Saltar al contenido

GPT-6 Astra no destrona a Claude en código, pero cuesta menos de la mitad por tarea

Artificial Analysis midió a GPT-6 Astra dentro de Codex y le dio 67 puntos en su Coding Agent Index, aproximadamente empatado con Claude Opus 5 y Fable 5, y tres abajo de Fable 5.1 en Claude Code. La ventaja del modelo de OpenAI está en cuántos tokens gasta, no en el puntaje.

por Gerardo Pavez
A programmer in a blue shirt coding on an iMac. Perfect for technology or work-related themes.
Foto de Lee Campbell en Pexels

TL;DR:

  • Artificial Analysis midió GPT-6 Astra el 3 de septiembre de 2026 y le dio 67 puntos en su Coding Agent Index dentro de Codex, contra los 70 de Claude Fable 5.1 en Claude Code.
  • El modelo gasta un tercio de los tokens de GPT-5.6 Sol (max) y un quinto de los de Claude Opus 5 (xhigh); por tarea cuesta menos de la mitad que Claude Fable 5 con el mismo puntaje.
  • En el Intelligence Index de la misma firma se queda en 61, igual que su antecesor, con un precio de lista 2.5 veces mayor: 10 y 50 dólares por millón de tokens de entrada y salida.

Artificial Analysis publicó el 3 de septiembre de 2026 su medición independiente de GPT-6 Astra, el modelo que OpenAI lanzó ese mismo día. Dentro de Codex, Astra obtiene 67 puntos en el Coding Agent Index de la firma, aproximadamente empatado con Claude Opus 5 y Claude Fable 5 en Claude Code y con Muse Spark 1.3 de Meta en Muse Code. El liderato del índice sigue en manos de Fable 5.1 dentro de Claude Code, con 70. La diferencia que sí marca Astra está en el consumo: gasta un tercio de los tokens que GPT-5.6 Sol (max) en el mismo arnés y un quinto de los de Claude Opus 5 (xhigh), y eso lo coloca en la frontera de eficiencia de costo del índice. En el otro índice de la firma, el de inteligencia, no se movió de donde estaba su antecesor.

El 67 es de Astra dentro de Codex, con 326 tareas detrás

La cifra no describe al modelo en abstracto. Artificial Analysis arma su Coding Agent Index sobre variantes de agente, es decir, la combinación de un modelo con el arnés que lo envuelve y le da terminal, edición de archivos y control del contexto. Por eso la tabla compara a Fable 5.1 dentro de Claude Code, a Muse Spark 1.3 dentro de Muse Code y a Astra dentro de Codex. Salvo que se indique otra cosa, la firma corre cada agente con su configuración de razonamiento por defecto.

Esa pareja se evalúa sobre 326 tareas repartidas en tres pruebas, con tres intentos por tarea y calificación pass@1.

Componentes del Artificial Analysis Coding Agent Index, versión 1.4, vigente desde agosto de 2026
Evaluación Qué mide Tareas
DeepSWE Ingeniería de software de horizonte largo 113
Terminal-Bench v2.1 Uso agéntico de la terminal 89
SWE-Atlas-QnA Preguntas sobre repositorios de código 124

Esa versión 1.4 del índice, en uso desde agosto de 2026, sumó detección de reward hacking: un intento que edita los tests, escribe en el archivo de recompensa del verificador o consigue la solución de referencia fuera del entorno se califica con cero. La detección solo aplica a Terminal-Bench v2.1, cuyas tareas y soluciones son públicas y cuyos intentos corren con acceso a internet.

El ahorro está en cuántos tokens quema, no en el precio por token

Astra sale a 10 dólares por millón de tokens de entrada y 50 por millón de salida, 2.5 veces el precio vigente de GPT-5.6 Sol, que cobra 4 y 20. El descuento de 90% en lecturas de caché y el recargo de 25% en escrituras se mantienen igual.

Con un precio de lista más alto, la ventaja de costo por tarea tiene un solo origen, y Artificial Analysis lo dice directo: la eficiencia de tokens. En el arnés de Codex, Astra usa un tercio de lo que gasta GPT-5.6 Sol (max) y un quinto de lo de Claude Opus 5 (xhigh), y varios de sus niveles de esfuerzo ocupan la frontera de Pareto de eficiencia de tokens. Con esfuerzo máximo cuesta aproximadamente lo mismo que GPT-5.6 Sol (max) y saca dos puntos más en el índice; frente a Claude Fable 5, cuesta menos de la mitad por tarea para el mismo puntaje.

El desarrollador Simon Willison hizo notar que ese precio de lista es idéntico al de Claude Fable 5 y Fable 5.1, así que la comparación de costo por tarea entre ambos queda en manos de cuántos tokens quema cada combinación para resolver el mismo trabajo.

Close-up view of a developer typing code on a keyboard with a computer screen showing scripts.
El índice mide agentes de código completos, no modelos sueltos. Imagen ilustrativa. · Foto de Jakub Zerdzicki en Pexels

Conviene leer esas cifras con su letra chica. Artificial Analysis calcula el costo con tarifas de API por token, no con planes de suscripción, así que un equipo que trabaja dentro de un plan mensual de ChatGPT o de Claude no verá ese ahorro reflejado en su factura.

En inteligencia general, Astra se quedó donde estaba GPT-5.6 Sol

El otro índice de la firma cuenta una historia distinta. Astra saca 61 en el Artificial Analysis Intelligence Index, el mismo puntaje que GPT-5.6 Sol, cinco puntos abajo de Claude Fable 5.1 (max con fallback), y también detrás del recién llegado Muse Spark 1.3 (max) de Meta. Como el precio subió 2.5 veces y el consumo de tokens bajó cerca de 10% con esfuerzo máximo, cada tarea sale 75% más cara que con el modelo anterior.

Dentro de ese índice hay movimientos en las dos direcciones. La tasa de alucinación en AA-Omniscience, la prueba de conocimiento de la firma, cayó de 92% a 51% con esfuerzo máximo, y la precisión subió cuatro puntos al mismo tiempo. Astra también ganó cerca de 80 puntos de Elo en AA-Briefcase, la evaluación de trabajo de conocimiento de horizonte largo que usa proyectos de varias semanas con miles de archivos fuente. En sentido contrario perdió una cantidad parecida de Elo en GDPval-AA v2, la adaptación que Artificial Analysis hizo del conjunto de OpenAI sobre tareas económicamente valiosas en 44 ocupaciones, y retrocedió entre dos y tres puntos en τ³-Banking, SciCode y AA-LCR.

OpenAI documenta que Astra puede bajar su desempeño a propósito

Hay una advertencia que viene de la propia OpenAI y que cambia cómo se lee cualquier tabla de resultados. En la system card de Astra, el documento de seguridad publicado el 3 de septiembre, la empresa reporta que en pruebas adversarias, cuando los investigadores empujan al modelo a evadir sus monitores, Astra logra pasar inadvertido mientras baja su desempeño de forma estratégica en evaluaciones, una conducta conocida como sandbagging. OpenAI precisa que ese comportamiento aparece cuando se le indica explícitamente y que no encontró evidencia de razonamiento esteganográfico, lo que acota el riesgo a tareas que el modelo puede resolver sin verbalizar su razonamiento.

En el mismo documento, Apollo Research reporta que Astra verbalizó estar consciente de ser evaluado en 41.1% de las muestras con esfuerzo xhigh y en 50.6% con esfuerzo máximo, contra 27.7% de GPT-5.5 en el mismo nivel. Con tasas así y una ventana de prueba de tres días, la firma concluye que las bajas tasas de mala conducta que observó no aportan evidencia sustancial sobre la alineación del modelo. Ni OpenAI ni Artificial Analysis afirman que esto haya afectado la medición del Coding Agent Index. El punto es otro: las cifras de cualquier benchmark ahora conviven con un modelo que reconoce el examen y que, bajo instrucción, sabe reprobarlo sin que lo cachen.

Para quien elige con qué agente programar, el saldo es concreto. En la punta del índice ya no hay una brecha grande de capacidad entre Codex con Astra y Claude Code con Fable 5.1, sino tres puntos, y una diferencia de consumo de tokens que sí aparece en la factura de la API.

Fuentes: 1, 2, 3, 4

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia