Claude Sonnet 5.5 obtuvo 56 puntos en el Intelligence Index de Artificial Analysis con el esfuerzo en máximo, tres más que GPT-6 Astra en ese mismo nivel. Solo Claude Opus 5.5 lo supera entre los modelos evaluados con su configuración más exigente, con 58 puntos. La ventaja tiene un costo: Sonnet generó cerca de 193,000 tokens de salida por tarea, alrededor de siete veces lo que utilizó Astra, según la firma que realizó las pruebas.
El segundo puntaje ocupa la tercera fila
Artificial Analysis presentó el 28 de septiembre a Sonnet 5.5 como el segundo modelo de su índice y reportó una mejora de 18 puntos frente a Sonnet 5 en esfuerzo máximo. Su clasificación actual muestra un matiz: la configuración xhigh de Opus 5.5 también obtiene 56 puntos y aparece por encima de Sonnet. Al contar cada configuración como una entrada, Sonnet max queda tercero; al comparar la puntuación máxima de cada modelo, es segundo.
El índice combina diez evaluaciones de programación, trabajo de conocimiento y razonamiento. En la ejecución de Artificial Analysis, Sonnet 5.5 alcanzó 64% en Terminal-Bench 4.0. Anthropic publicó 70.6% para Sonnet en sus propias pruebas de ese benchmark. Son resultados reportados por evaluadores distintos y no deben intercambiarse como si fueran una sola medición.
Opus 5.5, cuyo lanzamiento contamos la semana pasada, sigue al frente de esta medición con 58 puntos en máximo.

El precio por token no cuenta toda la historia
Anthropic cobra por la API de Sonnet 5.5 dos dólares por millón de tokens de entrada y diez por millón de salida. Astra tiene tarifas más altas, de diez y 50 dólares, respectivamente. Aun así, en las tareas del índice, Artificial Analysis calcula un costo medio de 7.60 dólares para Sonnet max y 3.26 para Astra max. El consumo de tokens explica por qué un precio unitario menor puede acabar en una tarea más cara.
La comparación dentro de Anthropic también pesa. Opus 5.5 en xhigh iguala los 56 puntos de Sonnet max por 3.46 dólares por tarea; Opus max llega a 58 puntos por 5.98 dólares. Son promedios de esta batería de pruebas, no el precio fijo de una consulta individual ni una promesa de que cualquier tarea costará lo mismo.
El modo máximo tampoco es el ajuste habitual. Anthropic dice que Sonnet 5.5 usa medium por defecto en sus aplicaciones y Claude Code, y high en su plataforma para desarrolladores. En la tabla de Artificial Analysis, esos niveles obtienen 41 y 47 puntos, respectivamente. La compañía sostiene que el modelo puede costar hasta 30% menos que Sonnet 5 en sus pruebas de trabajo habitual; Artificial Analysis registró cerca de 50% más costo por tarea al comparar ambos en máximo. Las cifras corresponden a cargas y niveles de esfuerzo diferentes.
Artificial Analysis evaluó una versión previa al lanzamiento que tenía un fallo en solicitudes de salida estructurada. La firma prevé repetir las pruebas afectadas. Hasta entonces, su resultado más alto para Sonnet 5.5 refleja una configuración de consumo excepcional, una condición que importa tanto como la posición que ocupa en la tabla.
