Saltar al contenido

Nvidia llevó a Claude Opus 5 de 30% a 100% en ARC-AGI-3, pero su otro agente ya iba en 85.1%

Nvidia reportó que su sistema AVO, con Claude Opus 5 adentro, completó los 183 niveles del set público de ARC-AGI-3 con 100.00 RHAE. El contraste contra el 30.16% del modelo solo recorrió toda la cobertura; el 85.1% que la misma empresa publicó el 27 de julio, no.

por Dilis Salazar
A vivid abstract pattern with vibrant blue and pink pixelated textures.
Foto de Suzy Hazelwood en Pexels

TL;DR:

  • Nvidia reportó el 21 de agosto de 2026 que su sistema AVO, con Claude Opus 5 adentro, terminó los 183 niveles de los 25 juegos del set público de ARC-AGI-3 con una puntuación de 100.00 en la métrica RHAE, en 6,624 acciones.
  • El contraste que recorrió la cobertura, 30% del modelo contra 100% del sistema, es el que el propio reporte de Nvidia pide no leer como una medición de lo que aporta AVO.
  • La misma empresa publicó el 27 de julio que otro harness suyo, NOOA, llegaba a 85.1% en ese mismo set con GPT-5.6 Sol, por unos 13.3 dólares por juego y con el código abierto.

Nvidia publicó el viernes 21 de agosto de 2026 que AVO, su sistema de agente de propósito general, completó los 183 niveles de los 25 juegos del set público de ARC-AGI-3 con una puntuación de 100.00 en RHAE, una métrica que mide eficiencia contra un humano primerizo. El modelo que corría adentro es Claude Opus 5, de Anthropic, que por sí solo tiene 30.16% verificado por ARC Prize desde el 24 de julio. Ese salto, de 30 a 100, encabezó la cobertura del día. El reporte de Nvidia advierte en su propio texto que las dos cifras no se comparan así: cambian el ajuste de razonamiento, el sistema de agente y el montaje de evaluación. Y hay otra cifra que ese reporte no menciona, aunque también es suya: el 85.1% que publicó el 27 de julio sobre el mismo set de juegos.

El 100 de ARC-AGI-3 mide eficiencia contra un humano primerizo

ARC-AGI-3 mete al agente en juegos de rejilla que no conoce, sin instrucciones, sin reglas escritas y sin objetivo declarado. Tiene que descubrir qué hacen los controles probándolos. Y quien juega no es el modelo solo: es el modelo dentro de un harness, la capa de software que le da herramientas, le administra memoria y contexto, y decide qué ve y cuándo. Lo contamos en julio, cuando OpenAI prometió sumar salvaguardas en esa capa después de que GPT-5.6 Sol borrara archivos de varios desarrolladores.

La puntuación se llama RHAE, por Relative Human Action Efficiency, y no cuenta aciertos: cuenta acciones. La documentación de ARC Prize fija la fórmula por nivel, y es dura. Se dividen las acciones del humano de referencia entre las de la IA y el resultado se eleva al cuadrado. Si el humano necesitó 10 movimientos y la IA usó 20, ese nivel vale 0.25. Si usó 100, vale 0.01. El techo por nivel es 1.15, así que encontrar un atajo no compensa de forma indefinida.

Cada juego se califica con un promedio ponderado en el que el peso es el número de nivel, de modo que los últimos pesan más que el tutorial, y ningún juego llega a 100% si el agente no terminó todos sus niveles. El humano de referencia tampoco es el más rápido de la muestra: ARC Prize toma la mediana superior entre varios participantes que ven el juego por primera vez. Un 100.00, entonces, quiere decir que el agente cerró los 25 juegos completos y, en promedio ponderado, gastó tantas acciones como ese humano o menos.

El total fueron 6,624 acciones. Nvidia pone esa cifra al lado de las 7,542 que VISTA, otro sistema, reportó con el mismo modelo sobre los mismos 183 niveles: cerca de 12% menos. La propia empresa aclara que no se trata de una ablación controlada, porque entre los dos sistemas cambian el motor del agente, la memoria, el manejo de contexto y hasta la forma de ver el tablero. AVO le pasó al modelo una rejilla de texto de 64 por 64, sin imágenes; la configuración principal de VISTA usa un PNG de 512 por 512.

Un experimento secundario apunta en la misma dirección. Nvidia también corrió AVO con GPT-5.6 Sol sobre un subconjunto de juegos difíciles: Sol llegó antes en tiempo real a los mismos niveles en varios casos, y Opus 5 gastó menos acciones. La empresa lo describe como preliminar y deja la comparación sistemática para después.

AVO nació afinando kernels de GPU durante siete días

AVO, por Agentic Variation Operators, es un proyecto de investigación que Nvidia presentó en un paper en marzo de 2026. Su primer terreno fue la ingeniería de software y la optimización de kernels de GPU. Ahí el agente trabajó siete días seguidos, exploró más de 500 direcciones de optimización y dejó 40 versiones de kernel en el repositorio. Los kernels de atención multicabeza que salieron de esa corrida superaron a cuDNN por hasta 3.5% y a FlashAttention-4 por hasta 10.5% en sistemas DGX B200, según el reporte. Después adaptó el resultado a atención de consulta agrupada con unos 30 minutos más de trabajo autónomo.

Dos piezas sostienen una jornada así. La memoria persistente arrastra implementaciones previas, resultados de evaluación y salidas del compilador, para que el agente retome donde iba en lugar de reconstruir la búsqueda. La segunda es un supervisor, un módulo de software que vigila la trayectoria completa y redirige al agente principal cuando la búsqueda se estanca.

El supervisor "casi actúa como un CEO que empuja al agente cuando se desvía", dijo Adel El Hallak, vicepresidente de producto de la unidad de IA de Nvidia, a TechCrunch.

Ese mismo medio apunta que AVO se publica como investigación, no como un producto a la venta.

Focused detail of a modern server rack with blue LED indicators in a data center.
Imagen ilustrativa: AVO pasó siete días afinando kernels de GPU antes de que lo conectaran al benchmark; la foto no corresponde a instalaciones de Nvidia · Foto de panumas nikhomkhai en Pexels

El salto de 30% a 100% compara un modelo solo contra un sistema entero

Nvidia enlaza el 30% de ARC Prize y, en el mismo párrafo, explica por qué no debe leerse como la contribución de AVO: su corrida usó la misma familia de modelo con otro ajuste de razonamiento, otro sistema de agente y otro montaje de evaluación. El conjunto de juegos sí es el mismo, esa parte no se mueve: ARC Prize midió a Opus 5 sobre la misma demo pública de 25 entornos.

Hay una segunda comparación que el reporte no hace. El 27 de julio de 2026, tres semanas antes, Nvidia publicó otro texto sobre harnesses en el que NOOA, su framework de agentes orientado a objetos, llegaba a 85.1% de RHAE promedio en ese mismo set con GPT-5.6 Sol, y a 50.2% con GPT-5.5. Ese texto trae además los números que el de AVO no incluye: costo por juego, unos 13.3 dólares con Sol y unos 17.85 con GPT-5.5; modo competencia con tope de dos horas; 19 de los 25 juegos resueltos completos; y enlaces a los scorecards públicos de cada corrida. NOOA salió como research preview, con código, pruebas y metodología de evaluación abiertos.

Así quedan las cuatro cifras que entran en esta comparación, sobre el mismo set de 25 juegos:

Sistema y modelo RHAE en el set público Costo por juego según Nvidia
Claude Opus 5 (High) sin harness, medición de ARC Prize 30.16% No aplica
NOOA con GPT-5.5, medición de Nvidia 50.2% Unos 17.85 dólares
NOOA con GPT-5.6 Sol, medición de Nvidia 85.1% Unos 13.3 dólares
AVO con Claude Opus 5, medición de Nvidia 100.00 Sin publicar

Las filas de NOOA tampoco son una comparación limpia contra AVO: corrieron con otros modelos y con un reloj de dos horas encima, mientras que AVO usó Claude Opus 5 sin tope de tiempo publicado. Ese es justo el punto. Sobre el mismo benchmark y el mismo conjunto de juegos, la única cifra que Nvidia eligió poner al lado del 100.00 fue la del modelo desnudo.

El set público no es el que reparte el ARC Prize

Los 25 juegos son el set público de ARC-AGI-3, abierto para que cualquiera los juegue y los descargue. Nvidia lo aclara al cerrar su sección de resultados y volvió sobre el punto el mismo día: el post salió a las 13:00 UTC del 21 de agosto y se actualizó a las 21:08, con una nota del editor que explica el ajuste de redacción para separar con más precisión el set público de los conjuntos semiprivado y privado de competencia.

La objeción automática, sin embargo, no encaja aquí. La política de pruebas de ARC Prize dice que en ARC-AGI-3 la demo pública es más difícil que el conjunto semiprivado, y que por eso espera que las puntuaciones semiprivadas sean las más altas de las dos; acepta como concordancia una diferencia de hasta 15 puntos. El reclamo habitual, que el set abierto es el fácil, no aplica de la misma forma en esta versión del benchmark.

Lo que falta es el sello. ARC Prize verifica solo lo que decide verificar, y sus reglas de envío exigen que la solución completa sea de código abierto, que llegue como notebook de Kaggle capaz de correr en menos de 12 horas y que el gasto de ejecución no pase de 10,000 dólares. El reporte de AVO enlaza el paper y ningún repositorio; el de NOOA sí publica código, pruebas y metodología. Bajo esa regla, NOOA cumple el requisito de apertura y AVO, tal como se publicó, todavía no. La misma fundación permite de forma explícita que cualquiera pruebe sobre datos públicos y difunda su resultado, siempre que diga sobre qué se probó y que la cifra no está verificada por ella. Es exactamente lo que hizo Nvidia.

Para quien construye agentes, la cifra aprovechable está en la comparación completa. Nvidia publicó 85.1% en el mismo benchmark con el código abierto y el costo por juego a la vista, y 100.00 sin ninguna de las dos cosas. La primera se puede reproducir hoy; la segunda, por ahora, solo se puede leer.

Fuentes: 1, 2, 3, 4, 5, 6

Dilis Salazar imagen de perfil
por Dilis Salazar

Leer más de Tecnología y Ciencia