Saltar al contenido

Un modelo de 27B dice ganarle a Claude y GPT-5.5, pero usa a GPT-5.5 como herramienta

Inherent presentó Faraday, un agente de 27,000 millones de parámetros que, según su propio juez automático, replica figuras de papers mejor que Claude Opus 4.8 y GPT-5.5. La letra chica: delega el código en GPT-5.5 Codex y el estudio que valida a ese juez no alcanzó significancia.

por Patricia Rodriguez
A woman analyzes data on a computer screen in a modern office setup, focusing on technological research.
Foto de ThisIsEngineering en Pexels

TL;DR:

  • Inherent afirma que Faraday, un agente de 27,000 millones de parámetros, replicó figuras de artículos científicos mejor que Claude Opus 4.8 y GPT-5.5 en 73% de las tareas de aprendizaje automático y en 60% de las de ciencia.
  • Faraday no sustituye a esos modelos: usa GPT-5.5 Codex como herramienta y le delega la escritura de código, así que lo medido es la capa que da las instrucciones.
  • Las calificaciones salieron de un juez automático construido por Inherent; los expertos humanos coincidieron con él en 63% de los casos disputados, sin alcanzar significancia estadística (p=0.109).

Inherent, un laboratorio de inteligencia artificial con sede en Londres fundado por exintegrantes de Google DeepMind, afirma que su agente Faraday replica figuras de artículos científicos mejor que Claude Opus 4.8 y GPT-5.5, pese a correr sobre un modelo de 27,000 millones de parámetros. La compañía publicó el resultado el 14 de agosto de 2026, junto con un preprint en arXiv que todavía no pasa por revisión por pares, y este 22 de agosto su cofundador y director científico, Edward Hughes, lo desarrolló en una entrevista con TechCrunch. La comparación llega con dos condiciones que el propio laboratorio detalla: Faraday no trabaja solo, sino que dirige a GPT-5.5 Codex como herramienta de programación, y las calificaciones salieron de un juez automático que Inherent diseñó y validó con un estudio humano cuyo resultado principal no alcanzó significancia estadística.

Faraday dirige a GPT-5.5 Codex en lugar de sustituirlo

Inherent describe a Faraday como una capa de intuición científica montada encima de los agentes de programación que ya existen. Faraday, entrenado a partir del modelo de pesos abiertos Qwen3.6-27B, planea el experimento, decide qué vale la pena probar y delega el código a Codex GPT-5.5, la herramienta de OpenAI. El artículo calcula que ese modelo subordinado es cuando menos dos órdenes de magnitud más grande, y cita un trabajo externo que le estima unos 5 billones de parámetros.

La prueba también la construyó Inherent y se llama Replica: 310 tareas sacadas de 100 artículos de aprendizaje automático y de IA aplicada a la ciencia, publicados entre 1990 y 2026. Cada tarea entrega el paper con una figura de resultados borrada y pide reconstruirla en una hora, con un séptimo de una GPU H200. Cuando el experimento original no cabe en ese presupuesto, el agente debe entregar la versión reducida más fiel que pueda.

Sobre esa prueba, Inherent reporta que Faraday quedó por encima de Claude Opus 4.8 y de GPT-5.5 en 73% de las tareas de aprendizaje automático, las que vio durante el entrenamiento, y en 60% de las tareas de ciencia, que quedaron fuera. La ventaja promedio en el conjunto de prueba fue de 6% frente a Claude y de 8% frente a Codex. Los dos modelos de referencia corrieron en sus propios entornos, Claude Code y Codex, con el esfuerzo de razonamiento al máximo.

Replicar resultados ajenos es el entrenamiento estándar de cualquier científico, dijo Hughes a TechCrunch: “Muchos estudiantes de doctorado empiezan justamente haciendo esto”.

Researcher in PPE reviews data on a digital screen in a modern laboratory setting.
Imagen ilustrativa: la prueba de Inherent pide reconstruir una figura de resultados sin ver el gráfico original · Foto de Tima Miroshnichenko en Pexels

El juez que decidió quién ganó lo construyó Inherent

Replicar una figura no tiene una respuesta que se pueda verificar sola, así que la compañía tuvo que fabricar la vara de medir. Claude Opus 4.7 genera primero una rúbrica específica para cada tarea, sin ver la figura original. Después un juez basado en Codex GPT-5.5 recibe diez minutos, el contenedor completo del agente y el gráfico real del paper, y puntúa cinco dimensiones: parecido visual, respaldo de la afirmación científica, si el experimento implementa de verdad lo que describe el artículo, aprovechamiento del presupuesto de cómputo e integridad, es decir, si el agente hizo trampa.

Para medir cuánto se parece ese juez a un humano, Inherent reclutó a doctorandos y doctores de universidades de investigación, les pagó 150 libras por tarea y reunió 117 rankings de 20 participantes. El resultado principal es más modesto que el titular. En las comparaciones donde el juez con rúbrica y un juez de control se contradecían, los expertos se pusieron del lado del primero en 63% de los casos, por encima del azar pero sin alcanzar significancia estadística (p=0.109). Medida con la correlación de Kendall, la coincidencia entre el juez y los humanos quedó en 0.19, en una escala donde 1 significa orden idéntico. Dos ejecuciones del mismo juez se parecen bastante más entre sí (0.66) que dos humanos entre ellos (0.30).

El segundo estudio humano es el que arroja los porcentajes altos y también el más acotado. A los expertos solo se les mostraron los casos donde el juez ya había colocado a Faraday al menos 0.2 puntos arriba de sus dos rivales, en una escala de 0 a 1. Ahí prefirieron a Faraday sobre Claude en 80% de los rankings y sobre Codex en 88%. Los autores advierten que ese diseño no permite concluir nada sobre si un humano lo preferiría en promedio.

El preprint reconoce réplicas fallidas y conflictos de interés

El trabajo tiene 47 páginas y se subió a arXiv el 13 de agosto. En su declaración de ética, el equipo admite que algunos artículos del corpus los escribieron autores de este mismo paper o personas que conocen, y que parte del material sale de instituciones cuyos modelos comerciales usaron para la investigación. También reconoce que Faraday falló al replicar varios trabajos que ellos consideran sólidos, y aclara que esas fallas no implican problemas con la investigación original.

Inherent pidió además la opinión de los autores de cuatro de los artículos replicados. Hubo elogios a partes concretas del resultado y al ingenio del agente al diseñar una tarea reducida, pero también reparos: que el problema elegido probablemente era demasiado fácil, que partes de la redacción quedaron pobres y que el código incluye cálculos innecesariamente enredados.

Queda un detalle de calendario. La comparación se hace contra Claude Opus 4.8 y GPT-5.5, no contra los modelos que Anthropic y OpenAI tienen hoy al frente, aunque el mismo artículo recurre a Claude Opus 5 para etiquetar los momentos de descubrimiento dentro de las ejecuciones de Faraday. Tampoco es el único laboratorio que se mide contra la generación anterior: DeepSeek presentó su modelo con visión comparándolo con Opus 4.8 y no con Opus 5.

Si el resultado se sostiene fuera de casa, lo interesante no será el tamaño del modelo sino dónde quedó la habilidad. Inherent entrenó a Faraday con GPT-5.4 mini como herramienta y, al cambiarlo por GPT-5.5 sin volver a entrenarlo, sus puntuaciones subieron. Decidir qué experimento correr y con qué presupuesto aparece entonces como una capacidad separable del modelo que escribe el código, y que mejora cuando mejora el agente de abajo. Comprobarlo exige que alguien ajeno a Inherent corra Replica y publique sus propios números.

Fuentes: 1, 2, 3

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Solo puedo decir que soy una apasionada con todo lo que tiene que ver con el mundo Digital me encanta todo lo que es escritura, IA, Ediciones de Video Reels y más. Me considero una persona "DIVERGENTE"

Leer más de Tecnología y Ciencia