Saltar al contenido

El harness que mueve Codex y ChatGPT Work: así recorta OpenAI la factura de tokens

OpenAI detalla cómo el harness abierto de Codex, que ya mueve ChatGPT Work, recorta el gasto de tokens.

por Dilis Salazar
Close-up of colorful programming code on a blurred computer monitor.
Foto de Al Nahian en Pexels

TL;DR:

  • OpenAI detalló en un post de ingeniería cómo su harness de agentes, la capa que orquesta a Codex y desde el 9 de julio también a ChatGPT Work, se convirtió en el lugar donde atacó el gasto descontrolado de tokens.
  • La cifra que encabeza el anuncio: GPT-5.6 Sol con razonamiento máximo lidera el Artificial Analysis Coding Agent Index con 80 puntos, 2.8 arriba de Claude Fable 5, usando 54% menos tokens de salida.
  • Las tres decisiones de diseño que sostienen el ahorro (contexto append-only, descubrimiento diferido de herramientas y tope de 10,000 tokens por respuesta de herramienta) no exigen la escala de OpenAI y cualquier equipo puede copiarlas.

OpenAI puso números a la capa de software que sostiene a sus agentes: el harness que orquesta a Codex y que, desde el 9 de julio de 2026, también mueve a ChatGPT Work. En una entrevista exclusiva con The Deep View publicada este miércoles 29 de julio, ingenieros y responsables de producto de la compañía explicaron que ahí, y no solo en el modelo, está la ventaja que persiguen. El post de ingeniería que acompaña esa tesis, revisado por The New Stack antes de su publicación, reporta 20% menos de costo de servir los modelos, más de 15% de mejora en la generación de tokens y ejecuciones hasta 40% más rápidas cuando una tarea encadena 20 llamadas a herramientas o más. Importa porque la factura de tokens se volvió el freno real de la adopción de agentes en las empresas.

El harness es la capa de orquestación que conecta al modelo con las herramientas y con el entorno del usuario: arma la petición, administra el contexto, ejecuta acciones y mantiene al agente en la tarea hasta terminarla. The Deep View lo compara con el director de una orquesta. Joe Gershenson, responsable de ingeniería de harness en OpenAI, lo puso en términos más secos.

"El harness es la forma en que el modelo interactúa con el mundo y cómo logramos expresar las capacidades del modelo".

El pánico por los tokens empezó con facturas de 20,000 dólares al mes

En enero y febrero, cuando OpenClaw y otros agentes despegaron, algunos desarrolladores acumularon cuentas de hasta 20,000 dólares mensuales en tokens porque sus agentes quemaban cómputo en bruto para completar tareas, según el recuento de The Deep View. Ese susto llegó a las empresas y se quedó ahí.

"Es lo número uno que nos preguntan: ¿cómo frenamos el costo sin dejar de invertir en IA?".

La frase es de Ali Ghodsi, director ejecutivo de Databricks, citado por el mismo medio. Hay dos formas de bajar el costo de inferencia: abaratar el token o generar menos tokens. OpenAI apostó por la segunda, y la pieza donde se decide cuántos tokens se generan es precisamente el harness.

Filas de racks de servidores iluminados en el pasillo de un centro de datos
Imagen ilustrativa: buena parte del costo de servir un modelo se juega en la infraestructura, no en los pesos · Foto de panumas nikhomkhai en Pexels

Tres decisiones del harness que un equipo pequeño puede copiar

El harness de Codex es una capa de orquestación escrita en Rust. Una sola tarea puede requerir 30 solicitudes al modelo, así que un segundo extra por solicitud se nota. Según el post de ingeniería reseñado por The New Stack, el trabajo se concentró en tres puntos:

  • Descubrimiento diferido: las integraciones, las herramientas MCP personalizadas, las skills y los plugins solo aparecen en el contexto cuando hacen falta. Mientras tanto no ocupan espacio ni distraen al modelo.
  • Tope de salida: la respuesta de cada herramienta se corta en 10,000 tokens por defecto, salvo que el modelo pida otro límite.
  • Historial append-only: todo lo que el modelo ve se agrega al final, nunca se inserta en medio del contexto anterior. Las herramientas se presentan en orden determinista y los ajustes de ejecución, como las políticas de aprobación, se aplican al correr y no van incrustados en la definición de las herramientas.

A eso se suma un cambio de protocolo. Codex enviaba la conversación completa después de cada llamada a herramienta, y como tokenizar es una operación que crece con la longitud del texto, terminaba pagando decenas de veces por procesar lo mismo. Con una integración por WebSocket que mantiene el estado de tokenización en el servidor, la primera llamada procesa el prompt entero y las siguientes envían solo lo nuevo. De ahí sale el hasta 40% de mejora en ejecuciones largas. Otro hallazgo llegó del hardware: nodos con el mismo tipo de instancia corrían generaciones distintas de CPU, y las viejas consumían el doble de recursos para el mismo trabajo. Redirigir tráfico a las nuevas mejoró cerca de 20% el tiempo hasta el primer token.

MCP elimina las sesiones en su mayor cambio
MCP estrena su versión 2026-07-28: adiós a las sesiones, autorización más dura y 12 meses para migrar

The New Stack subraya el punto que más rinde para quien lee desde afuera: nada de esto requiere la escala de OpenAI. Contexto append-only, orden fijo de herramientas y tope de salida atacan el gasto de tokens de forma directa en cualquier agente interno.

El 54% menos de tokens se midió dentro del propio harness de OpenAI

La comparación que encabeza el anuncio tiene letra chica. El Artificial Analysis Coding Agent Index coloca a GPT-5.6 Sol con razonamiento máximo en 80 puntos, contra 77.2 de Claude Fable 5 y 72.5 de Claude Opus 4.8, según la tabla que la propia OpenAI publicó el 9 de julio. Artificial Analysis, la firma que arma el índice, aclara en su análisis que hizo la evaluación previa al lanzamiento a petición de OpenAI y que corrió a Sol dentro del harness de Codex. El ahorro de tokens se midió, entonces, en la casa del anfitrión.

La misma tabla oficial ordena otras cosas de manera distinta. En SWE-Bench Pro, que mide tareas de ingeniería sobre repositorios reales, Sol marca 64.6% frente a 80% de Fable 5 y 80.3% de Claude Mythos 5. En el Artificial Analysis Intelligence Index, Fable 5 queda arriba por un punto, 59.9 contra 58.9. La eficiencia es el terreno donde OpenAI gana con holgura, no la capacidad bruta.

Y esa eficiencia está amarrada a la lista de precios. GPT-5.6 cuesta 5 y 30 dólares por millón de tokens de entrada y salida en Sol, 2.50 y 15 en Terra, y 1 y 6 en Luna, el 80% por debajo del modelo insignia. La familia conserva el descuento de 90% en lecturas de caché y estrena un cobro de 1.25 veces el precio de entrada por cada escritura de caché, la primera vez que OpenAI cobra ese concepto, según Artificial Analysis. Dicho de otro modo: el diseño append-only del harness existe para pegarle al caché, y el caché es justo donde vive el descuento.

⚠️
Todas las cifras de ahorro provienen de mediciones de producción de la propia OpenAI y no han sido auditadas de forma independiente. El dato de 10 millones de usuarios que circula desde el 21 de julio, reportado por Bloomberg, es una suma combinada de Codex y ChatGPT Work: la compañía no desglosó cuántos corresponden a cada producto ni definió qué cuenta como usuario activo.

Un experimento independiente muestra el otro lado de la moneda

El mismo 29 de julio, el sitio XDA publicó una prueba que funciona como contrapeso. Su autor, Joe Rice-Jones, montó a Claude Code como orquestador de agentes de Codex con el plugin de código abierto codex-orchestrator: Claude planifica, verifica y hace el commit final, Codex escribe el código. El resultado técnico fue bueno, porque el sistema detectó dependencias faltantes y errores de diseño que el propio autor había dejado pasar.

El costo cuenta otra historia. Según el README del proyecto, la configuración orquestada resolvió 9 de 10 problemas de un set de depuración contra 8 de 10 de los agentes solos, pero corrió sin límite de tiempo mientras los agentes individuales estaban cronometrados. Y en la ejecución completa, Claude consumió más de 9 millones de tokens frente a cerca de 1.2 millones de Codex, alrededor de ocho veces más. Mismos modelos, harness distinto, factura incomparable. Es la demostración práctica de por qué OpenAI decidió meter mano justo en esa capa.

Para un equipo en Guadalajara, Madrid o Bogotá que paga su API en dólares, lo aprovechable de este anuncio no es el benchmark. Es que las tres decisiones de diseño están descritas en público y el código del harness de Codex vive en GitHub, algo que The Deep View contrasta con el harness cerrado de Claude Code. Copiar el orden determinista de herramientas y el tope de salida no cuesta un centavo; el resultado se ve en el estado de cuenta del mes siguiente.

Preguntas rápidas sobre el harness de Codex

¿Qué es el harness de un agente de IA?

Es la capa de software que conecta al modelo con las herramientas y con el entorno del usuario. Arma la petición, administra el contexto, ejecuta acciones y mantiene al agente en la tarea hasta terminarla. En Codex está escrita en Rust y una sola tarea puede requerir 30 solicitudes al modelo, según el post de ingeniería de OpenAI.

¿Cuánto cuesta GPT-5.6 en la API?

Por millón de tokens de entrada y salida: 5 y 30 dólares en Sol, 2.50 y 15 en Terra, y 1 y 6 en Luna. Las lecturas de caché mantienen 90% de descuento y las escrituras de caché se cobran a 1.25 veces el precio de entrada. Son las tarifas publicadas por OpenAI el 9 de julio de 2026.

¿El harness de Codex es de código abierto?

Sí, el código está publicado en el repositorio de OpenAI en GitHub, y The Deep View señala que es una diferencia frente al harness de Claude Code, de Anthropic, que no lo está. Eso permite a cualquier equipo leer cómo está resuelto el manejo de contexto y las llamadas a herramientas.

La discusión sobre agentes venía girando alrededor de qué modelo razona mejor. Este anuncio la mueve un piso más abajo, hacia el software que rodea al modelo, y ahí las mejoras son medibles en dinero. Con ChatGPT Work empujando agentes a usuarios que nunca escribieron una línea de código, cada token que el harness deja de generar se multiplica por millones de sesiones.

Fuentes: 1, 2, 3

Dilis Salazar imagen de perfil
por Dilis Salazar

Suscríbete GRATIS

Recibe las noticias más importantes de política, tecnología, negocios, deportes, entretenimiento y cultura directamente en tu correo.

¡Listo! Revisa tu correo

Para completar la suscripción, haz clic en el enlace de confirmación que enviamos a tu correo. Si no llega en 3 minutos, revisa tu carpeta de spam.

Ok, gracias

Leer más de Tecnología y Ciencia