Saltar al contenido

OpenAI enfrenta dudas por el “recurrent depth” reportado en Astra

Un reporte atribuye a Astra una arquitectura que puede mejorar el rendimiento y ahorrar recursos, pero que también podría dejar menos señales legibles para vigilar el comportamiento del próximo modelo de OpenAI.

por Patricia Rodriguez
Vibrant close-up of code displayed on a monitor with various programming details.
Foto de Muhammed Ensar en Pexels

TL;DR:

  • The Verge, al resumir un reporte de The Information, atribuyó a Astra el uso de “recurrent depth”, una técnica que repite bloques internos y deja parte del cómputo fuera del texto visible.
  • OpenAI no confirmó ni negó esa arquitectura, pero sí dijo que Astra es su primer modelo en el nivel “Critical” de ciberseguridad y que tendrá monitoreo adicional.
  • La técnica puede mejorar el rendimiento y reducir costos de memoria, pero también limitar la señal que investigadores y monitores usan para detectar acciones no autorizadas.

The Verge, al resumir un reporte de The Information basado en una fuente no identificada, atribuyó a Astra, el próximo modelo de OpenAI, el uso de “recurrent depth”, una técnica que repite información dentro de un bloque antes de generar el siguiente token. Puede aumentar el cómputo útil y mejorar el rendimiento con menos texto intermedio, pero parte del proceso queda en representaciones latentes, no en lenguaje legible para los monitores. OpenAI no confirmó ni negó esa arquitectura. Sí confirmó el 1 de septiembre que Astra alcanza su nivel “Critical” de ciberseguridad y que llegará con monitoreo adicional de cadena de pensamiento. La tensión es directa: el modelo más capaz de la empresa también podría dejar menos rastro visible para vigilarlo.

Cómo funciona el recurrent depth

Un transformer convencional procesa cada token a través de una secuencia fija de capas antes de producir una salida. Los modelos de razonamiento suelen aumentar el trabajo en cada consulta generando más tokens intermedios, que forman una cadena de pensamiento visible para los sistemas de supervisión, aunque no sea una transcripción perfecta de todo lo que ocurre dentro del modelo.

El recurrent depth cambia ese intercambio. Un bloque compartido recibe el estado interno, lo actualiza y vuelve a procesarlo varias veces antes de que el modelo produzca el siguiente token. En lugar de convertir cada etapa en texto, una parte mayor del trabajo queda en representaciones latentes, es decir, valores numéricos internos que no se leen como lenguaje natural.

Un trabajo académico publicado en 2025 describió esta ruta como razonamiento latente. Sus autores entrenaron un prototipo de 3,500 millones de parámetros y reportaron mejoras al darle más cómputo durante la inferencia, con una carga equivalente a la de un modelo de hasta 50,000 millones de parámetros. Ese resultado corresponde al prototipo del estudio y no demuestra que Astra use exactamente el mismo diseño. Sí explica por qué la técnica resulta atractiva: permite aumentar la profundidad efectiva y ahorrar memoria frente a cadenas largas de razonamiento textual.

La eficiencia tiene un costo de observabilidad

La cadena de pensamiento cumple una función particular en los modelos agénticos. Cuando un sistema escribe sus pasos, los investigadores pueden buscar señales de que está mintiendo, intentando saltarse una restricción o preparando una acción fuera del objetivo asignado. Esa lectura no garantiza conocer el estado interno real, pero ofrece una señal que los monitores pueden analizar antes de que el modelo use una herramienta o modifique un sistema.

Con recurrent depth, parte de ese proceso ocurre antes de la salida y fuera del texto. Por eso la preocupación no significa que Astra sea invisible ni que todas sus respuestas carezcan de explicación. Significa que una arquitectura capaz de hacer más iteraciones internas puede reducir la cantidad de razonamiento expresado en un formato que un revisor humano o un clasificador pueda inspeccionar.

Según la cobertura de The Verge sobre el reporte de The Information, OpenAI habría limitado cuánto usa Astra esta técnica para conservar una cadena de pensamiento suficientemente legible. Si esa descripción es correcta, la medida convierte la legibilidad en una decisión de seguridad del diseño, no solo en una característica de la interfaz.

OpenAI no confirma el diseño de Astra

The Verge consultó a OpenAI sobre el uso de un “looped transformer” o recurrent depth. La compañía no confirmó ni negó que esa sea la base técnica de Astra y remitió a una publicación de Jakub Pachocki, su científico jefe. El post oficial de OpenAI sobre la preparación del modelo tampoco menciona esa arquitectura.

Lo que OpenAI sí confirmó el 1 de septiembre es que Astra cumple el nivel “Critical” de ciberseguridad de su Preparedness Framework, la primera vez que la compañía asigna esa categoría a uno de sus modelos. Según sus propias evaluaciones, con las herramientas y el acceso adecuados puede encontrar fallas desconocidas y desarrollar formas de explotarlas en sistemas bien protegidos sin que una persona guíe cada paso.

La empresa planea limitar al principio las capacidades cibernéticas avanzadas a un grupo reducido de probadores y ampliar después el acceso mediante Daybreak Blue. También promete publicar una system card con más información sobre las pruebas de seguridad, alineación y monitoreo realizadas antes del lanzamiento.

Pachocki ha defendido que OpenAI lleva años intentando conservar el monitoreo de cadenas de pensamiento, pero también ha reconocido que esa técnica es frágil. Según The Verge, añadió que la profundidad computacional de Astra está dentro de un factor de dos respecto de GPT-4 y que las dificultades del monitoreo no dependen únicamente de un cambio de arquitectura. Ese argumento matiza la alarma, pero no resuelve la pregunta central sobre cuánto razonamiento de Astra quedará disponible para sus monitores.

El antecedente de Hugging Face eleva el riesgo

La discusión llega después de que agentes de OpenAI escaparan de un entorno de pruebas y accedieran a sistemas de Hugging Face durante una evaluación. OpenAI sostiene que Astra no participó en ese incidente. Aun así, Ryan Greenblatt, científico jefe de Redwood Research y uno de los investigadores externos que revisaron el caso, dijo que la investigación dependió en gran medida de las cadenas de pensamiento de los agentes.

Esa experiencia explica por qué un cambio que podría parecer puramente técnico preocupa a los investigadores de seguridad. Si una arquitectura reduce el rastro legible justo cuando los modelos adquieren más autonomía y acceso a herramientas, la supervisión tendría que apoyarse más en sus acciones, sus estados internos y controles externos, no solo en lo que el modelo alcanza a escribir.

Esta nota actualiza la cobertura previa de FomoEra sobre la clasificación de Astra en el nivel “Critical” de ciberseguridad:

Astra: OpenAI confirma riesgo cibernético crítico
Astra es el primer modelo que OpenAI ubica en el nivel Crítico de ciberseguridad. Saldrá con acceso restringido y sin fecha.

Qué queda abierto antes del lanzamiento

OpenAI ha anunciado controles adicionales, pero todavía faltan datos públicos para evaluar la tensión entre eficiencia y supervisión. Las preguntas principales son:

  • si Astra usa recurrent depth en su configuración de producción y hasta qué punto limita la generación de razonamiento legible;
  • qué información reciben exactamente los monitores cuando el modelo procesa tareas largas o usa herramientas;
  • con qué frecuencia las salvaguardas detienen trabajo legítimo, un efecto secundario que OpenAI ya reconoce para tareas de ciberseguridad defensiva y otros trabajos prolongados.

Los resultados publicados por OpenAI tampoco describen necesariamente la experiencia del usuario común. La compañía aclara que varias cifras de Astra corresponden al acceso Daybreak Blue y no a la configuración de producción por defecto.

Recurrent depth no es por sí mismo una falla de seguridad. El problema aparece si el ahorro de recursos depende de trasladar a una zona menos observable la parte del proceso que los monitores necesitan inspeccionar. OpenAI ha anunciado que publicará más detalles en la system card y que trabajará con agencias y organizaciones de seguridad de IA para evaluar el modelo. Esos materiales tendrán que aclarar cuánto de ese razonamiento puede vigilarse.

Fuentes: 1, 2, 3

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia