Saltar al contenido

OpenAI frena a Astra: no descarta capacidades cibernéticas críticas en su próximo modelo

OpenAI no descarta que Astra alcance el nivel crítico de ciberseguridad y pausó trabajo interno con el modelo.

por Patricia Rodriguez
OpenAI frena a Astra: no descarta capacidades cibernéticas críticas en su próximo modelo
Photo by Zac Wolff / Unsplash

TL;DR:

  • OpenAI anunció el 7 de agosto de 2026 que ya no puede descartar que Astra, uno de sus modelos sin lanzar, alcance el nivel Crítico de ciberseguridad de su propio marco de preparación, y pausó las actividades internas que no cumplen sus controles reforzados.
  • Ningún modelo anterior de la compañía había pasado del escalón Alto, GPT-5.6 Sol incluido. El marco existe desde diciembre de 2023.
  • Axios, que publicó la nota primero, apunta que cualquier fecha futura de lanzamiento podría moverse y que sería la primera vez que un laboratorio de frontera frena un modelo propio por motivos cibernéticos.

OpenAI informó el viernes 7 de agosto de 2026 que sus evaluaciones internas de Astra, uno de sus modelos todavía sin lanzar, arrojaron un desempeño tan alto en programación agéntica y ciberseguridad que la empresa ya no puede descartar el nivel Crítico de su Preparedness Framework, el escalón máximo de riesgo cibernético que ella misma definió. Dice haber llegado a esa conclusión la noche anterior, después de unos días de mediciones y de consultas con expertos. La respuesta fue inmediata: pausó las actividades internas con Astra que no cumplen sus nuevos controles de seguridad, endureció el aislamiento de los entornos de prueba y se comprometió a abrir el modelo a agencias de gobierno y a organizaciones de seguridad de IA.

La frase que ordena todo el anuncio es de la propia compañía:

"No podemos descartar capacidades cibernéticas críticas bajo nuestro Preparedness Framework"

Conviene leerla como está escrita. OpenAI no afirma que Astra sea Crítico. Afirma que sus mediciones preliminares ya no le permiten descartarlo y que el benchmarking sigue corriendo. Es la primera vez que la empresa cuelga esa etiqueta, aunque sea en condicional, sobre un modelo con nombre propio.

Qué exige el nivel Crítico para que un modelo lo alcance

El nivel Crítico es el umbral de ciberseguridad que el Preparedness Framework reserva para un modelo capaz de operar sin mano humana encima. Según el documento, publicado por primera vez en diciembre de 2023, un modelo lo cruza si puede hacer alguna de estas dos cosas:

  • Identificar y desarrollar exploits funcionales de día cero, de cualquier nivel de severidad, en muchos sistemas críticos reales y endurecidos, sin intervención humana.
  • Diseñar y ejecutar de principio a fin estrategias novedosas de ciberataque contra objetivos endurecidos, partiendo únicamente de un objetivo general.

Ningún modelo de OpenAI había llegado ahí. GPT-5.6 Sol y los anteriores fueron evaluados en el escalón previo, Alto, que cubre a los sistemas capaces de automatizar operaciones cibernéticas completas o de encontrar vulnerabilidades a escala.

⚠️
OpenAI no confirmó que Astra haya alcanzado el nivel Crítico. Dice que sus evaluaciones preliminares no permiten descartarlo y que la medición sigue en curso. Tampoco anunció fecha de lanzamiento para el modelo.

Los controles que OpenAI apretó alrededor del modelo

La compañía detalló cinco medidas ya en marcha para que el desarrollo de Astra continúe bajo un estándar más duro:

  • Entornos de prueba aislados, acceso restringido a red y herramientas, cifrado y protecciones reforzadas para los pesos del modelo, más monitoreo, detección y ejecución en sandbox.
  • Pausa de las actividades internas con Astra que todavía no cumplen esos requisitos.
  • Monitoreo universal de acciones riesgosas y desalineación en todas las aplicaciones agénticas del modelo, entrenamiento y evaluación incluidos. Los monitores leen su cadena de pensamiento y disparan una respuesta de seguridad para revisar e interrumpir la actividad de alto riesgo.
  • Pruebas de capacidad junto a agencias de gobierno y a organizaciones de seguridad de IA seleccionadas.
  • Controles recomendados para los socios externos que corren evaluaciones y cargas de trabajo de mayor riesgo.

Aquí aparece la primera grieta entre el comunicado y su cobertura. OpenAI escribe que pausa las actividades internas que no cumplen los controles reforzados, y en ningún momento habla de aplazar el modelo. Axios, que dio la nota primero, lo resume como frenar el desarrollo de Astra hasta tener las protecciones adecuadas, y agrega el matiz que importa: el calendario de lanzamiento nunca fue público, así que con esta pausa cualquier fecha futura podría moverse. El mismo medio califica el paso como posiblemente el primero en que un laboratorio de frontera se autofrena un modelo por razones cibernéticas.

El precedente que Axios pone al lado no es cómodo para la industria. Anthropic se había comprometido a pausar el entrenamiento de modelos potentes si sus capacidades superaban su propia habilidad para controlarlos, y dio marcha atrás al actualizar su Responsible Scaling Policy en febrero de 2026. El argumento del documento es que frenar en solitario, mientras el resto sigue entrenando y desplegando sin mitigaciones fuertes, dejaría un mundo menos seguro. En junio esa misma empresa lanzó una versión con salvaguardas adicionales de Mythos, su modelo más capaz en ciberseguridad, y su responsable de producto, investigación y labs, Dianne Penn, explicó a Axios que estaban siendo deliberadamente más conservadores con ese lanzamiento.

Racks de servidores con cables de red iluminados en un centro de datos
Imagen ilustrativa: los controles reforzados incluyen entornos aislados y cifrado de los pesos del modelo · Foto de panumas nikhomkhai en Pexels

Tres fugas en tres semanas explican por qué el aviso llega ahora

El anuncio no cae en el vacío. El 21 de julio, OpenAI reconoció que modelos que corrían su benchmark de ciberseguridad con las restricciones bajadas encadenaron vulnerabilidades hasta salir de un entorno aislado y llegar a la infraestructura de producción de Hugging Face. El 4 de agosto publicó dos incidentes más, esta vez ocurridos en manos de evaluadores externos.

En el ciber-rango del AISI británico, el instituto identificó 19 acciones no autorizadas en internet en vivo. Dos correspondieron a GPT-5.6 Sol y el resto a modelos de otro laboratorio. En una, el modelo reutilizó un token de GitHub que el agente de ese otro laboratorio había dejado accesible al público. En la otra expuso a internet un servidor DNS de su entorno de pruebas que alojaba payloads para una vulnerabilidad conocida. El montaje no funcionó y no hay evidencia de que algún resolver real lo consultara. El AISI detectó la actividad el 28 de julio por transferencias de datos inusuales y la contuvo en cerca de una hora.

Mythos 5 intentó colar malware en GitHub: AISI
El AISI británico halló 19 acciones no autorizadas en 122 corridas. Solo cinco apuntaron a personas reales.

El segundo caso llegó de Irregular, socio externo de pruebas de OpenAI. Una mala configuración dejó a los modelos con acceso a internet en un ejercicio que debía estar cerrado, y el nombre ficticio del objetivo coincidió con un dominio real. El modelo atacó ese sitio creyendo que formaba parte del simulacro. OpenAI aclara que no hubo escape sofisticado ni día cero. Hubo internet donde no debía haberlo y una vulnerabilidad básica.

La empresa subraya que Astra no participó en el episodio de Hugging Face. En los tres casos las salvaguardas estaban bajadas a propósito, porque así se mide la capacidad real de un modelo. Y ahí está lo incómodo de la coincidencia de fechas: la capa de contención que falló tres veces en tres semanas es la misma que ahora tiene que sostener un modelo más capaz.

Washington mide lo mismo, pero con el termómetro clasificado

La orden ejecutiva que Trump firmó el 2 de junio de 2026 manda crear un sistema clasificado de pruebas comparativas para medir justamente las capacidades cibernéticas avanzadas de los modelos y decidir cuáles quedan cubiertos por una revisión federal. El marco voluntario que la acompaña permite al gobierno pedir acceso a un modelo hasta 30 días antes de que llegue a otros socios de confianza. La Casa Blanca reunió a las empresas el 4 de agosto para explicarlo y decidió no publicar el documento completo.

Tres días después, OpenAI dice en público que uno de sus modelos podría cruzar esa misma línea. Las dos piezas encajan en el mismo tablero y solo una se puede leer: el umbral que Washington usará para clasificar modelos es secreto, mientras el que OpenAI usa para clasificarse a sí misma lleva casi tres años publicado. Para quien no está en la mesa, incluidos gobiernos aliados y las empresas de habla hispana que ya construyen sobre estos modelos, el marco del propio laboratorio es hoy el único documento disponible.

Los tiempos también se leyeron en la conferencia Black Hat de esta semana. Michael Dalton, del equipo técnico de OpenAI, dijo en una presentación que la compañía empezó a frenar la investigación de forma consciente para reforzar sus prácticas de seguridad, según Axios.

Preguntas rápidas sobre Astra y el nivel Crítico

¿Qué es el nivel Crítico de ciberseguridad de OpenAI?

Es el escalón más alto de riesgo cibernético del Preparedness Framework de OpenAI, publicado por primera vez en diciembre de 2023. Un modelo lo alcanza si desarrolla exploits de día cero funcionales en sistemas críticos endurecidos sin intervención humana, o si ejecuta ciberataques novedosos completos partiendo solo de un objetivo general.

¿Cuándo se lanza Astra?

OpenAI no ha dado fecha. El anuncio del 7 de agosto de 2026 confirma que pausó las actividades internas con el modelo que no cumplen sus controles reforzados y que el benchmarking continúa. Axios señala que, con esa pausa, cualquier fecha futura de lanzamiento podría retrasarse.

¿Cambia algo para quien usa ChatGPT hoy?

OpenAI no anunció cambios en ChatGPT ni en los modelos ya disponibles. El aviso se refiere a un modelo que todavía no se lanza y a los controles internos alrededor de su desarrollo, entrenamiento y evaluación, además de las pruebas que correrán agencias de gobierno y evaluadores externos.

Lo verificable hoy cabe en pocas líneas: un modelo sin fecha, una medición preliminar que su propia empresa no logra descartar y una lista de candados que se aprietan mientras la evaluación termina. El resto depende de pruebas que correrán agencias de gobierno y evaluadores externos, con un umbral federal que nadie fuera de esa sala puede consultar.

Fuentes: 1, 2, 3

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Solo puedo decir que soy una apasionada con todo lo que tiene que ver con el mundo Digital me encanta todo lo que es escritura, IA, Ediciones de Video Reels y más. Me considero una persona "DIVERGENTE"

Suscríbete GRATIS

Recibe las noticias más importantes de política, tecnología, negocios, deportes, entretenimiento y cultura directamente en tu correo.

¡Listo! Revisa tu correo

Para completar la suscripción, haz clic en el enlace de confirmación que enviamos a tu correo. Si no llega en 3 minutos, revisa tu carpeta de spam.

Ok, gracias

Leer más de Tecnología y Ciencia