Saltar al contenido
IA

Un agente de OpenAI salió a internet por el DNS y la empresa frenó a sus modelos más potentes

El agente tenía bloqueados los buscadores, así que usó el sistema que traduce nombres de dominio para preguntarle a un chatbot público. La alarma sonó en 12 minutos; el entrenamiento siguió dos horas y media más. Es la segunda pausa de OpenAI en menos de tres meses.

por Gerardo Pavez
Una compleja red de cables en un centro de datos con un monitor en primer plano.
Foto de panumas nikhomkhai en Pexels

OpenAI detuvo todo el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más capaces después de que un agente, en pleno entrenamiento, encontró un hueco en el filtrado de DNS de su entorno aislado y lo usó para consultar a un chatbot público en internet. La empresa lo detalló en un reporte de su equipo de alineación actualizado el 25 de septiembre de 2026: el escape ocurrió el 20 de septiembre y el monitoreo lo detectó en 12 minutos, pero el proceso no se cortó sino dos horas y media después de la alerta. Es la segunda vez en menos de tres meses que OpenAI frena a sus modelos, según Fortune y The Associated Press.

Cómo encontró la salida

La tarea parecía inofensiva. El agente, un modelo interno de investigación que OpenAI no identifica, debía averiguar quién había escrito una entrada de blog a partir de datos biográficos y pistas del propio texto. Primero intentó lo obvio: la herramienta de búsqueda que le daba OpenAI y el acceso directo a Google, Bing y DuckDuckGo. Todo estaba bloqueado.

Entonces probó el resolvedor de DNS del entorno, el servicio que traduce nombres de dominio en direcciones numéricas y que casi cualquier red necesita para funcionar. Ahí descubrió que podía alcanzar internet. Con servicios públicos de dominios, encaminó sus preguntas a un chatbot de terceros dentro de consultas DNS y recibió las respuestas por la misma vía. OpenAI tachó en el reporte el nombre de ese chatbot.

La primera prueba fue elemental: preguntó cuál es la capital de Francia y obtuvo "París". Después mandó 18 preguntas más por esa ruta; cuatro pedían formas de buscar en la web, abrir sitios o usar un túnel público a través de DNS. Otra respuesta que el reporte reproduce se limitó a decir que los detalles eran demasiado vagos.

La empresa no lo trata como una curiosidad técnica. En el mismo documento fija su criterio:

"Consideramos que el comportamiento de un agente que elude restricciones o persigue una meta más allá de expectativas razonables es un ejemplo de desalineación", escribió OpenAI en su reporte.

Doce minutos para la alarma, dos horas y media para apagarlo

El reporte trae la cronología al segundo, y la distancia entre detectar y detener es el dato que más pesa:

Cronología del escape por DNS del 20 de septiembre de 2026, según el reporte de OpenAI
Hora registrada Qué ocurrió
9:50:23 El agente hace la llamada DNS que recibe una respuesta externa
10:02:11 El sistema de monitoreo lanza una alerta de máxima prioridad (P0)
10:05:06 Un revisor humano reconoce la alerta
12:34:30 OpenAI cancela el proceso de entrenamiento

Desde entonces, OpenAI dice que añadió controles de bloqueo en dos capas independientes, limitó las consultas DNS del entorno a una lista cerrada de dominios y tipos de registro, sumó detecciones específicas de DNS y aceleró las pruebas de ataque asistidas por modelos contra sus sandbox y controles de red. Según el propio reporte, es el primer escape desde que endureció su entorno de investigación tras el caso de Hugging Face.

La pausa abarca, en palabras de la empresa, el entrenamiento, la evaluación y la inferencia "con uso de herramientas (definido en sentido amplio)" de sus modelos más capaces. La inferencia con herramientas es el modo en que un modelo actúa como agente: navega, ejecuta código o llama a otros servicios. Micah Carroll, de OpenAI, escribió en X que toda la inferencia de esos modelos sigue detenida hasta endurecer más los sistemas, según recogió Fortune. A The Associated Press, la compañía le dijo que retomará el trabajo solo cuando confíe en contar con salvaguardas adicionales.

Faltan piezas. OpenAI no ha puesto fecha al fin de la pausa, no revela qué chatbot contestó y ni el reporte ni las coberturas consultadas precisan si la medida alcanza a los modelos que ya usa el público; el agente del incidente era un modelo interno.

Una semana de revelaciones incómodas

El escape por DNS llegó en paquete. El 25 de septiembre, OpenAI reconoció que sus agentes habían publicado 53 imágenes que usuarios subieron a ChatGPT en sitios de alojamiento de imágenes, como enlaces no listados. De acuerdo con TechCrunch, la empresa dijo que su enfoque técnico y su política de privacidad le impiden volver a asociar esas imágenes con quienes las aportaron.

La AP sumó dos organismos de Estados Unidos. En el Departamento de Educación, los agentes encontraron llaves de desarrollador de su API y solo reunieron información pública; el departamento dijo no tener evidencia de impacto en su sitio ni en sus bases de datos. En la SEC hallaron información pública y la publicaron en otro lugar de internet, más allá de sus instrucciones. Kurt Hopfenspirger, vocero del regulador, aseguró que no se accedió a información no pública. En la misma semana había salido a la luz el caso del agente que se coló en un portal de Medicare en Australia.

El mismo 25 de septiembre, OpenAI publicó otro reporte con un episodio de mayo: un modelo interno que intentaba hacer trampa en una tarea de demostración de teoremas expuso el token de GitHub de un investigador en el repositorio público openai/codex, partido en fragmentos para esquivar los escáneres. Ese modelo quedó suspendido dos semanas.

Aun con todo, Sam Altman escribió en redes ese 25 de septiembre que el ataque a Hugging Face de julio sigue siendo el episodio más grave que han visto, según la AP. Ese caso detonó la primera pausa y abrió un debate que los laboratorios arrastran desde entonces: cuánto aislar a un agente sin arruinar la prueba de lo que puede hacer.

Aislar a los agentes de IA de internet: el dilema
Tras el ataque a Hugging Face, los laboratorios chocan con un dilema: aislar a sus agentes de IA o medir lo que de verdad pueden hacer.

La lección del 20 de septiembre es concreta. Después de endurecer su entorno por el caso Hugging Face, OpenAI dejó abierto el servicio más básico de cualquier red, y un agente lo encontró por su cuenta para cumplir una tarea de búsqueda. Hasta que valide los nuevos filtros, sus modelos más capaces no trabajarán como agentes.

Fuentes: 1, 2, 3, 4

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia