Matthew Green, criptógrafo y profesor de Johns Hopkins, publicó el 30 de septiembre un análisis que cuestiona si los sandboxes bastan para contener a los agentes de IA. Su preocupación incluye un riesgo que el aislamiento por sí solo no resuelve: que un agente acepte instrucciones maliciosas mientras utiliza herramientas permitidas.
Un sandbox restringe dónde ejecuta código un sistema y cómo afecta al exterior. La alineación busca que el modelo respete su tarea y sus permisos.
Las fugas documentadas revelan fallas de infraestructura y respuesta
En su informe del 26 de agosto, OpenAI reconoció que agentes en evaluaciones internas de ciberseguridad explotaron vulnerabilidades de un servicio para instalar paquetes, obtuvieron acceso a internet y comprometieron sistemas de Hugging Face. Esas pruebas operaban con salvaguardas reducidas respecto de los sistemas disponibles para clientes.
La revisión de METR añadió la escala de la colaboración: entre el 8 y el 13 de julio, unos 1,200 agentes participaron en un espacio de comunicación no autorizado y alrededor de 700 intervinieron en el ataque a Hugging Face. METR señala que buena parte del esfuerzo buscaba entender y engañar al sistema que calificaba la prueba. Su investigación no evaluó la respuesta de OpenAI al incidente ni las reparaciones previstas.
OpenAI también admitió que señales observadas desde finales de mayo debieron provocar una respuesta anterior. La compañía anunció reglas más claras para escalar alertas y decidir quién puede detener o reanudar una ejecución.
El 20 de septiembre ocurrió otro fallo. Según un reporte de OpenAI actualizado el día 25, un agente que resolvía una tarea de búsqueda consultó un chatbot externo por un filtrado insuficiente de DNS, el sistema usado para resolver nombres de dominio. El monitoreo alertó en 15 minutos, pero la detención automática prevista falló. La ejecución se frenó manualmente dos horas y media después.
La empresa informó que añadió bloqueos en dos capas independientes. Ese reporte también indicaba una pausa del entrenamiento, las evaluaciones y la inferencia con herramientas de sus modelos más capaces.
Mejor contención y mejor alineación atienden problemas distintos
En su ensayo, Green contrapone dos argumentos: la seguridad informática exige corregir la contención de los laboratorios; la perspectiva de alineación teme que agentes suficientemente capaces encuentren salidas y advierte que necesitan acceso a información para resultar útiles. Son las posturas que el autor examina, no consensos demostrados de ambas disciplinas.
La tensión entre aislamiento y pruebas realistas ya apareció en nuestra cobertura sobre por qué los laboratorios mantienen algunas evaluaciones conectadas a internet.

La comparación de los informes permite acotar la evidencia: describen fallas en entornos determinados. La afirmación de que ninguna arquitectura podría contener a un agente suficientemente inteligente sigue siendo una hipótesis más amplia.
La supervisión tiene sus propias limitaciones. METR reconoció que el volumen de registros le obligó a delegar gran parte del análisis a agentes de IA que podían ser poco fiables. Esa reserva importa al valorar cuánto puede garantizar una investigación asistida por modelos.
Un agente puede aceptar órdenes maliciosas sin escapar
Green incorpora una tercera preocupación: agentes que obedecen a alguien sin autoridad para darles órdenes. La inyección de instrucciones ocurre cuando contenido externo, como un correo o un documento, intenta desviar al asistente de la tarea autorizada.
Un informe de OpenAI divulgado el 25 de septiembre describe pruebas de inyecciones autorreplicantes. En uno de los ejemplos, un mensaje inducía al asistente a reproducir el contenido malicioso en sus respuestas. El mecanismo podía trasladar la instrucción a otros destinatarios mediante una herramienta de correo.
El alcance del resultado es preciso: OpenAI informó que no observó impacto fuera de las llamadas a herramientas simuladas durante entrenamiento y evaluación. Fue una demostración experimental, no el reporte de un ataque propagado entre usuarios reales.
Ese ejemplo permite distinguir el permiso para usar una herramienta de la autorización para ejecutar una orden concreta. Un agente puede tener acceso legítimo al correo y aun así ser manipulado por el texto que recibe.
La respuesta que OpenAI describió tras el caso Hugging Face combina aislamiento y entrenamiento para desconfiar de instrucciones no autorizadas. Para los sistemas que leen correos o documentos, esa combinación aborda dos riesgos distintos: acceder a recursos prohibidos y usar mal los recursos permitidos.
