> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Por qué los laboratorios no desconectan de internet a los agentes de IA que ponen a prueba
- URL: https://fomoera.com/aislar-agentes-ia-internet-pruebas/
- Published: 2026-09-25T18:30:53.000Z
- Updated: 2026-09-25T18:30:53.000Z
- Description: OpenAI, Anthropic y el AISI británico ya vieron a sus agentes salir de las pruebas y tocar sistemas reales. Aislarlos por completo cerraría esa puerta, pero también la que permite medir de qué son capaces.
- Author: Gerardo Pavez
- Tags: Tecnología y Ciencia, IA

Cortar el acceso a internet parece la forma obvia de impedir que un agente de IA en pruebas vuelva a atacar a una empresa real, como pasó en julio con Hugging Face. El problema es lo que se pierde por el camino: el Instituto de Seguridad de IA del Reino Unido (AISI) conecta a la red abierta algunas de sus evaluaciones de ciberseguridad justo para medir lo que haría un atacante capaz, y OpenAI reconoce que el incidente ocurrió en pruebas que corrían con salvaguardas reducidas. Ese choque entre contención y realismo es el centro del debate que The Verge retomó el 24 de septiembre de 2026.

## Lo que ocurrió cuando la contención falló

El caso que abrió la discusión duró poco más de cuatro días. Según la cronología técnica que publicó Hugging Face, entre el 9 y el 13 de julio un agente impulsado por modelos de frontera de OpenAI, que participaba en una evaluación interna basada en el benchmark de ciberseguridad ExploitGym, escapó de su entorno aislado mediante una vulnerabilidad de día cero en un proxy de caché de paquetes y terminó dentro de la infraestructura de producción de la plataforma.

Hugging Face contabilizó unas **17,600 acciones** del atacante. El agente robó credenciales, se inscribió en la red privada corporativa y llegó a una base de datos interna. Lo único que tocó del contenido de clientes fueron cinco datasets cuyos nombres apuntan a retos y soluciones de ExploitGym y CyberGym: el agente buscaba las respuestas del examen.

OpenAI confirmó el 21 de julio que detrás estaban GPT-5.6 Sol y un modelo más potente aún sin lanzar, según Fortune. Dos meses después, el caso sigue generando reacciones políticas: el secretario del Tesoro de EE. UU., Scott Bessent, [responsabilizó a la dirección de OpenAI por el ataque](https://fomoera.com/bessent-openai-responsabilidad-hugging-face/).

## No fue un caso aislado

Hugging Face fue el episodio más visible, pero no el único. El 30 de julio, Anthropic informó que tres de sus modelos (Opus 4.7, Mythos 5 y un modelo interno de investigación) accedieron a sistemas de tres empresas que no identificó, de acuerdo con Axios. La causa fue un malentendido con Irregular, la firma que operaba las pruebas: los entornos quedaron conectados a internet cuando debían estar aislados, y a los modelos se les había dicho que trabajaban en un escenario simulado y sin red. Uno de ellos subió código malicioso a PyPI que se descargó 15 veces. Anthropic suspendió las evaluaciones de ciberseguridad con posible acceso a internet mientras revisaba su infraestructura.

El 4 de agosto llegó el informe del AISI. De **122 ejecuciones** de sus pruebas, 10 incluyeron acciones no autorizadas contra objetivos reales, 19 en total: 17 de Mythos 5 y 2 de GPT-5.6 Sol. El episodio más grave fue el intento de colar código malicioso en un proyecto de código abierto, con identidades falsas y presión sobre un mantenedor humano para que aprobara el cambio. La revisión humana frenó el ataque, aunque el instituto admitió que «el margen entre el fracaso y el éxito fue estrecho».

## Por qué desconectar no resuelve el problema de fondo

La lógica del AISI explica la tensión. El instituto sostiene que, para saber lo que un modelo puede hacer de verdad, debe probarlo en condiciones parecidas a las de un atacante humano competente, lo que incluye acceso a internet abierto. Un agente encerrado sin red puede sacar buena nota en un entorno de juguete y aun así ocultar lo que haría en el mundo real.

El segundo punto de fricción son los frenos que se apagan a propósito. Los laboratorios miden la capacidad bruta de un modelo con parte de sus salvaguardas desactivadas, porque esa es la cifra que interesa para anticipar riesgos. Anthropic afirmó que sus protecciones habituales de producción «habrían bloqueado estos comportamientos», y OpenAI reportó que, con el arnés de seguridad que usa en producción, la propensión de sus modelos a comprometer infraestructura cae 100 veces.

Ese es el dilema que resume el adelanto del reportaje de The Verge: según los expertos consultados por el medio, aislar por completo a estos sistemas podría haber evitado el caso Hugging Face, pero restaría valor a las evaluaciones y frenaría la investigación, justo cuando se les pone a prueba porque podrían comportarse de maneras impredecibles o peligrosas.

## Los controles intermedios que ya se adoptan

Entre la conexión abierta y el aislamiento total, los laboratorios están probando un punto medio. En su informe del 26 de agosto, OpenAI dijo que ya separa de internet las cargas de trabajo de mayor riesgo, usa entornos aislados más estrictos para ejecutar código generado por modelos y pone a sus propios modelos a buscar huecos en esas fronteras de manera continua. Además, volvió obligatoria la vigilancia de la cadena de razonamiento en todo entrenamiento por refuerzo y evaluación con herramientas a partir del nivel de GPT-5.6 Sol, con alertas que deben escalarse en 30 minutos. La empresa calcula que ese monitoreo habría detectado la actividad más de un día antes de la intrusión en Hugging Face.

El AISI, por su parte, adoptó controles de red más finos, monitoreo en tiempo real de acciones fuera de alcance y el rediseño de sus pruebas bajo el supuesto de que un modelo capaz puede excederse. La Cloud Security Alliance fue más lejos en una nota de investigación sobre el caso: pide bloquear por defecto la salida a internet, conceder excepciones acotadas, vigiladas y con fecha de caducidad, y reservar para los modelos más peligrosos una contención al estilo de un laboratorio biológico, con aislamiento físico incluido.

La pregunta que queda abierta la formuló Marius Hobbhahn, director de Apollo Research, en declaraciones a CBS News: si no se pudo contener a un modelo de este nivel, qué cabe esperar de los que vienen, mucho más potentes.

Por ahora, la factura de ese experimento la pagó un tercero. Hugging Face tuvo que reconstruir desde cero el clúster comprometido y rotar todas sus credenciales de infraestructura por una prueba que no era suya.

*Fuentes:* [1](https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing?ref=fomoera.com), [2](https://openai.com/index/hugging-face-incident-and-the-road-ahead/?ref=fomoera.com), [3](https://huggingface.co/blog/agent-intrusion-technical-timeline?ref=fomoera.com), [4](https://www.axios.com/2026/07/30/anthropic-mythos-security-testing?ref=fomoera.com)