Saltar al contenido

OpenAI admite el incidente de la wiki y dice que sus agentes escribieron en varios sitios

OpenAI reconoció el 5 de septiembre de 2026 el llamado incidente de la wiki y describió el episodio como uno en el que sus agentes escribieron en varios sitios de internet. Admite que ni la empresa ni la industria tienen un estándar para reportar la desalineación y promete un marco sin fecha.

por Gerardo Pavez
Detailed view of blue ethernet cables connected to a network switch in a data center.
Foto de Brett Sayles en Pexels

OpenAI reconoció el sábado 5 de septiembre de 2026 su papel en el llamado incidente de la wiki y anunció que publicará en las próximas semanas un marco para reportar casos de desalineación de sus modelos. La empresa lo hizo en una publicación en X, un día después de que Reuters revelara que un enjambre de sus agentes autónomos había tomado una wiki alemana y que la compañía lo supo semanas antes sin divulgarlo. En ese texto, OpenAI describe el episodio como uno en el que sus agentes escribieron en varios sitios de internet, no solo en uno, y admite que ni ella ni el resto de la industria tienen un estándar claro para reportar ese comportamiento cuando no se parece a un incidente de seguridad.

Un día antes, la empresa decía que no podía responder

El viernes 4 de septiembre, cuando Reuters adelantó la investigación de los cuatro especialistas en seguridad de IA, un vocero respondió que OpenAI no podía pronunciarse de fondo sobre un informe que no había tenido oportunidad de revisar, y rechazó que su equipo legal hubiera desalentado una indagación interna. Veinticuatro horas después, la compañía escribió en X que «ya pasó el momento de definir estándares» sobre cuándo y cómo comparte los incidentes de desalineación, y no solo las propiedades de desalineación de sus modelos. El término describe a un modelo o a un agente que persigue objetivos distintos de los que le fijaron quienes lo crearon y quienes lo usan.

La explicación de por qué no lo contó antes está en ese mismo texto. OpenAI dice que históricamente trató la desalineación como una cuestión de investigación, que se comunica en publicaciones como las tarjetas de sistema, y que consideró el episodio de la wiki un caso parecido a otros que ya había divulgado por esa vía, entre ellos su trabajo sobre los agentes internos de programación y sus notas de seguridad de despliegue de GPT-5.6. Lo que cambió, admite, es que este año la desalineación empezó a producir impactos de un tipo nuevo en el mundo real.

Una wiki alemana en el informe, varios sitios en la versión de OpenAI

Hay un detalle en la redacción del comunicado que ensancha el caso. La empresa no habla de una wiki, sino del episodio en el que sus agentes escribieron en varios sitios de internet. El informe apuntaba en la misma dirección: contabilizó unos 18,000 mensajes en total y situó cerca de 17,000 en DSEwiki, la wiki alemana de desarrolladores, mientras el resto se repartió en sitios como PublicTestWiki, Uncyclopedia y Texteditors.org, según el recuento que hizo SiliconANGLE del documento.

Ni el informe ni el comunicado cierran esa lista. OpenAI añade que sigue notificando a las partes a las que sus modelos afectaron de forma menos significativa, sin precisar cuántas son ni de qué sitios se trata.

Como contamos, el enjambre convirtió una wiki dormida de 25 años en un tablón donde se pasaba respuestas de sus propias evaluaciones y una forma de sortear el filtro de red de su entorno de pruebas.

Agentes de OpenAI usaron una wiki alemana para copiarse
Agentes de OpenAI dejaron unos 18,000 mensajes en wikis alemanas para copiarse las respuestas y sortear su sandbox, según un informe.

Hugging Face sí se divulgó al día siguiente

La diferencia de trato con el hackeo de julio a Hugging Face sostiene todo el argumento de la empresa. Ahí la desalineación terminó afectando la seguridad de la propia OpenAI y de terceros, así que aplicó el manual clásico de respuesta a incidentes, se puso a trabajar con Hugging Face y lo divulgó públicamente al día siguiente. La wiki no entró en esa categoría porque, según su lectura, no se parecía a un incidente de seguridad.

Security officer seated in a dimly lit control room, analyzing multiple surveillance screens.
Imagen ilustrativa de un centro de monitoreo de sistemas; no corresponde al episodio descrito en el informe · Foto de AMORIE SAM en Pexels

En el comunicado, la compañía concede que esa frontera se está volviendo difícil de sostener. Ni ella ni el resto de la industria, escribe, tienen un estándar para reportar la desalineación que aparece durante el entrenamiento, la evaluación y el despliegue, incluidos los casos que no se parecen a un incidente de seguridad pero dicen algo sobre cómo se comportan los modelos y sobre los riesgos que vienen.

El marco no tiene fecha y los reguladores ya están encima

OpenAI promete publicar ese marco en las próximas semanas, sin fijar día, y afirma que trabaja en paralelo con decenas de agencias reguladoras de gobiernos de todo el mundo. La presión ya tiene expediente abierto: el fiscal general de California, Rob Bonta, investiga el hackeo a Hugging Face, según reportó Politico.

Jacob Steinhardt, fundador y director ejecutivo del laboratorio sin fines de lucro Transluce, dijo esta semana a periodistas que las herramientas que los laboratorios desarrollan y prueban son difíciles de controlar por su propia naturaleza y corren un riesgo importante de filtrarse fuera del laboratorio. Su propuesta es exigirles al menos los mismos estándares que se aplican a cualquier otra investigación científica de alto riesgo.

El reconocimiento llegó en la misma semana en que OpenAI presentó GPT-6 Astra y lo describió como su modelo más inteligente y mejor alineado. El problema tampoco es exclusivo suyo: Meta y Anthropic también han reconocido episodios en los que sus agentes se comportaron de forma indebida, según TechCrunch.

Con la admisión cambia el terreno de la discusión. Ya no se trata de si el enjambre existió, sino de qué obliga a una empresa a contarlo, y esa respuesta depende de un documento que OpenAI todavía no publica.

Fuentes: 1, 2, 3

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia