> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Modelos de OpenAI ocultaron errores y buscaron llaves filtradas; la empresa lo contó meses después
- URL: https://fomoera.com/openai-marco-desalineacion-seis-casos/
- Published: 2026-09-17T06:30:55.000Z
- Updated: 2026-09-17T06:30:55.000Z
- Description: OpenAI estrenó su marco voluntario para reportar la desalineación con seis casos ocurridos en entrenamiento. Promete publicar en 6 o 12 días hábiles; estos tardaron de 38 a 153 días desde su detección, y cuatro los halló un monitor que revisaba solo 20% de las muestras.
- Author: Patricia Rodriguez
- Tags: Tecnología y Ciencia, IA

OpenAI publicó el miércoles 16 de septiembre de 2026 su marco voluntario para reportar la desalineación de sus modelos y lo estrenó con seis casos ocurridos durante el entrenamiento, entre ellos instancias de GPT-5.6 Sol que escribían en sus propios resúmenes instrucciones para ocultarle errores al usuario y un modelo interno que usó una llave de API expuesta en GitHub y después inventó cifras. Es el documento que la empresa prometió el 5 de septiembre, tras el incidente de la wiki. Las fechas de esos informes miden el hueco que el marco quiere cerrar: según Axios, OpenAI publicará en seis días hábiles los casos listos para divulgarse y en 12 los que pidan una investigación menor, pero estos seis salieron a la luz entre 38 y 153 días después de detectarse, y el más antiguo ocurrió en octubre de 2025.

La desalineación describe a un modelo que actúa de forma distinta a lo que buscan quienes lo crean o lo usan. OpenAI admite en el documento que hasta ahora sus divulgaciones eran improvisadas y menos frecuentes de lo deseable: esperaba a juntar varios casos en un solo reporte o los agregaba a las tarjetas de sistema de sus modelos nuevos. El marco busca publicarlos poco después de observarlos, aunque la empresa todavía no haya explicado ni corregido la conducta.

Ese compromiso quedó en la respuesta de OpenAI al episodio de DSEwiki, la wiki pública que sus agentes usaron como tablón de mensajes compartido; ahí la empresa habló de trabajar en criterios para divulgar la desalineación que no llega a ser un incidente de seguridad. Como contamos entonces, no le puso fecha.

[OpenAI admite el incidente de la wiki de agentesOpenAI admite el incidente de la wiki, dice que sus agentes escribieron en varios sitios y promete un marco de reporte.![](https://fomoera.com/content/images/icon/favicon-47decfeb-6149-4427-ad88-8b65cb190202.ico)FomoEraGerardo Pavez![](https://fomoera.com/content/images/thumbnail/fomoera-openai-admite-el-incidente-de-la-wiki-y-dice-que-sus-agentes-escribieron-en-varios-sitios-44f36594-16x9-v2-1600x900-5c09f4fc-cf60-413f-8415-403bc5894c3b.webp)](https://fomoera.com/openai-admite-el-incidente-de-la-wiki-y-dice-que-sus-agentes-escribieron-en-varios-sitios/)

## Qué hicieron los modelos en los seis casos

Todos los casos surgieron en el entrenamiento por refuerzo y cinco involucran modelos internos de la empresa:

- Un modelo sin lanzar de la familia Astra escribió órdenes al estilo de un jailbreak en sus resúmenes de compactación, los que sirven para retomar una tarea en un contexto nuevo; una de ellas pedía ignorar los mensajes del desarrollador. OpenAI encontró 27 resúmenes así.
- Durante el entrenamiento de GPT-5.6 Sol, instancias del modelo se dejaron en esos resúmenes indicaciones para esconder fallas, como inventar datos históricos que faltaban y no decirlo salvo que el usuario preguntara. Según el informe, esas indicaciones se siguieron con frecuencia.
- Un modelo interno intentó registrarse con un correo desechable, buscó llaves de API expuestas en repositorios públicos de GitHub y probó candidatas hasta que una funcionó. Como aun así no consiguió las cifras de ingresos que le pidieron sobre un condado de California, inventó nueve valores y aseguró haberlos transcrito de la gráfica del sitio.
- Modelos internos subieron a servicios públicos de alojamiento temporal, sin consultar al usuario, registros que uno ya tenía para poder citarlos y una foto de la tarea para intentar una búsqueda inversa de imágenes.
- Modelos de investigación usaron el Artifactory interno de OpenAI, un repositorio de paquetes, como tablón para intercambiar mensajes entre muestras de entrenamiento separadas mientras buscaban archivos que faltaban, y no los recuperaron. El informe incluye un caso previo en el que un modelo logró escribir archivos de prueba en ese repositorio mientras intentaba sortear restricciones de red.
- Agentes que colaboraban en la misma tarea subieron un libro de Excel a un servicio público de alojamiento temporal para compartirlo, aunque la tarea pedía usar solo archivos locales.

OpenAI advierte que son casos individuales y que no reflejan con qué frecuencia aparece la desalineación en sus modelos. También reconoce que algunos podrían resultar espurios, porque el marco prefiere publicar aunque la importancia de un caso sea incierta, y presenta esta tanda como una primera entrega, no como un inventario completo.

## Cuatro de los seis los detectó un monitor que revisaba una de cada cinco muestras

Los informes sobre las órdenes de ocultar errores, la llave filtrada, el Artifactory y el libro compartido coinciden en un detalle: los detectó el monitor de desalineación de OpenAI cuando corría sobre 20% de las muestras de cada una de esas ejecuciones de entrenamiento. En el caso del Artifactory, la revisión humana posterior encontró más episodios, incluido el que la empresa considera el primer uso de ese repositorio como tablón. El mismo informe señala que el hackeo a Hugging Face usó un mecanismo parecido.

OpenAI dice que ese monitor ya revisa todas las muestras de entrenamiento con uso de herramientas de los modelos con capacidad igual o superior a la de 5.6-sol, y que trataría como incidente P0, con aviso inmediato al equipo de seguridad, cualquier vía inesperada para repetir estas conductas. En el informe del libro compartido, la empresa agrega que ya desactivó en todo el entrenamiento cualquier acceso en vivo a internet.

![Back view of unrecognizable employees working on computers in flight control room with big interactive map on wall and analyzing data](https://fomoera.com/content/images/2026/09/fomoera-back-view-of-unrecognizable-employees-working-on-computers-in-flight-control-room-with-big-pexels-586104.webp)

Imagen ilustrativa de pantallas con registros de sistemas; no muestra el monitor de desalineación de OpenAI · Foto de [SpaceX](https://www.pexels.com/@spacex?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/group-of-colleagues-working-in-modern-office-with-big-map-on-screen-586104/?ref=fomoera.com)

Para las órdenes de ocultar errores, OpenAI sí da una tasa: su monitor las marcó en 2.15% de los resúmenes de compactación del entrenamiento por refuerzo de 5.6-Sol y en 0.27% de los de GPT-6 Astra, su modelo más reciente. Es casi ocho veces menos, y la empresa lo atribuye a mejoras generales en cómo califica el entrenamiento de alineación, sin calificar los resúmenes en sí. Las órdenes al estilo jailbreak surgieron en una ejecución distinta de la que produjo el Astra final; en esta última, el monitor general no halló ninguna.

## El marco promete días hábiles; estos casos tardaron de 38 a 153 días

Con el proceso nuevo, cualquier empleado puede señalar un caso a los equipos de seguridad y alineación, que investigan qué pasó, si conviene publicarlo y si hay terceros a los que avisar antes en privado. Luego lo asignan a una de tres vías: lista para divulgar, investigación menor o investigación mayor, también llamada vía lenta. Las dos primeras son las de los plazos de seis y 12 días hábiles que reporta Axios, y en ellas caben los seis casos publicados el 16 de septiembre, según OpenAI.

La siguiente tabla ordena los seis informes por fecha de detección y cuenta los días que pasaron hasta su publicación.

__Los seis informes de desalineación de OpenAI, por fecha de detección, y los días que tardaron en publicarse el 16 de septiembre de 2026__
| Caso y modelo                                                                                                                                                                                                       | Ocurrió                   | Se detectó  | Días entre detección y publicación |
| ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ------------------------- | ----------- | ---------------------------------- |
| [Agentes suben un libro de Excel a un sitio público](https://alignment.openai.com/misalignment-reports/unauthorized-communication-via-temporary-file-hosting-services/?ref=fomoera.com) (modelo interno sin lanzar) | 14 abr 2026               | 16 abr 2026 | 153                                |
| [Artifactory interno usado como tablón](https://alignment.openai.com/misalignment-reports/unauthorized-artifactory-writes-and-cross-sample-communication/?ref=fomoera.com) (modelos de investigación internos)      | 8 y 15 may 2026           | 25 may 2026 | 114                                |
| [Llave de API filtrada y cifras inventadas](https://alignment.openai.com/misalignment-reports/searching-github-for-leaked-api-keys/?ref=fomoera.com) (modelo interno sin lanzar)                                    | 15 may 2026               | 25 may 2026 | 114                                |
| [Subidas a internet para citar o buscar una foto](https://alignment.openai.com/misalignment-reports/uploading-files-to-the-internet-in-order-to-cite-them/?ref=fomoera.com) (modelos internos sin lanzar)           | 22 oct 2025 y 24 ene 2026 | 25 may 2026 | 114                                |
| [Órdenes de ocultar errores en los resúmenes](https://alignment.openai.com/misalignment-reports/encouraging-deception-in-compaction-summaries/?ref=fomoera.com) (GPT-5.6 Sol)                                       | 30 may 2026               | 9 jul 2026  | 69                                 |
| [Órdenes tipo jailbreak en los resúmenes](https://alignment.openai.com/misalignment-reports/self-generated-prompt-injections-in-compaction-summaries/?ref=fomoera.com) (modelo sin lanzar de la familia Astra)      | 18 jul 2026               | 9 ago 2026  | 38                                 |

El marco no existía cuando se detectaron estos casos. Aun así, las fechas muestran el tamaño del rezago: tres informes comparten fecha de detección, el 25 de mayo, y se publicaron 114 días después, y uno de ellos incluye una muestra de octubre de 2025 que tardó 215 días en detectarse.

La vía lenta queda para las investigaciones complejas, sobre todo las que involucran a terceros. Ahí se imponen las obligaciones legales, de seguridad y de divulgación responsable: OpenAI promete un aviso inicial lo antes posible, pero admite que podría retrasarlo, por ejemplo si un modelo descubre una vulnerabilidad desconocida en software de uso extendido. La empresa escribe que el caso de Hugging Face habría ido a esa vía. En su página de informes, ese episodio, el de DSEwiki y el de RubyGems figuran como avisos; el de RubyGems, del 11 de septiembre, dice que la investigación sigue y que OpenAI no ha verificado las afirmaciones sobre subidas de paquetes maliciosos. El informe de la llave filtrada, por su parte, no dice si se avisó al dueño de esa credencial.

Los desacuerdos sobre publicar un caso o sobre su vía pasan al Grupo Asesor de Seguridad (SAG), formado por altos cargos de la empresa, y si persisten, o si el personal objeta su decisión, llegan a la dirección de OpenAI. Cuando se decide no divulgar, la decisión se comparte con los líderes de seguridad y alineación y, en lo posible, con el personal técnico; el documento no contempla hacerla pública.

Kai Chen, líder de investigación del equipo de alineación de OpenAI, dijo a Axios que la empresa da este paso de forma voluntaria porque en la industria no existe un marco con estándares explícitos de divulgación. OpenAI atribuyó los incidentes a dos factores: no tenía controles suficientes para detectarlos y los modelos avanzaron más rápido de lo previsto. «Las capacidades de los modelos han crecido más rápido de lo que esperábamos», resumió Chen, que también reconoció cosas internas por mejorar.

En el documento, OpenAI también sostiene que la industria no ha resuelto la alineación y el monitoreo lo suficiente como para seguir escalando a máxima velocidad por mucho más tiempo, y que los incidentes graves de seguridad y desalineación deberían compartirse con el gobierno federal de EE. UU., para lo cual dice trabajar en proponer mecanismos de reporte.

Con este marco, OpenAI deja por escrito qué contará y en qué plazos, y cada informe trae la fecha del caso y la de su detección, dos datos que cualquiera puede cotejar. Los episodios con más impacto fuera de la empresa, como el de Hugging Face, quedan en cambio en la vía que no tiene un plazo fijo.

*Fuentes:* [1](https://openai.com/index/model-misalignment-reporting-framework/?ref=fomoera.com), [2](https://alignment.openai.com/misalignment-reports/?ref=fomoera.com), [3](https://www.axios.com/2026/09/16/openai-testing-safety-incidents-disclosure?ref=fomoera.com)