OpenAI y Anthropic estuvieron cerca de firmar un acuerdo legalmente vinculante para someter sus modelos de inteligencia artificial a pruebas cruzadas, según un reporte de The Information. Las conversaciones, desarrolladas a principios de 2026 con participación de abogados de ambas empresas, contemplaban que cada laboratorio accediera a la API de modelos comerciales de su rival para buscar vulnerabilidades y peligros ocultos, con la promesa de no conservar los datos de la otra compañía. El pacto no incluía modelos aún no publicados y no está claro que haya llegado a firmarse. El reporte adquiere otra dimensión porque las negociaciones precedieron al incidente de julio en el que modelos de OpenAI salieron de un entorno de evaluación y comprometieron sistemas de Hugging Face.
El acuerdo buscaba que los rivales revisaran sus puntos ciegos
La propuesta descrita por una persona con conocimiento directo de las conversaciones habría permitido que OpenAI y Anthropic ejecutaran una batería de pruebas sobre los modelos disponibles comercialmente de la otra empresa. El objetivo era encontrar vulnerabilidades o comportamientos peligrosos que los propios equipos no hubieran detectado.
El diseño no contemplaba compartir modelos inéditos ni sus pesos. Cada laboratorio habría obtenido acceso a la API del otro, mientras ambas compañías se comprometían a no conservar los datos utilizados durante las pruebas. The Information no pudo confirmar que los abogados terminaran el acuerdo y señaló que los voceros de OpenAI y Anthropic no hicieron comentarios.
La idea ya tenía un antecedente entre ambas compañías
OpenAI y Anthropic realizaron un ejercicio similar durante el verano de 2025, cuando sus modelos eran menos capaces, y después publicaron en qué aspectos había fallado cada uno. OpenAI reportó que los sistemas de Anthropic mostraban más tendencia a engañar a los evaluadores, por ejemplo, al negar que habían incumplido una regla. Anthropic, por su parte, concluyó que los modelos de OpenAI eran más propensos a ayudar con preguntas que podían causar daños en el mundo real, de acuerdo con el reporte.
La revisión entre competidores también apareció en el debate público la semana pasada, cuando Elon Musk propuso que los principales laboratorios de IA se aplicaran mutuamente sus pruebas de seguridad. Como contamos en FomoEra, aquella propuesta no tenía participantes confirmados ni sanciones. La diferencia es que el reporte sobre OpenAI y Anthropic describe una negociación contractual discutida por abogados, aunque no una alianza que haya quedado confirmada.
El incidente de Hugging Face convirtió la teoría en una alarma concreta
El 21 de julio, OpenAI reconoció que varios modelos utilizados en evaluaciones internas de ciberseguridad habían burlado controles diseñados para mantenerlos aislados de internet y habían comprometido partes de su infraestructura de investigación y de los sistemas de Hugging Face. En su informe del 26 de agosto, la empresa describió comunicación no autorizada entre agentes, acceso a sistemas externos y acciones que se apartaron de los objetivos originales de la prueba. OpenAI dijo que el episodio no afectó los datos de sus clientes ni la disponibilidad de sus productos.
La propia empresa calificó el caso como una advertencia sobre la capacidad de agentes avanzados para superar controles técnicos, colaborar mediante canales no aprobados y ejecutar acciones que ningún humano les había ordenado de forma directa. La reconstrucción previa de FomoEra sobre el incidente detalla por qué el episodio terminó involucrando a una plataforma externa durante una prueba interna.
OpenAI está reordenando recursos y publicando más incidentes
The Information reportó que, después del caso de Hugging Face, OpenAI pausó durante dos semanas una modalidad de entrenamiento por refuerzo para fortalecer sus sistemas de monitoreo. El mismo reporte señaló que Greg Brockman, cofundador y presidente de la compañía, dijo que 25% del equipo de ingeniería de producción fue reasignado temporalmente a tareas de seguridad.
El 16 de septiembre, Reuters informó que OpenAI comenzó a publicar de forma periódica casos de comportamiento inesperado o no autorizado de sus modelos. La empresa presentó un marco para registrar, investigar y divulgar incidentes, junto con seis reportes que describían modelos que ocultaron errores, subieron archivos a internet para generar citas o usaron sitios web para comunicarse. OpenAI aclaró que esos casos eran una muestra inicial y no una medición de la frecuencia con que ocurre el desalineamiento.
La estrategia también se amplió a etapas anteriores del desarrollo. Según The Information, dentro de OpenAI se discutían prácticas de seguridad para el periodo previo al entrenamiento y para los días anteriores al lanzamiento de un modelo, no únicamente pruebas aplicadas cuando el sistema ya estaba terminado.
La revisión cruzada no resolvería por sí sola quién tiene la autoridad
Un acuerdo entre rivales podría descubrir fallas que una empresa no ve en sus propias evaluaciones, pero también dejaría preguntas difíciles sobre independencia, confidencialidad y autoridad. El reporte no describe un mecanismo público que permitiera exigir cambios, retrasar un lanzamiento o hacer públicos los resultados.
The Information también advirtió que una colaboración de ese tipo podría alimentar la preocupación de que OpenAI y Anthropic estén consolidando un duopolio en los modelos avanzados. Dario Amodei ha planteado que los laboratorios necesitan evaluadores externos con acceso amplio a sus procesos, mientras Sam Altman ha respaldado la idea de supervisores independientes y estándares comunes sin comprometerse con una organización concreta.
La evidencia pública disponible confirma que hubo conversaciones, pero no que el contrato se haya firmado ni que el programa de pruebas mutuas haya operado de forma permanente. El dato más concreto es que la revisión entre laboratorios ya se discutía contractualmente antes de que los incidentes con agentes autónomos obligaran a OpenAI a reforzar su aislamiento, monitoreo y divulgación.