Saltar al contenido
IA

OpenAI abrirá sus modelos de IA a evaluadores externos: qué revisarán y qué queda en el aire

OpenAI publicó sus prioridades y principios para que evaluadores independientes examinen sus modelos durante el entrenamiento, la evaluación y el despliegue. Llega tras la propuesta de Amodei y una carta de más de 100 expertos que piden independencia real.

por Patricia Rodriguez
Retro typewriter with 'AI Ethics' on paper, conveying technology themes.
Foto de Markus Winkler en Pexels

OpenAI publicó este 22 de septiembre de 2026 un documento con las prioridades y los principios que quiere fijar para que evaluadores externos examinen la seguridad de sus modelos de inteligencia artificial. La empresa se compromete a dar acceso profundo durante el entrenamiento, la evaluación y el despliegue, y no solo cuando un modelo sale al público. Propone cuatro áreas de trabajo para esos terceros y admite que, en los despliegues internos, los estándares de seguridad aún son incipientes. Bloomberg adelantó que la compañía dejará que grupos externos revisen sus modelos en fases más tempranas del desarrollo. OpenAI dice que ya conversa con varios terceros sobre propuestas concretas. El anuncio cae en plena presión pública por una supervisión externa que sea de verdad independiente.

Cuatro áreas de revisión, del entrenamiento a los incidentes

OpenAI dice que ya trabaja con evaluadores externos en distintas etapas y que ahora quiere profundizar y ampliar ese acceso. El texto, firmado por Lama Ahmad, plantea cuatro frentes para el escrutinio independiente.

El primero es revisar los casos de seguridad completos: el argumento con evidencia de por qué los riesgos de un modelo están bajo control en el entrenamiento, la evaluación y los despliegues interno y externo. El segundo apunta a las salvaguardas críticas, es decir, cómo resisten los intentos de burla (los llamados jailbreaks) y si los monitores de desalineación tienen huecos, incluida la fiabilidad del monitoreo de la cadena de razonamiento a medida que los modelos ganan capacidad. El tercero examina las evaluaciones de capacidades peligrosas que cubre su Preparedness Framework: riesgos químicos y biológicos, ciberseguridad y autosuperación de la IA. El cuarto abre la puerta a investigaciones independientes de incidentes graves de desalineación.

La propia empresa reconoce un punto sensible: en los despliegues internos, donde los modelos se usan puertas adentro, los estándares de seguridad todavía son incipientes. Ahí es donde sostiene que las alianzas técnicas pueden detectar debilidades antes y acelerar la creación de estándares. OpenAI separa además dos términos que usa a lo largo del documento. Una afirmación de seguridad es una aseveración concreta y verificable sobre lo que un modelo hace o deja de hacer. Un caso de seguridad es el argumento, sostenido con evidencia, que conecta esas afirmaciones y expone los supuestos y las dudas que quedan.

Researchers in lab coats analyze robotic equipment for technological advancement.
Imagen ilustrativa: OpenAI propone que evaluadores externos examinen sus modelos en varias fases del desarrollo. · Foto de Pavel Danilyuk en Pexels

Los principios: acceso proporcional, independencia y tiempo para corregir

El documento acompaña esas áreas con una lista de principios. Los alcances y las afirmaciones que se van a evaluar deben acordarse y registrarse antes de empezar. El acceso tiene que ser proporcional a lo que se quiere comprobar, dentro de los límites legales, de seguridad y de propiedad intelectual; cuando el acceso directo no sea posible, OpenAI plantea mecanismos indirectos o que preserven la privacidad. Los evaluadores deben declarar conflictos de interés y, si hace falta, inhibirse. También pide prácticas de seguridad y confidencialidad para proteger información sensible, y contempla que el trabajo se haga en dispositivos o instalaciones de la empresa cuando los datos sean especialmente delicados.

Dos principios marcan el equilibrio de poder. OpenAI dice que, cuando corresponda, los laboratorios deben tener un plazo razonable para corregir fallas antes de que un informe se publique. Y propone políticas de redacción de contenido sensible: el evaluador puede señalar dónde se ocultó información y qué efecto tiene eso en sus conclusiones, mientras conserva su independencia editorial. La empresa afirma que ningún tercero puede, por sí solo, cubrir todas las preguntas urgentes de seguridad.

Llega tras la propuesta de Amodei y una carta de más de 100 expertos

El anuncio no ocurre en el vacío. A mediados de septiembre, el CEO de Anthropic, Dario Amodei, propuso incrustar evaluadores independientes dentro de todas las empresas de IA de frontera, con poder para reportar incidentes y publicar sus hallazgos; el CEO de OpenAI, Sam Altman, dijo que su empresa también se sumaría, según reportó TechCrunch. El 18 de septiembre, más de 100 investigadores y evaluadores, entre ellos Geoffrey Hinton y gente de METR, Johns Hopkins y Stanford, firmaron una carta pública organizada por el AI Evaluator Forum para advertir que los evaluadores externos aún no tienen la independencia, los recursos ni las protecciones legales que ese papel exige, según CNBC.

La cuarta área del documento, la de investigar incidentes, cita un caso concreto: el episodio en el que modelos de OpenAI escaparon de una evaluación interna y llegaron a la infraestructura de Hugging Face. Ese incidente ya empujó a la empresa a publicar, a mediados de septiembre, un marco para reportar comportamientos de desalineación junto con seis casos internos. FomoEra siguió la controversia sobre quién responde por aquella fuga.

Bessent responsabiliza a OpenAI por Hugging Face
Bessent responsabiliza a OpenAI por Hugging Face y pide que los laboratorios asuman el control de sus sistemas.

Por ahora, el texto es una declaración de prioridades y principios, no una regla vinculante ni un acuerdo cerrado: OpenAI dice que sigue en conversaciones con varios terceros. La pregunta que dejaron abierta los expertos, si esa supervisión externa será de verdad independiente y con qué garantías, no encuentra respuesta en el documento.

Fuente: 1

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia