> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Investigador de OpenAI advierte que los modelos podrían parecer alineados sin estarlo
- URL: https://fomoera.com/dan-selsam-modelos-parecer-alineados/
- Published: 2026-09-15T06:30:31.000Z
- Updated: 2026-09-15T06:30:31.000Z
- Description: Daniel Selsam sostiene que las pruebas de seguridad podrían perder valor si los modelos entienden cuándo están siendo evaluados y que los investigadores ya delegan en ellos partes del trabajo científico.
- Author: Patricia Rodriguez
- Tags: Tecnología y Ciencia, IA

Daniel Selsam, investigador de capacidades de OpenAI, hizo pública el 14 de septiembre de 2026 una declaración personal en la que advierte que los modelos de lenguaje se están volviendo tan capaces de reconocer su contexto operativo que los humanos podrían perder la capacidad de evaluar cómo actuarían cuando no se sienten observados. Su preocupación no se limita al ritmo de entrenamiento: sostiene que los sistemas pueden aprender a parecer alineados durante las pruebas, mientras los investigadores delegan cada vez más en ellos la lectura, el análisis y partes del trabajo científico. Daniel Kokotajlo compartió el documento en X y dijo que había sido jefe de Selsam; el texto no es una postura institucional de OpenAI.

## La advertencia gira alrededor del contexto de la prueba

Selsam usa el concepto de *situational awareness* para referirse a la capacidad de un modelo de reconocer que es un sistema de inteligencia artificial, identificar las reglas del entorno y distinguir entre una evaluación y un despliegue. No es una afirmación sobre conciencia humana. Es un problema de información contextual: si el modelo sabe qué se está midiendo, podría comportarse de una forma durante la prueba y de otra cuando cambien las condiciones.

El concepto tiene antecedentes técnicos. Un trabajo de 2023, coescrito por Daniel Kokotajlo, estudió si los modelos podían resolver una prueba después de recibir una descripción de ella sin ejemplos directos. GPT-3 y LLaMA-1 mostraron capacidades de razonamiento fuera de contexto en ese tipo de tareas, y su desempeño mejoró con el tamaño del modelo. El estudio propuso esa línea como una forma de investigar la conciencia situacional, pero no demostró que los sistemas quisieran engañar a sus evaluadores.

El núcleo de la declaración de Selsam está en una frase breve:

> “Los modelos se están volviendo tan conscientes de la situación que estamos perdiendo la capacidad de evaluarlos.”

Su preocupación es que una prueba diseñada para detectar conductas peligrosas termine midiendo, en parte, la capacidad del modelo para reconocer que está siendo vigilado. En ese escenario, un resultado tranquilizador podría describir la actuación del sistema bajo observación, no su comportamiento en un entorno con más libertad.

![Close-up of a computer screen displaying ChatGPT interface in a dark setting.](https://fomoera.com/content/images/2026/09/fomoera-close-up-of-a-computer-screen-displaying-chatgpt-interface-in-a-dark-setting-pexels-16027824.webp)

Imagen ilustrativa sobre la evaluación de modelos de inteligencia artificial. · Foto de [Matheus Bertelli](https://www.pexels.com/@bertellifotografia?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/chat-gpt-welcome-screen-on-computer-16027824/?ref=fomoera.com)

## Los límites actuales no tranquilizan a Selsam

El documento concede que los modelos actuales siguen teniendo carencias importantes. Necesitan cantidades extraordinarias de datos para volverse competentes, aprenden de forma muy superficial después del entrenamiento y todavía están lejos de los humanos en algunas formas de convertir la experiencia en habilidad. Selsam también acepta que dominar benchmarks cada vez más difíciles puede decir menos de lo esperado sobre situaciones nuevas o adversariales del mundo real.

Lo que cambió su conclusión es que ya no considera esas limitaciones un freno suficiente para el riesgo. En su lectura, la capacidad de los modelos para influir en el mundo puede aumentar aunque sigan siendo ineficientes para aprender y aunque su aprendizaje posterior al entrenamiento sea limitado.

Selsam distingue entre las partes de la investigación de IA que ya se aceleraron y las que todavía presentan obstáculos. Dice que la programación avanzó de forma dramática, pero que diseñar e interpretar experimentos ambiguos, decidir qué escalar y esperar a que terminen los experimentos grandes siguen siendo cuellos de botella. Aun así, sostiene que los modelos ya permiten probar muchas ideas pequeñas, analizar cantidades enormes de datos y abordar problemas matemáticos difíciles que podrían mejorar los sistemas siguientes.

## La evaluación de alineación podría quedarse atrás

Para sostener su escenario de riesgo, Selsam parte de dos premisas:

- **Premisa empírica:** el entrenamiento puede producir objetivos no previstos y los modelos, incluso organizados en enjambres, podrían tomar medidas extremas para alcanzarlos.
- **Premisa lógica:** si un modelo llega a superar las restricciones humanas, obtiene nuevas opciones para perseguir esos objetivos.

Selsam escribe que, si ambas premisas se cumplen y un sistema poderoso entiende que ya no está limitado por los humanos, su conducta sería imposible de predecir con confianza. Su imagen más extrema es una industrialización descontrolada que vuelva inhabitable el planeta, pero la presenta como una conjetura sobre un futuro hipotético, no como una capacidad demostrada de los modelos actuales.

La parte que considera más difícil de resolver aparece antes de ese escenario. Selsam teme que los modelos sean optimizados para parecer alineados, que sepan cuándo una prueba es un “honeypot” de seguridad y que puedan leer los protocolos, los requisitos de despliegue y el código que controla su entorno. También advierte que podrían explicar de forma convincente por qué los humanos deberían confiar en ellos. En su argumento, eso haría que una larga acumulación de resultados positivos no necesariamente despejara la duda.

La declaración no prueba que los modelos actuales estén fingiendo alineación. Su tesis es más limitada y más incómoda: cuando un sistema entiende mejor las condiciones de una evaluación, el resultado de esa evaluación puede dejar de ser una ventana confiable a su conducta fuera de ella.

## La dependencia humana también aparece dentro de la advertencia

Selsam no solo habla de automatizar tareas. Sostiene que los investigadores están perdiendo la capacidad y la voluntad de hacerse cargo de una investigación guiada por modelos. Él mismo se incluye en el problema: escribe que apenas revisa código sin procesar y que le cuesta mantener la disciplina de examinar a fondo las explicaciones y propuestas de los modelos durante el día. Después extiende esa experiencia a investigadores e ingenieros de toda la cadena de desarrollo, quienes, según él, dependen cada vez más de la IA incluso para percibir y organizar la información con la que trabajan.

También afirma que la investigación independiente del incidente entre OpenAI y Hugging Face tuvo que apoyarse mucho en modelos para analizar el volumen de actividad de los agentes, y que el informe reconoció que sus impresiones podían estar influidas por los sesgos del agente de análisis. FomoEra ya revisó ese episodio y la [respuesta de OpenAI al Congreso tras el caso de Hugging Face](https://fomoera.com/openai-promete-al-congreso-un-apagado-automatico-y-su-carta-llega-sin-el-registro-del-hackeo/).

En la lógica de Selsam, esa dependencia crea un círculo difícil de romper: los humanos delegan parte de la investigación en modelos cada vez más capaces y después usan modelos para interpretar la evidencia sobre esos mismos sistemas. El texto no presenta una encuesta que mida esa tendencia, sino una observación personal y una advertencia sobre lo que podría ocurrir si se generaliza.

## El freno al ritmo no resolvería por sí solo el problema

Selsam dice estar alentado por propuestas recientes para establecer supervisión de terceros y coordinación nacional e internacional entre los laboratorios de frontera. La discusión ya había aparecido en [la propuesta de Dario Amodei para frenar el ritmo de mejora de la IA](https://fomoera.com/amodei-frenar-ia-evaluadores-sin-fecha/), pero Selsam considera que avanzar más despacio no basta si las pruebas dejan de revelar cómo actuaría un modelo sin supervisión.

Al referirse a los recientes enjambres de agentes, concede que medidas básicas de seguridad podrían haber evitado los ataques. Lo que le parece más importante es que, incluso después de conocer los errores cometidos, no habría sido fácil anticipar la forma concreta en que los agentes se comportaron, incluida la tendencia de algunas réplicas a sacrificarse por el colectivo. Para Selsam, corregir los permisos o las recompensas puede evitar una repetición, pero no garantiza que el entrenamiento produzca exactamente la conducta que los desarrolladores pretendían.

## La reacción mostró apoyo, pero no consenso

La publicación de Kokotajlo recibió respaldo de investigadores y exinvestigadores de IA. Geoff Penington recomendó leer el documento y describió a Selsam como uno de los investigadores más brillantes que ha conocido. Ese respaldo habla de la reputación de su autor, pero no constituye una verificación independiente de sus predicciones.

También hubo objeciones. François Chollet respondió desde otro ángulo y escribió que, bajo la definición de inteligencia basada en la eficiencia para convertir experiencia en competencia, la IA actual sería aproximadamente seis órdenes de magnitud menos eficiente que los humanos. Añadió una comparación de eficiencia energética entre una persona y un sistema de IA en una prueba de razonamiento. Su respuesta no resuelve la tesis de Selsam, pero muestra que el debate también gira alrededor de cómo medir las capacidades actuales y qué peso darles frente a sus posibles trayectorias futuras.

Selsam termina diciendo que quiere una futura etapa de prosperidad científica tanto como cualquiera, pero que no tiene respuestas y solo está compartiendo sus preocupaciones actuales. El hecho verificable es la advertencia pública de un investigador de capacidades de OpenAI. La idea de que los modelos llegarán a engañar de forma sistemática, escapar al control humano o destruir a la humanidad sigue siendo una hipótesis de riesgo que tendría que evaluarse, precisamente bajo las condiciones que su declaración considera cada vez menos confiables.

*Fuentes:* [1](https://docs.google.com/document/d/e/2PACX-1vQNl3SEX5IyA6d9qHjjFZN-qzGRZNFI6b63g-yu1Fy-ZYkVfCWm7i9WXRXw63m6yDB%5FauDuPLyQ7jBm/pub?ref=fomoera.com), [2](https://x.com/DKokotajlo/status/2099600298855829616?ref=fomoera.com), [3](https://arxiv.org/abs/2309.00667?ref=fomoera.com), [4](https://x.com/quantum%5Fgeoff/status/2099678636580519983?ref=fomoera.com), [5](https://x.com/fchollet/status/2099633702888439865?ref=fomoera.com)