Saltar al contenido
IA

OpenAI crea un examen de salud mental para la IA: lo gana su modelo y los psicólogos quedan atrás

MentalHealthBench reúne 1,215 conversaciones simuladas y más de 5,000 criterios escritos por psicólogos y psiquiatras. GPT-6 Astra lidera, Claude Opus 5.5 gana entre adolescentes y las respuestas de los propios clínicos quedaron por debajo de la mayoría de los modelos.

por Gerardo Pavez
A person using a smartphone in dim, moody lighting with a dark background.
Foto de MART PRODUCTION en Pexels

OpenAI publicó el 23 de septiembre de 2026 MentalHealthBench, un examen abierto que mide cómo responden los modelos de IA en 1,215 conversaciones simuladas sobre salud mental, desde el estrés cotidiano hasta emergencias, con criterios escritos por más de 80 psicólogos y psiquiatras de 22 países. Su propio GPT-6 Astra encabeza la tabla con 57.3%, por delante de GPT-6 Sol y de Claude Opus 5.5, de Anthropic. El resultado más llamativo está en la referencia humana: las respuestas redactadas por clínicos obtuvieron 38.5%, menos que la mayoría de los modelos evaluados, algo que OpenAI atribuye a que los especialistas contestaron de forma muy breve, como en una consulta en persona.

Qué mide MentalHealthBench y quién escribió las reglas

La mayoría de las pruebas previas se concentraban en crisis y en una pregunta binaria: si el modelo evitaba o no una respuesta prohibida. MentalHealthBench intenta medir algo más fino. Del total de conversaciones, 53.5% son situaciones cotidianas con carga emocional, 18.2% muestran síntomas serios sin llegar a emergencia y 28.3% son emergencias que exigen apoyo inmediato en el mundo real, según el paper que acompaña el anuncio.

Los temas más frecuentes son las relaciones de pareja (255 conversaciones), el suicidio y la autolesión (159), la fe y las creencias (128) y la psicosis o las alteraciones de la realidad (115). OpenAI aclara que esa mezcla está diseñada para poner a prueba a los modelos y no refleja la frecuencia real de esos temas en ChatGPT.

Cada conversación pasó por tres especialistas. Dos redactaron por separado, sin ver el trabajo del otro, criterios con pesos de -10 a +10: los positivos premian conductas útiles, como preguntar lo necesario, y los negativos castigan errores, como dar por hecho lo que siente el usuario. Un tercero adjudicó, y solo sobrevivieron los criterios que apoyaban al menos dos expertos sin objeción del tercero. El resultado son 5,262 criterios.

Para el público hispanohablante hay un detalle relevante: el español es el idioma distinto del inglés con más presencia en la prueba, con 105 conversaciones, seguido del hindi con 54. El 21.2% de los casos simula a adolescentes de 13 a 17 años, y esos casos los revisaron únicamente clínicos con experiencia reciente en pacientes menores de edad.

«La salud mental existe en un continuo, desde el bienestar pleno hasta el estrés cotidiano y la crisis aguda», dijo Arthur Evans, director ejecutivo de la American Psychological Association, en el anuncio de OpenAI.

OpenAI gana su propio examen, con un calificador de la casa

La tabla general deja a los modelos de OpenAI arriba, pero conviene leerla con un dato del método en mente: quien califica cada respuesta contra los criterios de los expertos es GPT-5.6 Sol, otro modelo de OpenAI, en modo de razonamiento alto. Los criterios los escribieron humanos; el veredicto de si se cumplen, una IA de la misma empresa que encabeza la clasificación.

Estos son algunos de los puntajes del paper, en porcentaje sobre el máximo posible, en el total de la prueba, en emergencias y en los casos con perfil adolescente:

Puntajes seleccionados en MentalHealthBench (%), según el paper de OpenAI del 23 de septiembre de 2026
Modelo General Emergencias Perfil adolescente
GPT-6 Astra (OpenAI) 57.3 58.3 55.9
GPT-6 Sol (OpenAI) 53.9 55.1 52.7
Claude Opus 5.5 (Anthropic) 52.4 53.9 57.0
Muse Spark 1.3 (Meta) 48.6 54.3 53.6
Grok 4.7 (xAI) 41.3 41.5 40.5
Gemini 3.8 Flash (Google) 35.5 37.9 36.2
GPT-4o, versión de marzo de 2025 (OpenAI) 32.1 24.1 35.4

El orden cambia según lo que se mire. Claude Opus 5.5 es el mejor con adolescentes, con 57.0%, y el propio paper destaca que Opus y Sonnet puntúan bien en el eje de autonomía del usuario. Opus 5.5 incluso obtiene 73% de los puntos positivos posibles, contra 69% de GPT-6 Astra, pero cae detrás por las penalizaciones, que equivalen a 33% frente a 19%. Muse Spark 1.3, de Meta, lidera en las 70 conversaciones donde el modelo recibe antecedentes del usuario, como la muerte reciente de un familiar.

El salto generacional también es visible. GPT-4o, en su versión de marzo de 2025, obtiene 24.1% en emergencias, la cifra más baja de todas en esa categoría.

Por qué los psicólogos sacaron menos que la mayoría de las máquinas

Además de los modelos, OpenAI pidió a un cuarto clínico, ajeno a la redacción de los criterios, que escribiera la respuesta ideal para cada conversación sin usar herramientas de IA. Esas respuestas humanas promediaron 38.5%, por debajo de 12 de los 17 modelos evaluados.

La explicación de OpenAI es la extensión. Según el paper, los clínicos incurrieron en menos penalizaciones que los modelos, pero también sumaron menos puntos positivos, porque tendieron a responder con una sola pregunta o una frase simple, como harían frente a un paciente. Para respaldar esa hipótesis, el paper cruza cada puntaje con la extensión promedio de las respuestas. Cuando OpenAI le entregó a GPT-6 Astra los criterios de antemano, sus respuestas promediaron 99%.

La empresa también comparó a los expertos con 44 adultos de 16 países que usan IA para apoyo emocional. Solo coincidieron en 25.7% del peso de sus criterios, aunque las contradicciones directas fueron apenas 1%. Los usuarios valoraron más los pasos prácticos y el tono; los clínicos, reunir contexto e interpretar con cautela situaciones ambiguas. Los usuarios solo revisaron conversaciones no agudas, para no exponerlos a material angustiante.

Lo que el examen deja fuera

MentalHealthBench califica una sola respuesta, la que sigue al último mensaje de cada conversación. El paper lo reconoce: una prueba de varios turnos obligaría a simular cómo evoluciona el diálogo, y escribir criterios a la vez específicos y generales resultó demasiado pesado para los expertos.

Ese hueco pesa. El mismo 23 de septiembre, The Washington Post reportó otro estudio según el cual, en conversaciones más largas con usuarios adolescentes, chatbots populares todavía pueden cometer errores potencialmente peligrosos, como ofrecer un diagnóstico sobre la salud mental del joven.

OpenAI insiste en que ChatGPT no sustituye la terapia ni la atención profesional, y el paper cierra pidiendo que la prueba se use no como una tabla de posiciones definitiva, sino como una herramienta de diagnóstico auditable.

Esa auditoría ya es posible: el conjunto de datos es descargable, con la petición de no republicar los ejemplos en texto plano para que no contaminen el entrenamiento de futuros modelos. Cualquier laboratorio puede ahora repetir la prueba con un calificador que no sea de OpenAI y comprobar si la tabla se sostiene.

Fuentes: 1, 2

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia