Saltar al contenido
IA

Altman responde sobre ChatGPT y salud mental tras una interrupción de OpenAI

Las evaluaciones de OpenAI comparan respuestas con criterios de especialistas. El documento de MentalHealthBench reconoce que falta ampliar sus pruebas a intercambios completos y varias conversaciones.

por Patricia Rodriguez
Opening Fireside Chat.
Imagen de archivo (2016) · Foto: Alexlcory, CC BY-SA 4.0, vía Wikimedia Commons

Sam Altman respondió sobre ChatGPT y salud mental después de que una publicista de OpenAI pidiera cambiar de tema. Vanity Fair publicó la entrevista el 5 de octubre de 2026.

Según The Verge, la publicista intervino cuando Mark Guiducci preguntaba por una usuaria que murió por suicidio. Drew Pusateri, portavoz de OpenAI, dijo al medio que la entrevista había excedido el horario y que pidieron agendar más tiempo después de que Altman abordara el tema.

El CEO defendió el potencial del chatbot para apoyar la salud mental y rechazó compartir conversaciones privadas con investigadores sin consentimiento.

Las pruebas miden respuestas en conversaciones simuladas

OpenAI presentó el 23 de septiembre MentalHealthBench, una batería abierta de pruebas para evaluar respuestas de IA en situaciones de salud mental. La empresa afirma que la desarrolló con más de 80 psicólogos y psiquiatras con licencia de 22 países. Utiliza conversaciones sintéticas inspiradas en patrones de uso reales.

Las respuestas se comparan con criterios definidos por especialistas, que valoran si el modelo reconoce riesgos, busca contexto y preserva la capacidad de decisión del usuario. La prueba abarca situaciones cotidianas y emergencias; la mezcla de escenarios no representa su frecuencia entre los usuarios de ChatGPT.

En la presentación, OpenAI también aclara que ChatGPT no sustituye la terapia ni la atención profesional.

El documento técnico precisa el alcance de la evaluación: aunque los escenarios incluyen contexto previo, MentalHealthBench puntúa la siguiente respuesta en momentos seleccionados. Sus autores señalan que una evaluación de varios turnos tendría que seguir generando mensajes futuros y evaluar el intercambio resultante.

Por ese diseño, las puntuaciones describen la calidad de una respuesta ante un escenario. No equivalen a una medición de mejorías clínicas en pacientes ni de lo que ocurre durante meses de uso.

El riesgo también puede aparecer entre conversaciones

El 14 de mayo de 2026, OpenAI describió otra línea de trabajo para detectar señales de riesgo que surgen con el tiempo. Su explicación parte de un problema concreto: una petición que parece normal puede cambiar de significado al leerse junto con mensajes anteriores que indican malestar o una posible intención de daño.

Según la empresa, sus resúmenes de seguridad conservan notas breves sobre ese contexto para ayudar al modelo a responder con más cuidado, incluso entre conversaciones separadas. OpenAI dice que tienen un alcance limitado, se guardan por un tiempo acotado y se usan cuando hay una preocupación seria de seguridad.

OpenAI afirma que psiquiatras y psicólogos de su red médica ayudaron a decidir cuándo crear esos resúmenes, cuánto contexto previo considerar y durante cuánto tiempo mantenerlo presente al responder.

En ese comunicado reportó pruebas internas con situaciones de alto riesgo simuladas para medir si el sistema daba la respuesta segura esperada. Son evaluaciones específicas del comportamiento del modelo, distintas de la batería general de MentalHealthBench.

Los autores de MentalHealthBench proponen ampliar la evaluación a intercambios completos, varias conversaciones y otros formatos, como la voz. Ese paso permitiría seguir cómo cambian las respuestas del sistema a medida que avanza una conversación.

Fuentes: 1, 2, 3, 4, 5

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia