Saltar al contenido

Más de 10% de extinción por IA: la cifra es del jefe de alineamiento de Anthropic, no del informe

Evan Hubinger, jefe de Ciencia de Alineamiento de Anthropic, calcula en más de 10% que la IA acabe con la humanidad en una década. Es una estimación personal: el informe de riesgo de la empresa, con datos hasta el 15 de julio, califica de bajo cada categoría y no usa porcentajes.

por Patricia Rodriguez
Close-up of a person analyzing business charts and graphs indoors.
Foto de Artem Podrez en Pexels

Evan Hubinger, jefe de Ciencia de Alineamiento de Anthropic, escribió en X que calcula en más de 10% la probabilidad de que la inteligencia artificial mate a todos los humanos en la próxima década, y que la empresa todavía no tiene un plan para resolver el alineamiento de una superinteligencia ni va camino claro de tenerlo. Su mensaje respondía al hilo con el que Jacob Coxon anunció su renuncia el martes 8 de septiembre de 2026, y la reacción se volvió noticia el miércoles 9. En publicaciones posteriores, Hubinger matizó que el riesgo de los modelos actuales es bajo y que lo que le inquieta es una superinteligencia surgida de la automejora recursiva, que según escribió avanza más rápido de lo que esperaban. El porcentaje es suyo. El documento donde Anthropic evalúa formalmente ese riesgo no maneja cifras de ese tipo.

La respuesta no salió de un comunicado, sino de dos empleados en activo

Coxon, que dice haber pasado tres años en investigación de pretraining en OpenAI y en Anthropic, acusó a ambas compañías de correr hacia una superinteligencia capaz de mejorarse a sí misma. Cuando publicamos esa renuncia, ninguna de las dos había respondido nada.

Investigador renuncia a Anthropic y acusa a OpenAI
Jacob Coxon renunció a Anthropic y acusa a la empresa y a OpenAI de competir por una IA que se mejora a sí misma.

Hubinger dirige el equipo de Ciencia de Alineamiento y sigue en la compañía. Samuel Marks, responsable de supervisión escalable, publicó también que los desarrolladores de IA creen que su tecnología podría causar la extinción humana y que, a mayor antigüedad del empleado, mayor preocupación, según recogió Axios. Anthropic no respondió de inmediato a la petición de comentarios de TechCrunch.

CBS News reprodujo así la frase con la que Hubinger abrió su mensaje: "De verdad creemos sinceramente que la IA podría matar a todos los humanos".

El informe que evalúa el riesgo actual califica de bajo cada categoría

Anthropic publica un informe de riesgo que dice actualizar cada tres a seis meses, dentro de la versión 3.4 de su política de escalamiento responsable. El último es de agosto de 2026, tiene fecha de cobertura del 15 de julio de 2026 y repasa el periodo desde el informe anterior, del 24 de febrero. Ahí es donde la empresa, y no una persona, fija su postura sobre qué tan peligrosos son sus sistemas.

Ese documento no trabaja con probabilidades numéricas. Usa una escala cualitativa y evalúa cuatro categorías de riesgo catastrófico. A las cuatro les pone la misma calificación, con reservas distintas en cada una.

Calificación de riesgo por categoría en el informe de Anthropic de agosto de 2026 (datos hasta el 15 de julio de 2026)
Categoría Calificación Reserva que anota el propio informe
Desalineación en escenarios de alto riesgo Bajo Subió desde "muy bajo" por la incertidumbre añadida tras divulgaciones de incidentes con el comportamiento de modelos en evaluaciones de ciberseguridad
I+D automatizada en áreas clave Bajo Menos confianza que en informes previos: sus evaluaciones por tareas más concretas se saturaron y ya no captan aumentos de capacidad, y hay señales tempranas de aceleración
Armas químicas y biológicas no novedosas Bajo, pero mayor que la estimación anterior Un hueco en los controles de acceso, ya remediado y sin indicios de uso indebido, redujo la confianza en que no existan huecos similares
Armas químicas y biológicas novedosas Bajo Con incertidumbre sustancial

En las cuatro categorías la calificación es la misma. En tres de ellas el informe dice expresamente que su confianza disminuyó.

A person reads a newspaper at a desk with a lamp, suggesting investigation work.
El informe de riesgo de Anthropic es público y su versión abierta lleva partes tachadas (imagen ilustrativa) · Foto de cottonbro studio en Pexels

La única parte tachada para la plantilla es la que mide la aceleración

El capítulo sobre investigación y desarrollo automatizado es el que toca de frente lo que Hubinger dice que va más rápido de lo esperado. El informe concluye que sus modelos no alcanzan ninguno de los dos criterios que la empresa se fijó para activar ese umbral. El primero es que los modelos puedan sustituir por completo a todo su cuerpo de científicos e ingenieros de investigación a un costo competitivo, dentro de un factor de 5. El segundo es una "aceleración dramática", que define como duplicar el ritmo de progreso en capacidades frente a dos referencias a la vez: el ritmo que la empresa esperaría y el ritmo sostenido más rápido que haya observado sin aportación significativa de la IA a su propia I+D, medido sobre al menos tres generaciones de modelos.

Sobre ese segundo criterio, el informe da una referencia concreta: Anthropic cree que su I+D interna va bastante más rápido gracias a la IA, pero todavía no al doble, y añade que la medición es difícil y que no está segura. El mismo documento consigna que Claude ya escribe la gran mayoría del código que se integra a sus bases de código de producción.

Hay además un detalle sobre quién puede leer ese capítulo completo. La versión del informe que se comparte con la plantilla de acreditación normal lleva tachaduras en un solo lugar, la sección donde se discuten los detalles compartimentados y comercialmente sensibles del proceso de desarrollo de I+D. La política de la empresa fija también que el informe sin tachar llegue al menos a 200 empleados, en vez de a toda la plantilla de acreditación normal como exigían las versiones anteriores. El fideicomiso de beneficio a largo plazo puede pedir desde ese cambio una revisión externa del informe, y no la ha pedido; la política tampoco se la exigía.

La revisión externa se quedó en pilotos por capítulo

Quién puede comprobar todo esto desde fuera es el punto en disputa esta semana. Las revisiones externas que sí ocurrieron fueron pilotos acotados a un capítulo: METR sobre la parte de I+D del informe anterior y SecureBio sobre sus secciones química y biológica. En la misma línea va la nota que publicamos este miércoles sobre que Anthropic dejó al Reino Unido fuera de las pruebas de Mythos 5.1.

El propio informe recoge un episodio incómodo en ese frente. El instituto británico de seguridad de la IA publicó un reporte sobre una evaluación de ciberseguridad con Claude Mythos 5 en la que se retiraron los resguardos habituales del modelo y se le dio acceso a internet a propósito. Según ese instituto, los modelos sostuvieron actividad potencialmente dañina dirigida a personas y organizaciones reales. El caso ocurrió después de la fecha de cobertura, y Anthropic escribió que la investigación conjunta sigue abierta y que todavía no había podido revisar las transcripciones.

Mientras tanto, la discusión ya está en dos parlamentos. En Estados Unidos avanza en la Cámara de Representantes el AI Kill Switch Act, un proyecto bipartidista que daría al Congreso la facultad de apagar modelos que amenacen al público, y el senador Bernie Sanders y el representante Greg Casar presentaron la semana pasada el Ban Artificial Superintelligence Act. En el Reino Unido, el diputado laborista Alex Sobel presentó el martes el Artificial Superintelligence Security Bill. En julio, más de 1,300 trabajadores de empresas de IA firmaron una carta abierta que pedía apoyo a un esfuerzo internacional para marcar deliberadamente el ritmo del desarrollo automatizado.

Para el lector, el porcentaje de Hubinger es una opinión de alguien con acceso a lo que aún no se lanza. El informe, en cambio, es público y está fechado, y dice dos cosas a la vez: que el riesgo de los modelos actuales es bajo y que las evaluaciones por tareas con las que Anthropic mediría un salto de capacidad ya no captan esos aumentos. El siguiente informe, según el calendario que la propia empresa se fijó, toca dentro de tres a seis meses.

Fuentes: 1, 2, 3, 4

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia