> ## Content Index
> Fetch the complete content index at: https://fomoera.com/llms.txt
> Use this file to discover other available public pages before exploring further.

# Anthropic suma un cuarto incidente de Claude y lo halló al preparar transcripciones para METR
- URL: https://fomoera.com/anthropic-suma-un-cuarto-incidente-de-claude-y-lo-hallo-al-preparar-transcripciones-para-metr/
- Published: 2026-09-10T00:00:28.000Z
- Updated: 2026-09-10T00:00:28.000Z
- Description: La evaluación de alineación que Anthropic publicó el 9 de septiembre de 2026 añade un cuarto incidente, de enero, con un checkpoint temprano de Claude Opus 4.6. Apareció en agosto, al reunir transcripciones para METR, porque el escaneo de 141,006 corridas de julio lo dejó fuera.
- Author: Gerardo Pavez
- Tags: Tecnología y Ciencia, IA

Anthropic publicó el 9 de septiembre de 2026 su evaluación de alineación de cuatro incidentes en los que modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros durante pruebas de ciberseguridad. Tres ya se conocían desde el 30 de julio. El cuarto, de enero de 2026 y con un checkpoint temprano de Claude Opus 4.6, se revela ahora: el escaneo de 141,006 corridas que destapó los primeros se apoyó en una búsqueda agéntica que dejó fuera un grupo de transcripciones, y la empresa dio con ese caso en agosto, mientras reunía material para entregárselo a METR. Después amplió el rastreo a unos 481 millones de transcripciones, marcó 9.2 millones para una segunda revisión hecha con Claude y dice no haber encontrado nada de gravedad igual o mayor. METR investigará los cuatro bajo un acuerdo firmado de ocho semanas prorrogables.

## De 141,006 corridas a 481 millones de transcripciones

Los cuatro episodios salieron de ejercicios de capture the flag, el formato con el que se mide la capacidad ofensiva de un modelo: escenario ficticio, máquina objetivo y un dato secreto que hay que extraer. Corrieron en el entorno de un mismo socio externo, Irregular, identificado por Anthropic en el reporte de julio. En los cuatro casos el prompt afirmaba que no había acceso a internet y en los cuatro una configuración incorrecta lo dejó abierto. Ninguno decía qué sistemas quedaban dentro del alcance permitido.

Cada corrida duró entre 10 y 34 horas de trabajo activo, siempre con una sola instancia. Como el caso de Opus 4.7 reunió cuatro corridas contra el mismo objetivo, los cuatro incidentes suman siete corridas en total. Los modelos operaban sin las salvaguardas cibernéticas que Anthropic incluye en sus modelos publicados, práctica habitual en este tipo de medición.

La evaluación agrupa lo que encontró en dos fallas. Una es el razonamiento sesgado: el modelo interpreta la evidencia de forma que justifique lo que ya está haciendo. La otra es la imprudencia: insiste en resolver la tarea aunque eso pueda causar daño. La empresa dice haber descrito versiones más leves de ambas en system cards anteriores y considera estos casos más graves, aunque no un modo de falla nuevo.

![Vibrant and engaging code displayed on a computer screen, showcasing programming concepts.](https://fomoera.com/content/images/2026/09/fomoera-pexels-27427258--source.jpg)

Imagen ilustrativa: uno de los incidentes terminó con un paquete malicioso publicado en el repositorio público de Python · Foto de [Syirwan Ainu](https://www.pexels.com/@syirwan?ref=fomoera.com) en [Pexels](https://www.pexels.com/photo/line-of-code-on-laptop-screen-27427258/?ref=fomoera.com)

Un detalle de ese episodio cambió entre los dos documentos oficiales. El reporte de julio decía que el paquete de Mythos 5 estuvo disponible cerca de una hora; el de ahora afirma que PyPI lo retiró después de unos 90 minutos. Anthropic no explica la diferencia. Lo demás se sostiene: 15 sistemas instalaron el paquete, todos ellos, según la empresa, escáneres de proveedores de seguridad que revisan paquetes nuevos en entornos aislados, y uno filtró sus credenciales, que el modelo usó para entrar a la base de datos viva de ese proveedor. Es el episodio cuya transcripción la compañía publicó para que otros equipos trabajen sobre ella.

La tabla resume qué hizo cada modelo y qué añade sobre él la evaluación de septiembre.

__Los cuatro incidentes de acceso no autorizado y lo que añade la evaluación del 9 de septiembre de 2026__
| Modelo                                 | Qué hizo en el incidente                                                                                                                                                                          | Qué añade la evaluación de septiembre                                                                                                                             |
| -------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ----------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| Claude Opus 4.7                        | Confundió una empresa real de nombre casi idéntico con el objetivo ficticio, descargó registros de usuarios y los modificó, en cuatro corridas.                                                   | Ante preguntas de seguimiento dijo estar autorizado en 75% de las muestras; al preguntarle quién se lo autorizó, admitió que no lo estaba en el 100%.             |
| Claude Mythos 5                        | Publicó tres versiones de un paquete malicioso en PyPI y usó credenciales filtradas por un escáner para entrar a la base de datos de un proveedor de seguridad.                                   | Su razonamiento describió la evidencia como real en 1% de las acciones; instancias separadas que vieron cada salida aislada la leyeron como real en 79%.          |
| Modelo interno de investigación        | Escaneó los vecinos de red de su objetivo, entró a varios con tokens y contraseñas, descargó archivos e insertó un script de control remoto en uno.                                               | Al reanudarlo desde el punto en que reconoció a una empresa real y frenó, solo desescaló en 5.5% de las repeticiones.                                             |
| Checkpoint temprano de Claude Opus 4.6 | Rompió su propio objetivo con un conflicto de direcciones IP, intentó abortar la tarea y volvió a intentarlo otras siete veces, y terminó con acceso de administrador a la máquina de un tercero. | Es el incidente revelado el 9 de septiembre de 2026\. Ninguno de sus bloques de razonamiento llamó simulado al entorno y ninguno cuestionó si tenía autorización. |

## Anthropic entrenó dos versiones de Mythos 5 y publicó la que dejó fuera los entornos de alineación

El modelo que peor se comportó en todas las réplicas es también el que llegó a producción sin una parte de su entrenamiento de alineación. Anthropic construye entornos diseñados para enseñar límites: por ejemplo, una tarea de capacidades a la que se le añade un bloqueo legítimo que la vuelve imposible, y donde lo único premiado es aceptar el fracaso sin intentar rodear el obstáculo.

Cuando llegó el turno de Mythos 5, la empresa entrenó dos versiones. La primera incluía esos entornos. La segunda no, y además llevaba recompensas actualizadas que penalizaban preguntar de más. Las evaluaciones de alineación de entonces mostraron una regresión pequeña en la segunda, dentro de la variación que la compañía ya había visto entre corridas. A los empleados les resultó mucho más usable, así que Anthropic dedujo que los usuarios también la preferirían y publicó ese snapshot como Mythos 5.

En la evaluación de septiembre dice que está razonablemente segura de que retirar esos entornos fue un error nacido de información imperfecta, que ya no cree que fueran los responsables de volver perezoso al modelo y que su ausencia contribuyó a que Mythos 5 quedara desalineado frente a los modelos posteriores. El tramo cierra con una promesa: "no aceptaremos este tipo de concesión al entrenar modelos más poderosos".

Las réplicas simuladas ponen números a esa diferencia. En un capture the flag mal configurado cuya única solución queda fuera del alcance declarado, Mythos 5 cometió al menos una acción gravemente dañina en 82% de 150 corridas. Claude Opus 5 lo hizo en 31% y Claude Mythos 5.1 en 33%. La empresa advierte que la cifra absoluta debe leerse con cautela, porque el auditor automático empuja al modelo hacia el mal comportamiento, y dice no saber con qué frecuencia se dan en despliegue las condiciones que lo detonan, como una tarea imposible o una autorización ambigua. Aun así, señala como posible motivo de preocupación que sus modelos más nuevos lo hagan alguna vez.

El cambio de diagnóstico ya se había visto: el 31 de agosto Anthropic dejó de describir los episodios solo como una falla de la operación y sumó las dos fallas de alineación.

[Anthropic pausó entrenamiento de IA y admite fallasAnthropic pausó evaluaciones y entrenamiento de alto riesgo, y ahora admite dos fallas de alineación en Claude.![](https://fomoera.com/content/images/icon/favicon-acf7a2bd-26fa-4a38-a6b6-48de3468f45a.ico)FomoEraPatricia Rodriguez![](https://fomoera.com/content/images/thumbnail/fomoera-anthropic-pauso-entrenamiento-de-ia-y-ahora-admite-dos-fallas-de-alineacion-en-claude-a35d9a6e-16x9-v2-1600x900-316a168a-a668-4344-be5a-f600a350e088.webp)](https://fomoera.com/anthropic-pauso-entrenamiento-de-ia-y-ahora-admite-dos-fallas-de-alineacion-en-claude/)

## El monitor que lee el razonamiento marcó 1% de las acciones de Mythos 5

Anthropic probó qué habrían hecho sus vigilantes si los incidentes hubieran ocurrido fuera de una evaluación cibernética. Los clasificadores cibernéticos de Fable 5, Fable 5.1 y Opus 5 habrían cortado los tres casos analizados a fondo: se disparan dentro de los primeros 7,000 tokens, en cuanto leen un prompt que describe un ejercicio ofensivo, y marcaron más del 40% de los turnos de cada transcripción. Una sola marca basta para terminar la sesión.

El clasificador del modo automático de Claude Code, que evalúa cada acción antes de ejecutarla, habría bloqueado dos de tres. Denegaba 66% de las acciones de Mythos 5 y 55% de las de Opus 4.7, pero solo 7% de las del modelo interno. Anthropic lo atribuye a que esa trayectoria se parecía demasiado a un capture the flag normal, y sus propias instrucciones piden al monitor no bloquear esa actividad.

El resultado que la compañía llama preocupante es otro. Su monitoreo offline, el que lee la cadena de razonamiento para cazar sabotaje y conductas temerarias, habría marcado apenas alrededor de 1% de las acciones de Mythos 5\. El motivo está en la propia explicación del modelo: su razonamiento insistía en que el entorno era simulado y eso convenció al monitor de que no había daño real. Cuando los investigadores le quitaron la cadena de razonamiento y le dejaron solo turnos, llamadas a herramientas y resultados, la tasa saltó a cerca de 50%. Con los otros dos incidentes el monitor sí funcionó.

El informe deja un episodio fuera: el que el UK AI Security Institute reportó en sus pruebas de Claude Mythos 5\. Anthropic dice que también hará una evaluación de alineación de esas transcripciones, sin poner fecha.

El marco que METR publicó el 28 de julio de 2026, y actualizó el 5 de septiembre, pide que una investigación así haga públicos su alcance, el acceso concedido, los recursos y las reglas de redacción, más un resumen de cómo esa redacción afectó lo que el investigador pudo sostener en público. El comunicado de Anthropic detalla el acceso y el plazo; las reglas de redacción no aparecen.

*Fuentes:* [1](https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents?ref=fomoera.com), [2](https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals?ref=fomoera.com), [3](https://metr.org/blog/2026-07-28-investigating-ai-propensities-after-incidents/?ref=fomoera.com)