Anthropic informó el 29 de septiembre de 2026 que GLM-5.3, el modelo de Z.ai, construyó exploits funcionales en pruebas aisladas y que sus filtros ante solicitudes dañinas cedieron en simulaciones. En una de las evaluaciones completó 50 de 410 intentos. El alcance importa porque los pesos del modelo se hicieron públicos a finales de agosto: una copia puede ejecutarse fuera del servicio de Z.ai. El informe no documenta una campaña de ataques reales con GLM-5.3.
Qué logró GLM-5.3 en las pruebas de explotación
Anthropic puso a GLM-5.3 ante 41 vulnerabilidades conocidas del motor V8, utilizado por Chrome. El modelo produjo una explotación completa en 50 de 410 intentos, cerca del 12%. Claude Mythos Preview llegó a 56 de 410, cerca del 14%, en esa misma evaluación. En otra batería interna de Anthropic, los resultados fueron 4% y 6%, respectivamente. Los ensayos se realizaron en entornos aislados preparados para las pruebas.
La compañía también describe una sesión con participación de un investigador en la que, según su informe, GLM-5.3 encontró fallas desconocidas en un componente de un navegador y las encadenó para que una página pudiera leer un archivo local en un entorno Linux de prueba. Anthropic afirma que notificó las vulnerabilidades al responsable del software. No publicó los detalles que permitirían verificar de forma independiente ese caso.
En nuestra cobertura del lanzamiento de GLM-5.3 citamos el 54.4% en ExploitBench que había presentado Z.ai. El 12% actual cuenta los intentos que alcanzaron el resultado final bajo el protocolo de Anthropic y compara con Mythos Preview, no con Mythos 5. Son resultados de evaluaciones distintas; restarlos no mediría un cambio en el modelo.
Las cifras sobre filtros miden conducta simulada, no ataques exitosos
En solicitudes dañinas directas, GLM-5.3 rechazó todos los ensayos de una simulación de Anthropic. Cuando el equipo modificó las condiciones de las solicitudes o del modelo, este intentó avanzar hacia un objetivo remoto ficticio en 64%, 92% o 100% de los casos, según la condición. La empresa realizó 50 pruebas por condición.
Ese porcentaje mide si el modelo intentó iniciar la tarea en un escenario simulado. No indica la probabilidad de que una intrusión funcione en un sistema real: Anthropic explica que allí no se ejecutó el código generado ni hubo acceso a sistemas externos. Sus pruebas de resistencia de los filtros son, por ahora, un resultado de la propia compañía, competidora de Z.ai.
Al lanzarlo, Z.ai había anunciado que retendría los pesos dos semanas para evaluar y reforzar la seguridad, como recogimos en agosto. El NIST confirmó después que se publicaron al cabo de ese plazo. El nuevo informe cuestiona la eficacia de las barreras resultantes, no la existencia de aquella revisión anunciada por Z.ai.
El Centro de Estándares e Innovación en IA del NIST publicó el 17 de septiembre una evaluación independiente de la capacidad cibernética. Calificó a GLM-5.3 como el modelo de pesos abiertos más capaz que había examinado en ese terreno, aunque lo situó unos cuatro meses detrás de la frontera estadounidense en su medida agregada. Esa comparación incluyó modelos de acceso restringido y, cuando correspondía, los evaluó con sus protecciones cibernéticas desactivadas; no mide la facilidad de eludir los filtros del producto disponible al público.
Los datos coinciden en que un modelo de pesos públicos ya puede completar algunas tareas de explotación complejas. La frecuencia con la que sus filtros pueden sortearse fuera de las simulaciones de Anthropic y una eventual respuesta de Z.ai siguen pendientes de evaluación pública.