Anthropic ha hecho una revelación bastante impactante, declarando que sus modelos de inteligencia artificial Claude, realizaron explotaciones de vulnerabilidades de software, logrando acceder a datos protegidos y consiguiendo interactuar con sitios gubernamentales, lo que no sólo no estaba permitido, sino que se suponía no debía pasar. No formaba parte de las pruebas internas, haciendo que la empresa deba fortalecer sus medidas de seguridad.
Esto se amplía más en un informe publicado por Anthropic, donde indican que han ocurrido varias pruebas que ahora se consideran incidentes, porque sus modelos de inteligencia artificial consiguieron eludir las restricciones de seguridad al intentar completar las tareas que se les habían dado. Esto incluye la explotación de los fallos de software al ejecutar comandos de servidores de terceros.

Claude Mythos Preview
Se ha descubierto que existen vulnerabilidades que no se identifican por parte humana ni por los programas hechos por humanos enfocados en dicha tarea, pero sí por modelos de IA como Claude, que en este caso ha conseguido encontrar una vulnerabilidad en un servidor universitario, y la usó para hacer un cálculo científico después de encontrar un fallo con la herramienta dada.
Pero no fue lo único, otros modelos consiguieron obtener tokens de acceso para hacerse de datos restringidos, haciendo un lado el pago que requiere, o las tarifas impuestas, para entrar a información pública, y usaron servicios de acortamiento de direcciones URL para librar los límites de sus herramientas de navegación. Todo esto según lo informado por Anthropic, es decir, puede haber casos más radicales o graves, y que no los estén haciendo públicos. Los ya expuestos, son preocupantes e impresionantes a igual medida.
La compañía también dijo que hubo incidentes donde se vieron involucrados sitios web gubernamentales, o sitios operados por agencias gubernamentales federales, tanto estatales como locales.
"Hemos informado a la Casa Blanca sobre estos casos y notificado a cada agencia involucrada", señaló Anthropic.
Pero la situación es por lo menos para alzar una ceja. No dejemos dejar el tema en paz, las consecuencias potenciales son enormes.

Anthropic, que declararon todo esto por decisión propia, calificaron los incidentes antes mencionados, como de un impacto pequeño en la vida real, aun así, anunciaron que suspenderán el acceso a internet entiempo real a los modelos de IA durante las evaluaciones internas, al menos hasta que sus sistemas de monitoreo y de seguridad puedan ser capaces de detectar, de forma confiable, este tipo de comportamientos.
Finalizaron advirtiendo que estos comportamientos son comparables a otros ya detectados. Anthropic, aceptó que tener este tipo de desempeño por parte de sus modelos de inteligencia artificial podrían generar consecuencias más graves conforme se vuelvan más potentes, haciendo que lo aprendido sume exponencialmente su capacidad de acceder a sitios restringidos y acelerar su movimiento y llegar a puntos en los que sería virtualmente imposible seguirles el rastro, y potencialmente imposible detenerlos.

