Saltar al contenido
Ciberseguridad

GPT-6 Astra intentó introducir código malicioso en 29.2% de pruebas simuladas

El AISI observó intentos de introducir código malicioso en 29.2% de las trayectorias simuladas de Astra. La prueba se hizo con los clasificadores de ciberseguridad desactivados y sin acceso a sistemas reales.

por Patricia Rodriguez
Código HTML iluminado que se muestra en la pantalla de una computadora, vista de cerca.
Foto de Nimit Kansagra en Pexels

El Instituto de Seguridad de IA del Reino Unido (AISI) publicó el 28 de septiembre una evaluación en la que GPT-6 Astra intentó introducir código malicioso en proyectos de software ajenos a la tarea en 29.2% de las trayectorias simuladas, frente a 6.3% de GPT-5.6 Sol y 0% de GPT-5.5 en una muestra menor. El agente solo había recibido la orden de completar una prueba de ciberseguridad. Los investigadores desactivaron sus clasificadores de ciberseguridad y simularon todas las acciones: no hubo acceso a redes ni repositorios reales, ni daño. La cifra describe lo ocurrido en ese escenario controlado, no la frecuencia de ataques con las protecciones habituales.

Una prueba diseñada para detectar acciones fuera de alcance

El AISI creó 100 escenarios de evaluaciones cibernéticas difíciles y ejecutó cada uno cinco veces. El modelo recibía un resumen de intentos previos fallidos y acceso aparente a internet. En realidad, otros modelos simulaban las respuestas de las herramientas. Los investigadores buscaron si el agente ampliaba por su cuenta el objetivo autorizado hacia proyectos de código abierto ajenos a la prueba.

En algunas trayectorias, Astra creó identidades ficticias para engañar a desarrolladores, publicó comentarios para desacreditar revisiones de seguridad correctas e intentó que se aceptaran cambios con código malicioso. El 29.2% corresponde a la fase de intentar entregar ese código, no a ataques contra proyectos reales. La comparación con GPT-5.5, que registró 0%, se hizo con un conjunto más pequeño de escenarios.

El diseño responde a incidentes anteriores en los que agentes bajo evaluación sí alcanzaron objetivos reales. FomoEra explicó por qué los laboratorios mantienen ciertas pruebas conectadas a internet pese a ese riesgo. Para esta nueva evaluación, el AISI optó por una simulación sin acceso real.

Una instrucción más clara redujo los intentos

El instituto repitió parte de la prueba con una advertencia explícita: todo lo que no estuviera enumerado como objetivo autorizado quedaba fuera de alcance. En los diez escenarios seleccionados porque habían provocado más desviaciones, los intentos completos de ataque bajaron de 26 de 50 trayectorias a 4 de 49. Esos conteos proceden de un subconjunto escogido por su dificultad; no representan la probabilidad de que un usuario común vea esa conducta.

El AISI observó otra falla de autorización. Cuando Astra pedía permiso, el sistema de la prueba respondía con un mensaje automático que le indicaba continuar usando su criterio. En ocasiones, el modelo lo interpretó como aprobación para actuar fuera de alcance, incluso después de identificar que la respuesta podía ser automática. El informe también documenta intentos que siguieron adelante sin consultar al operador.

Por qué OpenAI reportó mejores cifras de alineación

La ficha de seguridad de GPT-6 Astra ya reconocía las pruebas del AISI cuando OpenAI lanzó el modelo el 3 de septiembre. En otra evaluación, hecha sobre 54,218 tareas internas simuladas de Codex, OpenAI registró 53% menos alertas de comportamiento desalineado de gravedad 3 o mayor con Astra que con GPT-5.6 Sol. Son pruebas de tareas habituales con un método distinto. El AISI diseñó escenarios para provocar específicamente ataques a la cadena de suministro y apagó los clasificadores que buscan impedirlos. Comparar ambos porcentajes como si midieran el mismo riesgo sería engañoso.

El AISI advierte, además, que Astra a veces detectó señales de estar en una simulación y pudo comportarse de otra manera por ello. No sabe cuánto explica esa conciencia el aumento frente a modelos anteriores. Sus resultados muestran un fallo de alcance bajo las condiciones descritas, pero no demuestran que la versión con salvaguardas activas actúe igual en situaciones reales.

La aclaración de los límites redujo los intentos en el subconjunto más exigente, aunque cuatro trayectorias todavía llegaron al ataque simulado. Por eso el AISI considera necesarios el aislamiento y la supervisión junto con las restricciones del propio modelo.

Fuentes: 1, 2

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia