TL;DR:
- Mistral publicó Shieldstral 1.0, un clasificador de seguridad que revisa texto e imágenes con políticas escritas en lenguaje natural.
- El modelo obtuvo un F1 promedio de 84.9% en seguridad de texto, el mismo resultado que GPT-OSS-Safeguard de 20B, según las pruebas de sus autores.
- Sus pesos están bajo Apache 2.0 y caben en una GPU NVIDIA de 16 GB, pero el lanzamiento sigue en vista previa pública.
Mistral lanzó el 4 de agosto de 2026 Shieldstral 1.0, un clasificador multimodal de seguridad que permite cambiar los criterios de moderación mediante instrucciones en lenguaje natural, sin volver a entrenar el modelo. La compañía lo presenta como un modelo de 3B con pesos abiertos bajo Apache 2.0, capaz de analizar prompts, respuestas, pares de conversación e imágenes en una sola GPU NVIDIA de 16 GB. Su atractivo para empresas y desarrolladores está en separar la política de seguridad del modelo principal: las reglas pueden cambiar con el producto, la audiencia o el contexto.
Shieldstral es un modelo especializado que calcula si un contenido cumple una política concreta. Mistral lo construyó sobre Ministral-3B-Base-2512 y añadió el codificador visual de Pixtral. Aunque el nombre comercial lo coloca en la clase de 3B, la ficha técnica oficial registra 3.8 mil millones de parámetros activos y una ventana de contexto recomendada de 32,000 tokens.
La petición que recibe se organiza en tres piezas:
<Instruct>fija el contexto de evaluación, el nivel de tolerancia y, si hace falta, la definición de contenido inseguro.<Query>plantea una sola pregunta que pueda contestarse con sí o no, como si el contenido promueve violencia física.<Document>contiene el prompt, la respuesta, el intercambio completo, una imagen o una combinación de imagen y texto.
El modelo lee las probabilidades de los tokens yes y no, las convierte en una puntuación continua y aplica por defecto un umbral de 0.5 para decidir. El operador puede ajustar ese corte a su producto. En este lanzamiento, "multimodal" significa texto e imágenes; Mistral no anuncia clasificación de audio o video.
El empate de 84.9% detrás de la comparación con modelos siete veces mayores
El reporte técnico evaluó Shieldstral en 16 benchmarks, 21 particiones y frente a 10 modelos de referencia. Los autores afirman que todas las muestras de evaluación quedaron fuera del entrenamiento. Estos son los tres resultados agregados que sostienen el anuncio:
- En seguridad de texto alcanzó 84.9% de F1 promedio, un empate con GPT-OSS-Safeguard de 20B.
- En clasificación multimodal llegó a 83.8% de F1, por encima del 77.6% de OmniGuard de 7B, y lideró dos de los tres benchmarks visuales.
- En adaptación a políticas nuevas obtuvo 91.3% de F1. GPT-OSS-Safeguard quedó por delante con 94.1%.
El F1 combina precisión y exhaustividad, también llamada recall, en una sola medida. Sirve para comparar clasificadores cuando importa tanto evitar falsos positivos como detectar contenido dañino, pero no equivale por sí mismo a seguridad garantizada en producción.
Shieldstral tampoco ganó cada prueba. LlavaGuard de 7B obtuvo 81.4% en su benchmark homónimo, frente al 72.0% de Shieldstral. Además, el rival de 20B que empató el promedio de texto superó al modelo de Mistral en la evaluación de políticas nuevas.
La salida de un solo token sí apunta a una inferencia más liviana que la de clasificadores que generan una cadena de razonamiento antes del veredicto. El paper señala esa diferencia, pero no publica una tabla comparativa de latencia, solicitudes por segundo, consumo energético o costo. Con los datos disponibles, no se puede convertir la ventaja de tamaño en una promesa equivalente de ahorro.
Los 54.1 millones de ejemplos hicieron el trabajo pesado
Mistral atribuye buena parte del resultado a una colección de aproximadamente 54.1 millones de muestras con taxonomías y formatos distintos:
- 45.2 millones proceden de conjuntos de texto de fuentes abiertas.
- 4.4 millones son muestras sintéticas de texto creadas por contraste.
- 4.5 millones combinan información visual y textual.
El entrenamiento no se limitó a mostrar ejemplos seguros e inseguros. El equipo tomó una misma pieza de contenido y la enfrentó a preguntas cercanas pero distintas. Una muestra podía violar una regla sobre violencia y, al mismo tiempo, funcionar como caso negativo para otra sobre fraude. Así obligaron al clasificador a atender la regla solicitada, en lugar de aprender una etiqueta general de peligro.
Para comprobar si podía trabajar con políticas desconocidas, los investigadores separaron la taxonomía de entrenamiento, con 73 categorías finales, de otra taxonomía de evaluación con 52. También utilizaron modelos y semillas diferentes para generar y revisar esa prueba. La separación reduce el riesgo de que Shieldstral solo memorizara nombres de categorías, aunque la evaluación adaptativa sigue dependiendo de datos sintéticos producidos y verificados con otros modelos.
Shieldstral rinde bien en español, con límites que importan
El apéndice del paper ofrece un corte por idioma de los benchmarks multilingües PolyGuard y RTP-LX. En español, Shieldstral alcanzó 86.8% de F1 al clasificar prompts y 87.8% al clasificar respuestas. En esta última tarea empató el resultado de GPT-OSS-Safeguard de 20B.
Es una señal favorable para productos dirigidos a usuarios hispanohablantes, pero no certifica el mismo rendimiento ante jerga regional, códigos mezclados, políticas legales específicas o ataques diseñados para una aplicación concreta. Mistral reconoce varias limitaciones en la tarjeta del modelo:
- La confiabilidad cambia entre idiomas y dominios con representación desigual en los datos.
- Los conjuntos públicos y sintéticos conservan sesgos y ruido de etiquetado pese a los filtros aplicados.
- El texto codificado, transliterado u ofuscado puede reducir la precisión.
- Los documentos muy largos también pueden degradar el resultado.
El modelo admite en teoría hasta 256,000 tokens, pero Mistral lo entrenó con secuencias de hasta 32,000 y recomienda mantenerse dentro de ese rango. Shieldstral también figura como vista previa pública. El estudio apareció como preprint en arXiv el 28 de julio. Mistral no acompaña el lanzamiento con una revisión por pares o una reproducción independiente.
Apache 2.0 abre la puerta al despliegue local
Mistral publicó los pesos para uso comercial y no comercial bajo Apache 2.0. Los equipos pueden descargarlos, modificarlos, afinarlos y ejecutar el clasificador en su propia infraestructura. La tarjeta oficial incluye rutas para vLLM, llama.cpp y Transformers; la configuración BF16 cabe, según la empresa, en una sola GPU con 16 GB de memoria.
Ese control local puede resultar valioso cuando los prompts, las respuestas o las imágenes contienen información sensible que una empresa no quiere enviar a un servicio externo. También permite actualizar una regla escribiendo otra pregunta, en vez de preparar un nuevo ciclo de entrenamiento.
El modelo se ocupa de clasificar contenido. La aplicación todavía tiene que decidir qué hace con la puntuación, calibrar sus umbrales, medir falsos positivos y falsos negativos, registrar decisiones y probar ataques propios en cada idioma. Los pesos abiertos facilitan que terceros examinen esas fronteras; por ahora, los porcentajes de 84.9%, 83.8% y 91.3% siguen siendo resultados reportados por el equipo que creó Shieldstral.