Saltar al contenido
IA

Xiaomi libera MiMo-V2.6 y afirma que Pro iguala a Opus 5 y GPT-5.6 Sol

Xiaomi publica MiMo-V2.6 Pro y Flash con pesos MIT, recursos de RL y una tabla que los acerca a modelos cerrados de frontera.

por Patricia Rodriguez
Abstract black and white graphic featuring a multimodal model pattern with various shapes.
Foto de Google DeepMind en Pexels

Xiaomi publicó la familia MiMo-V2.6, formada por los modelos omnimodales Pro y Flash, y liberó sus pesos bajo licencia MIT junto con un informe técnico, el código de aprendizaje por refuerzo y más de 7,000 entornos de tareas. La compañía afirma que MiMo-V2.6-Pro rinde a la par de Claude Opus 5 y GPT-5.6 Sol en la mayoría de los benchmarks de agentes, aunque su propia tabla muestra una ventaja desigual: el modelo se acerca o supera a esos rivales en varias pruebas y queda por detrás en otras. Xiaomi también reportó que entrenar ambos modelos costó alrededor de 3.47 millones de dólares en menos de seis días, mientras transmitía parte del proceso de RL en público.

Dos modelos omnimodales con contexto de un millón de tokens

MiMo-V2.6-Pro es un modelo de mezcla de expertos, o MoE, con 1.02 billones de parámetros totales, es decir, 1.02 millones de millones, de los cuales 42,000 millones se activan por token. MiMo-V2.6-Flash suma 309,000 millones de parámetros y activa 15,000 millones. Flash está planteado como la variante más eficiente, mientras Pro ocupa el lugar insignia de la familia.

Los dos modelos aceptan texto, imágenes, video y audio, y trabajan con una ventana de contexto de un millón de tokens. Las fichas de Hugging Face identifican ambos repositorios con licencia MIT. Xiaomi también publicó el informe técnico, un framework de RL de extremo a extremo, más de 7,000 entornos de tareas y una versión destilada de 9,000 millones de parámetros basada en Qwen.

La apertura tiene un límite práctico. Los pesos pueden descargarse y auditarse, pero el tamaño de Pro eleva mucho las exigencias de memoria y despliegue. Para quienes no quieran operar los modelos, Xiaomi anunció acceso mediante su plataforma API y su cliente de escritorio. El lanzamiento encaja en una carrera donde los modelos de pesos abiertos intentan alcanzar a los sistemas cerrados antes de que estos vuelvan a mover la frontera, una diferencia que ya analizamos en nuestra cobertura sobre el ritmo de convergencia entre modelos abiertos y cerrados.

La comparación con Opus 5 y GPT-5.6 Sol no es una barrida

La afirmación de Xiaomi se refiere a la mayoría de sus pruebas para agentes, no a todos los escenarios. La ficha pública de MiMo-V2.6 compara a Pro y Flash con Claude Opus 5 y GPT-5.6 Sol en programación, automatización, uso de herramientas, terminal, ciberseguridad y tareas visuales.

La siguiente selección muestra por qué la descripción de “a la par” es defendible en algunas evaluaciones, pero no equivale a una victoria general:

Ejemplos de la tabla de benchmarks publicada por Xiaomi
Benchmark MiMo-V2.6-Pro Claude Opus 5 GPT-5.6 Sol
DeepSWE v1.1 71.9 74.0 73.0
AutomationBench v1.0.6 53.1 50.3 45.8
Terminal Bench 2.1 89.9 89.1 88.8
ProgramBench 26.5 37.0 25.0
Terminal Bench 4.0 34.9 49.0 39.9

Pro también queda cerca en OSWorld-Verified, con 82.0 frente a 83.4 de Opus 5 y 83.0 de GPT-5.6 Sol. En cambio, en ExploitBench marca 47.9, por debajo de 70.0 y 78.5. La lectura razonable es que Xiaomi redujo mucho la distancia en tareas agénticas, no que haya eliminado la diferencia con los mejores modelos cerrados.

Como referencia externa, Artificial Analysis le asigna 46 puntos a MiMo-V2.6-Pro en su Intelligence Index, construido con diez evaluaciones independientes. La cifra respalda que está en la parte alta de los modelos de pesos abiertos, pero no sustituye una reproducción independiente de toda la tabla de Xiaomi.

Xiaomi sitúa el entrenamiento de RL en 3.47 millones de dólares

La cifra de entrenamiento corresponde a una ejecución corta y muy intensiva. Xiaomi dice que Pro costó alrededor de 2.62 millones de dólares y Flash unos 850,000 dólares. Sumados, los dos modelos representan aproximadamente 3.47 millones de dólares en menos de seis días. Cada variante completó 30 pasos y, entre ambas, acumularon cerca de 750,000 trayectorias.

El equipo escaló el aprendizaje por refuerzo en tres frentes. Cada actualización usó 1,568 muestras, la ejecución llegó a entre 3,500 y 3,700 millones de tokens por paso y las tareas mezclaron programación, agentes generales, entradas visuales y ciberseguridad. En lugar de limitarse a una recompensa binaria de aprobado o reprobado, Xiaomi construyó evaluadores que comparan las trayectorias exitosas dentro de cada grupo para favorecer soluciones más cortas y eficientes.

La empresa reporta que la tasa promedio de aprobación de las tareas aumentó 25% en términos relativos para Flash y 12% para Pro. En DeepSWE v1.1, Xiaomi dice que Flash pasó de 48.8 a 65.7 y Pro de 58.4 a 72.6. Son resultados de la evaluación de la propia compañía; todavía no constituyen una replicación independiente.

Qué cambia para quienes quieran usarlo

MiMo-V2.6 combina tres elementos que rara vez llegan juntos: pesos descargables, modelos nativos para texto, imagen, video y audio, y una divulgación detallada del entrenamiento por refuerzo. La licencia MIT facilita el uso comercial, la modificación y el ajuste posterior, mientras que el informe y los entornos permiten examinar el método con más profundidad que una simple tabla de resultados.

El costo aparece en el despliegue. Flash reduce la escala activa a 15,000 millones de parámetros, pero sigue siendo un modelo grande; Pro, con 42,000 millones activos y 1.02 billones totales, está orientado a equipos con infraestructura de alto rendimiento. Xiaomi ofrece una ruta hospedada por API, pero quien quiera operar los pesos por su cuenta tendrá que resolver memoria, distribución entre aceleradores y velocidad de inferencia.

MiMo-V2.6 no demuestra que los modelos abiertos ya superen de forma general a los cerrados. Sí muestra que Xiaomi puede publicar pesos, código y recursos de RL mientras coloca a su modelo insignia cerca de la frontera en varias pruebas. La validación decisiva será que terceros repitan esas mediciones y que el rendimiento sobreviva al paso de la tabla de laboratorio a cargas de trabajo reales.

Fuentes: 1, 2, 3, 4

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia