TL;DR:
- Meta lanzó Muse Spark 1.3 el 2 de septiembre de 2026 en su agente de programación Muse Code y en Meta Model API, al mismo precio que la versión anterior.
- En DeepSWE v1.1 el modelo marca 75.4 frente a 74.0 de Claude Opus 5, pero el reporte de metodología de Meta indica que esa corrida usó "max", el nivel de razonamiento que la empresa dejó para después de más pruebas de seguridad.
- Alexandr Wang dijo a Axios que un porcentaje de dos dígitos de los programadores ya usa la modalidad barata que autoriza a Meta a entrenar con su trabajo.
Meta lanzó el miércoles 2 de septiembre de 2026 Muse Spark 1.3, la cuarta versión de su modelo insignia en cinco meses, disponible ese mismo día en el agente de programación Muse Code y en Meta Model API. La empresa reporta mejoras en tareas de código y de agentes, y la tabla que publicó coloca al modelo por delante de Claude Opus 5 en DeepSWE v1.1, una prueba de programación de largo recorrido. El reporte de metodología que acompaña al anuncio agrega una condición que la tabla no muestra: esa corrida se hizo en "max", el nivel de razonamiento que, según el propio blog de la compañía, llegará más adelante, cuando terminen pruebas de seguridad adicionales. Quien conecte hoy contra la API trabaja con un modo distinto del que produjo ese número.
El mejor resultado de código salió de un modo que Meta todavía no entrega
Meta comparó Muse Spark 1.3 con su antecesor, con Claude Opus 5 y con GPT-5.6 Sol en tres bloques: agentes, contexto largo y programación. Las cifras de esa tabla, recogidas por Investing.com, dan al modelo nuevo 75.4 en DeepSWE v1.1 frente a 74.0 de Opus 5, 88.8 en Terminal-Bench 2.1 en empate con GPT-5.6 Sol y 59.4 en SWE-Atlas Codebase QnA, por encima del 53.5 y el 52.7 de los otros dos.
El reporte de metodología describe dos veces, y de forma distinta, con qué modo se corrió Muse Spark 1.3. En la configuración general, Meta escribe que usó esfuerzo de razonamiento "xhigh" para sus dos modelos y "max" para Opus 5 y GPT-5.6 Sol. En el apartado de DeepSWE v1.1 dice otra cosa: ahí corrió "Muse Spark 1.3 max" con un agente mini-swe y tomó los resultados de los demás modelos del tablero oficial de Datacurve.
Ese "max" es el mismo que el anuncio deja pendiente. El blog indica que los modos de razonamiento previos están disponibles desde el primer día y que el máximo llega cuando la empresa termine pruebas de seguridad adicionales. En la única prueba donde el reporte documenta explícitamente el uso de ese modo, Muse Spark 1.3 pasa por delante de Opus 5 por 1.4 puntos.
La tabla siguiente ordena cuatro pruebas del marcador junto con la explicación que el propio reporte da sobre cómo se obtuvo cada resultado.
| Prueba | Resultado de Muse Spark 1.3 | Cómo se obtuvo, según el reporte de metodología de Meta |
|---|---|---|
| DeepSWE v1.1 | 75.4, frente a 74.0 de Claude Opus 5 | Meta corrió su modelo en modo max con un agente mini-swe y tomó los datos de los demás del tablero oficial de Datacurve |
| Terminal-Bench 2.1 | 88.8, empate con GPT-5.6 Sol | Cada tarea se corrió con el agente de programación indicado, en un entorno aislado en la nube, con el verificador oficial |
| GDPVal-AA v2 | 1754, frente a 1824 de Claude Opus 5 | Elo de comparaciones a ciegas juzgadas por un modelo de lenguaje, con la referencia humana fijada en 1,000 |
| IF Index | 57.8, frente a 60.5 de GPT-5.6 Sol | Evaluación interna de Meta que agrupa varias pruebas propias y no tiene un conjunto fijo de tareas |
El propio reporte advierte que no afinó las pruebas para los rivales
Meta incluye una salvedad sobre los modelos ajenos: sus corridas usan configuraciones comunes cuando resulta práctico, pero son de mejor esfuerzo, y admite que los prompts, las herramientas y el entorno pueden no estar ajustados para modelos propietarios ni reflejar su mejor rendimiento. Es la misma advertencia que acompañó a la tabla de Muse Glimmer en agosto, cuando la compañía comparó su modelo abierto con Gemma4-31B y Qwen3.6-27B.

Otras dos reglas del reporte cambian cómo se lee el marcador. Para cada modelo, Meta toma el valor más alto disponible entre su propia evaluación, el tablero oficial de la prueba y lo que publicó el proveedor. Y las respuestas que no se pueden calificar y los rechazos del modelo valen cero y siguen contando en el denominador, un criterio que penaliza a los modelos que se niegan a completar una tarea.

Una de las categorías del marcador tampoco se puede reproducir fuera de la empresa. El IF Index, que mide si el modelo respeta las restricciones y los pasos de una tarea, es una evaluación interna que agrupa varias pruebas propias de Meta. Los demás resultados sí apuntan a pruebas públicas: GDPVal-AA v2 corre en el arnés Stirrup de Artificial Analysis, AutomationBench viene de Zapier y SWE-Atlas sigue el protocolo del tablero de Scale AI.
El precio no se movió, pero hay una puerta barata que se paga con código
Wang dijo a Axios que Muse Spark 1.3 cuesta lo mismo que su antecesor y calificó ese precio de agresivo. Artificial Analysis registra el de Muse Spark 1.2, salido el 5 de agosto de 2026, en 1.25 dólares por millón de tokens de entrada y 4.25 por millón de salida, con una ventana de contexto de un millón de tokens.
Meta ofrece además una modalidad de contribuidor que baja mucho el costo de su producto de programación a cambio de permiso para usar el trabajo del desarrollador y mejorar sus modelos. La elige un porcentaje de dos dígitos de los programadores, según contó Wang en la misma entrevista, y calificó esa cifra de significativa. El intercambio queda a la vista, porque el desarrollador paga menos y a cambio su código entra al entrenamiento del siguiente modelo.
Sobre el rendimiento en producto, la única evidencia que ofrece Meta es interna. La compañía dice que en comparaciones hechas por sus propios ingenieros el modelo resultó más rápido y eficiente, con cerca de 20% menos llamadas a herramientas y 25% menos tokens que Muse Spark 1.2.
Lo que Meta todavía no suelta
El anuncio deja pendientes el modo de razonamiento máximo, sujeto a pruebas de seguridad adicionales; modelos más grandes, sin fecha; y los pesos abiertos de Muse Spark 1.2, que la empresa condiciona a un ajuste final de seguridad. El 10 de agosto, cuando liberó Muse Glimmer, la promesa era que esos pesos llegarían en las semanas siguientes.
El apartado de seguridad del anuncio se concentra en lo mismo que el resto de la nota. Meta afirma que 1.3 resiste mejor las entradas adversarias y las inyecciones de instrucciones, y que calibra mejor qué acciones son irreversibles antes de ejecutarlas. En agosto, la compañía informó que una configuración incorrecta durante pruebas de ciberseguridad encargadas a la firma Irregular dejó a uno de sus modelos con acceso a internet y que este explotó una vulnerabilidad en el servicio de un tercero. A diferencia de otros laboratorios, sostuvo Wang ante Axios, Meta no ha tenido que pausar ningún trabajo por razones de seguridad, aunque aumentó su inversión en esa área.
El lanzamiento cayó en una semana cargada. Google presentó Gemini 3.8 Flash el mismo miércoles, Anthropic actualizó sus modelos Fable y Mythos el martes y OpenAI anunció que pronto liberará Astra, según Axios.

Quien programa en español puede comprobar hoy tres cosas: un modelo nuevo al mismo precio de siempre, una ventana de un millón de tokens y una modalidad barata que se paga con el propio código. El número que Meta puso al frente depende de un modo de razonamiento que la empresa todavía no ha entregado y de mediciones que nadie fuera de ella ha reproducido.