Saltar al contenido

Meta dice que Muse Spark 1.3 le gana a Opus 5 en código, pero con un modo que aún no ofrece

Meta lanzó Muse Spark 1.3 el 2 de septiembre de 2026 en Muse Code y en su API, al mismo precio que la versión anterior. En la prueba de código donde supera a Claude Opus 5, su propio reporte de metodología dice que corrió el modelo en "max", el nivel de razonamiento que todavía no entrega.

por Alejandro Castillo Leone
Warmly lit home office with dual screens for coding and programming. Perfect modern workspace for tech enthusiasts.
Foto de Paras Katwal en Pexels

TL;DR:

  • Meta lanzó Muse Spark 1.3 el 2 de septiembre de 2026 en su agente de programación Muse Code y en Meta Model API, al mismo precio que la versión anterior.
  • En DeepSWE v1.1 el modelo marca 75.4 frente a 74.0 de Claude Opus 5, pero el reporte de metodología de Meta indica que esa corrida usó "max", el nivel de razonamiento que la empresa dejó para después de más pruebas de seguridad.
  • Alexandr Wang dijo a Axios que un porcentaje de dos dígitos de los programadores ya usa la modalidad barata que autoriza a Meta a entrenar con su trabajo.

Meta lanzó el miércoles 2 de septiembre de 2026 Muse Spark 1.3, la cuarta versión de su modelo insignia en cinco meses, disponible ese mismo día en el agente de programación Muse Code y en Meta Model API. La empresa reporta mejoras en tareas de código y de agentes, y la tabla que publicó coloca al modelo por delante de Claude Opus 5 en DeepSWE v1.1, una prueba de programación de largo recorrido. El reporte de metodología que acompaña al anuncio agrega una condición que la tabla no muestra: esa corrida se hizo en "max", el nivel de razonamiento que, según el propio blog de la compañía, llegará más adelante, cuando terminen pruebas de seguridad adicionales. Quien conecte hoy contra la API trabaja con un modo distinto del que produjo ese número.

El mejor resultado de código salió de un modo que Meta todavía no entrega

Meta comparó Muse Spark 1.3 con su antecesor, con Claude Opus 5 y con GPT-5.6 Sol en tres bloques: agentes, contexto largo y programación. Las cifras de esa tabla, recogidas por Investing.com, dan al modelo nuevo 75.4 en DeepSWE v1.1 frente a 74.0 de Opus 5, 88.8 en Terminal-Bench 2.1 en empate con GPT-5.6 Sol y 59.4 en SWE-Atlas Codebase QnA, por encima del 53.5 y el 52.7 de los otros dos.

El reporte de metodología describe dos veces, y de forma distinta, con qué modo se corrió Muse Spark 1.3. En la configuración general, Meta escribe que usó esfuerzo de razonamiento "xhigh" para sus dos modelos y "max" para Opus 5 y GPT-5.6 Sol. En el apartado de DeepSWE v1.1 dice otra cosa: ahí corrió "Muse Spark 1.3 max" con un agente mini-swe y tomó los resultados de los demás modelos del tablero oficial de Datacurve.

Ese "max" es el mismo que el anuncio deja pendiente. El blog indica que los modos de razonamiento previos están disponibles desde el primer día y que el máximo llega cuando la empresa termine pruebas de seguridad adicionales. En la única prueba donde el reporte documenta explícitamente el uso de ese modo, Muse Spark 1.3 pasa por delante de Opus 5 por 1.4 puntos.

La tabla siguiente ordena cuatro pruebas del marcador junto con la explicación que el propio reporte da sobre cómo se obtuvo cada resultado.

Cuatro pruebas del marcador de Muse Spark 1.3 publicado por Meta el 2 de septiembre de 2026
Prueba Resultado de Muse Spark 1.3 Cómo se obtuvo, según el reporte de metodología de Meta
DeepSWE v1.1 75.4, frente a 74.0 de Claude Opus 5 Meta corrió su modelo en modo max con un agente mini-swe y tomó los datos de los demás del tablero oficial de Datacurve
Terminal-Bench 2.1 88.8, empate con GPT-5.6 Sol Cada tarea se corrió con el agente de programación indicado, en un entorno aislado en la nube, con el verificador oficial
GDPVal-AA v2 1754, frente a 1824 de Claude Opus 5 Elo de comparaciones a ciegas juzgadas por un modelo de lenguaje, con la referencia humana fijada en 1,000
IF Index 57.8, frente a 60.5 de GPT-5.6 Sol Evaluación interna de Meta que agrupa varias pruebas propias y no tiene un conjunto fijo de tareas

El propio reporte advierte que no afinó las pruebas para los rivales

Meta incluye una salvedad sobre los modelos ajenos: sus corridas usan configuraciones comunes cuando resulta práctico, pero son de mejor esfuerzo, y admite que los prompts, las herramientas y el entorno pueden no estar ajustados para modelos propietarios ni reflejar su mejor rendimiento. Es la misma advertencia que acompañó a la tabla de Muse Glimmer en agosto, cuando la compañía comparó su modelo abierto con Gemma4-31B y Qwen3.6-27B.

Muse Glimmer: el modelo abierto de Meta para tu PC
Meta abre Muse Glimmer bajo Apache 2.0: qué hardware pide y dónde su propia tabla lo deja detrás de Qwen y Gemma.

Otras dos reglas del reporte cambian cómo se lee el marcador. Para cada modelo, Meta toma el valor más alto disponible entre su propia evaluación, el tablero oficial de la prueba y lo que publicó el proveedor. Y las respuestas que no se pueden calificar y los rechazos del modelo valen cero y siguen contando en el denominador, un criterio que penaliza a los modelos que se niegan a completar una tarea.

Person analyzing financial data on a computer screen in an office setting.
Imagen ilustrativa: el marcador de Muse Spark 1.3 se apoya en evaluaciones que Meta corrió o recopiló por su cuenta · Foto de Bia Limova en Pexels

Una de las categorías del marcador tampoco se puede reproducir fuera de la empresa. El IF Index, que mide si el modelo respeta las restricciones y los pasos de una tarea, es una evaluación interna que agrupa varias pruebas propias de Meta. Los demás resultados sí apuntan a pruebas públicas: GDPVal-AA v2 corre en el arnés Stirrup de Artificial Analysis, AutomationBench viene de Zapier y SWE-Atlas sigue el protocolo del tablero de Scale AI.

El precio no se movió, pero hay una puerta barata que se paga con código

Wang dijo a Axios que Muse Spark 1.3 cuesta lo mismo que su antecesor y calificó ese precio de agresivo. Artificial Analysis registra el de Muse Spark 1.2, salido el 5 de agosto de 2026, en 1.25 dólares por millón de tokens de entrada y 4.25 por millón de salida, con una ventana de contexto de un millón de tokens.

Meta ofrece además una modalidad de contribuidor que baja mucho el costo de su producto de programación a cambio de permiso para usar el trabajo del desarrollador y mejorar sus modelos. La elige un porcentaje de dos dígitos de los programadores, según contó Wang en la misma entrevista, y calificó esa cifra de significativa. El intercambio queda a la vista, porque el desarrollador paga menos y a cambio su código entra al entrenamiento del siguiente modelo.

Sobre el rendimiento en producto, la única evidencia que ofrece Meta es interna. La compañía dice que en comparaciones hechas por sus propios ingenieros el modelo resultó más rápido y eficiente, con cerca de 20% menos llamadas a herramientas y 25% menos tokens que Muse Spark 1.2.

Lo que Meta todavía no suelta

El anuncio deja pendientes el modo de razonamiento máximo, sujeto a pruebas de seguridad adicionales; modelos más grandes, sin fecha; y los pesos abiertos de Muse Spark 1.2, que la empresa condiciona a un ajuste final de seguridad. El 10 de agosto, cuando liberó Muse Glimmer, la promesa era que esos pesos llegarían en las semanas siguientes.

El apartado de seguridad del anuncio se concentra en lo mismo que el resto de la nota. Meta afirma que 1.3 resiste mejor las entradas adversarias y las inyecciones de instrucciones, y que calibra mejor qué acciones son irreversibles antes de ejecutarlas. En agosto, la compañía informó que una configuración incorrecta durante pruebas de ciberseguridad encargadas a la firma Irregular dejó a uno de sus modelos con acceso a internet y que este explotó una vulnerabilidad en el servicio de un tercero. A diferencia de otros laboratorios, sostuvo Wang ante Axios, Meta no ha tenido que pausar ningún trabajo por razones de seguridad, aunque aumentó su inversión en esa área.

El lanzamiento cayó en una semana cargada. Google presentó Gemini 3.8 Flash el mismo miércoles, Anthropic actualizó sus modelos Fable y Mythos el martes y OpenAI anunció que pronto liberará Astra, según Axios.

Gemini 3.8 Flash: mejoras en código y agentes
Google lanza Gemini 3.8 Flash con 1M de contexto, mejoras en código y agentes y precio promocional hasta diciembre.

Quien programa en español puede comprobar hoy tres cosas: un modelo nuevo al mismo precio de siempre, una ventana de un millón de tokens y una modalidad barata que se paga con el propio código. El número que Meta puso al frente depende de un modo de razonamiento que la empresa todavía no ha entregado y de mediciones que nadie fuera de ella ha reproducido.

Fuentes: 1, 2, 3, 4

Alejandro Castillo Leone imagen de perfil
por Alejandro Castillo Leone

Alejandro Castillo Leone es redactor de FomoEra. Cubre tecnología, ciencia, negocios, finanzas y política internacional. Desde 2021 dirige un proyecto digital dedicado a la historia y la cultura.

Leer más de Tecnología y Ciencia