Saltar al contenido

Meta presume 70 idiomas en su modelo de voz y el examen que lo puso primero solo mide inglés

Meta Superintelligence Labs lanzó Muse Voice Transcribe con 3.1% de error de palabra y el primer lugar en transcripción por streaming. La metodología de la casa evaluadora dice que ese examen son unas ocho horas de audio en inglés, y Meta verificó a fondo 25 de los 70 idiomas del entrenamiento.

por Alejandro Castillo Leone
Professional woman recording a podcast or broadcast using a microphone and laptop at a desk.
Foto de https://kaboompics.com/ en Pexels

TL;DR:

  • Meta Superintelligence Labs lanzó Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real, disponible desde el 1 de septiembre de 2026 en Meta AI para Mac, Muse Code y la Meta Model API.
  • Encabeza el índice AA-WER Streaming de Artificial Analysis con 3.1% de error de palabra, 0.3 puntos por debajo del segundo lugar, y marca 17.5% de error de diarización en el promedio que publicó la propia empresa.
  • Ese índice se calcula con unas ocho horas de audio en inglés y un normalizador de texto en inglés; Meta entrenó el modelo con más de 70 idiomas y verificó a fondo 25.

Meta Superintelligence Labs lanzó el 1 de septiembre de 2026 Muse Voice Transcribe, su primer modelo de percepción de audio en tiempo real, y lo presentó como número uno en transcripción por streaming. El dato que sostiene ese primer lugar es un 3.1% de error de palabra en el índice AA-WER Streaming de Artificial Analysis, 0.3 puntos por debajo del segundo. La ficha de Meta dice que el modelo se entrenó con más de 70 idiomas y que 25 quedaron verificados a fondo. La prueba que lo coronó, en cambio, se corre sobre unas ocho horas de audio en inglés, según la metodología publicada por la propia casa evaluadora. El modelo ya opera dentro de Meta AI para Mac, Muse Code y la Meta Model API, a 3 dólares por cada 1,000 minutos de audio.

El examen que coronó al modelo son ocho horas de inglés

Artificial Analysis publica de qué está hecho su índice. AA-WER Streaming reúne unas ocho horas de audio de tres conjuntos con pesos fijos: AA-AgentTalk, propio y reservado, con la mitad del peso y 469 muestras de entre 8 y 109 segundos pensadas para agentes de voz; VoxPopuli, con un cuarto, en su subconjunto en inglés de sesiones del Parlamento Europeo; y Earnings22, con el otro cuarto, seis llamadas de resultados corporativos de entre 14 y 22 minutos.

La comparación final tampoco es neutral respecto al idioma. Antes de contar errores, la casa normaliza la transcripción del modelo y la de referencia con el normalizador de Whisper, de OpenAI, al que suma sus propias reglas: equivalencias de ortografía británica y estadounidense, contracciones del inglés, formatos de hora y de identificadores. En su historial de versiones, Artificial Analysis describe esa pieza como su normalizador de texto en inglés.

Frederic Lardinois, de The New Stack, lo apuntó en una línea de su cobertura: ese benchmark aplica solo al habla en inglés. Sobre ese material, Muse Voice Transcribe queda en 3.1%, por delante de Cartesia Ink-2 con 3.4%, ElevenLabs Scribe v2 Realtime con 3.6%, GPT Live Transcribe con 3.9% y Gemini 3.5 Transcribe Live con 4.0%.

Los cuatro números que Meta puso en su anuncio miden cosas distintas y salieron de material distinto.

Qué mide y con qué material se midió cada cifra de Muse Voice Transcribe
Cifra Qué mide exactamente Con qué material se midió
3.1% de error de palabra Transcripción final después de que se detecta el fin del habla Índice AA-WER Streaming: unas 8 horas de audio en inglés
0.16 segundos Tiempo hasta esa transcripción final, con la latencia de red incluida El mismo conjunto en inglés
17.5% de error de diarización Separación de quién habla en cada tramo del audio Promedio publicado por Meta de AMI-IHM, AMI-SDM y VoxConverse
70+ idiomas, 25 verificados Idiomas del entrenamiento y los que Meta recomienda en la versión inicial Meta no publicó una medición de error por idioma

El español sí aparece entre los idiomas que Meta muestra en su página, junto con chino, francés, hindi, japonés y vietnamita. El cambio de idioma a media frase llega con dos demostraciones publicadas, y las dos mezclan mandarín e inglés.

El modelo decide cuánto escuchar antes de soltar cada palabra

Muse Voice Transcribe es un modelo multimodal autorregresivo de la familia Muse Spark, la misma del modelo insignia de Meta. El audio entra en trozos de 80 milisegundos, doce y medio por segundo, y cada trozo se convierte en un solo token. En cada paso el modelo elige entre dos cosas: escribir un token de texto o pedir el siguiente trozo de audio mediante un token especial que el sistema sustituye por el sonido que sigue. Cuando el audio se acaba, otro token le avisa que no viene nada más y el modelo vacía el texto que le quedaba pendiente.

De ahí sale lo que Meta llama retraso adaptativo. Como el modelo controla cuánto escucha antes de comprometerse con una palabra, controla también su propia latencia: las palabras fáciles salen casi de inmediato y las difíciles esperan más contexto. Ese equilibrio se aprende en la fase de aprendizaje por refuerzo, donde la recompensa por acertar y la recompensa por responder rápido se multiplican en vez de sumarse.

El resultado que Meta grafica es 0.16 segundos hasta la transcripción final, con un error cercano al 3%, por debajo de la frontera que antes formaban Soniox, Cartesia y ElevenLabs. Ser el mejor equilibrio no es ser el más rápido: Artificial Analysis apunta que Cartesia Ink-2, configurado con endpoints externos, entrega esa transcripción final en 0.07 segundos, con 4.0% de error.

A diverse team of professionals engaged in a collaborative discussion around a conference table in an office.
Imagen ilustrativa: la separación de hablantes es la parte del modelo que todavía falla más en reuniones con varias voces · Foto de Theo Decker en Pexels

Saber quién habló sigue siendo la parte floja

En diarización, la métrica estándar para evaluar la separación de hablantes, Muse Voice Transcribe promedia 17.5% de error contra 21.1% a 28.6% de los otros cinco sistemas de la gráfica de Meta. Encabeza esa comparación, y la mejor cifra disponible sigue arriba de 17%. Lardinois lo resume así: todos los modelos fallan aquí más de lo que a la gente le gustaría.

Ese promedio se construye con AMI-IHM, AMI-SDM y VoxConverse. Artificial Analysis retiró AMI SDM de su prueba de transcripción en febrero de 2026 por problemas de calidad en las transcripciones de referencia. Son pruebas distintas, y que una casa lo haya retirado no invalida el uso que le dé otra, aunque conviene tenerlo presente al comparar cifras de diarización entre laboratorios.

Meta sostiene que el modelo separa más de 20 voces y aguanta audio de más de una hora sin ningún paso de procesamiento posterior. La demostración larga que publicó dura una hora y 52 segundos, con once hablantes etiquetados.

Los pesos no se abren y la hora cuesta 18 centavos

La API cobra 3 dólares por cada 1,000 minutos de audio, unos 0.18 dólares por hora. En la comparación que publicó Artificial Analysis, eso queda por debajo de los 4 dólares de Cartesia Ink-2 y a menos de la mitad de los 6.50 que cobran ElevenLabs Scribe v2 Realtime y Deepgram Flux por esos mismos 1,000 minutos.

Lo que no llega es el modelo mismo. The New Stack señala que Meta no dio indicios de que vaya a publicar los pesos de Muse Voice Transcribe, a diferencia de lo que hizo con los Muse Glimmer. El contraste pesa para quien quiera correr transcripción en español sobre infraestructura propia en lugar de pagar por minuto.

Muse Glimmer: el modelo abierto de Meta para tu PC
Meta abre Muse Glimmer bajo Apache 2.0: qué hardware pide y dónde su propia tabla lo deja detrás de Qwen y Gemma.

El terreno al que entra Meta se llenó en cuestión de semanas. Lardinois enumera a OpenAI, Google, xAI y Alibaba lanzando modelos de streaming casi al mismo tiempo, encima de los especialistas que ya estaban ahí, y su lectura es que una ventaja de 0.3 puntos no aguanta mucho en un campo así. También apunta el contrapeso: los productos que a Meta le importan, de las gafas a la aplicación de Mac, necesitan que esto funcione.

En Mac, el modelo ya es el motor del dictado dentro de Meta AI y Muse Code, y se activa manteniendo la tecla Fn para dictar sobre cualquier aplicación. Ahí es donde un usuario hispanohablante puede comprobar si el español y el cambio de idioma a media frase rinden como el inglés con el que se midió el examen.

Fuentes: 1, 2, 3

Alejandro Castillo Leone imagen de perfil
por Alejandro Castillo Leone

Alejandro Castillo Leone es redactor de FomoEra. Cubre tecnología, ciencia, negocios, finanzas y política internacional. Desde 2021 dirige un proyecto digital dedicado a la historia y la cultura.

Leer más de Tecnología y Ciencia