Saltar al contenido
IA

Microsoft lanza transcripción en vivo y dos nuevos modelos de voz con IA

MAI-Transcribe-2-Streaming procesa audio en 60 idiomas. Las nuevas voces admiten español de México y España; en Azure, los tres modelos están en vista previa pública.

por Patricia Rodriguez
Fila de portátiles con auriculares en un moderno ambiente de oficina listo para la comunicación.
Foto de MART PRODUCTION en Pexels

Microsoft lanzó el 1 de octubre de 2026 MAI-Transcribe-2-Streaming, un modelo que devuelve texto mientras una persona habla, junto con los generadores de voz MAI-Voice-2.1 y MAI-Voice-2.1-Flash. La propuesta busca reducir la espera en asistentes y atención al cliente. En Azure, los tres modelos se ofrecen en vista previa pública.

El transcriptor admite 60 idiomas, incluido el español, y detecta automáticamente el idioma durante la sesión. Según el anuncio de Microsoft, produce sus primeras transcripciones provisionales en poco más de 100 milisegundos después de recibir audio. Las corrige conforme llega más contexto y confirma el texto de cada intervención al terminar.

Con ese texto provisional, una aplicación puede empezar a identificar lo que pide una persona antes de que complete la frase. La ficha del modelo describe usos del texto definitivo, como completar formularios o dirigir una solicitud a un sistema de atención.

Microsoft lo sitúa en el primer puesto de precisión de Artificial Analysis para transcripciones provisionales y finales. La evaluadora utiliza unas ocho horas de audio de tres conjuntos de datos. Su medición de latencia parte del final del habla detectado, un punto distinto de la recepción de audio que menciona Microsoft al describir los primeros resultados.

La versión en vivo cuesta más y tiene otras funciones

La tarifa de lanzamiento de Streaming es de 0.54 dólares por hora de audio hasta el 31 de diciembre de 2026. La versión para grabaciones, MAI-Transcribe-2, que ya cubrimos en septiembre, sigue listada a 0.10 dólares por hora en la comparación oficial. Con esas tarifas, transcribir 100 horas cuesta 54 dólares en vivo o 10 dólares por archivos.

La misma ficha comparativa indica que Streaming no ofrece separación de hablantes, marcas de tiempo por palabra ni ajuste mediante palabras clave. MAI-Transcribe-2 sí incluye esas funciones. El cambio hacia subtítulos en directo supone, por tanto, elegir un conjunto diferente de capacidades.

Dos voces con español de México y España

MAI-Voice-2.1 y Flash convierten texto en audio en 23 idiomas, con variantes de español de México y de España. Microsoft afirma que una misma voz puede conservar su identidad al cambiar de idioma y adaptar su acento a cada lengua.

El modelo estándar está orientado a narraciones, audiolibros y contenido donde importa la expresividad. Cuesta 22 dólares por millón de caracteres. Flash apunta a asistentes y centros de llamadas con muchas solicitudes, y su tarifa es de 15 dólares por millón de caracteres.

Para Flash, la compañía anuncia la generación de 45 segundos de audio con una latencia de 150 milisegundos. Esa cifra corresponde a la generación de voz. El tiempo de respuesta de un asistente también depende de transcribir la solicitud, procesarla y consultar las herramientas que necesite.

Ambas versiones permiten recrear una voz a partir de un breve audio de referencia. Según la documentación de Azure, esa función tiene acceso restringido y requiere voces autorizadas con consentimiento.

Disponibles para desarrollar, aún en prueba en Azure

Microsoft anuncia los tres modelos en Foundry, MAI Playground, Vercel y Azure Voice Live. Las dos voces también llegan a OpenRouter, mientras que la integración con LiveKit figura como próxima. Para mostrar cómo se combinan, la empresa presentó Chatter, una demostración de conversación en MAI Playground.

La documentación permite integrar el transcriptor mediante una API compatible con OpenAI Realtime o con Azure Speech SDK. Son vías de acceso al reconocimiento de voz; las aplicaciones deben aportar la lógica que interpreta la solicitud y prepara la respuesta.

Las páginas técnicas del transcriptor y de las voces mantienen una reserva para las empresas que quieran incorporarlos a un servicio: están en vista previa pública, sin acuerdo de nivel de servicio, y Microsoft no recomienda estas funciones para cargas de producción en Azure.

Fuentes: 1, 2, 3, 4, 5, 6, 7

Patricia Rodriguez imagen de perfil
por Patricia Rodriguez

Patricia Rodriguez es redactora de FomoEra. Cubre tecnología, ciencia, inteligencia artificial, negocios y actualidad digital. También trabaja en escritura y edición de contenido audiovisual.

Leer más de Tecnología y Ciencia