Google lanzó el 23 de septiembre de 2026 Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos modelos de texto a voz que empiezan a llegar a la API de Gemini y a Google AI Studio. El primero diseña voces desde cero con instrucciones en lenguaje natural, en más de 100 idiomas y dialectos, y puede replicar una voz a partir de una muestra de 30 segundos si su dueño graba su consentimiento. Para el público hispanohablante hay dos lecturas: el español de México figura entre las variantes de un catálogo de más de 2,000 voces, pero la réplica de voz en AI Studio no está disponible en el Espacio Económico Europeo, que incluye a España.
Dos modelos para dos trabajos distintos
Google reparte el trabajo en dos perfiles. Flash TTS apunta a la dirección creativa y al diseño de personajes para videojuegos, audiolibros, podcasts y medios interactivos: cada línea se puede dirigir con acotaciones sobre actuación, ritmo, cambios de dialecto e interjecciones de escucha activa. Flash-Lite TTS está pensado para volumen y costo: doblaje a gran escala, producción de audio y agentes de voz, con control sobre tono, ritmo y matices expresivos.
Los dos comparten las herramientas de puesta en escena. Pueden montar una conversación de dos hablantes desde un solo guion, sostener horas de audio continuo con poca deriva en la voz y aceptar señales no verbales como risas, suspiros o jadeos, además de muletillas del tipo "mhm" o "yeah" para marcar reacciones.
El salto más visible está en el catálogo. Google pasa de 30 voces originales a una biblioteca de más de 2,000 voces listas para producción, con variantes regionales como el español de México, el francés de Quebec y el inglés de Escocia. Las voces creadas se pueden guardar para usarlas en proyectos largos, y la compañía anuncia como "próximamente" una función de remezcla para ajustar timbre, tono, velocidad y acento de voces existentes.

Réplica de voz con consentimiento y marca de agua
La función más delicada es la réplica. Flash TTS puede recrear un perfil vocal con 30 segundos de audio de la propia voz del usuario o de una voz sobre la que tenga derechos. Según Google, antes de crearla el sistema exige una grabación verbal de consentimiento del dueño de la voz y comprueba que coincida con el hablante de la muestra.
Todo clip generado por los modelos de Gemini Audio lleva SynthID, la marca de agua imperceptible de Google DeepMind, pensada para que el habla sintética siga siendo detectable. Las voces replicadas suman credenciales de contenido C2PA.
Hay límites geográficos. Una nota al pie del anuncio aclara que la réplica de voz a través de AI Studio no está disponible en Illinois, Texas, el Espacio Económico Europeo, Reino Unido, Suiza e India. Google no explica el motivo en su publicación. El resto de las funciones no aparece con esa restricción.
Los benchmarks que cita Google y los que mide un tercero
Google presenta a Flash TTS como número uno en el Voice Design Benchmark de Hume AI, con 71.4 puntos, y también primero en modelado de acentos, con 60.8. Afirma que Flash TTS y Flash-Lite TTS ocupan el primer y el segundo lugar del Overall Quality Index de la misma firma, y que en evaluaciones ciegas de preferencia humana de Voice Arena se colocan en posiciones de cabeza en japonés, portugués de Brasil, vietnamita, árabe estándar moderno, hindi y español de México.
Ese dato de Hume AI pide contexto. Uno de los dos firmantes del anuncio es Alan Cowen, hoy director de investigación científica del equipo de Gemini Audio. Cowen era el CEO de Hume AI cuando Google DeepMind lo incorporó en enero de 2026, junto con unos siete ingenieros, mediante un acuerdo de licencia; la startup siguió operando por separado y vendiendo su tecnología a otros laboratorios, según reportó TechCrunch. Nada de eso invalida los resultados, pero son cifras que Google elige y presenta sobre un evaluador con el que tiene una relación directa.
La medición independiente llegó el mismo día. Artificial Analysis publicó en X que Flash TTS debuta en el primer lugar de su Pronunciation Robustness Benchmark y en el segundo de su Provider Voice Arena Leaderboard. La misma firma matizó la velocidad: Flash TTS procesa 44.1 caracteres por segundo y Flash-Lite TTS, 40.2, unas 2.7 y 2.4 veces más rápido que el tiempo real. Ambos quedan por detrás de otros modelos que rastrea, como Falcon 2, con 204.9 caracteres por segundo.
Dónde se puede usar desde hoy
Los dos modelos se despliegan para desarrolladores en la API de Gemini y en Google AI Studio, que estrena un espacio de pruebas de audio con editor de guion para dos hablantes. Flash TTS llega además a Gemini Notebook y Flash-Lite TTS a Google Vids; el acceso empresarial por API en Gemini Enterprise figura como "próximamente". El anuncio no detalla precios de uso para los nuevos modelos.
En el lado de la industria, Google enumera a Agora, LiveKit, Pipecat y Vercel como plataformas que ya permiten construir sobre estos modelos, y a Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang como empresas que los integran para doblaje, localización y agentes de voz. Llegan a un mercado donde ya compiten especialistas como ElevenLabs y Murf AI, y donde Adobe añadió generación de voz a Firefly en agosto, recordó The Next Web.
Para quien produce audio en español, el cambio concreto es doble: más voces con acento regional sin grabar a nadie y una herramienta de clonación con candados de consentimiento. Quien trabaje desde España tendrá que esperar para usar esa segunda parte en AI Studio.