Google lanzó el 15 de septiembre de 2026 Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz en tiempo real para agentes, y los cobra con la misma tarifa por token. La igualdad termina en la factura. En la medición independiente de Artificial Analysis, Extended Thinking encabeza el índice de voz con 82.6 puntos, 1.1 por encima de la mejor configuración de GPT-Live-1, de OpenAI, pero con el razonamiento en nivel alto costó 3.50 dólares por hora de audio de entrada, contra 0.84 de Gemini 3.8 Live. Esa medición incluye los tokens de razonamiento, que Google cobra como salida y que su tabla de precios no traduce a minutos. Gemini 3.8 Live empieza a llegar a Search Live y Extended Thinking, a Gemini Live.
La tarifa por minuto deja fuera el razonamiento
La página de precios de la API de Gemini agrupa en una sola fila a Gemini 3.8 Live, a Gemini 3.8 Live Extended Thinking y al anterior Gemini 3.1 Flash Live Preview. El audio de entrada cuesta 3 dólares por millón de tokens, unos 0.005 dólares por minuto, y la imagen o el video, 1 dólar por millón (0.002 por minuto).
El precio de salida, que según la propia tabla incluye los tokens de razonamiento, es de 4.50 dólares por millón en texto y de 12 dólares por millón en audio, equivalentes a 0.018 por minuto. Solo el audio, la imagen y el video tienen equivalencia por minuto; el texto y el razonamiento, no.
The Decoder usó esas tarifas para calcular que una hora de conversación cuesta unos 1.38 dólares con Google, contra al menos 3 dólares con GPT-Live-1, y tituló que Google reta a OpenAI a una fracción del costo. Esa cifra coincide con sumar 60 minutos de audio de entrada y 60 de salida a las tarifas redondeadas de la tabla, una cuenta que no puede incluir razonamiento. OpenAI cobra GPT-Live-1 a 0.05 dólares por minuto de sesión, facturados por segundo, y su ficha del modelo aclara que el modelo de fondo y las herramientas se pagan aparte.
Artificial Analysis sí cuenta el razonamiento. Su costo por hora parte de un subconjunto fijo de 40 preguntas de Big Bench Audio, se normaliza con la duración del audio de entrada e incluye audio y texto de entrada y salida, además de los tokens de razonamiento que el proveedor expone por separado; deja fuera los descuentos por caché y las llamadas a herramientas. Con ese método, Gemini 3.8 Live costó 0.84 dólares por hora y Extended Thinking en nivel alto, 3.50. Las dos configuraciones de GPT-Live-1 que midió la firma salieron en 4.47 dólares (Sol, nivel bajo) y 5.83 (Astra, nivel medio).
En esa prueba, el modelo que gana el índice sale entre 22% y 40% más barato que GPT-Live-1, una ventaja menor que el 54% que se desprende de comparar 1.38 contra 3 dólares. Quien use Extended Thinking puede bajar el razonamiento a nivel medio o bajo, según la documentación de Google, pero la tabla de Artificial Analysis solo publica el nivel alto. Gemini 3.8 Live no acepta ese ajuste.
Una ventaja de 1.1 puntos y un modelo básico que tropieza en tareas
La tabla reúne a los cinco modelos mejor colocados en el índice de voz de Artificial Analysis, consultado el 15 de septiembre de 2026, con su resultado en τ-Voice y su costo por hora de audio de entrada; entre paréntesis va la configuración que reporta la firma.
| Modelo | Índice de voz | Tareas de agente (τ-Voice) | Costo por hora de audio de entrada |
|---|---|---|---|
| Gemini 3.8 Live Extended Thinking (nivel alto) | 82.6 | 68.6% | 3.50 dólares |
| GPT-Live-1 (Astra, nivel medio) | 81.5 | 67.9% | 5.83 dólares |
| Grok Voice Think Fast 2.0 (nivel alto) | 81.3 | 56.5% | 4.80 dólares |
| GPT-Live-1 (Sol, nivel bajo) | 80.1 | 59.3% | 4.47 dólares |
| Gemini 3.8 Live | 76.0 | 30.1% | 0.84 dólares |
El liderazgo es estrecho. Extended Thinking supera por 1.1 puntos a GPT-Live-1 en el índice y por 0.7 en τ-Voice. El índice promedia con el mismo peso cuatro resultados: razonamiento hablado, tareas de agente, preferencia humana y tasa de éxito. En τ-Voice, un cliente simulado llama al modelo con un problema de aerolínea, comercio o telecomunicaciones, y el caso solo cuenta si la base de datos queda en el estado correcto. La firma promedia tres intentos cuando los tiene; las dos configuraciones de GPT-Live-1 se midieron con uno. Google presenta ese 68.6% como liderazgo en tareas de agente y añade un 35.1% en la versión bancaria de τ-Voice, de Sierra.
Grok Voice Think Fast 2.0, de SpaceXAI, queda a 1.3 puntos del primer lugar y es el más rápido de los cinco: tarda 0.70 segundos en emitir el primer audio.

El modelo básico cuenta otra historia. Gemini 3.8 Live, la opción que Google recomienda por defecto para la mayoría de los agentes de voz de baja latencia, resuelve 30.1% en τ-Voice, por debajo del 37.7% de su antecesor, Gemini 3.1 Flash Live, en nivel alto.
A cambio, gana donde pesa la conversación. Marca 96.1% en dinámica conversacional (pausas, turnos, interrupciones y asentimientos) contra 91.9% de Extended Thinking, tarda 1.18 segundos en emitir el primer audio contra 1.35, y 93.2% de sus conversaciones en la arena de la firma terminan con la llamada correcta a la herramienta, contra 89.1%. Google asegura que quedó segundo en esa arena, donde personas comparan dos modelos sin saber cuál es cuál.
Qué cambia en Gemini Live, Search y Workspace
Para el público general, los modelos entran por dos puertas. Gemini 3.8 Live empieza a mover Search Live, la búsqueda por voz y cámara de la app de Google, que desde marzo funciona en más de 200 países y territorios donde está disponible AI Mode, según Search Engine Land. Extended Thinking llega a Gemini Live, a Docs Live para suscriptores de Google AI Pro y Ultra, y a Gmail Live y Keep Live para todos los suscriptores de Google AI.
En Workspace, el anuncio no toca el idioma. Cuando esas funciones empezaron a desplegarse, a principios de septiembre, 9to5Google reportó que Gmail Live estaba disponible en inglés y que Keep Live solo funcionaba en Android. El blog del 15 de septiembre no dice si Gmail Live ya funciona en otras lenguas. Para Gemini 3.8 Live, Google sí da una cifra: detecta 97 idiomas y cambia entre ellos a mitad de una conversación.
En empresas, los dos modelos entran en vista previa privada en Gemini Enterprise, y Google promete llevarlos pronto a Gemini Enterprise for Customer Experience; Extended Thinking llegará también a los clientes empresariales de Workspace. Todo el audio que generan los productos de IA de Google lleva la marca de agua SynthID, según la compañía.
Los cambios que obligan a tocar el código
Los dos modelos empezaron a desplegarse el 15 de septiembre en la API de Gemini y en Google AI Studio, con una documentación que matiza el anuncio en un punto. El blog dice que Gemini 3.8 Live ejecuta herramientas y llamadas a API en segundo plano mientras sigue la conversación. La tabla comparativa de la guía de razonamiento de la Live API indica que ese modelo espera a que termine la herramienta antes de hablar, y reserva para Extended Thinking las frases de relleno, como «revisando opciones de vuelo», mientras trabaja.
Extended Thinking también cambia el protocolo. Solo acepta funciones no bloqueantes, y una declaración bloqueante devuelve error. El razonamiento se fija en nivel bajo, medio o alto, y la señal turnComplete ya no indica que el modelo quedó libre, porque puede seguir trabajando en segundo plano; ahora lo marca el campo interaction_status.
Para Gemini 3.8 Live, la guía de migración desde 3.1 Flash Live avisa que el diálogo afectivo, que adaptaba el estilo y el tono de la respuesta a la expresión del usuario, salió de la API, y que el audio proactivo, la función que controla cuándo y en qué contextos responde el modelo, queda siempre activo. El modelo también recibe por defecto los fotogramas de video, por lo que Google recomienda mandarlos solo cuando hagan falta para controlar contexto y costo.
La página general de la Live API, actualizada el mismo 15 de septiembre, todavía presenta el diálogo afectivo entre sus funciones principales y habla de 70 idiomas, no de 97. Plataformas como Agora, LangChain, LiveKit, Pipecat y Vercel ya trabajan con esa API, según Google, que cita a Salesforce, Genspark y Lumeris entre sus socios para los nuevos modelos.
Para quien arma un agente telefónico, la elección entre los dos Gemini ya no pasa por la tarifa, que es la misma, sino por cuántas tareas de varios pasos debe resolver: en la prueba de Artificial Analysis, el básico cuesta 0.84 dólares por hora de audio de entrada y resuelve 30.1% de los casos de atención al cliente; el que razona cuesta 3.50 y resuelve 68.6%.