Tavus presentó el 1 de octubre de 2026 a Griffin, una IA de conversación por video. La empresa afirma que 26 de 54 participantes, el 48%, creyeron que su versión Griffin-Lite era humana tras una llamada de un minuto. Con ese ensayo propio, asegura haber superado por primera vez la "prueba de Turing por video".
Tavus también lo presenta como el primer Human Interaction Model (HIM), o modelo de interacción humana. Describe un sistema full-duplex: escucha y observa mientras genera voz y video, y puede reaccionar con gestos o dejar de hablar ante una interrupción.
La presentación de Tavus incluye una demostración de conversación con su avatar de IA.
Introducing Griffin, the first model to pass the video Turing test.
— Tavus (@tavus) October 1, 2026
48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video.
It’s the first Human Interaction Model (HIM). pic.twitter.com/eb11XbC8Xr
Los participantes esperaban hablar con otra persona
Para el ensayo, Tavus reclutó participantes mediante una plataforma de investigación independiente. Se les dijo que hablarían con otra persona sobre lo que esperaban de este año. La pregunta sobre si su interlocutor podía ser una IA llegó al final de la encuesta; después se les informó de que habían hablado con un modelo.
La configuración anterior de Tavus, con Phoenix-4.5, Sparrow-2 y Raven-1, obtuvo una identificación como humano entre 41 participantes, el 2.4%, bajo el mismo protocolo. La comparación del anuncio se refiere a ese sistema previo.
Como señala Decrypt, las cifras proceden del ensayo de la empresa. Su alcance queda acotado a una llamada breve sin advertencia previa de que el interlocutor era una IA.
NVIDIA evalúa capacidades distintas
La clasificación pública de NVIDIA confirma que Griffin-Lite lidera las puntuaciones generales de generación y percepción de VideoFDB entre las IA publicadas. Esta evaluación usa clips de videollamadas reales y un modelo de lenguaje como juez.
Generación puntúa la voz y el rostro producidos; percepción evalúa cómo responde el sistema a lo que ve y escucha. Ambas categorías se califican de 0 a 5:
| Categoría | Griffin-Lite | Referencia humana |
|---|---|---|
| Generación | 3.83 | 3.92 |
| Percepción | 3.73 | 4.20 |
La cercanía de la puntuación de generación convive con una latencia superior. En esa categoría, VideoFDB registra una mediana de 1,892 milisegundos para Griffin-Lite, frente a 900 milisegundos para la referencia humana. Calidad y tiempos de respuesta muestran brechas distintas.
Tavus limita Griffin-Lite a evaluadores de confianza porque reconoce el potencial de engaño de ese realismo. Dice que prepara mecanismos para comunicar la identidad artificial del interlocutor y otras medidas de seguridad antes de ofrecerlo a sus clientes.