Saltar al contenido
IA

Tavus dice que el 48% de los participantes confundió su IA Griffin con una persona

El ensayo duró un minuto y reunió a 54 personas que esperaban hablar con otro participante. La clasificación de NVIDIA evalúa capacidades distintas.

por Gerardo Pavez
Un hombre participa en una reunión de negocios en línea a través de una computadora portátil en un ambiente cálido y acogedor de una cafetería.
Foto de Jack Sparrow en Pexels

Tavus presentó el 1 de octubre de 2026 a Griffin, una IA de conversación por video. La empresa afirma que 26 de 54 participantes, el 48%, creyeron que su versión Griffin-Lite era humana tras una llamada de un minuto. Con ese ensayo propio, asegura haber superado por primera vez la "prueba de Turing por video".

Tavus también lo presenta como el primer Human Interaction Model (HIM), o modelo de interacción humana. Describe un sistema full-duplex: escucha y observa mientras genera voz y video, y puede reaccionar con gestos o dejar de hablar ante una interrupción.

La presentación de Tavus incluye una demostración de conversación con su avatar de IA.

Los participantes esperaban hablar con otra persona

Para el ensayo, Tavus reclutó participantes mediante una plataforma de investigación independiente. Se les dijo que hablarían con otra persona sobre lo que esperaban de este año. La pregunta sobre si su interlocutor podía ser una IA llegó al final de la encuesta; después se les informó de que habían hablado con un modelo.

La configuración anterior de Tavus, con Phoenix-4.5, Sparrow-2 y Raven-1, obtuvo una identificación como humano entre 41 participantes, el 2.4%, bajo el mismo protocolo. La comparación del anuncio se refiere a ese sistema previo.

Como señala Decrypt, las cifras proceden del ensayo de la empresa. Su alcance queda acotado a una llamada breve sin advertencia previa de que el interlocutor era una IA.

NVIDIA evalúa capacidades distintas

La clasificación pública de NVIDIA confirma que Griffin-Lite lidera las puntuaciones generales de generación y percepción de VideoFDB entre las IA publicadas. Esta evaluación usa clips de videollamadas reales y un modelo de lenguaje como juez.

Generación puntúa la voz y el rostro producidos; percepción evalúa cómo responde el sistema a lo que ve y escucha. Ambas categorías se califican de 0 a 5:

VideoFDB: puntuaciones generales de Griffin-Lite y referencias humanas, de 0 a 5
Categoría Griffin-Lite Referencia humana
Generación 3.83 3.92
Percepción 3.73 4.20

La cercanía de la puntuación de generación convive con una latencia superior. En esa categoría, VideoFDB registra una mediana de 1,892 milisegundos para Griffin-Lite, frente a 900 milisegundos para la referencia humana. Calidad y tiempos de respuesta muestran brechas distintas.

Tavus limita Griffin-Lite a evaluadores de confianza porque reconoce el potencial de engaño de ese realismo. Dice que prepara mecanismos para comunicar la identidad artificial del interlocutor y otras medidas de seguridad antes de ofrecerlo a sus clientes.

Fuentes: 1, 2, 3

Gerardo Pavez imagen de perfil
por Gerardo Pavez

Redactor y creador de contenido especializado en deportes y tecnología. Apasionado por todo lo que ocurre dentro y fuera de la cancha.

Leer más de Tecnología y Ciencia