Tavus Griffin AI engañó al 48% de los participantes, pero su prueba de Turing en video necesita contexto
Tavus presentó Griffin después de que el 48% de los participantes de un breve estudio en vivo confundiera el avatar Tavus Griffin AI con una persona real. La empresa describe a Griffin como el primer Human Interaction Model y el primer sistema en superar una prueba de Turing en video en tiempo real.
El resultado parece una victoria contundente para la IA con comportamiento humano. Se entiende mejor como evidencia de que los agentes de video en tiempo real han superado un umbral de interacción relevante bajo una prueba limitada. Tavus diseñó, realizó y comunicó el estudio, que incluyó a 54 participantes que interactuaron con Griffin-Lite en conversaciones de un minuto.
El resultado más comparable de forma independiente procede del Video Full-Duplex Benchmark de NVIDIA. Griffin-Lite lidera los sistemas evaluados en ese benchmark tanto en percepción como en generación, por delante de los modelos de Gemini y OpenAI en varias métricas conversacionales. En conjunto, las dos evaluaciones sugieren que Tavus ha mejorado el comportamiento de un avatar durante una conversación, aunque no demuestran que pueda pasar sistemáticamente por humano.
Lo que Tavus Griffin AI incorpora realmente
Griffin transforma la unidad del video con IA: de una respuesta generada a una interacción gestionada de forma continua.
Tavus anunció Griffin en San Francisco el 1 de octubre de 2026. La versión inicial Griffin-Lite es una vista previa de investigación disponible solo para evaluadores seleccionados, no un producto para clientes de disponibilidad general.
La empresa describe un Human Interaction Model como un sistema diseñado para comprender y generar interacciones cara a cara en tiempo real. Procesa el habla, el comportamiento visual, el ritmo y las señales no verbales mientras produce su propia voz y video.
Esa descripción diferencia a Griffin de muchos sistemas de avatar actuales. Un sistema convencional suele transcribir el habla, enviar el texto a un modelo de lenguaje, generar una respuesta, convertirla en audio y animar un rostro. Cada componente empieza su trabajo después de que otro haya completado suficiente parte del paso anterior.
Griffin sigue conteniendo motores técnicos diferenciados, pero Tavus afirma que operan de forma simultánea. Su componente conversacional procesa continuamente el audio y el video entrantes. Un segundo componente convierte sus decisiones en habla sincronizada, comportamiento facial, mirada y gestos.
La investigación sobre Griffin de la empresa afirma que el modelo reevalúa un intercambio a intervalos inferiores a un segundo. En cada intervalo, puede seguir escuchando, reconocer al interlocutor, interrumpir, esperar o ceder el turno de palabra.
Esto importa porque una conversación no es simplemente un intercambio de frases completas. Las personas asienten antes de que quien habla termine, hacen pausas sin renunciar a su turno, apartan la mirada mientras piensan y cambian de dirección al notar la reacción de otra persona.
Los agentes basados en turnos suelen gestionar mal esas señales. Interrumpen una pausa reflexiva, permanecen inexpresivos ante una declaración emocional o siguen hablando cuando el usuario intenta intervenir.
Griffin busca convertir esos momentos en parte del proceso central de decisión del modelo. Tavus afirma que un cambio realizado durante una frase puede afectar la voz y el rostro del avatar dentro del mismo segmento conversacional.
Según Tavus, el sistema de generación también produce toda la escena visible a partir de una imagen de referencia. Esto incluye el rostro, el cuerpo, el fondo, las sombras y los objetos cercanos, en lugar de limitarse a animar una boca o una malla facial.
Las demostraciones publicadas por la empresa muestran a un avatar reaccionando a un ascenso, jugando a Simon Says, siguiendo un cubo de Rubik y ayudando a alguien a soldar una placa base. Estos ejemplos siguen siendo demostraciones seleccionadas por la empresa, pero aclaran el uso previsto del contexto visual.
La vista previa de Griffin-Lite también puede clonar una voz a partir de aproximadamente diez segundos de audio de referencia, según Tavus. Su decodificador de audio causal produce paquetes de apenas 10 milisegundos mientras las partes posteriores de la respuesta aún se están generando.
Estos detalles no establecen una equivalencia humana. Explican por qué Griffin puede parecer más atento que un avatar ensamblado a partir de componentes secuenciales más lentos.
Por tanto, el acontecimiento inmediato es más amplio que un nuevo rostro sintético. Tavus plantea el ritmo de interacción, la percepción visual y la generación expresiva como un único problema a nivel de modelo.
Por qué el video full-duplex pone bajo presión a los agentes basados en turnos
La presión competitiva proviene de que Griffin trata la escucha y la respuesta como actividades simultáneas, en lugar de turnos separados.
La comunicación full-duplex significa que ambas partes pueden enviar y recibir información al mismo tiempo. En una conversación con IA, el sistema sigue escuchando y observando mientras habla, y luego se ajusta sin esperar a un turno nuevo completo.
Una arquitectura en cascada gestiona la experiencia de otra manera. El reconocimiento de voz convierte las palabras del usuario en texto, un modelo de lenguaje crea una respuesta y sistemas separados sintetizan el audio y el movimiento del avatar.
Ese enfoque modular ofrece ventajas prácticas. Los desarrolladores pueden sustituir componentes individuales, inspeccionar transcripciones y seleccionar modelos especializados. También crea transferencias en las que pueden perderse el ritmo, el tono vocal, la mirada y otros elementos de contexto.
La propuesta central de Griffin es que un agente de video convincente no puede recuperar esas señales después de reducir la interacción a texto. Debe modelar continuamente qué dice el usuario, cómo lo dice y qué muestra la cámara.
Pensemos en un cliente que sostiene un componente dañado ante una cámara. Un agente centrado en texto debe depender de que el usuario identifique el objeto o proporcione una descripción verbal útil. Un agente visual puede inspeccionar la pieza y responder a lo que aparece en pantalla.
El desafío conversacional es más sutil. Si el cliente hace una pausa mientras recoloca el componente, el agente no debería asumir que la pregunta ha terminado. Si el cliente empieza a hablar de nuevo, el agente debería detenerse o ceder el turno sin perder el contexto.
El mismo principio se aplica a la tutoría. La expresión de un estudiante o una vacilación prolongada pueden indicar confusión antes de que la exprese directamente. Un agente que detecte esas señales puede cambiar su explicación o esperar a que el estudiante termine de pensar.
La simulación de roles y los ensayos ofrecen otro uso plausible. Un usuario que practica una entrevista o una conversación difícil en el trabajo necesita un interlocutor que reaccione en el momento adecuado, no un avatar que simplemente recite respuestas elaboradas.
Estos escenarios explican por qué Google, OpenAI, Tavus e investigadores de código abierto trabajan en interacción multimodal en tiempo real. La próxima competencia por las interfaces no se limita a qué modelo produce la mejor respuesta aislada.
También se trata de si un agente puede ocupar tiempo conversacional sin obligar al usuario a gestionarlo. Los silencios prolongados, las interrupciones accidentales, las expresiones congeladas y las reacciones visuales tardías revelan el sistema subyacente.
Tavus no ha demostrado que su enfoque vaya a sustituir las arquitecturas modulares. Los sistemas de producción deben equilibrar el comportamiento natural con el coste, la fiabilidad, el control, la seguridad y la capacidad de auditar los componentes individuales.
Un bucle de comportamiento unificado también puede dificultar el aislamiento de errores. Una interrupción inapropiada podría originarse en la percepción, la gestión de turnos, la generación de lenguaje o el control expresivo. Los desarrolladores necesitan herramientas que revelen qué decisión falló.
Aun así, el lanzamiento de Griffin eleva el estándar para los competidores. Una voz receptiva acompañada de un rostro convincente ya no basta si el rostro no escucha mientras habla.
Tavus Griffin frente a Gemini en el benchmark de video de NVIDIA
El benchmark de NVIDIA respalda la ventaja de interacción de Griffin, pero no valida la afirmación independiente de Tavus de que el modelo pasó por humano.
El Video Full-Duplex Benchmark de NVIDIA, o VideoFDB, evalúa cómo los agentes conversacionales perciben y producen comportamientos audiovisuales continuos. Utiliza 237 clips anotados por expertos de videollamadas naturales entre dos personas.
Los clips cubren 11 dinámicas conversacionales, entre ellas la toma de turnos, la risa, los cambios de mirada, las pausas, las expresiones emocionales, las interrupciones y las confirmaciones no verbales. El benchmark separa la percepción de la generación.
Su pista de percepción pregunta si un modelo interpreta lo que está ocurriendo. La pista de generación evalúa si el agente produce habla y comportamiento no verbal apropiados en el momento adecuado.
En la clasificación publicada de VideoFDB, Griffin-Lite registra una puntuación global de percepción de 3.73. Gemini 2.5 Flash Native obtiene 3.17, mientras que Gemini 3.1 Flash Live obtiene 2.84.
gpt-realtime y gpt-realtime-mini de OpenAI aparecen por debajo de esos resultados, con puntuaciones globales de percepción de 2.75 y 2.73. El modelo de código abierto MiniCPM-o 4.5 obtiene 3.40.
Griffin-Lite también obtiene 3.92 en anclaje visual, frente a 3.37 de Gemini 2.5 Flash Native. Su resultado de ritmo medido es del 73.8% a 2,232 milisegundos.
Estas cifras requieren una lectura cuidadosa. MiniCPM-o 4.5 registra un resultado de ritmo más rápido, de 720 milisegundos, mientras que VITA-1.5 alcanza 400 milisegundos. Por tanto, la ventaja de Griffin no significa que tenga la menor latencia medida.
La pista de generación establece una distinción más fuerte entre Griffin y los sistemas de avatar en cascada. Griffin-Lite logra una puntuación global de 3.83, cerca de la puntuación de referencia humana de 3.92.
Una cascada de Gemini 2.5 y Anam obtiene 2.80. Una combinación de Gemini 2.5 y Keyframe obtiene 2.39. Griffin también recibe puntuaciones más altas en fluidez, correspondencia emocional y selección de señales no verbales adecuadas.
Esto respalda el argumento de Tavus sobre el mecanismo. Un sistema diseñado para coordinar continuamente la voz y el comportamiento obtiene mejores resultados en este benchmark que los procesos evaluados que conectan un avatar a otro modelo.
Sin embargo, VideoFDB no pregunta a los evaluadores si creen que el agente es humano. Evalúa comportamientos conversacionales seleccionados mediante rúbricas definidas.
El proceso de puntuación también tiene limitaciones. NVIDIA afirma que tres ejes de rúbrica de cada categoría reciben puntuaciones de un juez basado en un modelo de lenguaje. El acuerdo entre jueces se sitúa dentro de un punto entre el 77% y el 89% de las veces.
NVIDIA puntúa los resultados de los modelos enviados antes de añadir sistemas a la clasificación. Esto es más independiente que una empresa calificando su propia entrega, pero no equivale a pruebas sin restricciones realizadas por múltiples laboratorios externos.
El benchmark incluye una referencia humana y varios competidores reconocibles, lo que lo hace útil para la comparación. Su alcance sigue siendo más limitado que el despliegue en distintos idiomas, acentos, condiciones de iluminación, situaciones emocionales y conversaciones prolongadas.
La conclusión justa es específica. Griffin-Lite rinde actualmente bien en un benchmark diseñado en torno a la conversación audiovisual full-duplex. Esto refuerza la afirmación de Tavus de que su arquitectura mejora la calidad de interacción.
No establece que Griffin sea, en general, indistinguible de una persona. El estudio de participantes de Tavus es la evidencia ofrecida para esa afirmación independiente.
Lo que la prueba de Turing en video del 48% no demuestra
El resultado del 48% mide la plausibilidad de una primera impresión en una llamada controlada de un minuto, no una equivalencia humana duradera.
Tavus reclutó participantes a través de una plataforma de investigación independiente. Se les dijo que hablarían durante un minuto con otro participante sobre aquello que esperaban con ilusión ese año.
En realidad, su interlocutor era un avatar Griffin-Lite que generaba su rostro, voz y respuestas en tiempo real. Tavus preguntó por la identidad del interlocutor solo después de otras preguntas de la encuesta.
De los 54 participantes, 26 dijeron creer que su interlocutor era una persona real. Eso produce la cifra del 48% ampliamente difundida.
La comparación con el sistema anterior de Tavus es considerable. Según el mismo protocolo reportado, uno de los 41 participantes confundió el conjunto Phoenix-4.5, Sparrow-2 y Raven-1 con una persona, una tasa del 2,4 %.
Los participantes que eligieron «real» declararon una confianza media del 79 %. Quienes seleccionaron IA indicaron un 81 % de confianza. Las personas que empezaron a sospechar por lo general lo hicieron durante los primeros 20 segundos.
Griffin-Lite obtuvo una puntuación media de naturalidad de 5,4 en una escala de siete puntos. Los participantes le otorgaron un 5,6 en fiabilidad y un 5,8 respecto a si disfrutarían de otra conversación.
La medida reportada más débil fue el flujo conversacional, con una media de 4,9. Ese resultado importa porque la sincronización natural es la promesa central del modelo.
Estos datos indican una mejora importante respecto al conjunto anterior de Tavus. No resuelven si el sistema «superó» una prueba de Turing por video estándar, porque no existe un protocolo universalmente aceptado que defina dicha prueba.
El juego de imitación original de Alan Turing se centraba en intercambios basados en texto. No creó una prueba de video estandarizada de un minuto ni definió un umbral del 48 % para los avatares modernos.
Por tanto, el término «prueba de Turing por video» es la forma en que Tavus enmarca su experimento. No es una certificación emitida por un organismo independiente de normalización.
Varias cuestiones metodológicas siguen sin respuesta en la descripción publicada. Tavus no proporciona suficiente información para determinar cuán representativos eran los participantes ni cómo variaban los resultados entre grupos demográficos.
Una conversación de un minuto también ofrece poco tiempo para evaluar memoria, consistencia factual, interrupciones difíciles, entradas visuales inusuales o cambios en el contexto emocional. Las llamadas más largas crean más oportunidades para que aparezcan artefactos y contradicciones de comportamiento.
El tema elegido era socialmente sencillo y predecible. Preguntar qué espera alguien durante el año invita a respuestas breves y positivas. Un debate, una tarea colaborativa, un diagnóstico técnico o una conversación personal delicada plantearían exigencias distintas.
No se informó a los participantes de que estaban probando una IA. Eso ayuda a medir la percepción espontánea, pero no muestra cómo evaluarían las mismas personas al avatar si buscaran activamente señales sintéticas.
El estudio también utilizó una única presentación controlada por Tavus. Rostros, voces, condiciones de red, dispositivos, idiomas y entornos diferentes podrían alterar el resultado.
Lo más importante es que el estudio fue diseñado y reportado por la empresa cuyo producto evalúa. El reclutamiento mediante una plataforma independiente no convierte el experimento global en una validación independiente.
Eso no hace que el resultado carezca de sentido. La investigación de proveedores suele aportar las primeras evidencias sobre un sistema nuevo. Significa que la conclusión debe mantenerse proporcional al protocolo.
La afirmación respaldada es que Griffin-Lite convenció a 26 personas durante una interacción específica de un minuto. El salto no respaldado es que Griffin pueda hacerse pasar de forma fiable por un humano en llamadas de video cotidianas.
También existe un límite conceptual más profundo. Parecer humano no mide conciencia, veracidad, criterio ni inteligencia general. Mide si un observador identifica el sistema como artificial bajo condiciones definidas.
Griffin podría ser excelente al sincronizar un asentimiento y aun así proporcionar una respuesta falsa. Podría detectar confusión sin comprender las consecuencias de su orientación. Una presentación similar a la humana puede aumentar la competencia percibida sin aumentar la competencia real.
Para los compradores empresariales, esa distinción es esencial. La evaluación debe separar la naturalidad conversacional de la precisión de las tareas, el cumplimiento de políticas, el manejo de datos y la derivación segura a una persona.
El modelo de interacción humana crea un problema de divulgación
La capacidad más persuasiva de Griffin también es su riesgo más evidente: los usuarios pueden confiar en un interlocutor artificial porque se comporta como una persona.
Tavus reconoce este conflicto directamente. La empresa afirma que las mismas propiedades que permiten una comunicación natural pueden engañar a alguien y hacerle creer que el agente no es una IA.
Esa preocupación explica el lanzamiento limitado. Griffin-Lite está disponible para determinados probadores de investigación, pero Tavus afirma que los clientes todavía no pueden implementarlo mediante la plataforma de la empresa.
Tavus afirma que está desarrollando funciones de divulgación y procedimientos de seguridad adicionales antes de un lanzamiento más amplio. El anuncio no especifica el diseño final de la divulgación, los criterios de lanzamiento ni el mecanismo de aplicación.
La divulgación debe seguir siendo efectiva durante toda la interacción. Un aviso mostrado antes de una llamada puede no ayudar a alguien que se incorpora tarde, recibe una grabación recortada o ve el avatar a través de otro servicio.
El etiquetado visual persistente puede ofrecer un aviso más sólido, pero podría recortarse o eliminarse. La divulgación verbal puede olvidarse durante una conversación larga. Los metadatos pueden ayudar a las plataformas a identificar medios sintéticos, pero no protegen a los usuarios en sistemas no compatibles.
El riesgo va más allá de la suplantación directa. Un agente similar a un humano puede generar una confianza emocional excesiva sin copiar a una persona concreta.
Un avatar educativo podría parecer paciente y atento. Un agente de ventas podría reflejar la vacilación. Un agente de soporte podría mostrar simpatía. Esos comportamientos pueden hacer que los usuarios infieran comprensión, discreción o autoridad que el sistema no posee.
La clonación de voz añade otra capa. Tavus afirma que Griffin-Lite puede reproducir una voz a partir de unos diez segundos de audio. Por lo tanto, los controles de consentimiento e identidad importan tanto como la calidad de renderizado.
La suplantación ya es una categoría importante de fraude. La Comisión Federal de Comercio de Estados Unidos informó de que los consumidores perdieron casi 3.000 millones de dólares por estafas de suplantación durante 2024.
Esa cifra cubre un conjunto más amplio de estafas y no mide las pérdidas causadas por Griffin o agentes de video comparables. Establece el entorno en el que llegarán interlocutores sintéticos cada vez más convincentes.
Las empresas que evalúan modelos de interacción humana necesitan controles en varios niveles. Necesitan autorización verificada para rostros y voces, divulgación persistente, casos de uso restringidos, registros auditables de las interacciones y vías claras de derivación.
Los contextos de alto riesgo exigen más cautela. La atención sanitaria, los servicios financieros, el empleo, la educación y el apoyo jurídico implican decisiones en las que la empatía percibida puede influir en la divulgación o el consentimiento.
Un usuario podría compartir información sensible porque un avatar parece atento. La expresión del sistema no garantiza que su consejo sea preciso ni que sus prácticas de datos coincidan con las expectativas del usuario.
Los desarrolladores también deben probar fallos de comportamiento. Un avatar que sonríe ante el sufrimiento, imita la ira o interrumpe una divulgación puede causar daño incluso si sus palabras cumplen los requisitos de las políticas.
Griffin hace urgentes estas cuestiones porque el comportamiento no verbal ya no es una salida decorativa. Tavus lo sitúa dentro del bucle de decisión conversacional del modelo.
Por tanto, la tensión competitiva central no enfrenta a Tavus con una sola empresa de avatares. Enfrenta la interacción continua similar a la humana con los límites de la divulgación y la confianza.
Si Tavus puede preservar una identidad claramente mecánica mientras ofrece una conversación natural, la arquitectura de Griffin podría mejorar las interfaces prácticas. Si la naturalidad depende de la ambigüedad sobre la identidad, la adopción encontrará resistencia por parte de usuarios, reguladores y equipos de riesgo empresarial.
Qué observar tras la vista previa de Tavus Griffin
Tres señales determinarán si Griffin se convierte en un avance duradero de plataforma o sigue siendo una impresionante vista previa controlada.
La primera señal es la replicación independiente del estudio con participantes. Los investigadores deberían repetir el protocolo con muestras más grandes, múltiples avatares, temas variados y llamadas más largas.
La replicación también debería comparar participantes informados y no informados. Eso revelaría si Griffin sigue siendo convincente cuando los usuarios evalúan activamente el comportamiento sintético.
Una prueba más larga expondría problemas de consistencia que las conversaciones de un minuto no pueden captar. También mostraría si los usuarios se vuelven más o menos suspicaces a medida que la interacción acumula contexto.
Si equipos independientes obtienen resultados cercanos a la cifra del 48 % de Tavus, la afirmación de la empresa sobre la prueba de Turing por video ganará credibilidad. Un descenso pronunciado demostraría que el resultado del lanzamiento dependía en gran medida de su protocolo seleccionado.
La segunda señal es una participación más amplia en VideoFDB. Griffin lidera actualmente los resultados publicados de percepción y generación, pero las clasificaciones cambian a medida que entran sistemas más potentes.
Las presentaciones directas de más proveedores comerciales de avatares mejorarían la comparación. Los modelos actualizados de Google, OpenAI y equipos de código abierto también podrían reducir la ventaja de Griffin.
Los resultados más informativos separarán la comprensión visual de la presentación fluida. Un sistema no debería recibir un reconocimiento amplio por parecer receptivo si ignora el flujo visual o gestiona mal la conversación.
La tercera señal es el paquete de lanzamiento de Tavus. La empresa debe definir disponibilidad, latencia en condiciones de red normales, controles para desarrolladores, funciones de divulgación y restricciones sobre la reproducción de voz e identidad.
La evidencia de producción debería incluir el rendimiento durante sesiones más largas y en entornos variados. Los compradores también necesitarán métodos para revisar las decisiones tomadas dentro del bucle conversacional continuo.
El resultado más sólido de Griffin no es que se haya convertido en una persona. Es que un modelo de video en tiempo real ahora coordina suficientes señales conversacionales humanas como para cambiar la percepción de los usuarios.
Ese cambio importa para los desarrolladores que crean tutores, agentes de soporte, sistemas de juego de roles y asistentes visuales. También importa para quienes son responsables de la identidad, el consentimiento o la confianza dentro de un producto.
El siguiente paso útil es probar la IA Tavus Griffin frente a la tarea que realmente importa. Mida por separado la precisión, las interrupciones, el recuerdo de la divulgación, la fundamentación visual y el comportamiento de derivación. Después formule la pregunta que una prueba de Turing de un minuto no puede responder: ¿sigue siendo fiable el agente después de que desaparezca la novedad de parecer humano?



