top of page

Tavus Griffin AI a trompé 48 % des appelants, mais son test de Turing vidéo doit être contextualisé

il y a 8 minutes
14 min de lecture

Tavus a dévoilé Griffin après que 48 % des participants à une courte étude en direct ont pris l’avatar Tavus Griffin AI pour une vraie personne. L’entreprise présente Griffin comme le premier Human Interaction Model et le premier système à réussir un test de Turing vidéo en temps réel.

Ce résultat peut sembler démontrer clairement la capacité d’une IA à paraître humaine. Il est plus juste de le considérer comme la preuve que les agents vidéo en temps réel ont franchi un seuil notable d’interaction dans le cadre d’un test restreint. Tavus a conçu, mené et communiqué cette étude, qui a réuni 54 participants avec Griffin-Lite autour de conversations d’une minute.

Le résultat le plus facilement comparable de manière indépendante provient du Video Full-Duplex Benchmark de NVIDIA. Griffin-Lite y domine les systèmes évalués, tant en perception qu’en génération, devant les modèles Gemini et OpenAI sur plusieurs indicateurs conversationnels. Ensemble, ces deux évaluations suggèrent que Tavus a amélioré le comportement d’un avatar en conversation, sans pour autant prouver qu’il peut systématiquement se faire passer pour un humain.

Ce que Tavus Griffin AI introduit réellement

Griffin fait évoluer l’unité de la vidéo IA : d’une réponse générée vers une interaction gérée en continu.

Tavus a annoncé Griffin à San Francisco le 1er octobre 2026. La première version, Griffin-Lite, est un aperçu de recherche réservé à des testeurs sélectionnés, et non un produit client disponible au grand public.

L’entreprise décrit un Human Interaction Model comme un système conçu pour comprendre et générer des interactions en face à face en temps réel. Il traite la parole, le comportement visuel, le rythme et les signaux non verbaux, tout en produisant sa propre voix et sa propre vidéo.

Cette description distingue Griffin de nombreux systèmes d’avatars actuels. Un système conventionnel transcrit souvent la parole, envoie le texte à un modèle de langage, génère une réponse, la convertit en audio, puis anime un visage. Chaque composant commence son travail après qu’un autre a suffisamment achevé l’étape précédente.

Griffin conserve des moteurs techniques distincts, mais Tavus affirme qu’ils fonctionnent simultanément. Son composant conversationnel traite en continu les flux audio et vidéo entrants. Un second composant transforme ses décisions en parole synchronisée, comportements faciaux, regard et gestes.

La recherche sur Griffin détaillée par l’entreprise indique que le modèle réévalue un échange à des intervalles inférieurs à la seconde. À chaque intervalle, il peut continuer à écouter, acquiescer, interrompre, attendre ou céder la parole.

C’est important, car une conversation ne se résume pas à un échange de phrases complètes. Les personnes acquiescent avant qu’un interlocuteur ait fini, marquent des pauses sans céder leur tour, détournent le regard pour réfléchir et changent de direction après avoir observé la réaction de l’autre.

Les agents fonctionnant par tours de parole gèrent fréquemment mal ces signaux. Ils interrompent une pause réfléchie, restent sans expression face à une déclaration émotionnelle ou continuent de parler lorsque l’utilisateur tente de les couper.

Griffin est conçu pour intégrer ces moments au processus décisionnel central du modèle. Tavus affirme qu’un changement intervenant au cours d’une phrase peut affecter la voix et le visage de l’avatar dans le même segment conversationnel.

Le système de génération produit également toute la scène visible à partir d’une image de référence, selon Tavus. Cela comprend le visage, le corps, l’arrière-plan, les ombres et les objets proches, plutôt que la seule animation d’une bouche ou d’un maillage facial.

Les démonstrations publiées par l’entreprise montrent un avatar réagissant à une promotion, jouant à Jacques a dit, suivant un Rubik’s Cube et aidant quelqu’un à souder une carte mère. Ces exemples restent des démonstrations sélectionnées par l’entreprise, mais ils précisent l’usage prévu du contexte visuel.

L’aperçu Griffin-Lite peut aussi cloner une voix à partir d’environ dix secondes d’audio de référence, selon Tavus. Son décodeur audio causal produit des paquets aussi courts que 10 millisecondes alors que les parties ultérieures de la réponse sont encore en cours de génération.

Ces éléments ne démontrent pas une équivalence avec l’humain. Ils expliquent pourquoi Griffin peut paraître plus attentif qu’un avatar assemblé à partir de composants séquentiels plus lents.

L’événement immédiat dépasse donc le lancement d’un nouveau visage synthétique. Tavus présente le rythme interactionnel, la perception visuelle et la génération expressive comme un unique problème au niveau du modèle.

Pourquoi la vidéo full-duplex met les agents à tour de rôle sous pression

La pression concurrentielle vient du fait que Griffin traite l’écoute et la réponse comme des activités simultanées plutôt que comme des tours distincts.

La communication full-duplex signifie que les deux parties peuvent envoyer et recevoir des informations en même temps. Dans une conversation avec une IA, le système continue d’écouter et d’observer pendant qu’il parle, puis s’ajuste sans attendre un nouveau tour complet.

Une architecture en cascade traite l’expérience différemment. La reconnaissance vocale convertit les paroles de l’utilisateur en texte, un modèle de langage élabore une réponse, puis des systèmes distincts synthétisent l’audio et le mouvement de l’avatar.

Cette approche modulaire offre des avantages pratiques. Les développeurs peuvent remplacer des composants individuels, examiner les transcriptions et choisir des modèles spécialisés. Elle crée aussi des transmissions où le rythme, le ton de la voix, le regard et d’autres éléments de contexte peuvent disparaître.

La proposition centrale de Griffin est qu’un agent vidéo convaincant ne peut pas retrouver ces signaux après avoir réduit l’interaction à du texte. Il doit modéliser en continu ce que dit l’utilisateur, la manière dont il le dit et ce que montre la caméra.

Prenons le cas d’un client tenant un composant endommagé devant une caméra. Un agent centré sur le texte doit compter sur le client pour identifier l’objet ou fournir une description verbale utile. Un agent visuel peut examiner la pièce et répondre à ce qui apparaît à l’écran.

Le défi conversationnel est plus subtil. Si le client fait une pause pour repositionner le composant, l’agent ne devrait pas supposer que la question est terminée. Si le client recommence à parler, l’agent devrait s’arrêter ou céder la parole sans perdre le contexte.

Le même principe s’applique au tutorat. L’expression d’un étudiant ou une hésitation prolongée peut signaler une incompréhension avant que l’étudiant ne l’exprime directement. Un agent qui remarque ces indices peut modifier son explication ou attendre que l’étudiant ait fini de réfléchir.

Les jeux de rôle et les répétitions constituent un autre usage plausible. Un utilisateur qui s’entraîne à un entretien ou à une conversation professionnelle difficile a besoin d’un interlocuteur qui réagit au bon moment, et non d’un avatar qui récite simplement des réponses bien formulées.

Ces scénarios expliquent pourquoi Google, OpenAI, Tavus et les chercheurs open source travaillent sur l’interaction multimodale en temps réel. La prochaine compétition d’interfaces ne se limite pas au modèle qui produit la meilleure réponse isolée.

Elle porte aussi sur la capacité d’un agent à occuper le temps conversationnel sans obliger l’utilisateur à le gérer. Les longs silences, les interruptions accidentelles, les expressions figées et les réactions visuelles tardives révèlent tous le système sous-jacent.

Tavus n’a pas démontré que son approche remplacera les architectures modulaires. Les systèmes de production doivent concilier comportement naturel, coût, fiabilité, contrôle, sécurité et capacité à auditer les composants individuels.

Une boucle comportementale unifiée peut également rendre les défaillances plus difficiles à isoler. Une interruption inappropriée peut provenir de la perception, de la gestion des tours de parole, de la génération linguistique ou du contrôle expressif. Les développeurs ont besoin d’outils révélant quelle décision a échoué.

Le lancement de Griffin relève néanmoins le niveau d’exigence pour les concurrents. Une voix réactive associée à un visage convaincant ne suffit plus si ce visage n’écoute pas pendant qu’il parle.

Tavus Griffin face à Gemini sur le benchmark vidéo de NVIDIA

Le benchmark de NVIDIA étaye l’avantage interactionnel de Griffin, mais il ne valide pas l’affirmation distincte de Tavus selon laquelle le modèle se serait fait passer pour un humain.

Le Video Full-Duplex Benchmark de NVIDIA, ou VideoFDB, évalue la manière dont les agents conversationnels perçoivent et produisent des comportements audiovisuels continus. Il utilise 237 extraits annotés par des experts issus d’appels vidéo naturels entre deux personnes.

Les extraits couvrent 11 dynamiques conversationnelles, dont la gestion des tours de parole, le rire, les changements de regard, les pauses, les manifestations émotionnelles, les interruptions et les signes d’acquiescement non verbaux. Le benchmark sépare la perception de la génération.

Son volet perception cherche à déterminer si un modèle interprète correctement ce qui se passe. Le volet génération évalue si l’agent produit une parole et un comportement non verbal appropriés au bon moment.

Sur le classement VideoFDB publié, Griffin-Lite obtient un score global de perception de 3,73. Gemini 2.5 Flash Native obtient 3,17, tandis que Gemini 3.1 Flash Live atteint 2,84.

Les modèles gpt-realtime et gpt-realtime-mini d’OpenAI apparaissent sous ces résultats, avec des scores globaux de perception de 2,75 et 2,73. Le modèle open source MiniCPM-o 4.5 obtient 3,40.

Griffin-Lite atteint également 3,92 en ancrage visuel, contre 3,37 pour Gemini 2.5 Flash Native. Son résultat de timing mesuré est de 73,8 % à 2 232 millisecondes.

Ces chiffres doivent être lus avec prudence. MiniCPM-o 4.5 affiche un résultat de timing plus rapide, à 720 millisecondes, tandis que VITA-1.5 atteint 400 millisecondes. L’avance de Griffin ne signifie donc pas qu’il possède la latence mesurée la plus faible.

Le volet génération distingue plus nettement Griffin des systèmes d’avatars en cascade. Griffin-Lite obtient un score global de 3,83, proche du score de référence humain de 3,92.

Une cascade Gemini 2.5 et Anam obtient 2,80. Une combinaison Gemini 2.5 et Keyframe obtient 2,39. Griffin reçoit également des scores plus élevés en fluidité, correspondance émotionnelle et sélection de signaux non verbaux appropriés.

Cela étaye l’argument de Tavus sur le mécanisme. Sur ce benchmark, un système conçu pour coordonner en continu la voix et le comportement surpasse les pipelines testés qui associent un avatar à un autre modèle.

Cependant, VideoFDB ne demande pas aux évaluateurs s’ils pensent que l’agent est humain. Il évalue des comportements conversationnels sélectionnés au moyen de grilles définies.

Le processus de notation présente également des limites. NVIDIA indique que trois axes de grille dans chaque catégorie reçoivent une note d’un juge fondé sur un modèle de langage. L’accord entre les juges se situe à moins d’un point dans 77 % à 89 % des cas.

NVIDIA note les sorties de modèles soumises avant d’ajouter les systèmes au classement. C’est plus indépendant qu’une entreprise notant sa propre soumission, mais cela n’équivaut pas à des tests sans restriction menés par plusieurs laboratoires externes.

Le benchmark comprend une référence humaine et plusieurs concurrents reconnaissables, ce qui le rend utile à des fins de comparaison. Son périmètre reste plus étroit qu’un déploiement couvrant différentes langues, différents accents, conditions d’éclairage, situations émotionnelles et conversations prolongées.

La conclusion équitable est précise. Griffin-Lite affiche actuellement de bonnes performances sur un benchmark conçu autour de la conversation audiovisuelle full-duplex. Cela renforce l’affirmation de Tavus selon laquelle son architecture améliore la qualité de l’interaction.

Cela n’établit pas que Griffin soit généralement impossible à distinguer d’une personne. L’étude menée par Tavus auprès des participants est l’élément de preuve avancé pour cette affirmation distincte.

Ce que le test de Turing vidéo à 48 % ne prouve pas

Le résultat de 48 % mesure la plausibilité d’une première impression dans un appel contrôlé d’une minute, et non une équivalence humaine durable.

Tavus a recruté des participants par l’intermédiaire d’une plateforme de recherche indépendante. Les participants ont été informés qu’ils parleraient pendant une minute avec un autre participant de ce qu’ils attendaient avec impatience cette année-là.

Leur partenaire était en réalité un avatar Griffin-Lite générant son visage, sa voix et ses réponses en temps réel. Tavus n’a interrogé les participants sur l’identité de leur partenaire qu’après d’autres questions d’enquête.

Sur 54 participants, 26 ont déclaré croire que leur partenaire était une vraie personne. C’est ce qui produit le chiffre de 48 % largement relayé.

La comparaison avec le système précédent de Tavus est frappante. Selon le même protocole rapporté, un participant sur 41 a pris la pile Phoenix-4.5, Sparrow-2 et Raven-1 pour une personne, soit un taux de 2,4 %.

Les participants ayant choisi « réel » ont indiqué un niveau de confiance moyen de 79 %. Ceux ayant sélectionné l’IA ont déclaré une confiance de 81 %. Les personnes devenues méfiantes l’ont généralement été au cours des 20 premières secondes.

Griffin-Lite a obtenu un score moyen de naturel de 5,4 sur une échelle de sept points. Les participants lui ont attribué 5,6 pour la fiabilité et 5,8 pour leur envie d’avoir une autre conversation.

La mesure rapportée la plus faible concernait la fluidité conversationnelle, avec une moyenne de 4,9. Ce résultat compte, car le timing naturel constitue la promesse centrale du modèle.

Ces données indiquent une amélioration majeure par rapport à la pile précédente de Tavus. Elles ne permettent pas de déterminer si le système a « réussi » un test de Turing vidéo standard, car aucun protocole universellement accepté ne définit un tel test.

Le jeu de l’imitation original d’Alan Turing se concentrait sur des échanges textuels. Il n’a pas créé d’essai vidéo standardisé d’une minute ni défini de seuil de 48 % pour les avatars modernes.

Le terme « test de Turing vidéo » est donc la manière dont Tavus présente son expérience. Il ne s’agit pas d’une certification délivrée par un organisme de normalisation indépendant.

Plusieurs questions méthodologiques restent sans réponse dans le compte rendu publié. Tavus ne fournit pas suffisamment d’informations pour déterminer dans quelle mesure les participants étaient représentatifs ni comment les résultats variaient selon les groupes démographiques.

Une conversation d’une minute offre également peu de temps pour tester la mémoire, la cohérence factuelle, les interruptions difficiles, les entrées visuelles inhabituelles ou l’évolution du contexte émotionnel. Des appels plus longs créent davantage d’occasions de voir apparaître des artefacts et des contradictions comportementales.

Le sujet choisi était socialement simple et prévisible. Demander ce qu’une personne attend avec impatience au cours de l’année invite à des réponses courtes et positives. Un débat, une tâche collaborative, un diagnostic technique ou une conversation personnelle sensible imposeraient des exigences différentes.

Les participants n’ont pas été informés qu’ils testaient une IA. Cela aide à mesurer la perception spontanée, mais ne montre pas comment ces mêmes personnes évalueraient l’avatar en recherchant activement des indices synthétiques.

L’étude a également utilisé une présentation contrôlée par Tavus. Des visages, voix, conditions réseau, appareils, langues et environnements différents pourraient modifier le résultat.

Surtout, l’étude a été conçue et rapportée par l’entreprise dont elle évalue le produit. Le recrutement via une plateforme indépendante ne rend pas l’expérience globale validée de manière indépendante.

Cela ne rend pas le résultat dénué de sens. Les recherches menées par les fournisseurs apportent souvent les premières preuves concernant un nouveau système. Cela signifie que la conclusion doit rester proportionnée au protocole.

L’affirmation étayée est que Griffin-Lite a convaincu 26 personnes lors d’une interaction spécifique d’une minute. L’extrapolation non étayée serait d’affirmer que Griffin peut imiter de manière fiable un humain dans des appels vidéo ordinaires.

Il existe aussi une limite conceptuelle plus profonde. Se faire passer pour un comportement humain ne mesure ni la conscience, ni la véracité, ni le jugement, ni une intelligence générale. Cela mesure si un observateur identifie le système comme artificiel dans des conditions définies.

Griffin peut être excellent pour synchroniser un hochement de tête tout en fournissant une réponse fausse. Il peut remarquer la confusion sans comprendre les conséquences de ses conseils. Une présentation humaine peut accroître la compétence perçue sans améliorer la compétence réelle.

Pour les acheteurs en entreprise, cette distinction est essentielle. L’évaluation doit séparer le naturel conversationnel de l’exactitude des tâches, de la conformité aux politiques, de la gestion des données et de l’escalade sûre vers une personne.

Le modèle d’interaction humaine crée un problème de divulgation

La capacité la plus persuasive de Griffin est aussi son risque le plus évident : les utilisateurs peuvent faire confiance à un interlocuteur artificiel parce qu’il se comporte comme une personne.

Tavus reconnaît directement ce conflit. L’entreprise affirme que les mêmes propriétés qui permettent une communication naturelle peuvent tromper quelqu’un et lui faire croire que l’agent n’est pas une IA.

Cette préoccupation explique la diffusion limitée. Griffin-Lite est disponible pour certains testeurs de recherche, mais Tavus indique que les clients ne peuvent pas encore le déployer via la plateforme de l’entreprise.

Tavus indique développer des fonctionnalités de divulgation et des procédures de sécurité supplémentaires avant un lancement plus large. L’annonce ne précise ni la conception finale de la divulgation, ni les critères de sortie, ni le mécanisme d’application.

Une divulgation doit rester efficace pendant toute l’interaction. Un avis affiché avant un appel peut ne pas aider une personne qui rejoint la conversation en retard, reçoit un enregistrement tronqué ou voit l’avatar via un autre service.

Un étiquetage visuel persistant peut fournir un avertissement plus fort, mais il peut être recadré ou supprimé. Une divulgation orale peut être oubliée au cours d’une longue conversation. Les métadonnées peuvent aider les plateformes à identifier les médias synthétiques, mais elles ne protègent pas les utilisateurs sur des systèmes non pris en charge.

Le risque dépasse l’usurpation directe. Un agent humanoïde peut susciter une confiance émotionnelle excessive sans copier une personne précise.

Un avatar de tutorat peut sembler patient et attentif. Un agent commercial peut refléter l’hésitation. Un agent d’assistance peut afficher de la sympathie. Ces comportements peuvent amener les utilisateurs à déduire une compréhension, une discrétion ou une autorité que le système ne possède pas.

Le clonage vocal ajoute une couche supplémentaire. Tavus affirme que Griffin-Lite peut reproduire une voix à partir d’environ dix secondes d’audio. Les contrôles de consentement et d’identité importent donc autant que la qualité du rendu.

L’usurpation d’identité constitue déjà une catégorie majeure de fraude. La Federal Trade Commission des États-Unis a indiqué que les consommateurs avaient perdu près de 3 milliards de dollars dans des arnaques par usurpation d’identité en 2024.

Ce chiffre couvre un ensemble plus large d’arnaques et ne mesure pas les pertes causées par Griffin ou des agents vidéo comparables. Il établit le contexte dans lequel des interlocuteurs synthétiques toujours plus convaincants vont apparaître.

Les entreprises qui évaluent les modèles d’interaction humaine ont besoin de contrôles à plusieurs niveaux. Elles ont besoin d’autorisations vérifiées pour les visages et les voix, d’une divulgation persistante, de cas d’usage restreints, de journaux d’interaction auditables et de voies d’escalade claires.

Les contextes à haut risque exigent davantage de prudence. La santé, les services financiers, l’emploi, l’éducation et l’assistance juridique impliquent des décisions où l’empathie perçue peut influencer la divulgation ou le consentement.

Un utilisateur peut partager des informations sensibles parce qu’un avatar semble attentif. L’expression du système ne garantit ni l’exactitude de ses conseils ni que ses pratiques de données correspondent aux attentes de l’utilisateur.

Les développeurs doivent également tester les échecs comportementaux. Un avatar qui sourit face à la détresse, imite la colère ou interrompt une divulgation peut causer un préjudice même lorsque ses mots respectent les exigences de politique.

Griffin rend ces questions urgentes, car le comportement non verbal n’est plus une simple sortie décorative. Tavus l’intègre dans la boucle de décision conversationnelle du modèle.

La tension concurrentielle centrale n’oppose donc pas Tavus à une seule entreprise d’avatars. Elle oppose une interaction humaine continue aux limites de la divulgation et de la confiance.

Si Tavus parvient à préserver une identité clairement machinique tout en offrant une conversation naturelle, l’architecture de Griffin pourrait améliorer les interfaces pratiques. Si le naturel dépend d’une ambiguïté sur l’identité, son adoption rencontrera une résistance de la part des utilisateurs, des régulateurs et des équipes de gestion des risques en entreprise.

Ce qu’il faut surveiller après l’aperçu de Tavus Griffin

Trois signaux détermineront si Griffin devient une avancée durable de plateforme ou reste un aperçu contrôlé impressionnant.

Le premier signal sera la réplication indépendante de l’étude auprès des participants. Les chercheurs devraient répéter le protocole avec des échantillons plus larges, plusieurs avatars, des sujets variés et des appels plus longs.

La réplication devrait également comparer les participants informés et non informés. Cela révélerait si Griffin reste convaincant lorsque les utilisateurs évaluent activement le comportement synthétique.

Un test plus long mettrait en évidence les problèmes de cohérence que les conversations d’une minute ne peuvent pas capturer. Il montrerait aussi si les utilisateurs deviennent plus ou moins méfiants à mesure que l’interaction accumule du contexte.

Si des équipes indépendantes obtiennent des résultats proches du chiffre de 48 % de Tavus, l’affirmation de l’entreprise concernant le test de Turing vidéo gagnera en crédibilité. Une baisse marquée montrerait que le résultat de lancement dépendait fortement du protocole choisi.

Le deuxième signal sera une participation plus large à VideoFDB. Griffin domine actuellement les résultats publiés de perception et de génération, mais les classements évoluent à mesure que des systèmes plus puissants arrivent.

Des soumissions directes d’un plus grand nombre de fournisseurs commerciaux d’avatars amélioreraient la comparaison. Des modèles mis à jour de Google, OpenAI et d’équipes open source pourraient également réduire l’avance de Griffin.

Les résultats les plus instructifs distingueront la compréhension visuelle de la présentation fluide. Un système ne devrait pas recevoir un large crédit pour son apparence réactive s’il ignore le flux visuel ou gère mal la conversation.

Le troisième signal sera le package de lancement de Tavus. L’entreprise doit définir la disponibilité, la latence dans des conditions réseau ordinaires, les contrôles pour les développeurs, les fonctionnalités de divulgation et les restrictions relatives à la réplication de voix et d’identité.

Les preuves en production devraient inclure les performances sur des sessions plus longues et dans des environnements variés. Les acheteurs auront également besoin de méthodes pour examiner les décisions prises au sein de la boucle conversationnelle continue.

Le résultat le plus fort de Griffin n’est pas qu’il soit devenu une personne. C’est qu’un modèle vidéo en temps réel coordonne désormais suffisamment de signaux conversationnels humains pour modifier la perception des utilisateurs.

Ce changement importe aux développeurs qui créent des tuteurs, des agents d’assistance, des systèmes de jeu de rôle et des assistants visuels. Il importe aussi à toute personne responsable de l’identité, du consentement ou de la confiance au sein d’un produit.

La prochaine étape utile consiste à tester l’IA Tavus Griffin sur la tâche qui vous importe réellement. Mesurez séparément l’exactitude, les interruptions, le rappel de la divulgation, l’ancrage visuel et le comportement d’escalade. Posez ensuite la question à laquelle un test de Turing d’une minute ne peut pas répondre : l’agent reste-t-il digne de confiance une fois que la nouveauté de son apparence humaine s’est dissipée ?

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page