Tavus Griffin AI ha ingannato il 48% degli interlocutori, ma il suo video Turing test richiede contesto
Tavus ha presentato Griffin dopo che il 48% dei partecipanti a un breve studio dal vivo ha scambiato l'avatar Tavus Griffin AI per una persona reale. L'azienda definisce Griffin il primo Human Interaction Model e il primo sistema a superare un video Turing test in tempo reale.
Il risultato sembra una netta vittoria per un'AI dall'aspetto umano. È più corretto interpretarlo come prova del fatto che gli agenti video in tempo reale abbiano superato una rilevante soglia di interazione in un singolo test circoscritto. Tavus ha progettato, condotto e riportato lo studio, che ha coinvolto 54 partecipanti con Griffin-Lite e conversazioni di un minuto.
Il risultato più comparabile in modo indipendente proviene dal Video Full-Duplex Benchmark di NVIDIA. Griffin-Lite guida i sistemi valutati in quel benchmark sia nella percezione sia nella generazione, superando i modelli Gemini e OpenAI in diverse misure conversazionali. Insieme, le due valutazioni suggeriscono che Tavus abbia migliorato il comportamento di un avatar durante una conversazione, anche se non dimostrano che possa risultare costantemente indistinguibile da un essere umano.
Cosa introduce davvero Tavus Griffin AI
Griffin cambia l'unità del video AI: da una risposta generata a un'interazione gestita in modo continuo.
Tavus ha annunciato Griffin a San Francisco il 1° ottobre 2026. La versione iniziale Griffin-Lite è un'anteprima di ricerca disponibile soltanto per tester selezionati, non un prodotto per clienti generalmente disponibile.
L'azienda descrive un Human Interaction Model come un sistema progettato per comprendere e generare interazioni faccia a faccia in tempo reale. Elabora parlato, comportamento visivo, tempistiche e segnali non verbali mentre produce la propria voce e il proprio video.
Questa descrizione distingue Griffin da molti sistemi di avatar attuali. Un sistema convenzionale spesso trascrive il parlato, invia il testo a un modello linguistico, genera una risposta, la converte in audio e anima un volto. Ogni componente inizia a lavorare dopo che un altro ha completato a sufficienza la fase precedente.
Griffin contiene comunque motori tecnici distinti, ma Tavus afferma che operino simultaneamente. Il suo componente conversazionale elabora in modo continuo audio e video in ingresso. Un secondo componente trasforma le sue decisioni in parlato sincronizzato, espressioni facciali, sguardo e gesti.
La dettagliata ricerca su Griffin dell'azienda afferma che il modello rivaluta uno scambio a intervalli inferiori al secondo. A ogni intervallo può continuare ad ascoltare, riconoscere il contributo dell'interlocutore, interrompere, attendere o cedere il turno di parola.
Questo conta perché una conversazione non è semplicemente uno scambio di frasi complete. Le persone annuiscono prima che chi parla finisca, fanno una pausa senza cedere il turno, distolgono lo sguardo mentre riflettono e cambiano direzione dopo aver notato la reazione dell'altra persona.
Gli agenti basati sui turni gestiscono spesso male questi segnali. Interrompono una pausa riflessiva, restano inespressivi durante un'affermazione emotiva o continuano a parlare quando l'utente cerca di intervenire.
Griffin è pensato per rendere questi momenti parte del processo decisionale centrale del modello. Tavus afferma che una modifica effettuata durante una frase possa influenzare voce e volto dell'avatar all'interno dello stesso segmento conversazionale.
Secondo Tavus, il sistema di generazione produce inoltre l'intera scena visibile a partire da un'immagine di riferimento. Include volto, corpo, sfondo, ombre e oggetti vicini, anziché animare soltanto una bocca o una mesh facciale.
Le dimostrazioni pubblicate dall'azienda mostrano un avatar che reagisce a una promozione, gioca a Simon Says, segue un Cubo di Rubik e aiuta qualcuno a saldare una scheda madre. Questi esempi restano dimostrazioni selezionate dall'azienda, ma chiariscono l'uso previsto del contesto visivo.
L'anteprima Griffin-Lite può anche clonare una voce da circa dieci secondi di audio di riferimento, secondo Tavus. Il suo decoder audio causale produce pacchetti di appena 10 millisecondi mentre le parti successive della risposta sono ancora in fase di generazione.
Questi dettagli non dimostrano un'equivalenza umana. Spiegano perché Griffin possa apparire più attento di un avatar assemblato da componenti sequenziali più lenti.
L'evento immediato è quindi più ampio di un nuovo volto sintetico. Tavus presenta tempistiche di interazione, percezione visiva e generazione espressiva come un unico problema a livello di modello.
Perché il video full-duplex mette sotto pressione gli agenti basati sui turni
La pressione competitiva deriva dal fatto che Griffin considera ascolto e risposta attività simultanee anziché turni separati.
La comunicazione full-duplex significa che entrambe le parti possono inviare e ricevere informazioni contemporaneamente. In una conversazione con l'AI, il sistema continua ad ascoltare e osservare mentre parla, quindi si adatta senza attendere un nuovo turno completo.
Un'architettura a cascata gestisce l'esperienza in modo diverso. Il riconoscimento vocale converte le parole dell'utente in testo, un modello linguistico crea una risposta e sistemi separati sintetizzano l'audio e il movimento dell'avatar.
Questo approccio modulare offre vantaggi pratici. Gli sviluppatori possono sostituire singoli componenti, ispezionare le trascrizioni e selezionare modelli specializzati. Crea però anche passaggi di consegna in cui possono andare persi tempistiche, tono vocale, sguardo e altro contesto.
La tesi centrale di Griffin è che un agente video convincente non possa recuperare questi segnali dopo aver ridotto l'interazione a testo. Deve modellare continuamente ciò che l'utente dice, come lo dice e ciò che mostra la videocamera.
Si consideri un cliente che tiene un componente danneggiato davanti a una videocamera. Un agente incentrato sul testo deve affidarsi all'utente affinché identifichi l'oggetto o fornisca una descrizione verbale utile. Un agente visivo può ispezionare il pezzo e rispondere a ciò che appare sullo schermo.
La sfida conversazionale è più sottile. Se il cliente si ferma per riposizionare il componente, l'agente non dovrebbe presumere che la domanda sia terminata. Se il cliente ricomincia a parlare, l'agente dovrebbe fermarsi o cedere il turno senza perdere il contesto.
Lo stesso principio si applica al tutoraggio. L'espressione di uno studente o una prolungata esitazione possono segnalare confusione prima che lo studente la dichiari esplicitamente. Un agente che nota questi segnali può modificare la propria spiegazione o attendere che lo studente finisca di riflettere.
Il role-play e la preparazione offrono un altro uso plausibile. Un utente che si prepara a un colloquio o a una difficile conversazione sul lavoro necessita di un interlocutore che reagisca al momento giusto, non di un avatar che si limiti a recitare risposte ben formulate.
Questi scenari spiegano perché Google, OpenAI, Tavus e i ricercatori open source stiano lavorando sull'interazione multimodale in tempo reale. La prossima competizione sulle interfacce non si limita a quale modello produca la migliore risposta isolata.
Riguarda anche la capacità di un agente di occupare il tempo conversazionale senza costringere l'utente a gestirlo. Lunghi silenzi, interruzioni accidentali, espressioni congelate e reazioni visive ritardate rivelano tutti il sistema sottostante.
Tavus non ha dimostrato che il suo approccio sostituirà le architetture modulari. I sistemi di produzione devono bilanciare comportamento naturale con costi, affidabilità, controllo, sicurezza e possibilità di sottoporre ad audit i singoli componenti.
Un ciclo comportamentale unificato può inoltre rendere più difficili da isolare i guasti. Un'interruzione inappropriata potrebbe avere origine nella percezione, nella gestione dei turni, nella generazione linguistica o nel controllo espressivo. Gli sviluppatori hanno bisogno di strumenti che rivelino quale decisione è fallita.
Tuttavia, il lancio di Griffin alza l'asticella per i concorrenti. Una voce reattiva abbinata a un volto convincente non basta più se il volto non ascolta mentre parla.
Tavus Griffin vs Gemini nel benchmark video di NVIDIA
Il benchmark di NVIDIA sostiene il vantaggio di Griffin nell'interazione, ma non convalida l'affermazione separata di Tavus secondo cui il modello sarebbe passato per umano.
Il Video Full-Duplex Benchmark di NVIDIA, o VideoFDB, valuta il modo in cui gli agenti conversazionali percepiscono e producono un comportamento audiovisivo continuo. Utilizza 237 clip annotate da esperti tratte da naturali videochiamate tra due persone.
Le clip coprono 11 dinamiche conversazionali, tra cui alternanza dei turni, risate, cambiamenti dello sguardo, pause, manifestazioni emotive, interruzioni e segnali non verbali di riconoscimento. Il benchmark separa percezione e generazione.
La sua traccia di percezione chiede se un modello interpreti ciò che sta accadendo. La traccia di generazione valuta se l'agente produca parlato e comportamento non verbale appropriati al momento giusto.
Nella classifica VideoFDB pubblicata, Griffin-Lite registra un punteggio complessivo di percezione pari a 3,73. Gemini 2.5 Flash Native ottiene 3,17, mentre Gemini 3.1 Flash Live ottiene 2,84.
gpt-realtime e gpt-realtime-mini di OpenAI si collocano al di sotto di questi risultati, con punteggi complessivi di percezione rispettivamente di 2,75 e 2,73. Il modello open source MiniCPM-o 4.5 ottiene 3,40.
Griffin-Lite ottiene inoltre 3,92 nel visual grounding, rispetto al 3,37 di Gemini 2.5 Flash Native. Il suo risultato misurato sulle tempistiche è del 73,8% a 2.232 millisecondi.
Queste cifre richiedono una lettura attenta. MiniCPM-o 4.5 registra un risultato sulle tempistiche più rapido, pari a 720 millisecondi, mentre VITA-1.5 raggiunge 400 millisecondi. Il vantaggio di Griffin non significa quindi che abbia la latenza misurata più bassa.
La traccia di generazione crea una distinzione più marcata tra Griffin e i sistemi di avatar a cascata. Griffin-Lite ottiene un punteggio complessivo di 3,83, vicino al punteggio di riferimento umano di 3,92.
Una cascata Gemini 2.5 e Anam ottiene 2,80. Una combinazione Gemini 2.5 e Keyframe ottiene 2,39. Griffin riceve inoltre punteggi più alti per fluidità, corrispondenza emotiva e selezione di segnali non verbali appropriati.
Questo sostiene l'argomento di Tavus sul meccanismo. Un sistema progettato per coordinare in modo continuo voce e comportamento ottiene risultati migliori in questo benchmark rispetto alle pipeline testate che collegano un avatar a un altro modello.
Tuttavia, VideoFDB non chiede ai valutatori se credano che l'agente sia umano. Valuta comportamenti conversazionali selezionati attraverso rubriche definite.
Anche il processo di valutazione ha dei limiti. NVIDIA afferma che tre assi di valutazione in ogni categoria ricevono punteggi da un giudice basato su modello linguistico. L'accordo tra i giudici rientra in un punto tra il 77% e l'89% delle volte.
NVIDIA valuta gli output dei modelli inviati prima di aggiungere i sistemi alla classifica. Questo è più indipendente di un'azienda che valuta la propria proposta, ma non equivale a test senza restrizioni condotti da più laboratori esterni.
Il benchmark include un riferimento umano e diversi concorrenti riconoscibili, il che lo rende utile per il confronto. Il suo ambito resta più ristretto rispetto all'impiego in lingue, accenti, condizioni di illuminazione, situazioni emotive e conversazioni prolungate differenti.
La conclusione corretta è specifica. Griffin-Lite attualmente ottiene buoni risultati in un benchmark progettato attorno alla conversazione audiovisiva full-duplex. Questo rafforza l'affermazione di Tavus secondo cui la sua architettura migliori la qualità dell'interazione.
Non dimostra che Griffin sia generalmente indistinguibile da una persona. Lo studio condotto da Tavus sui partecipanti è la prova offerta per questa affermazione separata.
Cosa non dimostra il video Turing test del 48%
Il risultato del 48% misura la plausibilità della prima impressione in una chiamata controllata di un minuto, non un'equivalenza umana duratura.
Tavus ha reclutato i partecipanti attraverso una piattaforma di ricerca indipendente. Ai partecipanti è stato detto che avrebbero parlato per un minuto con un altro partecipante di ciò che attendevano con più entusiasmo quell'anno.
Il loro interlocutore era in realtà un avatar Griffin-Lite che generava volto, voce e risposte in tempo reale. Tavus ha chiesto dell'identità dell'interlocutore soltanto dopo altre domande del sondaggio.
Su 54 partecipanti, 26 hanno dichiarato di credere che il proprio interlocutore fosse una persona reale. Da qui deriva la cifra del 48% ampiamente condivisa.
Il confronto con il sistema precedente di Tavus è significativo. Con lo stesso protocollo dichiarato, uno dei 41 partecipanti ha scambiato lo stack Phoenix-4.5, Sparrow-2 e Raven-1 per una persona, pari al 2,4%.
I partecipanti che hanno scelto “reale” hanno riportato una fiducia media del 79%. Chi ha selezionato AI ha riportato una fiducia dell’81%. Le persone che hanno iniziato a sospettare qualcosa lo hanno fatto generalmente entro i primi 20 secondi.
Griffin-Lite ha ricevuto un punteggio medio di naturalezza pari a 5,4 su una scala di sette punti. I partecipanti gli hanno assegnato 5,6 per l’affidabilità e 5,8 per la probabilità di apprezzare un’altra conversazione.
La misura riportata più debole è stata il flusso conversazionale, con una media di 4,9. Il risultato conta perché la naturalezza dei tempi di risposta è la promessa centrale del modello.
Questi dati indicano un importante miglioramento rispetto allo stack precedente di Tavus. Non stabiliscono se il sistema abbia “superato” un test di Turing video standard, perché non esiste un protocollo universalmente accettato che definisca un test di questo tipo.
L’originale gioco dell’imitazione di Alan Turing si concentrava su scambi testuali. Non ha creato una prova video standardizzata di un minuto né definito una soglia del 48% per gli avatar moderni.
Il termine “test di Turing video” è quindi il modo in cui Tavus inquadra il proprio esperimento. Non è una certificazione rilasciata da un organismo indipendente di standardizzazione.
Nel resoconto pubblicato restano senza risposta diverse questioni metodologiche. Tavus non fornisce informazioni sufficienti per determinare quanto fossero rappresentativi i partecipanti o come i risultati variassero tra gruppi demografici.
Una conversazione di un minuto offre inoltre poco tempo per verificare memoria, coerenza fattuale, interruzioni difficili, input visivi insoliti o contesti emotivi mutevoli. Le chiamate più lunghe creano maggiori occasioni perché emergano artefatti e contraddizioni comportamentali.
L’argomento scelto era socialmente semplice e prevedibile. Chiedere cosa una persona attenda con interesse durante l’anno invita a risposte brevi e positive. Un dibattito, un compito collaborativo, una diagnosi tecnica o una conversazione personale delicata creerebbero richieste diverse.
Ai partecipanti non è stato detto che stavano testando un’AI. Questo aiuta a misurare la percezione spontanea, ma non mostra come le stesse persone valuterebbero l’avatar cercando attivamente indizi sintetici.
Lo studio ha inoltre utilizzato un’unica presentazione controllata da Tavus. Volti, voci, condizioni di rete, dispositivi, lingue e ambienti differenti potrebbero alterare il risultato.
Soprattutto, lo studio è stato progettato e riportato dall’azienda il cui prodotto viene valutato. Il reclutamento tramite una piattaforma indipendente non rende l’esperimento complessivo validato in modo indipendente.
Questo non rende il risultato privo di significato. La ricerca dei fornitori fornisce spesso le prime evidenze su un nuovo sistema. Significa che la conclusione dovrebbe rimanere proporzionata al protocollo.
L’affermazione supportata è che Griffin-Lite ha convinto 26 persone durante una specifica interazione di un minuto. Il salto non supportato è che Griffin possa impersonare in modo affidabile un essere umano nelle normali videochiamate.
Esiste anche un limite concettuale più profondo. Apparire umano non misura coscienza, veridicità, giudizio o intelligenza generale. Misura se un osservatore identifica il sistema come artificiale in condizioni definite.
Griffin potrebbe essere eccellente nel sincronizzare un cenno del capo e fornire comunque una risposta falsa. Potrebbe rilevare la confusione senza comprenderne le conseguenze per le proprie indicazioni. Una presentazione simile a quella umana può aumentare la competenza percepita senza aumentare la competenza effettiva.
Per gli acquirenti aziendali, questa distinzione è essenziale. La valutazione deve separare la naturalezza conversazionale dall’accuratezza nel compito, dalla conformità alle policy, dalla gestione dei dati e dall’escalation sicura a una persona.
Il modello di interazione umana crea un problema di divulgazione
La capacità più persuasiva di Griffin è anche il suo rischio più evidente: gli utenti potrebbero fidarsi di un interlocutore artificiale perché si comporta come una persona.
Tavus riconosce direttamente questo conflitto. L’azienda afferma che le stesse proprietà che consentono una comunicazione naturale possono indurre qualcuno a credere che l’agente non sia un’AI.
Questa preoccupazione spiega il rilascio limitato. Griffin-Lite è disponibile per tester di ricerca selezionati, ma Tavus afferma che i clienti non possono ancora implementarlo tramite la piattaforma dell’azienda.
Tavus afferma di stare sviluppando funzionalità di divulgazione e procedure di sicurezza aggiuntive prima di un lancio più ampio. L’annuncio non specifica il progetto finale della divulgazione, i criteri di rilascio o il meccanismo di applicazione.
Una divulgazione deve rimanere efficace per tutta l’interazione. Un avviso mostrato prima di una chiamata potrebbe non aiutare chi si collega in ritardo, riceve una registrazione ritagliata o vede l’avatar tramite un altro servizio.
Un’etichettatura visiva persistente può fornire un avviso più forte, ma può essere ritagliata o rimossa. Una divulgazione vocale può essere dimenticata durante una lunga conversazione. I metadati possono aiutare le piattaforme a identificare i media sintetici, ma non proteggono gli utenti sui sistemi non supportati.
Il rischio va oltre l’impersonificazione diretta. Un agente simile a un essere umano può generare un’eccessiva fiducia emotiva senza copiare una persona specifica.
Un avatar tutor potrebbe apparire paziente e attento. Un agente di vendita potrebbe rispecchiare l’esitazione. Un agente di assistenza potrebbe mostrare empatia. Questi comportamenti possono portare gli utenti a dedurre comprensione, discrezione o autorità che il sistema non possiede.
La clonazione vocale aggiunge un ulteriore livello. Tavus afferma che Griffin-Lite può riprodurre una voce da circa dieci secondi di audio. Il consenso e i controlli sull’identità contano quindi quanto la qualità del rendering.
L’impersonificazione è già una categoria importante di frode. La Federal Trade Commission statunitense ha riportato che i consumatori hanno perso quasi 3 miliardi di dollari in truffe di impersonificazione nel corso del 2024.
Questa cifra copre un insieme più ampio di truffe e non misura le perdite causate da Griffin o da agenti video comparabili. Definisce il contesto nel quale arriveranno interlocutori sintetici sempre più convincenti.
Le aziende che valutano gli Human Interaction Models necessitano di controlli su più livelli. Servono autorizzazioni verificate per volti e voci, divulgazione persistente, casi d’uso limitati, registri delle interazioni verificabili e percorsi di escalation chiari.
I contesti ad alto rischio richiedono maggiore cautela. Sanità, servizi finanziari, occupazione, istruzione e supporto legale implicano decisioni nelle quali l’empatia percepita può influenzare la divulgazione o il consenso.
Un utente potrebbe condividere informazioni sensibili perché un avatar sembra attento. L’espressione del sistema non garantisce che i suoi consigli siano accurati né che le sue pratiche sui dati corrispondano alle aspettative dell’utente.
Gli sviluppatori devono inoltre testare i fallimenti comportamentali. Un avatar che sorride durante un momento di sofferenza, imita la rabbia o interrompe una divulgazione può causare danni anche quando le sue parole rispettano i requisiti delle policy.
Griffin rende queste domande urgenti perché il comportamento non verbale non è più un output decorativo. Tavus lo colloca nel ciclo decisionale conversazionale del modello.
La tensione competitiva centrale non è quindi Tavus contro una singola azienda di avatar. È l’interazione continua simile a quella umana contro i limiti della divulgazione e della fiducia.
Se Tavus riuscirà a preservare una chiara identità artificiale offrendo al contempo una conversazione naturale, l’architettura di Griffin potrebbe migliorare le interfacce pratiche. Se la naturalezza dipende dall’ambiguità sull’identità, l’adozione incontrerà resistenza da utenti, regolatori e team aziendali di gestione del rischio.
Cosa osservare dopo l’anteprima di Tavus Griffin
Tre segnali determineranno se Griffin diventerà un progresso duraturo per la piattaforma o resterà un’impressionante anteprima controllata.
Il primo segnale è la replica indipendente dello studio sui partecipanti. I ricercatori dovrebbero ripetere il protocollo con campioni più grandi, avatar multipli, argomenti diversi e chiamate più lunghe.
La replica dovrebbe inoltre confrontare partecipanti informati e non informati. Questo rivelerebbe se Griffin rimane convincente quando gli utenti valutano attivamente il comportamento sintetico.
Un test più lungo esporrebbe problemi di coerenza che le conversazioni di un minuto non possono cogliere. Mostrerebbe inoltre se gli utenti diventano più o meno sospettosi man mano che l’interazione accumula contesto.
Se team indipendenti otterranno risultati vicini alla cifra del 48% di Tavus, l’affermazione dell’azienda sul test di Turing video acquisirà credibilità. Un forte calo mostrerebbe che il risultato del lancio dipendeva in larga misura dal protocollo selezionato.
Il secondo segnale è una partecipazione più ampia a VideoFDB. Griffin guida attualmente i risultati pubblicati sulla percezione e sulla generazione, ma le classifiche cambiano con l’ingresso di sistemi più forti.
Invii diretti da parte di un maggior numero di fornitori commerciali di avatar migliorerebbero il confronto. Modelli aggiornati di Google, OpenAI e team open-source potrebbero inoltre ridurre il vantaggio di Griffin.
I risultati più informativi separeranno la comprensione visiva dalla presentazione fluida. Un sistema non dovrebbe ricevere un ampio riconoscimento per sembrare reattivo se ignora il flusso visivo o gestisce male la conversazione.
Il terzo segnale è il pacchetto di rilascio di Tavus. L’azienda deve definire disponibilità, latenza nelle normali condizioni di rete, controlli per gli sviluppatori, funzionalità di divulgazione e restrizioni sulla replica di voce e identità.
Le evidenze in produzione dovrebbero includere le prestazioni in sessioni più lunghe e ambienti diversificati. Gli acquirenti avranno inoltre bisogno di metodi per riesaminare le decisioni prese all’interno del ciclo conversazionale continuo.
Il risultato più forte di Griffin non è che sia diventato una persona. È che un modello video in tempo reale ora coordina abbastanza segnali conversazionali umani da modificare la percezione degli utenti.
Questo cambiamento conta per gli sviluppatori che realizzano tutor, agenti di assistenza, sistemi di role-play e assistenti visivi. Conta anche per chiunque sia responsabile dell’identità, del consenso o della fiducia all’interno di un prodotto.
Il prossimo passo utile è testare Tavus Griffin AI rispetto al compito che interessa davvero. Misurate separatamente accuratezza, interruzioni, ricordo della divulgazione, ancoraggio visivo e comportamento di escalation. Poi ponete la domanda a cui un test di Turing di un minuto non può rispondere: l’agente rimane affidabile dopo che la novità del suo aspetto umano svanisce?



