Tavus Griffin AIは通話者の48%を欺いたが、その動画チューリングテストには文脈が必要だ
Tavusは、短時間のライブ調査で参加者の48%がTavus Griffin AIアバターを実在の人物と誤認したことを受け、Griffinを発表した。同社はGriffinを、初のHuman Interaction Modelであり、リアルタイム動画チューリングテストを通過した初のシステムだと位置付けている。
この結果は、人間らしいAIの明快な勝利のように聞こえる。しかし、より適切には、リアルタイム動画エージェントが限定的な一つのテストにおいて、注目すべき対話の閾値を超えた証拠と捉えるべきだろう。この調査はTavusが設計、実施、報告したもので、Griffin-Liteとの1分間の会話を行った参加者は54人だった。
より独立性の高い比較結果は、NVIDIAのVideo Full-Duplex Benchmarkから得られる。Griffin-Liteは、知覚と生成の両方で評価対象システムの首位に立ち、複数の会話指標でGeminiおよびOpenAIのモデルを上回った。両評価を合わせると、Tavusが会話中のアバターの振る舞いを改善したことが示唆される。ただし、常に人間として通用することを証明するものではない。
Tavus Griffin AIが実際に導入するもの
Griffinは、AI動画の単位を生成された応答から、継続的に管理される対話へと変える。
Tavusは2026年10月1日、サンフランシスコでGriffinを発表した。初期版のGriffin-Liteは、一般提供される顧客向け製品ではなく、選ばれたテスターだけが利用できる研究プレビューだ。
同社はHuman Interaction Modelを、対面での対話をリアルタイムに理解・生成するよう設計されたシステムと説明している。独自の音声と動画を生成しながら、発話、視覚的な振る舞い、タイミング、非言語シグナルを処理する。
この説明によって、Griffinは多くの現行アバターシステムと区別される。従来型システムでは、音声を文字起こしし、そのテキストを言語モデルへ送り、応答を生成して音声に変換し、顔をアニメーション化することが多い。各コンポーネントは、先行する工程が十分に完了してから動作を開始する。
Griffinにも異なる技術エンジンは含まれるが、Tavusによれば、それらは同時並行で動作する。会話コンポーネントは入力される音声と動画を継続的に処理する。もう一つのコンポーネントは、その判断を同期した発話、表情、視線、ジェスチャーへと変換する。
同社の詳細なGriffin researchによれば、このモデルは1秒未満の間隔で対話を再評価する。各時点で、聞き続ける、話者に相づちを打つ、割り込む、待つ、または発話権を譲ることができる。
これは重要だ。会話は、完成した文を単にやり取りするものではない。人は話し手が話し終える前にうなずき、順番を譲ることなく間を置き、考えながら視線をそらし、相手の反応に気づいて話の方向を変える。
ターンベースのエージェントは、こうしたシグナルを誤って扱いがちだ。考え込むための間を遮ったり、感情的な発言の最中に無表情のままだったり、ユーザーが割り込もうとしても話し続けたりする。
Griffinは、こうした瞬間をモデルの中核的な意思決定プロセスに組み込むことを目指している。Tavusによれば、文の途中で生じた変化でも、同じ会話セグメント内でアバターの声や表情に影響を与えられる。
Tavusによると、生成システムは参照画像から可視シーン全体も生成する。口や顔のメッシュだけを動かすのではなく、顔、身体、背景、影、周囲の物体まで含まれる。
同社が公開したデモでは、アバターが昇進に反応したり、Simon Saysを遊んだり、ルービックキューブを追ったり、マザーボードのはんだ付けを手伝ったりする様子が示されている。これらは依然として同社が選んだデモだが、視覚的文脈の想定用途を明確にしている。
Tavusによれば、Griffin-Liteのプレビュー版は約10秒の参照音声から声をクローンすることもできる。因果的な音声デコーダーは、応答の後半部分が生成されている間にも、最小10ミリ秒のパケットを生成する。
こうした詳細は、人間との同等性を確立するものではない。Griffinが、より遅く逐次的なコンポーネントから組み立てられたアバターよりも注意深く見える理由を説明するものだ。
したがって、目下の出来事は新しい合成顔の登場以上の意味を持つ。Tavusは、対話のタイミング、視覚的知覚、表現豊かな生成を、モデルレベルの一つの問題として提示している。
フルデュプレックス動画がターンベースのエージェントに圧力をかける理由
競争上の圧力は、Griffinが聞くことと応答することを別々のターンではなく同時活動として扱う点から生じる。
フルデュプレックス通信とは、双方が同時に情報を送受信できることを意味する。AIとの会話では、システムは発話中も聞き、見続け、完全な新しいターンを待たずに調整する。
カスケード型アーキテクチャでは、体験は異なる形で処理される。音声認識がユーザーの言葉をテキストに変換し、言語モデルが回答を作成し、別のシステムが音声とアバターの動きを合成する。
このモジュール型アプローチには実用上の利点がある。開発者は個々のコンポーネントを置き換えられ、文字起こしを確認でき、専門特化したモデルを選択できる。一方で、タイミング、声の調子、視線、その他の文脈が失われうる受け渡しも生まれる。
Griffinの中核的な主張は、対話をテキストに還元した後では、説得力のある動画エージェントはこうしたシグナルを取り戻せないというものだ。ユーザーが何を言うか、どう言うか、カメラに何が映るかを継続的にモデル化する必要がある。
例えば、顧客が損傷した部品をカメラの前に掲げている場面を考えてみよう。テキスト中心のエージェントは、顧客が物体を特定するか、有用な口頭説明をすることに頼らなければならない。視覚エージェントなら、その部品を確認し、画面に映るものに応答できる。
会話上の課題はさらに繊細だ。顧客が部品の位置を変えるために間を置いた場合、エージェントは質問が終わったと想定すべきではない。顧客が再び話し始めたなら、文脈を失わずに停止するか、発話権を譲るべきだ。
同じ原則は個別指導にも当てはまる。学生の表情や長い躊躇は、本人が直接口にする前に混乱を示すことがある。こうした手掛かりに気づくエージェントは、説明を変えたり、学生が考え終えるのを待ったりできる。
ロールプレイやリハーサルも、もっともらしい用途の一つだ。面接や職場での難しい会話を練習するユーザーには、洗練された回答を読み上げるだけのアバターではなく、適切な瞬間に反応する会話相手が必要となる。
こうしたシナリオは、Google、OpenAI、Tavus、そしてオープンソース研究者がリアルタイムのマルチモーダル対話に取り組んでいる理由を説明する。次のインターフェース競争は、最良の単独回答を生むモデルだけで決まるものではない。
エージェントが、ユーザーに会話を管理させることなく会話時間を占められるかどうかも問われる。長い沈黙、意図しない割り込み、固まった表情、遅れた視覚的反応は、いずれもその下にあるシステムを露呈させる。
Tavusは、そのアプローチがモジュール型アーキテクチャを置き換えることを示したわけではない。本番システムは、自然な振る舞いと、コスト、信頼性、制御、安全性、個別コンポーネントを監査する能力の間でバランスを取る必要がある。
統合された行動ループは、障害の切り分けを難しくする可能性もある。不適切な割り込みは、知覚、ターン管理、言語生成、表現制御のいずれに起因する場合もある。開発者には、どの判断が失敗したのかを明らかにするツールが必要だ。
それでもGriffinの発表は、競合に対する基準を引き上げる。顔が発話中に聞いていないなら、反応のよい声と説得力のある顔を組み合わせるだけでは、もはや十分ではない。
NVIDIAの動画ベンチマークにおけるTavus GriffinとGeminiの比較
NVIDIAのベンチマークはGriffinの対話上の優位性を裏付けるが、モデルが人間として通用したというTavusの別の主張を検証するものではない。
NVIDIAのVideo Full-Duplex Benchmark、通称VideoFDBは、会話エージェントが継続的な視聴覚行動をどのように知覚・生成するかを評価する。自然な2人のビデオ通話から、専門家がアノテーションを付けた237本のクリップを使用する。
クリップは、ターンテイキング、笑い、視線の変化、間、感情表現、割り込み、非言語的な相づちを含む11の会話ダイナミクスを対象とする。このベンチマークは知覚と生成を分離している。
知覚トラックでは、モデルが起きていることを解釈できるかを問う。生成トラックでは、エージェントが適切なタイミングで適切な発話と非言語行動を生み出すかを評価する。
公開されているVideoFDB leaderboardでは、Griffin-Liteは知覚の総合スコア3.73を記録している。Gemini 2.5 Flash Nativeは3.17、Gemini 3.1 Flash Liveは2.84だ。
OpenAIのgpt-realtimeとgpt-realtime-miniは、それらを下回り、知覚の総合スコアはそれぞれ2.75と2.73となっている。オープンソースのMiniCPM-o 4.5モデルは3.40を記録した。
Griffin-Liteは、Gemini 2.5 Flash Nativeの3.37に対して、視覚的グラウンディングでも3.92を獲得している。測定されたタイミング結果は、2,232ミリ秒で73.8%だった。
これらの数値は慎重に読む必要がある。MiniCPM-o 4.5は720ミリ秒でより速いタイミング結果を記録し、VITA-1.5は400ミリ秒に達している。したがって、Griffinの優位性は、測定上のレイテンシーが最も低いことを意味しない。
生成トラックでは、Griffinとカスケード型アバターシステムの差がより明確になる。Griffin-Liteは総合3.83を獲得し、人間の参照スコア3.92に近い。
Gemini 2.5とAnamのカスケードは2.80、Gemini 2.5とKeyframeの組み合わせは2.39を記録した。Griffinは流暢さ、感情との一致、適切な非言語的手掛かりの選択でも高いスコアを得ている。
これはTavusのメカニズムに関する主張を支持する。音声と行動を継続的に協調させるよう構築されたシステムは、このベンチマークにおいて、別のモデルにアバターを接続するテスト済みパイプラインよりも優れた結果を示した。
ただし、VideoFDBは、評価者にエージェントを人間だと信じるかどうかを問うものではない。定義されたルーブリックを通じて、選択された会話行動を評価する。
採点プロセスにも限界がある。NVIDIAによれば、各カテゴリーの3つのルーブリック軸は言語モデルの判定者によって採点される。判定者間の一致は、77%から89%の割合で1点以内に収まる。
NVIDIAは、システムをリーダーボードに追加する前に、提出されたモデル出力を採点する。これは企業が自社の提出物を採点するより独立性が高いが、複数の外部研究機関による制約のないテストと同等ではない。
このベンチマークには人間の参照と複数のよく知られた競合が含まれ、比較に役立つ。その範囲は、言語、アクセント、照明条件、感情的な状況、長時間の会話をまたぐ実運用よりも狭いままだ。
公平な結論は具体的だ。Griffin-Liteは現在、フルデュプレックスの視聴覚会話を中心に設計されたベンチマークで高い性能を示している。これは、そのアーキテクチャが対話品質を改善するというTavusの主張を強める。
人と一般的に区別できないことを確立するものではない。その別の主張についてTavusが示している証拠は、同社自身の参加者調査である。
48%の動画チューリングテストが証明しないこと
48%という結果が測定するのは、管理された1分間の通話における第一印象のもっともらしさであり、持続的な人間との同等性ではない。
Tavusは独立したリサーチプラットフォームを通じて参加者を募集した。参加者には、その年に楽しみにしていることについて、別の参加者と1分間話すと伝えられた。
実際の相手は、顔、声、応答をリアルタイムで生成するGriffin-Liteアバターだった。Tavusは、別のアンケート質問の後にのみ、相手の正体について尋ねた。
54人の参加者のうち、26人が相手は実在の人物だと信じたと回答した。これが広く共有された48%という数値につながっている。
Tavusの従来システムとの比較は大きい。同じ報告プロトコルの下で、Phoenix-4.5、Sparrow-2、Raven-1のスタックを人間だと誤認した参加者は41人中1人、率にして2.4%だった。
「本物」を選んだ参加者の平均確信度は79%だった。AIを選んだ人の確信度は81%だった。不審に思った人は、概して最初の20秒以内にそう感じ始めた。
Griffin-Liteは、7段階評価で平均5.4の自然さスコアを得た。参加者は信頼性を5.6、もう一度会話したいと思うかを5.8と評価した。
報告された指標で最も弱かったのは会話の流れで、平均4.9だった。この結果は重要である。自然なタイミングこそが、このモデルの中核的な約束だからだ。
これらのデータは、Tavusの従来スタックに対する大幅な改善を示している。ただし、標準的なビデオ・チューリングテストをシステムが「通過した」かどうかを確定するものではない。そのようなテストを定義する普遍的に受け入れられたプロトコルは存在しないためだ。
Alan Turingの原典である模倣ゲームは、テキストベースのやり取りに焦点を当てていた。現代のアバター向けに、標準化された1分間のビデオ試験や48%という閾値を定めたものではない。
したがって、「video Turing test」という用語は、Tavusがこの実験を位置付けるための表現である。独立した標準化団体が発行する認証ではない。
公開された説明には、方法論上いくつか未回答の疑問が残る。Tavusは、参加者がどの程度代表性を持つのか、また人口統計グループごとに結果がどう異なったのかを判断するのに十分な情報を提供していない。
1分間の会話では、記憶、事実的一貫性、難しい割り込み、珍しい視覚入力、変化する感情的文脈を検証する時間もほとんどない。より長い通話では、アーティファクトや行動上の矛盾が現れる機会が増える。
選ばれた話題は、社会的に取り組みやすく予測可能だった。その年に何を楽しみにしているかを尋ねる質問は、短く前向きな回答を促す。討論、共同作業、技術的な診断、または繊細な個人的会話なら、異なる要求が生じるだろう。
参加者には、AIをテストしているとは告げられていなかった。これは自発的な知覚を測る助けになるが、同じ人々が合成的な手がかりを積極的に探しながらアバターを評価した場合にどう判断するかは示さない。
この研究では、Tavusが管理する単一の提示形式も用いられた。異なる顔、声、ネットワーク状況、デバイス、言語、周囲の環境によって、結果は変わり得る。
最も重要なのは、この研究が、自社製品を評価する企業自身によって設計・報告された点だ。独立したプラットフォームを通じた参加者募集は、実験全体が独立検証されたことを意味しない。
だからといって、この結果が無意味になるわけではない。ベンダーによる研究は、新しいシステムに関する最初の証拠を提供することが多い。結論は、プロトコルに見合う範囲にとどめるべきだという意味である。
裏付けられている主張は、Griffin-Liteが特定の1分間のやり取りで26人を納得させた、ということだ。裏付けのない飛躍は、Griffinが通常のビデオ通話全般で人間を確実に装える、という主張である。
さらに深い概念的な限界もある。人間らしく見えることは、意識、真実性、判断力、あるいは幅広い知能を測るものではない。定義された条件下で、観察者がそのシステムを人工的なものと識別するかどうかを測るにすぎない。
Griffinはうなずくタイミングに優れていても、誤った回答を返す可能性がある。混乱を察知しても、その助言がもたらす結果を理解していないかもしれない。人間らしい提示は、実際の能力を高めずに、能力が高いという印象を強め得る。
企業の購入担当者にとって、この区別は不可欠だ。評価では、会話の自然さを、タスクの正確性、ポリシー順守、データ処理、人間への安全なエスカレーションから分けなければならない。
Human Interaction Modelが生む開示の問題
Griffinの最も説得力ある能力は、同時に最も明確なリスクでもある。人のように振る舞うことで、ユーザーが人工的な話者を信頼してしまう可能性がある。
Tavusはこの対立を直接認めている。同社によれば、自然なコミュニケーションを可能にする性質そのものが、エージェントはAIではないと誰かに信じ込ませる可能性がある。
この懸念が、限定的な公開の理由を説明している。Griffin-Liteは選ばれた研究テスターに提供されているが、Tavusによれば、顧客はまだ同社のプラットフォームを通じて導入できない。
Tavusは、より広範な公開に先立ち、開示機能と追加の安全手順を開発しているとしている。この発表では、最終的な開示設計、公開基準、執行メカニズムは明らかにされていない。
開示は、やり取りの全期間にわたり有効でなければならない。通話前に表示される通知は、途中から参加した人、切り抜かれた録画を受け取った人、別のサービスを通じてアバターを見た人には役立たない可能性がある。
継続的な視覚ラベルはより強い通知になり得るが、切り抜きや削除の対象になり得る。音声による開示は、長い会話の間に忘れられるかもしれない。メタデータはプラットフォームによる合成メディアの識別を助けられるが、非対応システム上のユーザーを保護するものではない。
リスクは直接的ななりすましにとどまらない。人間らしいエージェントは、特定の人物を模倣せずとも、過度な感情的信頼を生み出し得る。
指導用アバターは忍耐強く注意深いように見えるかもしれない。営業エージェントはためらいを映し出すかもしれない。サポートエージェントは共感を示すかもしれない。こうした振る舞いにより、ユーザーはシステムに存在しない理解力、慎重さ、あるいは権威を推測してしまう可能性がある。
音声クローンはさらに別の層を加える。Tavusによれば、Griffin-Liteは約10秒の音声から声を再現できる。したがって、同意と本人性の管理は、レンダリング品質と同じくらい重要である。
なりすましはすでに主要な詐欺カテゴリーだ。米国連邦取引委員会は、消費者が2024年になりすまし詐欺で約30億ドルを失ったと報告している。
この数字はより広範な詐欺を対象としており、Griffinや同等のビデオエージェントが引き起こした損失を測るものではない。だが、ますます説得力を増す合成的な発信者が参入する環境を示している。
Human Interaction Modelを評価する企業には、複数のレベルでの統制が必要になる。顔と声に対する検証済みの権限付与、継続的な開示、限定されたユースケース、監査可能な対話ログ、明確なエスカレーション経路が必要だ。
高リスクな文脈では、より慎重な対応が求められる。医療、金融サービス、雇用、教育、法的支援には、知覚される共感が情報開示や同意に影響し得る判断が関わる。
アバターが注意深く見えるため、ユーザーは機微な情報を共有するかもしれない。システムの表情は、その助言が正確であることも、データの取り扱いがユーザーの期待に合うことも保証しない。
開発者は行動上の失敗もテストする必要がある。苦痛の場面で笑う、怒りをまねる、開示を遮るアバターは、その言葉がポリシー要件を満たしていても害を及ぼし得る。
Griffinによって、これらの問題は切迫したものになっている。非言語的な振る舞いはもはや装飾的な出力ではない。Tavusはそれをモデルの会話的意思決定ループの内部に組み込んでいる。
したがって中心的な競争上の緊張は、Tavus対ある一社のアバター企業ではない。継続的な人間らしい対話と、開示および信頼の限界との間にある。
Tavusが自然な会話を実現しながら明確な機械としてのアイデンティティを維持できれば、Griffinのアーキテクチャは実用的なインターフェースを改善し得る。自然さがアイデンティティの曖昧さに依存するなら、導入はユーザー、規制当局、企業のリスクチームから抵抗を受けるだろう。
Tavus Griffinプレビュー後に注目すべき点
Griffinが持続的なプラットフォームの進歩となるか、それとも印象的だが統制されたプレビューにとどまるかは、3つのシグナルによって決まる。
第一のシグナルは、参加者研究の独立した再現だ。研究者は、より大きなサンプル、複数のアバター、多様な話題、より長い通話でプロトコルを繰り返すべきである。
再現研究では、情報を与えられた参加者と与えられていない参加者も比較すべきだ。これにより、ユーザーが合成的な振る舞いを積極的に評価する場合にも、Griffinが説得力を維持するかどうかが明らかになる。
より長いテストなら、1分間の会話では捉えられない一貫性の問題が露呈する。また、やり取りが文脈を積み重ねるにつれて、ユーザーの不審感が強まるのか弱まるのかも示せる。
独立チームがTavusの48%という数字に近い結果を得れば、同社のビデオ・チューリングテストに関する主張は信頼性を増す。大幅な低下が見られれば、公開時の結果が選定されたプロトコルに大きく依存していたことを示すだろう。
第二のシグナルは、より広範なVideoFDBへの参加だ。Griffinは現在、公開されている知覚および生成の結果で首位に立っているが、より強力なシステムが登場すればリーダーボードは変化する。
より多くの商用アバタープロバイダーによる直接投稿は、比較を改善する。Google、OpenAI、オープンソースチームによる更新モデルも、Griffinの優位を縮める可能性がある。
最も有益な結果は、視覚的理解と流暢な提示を分けて評価するものになる。視覚ストリームを無視したり会話を誤処理したりするシステムが、反応的に見えるだけで広範な評価を得るべきではない。
第三のシグナルは、Tavusの公開パッケージだ。同社は、提供形態、通常のネットワーク環境におけるレイテンシ、開発者向けの制御、開示機能、音声とアイデンティティの複製に関する制限を定義する必要がある。
本番環境の証拠には、より長いセッションと多様な環境における性能を含めるべきだ。購入者には、継続的な会話ループ内で行われた判断をレビューする手段も必要になる。
Griffinの最も強い成果は、人間になったことではない。リアルタイムのビデオモデルが、ユーザーの知覚を変えるほど十分な人間的な会話シグナルを協調させられるようになったことだ。
この変化は、指導者、サポートエージェント、ロールプレイシステム、視覚アシスタントを構築する開発者にとって重要である。また、製品内のアイデンティティ、同意、信頼に責任を持つ人にとっても重要だ。
有用な次のステップは、実際に重視するタスクに対してTavus Griffin AIをテストすることだ。正確性、割り込み、開示の記憶、視覚的グラウンディング、エスカレーションの振る舞いを個別に測定する。そのうえで、1分間のチューリングテストでは答えられない問いを投げかけるべきだ。人間らしく見える新鮮さが薄れた後も、そのエージェントは信頼に値するのか。



