Tavus Griffin AI 让 48% 的通话者误以为是真人,但其视频图灵测试仍需结合背景解读
Tavus 推出了 Griffin:在一项简短的实时研究中,48% 的参与者将 Tavus Griffin AI 虚拟形象误认为真人。该公司称 Griffin 是首个 Human Interaction Model,也是首个通过实时视频图灵测试的系统。
这一结果听起来像是类人 AI 的明确胜利。更准确地说,它表明在一项范围有限的测试中,实时视频智能体已跨越了一个值得关注的交互门槛。该研究由 Tavus 设计、实施并发布结果,共有 54 名 Griffin-Lite 参与者,通话时长为一分钟。
更具独立可比性的结果来自 NVIDIA 的 Video Full-Duplex Benchmark。Griffin-Lite 在该基准测试的受评系统中,无论感知还是生成均居于领先,在多项对话指标上超过 Gemini 和 OpenAI 模型。这两项评估共同表明,Tavus 改进了虚拟形象在对话中的表现方式,但并未证明其能够稳定地伪装成人类。
Tavus Griffin AI 实际带来了什么
Griffin 将 AI 视频的基本单位从一次生成的回复,转变为持续管理的交互。
Tavus 于 2026 年 10 月 1 日在旧金山发布 Griffin。最初的 Griffin-Lite 版本是仅向部分测试者开放的研究预览版,并非面向所有客户普遍提供的产品。
该公司将 Human Interaction Model 描述为一类专为实时理解和生成面对面互动而设计的系统。它在生成自身语音和视频的同时,处理语音、视觉行为、时机以及非语言信号。
这一描述让 Griffin 有别于许多现有的虚拟形象系统。传统系统通常会先转录语音,再将文本发送至语言模型,生成回复后转换为音频,并为面部制作动画。每个组件都要等前一环节完成足够的工作后才开始运行。
Griffin 仍包含不同的技术引擎,但 Tavus 表示它们会并行工作。其对话组件持续处理传入的音频和视频;第二个组件则将决策转化为同步的语音、面部行为、视线和手势。
公司详细的 Griffin research 表示,该模型会以亚秒级间隔重新评估对话过程。每个间隔中,它可以继续聆听、回应说话者、打断、等待,或让出发言权。
这很重要,因为对话并不只是完整句子之间的交换。人们会在说话者结束前点头,会在不放弃发言权的情况下停顿,会在思考时移开视线,也会在察觉对方反应后改变表达方向。
回合制智能体经常处理不好这些信号。它们会打断沉思中的停顿,会在情绪化表述时面无表情,或在用户试图插话后继续说下去。
Griffin 的目标是让这些时刻成为模型核心决策过程的一部分。Tavus 表示,在一句话中途作出的改变,也可以在同一段对话内影响虚拟形象的声音和面部表现。
据 Tavus 称,该生成系统还会根据一张参考图像生成完整可见场景。这包括面部、身体、背景、阴影和附近物体,而不只是为嘴部或面部网格制作动画。
公司发布的演示展示了一个虚拟形象对升职作出反应、玩“Simon Says”、跟随魔方,以及协助他人焊接主板。这些仍是公司挑选的演示案例,但它们阐明了视觉上下文的预期用途。
Tavus 表示,Griffin-Lite 预览版还可以从约十秒的参考音频中克隆声音。其因果音频解码器能够生成最小仅 10 毫秒的数据包,此时回复后续部分仍在生成中。
这些细节并不能证明它与人类等同。但它们解释了为何 Griffin 看上去可能比由较慢、串行组件拼装而成的虚拟形象更专注。
因此,眼前这一事件的意义不止于一张新的合成面孔。Tavus 正将交互时机、视觉感知和表现性生成视为一个模型层面的统一问题。
为什么全双工视频让回合制智能体承受压力
竞争压力来自 Griffin 将倾听和回应视为同步活动,而非彼此分离的回合。
全双工通信意味着双方可以同时发送和接收信息。在 AI 对话中,系统会在说话时持续倾听和观察,随后无需等待完整的新回合便作出调整。
级联式架构对这一体验的处理方式不同。语音识别先将用户的话转换为文本,语言模型生成答案,再由独立系统合成音频和虚拟形象动作。
这种模块化方式具有实际优势。开发者可以替换单个组件、检查转录文本,并选择专用模型。但它也会产生交接环节,使时机、语调、视线和其他上下文可能丢失。
Griffin 的核心主张是:一个令人信服的视频智能体,无法在把交互简化为文本后再恢复这些信号。它必须持续建模用户说了什么、如何说,以及摄像头中展示了什么。
设想一位客户在摄像头前拿着一个损坏的组件。以文本为中心的智能体必须依赖用户识别该物体,或提供有用的口头描述。视觉智能体则可以检查该部件,并针对屏幕上显示的内容作出回应。
对话层面的挑战更为微妙。如果客户在重新摆放组件时停顿,智能体不应假定提问已经结束。如果客户再次开始说话,智能体应当停止或让出发言权,同时不丢失上下文。
同样的原则也适用于辅导教学。学生的表情或持续犹豫,可能在他们直接说出来之前就表明困惑。能够注意到这些线索的智能体,可以改变解释方式,或等待学生完成思考。
角色扮演和演练是另一种合理用途。练习面试或艰难职场对话的用户,需要一个能在恰当时机作出反应的对话对象,而不是一个只会背诵精心润色答案的虚拟形象。
这些场景解释了为什么 Google、OpenAI、Tavus 和开源研究者都在研究实时多模态交互。下一场界面竞争不只关乎哪个模型能生成最佳的孤立答案。
它还关乎智能体能否占据对话时间,而无需让用户来管理它。长时间沉默、意外打断、表情僵硬和延迟的视觉反应,都会暴露系统底层的问题。
Tavus 尚未证明其方法能够取代模块化架构。生产系统必须在自然行为与成本、可靠性、可控性、安全性,以及审计单个组件的能力之间取得平衡。
统一的行为循环也可能让故障更难定位。不恰当的打断可能源于感知、回合管理、语言生成或表现控制。开发者需要能揭示究竟是哪项决策失效的工具。
尽管如此,Griffin 的发布提高了竞争对手的标准。如果一张令人信服的面孔在说话时并不倾听,那么仅将响应迅速的语音与其配对已不再足够。
Tavus Griffin 与 Gemini 在 NVIDIA 视频基准测试中的对比
NVIDIA 的基准测试支持 Griffin 的交互优势,但并未验证 Tavus 关于该模型能够伪装成人类的另一项主张。
NVIDIA 的 Video Full-Duplex Benchmark(简称 VideoFDB)评估对话智能体如何感知和生成连续的视听行为。它使用了 237 段由专家标注的自然双人视频通话片段。
这些片段覆盖 11 种对话动态,包括轮流发言、笑声、视线变化、停顿、情绪表达、打断和非语言回应。该基准将感知与生成分开评估。
感知赛道考察模型是否能理解正在发生的情况。生成赛道则评估智能体能否在恰当的时机产生合适的语音和非语言行为。
在已发布的 VideoFDB leaderboard 上,Griffin-Lite 的总体感知得分为 3.73。Gemini 2.5 Flash Native 得分为 3.17,Gemini 3.1 Flash Live 得分为 2.84。
OpenAI 的 gpt-realtime 和 gpt-realtime-mini 排在这些结果之后,总体感知得分分别为 2.75 和 2.73。开源模型 MiniCPM-o 4.5 得分为 3.40。
Griffin-Lite 的视觉定位得分也达到 3.92,而 Gemini 2.5 Flash Native 为 3.37。其测得的时机表现为 73.8%,对应 2,232 毫秒。
这些数字需要谨慎解读。MiniCPM-o 4.5 的时机结果更快,为 720 毫秒;VITA-1.5 则达到 400 毫秒。因此,Griffin 的领先并不意味着它具有最低的实测延迟。
生成赛道在 Griffin 与级联式虚拟形象系统之间形成了更鲜明的差异。Griffin-Lite 的总体得分为 3.83,接近人类参考得分 3.92。
由 Gemini 2.5 和 Anam 组成的级联系统得分为 2.80。Gemini 2.5 与 Keyframe 的组合得分为 2.39。Griffin 在流畅度、匹配情绪以及选择恰当非语言线索方面也获得了更高分数。
这支持了 Tavus 关于其机制的论点:与为另一模型附加虚拟形象的受测流水线相比,专为持续协调语音与行为而构建的系统在该基准上表现更好。
不过,VideoFDB 并不询问评估者是否认为智能体是人类。它通过既定量表评估特定的对话行为。
评分过程也存在局限。NVIDIA 表示,每个类别中的三个量表维度均由语言模型评审打分。评审之间的评分有 77% 至 89% 的时间相差不超过一分。
NVIDIA 在将系统加入排行榜前会对提交的模型输出进行评分。这比公司自行为自身提交结果评分更具独立性,但并不等同于多个外部实验室进行的不受限制测试。
该基准包含人类参考和多个知名竞争对手,因此可用于比较。其范围仍比跨语言、口音、光照条件、情绪场景和长时间对话的实际部署更窄。
合理的结论应当具体明确:Griffin-Lite 目前在围绕全双工视听对话设计的基准测试中表现良好。这加强了 Tavus 关于其架构能够提升交互质量的主张。
但这并不能证明 Griffin 在普遍情况下与真人无法区分。Tavus 自己的参与者研究,才是其为这一独立主张提供的证据。
48% 的视频图灵测试并不能证明什么
48% 的结果衡量的是在受控一分钟通话中的第一印象可信度,而非持久的人类等同性。
Tavus 通过一个独立研究平台招募参与者。参与者被告知,他们将与另一位参与者交谈一分钟,话题是自己当年最期待的事。
他们的对话伙伴实际上是一个 Griffin-Lite 虚拟形象,实时生成其面部、声音和回应。Tavus 仅在其他调查问题之后,才询问参与者对对方身份的看法。
在 54 名参与者中,26 人表示相信自己的对话伙伴是真人。这便形成了被广泛传播的 48% 数据。
与 Tavus 之前的系统相比,这是一项显著进步。根据相同的报告协议,在 41 名参与者中,有 1 人将 Phoenix-4.5、Sparrow-2 和 Raven-1 的组合误认为真人,占比为 2.4%。
选择“真人”的参与者平均置信度为 79%。选择 AI 的参与者置信度为 81%。产生怀疑的人通常会在前 20 秒内察觉异常。
Griffin-Lite 在七分制量表上的自然度平均得分为 5.4。参与者对其可信度的评分为 5.6,对“是否愿意再次与其交谈”的评分为 5.8。
报告中表现最弱的指标是对话流畅度,平均为 4.9。这一结果很重要,因为自然的时机把握正是该模型的核心承诺。
这些数据表明,Tavus 相较于此前的技术栈实现了重大改进。但它们并不能确定该系统是否“通过”了标准视频图灵测试,因为目前尚无被普遍接受的协议来定义这种测试。
Alan Turing 最初的模仿游戏聚焦于基于文本的交流。它并未设立标准化的一分钟视频测试,也没有为现代数字化身定义 48% 的门槛。
因此,“视频图灵测试”这一说法是 Tavus 对其实验的界定,而非由独立标准机构颁发的认证。
已发布的说明中仍有若干方法论问题未获解答。Tavus 没有提供足够信息,无法判断参与者的代表性,或结果在不同人口统计群体之间如何变化。
一分钟的对话也几乎没有时间测试记忆、事实一致性、棘手的打断、罕见的视觉输入或不断变化的情绪语境。更长的通话会为瑕疵和行为矛盾的显现创造更多机会。
所选话题在社交层面较为轻松且可预测。询问某人对这一年有什么期待,通常会引出简短、积极的回答。辩论、协作任务、技术诊断或敏感的个人对话则会带来不同的要求。
参与者并未被告知自己正在测试 AI。这有助于衡量自发感知,但无法说明同一批人在主动寻找合成线索时会如何评价该数字化身。
研究还采用了 Tavus 控制的一种展示形式。不同的面孔、声音、网络条件、设备、语言和周边环境都可能改变结果。
最重要的是,这项研究由其所评估产品的公司设计并报告。通过独立平台招募参与者,并不意味着整个实验已获得独立验证。
这并不意味着结果毫无意义。供应商研究往往为新系统提供最初的证据。它意味着结论应与实验协议相称。
有证据支持的说法是,在特定的一分钟互动中,Griffin-Lite 说服了 26 人。缺乏支持的跳跃式结论则是,Griffin 能在日常视频通话中可靠地冒充人类。
这里还存在更深层的概念局限。表现得像人类并不衡量意识、真实性、判断力或广泛智能。它衡量的是,在既定条件下,观察者是否将系统识别为人工产物。
Griffin 或许非常擅长把握点头时机,却仍可能给出错误答案。它或许能察觉困惑,却不理解其引导所带来的后果。类人化呈现可能提高人们感知到的能力,却不会提升实际能力。
对企业买家而言,这一区别至关重要。评估必须将对话自然度与任务准确性、政策合规、数据处理以及安全地转交给人工人员的能力区分开来。
人类交互模型带来了披露难题
Griffin 最具说服力的能力,也是其最明显的风险:由于它表现得像人,用户可能会信任一位人工说话者。
Tavus 直接承认了这一冲突。该公司表示,使自然沟通成为可能的同一组特性,也可能让人误以为该代理并非 AI。
这一担忧解释了其有限发布的策略。Griffin-Lite 已向部分研究测试者开放,但 Tavus 表示,客户目前尚不能通过该公司的平台部署它。
Tavus 表示,在更广泛发布之前,公司正在开发披露功能和额外的安全流程。公告没有说明最终的披露设计、发布标准或执行机制。
披露必须在整个互动过程中持续有效。通话前显示的一则提示,可能无法帮助迟到加入的人、收到剪辑录音的人,或通过其他服务看到该数字化身的人。
持续的视觉标识可以提供更强的提示,但可能被裁剪或移除。口头披露可能在长时间对话中被遗忘。元数据可以帮助平台识别合成媒体,但无法保护使用不受支持系统的用户。
风险不止于直接冒充。类人代理即使没有复制某个特定人物,也可能制造过度的情感信任。
辅导数字化身可能显得耐心且专注。销售代理可能会模仿犹豫。支持代理可能表现出同情。这些行为可能使用户推断该系统具备其实际上并不拥有的理解力、审慎性或权威性。
声音克隆又增加了一层风险。Tavus 表示,Griffin-Lite 能够根据约十秒钟的音频复现声音。因此,同意与身份控制和渲染质量同样重要。
冒充已经是主要的欺诈类别。美国联邦贸易委员会报告称,消费者在 2024 年因冒充诈骗损失近 30 亿美元。
这一数字涵盖了更广泛的诈骗类型,并不衡量 Griffin 或类似视频代理造成的损失。它反映的是愈发逼真的合成来电者将进入的环境。
评估人类交互模型的企业需要在多个层面设置控制措施:对面孔和声音的经验证授权、持续披露、受限的使用场景、可审计的互动日志,以及明确的升级路径。
高风险场景需要更加谨慎。医疗保健、金融服务、就业、教育和法律支持涉及的决策中,感知到的共情能力可能影响信息披露或同意。
用户可能因为数字化身看起来很专注而分享敏感信息。系统的表情并不能保证其建议准确,也不能保证其数据实践符合用户预期。
开发者还需要测试行为失误。即使其措辞符合政策要求,数字化身在他人痛苦时微笑、模仿愤怒或打断披露,都可能造成伤害。
Griffin 让这些问题变得紧迫,因为非语言行为不再只是装饰性的输出。Tavus 将其置于模型的对话决策循环之中。
因此,核心竞争张力并非 Tavus 与某一家数字化身公司的竞争,而是持续、类人化互动与披露和信任边界之间的矛盾。
如果 Tavus 能在提供自然对话的同时保留清晰的机器身份,Griffin 的架构可能改善实用界面。如果自然度依赖于身份上的模糊性,其采用将面临用户、监管机构和企业风险团队的阻力。
Tavus Griffin 预览版之后应关注什么
三项信号将决定 Griffin 会成为持久的平台进步,还是仅仅停留在令人印象深刻的受控预览。
第一个信号是参与者研究的独立复现。研究人员应以更大的样本、多种数字化身、不同话题和更长通话重复该协议。
复现还应比较知情与不知情的参与者。这将揭示当用户主动评估合成行为时,Griffin 是否仍然具有说服力。
更长的测试将暴露一分钟对话无法捕捉的一致性问题。它还将显示,随着互动累积更多语境,用户会变得更可疑还是更不易起疑。
如果独立团队获得接近 Tavus 所报告 48% 的结果,该公司的视频图灵测试主张将更具可信度。若结果大幅下降,则说明发布结果在很大程度上依赖于其选定的实验协议。
第二个信号是更广泛的 VideoFDB 参与。Griffin 目前在已发布的感知和生成结果中领先,但随着更强系统进入,排行榜也会发生变化。
来自更多商业数字化身提供商的直接提交,将改善比较的质量。Google、OpenAI 和开源团队的更新模型也可能缩小 Griffin 的领先优势。
最具参考价值的结果将把视觉理解与流畅呈现区分开来。如果一个系统忽视视觉流或处理不好对话,就不应仅因看起来反应灵敏而获得广泛认可。
第三个信号是 Tavus 的发布方案。该公司需要明确可用性、普通网络条件下的延迟、开发者控制、披露功能,以及对声音和身份复制的限制。
生产环境证据应包括在更长会话和多样环境下的表现。买家还需要能够审查连续对话循环内部决策的方法。
Griffin 最强的成果并不是它已经成为一个人,而是一个实时视频模型如今已能协调足够多的人类对话信号,从而改变用户感知。
这一变化对构建辅导工具、支持代理、角色扮演系统和视觉助手的开发者至关重要。对于任何负责产品内身份、同意或信任的人而言,这也同样重要。
下一步应是根据你实际关心的任务测试 Tavus Griffin AI。分别衡量准确性、打断处理、披露记忆、视觉依据和升级行为。然后提出一分钟图灵测试无法回答的问题:当“看起来像人”的新鲜感消退后,这个代理是否仍然值得信赖?



