top of page

Google 的 Gemini 3.8 Live Avatar 正式可用,真正的考验是生产环境信任

56分钟前
讀畢需時 14 分鐘

Google 已将 Gemini 3.8 Live Avatar 正式推向市场,尽管信任问题尚未完全解决,仍将这款实时视频智能体从预览阶段带入企业生产环境。

9 月 24 日发布的版本将语音、实时视觉理解、同步虚拟形象视频和业务系统操作整合进一个流式模型。Google 表示,企业可通过 Gemini Enterprise 在网页应用、移动服务和互动信息亭中部署该功能。

相比单纯的动态面孔,这种整合更重要。大多数对话智能体仍需连接转录、推理、语音生成、工具执行和视觉呈现等独立组件。每一次连接都可能增加延迟、丢失上下文,或带来新的故障点。

Gemini 3.8 Live Avatar 以更集成的运行时架构挑战这种拼接式方案。它可以在后端任务运行时继续说话、解读摄像头画面,并在同一会话中切换语言。Google 还表示,虚拟形象会在整个交互过程中保持同步。

眼下的压力落在那些将语音智能体、虚拟形象生成器和编排层作为独立产品销售的供应商身上。OpenAI 的 Realtime API 是语音到语音智能体的重要替代方案,但 Google 的公告将竞争扩展到了生成式视觉呈现领域。

正式可用并不能决定这场竞争的胜负。它意味着 Google 认为该服务已准备好支持生产工作负载。企业买家仍须在自身环境中验证延迟、任务准确率、身份控制、无障碍能力、运营成本和用户接受度。

Gemini 3.8 Live Avatar 从演示走向部署

此次发布使 Live Avatar 从会议预览版转为受支持的企业服务,并提供明确的部署区域和生产容量选项。

Google 最初在 Google Cloud Next 2026 上预览了这项技术。其发布公告现将 Live Avatar 纳入 Gemini Enterprise,并在美国和欧盟提供端点。

该产品可生成带有同步语音和唇部动作的对话视频。用户可选择精选虚拟形象,或在获得额外批准后,基于参考图像和语音样本创建虚拟形象。

自定义虚拟形象仍受企业白名单机制限制。这一限制很重要,因为个性化数字面孔相比通用角色会带来更高的冒充、同意和品牌风险。

Google 表示,每个生成的音频和视频流都带有不可感知的 SynthID 水印。该水印旨在帮助识别 AI 生成媒体,同时不会在视觉上改变用户体验。

该模型还可接收实时摄像头画面和屏幕共享。这使智能体能够根据用户展示的内容作出响应,而非仅依赖口头描述或上传文件。

客户可在保险理赔期间将手机摄像头对准受损财产。智能体可以讨论损坏情况、收集信息、核查保单规则,并为人工理赔员准备材料。

Google 使用实时界面背后的 Agent Development Kit 团队演示了这一场景。虚拟形象负责对话,而支持智能体则核查保单并填写受理记录。

另一项公布的案例来自 Cox Automotive。其 Autotrader 助手利用对话式引导、屏幕高亮和工具调用,帮助消费者搜索库存并比较车辆。

Equal AI 则提供了不同规模的信号。该公司表示,其个人 AI 每天以九种印度语言处理超过 100 万通实时通话。其 CEO 将更好的打断处理、多语言对话和工具可靠性归功于 Gemini 3.8 Live。

这些案例仍属于客户和供应商的说法,并非独立评估。但它们仍展示了 Google 希望买家与此次发布关联的工作负载:服务、销售、受理、引导和交易支持。

底层模型也可通过 Gemini Live API 使用。开发者可以定义工具、会话行为、语音和虚拟形象设置,同时将模型连接到自己的应用。

Google 的模型规格列出最大输入为 128,000 个 token,最大输出为 64,000 个 token。文档将 gemini-3.8-live 标识为生产模型 ID。

对于需要预留处理容量的组织,该模型支持 Provisioned Throughput。标准按量付费使用方式同样列出,但实际工作负载的经济性将取决于会话设计和模态使用情况。

Gemini 3.8 Live Extended Thinking 仍处于私密预览阶段。因此,买家应将正式可用的实时模型与 Google 更具审慎推理能力的实时推理选项区分开来。

这种区分使公告的实际范围比标题暗示的更窄。Google 推出的是具备虚拟形象输出的生产级对话模型,而非 3.8 系列相关的所有高级推理能力。

不过,进入正式可用阶段仍改变了采购讨论。团队如今可依据正式要求测试 Live Avatar,而不再仅将其视为实验性的会议演示。

原生管线才是真正的产品

Gemini 3.8 Live Avatar 的重要性在于,Google 正将多个实时智能体功能压缩到一个连续会话中。

传统语音智能体通常先将语音转换为文本。随后,语言模型解读该文本、选择操作,并向独立的语音引擎发送回复。

加入虚拟形象又会增加一层。系统必须将生成的语音与面部动作对齐、渲染视频、保留表情,并在不让对话显得延迟的情况下交付流媒体。

这些组件单独运行时都可能表现良好。问题出现在它们的边界处:时序、状态和错误处理必须跨越多个供应商和网络调用保持稳定。

Gemini 3.8 Live 使用有状态的 WebSocket 连接,也就是说,应用会在对话期间保持持续的双向通道。这支持流式输入和输出,而无需在每次交互时重新启动。

Google 的开发者指南称,该系统以亚秒级延迟处理语音、实时视觉输入和屏幕广播。它生成 24 kHz 音频,以及每秒 24 帧的同步虚拟形象视频。

这些规格属于 Google 的测量结果和设计说明。它们并不保证在不同设备、网络、区域或企业集成环境中都能实现相同性能。

更具影响力的功能可能是异步工具调用。工具调用是一种结构化请求,可让模型使用外部服务,例如客户数据库或预订系统。

较早的智能体设计通常会在该服务响应时暂停。尤其当业务系统需要数秒才能响应时,这种沉默会让用户怀疑调用是否失败。

Gemini 3.8 Live 可以在保持对话的同时启动后台任务。智能体可以在等待结果时解释下一步、回答相关问题,或确认存在延迟。

当某项操作必须在对话继续前完成时,该系统也支持阻塞式调用。如果收到新的用户输入,模型可以取消待处理的阻塞式调用,并回应更新后的请求。

这种行为解决了实时智能体中的一个微妙问题。人类对话经常改变方向,而软件工作流往往假设每项请求的操作都应执行到底。

自动取消可以防止用户纠正请求后,过时请求继续执行。不过,开发者仍须决定哪些业务操作可以安全取消,哪些需要明确确认。

打断处理遵循类似原则。Google 表示,当用户正在说话时,模型会等待,而不是在对方说话时交付已完成的工具响应。

这一点听起来很小,直到智能体开始处理情绪化或复杂的互动。即便事实回复正确,一个反复打断客户的助手也可能损害信任。

Gemini 3.8 Live 还采用原生语音到语音处理。这种方式可以保留语气、停顿及其他声学信号;而在经过独立转录步骤后,这些信号往往更难获取。

Google 将其响应调整能力称为情感化对话。该公司称,模型会聆听语音线索,并相应调整语调和对话节奏。

企业应将此视为需要测试的行为,而非经过验证的情感理解。语音信号会因个人、语言、残障情况、文化、设备和嘈杂环境而异。

该模型支持在 97 种语言之间自动切换。Google 表示,用户可在会话期间切换语言,无需选择新设置或重启连接。

Live Avatar 也会在这些切换过程中调整唇部动作和表情。这使多语言同步成为集成系统的一部分,而非最后的动画步骤。

这种原生设计构成了 Google 最明确的竞争论点。单一模型和运行时可减少构建多模态智能体所需的协调工作。

但它并未消除应用工程。开发者仍需要身份验证、权限、业务规则、审计记录、升级路径、数据连接和恢复行为。

他们还需要可靠的组织上下文。将智能体连接到受治理的 AI knowledge bases 可以改善检索,但团队必须控制每个会话可访问的信息。

因此,此次发布转移了工程负担,而非将其消除。Google 承担了更多实时媒体循环工作,客户仍需负责周边业务系统。

Gemini 3.8 Live Avatar 向拼接式语音智能体施压

Google 押注企业会偏好统一且受治理的实时技术栈,而非分别使用语音、推理、虚拟形象和编排服务。

竞争路线仍然是模块化方案。一家公司可以选择一个模型负责推理、另一项服务负责语音、由专业厂商负责虚拟形象渲染,并采用自己偏好的智能体框架。

这种方法提供灵活性。团队可以替换表现较弱的组件、与不同供应商谈判,并选择适合特定语言、行业或呈现风格的技术。

模块化还可减少对单一云平台的依赖。客户可以保留应用层,同时将语音处理或模型推理迁移至其他平台。

其代价是集成复杂性。每项服务都会带来各自的延迟特征、数据处理政策、配额系统、身份验证方式和发布周期。

实时视频智能体会放大这些依赖关系。音频不能与唇部动作脱节,工具结果不能覆盖较新的请求,视觉上下文也必须始终关联到正确的对话。

Google 的一体化路线承诺减少交接环节。但它也将更多交互集中在 Google 平台内部,包括音频、视频、模型推理、工具和会话状态。

这种集中为企业架构师带来了明确的权衡。一体化系统可以缩短开发周期,同时也提高了单一供应商在运营中的重要性。

OpenAI 仍是重要的参照点,因为其实时模型使原生语音交互成为核心 API 类别。开发者可以构建低延迟语音智能体,使用工具并支持自然打断。

Google 正通过模型生成的视频输出扩大这场竞争。Gemini 无需依赖独立的虚拟形象管线,即可将同步视频作为一种响应模态返回。

专业虚拟形象供应商仍有竞争空间。其优势可能包括角色设计、品牌控制、演示工具、既有媒体工作流,或超出单一模型供应商的部署选择。

传统联络中心平台同样保留着宝贵资产。它们已在大型服务组织中管理路由、质量监控、劳动力运营、合规记录和升级处理。

Google 的公告并不会取代这些系统。它创造了一个新的智能与呈现层,可以嵌入这些系统,也可能争夺其部分工作流。

Salesforce 展示了合作路线。Google 表示,其团队正与 Salesforce AI Research 合作,将 Gemini 3.8 Live 与 Agentforce 结合,用于客户服务体验。

这种关系也说明,将其简单描述为公司之间的对抗会产生误导。企业智能体市场融合了竞争、基础设施供给、软件集成和渠道合作伙伴关系。

更尖锐的竞争在于架构。企业应使用可互换组件组装实时智能体,还是采用能够处理更多技术栈环节的原生多模态运行时?

正确答案将因工作负载而异。引导式零售终端与医疗接诊、金融服务、员工培训或道路救援的要求并不相同。

有些体验能直接受益于视觉呈现。虚拟形象可以指向界面控件、示范实体操作、维持注意力,或提供可见的轮次交替提示。

另一些任务则几乎无法从生成的人脸中获益。查询账户余额的用户可能更偏好快速语音回复、文本确认或传统界面。

视频消耗的计算和网络资源也多于单独的音频。企业应衡量视觉层是否能充分提升任务完成率、理解度或满意度,以证明这部分开销合理。

因此,最佳比较方式并不是孤立地比较虚拟形象与无虚拟形象。采购方应比较不同界面设计下的完整任务结果。

他们应衡量成功解决率、升级频率、放弃率、纠正率和用户偏好。这些结果比虚拟形象在受控演示中看起来是否令人印象深刻更重要。

Google 的发布为团队提供了一个可信的一体化测试选项。但这并不证明该一体化方案将在每一次部署中胜出。

一张面孔提高了信任与同意的风险

视觉层可以让智能体更容易与人互动,但也会让身份失误和误导性行为造成更严重的后果。

人们会以社会化方式解读面孔。表情、眼神、时机和语调会影响说话者是否显得自信、专注、不确定或富有同理心。

因此,生成的虚拟形象不只是装饰语音界面。它可以放大人们对底层智能体人格与权威性的感知。

这种效应带来了设计机会。培训智能体可以演示客户互动,而数字礼宾员可以在复杂流程中提供可见提示。

但它也带来风险。用户可能会将人类式理解、问责能力或情感意识归因于一个根据输入信号预测回应的系统。

企业应明确将虚拟形象标识为 AI。披露信息应在互动开始时让人易于理解,而不应埋藏在政策页面中。

Google 表示,SynthID 已嵌入生成的音频和视频中。水印可以支持后续检测,但不能替代向正在交谈的人即时披露这一事实。

自定义肖像需要更加谨慎。Google 的虚拟形象配置说明,客户必须为人脸或语音样本取得必要的权利和同意。

该文档还禁止使用未成年人和名人的参考图像。自定义虚拟形象访问权限仍仅通过审批流程向部分企业客户开放。

这些控制措施降低了明显的滥用路径。但它们无法判定每位员工、承包商、客户或表演者是否都已就每一种预期用途给予知情同意。

组织需要建立自己的审批记录和退役流程。如果虚拟形象出现在未经批准的场景中,也需要制定响应计划。

品牌安全带来了另一项挑战。一名逼真的代表人物可能在显得镇定且权威的同时,发表错误陈述。

这种组合可能比普通聊天机器人出错更具说服力。界面能够提升信心,却不一定提高底层回答的准确性。

Google 的安全指南建议采用过滤器、系统指令、数据泄露防护和防御恶意提示等分层控制措施。

同一份指南也承认存在权衡。额外的安全检查可能增加成本和延迟,且罕见的漏检仍有可能发生。

这对实时对话尤为重要,因为延迟会改变体验。团队不能假设每增加一项政策检查,用户都不会察觉。

开发者必须决定哪些操作需要确认,哪些可以自动执行。产品搜索和金融转账不应采用相同的授权设计。

摄像头输入同样需要谨慎界定边界。能够看到屏幕或实体环境的智能体,可能会接触到人脸、文件、地址、账户详情或无关旁观者。

应用程序应尽量减少收集,并清晰显示录制状态。它们还应规定视觉输入如何存储、审查和删除。

区域端点可以支持数据驻留要求,但端点位置并不能解决所有治理问题。数据仍可能通过连接的工具、日志、监控服务或客户系统流动。

无障碍性也需要直接测试。虚拟形象不应成为获取信息、使用控件或寻求支持的唯一途径。

字幕、文字记录、键盘交互、屏幕阅读器兼容性、音频替代方案和人工升级仍然必要。面部动画本身并不能让体验具备无障碍性。

偏差测试必须涵盖口音、言语障碍、混合语言对话、背景噪音和不同摄像头。一项表现亮眼的平均结果,可能掩盖特定群体的糟糕体验。

企业还应审慎评估情绪适应。根据语音线索调整语调可以改善对话,但错误推断可能显得居高临下或不合时宜。

核心不确定性并不在于 Google 是否能够生成同步视频。其文档为开发者提供了实现这一点的具体接口。

不确定的是,组织能否在不夸大理解能力、不掩盖自动化、也不削弱同意机制的前提下部署这项能力。全面可用性让这项治理工作变得迫在眉睫。

生产就绪是一项主张,而非定论

全面可用性提供了支持与部署承诺,但每位采购方仍需要从自身工作负载中取得证据。

Google 将 Gemini 3.8 Live Avatar 定位为可用于企业生产环境。这一状态具有意义,因为它将该服务与保障有限的预览版本区分开来。

但生产就绪并不具有普遍性。一个智能体可能在引导式演示中表现良好,却在用户犹豫、转换话题、相互抢话或提供不完整信息时失效。

实时系统还要面对网络波动。移动网络、旧设备、限制严格的企业网络和拥挤的公共空间都会改变体验。

模型的输入视频被描述为每秒一帧,而虚拟形象输出则以每秒 24 帧运行。这些数字服务于不同功能,不应混为一谈。

输入流为模型提供周期性的视觉上下文。输出流则为观看虚拟形象的人创造流畅动画。

每秒一帧或许足以展示静态损坏,或跟随缓慢变化的屏幕。但它可能错过快速运动或细微的时间序列细节。

团队应测试他们实际计划支持的视觉任务。能识别挡风玻璃裂痕的系统,未必能可靠地理解快速的机械操作过程。

工具可靠性值得单独衡量。异步执行可以减少沉默等待,但并不能让客户数据库或企业资源系统正确响应。

对话层必须区分待处理、成功、失败、取消和不确定的操作。在底层交易完成前,用户绝不应听到确认信息。

开发者还需要实现幂等性,即重复请求不会意外执行同一操作两次。中断和重连使这一点尤为重要。

会话恢复构成另一项测试。如果工具调用期间网络中断,应用程序必须知道业务操作是否完成,以及用户已经听到了什么。

Google 提供模型和流式传输基础设施,而客户拥有大部分交易逻辑。该边界应在架构评审和事件计划中清晰体现。

质量衡量应考察完整旅程。语音识别、推理、工具选择、后端执行、响应措辞、语音交付和虚拟形象同步都可能各自独立失败。

综合满意度评分无法揭示哪个层级导致了问题。团队需要在保护隐私的同时支持诊断的结构化追踪记录。

人工升级也必须准确传递上下文。客户不应因为虚拟形象无法完成任务,就不得不重复整段互动。

这种交接应包括相关事实、已完成操作、待处理事项和不确定因素。敏感视觉材料仅应在政策和用户同意允许时传递。

企业应在将 Live Avatar 用于高影响工作流前开展受控试点。早期部署应采用有限权限和可逆操作。

零售导览或员工培训助手,比医疗建议、信贷决策或账户变更提供了更安全的验证场景。

第一个有用的基准不是用户是否认为虚拟形象很逼真,而是他们能否以更少错误和可接受的投入完成预期任务。

第二个基准是信任校准。用户应了解智能体知道什么、能做什么,以及何时仍由人类负责。

第三个基准是运营韧性。团队必须了解服务在高负载、区域中断以及连接工具不可用时的表现。

Gemini 3.8 Live Avatar 已跨过 Google 的发布门槛。企业是否接受它,将取决于该门槛之后收集到的证据。

企业采购方接下来应关注什么

三个信号将表明 Google 的一体化视频智能体战略会成为持久平台,还是仍只是一种专业界面。

第一个信号,是其是否在受控演示之外获得采用。买方应关注那些公布任务完成率、升级处理、留存率或满意度结果的生产部署。

仅有客户 logo 的证明力有限。更有力的信号将是其在真实服务条件下的持续使用,包括嘈杂环境和复杂的后端工作流。

如果部署效果优于纯语音或模块化替代方案,Google 关于原生管线的论点就会更有说服力。若客户仅将虚拟形象用于演示,这一论点则会被削弱。

第二个信号,是自定义虚拟形象和 Extended Thinking 是否获得更广泛的访问权限。这两项能力目前仍受限制,尽管原因不同。

自定义虚拟形象的扩展将表明,Google 的身份控制和企业审批流程能够支持更大范围的部署。Extended Thinking 的可用性则将显示,更深层的推理能否在不造成不可接受延迟的情况下融入实时体验。

若这些限制持续数月未解除,可能意味着安全、容量或产品设计方面的约束尚未解决。谨慎推进是合理的,但买方需要明确的信息来进行长期规划。

第三个信号,是竞争模型与虚拟形象供应商的回应。关注它们是否提供同样一体化的视频输出、更强的可移植性,或更清晰的评估数据。

竞争性的回应也可能进一步巩固模块化设计。供应商可以让独立组件更易于协调,从而削弱 Google 当前强调的集成优势。

企业团队不应被动等待这场竞争尘埃落定。他们可以从一个范围有限的工作流开始,对比虚拟形象与非虚拟形象版本,并记录完整的故障链路。

询问用户,视觉呈现是否真正提升理解,还是仅仅增添新鲜感。衡量后台工具执行是否能减少用户放弃,同时避免产生过早确认。

审查每一次对面孔、声音、摄像头和组织记录的使用。将披露、同意、留存、无障碍访问和人工升级纳入产品设计。

Gemini 3.8 Live Avatar 现已成为真实的生产选项,而不再只是预览功能。它能否成功,将取决于企业是否能够把同步呈现转化为更好的结果,同时不夸大智能体实际理解的能力。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page