top of page

Google AI 发布 Gemini 3.5 Live Translate,支持超过 70 种语言

已更新:7月20日

Google AI 发布了 Gemini 3.5 Live Translate。该模型可处理超过 70 种语言的实时音频流。它在翻译过程中保持原始语调、节奏和音高。

该更新针对真实对话。东南亚超级应用 Grab 已在为说不同语言的司机和乘客测试该工具。这些用户每月发起超过 1000 万次语音通话。

直接音频处理改变速度

Gemini 3.5 Live Translate 直接摄取原始音频,而非先将语音转换为文本。此步骤减少了一层转换。延迟降至近乎实时。

开发者可通过 Gemini Live API 访问该模型。他们可将其与 LiveKit、Fishjam、Pipecat 或 Vision Agents 搭配使用。LiveKit 已运行可实时翻译语音的虚拟会议室。

Grab 展示首次大规模测试

Grab 每月记录超过 1000 万次司机与乘客之间的语音通话。许多通话跨越语言界限。该公司现正探索使用 Gemini 3.5 Live Translate,以减少乘车过程中的沟通误解。

早期测试聚焦于有关方向、价格和交通的常用短语。该模型必须在切换语言的同时保留紧迫感和礼貌。

软件合作伙伴突破流媒体限制

Software Mansion 将该模型与 MoQ 协议结合使用。该组合减少了直播期间的缓冲。VisionAgents AI 展示了在单次对话中即时切换语言。

这些集成表明,音频管道可在可变网络条件下处理,而不会丢词。

主要压力落在早期翻译服务上

现有云翻译产品依赖独立的语音识别,然后再进行机器翻译步骤。Gemini 3.5 Live Translate 跳过了这一序列。竞争对手现在必须决定是重建其堆栈,还是在延迟上落后。

Microsoft 和 Amazon 提供类似产品。两者均未宣布单一模型能以相同声称的速度端到端处理超过 70 种语言的原始音频。

语境和口音方面仍存在限制

该公司表示该模型支持超过 70 种语言。但尚未详细说明在罕见方言或浓重地方口音上的表现。独立测试尚未出现。

Grab 将在更广泛推出前进行更长时间的试点。嘈杂乘车期间的任何准确性下降都可能减缓采用。

接下来值得关注的事项

三个信号将显示该方法是否成立。首先,Grab 将在试点结束后发布内部准确性数据。其次,LiveKit 将发布其多语言会议室的通话量数据。第三,Google 将更新 Gemini Live API 变更日志,添加或移除支持的语言。

每个数据点要么强化延迟声明,要么暴露竞争对手可攻击的差距。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page