top of page

Gemini 3.8 文本转语音登场,声音设计成为真正的竞争焦点

41分钟前
讀畢需時 13 分鐘

Google 表示,Gemini 3.8 文本转语音现已推出两款模型、超过 2,000 种声音,以及基于 30 秒录音的声音复刻功能。这项于 9 月 23 日发布的更新,让 Gemini 不再只是从预设旁白中进行选择,而是允许用户通过自然语言指令设计、保存并指导合成声音。

这一变化让 Google 进入了不同于基础语音合成的竞争领域。新的挑战在于:在长篇录音中维持角色一致性,同时控制口音、节奏、情绪和对话。Google 还必须证明,声音复刻可以在规模化发展的同时,不削弱同意机制,也不会让欺骗性音频更容易被制作。

这种压力不只会影响专业语音公司,也会波及音频制作平台、配音服务、播客工具,以及已围绕竞争性语音 API 构建业务的企业。Google 一方面向开发者提供模型,另一方面也通过 Gemini Notebook 和 Google Vids 等产品进行分发。

Gemini 3.8 文本转语音迎来可设计声音

核心变化在于,Google 现在将合成声音视为可复用的创意资产,而非固定菜单中的选项。

Google 于 2026 年 9 月 23 日通过一篇官方发布推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。两者均可接收文字脚本并生成音频,不过 Google 将它们定位于不同的制作需求。

Gemini 3.8 Flash TTS 面向需要更高声学保真度、细致表演、复杂发音和持续角色演绎的工作。Flash-Lite 则面向更高产量的任务,包括配音、朗读服务、批量内容和语音代理流程。两款模型采用相同的 API 结构,这应能减少测试或切换模型所需的工作量。

旗舰模型可根据自然语言描述创建声音。用户无需从预设说话人开始,即可指定角色定位、口音、音色特质和预期表演方式。Google 表示,该模型的声音设计覆盖超过 100 种语言和方言。

Google 还将现成声音目录从最初的 30 种选择扩展至超过 2,000 种制作级声音。该库包括魁北克法语、墨西哥西班牙语和苏格兰英语等区域变体。这样的广度很重要,因为即使系统在技术上支持一种语言,本地化也常常在区域层面失效。

此次发布还加入了声音复刻功能,这是 Google 对基于参考音频创建一致声音档案的称呼。该公司表示,流程需要一段 30 秒样本,以及由声音所有者单独录制的口头同意声明。随后生成的声音身份可被保存,并在不同项目中重复使用。

这比自然旁白效果的又一次提升更具影响力。可复用的声音能够成为产品身份的一部分,如同视觉角色、字体或界面音效。它也带来了有关所有权、审批、版本管理和访问权限的运营问题。

Gemini 3.8 在声音被选择或设计后,加入了逐句指导功能。制作人员可以在不同轮次之间调整语速、情绪、方言和表达方式,也可以在精确位置插入笑声、呼吸、倒吸气和停顿等发声事件。

这些模型支持通过一份结构化脚本原生生成双人场景。Google 表示,它们在处理对话轮次和听者反应时,能够保持不同声音之间的区分。这些附和声是叠加在另一位说话者轮次中的简短回应,例如简短的认可。

这种结构让 Gemini 3.8 TTS 与 Gemini Live 区分开来。TTS 严格遵循既定脚本,并可对表演提供细致控制;Live API 则处理涉及不断变化的用户输入和外部操作的开放式低延迟对话。

开发者可通过 Gemini API 和 Google AI Studio 使用两款新的 TTS 模型。Gemini 3.8 Flash TTS 也正在通过 Gemini Notebook 推出。Flash-Lite 正在进入 Google Vids,而更广泛的企业 API 可用性则被列为即将推出。

这些分发选择揭示了 Google 的近期目标。Gemini Notebook 将生成语音与基于来源的研究和旁白连接起来;Google Vids 则将更快的模型接入工作场景的视频制作,而反复修改和本地化可能会产生大量音频工作负载。

Google 正在压缩声音制作技术栈

Gemini 3.8 通过在同一模型家族中结合声音创建、表演指导、复刻和分发,对竞争对手形成压力。

传统文本转语音系统以脚本和从目录中选定的声音为起点。更先进的服务会增加风格设置或克隆功能。制作团队仍需在写作、选角、录音、编辑、本地化和资产管理工具之间切换。

Google 正试图将更多环节压缩到单一工作流中。制作人可以描述角色、生成候选声音身份、保存其中一个、指导不同台词,并编排双人对话。同一套底层模型可支持有声书、本地化视频、播客场景或脚本化助手回复。

实际差异在于控制力。自然语音本身已无法区分领先系统,因为多家供应商都能生成可信的旁白。更困难的问题,是让精确的表演能够在不同剧集、市场、修订版本和制作团队之间被稳定复现。

Google 的语音生成指南明确体现了这一制作逻辑。Gemini 3.8 将提供的文本视为逐字稿。持续性的表达指令应放入结构化语音元数据中,而短暂的发声动作则保留在脚本内。

这种分离减少了歧义。例如,“缓慢说话”这样的指令应控制完整的一轮发言;<sigh> 这样的标记则应出现在一个精确位置。早期的提示方法常将对白、角色描述和舞台指示混杂在同一个文本块中。

这种新方法也要求团队在生成大量台词之前先设计角色声音。创建后,该声音会获得一个可在后续请求中保持一致的标识符。Google 建议开发者避免反复描述同一种声音,因为过多指令可能增加漂移。

声音漂移是指生成角色在不同片段中逐渐改变音色、口音或身份。它在有声书、连载故事、培训材料和长篇播客中尤为明显。如果第十章听起来像由另一位表演者完成,再可信的样本价值也有限。

根据 Google 的模型文档,Gemini 3.8 Flash TTS 支持最长 8,000 个 token 的文本输入。该模型可生成音频,并支持长得多的输出容量。然而,制作质量仍取决于团队如何拆分脚本、保留设置并审核连续性。

对于从早期预览模型迁移的开发者而言,输出格式也发生了变化。Gemini 3.8 默认针对标准请求返回 WAV 音频。此前手动添加 WAV 文件头的旧实现必须移除该步骤,或请求另一种受支持的音频格式。

这些细节之所以重要,是因为在成熟流程中替换模型很少只是修改一个参数。团队必须测试发音、分段、响度、延迟、编码、重试行为和后期制作工具,还需要为每个重要角色和语言准备回归样本。

因此,竞争压力不只落在声音质量上。供应商必须提供可靠的身份管理、可控的表演、清晰的同意记录,以及与生成流程周边工具的集成。Google 可通过其 API、Workspace 产品和开发者平台连接这些环节。

Gemini 3.8 的到来,也紧随 Google 扩展其实时音频模型家族之后。该公司于 9 月 15 日推出 Gemini 3.8 Live 和 Extended Thinking。其语音应用发布涵盖对话代理,而新的 TTS 模型则处理脚本化输出。

这些发布共同让 Google 能够覆盖机器语音的两端。Live 模型在对话中监听、推理、回应并调用工具;TTS 模型则以更审慎的方式呈现经批准的文字,并对每一句话的声音提供更多控制。

这种广度提高了独立供应商面临的门槛。专业厂商仍可凭借更出色的声音、更低延迟、更简便的权利管理或更好的制作工具取胜。然而,它们现在必须与连接到 Google 笔记本、视频、企业系统和应用平台的模型竞争。

声音设计是改变市场的关键机制

真正重要的机制并非语音生成本身,而是将文字描述转化为稳定且可指导的声音身份。

Google 的上一代产品已支持富有表现力的语音和多说话人功能。2026 年 4 月发布的 Gemini 3.1 Flash TTS 增加了细粒度音频标签,并覆盖超过 70 种语言,也支持场景指导和说话人专属指令。

Gemini 3.8 改变了起点。用户不再是先选择声音、再应用风格,而是可以直接设计声音本身。这让控制权从表演设置延伸至选角,并影响之后的每一句台词。

这种差异更像是在指导一位演员,而不是调整录音滤镜。声音描述建立了底层角色身份;逐轮元数据随后塑造当前表演,而内联标签则放置特定反应或停顿。

Google 表示,Gemini 3.8 Flash TTS 支持 130 种语言,Flash-Lite 支持 101 种。这些数字来自其当前开发者文档。仅凭语言总数并不能证明其在不同口音、文字系统和说话风格上具有同等质量。

不过,更广泛的覆盖改变了实验的经济性。制作团队可以在安排所有目标市场的录音工作前,先测试本地化角色;也可以评估一种品牌声音是否能恰当迁移,或是否需要针对不同地区提供替代方案。

声音库提供了另一条路径。不需要原创身份的团队可按语言、音高、性别和制作场景搜索预构建选项。这种方法更适合功能性旁白、无障碍功能和原型设计。

复刻则面向声音身份已经存在的情形。表演者、创作者、高管或经授权的品牌代表可以提供参考音频。生成的档案随后让制作团队能够在不重新录制每一句话的情况下,创建获批准的变体。

这一能力具有明确用途。出版商可以在有声书录制后修正一句话;培训部门可以更新合规模块,而无需重新录制整套课程;视频团队可以在保留经授权角色身份的同时对脚本进行本地化。

它也改变了原始录音的价值。参考样本成为生成未来语音的凭证,而不只是音频资产。组织需要控制谁可以上传样本、批准样本、访问其声音标识符,以及撤销其使用权限。

这种治理方式类似于对机密源材料的管理。团队需要可追溯的所有权归属和明确的保留政策,尤其是在参考音频来自员工或承包商时。可检索的个人知识库可以整理审批记录和项目背景,但无法取代正式的权利管理。

该模型对双说话人的支持也让场景构建更加直接。制作人员可以指定不同的身份,并为每一句话附加元数据。插话机制允许听者作出反应,而不会形成一连串不自然、彼此孤立的音频片段。

这对播客和戏剧化对白很重要,因为时机本身承载着意义。放在一句话之前的笑声,与放在同一句话之后传达的含义不同。重叠的回应可以让场景听起来不那么像轮流发送的语音消息。

Google 还声称,该模型在长内容中的一致性更强,且说话人漂移有所减少。这是公司报告的改进,并不保证适用于每一份脚本。长项目仍需要人工审查发音、情绪、节奏和连贯性。

底层模型并不会决定一种表演是否适合某个角色或受众。技术上准确的口音仍可能显得不恰当。即使每个词都没有改变,戏剧化的演绎也可能扭曲事实材料。

因此,Gemini 3.8 让创意指导更易于实现,同时也增加了团队必须管理的指导内容。更快的生成会带来更多变体,而不是更少的编辑决策。制作瓶颈可能会从录音转向筛选和质量保证。

同意与基准测试无法解决信任问题

Google 增加了有意义的保障措施,但此次发布仍让声音所有者和制作团队必须承担艰难判断的责任。

声音复刻是此次发布中最敏感的部分。Google 表示,用户必须提供与参考说话人相匹配的口头同意录音,才能创建声音。这项要求旨在防止有人利用无关的公开音频片段克隆他人的声音。

该公司还表示,Gemini Audio 生成的每段音频都包含 SynthID。这种不可感知的水印会在模型输出中嵌入机器可检测的信号。Google 将其描述为识别合成媒体的透明度措施。

水印很有用,但不会自动告知每一位听众。检测需要兼容的工具,并且该信号需要在编辑、压缩或再分发后持续保留。在敏感场景中,仍可能需要可听见的披露说明和平台标签。

Google 还表示,生成的音频带有 C2PA 凭证,这是一项用于向媒体附加来源信息的标准。来源信息可以记录资产的来源及其变化过程。其价值取决于应用程序是否会保留并展示这些凭证。

创建时获得同意,并不能回答之后的所有问题。一位表演者可能批准一个项目,却不批准另一个项目。一家公司可能授权内部旁白,却拒绝广告、政治内容或不受限制的公开发布。

撤销同意带来了另一项挑战。保存的声音在创建后,可能出现在许多项目和系统中。企业需要制定流程,以禁用未来生成、识别现有文件,并记录哪些内容在法律上仍可使用。

地区限制表明,政策环境并不统一。Google 表示,AI Studio 的声音复刻功能在伊利诺伊州、得克萨斯州、欧洲经济区、英国、瑞士和印度不可用。该公司并未将这项功能描述为普遍可用。

Gemini 模型卡也为发布措辞增添了审慎态度。其指出,该音频模型系列可能呈现基础模型的局限性,包括幻觉问题,也可能出现运行缓慢和超时问题。

对于脚本化 TTS,幻觉风险需要谨慎解读。开发者指南称,Gemini 3.8 会将文本视为逐字稿,这缩小了模型的发挥空间。制作团队仍应测试姓名、数字、缩写、外来词和不常见的语音组合。

基准测试提供了证据,但并不能给出完整的制作结论。Google 报告称,Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 上获得了 71.4 分。它还报告了 60.8 分的口音建模得分,并在该基准中位列第一。

Google 进一步表示,Flash 和 Flash-Lite 在 Hume AI 的 Overall Quality Index 中分别排名第一和第二。该公司援引了日语、巴西葡萄牙语、越南语、阿拉伯语、墨西哥西班牙语和印地语的强劲盲测人工偏好结果。这些结果支持了该公司关于多种语言质量表现的论点。

然而,基准领先并不能证明其在每种方言或工作流程中都具备一致质量。测试集可能无法代表长篇脚本、专业词汇、无障碍要求或品牌特定的声音需求。人类偏好也不同于法律授权和事实准确性。

Google 早前的Gemini 3.1 发布提供了有用的基线。该模型已经支持多说话人输出、富有表现力的标签和广泛的语言支持。Gemini 3.8 必须证明,其声音设计和复刻能力在精选演示之外依然可靠。

最可信的评估将来自重复的生产使用。团队应在不同口音、情绪和片段时长下比较相同脚本,还应衡量重新生成的频率、人工编辑时间,以及数十个场景之后的一致性。

声音所有者需要独立的证据。他们应了解模型在多大程度上复现了自己的身份、哪些用途仍受到限制,以及如何撤回同意。他们还需要明确,经转换或混音的声音是否仍可能被识别为自己的声音。

合成音频的风险并不限于精确模仿。一种新设计的声音即使没有使用某人的录音,也可能与真实人物相似。大型声音库还可能包含让听众联想到公众人物或熟悉表演者的声音。

因此,这些新控制措施同时增强了合法制作和滥用的潜在可能。同意验证、水印和来源信息提高了在 Google 系统内滥用的门槛,但并不能解决音频离开该环境后会发生什么。

三个信号将显示 Gemini 3.8 TTS 是否兑现承诺

下一项考验是,Google 能否将令人印象深刻的声音控制能力转化为可靠、可治理的制作基础设施。

第一个信号是企业可用性。Google 列出,两款模型的 Gemini Enterprise API 支持即将推出。更广泛的发布应能揭示该公司如何处理管理控制、地区限制、声音所有权、日志记录和组织范围的访问权限。

企业部署还将考验大规模使用下的可靠性。买家将希望获得可预测的延迟、稳定的输出格式,以及模型更新后的一致行为。他们还需要能够锁定已批准的声音,并在数月后复现既有素材。

如果 Google 提供详尽的声音治理和可靠的版本控制,其创意工作室的论点将更具说服力。如果团队必须在悄无声息的模型变更后重建声音,此次发布看起来将更适合实验,而非生产。

第二个信号是独立的长内容测试。Google 表示,Flash TTS 可以在数小时音频中保持声音质量、节奏和角色音色。有声书和连载播客将揭示,这种一致性是否能经受复杂脚本和重复生成的考验。

有用的指标并不是单个样本是否听起来像真人,而是制作人员需要多久重新生成台词、修复发音或纠正角色漂移。这些干预决定了生成式语音是否真的能减少制作工作。

测试也应覆盖 Flash-Lite,因为其预期用途涉及更高的输出量。微小的质量差异一旦出现在数千个片段中,成本就可能很高。更快的生成路径只有在其输出能够持续通过审查时才有帮助。

第三个信号是竞争对手如何回应 Google 对设计、复刻和分发的组合。专业供应商可以通过更好的同意系统、更易编辑的体验、更强的实时性能或更可靠的角色连续性来应对。

竞争性回应还将澄清客户最重视什么。有些客户会偏好将语音与文档、视频和智能体连接起来的广泛平台;另一些客户则会选择专注型供应商,以获得对较窄制作流程的更深层控制。

Google 的分发优势相当显著。它可以通过 API、实验性工作室、笔记本产品和办公视频编辑器提供这些模型。这使一个模型家族能够通过不同入口触及开发者、创作者和办公用户。

然而,分发并不能消除编辑责任。生成的声音仍需要选角、审核、披露和权利管理。跳过这些步骤的组织,可能会比过去的录音工作流程更快地引发法律和声誉问题。

Gemini 3.8 文本转语音在合成语音已能在短演示中令人信服的时刻登场。Google 押注,下一个市场边界将是可控性、可复用身份和规模化。其发布为这三者都提供了可信的机制。

悬而未决的问题是,这些机制能否在长项目、地区口音和不断变化的许可条件下保持可靠。未来三个月,请关注企业版发布、独立制作测试和竞争对手的回应。

对开发者而言,眼下的行动很直接:使用已批准的脚本测试两款 Gemini 模型,记录每一次人工修正,并将同意视为持续有效的许可,而非一次性勾选。创作者应比较完整场景中的声音稳定性,而不是只看经过润色的样本。企业买家应询问身份信息如何存储、撤销、审计,以及如何在更新中得到保留。这些检查将显示,Gemini 3.8 文本转语音究竟是作为生产系统登场,还是仍停留在令人印象深刻的创意预览阶段。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page