Qwen 发布 Qwen-Audio-3.0-TTS 并登顶 TTS 排行榜,但竞争依然激烈
Qwen 发布 Qwen-Audio-3.0-TTS,其 Plus 模型登顶 TTS 排行榜,并于 2026 年 7 月 24 日位居第一。这一结果让 Alibaba 在竞争激烈的盲听测试中取得领先,但并不意味着其获得了无可争议的技术胜利。
此次发布推出了两款托管模型。Qwen-Audio-3.0-TTS-Plus 优先追求输出质量,而 Qwen-Audio-3.0-TTS-Flash 则以更低延迟面向交互式应用。两者均集成语音克隆、自然语言指令、局部内联控制、流式生成和多语言语音功能。
Qwen 的领先地位立即给 SpeechifyAI、Google、Cartesia、Inworld 及其他语音 AI 提供商带来压力。然而,在该排行榜快照中,Qwen 与排名第二的 Simba 3.2 仅相差 4 个 Elo 分。两者的置信区间也存在重叠,因此这一排名虽有意义,但仍只是暂时性的。
更重要的是这一结果背后的产品设计。Alibaba 正试图在同一模型家族中融合表现力控制、长内容一致性、多语言覆盖和交互速度。过去,开发者必须组合多个专用系统才能获得这些能力。
Qwen-Audio-3.0-TTS 发布后登顶 TTS 排行榜
Qwen 获得了最引人注目的优势,但这一结果本质上只表明,在特定测试条件下,它以微弱优势更受偏爱。
Qwen 通过官方 Qwen-Audio 发布公告宣布了该模型。该公司将 Flash 定位为实时交互选项,将 Plus 定位为注重生成语音质量的选项。
7 月 24 日,Qwen-Audio-3.0-TTS-Plus 在 Artificial Analysis Speech Arena中位居第一。它使用 8 种提供商语音,基于 1,517 个样本取得了 1,234 的 Elo 分数。
SpeechifyAI 的 Simba 3.2 以 1,230 的 Elo 分数紧随其后。Google 的 Gemini 3.1 Flash TTS 以 1,215 分位列第三,随后是以 1,208 分排名第四的 Cartesia Sonic 3.5。
Elo 分数汇总了多次比较中的相对表现。在这个竞技场中,听众会听到根据相同文本生成的两个样本,然后选择自己更喜欢的一个。
这种形式让该排名比供应商自行挑选的演示更有价值。参与者无须在没有听取竞品输出的情况下,直接接受 Alibaba 对自然度、表现力或保真度的描述。
然而,该排行榜并不能确立永久的胜者。Qwen 显示的排名区间为第一至第二,而 Simba 的区间则从第一延伸至第三。Qwen 的 95% 置信区间在两个方向上均跨度 16 分。
这些区间之所以重要,是因为 4 分的差距小于任一分数周围的统计不确定性。只需增加不多的投票,即使两家提供商都未更新模型,排名顺序也可能发生变化。
这一结果评估的也是提供商语音,即每个系统均使用其开发者提供的语音。该测试反映了客户从各家提供商处获得的完整体验,但并未单独考察模型架构。
语音选择会影响感知质量。一家拥有特别悦耳默认语音的提供商,可能会胜过另一家底层合成能力更强、但需要精心控制参考语音才能发挥优势的系统。
该竞技场支持知识分享、助手、娱乐和客户服务等类别,还包括口音筛选器。因此,当用户将评估范围缩小至特定任务时,结果可能有所不同。
尽管如此,Qwen 仍然赢得了令人信服的位置。位居第一意味着,在竞技场当前的任务组合中,听众经常更偏爱其样本,而非实力强劲的替代方案。
这项成就尤其值得关注,因为它并非只是 Qwen3-TTS 的又一次修订。Alibaba 将 Qwen-Audio-3.0-TTS 描述为一套面向生产环境的系统,配备全新的分词器、渐进式训练方法和扩展的控制机制。
此次发布也正值榜单快速更替之际。排行榜顶部附近的多个系统都在 2026 年发布或进行了更新。当供应商争夺新的语音智能体和内容生产工作负载时,即便只是暂时领先也依然意义重大。
对于买家而言,正确的结论应当具体明确。Qwen-Audio-3.0-TTS-Plus 已成为经过测试的最强托管 TTS 选项之一,但其确切排名仍可能因新增投票和竞品发布而改变。
为什么 Qwen 的双模型策略给语音 AI 提供商带来压力
Alibaba 同时争夺交互式语音应用和注重质量的生产场景,而不是将它们视为两个独立市场。
文本转语音系统通常面临一个艰难的运营选择。应用可以等待更长时间以获得表现力更丰富的语音,也可以优先考虑响应速度,并接受潜在的质量妥协。
这种取舍在对话式智能体中尤为明显。如果系统回答前停顿太久,即使语音自然也会让人感到别扭。然而,如果发音、节奏或情感听起来不可靠,快速响应也会失去价值。
Qwen 通过 Plus 和 Flash 分别承载这两种优先级。根据官方 TTS 模型指南,Plus 面向专业级质量,而 Flash 面向低延迟交互。
Alibaba 表示,Flash 可以在 200 毫秒内传输首个音频数据包。首包延迟衡量的是应用提交文本后,多快能够收到可播放的音频。
这一指标会影响语音助手、客户服务系统、游戏角色和无障碍工具。开发者可以在模型生成完整回复之前就开始播放。
Plus 服务于另一类工作负载。它面向旁白、本地化、培训内容、营销音频,以及其他语音稳定性可能比即时播放更重要的任务。
将两个模型归入同一个家族,为 Alibaba 进入企业客户提供了更广阔的路径。企业可以使用 Flash 测试实时交互,并使用 Plus 制作预先准备的内容,而无须采用彼此无关的控制系统。
共享的功能集进一步强化了这一主张。根据 QwenCloud 文档,这两个模型都支持流式传输、自定义语音和自然语言指令。
这种组合给那些最强产品仅覆盖工作流某一部分的供应商带来了压力。有些系统提供响应迅速的流式传输,却缺乏局部控制;另一些系统能生成富有表现力的旁白,却不太适合实时轮流对话。
Google 凭借 Gemini 的原生音频和 TTS 产品,依然是实力强劲的对手。Cartesia 围绕低延迟语音基础设施建立了自己的品牌定位,而 SpeechifyAI 则拥有丰富的消费级语音产品经验。
专业厂商还会在通用排行榜无法充分体现的维度上展开竞争。其中包括部署控制、发音工具、区域可用性、可观测性、集成质量和同意管理。
Alibaba 的优势在于广度。根据随附的模型研究,Qwen-Audio-3.0-TTS 家族支持 16 种语言和 20 个中国方言地区。
支持的 16 种语言包括中文、英语、法语、德语、日语、韩语、俄语、葡萄牙语、泰语、印度尼西亚语、越南语、意大利语、西班牙语、马来语、菲律宾语和阿拉伯语。
与研究团队所述的上一代 CosyVoice 3.0 覆盖范围相比,其中有 7 种语言是新增的。更广泛的语言支持可以减少制作国际化内容时所需的提供商数量。
跨语言生成又增加了一个实用维度。克隆或选定的语音可以使用另一种受支持的语言朗读目标文本,同时尽力保留可识别的声音特征。
这项能力可以帮助培训团队对演示文稿进行本地化,而无须为每个市场选择不同的旁白。它还可以让多语言产品助手保持一致的身份。
输出结果仍然需要由母语人士审核。词语正确并不保证重音恰当、地区发音准确或表达方式符合当地文化习惯。
因此,此次发布给竞争对手带来的压力源于产品整合,而不只是排行榜位置。Qwen 主张,一个模型家族就能覆盖即时对话、预制旁白、语音克隆和多语言交付。
这一主张对于维护大型内容集合的团队尤其重要。他们的源材料通常涵盖会议转录稿、产品文档、脚本和早期决策。
一个可搜索的 AI 知识库可以在 TTS 系统将选定文本转化为音频之前整理这些材料。语音模型负责提供声音,而知识层则决定应该说什么。
真正的进步在于声音发生变化的瞬间进行控制
Qwen 最强大的产品理念,是在同一次生成请求中将整体指令与短语级干预结合起来。
许多 TTS 系统允许用户选择一种整体风格。提示词可以要求使用沉稳的旁白、充满活力的演讲者,或谨慎的客户服务人员。
Qwen-Audio-3.0-TTS 接受这些自然语言指令。Alibaba 表示,用户可以描述期望的角色、情感、说话风格、语速、音色和口音,而无须设置底层声学参数。
这种方式减少了专门的配置工作。内容制作者可以使用编辑语言描述预期的表演效果,而无须调整多个数值控制项。
然而,仅靠整体指令通常并不足够。一份三分钟的脚本可能包含警告、引语、旁白和结尾指示。每个时刻都可能需要不同的表达方式。
Qwen 通过 86 个细粒度内联标签来解决这个问题。这些标签可以在短语或单词层面调整语音,并插入非语言事件。
示例包括耳语、笑声、呼吸声、咳嗽、叹息和情绪转换。模型可以理解整体指令,同时利用标签调整各个具体时刻。
以安全培训旁白为例。脚本的大部分内容可以使用平稳的指导性语气,而关键警告则变得更慢、更紧迫。
播客编辑可以将一段题外话标记为耳语,而无须将脚本拆分为多个独立任务。游戏开发者可以在角色对白中加入呼吸声或笑声。
局部控制可以减少音频拼接。拼接会连接多个生成的片段,这可能会引入音量、节奏、空间听感或声音身份方面的变化。
Alibaba 还表示,该模型可以一次生成最长三分钟的连续语音。更长的生成并不会自动保证更好的音频,但它为更连贯的节奏创造了空间。
研究团队将部分效率提升归因于 12.5 赫兹的语音分词器。语音分词器会将音频转换为生成模型可以预测的离散表示。
在 12.5 赫兹下,该系统每秒处理的语音帧少于使用更高帧率的模型。Alibaba 表示,这在保留语言和说话者信息的同时,降低了自回归解码的工作量。
随后,该系统将语言模型与流匹配组件相结合。语言模型规划离散的语音内容,而流匹配则帮助重建连续的声学细节。
阿里巴巴介绍了一个五阶段训练流程。它包括独立预训练、使用精选数据进行联合训练、针对语言模型的强化学习、鲁棒性训练,以及进一步的强化学习。
这些阶段针对不同的故障模式。其所述目标包括内容一致性、自然韵律、说话人保真度、感知质量,以及对低质量参考录音的适应能力。
架构之所以重要,是因为 TTS 质量涉及多个维度。一个样本可能听起来悦耳,却遗漏词语;也可能保留每一个词,却失去目标说话人的身份特征。
模型还可能在短句上表现良好,却在较长的旁白中逐渐偏离。情绪指令会引入另一个故障点,因为过度表达可能降低可懂度。
Qwen 正在尝试协调这些要求,而不是孤立地优化其中某一项。其在竞技场中排名第一的结果表明,至少在当前条件下,组合后的输出能够获得听众青睐。
此次发布还支持基于参考音频的声音克隆。用户提供目标说话人的音频,系统会创建一个标识符,用于后续语音合成。
QwenCloud 建议参考录音时长为 10 到 20 秒。文档中的工作流程要求获得明确授权、使用兼容的音频,并确保目标模型与后续合成请求相匹配。
阿里巴巴表示,Qwen-Audio-3.0-TTS 无需单独的降噪模式,就能处理带有噪声、混响或清晰度较低的参考语音。这一说法回应了一项重要的生产限制。
团队很少能拥有每位对象的完美录音室录音。他们可用的样本可能来自会议、电话、网络研讨会或较早的视频。
稳健的参考音频处理能力可以扩大可用素材的范围。与此同时,这也加重了在创建克隆声音之前核实身份、同意情况和授权复用范围的责任。
排名第一不能证明什么
排行榜验证了听众偏好,但它并不能确定可靠性、安全性、部署质量或在每种语言中的表现。
Artificial Analysis 采用盲测比较,从而减少品牌偏见。这是有价值的证据,但它回答的是一个狭窄的问题:听众更喜欢哪个样本?
生产系统必须回答更多问题。它是否正确读出了每一个名字?是否准确保留了数字、缩写和技术符号?是否遵循了要求的情绪,同时没有扭曲含义?
Qwen 研究页面包含针对复杂文本规范化的演示。其示例涵盖时间、货币、计量单位、章节编号和科学计数法。
这些示例展示了预期能力,而非普遍保证。团队在部署前应测试自己的名称、缩略词、地址、法律用语和数字格式。
长文本生成同样需要严格审查。三分钟的时长限制很实用,但仅凭时长无法衡量整段音频的一致性。
评估人员应留意漏词、短语重复、语速变化、声音漂移和不自然的停顿。他们还应通过自动化方式将生成的音频与源脚本进行比较。
排行榜的置信区间也构成了另一个需要保持克制的理由。在 7 月 24 日的快照中,Qwen 的第一名得分与 Simba 的第二名得分在统计上十分接近。
称 Qwen 为领先者,准确描述了榜单上显示的排名。若称其确定性地优于所有竞争对手,则超出了证据所能支持的范围。
排名也是动态变化的。随着用户提交更多偏好,Artificial Analysis 会更新 Elo 评分。即使模型本身没有更新,系统也可能因比较样本发生变化而改变排名。
特定类别的结果可能会显示出不同的领先者。富有表现力的娱乐声音与克制的客服声音解决的是不同问题,即使二者朗读的是相同文字。
语言覆盖范围带来了另一项不确定性。支持 16 种语言并不意味着在全部 16 种语言中的表现都相同。
项目材料展示了多语言和跨语言样本,但购买者仍需要由母语人士进行独立评估。地区口音、语码转换、外来词和本地人名都可能迅速暴露弱点。
声音克隆带来了最严重的风险。同一项功能既能帮助获得授权的说话人对内容进行本地化,也能在未经许可的情况下模仿他人。
QwenCloud 的声音克隆要求介绍了受支持的参考文件,并建议使用清晰的语音样本。技术文档无法确保每位客户都获得了知情同意。
组织需要在模型之外建立治理机制。负责任的工作流程应记录说话人的授权、允许的用途、获准使用的语言、保留期限和撤销流程。
访问控制应将声音录入与普通生成操作分离。审计日志应标明由谁创建了声音、使用了哪个模型,以及生成了什么内容。
面向客户的音频可能还需要进行披露。当合成声音与真实员工、高管、公众人物或家庭成员相似时,它可能误导听众。
内联情绪控制还会带来一种更隐蔽的风险。系统可能让某项陈述听起来充满恐惧、愤怒或带有机密意味,即使原说话人从未以这种方式表达过。
这个问题不仅限于冒充。情绪会改变人们对内容的理解,尤其是在新闻、教育、法律材料、医疗沟通和工作场所记录中。
因此,团队应将生成的音频视为一种新的衍生资产。批准底层文本并不自动意味着授权所有形式的声音呈现。
可用性也是一个需要考虑的因素。Qwen-Audio-3.0-TTS 以托管服务的形式提供,因此客户会依赖区域端点、服务限制、数据处理方式和供应商的持续运营能力。
发布材料主要聚焦于合成能力。对于高负载下的正常运行时间、运营支持、滥用响应,以及静默模型更新后的一致性,它们提供的独立证据较少。
开发者应运行可重复的评估集,而不是依赖令人印象深刻的样本。每个评估集都应包含普通文本、领域术语、复杂数字、长段落、情绪指令和多语言案例。
有效的评估不应只衡量偏好。它还应跟踪词错误率、说话人相似度、指令遵循度、首段音频延迟、总生成时间和故障频率。
对于自然度和适宜性,人工审核仍然不可或缺。自动化评分可以检测漏词,但无法全面判断某种表达是否适合其受众。
因此,核心的不确定性在于运营层面。Qwen 展示了一套覆盖范围异常广泛的能力组合,但其生产价值取决于能否在真实脚本和真实流量下保持可预测的表现。
三个信号将表明 Qwen 能否保持领先
接下来的考验并非另一项发布声明,而是独立投票、生产工作负载和竞争对手的回应能否支持最初的结果。
第一个信号是 Speech Arena 收集到更多比较数据后 Qwen 的排名。其 7 月 24 日的领先地位建立在 1,517 个样本之上,并且在统计区间上与 Simba 3.2 重叠。
如果 Elo 差距扩大,将有力支持听众始终更偏好 Qwen 的观点。如果排名在现有置信区间内发生逆转,则说明最初的领先是真实的,但并不具有决定性。
类别和口音方面的结果值得密切关注。如果在助手、娱乐、客户服务和知识分享任务中都能保持稳定表现,将支持阿里巴巴关于广泛生产适用性的主张。
第二个信号是来自已部署应用的证据。开发者应报告 Flash 在并发需求下能否保持响应迅速的首段音频输出,以及 Plus 能否在长脚本中完整保留内容。
成功的部署还应证明内联控制的可靠性。只有当标签表现一致且不会破坏发音或声音身份时,这项功能才真正有价值。
多语言评测将尤其具有揭示意义。母语人士能够识别出不自然的节奏、重音错位和地区差异,而这些问题可能会被宽泛的偏好排名忽略。
第三个信号是附近竞争对手的下一步行动。在当前竞技场中,SpeechifyAI 只需偏好发生小幅变化,就能超过 Qwen。
Google 可以通过 Gemini 更广泛的多模态平台作出回应,而 Cartesia 和 Inworld 可以强调基础设施与对话延迟方面的优势。专业供应商则可以通过安全控制、编辑工具或独特声音展开竞争。
快速推出的竞争性版本会削弱 Qwen 已建立持久优势的说法。如果它能连续数月稳定领先,此次发布的影响将更加深远。
客户不应仅凭一个全球排名做出选择。真正的检验在于,该模型处理代表性工作负载时,是否比现有替代方案更准确、更一致且更安全。
从已经引发过问题的脚本开始。加入不常见的名字、产品词汇、情绪转换、长段落、混合语言、计量单位和日期。
然后将 Plus 和 Flash 与至少一个排名接近的竞争对手进行比较。尽可能使用盲听,但也应在记录人类偏好的同时保留错误日志和延迟测量结果。
使用内部知识制作音频的团队还应保留源上下文。可搜索的工作流程有助于审核人员将语音中的陈述追溯到其原始文档。
Qwen 发布 Qwen-Audio-3.0-TTS,并在语音 AI 发展的战略关键时刻登顶 TTS 排行榜。它的领先优势很小,但其控制能力、语言覆盖范围、克隆功能和长文本输出的组合值得认真测试。
眼下的问题并不是阿里巴巴是否永久赢得了 TTS 竞赛,而是 Qwen 能否将一次接近的偏好胜利转化为可靠的生产表现。开发者现在有三个明确的检验方向:关注不断变化的投票结果、测试真实工作负载,并衡量竞争对手会以多快的速度作出回应。



