top of page

StepAudio 3 发布让 StepFun 登顶语音 AI 基准榜,但全栈能力面临更严峻考验

9月16日
讀畢需時 13 分鐘

StepFun 于 9 月 15 日发布五款 StepAudio 3 模型,并宣称在三项语音 AI 评测中位居第一。StepAudio 3 覆盖实时对话、语音识别、语音合成、通用音频生成和音乐创作。其覆盖广度与榜首排名同样值得关注。

据 StepFun 介绍,StepAudio 3 Realtime 在 Artificial Analysis 评测中,对话动态得分为 98.9%,语音推理得分为 99.7%。StepAudio 3 ASR 的词错误率为 1.7%,并列非流式语音识别第一。ASR 即自动语音识别,指将录制的语音转换为文本的过程。

阿里巴巴、OpenAI、Microsoft、ElevenLabs、Cartesia 和 Inworld 等服务商将面临直接压力。不过,核心竞争并不只是 StepFun 与某一家公司的较量。StepFun 押注的是:一个协同整合的音频模型家族,可以胜过一组各自独立的专业语音服务。

这一论点尚未得到完整验证。基准领先能够建立技术可信度,却不能证明生产环境的可靠性、跨语言一致性或用户偏好。StepAudio 3 TTS、Gen 和 Music 也尚未获得与实时和识别模型同等程度、可见的独立验证。

StepAudio 3 发布覆盖完整音频链路

StepFun 并非只发布了一款改进版语音模型,而是推出了五个专业端点,覆盖几乎所有主要音频工作负载。

StepAudio 3 Realtime 处理实时语音交互。它通过音频进行聆听和回应,同时追踪停顿、打断、情绪信号以及对话意图的变化。

StepAudio 3 ASR 将语音转换为文本。StepFun 表示,它支持中文、英文、地区方言、中英混说、长录音和专业术语。

StepAudio 3 TTS 将文本转换为语音输出。TTS 即文本转语音,这一新模型面向互动应用,目标是在完整生成回复前就能开始播放。

StepAudio 3 Gen 承担更广泛的创作角色。据称,它可以根据自然语言指令和参考音频,结合人声、对话、环境音、效果音和背景音乐。

StepAudio 3 Music 专注于结构化音乐创作。StepFun 表示,用户可以生成歌曲、围绕无伴奏人声编排伴奏、制作翻唱作品,并通过多轮提示修改音乐。

据该公司的官方发布,全部五款模型均已上线 StepFun 的开发者平台。这使得此次发布不只是研究预览,也成为一次部署事件。

此次发布形成了清晰的产品链路。一个系统可以在同一厂商的模型家族内识别请求、理解其含义、通过语音回应、生成辅助声音,并创作音乐。

以互动学习应用为例。它可以转录学生的问题,察觉说话者声音中的不确定性,口头讲解答案,并生成示意性的声音场景。

客服系统则是另一个例子。它可以在工具查询订单时维持实时对话,随后带着结果继续交流,而无需让用户面对沉默等待。

创意团队可以描述一个包含两位说话者、街道噪声和背景音乐的场景。StepAudio 3 Gen 的设计目标是将这些元素呈现为协调一致的音频序列。

这些例子描述的是预期能力,而非已有独立记录的生产部署。不过,它们说明了为何这一五模型结构值得在排行榜标题之外获得关注。

早期的语音技术栈通常将独立的识别、语言和合成组件串联起来。这种设计赋予开发者灵活性,但每一次连接都会增加延迟,也增加一次信息损失的可能。

一份转录文本可以保留文字,却会丢失犹豫、讽刺、重音或背景语境。后续语言模型无法对转录阶段已移除的声学信息进行推理。

原生音频模型试图通过直接处理声音来避免这种损失。StepFun 的实时系统采用这一路线,而其独立的 ASR 和 TTS 产品则为传统应用保留了模块化选择。

因此,StepAudio 3 的发布同时支持两种架构选择。开发者既可以使用集成式语音到语音模型,也可以用更专门的组件组装流水线。

这种双轨方案在商业上合乎逻辑。呼叫中心可能优先考虑可审计的转录文本,而对话角色则可能更看重时机把握和情绪连贯性。

这五项发布也减少了协调来自无关联厂商的不同代际模型的需求。它是否能带来更好的运营效果,仍取决于文档质量、区域可用性、可观测性,以及真实流量下的稳定表现。

这些问题直接指向竞争利害关系。StepFun 已展示完整的音频产品目录,但其中每个组件都在不同且拥挤的市场中竞争。

Artificial Analysis 的结果为 StepFun 提供可信切入点

这些基准结果之所以重要,是因为它们衡量的是语音交互的不同环节,而不是同一能力的五种版本。

Artificial Analysis 将语音推理与对话动态和任务完成情况区分开来。其基准测试方法反映了语音智能体的一项基本事实:说得流畅与完成工作是不同的问题。

语音推理使用 Big Bench Audio——一个由 Big Bench Hard 改编而来的、包含 1,000 个音频问题的集合。模型接收口头问题,并必须通过音频生成答案。

该基准涵盖形式谬误、导航、物体计数和逻辑问题。高分表明模型能够对语音输入进行推理,但并不能覆盖所有真实对话。

对话动态使用 Full Duplex Bench 的部分内容。全双工意味着双方都可以说话和反应,而无需严格等待轮流发言。

该评测测试模型是否会在自然停顿时保持安静、在真正的轮次边界作出回应、处理打断,以及识别简短的确认回应。这些行为决定了语音助手是显得反应灵敏,还是不断抢话。

StepFun 表示,StepAudio 3 Realtime 的语音推理得分为 99.7%,对话动态得分为 98.9%。该公司在宣布这一模型家族时,将两项分数都称为第一名。

相关的实时模型论文独立记录了 98.9 的 Full Duplex Bench 成绩。论文还报告了 90.6 的 MMSU 得分,以及在 tau-Voice 基准上 56.0% 的宏观任务成功率。

MMSU 评估模型对语音内容的理解与推理能力。Tau-Voice 则评估语音智能体是否能完成涉及工具调用和不断变化对话条件的多步骤客服任务。

这些结果揭示了一个重要区别。StepAudio 3 可以在结构化推理和轮次交替测试中接近满分,但任务成功率仍低得多。

这一差距并非 StepFun 独有。语音智能体可以识别指令并自然回应,却依然无法完成用户请求的交易或操作。

Artificial Analysis 推出其语音到语音指数,以综合推理、对话行为、智能体表现和偏好信号。其指数概述解释了为何没有任何单一分数能够定义最佳语音模型。

随着服务商、测试版本和资格要求变化,Artificial Analysis 的实时页面也可能发生变化。其当前已索引的公开摘要并未在所有视图中持续展示 StepAudio 3。

这形成了读者应当理解的验证边界。发布当日的分数出现在 StepFun 的公告和技术材料中,而稳定的公开排行榜位置可能变化或存在滞后。

ASR 结果也有类似限制。StepFun 报告称,StepAudio 3 ASR 在 Artificial Analysis 的非流式评测中词错误率为 1.7%。

词错误率衡量相较于参考转录文本的替换、删除和插入错误。分数越低越好,但单一汇总指标可能掩盖不同口音、环境和专业领域之间的显著差异。

StepFun 表示,这一结果与阿里巴巴的 Fun-Realtime-ASR-preview 并列。公布的对比数据将 Microsoft 的 MAI-Transcribe-2 列为 2.0%,ElevenLabs Scribe v2 列为 2.2%。

这些差距从绝对值看很小。但当机构处理数百万词内容时,它们仍可能具有影响,尤其是在错误涉及姓名、数字或受监管术语时。

不过,非流式准确率并不能自动预测实时转录质量。流式系统必须在听到完整句子之前产出部分结果,这带来了不同的准确率与延迟权衡。

Artificial Analysis 将其非流式 ASR 排行榜描述为跨多个语音数据集的汇总评测。采购方仍应测试自身的口音、麦克风、词汇和噪声条件。

基准胜利为 StepFun 提供了有力的评测邀请,但并未消除这一需求。

StepAudio 3 Realtime 与流水线模式竞争

最重要的竞争,是统一的原生音频与既有的识别、文本推理、工具调用和语音合成链路之间的竞争。

传统语音智能体始于 ASR。文本模型解读转录内容,在需要时调用工具,再将答案传递给 TTS 系统。

这种流水线依然具有吸引力,因为每一层都可以独立替换。团队可以选择一家服务商负责识别,另一家负责推理,再选择一家提供偏好语音。

其弱点出现在这些层之间。转录可能移除声学含义,顺序处理会增加延迟,而分离的服务则会使打断处理变得复杂。

StepAudio 3 Realtime 使用其研究人员所称的持续“聆听—交谈—思考—行动”循环。该模型旨在一边持续聆听,一边生成语音并管理工具。

其 Deep Perception 组件解读语义和声学信息。Seamless Duplex 协调同步输入与输出,包括停顿、打断和简短的附和回应。

该模型的标志性机制是 Think-While-Speaking。StepFun 表示,这使私有推理能够与口头输出并行持续进行。

这一设计应对了语音 AI 中一项困难的权衡。更长的推理能够改善回答,但等待推理完成会让语音交流显得缺乏响应。

提早开始说话能降低感知延迟。但如果后续推理与系统已说出的内容相矛盾,也会带来新的风险。

StepFun 的技术报告称,该系统能够在不阻塞对话的情况下协调规划与语音。论文报告称,模型在实时说话时,其表现可与专门的推理模式相当。

这里的措辞很重要。这些是在既定测试条件下报告的研究结果,并不保证每个应用都能同时维持速度和准确性。

据论文介绍,集成式 Voice Agent 可以异步执行工具调用。模型可以一边开始解释某个流程,一边由另一项操作检索信息。

这一能力适用于预订、零售支持、账户服务和日程安排等场景。但它也带来了运营问题:工具尚未返回结果前,模型应当说什么?

设计良好的智能体必须区分已确认的信息和暂时性的说明。否则,更快的语速可能产生自信的陈述,而外部系统随后会证伪这些陈述。

OpenAI、Google、xAI 和 Alibaba 都在推进原生音频交互,而专业供应商则持续改进流水线中的各个环节。StepFun 正进入一个已围绕多个优化目标展开竞争的市场。

在报道所述的发布结果中,Alibaba 是最接近的基准竞争对手。Artificial Analysis 展示的语音推理和对话评测中,其 Qwen Audio 模型位居前列。

OpenAI 和 Google 提供了拥有既有开发者采用基础的更广泛应用平台。其市场地位带来了分发优势,这并非单纯的基准领先能够抹平。

ElevenLabs、Cartesia、Inworld 和其他语音专业厂商则在自然度、可控性、延迟和生产工具方面竞争。即使另一模型在推理测试中领先,这些品质仍会影响采购决策。

StepFun 的应对方式是广度。其模型家族提供原生实时模型,同时保留独立的识别、合成、生成和音乐服务。

这种结构避免迫使每位客户采用同一种架构。但这也带来了严苛的产品责任,因为 StepFun 必须维护五种不同体验,而非单一旗舰端点。

统一供应商可以简化身份验证、支持和模型协同。但如果一个平台成为所有音频功能背后的依赖,也可能集中运营风险。

因此,开发者应评估架构,而不只是输出样本。关键问题在于:StepFun 的一体化模型家族是否减少了足够的复杂性,从而值得接受更深的平台依赖。

对于处理访谈或会议录音的团队而言,可靠的转录文本也会为下游研究和检索系统提供输入。只有在采集到的语音保持准确且可追溯时,可搜索的AI 知识库才真正有用。

这说明了更广泛的利害关系。语音模型正越来越多地为其他自动化系统提供信息,因此看似合理的错误可能远远超出一次对话的范围而扩散。

StepAudio 3 基准测试尚未证明什么

StepFun 已展现出技术竞争力的证据,但公开记录在不同模型、语言以及真实生产环境中的表现仍不均衡。

第一个限制在于覆盖范围。最强的发布主张集中在 StepAudio 3 Realtime 和 StepAudio 3 ASR。

研究期间获取的当前受控语音排行榜中,并未出现 StepAudio 3 TTS。可见榜单显示,较早的 StepAudio 2.5 TTS 排在数个较新竞争对手之后。

Artificial Analysis 在其语音竞技场中采用盲测偏好投票。随着更多对比结果加入,排名可能变化;即使显示的名次不同,置信区间也可能重叠。

缺少 StepAudio 3 TTS 的条目并不意味着其质量较差。这意味着此次发布尚未为该模型提供可比较的独立偏好证据。

StepAudio 3 Gen 有一份详细的技术报告,但其许多评估来自 StepFun 自身的实验设计。这篇生成论文报告了零样本 TTS、音色设计、人声、音效、音乐和混合音频生成能力。

零样本 TTS 指无需额外训练模型,便可依据简短参考音频生成新说话人的声音。音色设计则是根据描述性指令创建声音,而不是复制某位参考说话人的声音。

研究人员描述了一种将音频生成为 token 的离散自回归系统。自回归意味着它会基于已生成的元素预测后续元素。

其 tokenizer 以每秒 12.5 个步长、跨 16 个残差码本来表征通用音频。码本是一组经学习得到的离散符号,用于压缩音频信息。

主干网络随时间预测第一个码本。一个更小的因果 transformer 则补全其余 15 个码本,加入声学细节。

这不同于基于扩散的音频生成器,后者会在反复去噪步骤中细化连续信号。StepFun 认为,共享的离散表示能够在同一框架内支持语音、声音、人声和音乐。

论文称,该模型在公司评测中的中文 TTS Elo 得分为 1,755.33。它还称,在 500 次对比中取得了 410 胜、39 平和 51 负。

在音色设计方面,论文报告 Elo 得分为 1,668.5,并在 196 次对比中取得 75.5% 的综合胜率。这些数字具有参考价值,但不能与公共竞技场结果直接互换。

评测者、模型选择、提示词和评分流程决定了基准测试能支持何种结论。公司自行开展的对比应始终标注为公司自行开展的证据。

StepAudio 3 Music 更需要独立检验。音乐生成需要通过作曲、音频质量、人声一致性、提示词遵循度和长程结构来评判。

StepFun 表示,该模型理解主歌、副歌和桥段等部分。它还支持通过 ABC notation 进行控制,这是一种以文本表示音符的格式。

这些控制方式听起来有助于迭代创作。但它们并不能证明模型能多可靠地遵循复杂编曲,或在完整歌曲中保持旋律身份的一致性。

版权和声音权利构成了另一个尚未解决的领域。参考音频生成可以支持正当的本地化和创意工作,但也可能复现受保护或可识别个人身份的特征。

该公告并未说明身份验证、同意机制、水印或滥用检测如何在每个端点中发挥作用。企业买家将需要直接的政策与技术答复。

语言表现也存在进一步的不确定性。StepFun 强调中文、英文、方言、代码切换和专业词汇。

综合分数无法显示每种语言和方言是否表现同样出色。英文基准也可能低估 StepFun 在中文上的优势,同时几乎无法说明对支持较少语言的表现。

最后的缺口在于生产可靠性。演示可以在受控音频下成功,而部署后的智能体将面对重叠说话声、弱网络连接、情绪激动的来电者和意外的工具故障。

延迟也必须在首个声音之外进行衡量。系统可能很快开始说话,却依然会出现不自然停顿、自我修正,或延迟给出关键答案。

这些限制并不否定 StepAudio 3 的发布。它们界定了判断榜单实力能否转化为持久采用所需的证据。

三个信号将显示 StepFun 的领先地位能否维持

下一阶段应通过稳定的独立排名、经验证的部署行为,以及成熟语音平台的竞争性回应来评判。

第一个信号是 StepAudio 3 在 Artificial Analysis 公共页面上的持续表现。如果模型在评测更新后仍然上榜,发布日的领先地位就更具意义。

读者应关注综合语音到语音指数,而不只是语音推理和对话动态。综合视图包含任务完成和偏好证据,更接近实际运营中的产品。

强劲的整体排名将强化 StepFun 关于实时模型平衡推理、交互与行动的主张。较低的综合排名则会暴露头条“第一”背后的专业化局限。

报告中的 56.0% tau-Voice 任务成功率提供了有用基线。该指标的提升比将 99.7% 的推理分数再略微提高更重要。

第二个信号是对 StepAudio 3 TTS、Gen 和 Music 的独立测试。这些模型构成该模型家族创作广度的大部分,但尚缺乏同样显著的第三方证据。

对于 TTS,应关注盲测偏好排名、长篇内容的一致性、克隆保真度,以及对陌生口音的表现。首次音频生成时间对交互式使用也很重要。

对于 Gen,评测者应测试多位说话人能否保持稳定身份,也应测试所要求的声音事件是否按正确顺序发生。

对于 Music,决定性证据将包括长程结构和可编辑控制。吸引人的短样本无法证明模型能否在完整作品中遵循修改要求。

若独立结果与 StepFun 的内部对比相符,将加强全栈论点。若差异显著,则会将这一叙事收窄至实时交互和识别能力。

第三个信号是 Alibaba、OpenAI、Google 和专业语音供应商如何回应。只有当基准领先改变竞争对手的发布优先级时,它才最具影响力。

Alibaba 在所报告的语音评测中已紧随 StepFun。一项快速的 Qwen 更新,可能让榜首位置成为两个中国模型家族之间的短暂交替。

OpenAI 和 Google 能够将原生语音模型与广泛使用的推理及应用平台结合。它们可以通过分发、工具支持或可靠性作出回应,而不是仅靠更高的单项基准分数。

语音专业厂商可能会以更低延迟、更强控制、更好的可观测性或更清晰的企业级保障来回应。对于生产买家而言,这些因素可能胜过微小的准确率差距。

StepFun 面临的挑战,是在竞争对手填补明显差距前,将技术广度转化为连贯的开发者体验。文档、正常运行时间、评估工具和透明的安全控制将塑造这一转化。

StepAudio 3 的发布改变了 StepFun 在语音 AI 领域的位置。它如今是基准领先者,并拥有覆盖音频创作与交互几乎每一阶段的模型。

更困难的考验始于公告之后。StepFun 能否在保持第一名结果的同时,证明其五模型技术栈可在嘈杂、多语言、依赖工具的应用中正常工作?

开发者应使用自己的录音、工作流和故障案例来比较这些模型。最有参考价值的结果不会是又一次演示,而是一个能在不丢失上下文或控制权的情况下完成真实工作的语音智能体。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page