top of page

Sarvam AI Saaras V4 提升印度语音识别门槛,但基准测试只是起点

9月27日
讀畢需時 14 分鐘

Sarvam AI 推出了 Saaras V4,支持 22 种印度语言、全球英语以及五种转录文本格式。Sarvam AI Saaras V4 还宣称,在多项英语和印度语言语音基准测试中取得领先准确率。这一组合对 OpenAI、ElevenLabs 和 Deepgram 等通用服务构成了压力。

此次发布之所以重要,是因为印度的语音识别并不只是英语转录问题。真实对话往往混合区域语言、英语词汇、本地口音、经压缩的电话音频,以及频繁变化的说话人。一个系统可以在干净录音中表现良好,却可能难以应对企业实际接收到的通话。

Sarvam 正押注于,区域语言深度能够与全球供应商更广泛的语言覆盖和成熟基础设施竞争。其最突出的五项差异化能力包括:定制语言模型解码器、广泛的印度语言覆盖、五种原生输出模式、关键词提示,以及低延迟流式处理。不过,大部分性能证据仍来自 Sarvam 自身的评估,因此部署结果仍是更重要的检验。

Sarvam AI Saaras V4 改变多语言 ASR 竞争格局

Saaras V4 将 Sarvam 面向印度市场的语音模型,扩展为对全球转录平台更广泛的挑战。

Sarvam 于 2026 年 8 月 24 日通过详细的 Saaras V4 发布公告公布该模型。该公司几天前已推出 API 版本,并于 9 月 2 日让该模型面向 Sarvam Voice Agents 全面可用。

该版本保留了对印度 22 种法定语言的支持,同时将英语识别范围扩展至印度英语之外。Sarvam 将这一新增能力描述为全球英语支持,其中包括国际语音数据集中呈现的各类口音。

这一变化扩大了模型可覆盖的工作负载。一家印度客户服务机构可能会接到印地语、泰米尔语或孟加拉语电话,也可能处理使用印度、英国或美国英语的对话。在这些通话中使用同一识别系统,可以减少路由规则和模型切换。

Saaras V4 可通过 REST、批处理、旧版 WebSocket 和较新的实时接口使用。Sarvam 的模型文档列出了语音代理、通话分析、混合语言语音和 8 kHz 电话音频等目标应用场景。

REST 接口可接收时长最多 30 秒的录音。批处理服务可处理最长两小时的文件,而流式选项会在实时对话期间返回部分转录结果。批处理还支持说话人分离。

此次发布也展现了快速的产品迭代周期。Saaras V3 于 2026 年 2 月推出,同样支持 22 种印度语言和英语。Sarvam 表示,该版本将 IndicVoices 上的词错误率从约 22% 降至约 19%。

V4 改变了竞争定位。V3 主要被定位为印度语音专家,而 V4 新增国际英语基准,并将自身定位为同时服务印度语言和更广泛英语工作负载的单一模型。

这并不意味着 Sarvam 突然覆盖了全球转录服务支持的所有语言。Saaras 仍聚焦于 23 种具名语言,而其他平台宣传的语言目录要大得多。它的主张在于其所支持语言中的深度,而非尽可能长的语言列表。

这一差异构成了本文的核心张力。Sarvam 表示,专业化带来了对复杂印度语言更好的识别能力,同时未牺牲英语性能。全球供应商则可以凭借更广的覆盖范围、成熟工具链,以及超出基础转录能力的功能进行回应。

因此,对企业买家而言,决策并不取决于某一个排行榜名次,而在于哪个系统能在其实际口音、词汇、音频渠道和语码切换模式中稳定可靠地工作。

30 亿参数解码器将音频与语言连接起来

第一个核心特征,是一种将转录视为上下文语言生成而非孤立声音匹配的架构。

Saaras V4 将音频编码器与一个拥有 30 亿参数的自回归语言模型解码器结合。Sarvam 表示,它从零开始在内部训练了这一混合状态空间解码器。

音频编码器从波形中提取语音和声学信息。随后,一个时间下采样适配器会压缩这些信息,再将其投射到解码器的嵌入空间中。这种压缩有助于让更长录音适配模型可用的上下文。

解码器会将这些音频表征与文本提示共同处理。它按顺序生成转录 token,并在生成下一个 token 前将每个结果反馈给模型。

当多个词语听起来相似时,这种方法尤为重要。仅凭声学证据可能无法确定说话者使用了哪个词。句子上下文、语法和可能的词序列可以引导解码器生成更合理的转录结果。

基于 LLM 的解码器还支持控制输出的指令。同一个底层模型可以接收保留填充词、规范化数字、将语音转写为拉丁字母,或将结果翻译成英语等请求。

不过,上下文解码也带来熟悉的风险。能够预测合理文本的模型,可能生成听起来合情合理、但说话者从未说过的词语。这种失败在医疗、金融、法律和合规记录中尤其严重。

Sarvam 表示,V4 专为嘈杂录音、方言差异和混合语言语音设计。这些都是苛刻条件,因为声学信号本身可能已存在歧义。具备语言感知能力的解码器或许有所帮助,但它不能用流畅的虚构内容替代缺失的证据。

因此,开发者应分别测试删除、插入和替换错误。一份表面上可读的转录文本,仍可能遗漏限定条件、改动数字,或替换不常见的人名。

该架构也引发了关于可复现性的疑问。Sarvam 描述了模型和评估流程,但尚未发布 Saaras V4 的权重。买家无法独立检查其训练数据、在自己的基础设施上运行模型,或验证每一项架构主张。

这使托管 API 成为实际评估单位。团队需要衡量交付的服务本身,包括延迟、正常运行时间、数据处理方式和转录稳定性。

模型规模本身几乎无法提供有用指导。当较小解码器的音频训练和语言覆盖更契合工作负载时,它可能优于更大的解码器。反之,专业模型也可能在对话超出其目标领域时表现不佳。

真正有价值的问题是:这一架构能否减少真实印度语音中的错误,同时不引入新的上下文错误。Sarvam 的基准结果提供了令人鼓舞的信号,但客户音频将提供更有力的证据。

五种输出模式减少多个处理环节

第二项主要特性,是单一模型可为同一录音生成五种不同表征。

Saaras V4 支持转录、逐字转录、混合语言、转写和翻译模式。这些不只是外观格式选项,因为每种模式都服务于不同的下游工作流。

转录模式以原始语言生成文本,并规范化数字和日期等元素。它还会恢复标点,使结果适合阅读、索引和常规分析。

逐字转录模式会保留填充词和口头数字形式。合规团队、研究人员和对话分析师可能更偏好这一版本,因为规范化可能抹去表达方式中的细节。

混合语言模式会以原生文字保留印度语言词汇,同时用拉丁字符保留口语英语词汇。这种格式反映了许多多语言对话自然的书写和审阅方式。

转写模式会以拉丁字符呈现话语,但不翻译其含义。Sarvam 将其描述为非正式数字通信中常用的风格。它可帮助读者理解印地语或其他受支持语言的口语内容,而无需阅读其原生文字。

翻译模式会将受支持的印度语言语音直接转换为英语文本。这可服务于国际支持团队、报告系统,以及需要统一输出语言的分析师。

传统流程往往通过不同组件完成这些任务。一个服务负责识别语音,另一个规范化转录文本,第三个负责翻译或转写。每增加一次转换,都可能引入错误或丢失信息。

Saaras V4 在一个模型内生成全部五种形式。Sarvam 认为,这种设计避免了独立预处理环节带来的级联错误。

这一主张具有实际吸引力。一个客户服务平台可能会保存逐字语音记录以供审阅,向客服人员显示规范化文本,并将英语输出发送至分析系统。一个识别模型即可支持所有这些目的地。

这五种模式也让语音在知识工作流中更易使用。当团队可以选择规范化或翻译后的文本时,会议录音和访谈会更容易检索。一个可搜索的 AI 知识库随后可将转录文本与相关笔记和文档连接起来。

不过,单一模型并不能消除所有处理决策。团队仍必须确定哪种表征具有权威性、如何保存原始录音,以及翻译文本是否适合用于敏感决策。

根据 Sarvam 的文档,翻译模式仅输出英语。它并不支持任意两种受支持语言之间的翻译。

标准响应中也不提供词级时间戳。API 提供短语级或分块级时间信息,而批处理可添加带说话人归属的转录文本。

这些限制对于字幕编辑、取证审查和需要精确对齐的应用至关重要。对于这类任务,提供详细词级时间信息或转录编辑功能的竞争产品可能仍更合适。

尽管如此,这五种模式仍使 Saaras 有别于基础语音转文本端点。Sarvam 正将转录文本表征视为识别过程的一部分,这更贴合多语言生产系统的需求。

印度语言覆盖范围超越最大语种

第三项差异化特征,是对全部 22 种印度法定语言的一致产品支持,其中包括多种低资源语言。

Saaras V4 支持印地语、孟加拉语、泰米尔语、泰卢固语、马拉地语、古吉拉特语、卡纳达语、马拉雅拉姆语、旁遮普语、阿萨姆语、乌尔都语和奥里亚语。它还覆盖尼泊尔语、孔卡尼语、克什米尔语、信德语、梵语、桑塔利语、曼尼普尔语、博多语、迈蒂利语和多格拉语。

这种广度意义重大,因为训练资源分布并不均衡。主要语言拥有更多语音语料库、标注录音和商业需求。较小语言往往获得较弱的识别能力,或根本不受支持。

Sarvam 表示,V4 在全部 22 种语言中实现了最先进结果。这仍是公司的主张,不过该公司公布了评估方法,并列出了所使用的数据集。

Sarvam 针对十种印度语言,使用 Vistaar 对该模型进行了评估。评估涵盖 Common Voice、FLEURS、Gramvaani、IndicTTS、Kathbath、含噪的 Kathbath 录音以及 MUCS。

Sarvam 同时报出了传统词错误率和 LLM-WER。标准 WER 统计预测文本与参考转录文本之间的替换、插入和删除。

LLM-WER 增加了语义判断环节。它尝试区分会改变含义的差异,与不改变核心内容的拼写或格式差异。

这一区别对印度语言可能很有价值,因为书写形式和规范化约定存在差异。两份转录文本可能表达相同的词语,却仍会受到传统 WER 的惩罚。

不过,基于另一种语言模型的评估器会将判断因素引入该指标。结果可能取决于裁决模型及其指令。即使传统 WER 会夸大一些无害差异,它仍更容易复现。

语言识别是 Sarvam 覆盖范围主张的另一部分。据称,Saaras V4 在十种使用最广泛的印度语言中实现了 2.9% 的识别错误率。Sarvam 报告称,在全部 22 种语言中,该错误率为 5.22%。

自动检测免除了预先标注每段录音的需要。这对于共享呼叫队列、公共服务热线以及面向多语言受众的消费级应用很有帮助。

但在发生语码转换时,语言识别会变得更加复杂。当一段音频中出现多种语言时,Sarvam 的 API 会返回占主导地位的语言。需要词级语言标签的应用可能还要增加额外逻辑。

全球竞争对手以不同方式界定多语言覆盖能力。ElevenLabs 表示,其转录系统可识别 90 多种语言,并提供词级时间戳、实体检测和说话人分离。

Deepgram 的多语言模型支持在一组较窄但广泛使用的语言之间进行实时语码转换。其成熟的流式服务与语音代理工具构成了另一种竞争优势。

OpenAI 将 GPT-4o Transcribe描述为,相比早期 Whisper 模型,其词错误率和语言识别能力均有所提升。它的吸引力部分来自与更大模型平台的集成。

Sarvam 的应对方式并不是匹配所有全球语言,而是宣称在一个特定且语言复杂的市场中拥有更强表现。

这一策略会在广泛支持可能掩盖质量不一致的领域对竞争对手施压。列出某种语言,并不能说明系统如何处理地区口音、混合文字、姓名、电话压缩或非正式表达。

但这也让 Sarvam 在其核心语言集合之外面临风险。覆盖欧洲、非洲和东亚语言的跨国公司,可能更倾向于选择一家覆盖更广的供应商,即使 Saaras 在印度电话场景中表现更好。

因此,V4 最有力的应用场景似乎是:印度语言准确性的重要程度足以证明进行针对性评估或采用多供应商架构是合理的工作负载。

关键词与流式能力瞄准高难度生产音频

第四和第五项功能针对两类反复出现的部署问题:专业词汇与对话延迟。

关键词提示允许应用在转录前提供姓名、产品、地点、缩写或技术术语。模型随后会在解码过程中对这些词给予更高权重。

这很重要,因为专有名词是破坏性最大的识别错误之一。一份转录可能保留了周围的句子,却拼错了正在讨论的客户、药物、公司或设备名称。

Sarvam 的 REST 和批处理 API 可为 Saaras V4 接收最多 50 个关键词。根据其文档,流式端点目前尚未提供相同功能。

Sarvam 使用与 AI4Bharat 相关的基准 IndicContextEval 对提示功能进行了评估。该公司报告称,在 L5 设置下,模型实现了 16.03% 的 WER;该设置提供了领域实体的原生文字列表以及语言信息。

这一结果表明提示有所帮助,但也说明了一项部署要求:应用需要可靠地在每段录音前选出合适的术语。

医院可能提供临床医生姓名、药物和医疗程序。金融呼叫中心可能提供基金名称、证券和客户实体。发送一份庞大的通用列表,反而可能降低提示的实用性。

实时应用还面临另一项限制:转录文本必须足够快地出现,语音代理才能在不产生尴尬停顿的情况下作出回应。

Sarvam 宣称,Saaras V4 能在 150 毫秒内返回第一个流式 token。该公司还表示,系统可在一秒内处理时长数分钟的录音。

这些数字应被视为供应商报告的性能数据。端到端延迟还包括网络传输、音频缓冲、端点检测、应用处理,以及语音代理流水线中的下一个模型。

第一个 token 不一定代表稳定的转录文本。随着更多音频输入,流式识别系统通常会修订先前的文本。开发者应同时衡量初始延迟,以及完成最终片段所需的时间。

Sarvam 在发布后扩大了 V4 的实时可用性。其 9 月更新日志称,该模型已通过较新的 Realtime API 提供服务,尽管当时 V3 仍是默认模型。

这一细节值得关注。文档将 Saaras V4 描述为最新模型,同时仍建议将 V3 作为默认选择。这表明客户不应假定 V4 自动成为适用于所有工作负载的最稳妥迁移方案。

低延迟也不保证良好的轮次衔接。语音活动检测必须判断说话者何时暂停或结束发言。激进的设置可能打断人们,而保守的设置则会带来明显延迟。

嘈杂的电话音频进一步提高了难度。Sarvam 表示,V4 专为 8 kHz 通话、削波、干扰、语言混用和方言差异而设计。这些情况在支持服务和现场服务录音中经常同时出现。

有意义的测试应将它们结合起来。干净的录音棚片段无法揭示这样一种情况:来电者说话很快、切换语言、提到陌生姓名,并与另一人同时讲话时,系统会发生什么。

团队还应检查模型周边的运营能力。监控、区域处理、留存控制、故障处理、速率限制和支持服务,可能与微小的准确率优势同样重要。

Saaras V4 的关键词提示与流式能力组合颇具潜力,因为它瞄准了真实生产环境中的故障点。竞争结果取决于这些能力能否在大规模环境下保持可靠。

基准测试仍需独立的生产环境验证

Sarvam 已发布了大量证据,但其最广泛的性能主张仍需在公司自行开展的比较之外得到验证。

对于英语,Sarvam 在七个数据集上评估了 Saaras V4。这些数据集涵盖会议室语音、播客、有声书、网络视频、录音棚录音、复杂声学环境、金融电话、议会发言以及带印度口音的英语。

这些具名数据集包括 AMI、GigaSpeech、两个 LibriSpeech 划分、SPGISpeech、VoxPopuli 和 Svarah。Sarvam 表示,V4 在这组数据中实现了最低的平均 WER。

该公司称,六个国际数据集的结果来自 Open ASR Leaderboard。它表示,规范化和评分均遵循该排行榜公开发布的代码。

这比未具名的内部基准更具参考价值,因为它明确了数据集、评分方法和竞争系统。

不过,这些比较仍由 Sarvam 汇总并呈现。模型版本、API 设置、提示配置、音频预处理和发布时间都可能影响结果。

基准平均值也可能掩盖弱点。某个模型可能在整体上领先,却在特定口音、声道或说话风格上落后。买方应查看与自身流量相似的数据集级结果。

印度语言评估还带来额外复杂性。一些竞争对手并不支持每种语言,另一些则可能需要明确选择语言。覆盖缺失与识别不佳是不同的限制,即使两者都会阻碍成功部署。

Saaras V4 还与覆盖范围不同的产品竞争。ElevenLabs 强调广泛的语言支持、细粒度时间戳、实体检测和编辑能力。Deepgram 高度侧重于实时转录基础设施。OpenAI 则将转录集成到更广泛的 AI 平台中。

当训练投入集中在印度语音上时,Sarvam 较窄的语言目录可能是一项优势。对于希望拥有一份全球合同和一个 API 的公司而言,它也可能是一项劣势。

隐私和治理需要单独审查。托管式语音系统会处理可能包含个人、财务或健康信息的对话。准确率排名无法回答音频存储在何处、谁可以访问,以及留存如何运作。

该模型的封闭部署限制了外部审查。研究人员可以评估 API 输出,但无法在没有服务访问权限的情况下全面审计训练数据、复现模型或研究错误。

Saaras 在其文档化响应中也缺少词级时间戳。Translate 模式仅输出英语,而实时 REST 端点的输入时长上限为 30 秒。更长的文件必须使用批处理。

这些限制尚可管理,但会使“一个模型可取代整套转录技术栈”的说法变得更复杂。生产系统仍需要存储、质量审查、策略控制和回退行为。

Sarvam 最有力的证据涉及语音准确性和印度语言覆盖。其较弱的证据则涉及客户负载下的长期可靠性、敏感领域中的错误行为,以及相对于成熟供应商的运营优势。

正确的回应不是否定这些基准,而是在具有代表性的录音上复现它们,同时追踪对应用真正重要的错误。

客户支持团队应对账号和产品名称赋予更高权重。会议助手应测试重叠说话者和归因。媒体工作流应检查标点、时间对齐和长文本稳定性。

开发者还应比较规范化输出与逐字输出。当应用必须保留每一次犹豫、数字或修正时,较低的 WER 分数可能呈现出不同意义。

有三个信号将决定 Sarvam AI Saaras V4 的发布是否改变市场。

第一,独立评估必须在嘈杂的印度语音和全球英语场景中复现其优势。持续一致的第三方结果将加强 Sarvam 的核心准确性主张;显著差距则会削弱这一主张。

第二,生产环境采用必须超越演示。具有意义的证据将包括其在呼叫中心、语音代理、会议系统和多语言媒体工作流中的持续使用。

第三,竞争对手将通过更好的印度语言覆盖、语码转换或区域部署选项作出回应。大型供应商的明显反应将证实 Sarvam 已形成商业压力。

对开发者而言,眼下的行动很直接:从获得同意且具有代表性的录音中建立私有评估集,其中应包含复杂口音和较差音频。除整体 WER 外,还应单独评估重要实体。

企业买方应在原始准确率之外,测试延迟、转录稳定性、说话人分离和数据治理。知识工作者应关注会议和访谈工具是否会采用 Saaras,同时不削弱编辑控制能力。

Sarvam 已为专用多语言语音识别提出了有力的技术论证。如今,Saaras V4 必须证明,其在基准测试中的领先优势能够经受真实对话复杂环境的考验。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page