top of page

Sarvam AI Saaras V4、インド諸語音声の水準を引き上げるが、ベンチマークは出発点にすぎない

9月27日
読了時間: 19分

Sarvam AIは、インドの22言語、グローバル英語、そして文字起こしを整形する5つの方法をサポートするSaaras V4を発表した。Sarvam AI Saaras V4は、複数の英語およびインド諸語音声ベンチマークでトップクラスの精度を実現するとも主張している。この組み合わせは、OpenAI、ElevenLabs、Deepgramの汎用サービスに圧力をかけるものだ。

この発表が重要なのは、インドにおける音声認識が単なる英語の文字起こしの問題ではないからだ。実際の会話には、地域言語、英語の用語、地元のアクセント、圧縮された電話音声、頻繁な話者交代が混在する。クリーンな録音で優れた性能を示すシステムでも、企業が実際に受ける通話では苦戦する可能性がある。

Sarvamは、地域への深い対応力が、グローバルベンダーのより広い言語カバレッジと確立されたインフラに対抗できると見込んでいる。最も明確な差別化要因は、カスタム言語モデルデコーダー、幅広いインド諸語対応、5つのネイティブ出力モード、キータームプロンプティング、低遅延ストリーミングの5つだ。ただし、性能に関する根拠の大半は依然としてSarvam自身の評価によるものであり、導入後の結果こそがより重要な試金石となる。

Sarvam AI Saaras V4が多言語ASR競争を変える

Saaras V4は、Sarvamのインド特化型音声モデルを、グローバルな文字起こしプラットフォームに対するより広範な挑戦へと押し上げる。

Sarvamは、詳細なSaaras V4 releaseを通じて、2026年8月24日にこのモデルを発表した。その数日前にAPI版を導入し、9月2日にはSarvam Voice Agents向けにモデルを一般提供した。

このリリースは、インドの指定22言語への対応を維持しつつ、インド英語を超えた英語認識を拡大している。Sarvamはこれを、国際的な音声データセットに含まれるアクセントも対象とするグローバル英語対応と説明している。

この変更により、モデルが対応できる業務範囲は広がる。インドのカスタマーサービス業務では、ヒンディー語、タミル語、ベンガル語の通話に加え、インド、英国、米国英語が使われる会話を受ける可能性がある。これらの通話に1つの認識システムを使えれば、ルーティングルールやモデル切り替えを減らせる。

Saaras V4は、REST、バッチ、レガシーWebSocket、より新しいリアルタイムインターフェースを通じて利用できる。Sarvamのmodel documentationは、音声エージェント、通話分析、コードミックス音声、8 kHzの電話音声を主な用途として挙げている。

RESTインターフェースは、最大30秒の録音を受け付ける。バッチサービスは最長2時間のファイルに対応し、ストリーミングオプションではライブ会話中に部分的な文字起こしを返す。話者分離はバッチ処理で利用できる。

このリリースは、急速な製品サイクルも示している。Saaras V3は2026年2月に登場し、同じ22のインド言語と英語に対応していた。Sarvamによれば、このバージョンはIndicVoicesにおける単語誤り率を約22%から約19%へ引き下げた。

V4は競争上の主張を変えている。V3は主にインド音声の専門モデルとして位置付けられていた。V4は国際英語のベンチマークを加え、インド諸語とより広い英語ワークロードの両方に対応する単一モデルとして自らを提示している。

これは、Sarvamがグローバルな文字起こしサービスが対応するすべての言語を突然カバーするようになったという意味ではない。Saarasは23の明示された言語に重点を置く一方、他プラットフォームははるかに大規模な言語カタログを掲げている。同社の主張は、可能な限り長い言語リストではなく、対応言語における深さにある。

この違いが、本記事の中心的な緊張関係を生む。Sarvamは、専門化によって、英語性能を犠牲にせず難しいインド言語でより優れた認識を実現したと述べる。グローバルベンダーは、より広いカバレッジ、成熟したツール群、基本的な文字起こしを超える機能で対抗できる。

したがって企業の購入担当者にとって、この判断は単一のリーダーボード順位に関するものではない。実際のアクセント、語彙、音声チャネル、コードスイッチングのパターンで、どのシステムが安定して機能するかという問題である。

30億パラメータのデコーダーが音声と言語を結び付ける

最初の特徴は、文字起こしを孤立した音声照合ではなく、文脈を伴う言語生成として扱うよう設計されたアーキテクチャだ。

Saaras V4は、音声エンコーダーと30億パラメータの自己回帰型言語モデルデコーダーを組み合わせている。Sarvamは、このハイブリッド状態空間デコーダーを社内でゼロから学習させたとしている。

音声エンコーダーは、波形から音声学的・音響的な情報を抽出する。続いて時間方向のダウンサンプリングアダプターが、その情報を圧縮したうえでデコーダーの埋め込み空間へ投影する。この削減により、より長い録音をモデルの利用可能なコンテキスト内に収めやすくなる。

デコーダーは、これらの音声表現をテキストプロンプトとともに処理する。文字起こしトークンを順次生成し、各結果を次のトークンを生成する前にモデルへフィードバックする。

このアプローチは、複数の単語が似た音に聞こえる場合に重要となる。音響的な証拠だけでは、話者がどの単語を使ったか判断できないことがある。文脈、文法、起こりやすい単語列が、もっともらしい文字起こしへとデコーダーを導ける。

LLMベースのデコーダーは、出力を制御する指示にも対応する。同じ基盤モデルに対し、フィラーワードを保持する、数字を正規化する、発話を音写する、あるいは結果を英語に翻訳するといった要求を与えられる。

ただし、文脈的デコーディングにはよく知られたリスクがある。もっともらしいテキストを予測するモデルは、自然に聞こえるものの実際には発話されていない単語を生成する可能性がある。この失敗は、医療、金融、法務、コンプライアンスの記録で特に深刻だ。

Sarvamによれば、V4はノイズを含む録音、方言の違い、コードミックス音声向けに設計されている。これらは音響信号そのものがすでに曖昧である可能性があるため、厳しい条件だ。言語を認識するデコーダーは役立つ可能性があるが、欠けた証拠を流暢な創作で置き換えてはならない。

そのため開発者は、削除、挿入、置換のエラーを分けて検証すべきだ。一見読みやすい文字起こしでも、限定条件を省略したり、数字を変えたり、聞き慣れない名前を置き換えたりする可能性がある。

このアーキテクチャは再現性についても疑問を投げかける。Sarvamはモデルと評価プロセスを説明しているが、Saaras V4の重みは公開していない。購入者は、学習データを独自に調査したり、自らのインフラ上で実行したり、すべてのアーキテクチャ上の主張を検証したりできない。

そのため、実用上の評価単位はホスト型APIとなる。チームは、レイテンシー、稼働率、データ処理、文字起こしの安定性を含め、提供されるサービスそのものを測定する必要がある。

モデルサイズだけでは、ほとんど判断材料にならない。音声学習と対応言語がワークロードにより適合していれば、小規模なデコーダーが大規模なデコーダーを上回ることもある。逆に、特化型モデルは会話が想定ドメインの外に及ぶと苦戦する可能性がある。

有用な問いは、このアーキテクチャが新たな文脈上の誤りを生まずに、実際のインド音声におけるエラーを減らせるかどうかだ。Sarvamのベンチマーク結果は前向きなシグナルを示すが、より強い証拠となるのは顧客の音声データである。

5つの出力モードが複数の処理工程を省く

2つ目の主要機能は、1つのモデルが同じ録音から5種類の異なる表現を生成することだ。

Saaras V4は、transcribe、verbatim、code-mixed、transliteration、translationの各モードをサポートする。これらは単なる見た目の整形オプションではなく、それぞれ異なる後続ワークフローに対応する。

Transcribeモードは、元の言語でテキストを生成し、数字や日付などの要素を正規化する。句読点も復元するため、結果は閲覧、インデックス作成、日常的な分析に適している。

Verbatimモードは、フィラーワードと話し言葉の数字表現を保持する。コンプライアンスチーム、研究者、会話分析担当者は、正規化によって発話の仕方に関する詳細が失われる可能性があるため、このバージョンを好む場合がある。

Code-mixedモードは、インド言語の単語をネイティブスクリプトで保持しつつ、話された英単語をラテン文字で維持する。この形式は、多言語会話が自然に書かれ、レビューされるあり方を反映している。

Transliterationモードは、意味を翻訳せずに発話をラテン文字で表記する。Sarvamはこれを、非公式なデジタルコミュニケーションで一般的に使われるスタイルと説明している。ネイティブスクリプトを読めない利用者でも、ヒンディー語やその他の対応言語の発話を理解しやすくなる。

Translationモードは、対応するインド諸語の音声を直接英語テキストに変換する。国際的なサポートチーム、レポーティングシステム、共通の出力言語を必要とする分析担当者に役立つ可能性がある。

従来のパイプラインでは、これらの作業を別々のコンポーネントで行うことが多い。1つのサービスが音声を認識し、別のサービスが文字起こしを正規化し、さらに3つ目が翻訳または音写を行う。変換工程が増えるたびに、エラーが入り込んだり情報が失われたりする可能性がある。

Saaras V4は、5つすべての形式を1つのモデル内で生成する。Sarvamは、この設計により、別々の前処理段階から生じる連鎖的な誤りを回避できると主張する。

この主張には実用上の魅力がある。カスタマーサービスプラットフォームでは、レビュー用に逐語的な発話を保存し、エージェントに正規化テキストを表示し、分析システムには英語出力を送ることがある。1つの認識モデルで、それぞれの用途を支援できる可能性がある。

この5つのモードは、ナレッジワークフロー内で音声をより活用しやすくもする。チームが正規化済みまたは翻訳済みのテキストを選べるようになれば、会議録音やインタビューを検索しやすくなる。検索可能なAI knowledge baseは、文字起こしを関連するノートや文書と結び付けられる。

それでも、1つのモデルですべての処理判断が不要になるわけではない。チームは、どの表現を正本とするか、元の録音をどう保存するか、翻訳テキストが機密性の高い判断に適しているかを決めなければならない。

Sarvamのドキュメントによれば、Translationモードの出力は英語のみである。対応言語のあらゆる組み合わせ間で任意の翻訳を提供するわけではない。

また、標準レスポンスでは単語単位のタイムスタンプは利用できない。APIはフレーズ単位またはチャンク単位のタイミングを提供し、バッチ処理では話者に紐付いた文字起こしを追加できる。

これらの制約は、字幕編集者、フォレンジックレビュー、正確なアラインメントを必要とするアプリケーションにとって重要だ。詳細な単語タイミングや文字起こし編集機能を提供する競合製品が、こうした用途では引き続き望ましい可能性がある。

それでも5つのモードは、Saarasを基本的な音声テキスト変換エンドポイントと区別する。Sarvamは文字起こしの表現形式を認識の一部として扱っており、これは多言語の本番システムが求める要件をよりよく反映している。

インド諸語対応は主要言語の枠を超える

3つ目の差別化要因は、低リソース言語を含む、インドの指定22言語すべてにわたる一貫した製品サポートだ。

Saaras V4は、ヒンディー語、ベンガル語、タミル語、テルグ語、マラーティー語、グジャラート語、カンナダ語、マラヤーラム語、パンジャブ語、アッサム語、ウルドゥー語、オディア語をサポートする。また、ネパール語、コンカニ語、カシミール語、シンド語、サンスクリット語、サンタル語、マニプリ語、ボド語、マイティリー語、ドーグリー語にも対応する。

この広さは、学習リソースが均等に分布していないため重要だ。主要言語には、より大規模な音声コーパス、より多くのラベル付き録音、より高い商業需要がある。規模の小さい言語では、認識精度が低かったり、まったくサポートされなかったりすることが多い。

Sarvamは、V4が22言語すべてで最先端の結果を達成していると述べている。これは依然として同社の主張だが、同社は評価手法と使用したデータセットを公開している。

Sarvamは、インドの10言語についてVistaarでモデルを評価した。この評価には、Common Voice、FLEURS、Gramvaani、IndicTTS、Kathbath、ノイズを含むKathbath録音、MUCSが含まれる。

Sarvamは、従来の単語誤り率とLLM-WERの両方を報告している。標準的なWERは、予測された文字起こしと参照文字起こしの間にある置換、挿入、削除を数える。

LLM-WERは、意味に関する判定の工程を加える。意味を変える差異と、基礎となる内容を保つ表記や書式の揺れを区別しようとするものだ。

インドの言語では、表記形式や正規化の慣習が異なるため、この区別は有用になり得る。2つの文字起こしが同じ言葉を伝えていても、従来のWERではペナルティが科される場合がある。

ただし、別の言語モデルに基づく評価器は、指標に判断を持ち込むことになる。結果は判定を行うモデルとその指示に左右され得る。従来のWERは、無害な差異を過大に評価する場合があっても、再現しやすいままである。

言語識別もSarvamのカバレッジ主張を構成する要素だ。Saaras V4は、インドで最も話者数の多い10言語において、識別エラー率2.9%を記録したと報告されている。Sarvamは、全22言語では5.22%と報告している。

自動検出により、あらゆる録音を事前にラベル付けする必要がなくなる。これは、共用のコールキュー、公共サービス回線、多言語の利用者に対応する消費者向けアプリケーションで有用だ。

一方、コードスイッチングが発生すると言語識別はより複雑になる。SarvamのAPIは複数言語が現れる場合、主要言語を返す。単語レベルの言語ラベルを必要とするアプリケーションでは、追加ロジックが求められる可能性がある。

グローバルな競合各社は、多言語対応を異なる形で位置付けている。ElevenLabsは、そのtranscription systemが90以上の言語を認識し、単語単位のタイムスタンプ、エンティティ検出、話者ダイアライゼーションを提供するとしている。

Deepgramのmultilingual modelsは、より狭い範囲の広く使われる言語にまたがるリアルタイムのコードスイッチングをサポートする。成熟したストリーミングサービスと音声エージェント向けツール群が、異なる競争優位性を生んでいる。

OpenAIは、GPT-4o Transcribeについて、以前のWhisperモデルより単語誤り率と言語認識を改善していると説明している。その魅力の一部は、より大きなモデルプラットフォームとの統合にある。

Sarvamの答えは、あらゆるグローバル言語に対応することではない。言語的に複雑な特定市場で、より高い性能を示すことを目指す戦略だ。

この戦略は、幅広いサポートの裏に品質のばらつきが隠れ得る領域で競合に圧力をかける。言語を一覧に載せるだけでは、地域アクセント、混在する文字体系、名前、電話音声圧縮、口語表現をシステムがどう処理するかは分からない。

同時に、Sarvamは中核対象外では不利になり得る。欧州、アフリカ、東アジアの言語をカバーする多国籍企業は、Saarasがインドの通話で優れていたとしても、より広範な単一プロバイダーを選ぶかもしれない。

したがってV4が最も力を発揮するのは、インド言語の精度が十分に重要であり、重点的な評価やマルチプロバイダー構成を正当化できるワークロードだとみられる。

キータームとストリーミングは、困難な本番音声を狙う

第4および第5の機能は、専門用語と会話遅延という、導入時に繰り返し生じる2つの問題に対応する。

キータームプロンプティングにより、アプリケーションは文字起こしの前に、名前、製品、場所、略語、技術用語を指定できる。モデルはデコード時にそれらの用語をより重視する。

これは、固有名詞が最も大きな認識エラーの一つだからだ。文字起こしは周囲の文章を保てても、話題となっている顧客、医薬品、企業、機械の名前を誤記する可能性がある。

SarvamのREST APIとバッチAPIでは、Saaras V4向けに最大50個のキータームを受け付ける。ドキュメントによれば、ストリーミングエンドポイントは現時点で同じ機能を公開していない。

Sarvamは、AI4Bharatに関連するベンチマークであるIndicContextEvalでプロンプティングを評価した。同社は、ドメインエンティティのネイティブ文字リストと言語を提供するL5設定で、WER 16.03%を報告している。

この結果は、プロンプティングが役立つことを示唆する一方、導入上の要件も浮き彫りにする。アプリケーションは、録音ごとに適切な用語を選択する信頼性の高い方法を必要とする。

病院では、医師名、医薬品、処置を提供するかもしれない。金融コールセンターでは、ファンド名、証券、顧客エンティティを指定する可能性がある。巨大な汎用リストを送ると、プロンプトの有用性が下がるおそれがある。

リアルタイムアプリケーションには別の制約もある。音声エージェントが不自然な間を置かずに応答するには、文字起こしが十分に速く表示されなければならない。

Sarvamは、Saaras V4が最初のストリーミングトークンを150ミリ秒未満で返せると主張している。また、複数分に及ぶ録音を1秒以内に処理できるとしている。

これらの数値は、ベンダー報告の性能として扱うべきだ。エンドツーエンドの遅延には、ネットワーク転送、音声バッファリング、エンドポイント検出、アプリケーション処理、音声エージェントのパイプラインにおける次のモデルも含まれる。

最初のトークンは、必ずしも確定した文字起こしではない。ストリーミング音声認識システムは、さらに音声が到着すると先行するテキストを修正することが多い。開発者は初期レイテンシーと、セグメントが確定するまでに必要な時間の両方を測定すべきだ。

Sarvamは、ローンチ後にV4のリアルタイム提供を拡大した。同社の9月の変更履歴では、新しいRealtime API経由でモデルが利用可能になったとされるが、その時点ではV3がデフォルトのままだった。

この詳細には注意を払うべきだ。ドキュメントはSaaras V4を最新モデルとして説明しつつ、依然としてV3をデフォルトとして推奨していた。これは、顧客がV4がすべてのワークロードにとって自動的に最も安全な移行先だと想定すべきではないことを示唆する。

低レイテンシーも、優れたターンテイキングを保証するものではない。音声活動検出は、話者が一時停止したのか話し終えたのかを判断しなければならない。積極的な設定は人の発話を遮る可能性があり、慎重な設定は目立つ遅延を加える。

ノイズの多い電話音声では、重要性がさらに高まる。Sarvamによれば、V4は8 kHz通話、クリッピング、干渉、コードミキシング、方言差に対応するよう設計された。こうした条件は、サポートや現場サービスの録音で頻繁に同時発生する。

意味のあるテストでは、これらを組み合わせるべきだ。クリーンなスタジオ音声では、発信者が速く話し、言語を切り替え、聞き慣れない名前に言及し、別の人物と発話が重なった場合に何が起きるかは分からない。

チームはモデル周辺の運用機能も確認すべきだ。監視、リージョナル処理、保持管理、障害処理、レート制限、サポートは、わずかな精度優位性と同じほど重要になり得る。

Saaras V4のキータームプロンプティングとストリーミングの組み合わせは、実際の本番障害を狙っているため有望だ。競争上の成果は、こうした能力が大規模環境でも信頼性を維持できるかに左右される。

ベンチマークには独立した本番テストが必要だ

Sarvamは相当量の証拠を公開しているが、最も広範な性能主張については、同社運営の比較を超えた検証がなお必要である。

英語について、Sarvamは7つのデータセットでSaaras V4を評価した。会議室の音声、ポッドキャスト、オーディオブック、ウェブ動画、スタジオ録音、困難な音響環境、金融通話、議会発言、インド英語アクセントを対象としている。

列挙されたデータセットはAMI、GigaSpeech、2つのLibriSpeech分割、SPGISpeech、VoxPopuli、Svarahである。Sarvamは、V4がこのグループ全体で最も低い平均WERを達成したとしている。

同社は、6つの国際データセットについてOpen ASR Leaderboardの結果を利用したと報告している。正規化とスコアリングは、リーダーボードが公開しているコードに従ったという。

これは、名称不明の社内ベンチマークよりも多くの情報を提供する。データセット、スコアリング手法、競合システムを特定しているためだ。

ただし比較は依然としてSarvamが組み立て、提示したものだ。モデルのバージョン、API設定、プロンプト構成、音声前処理、リリース時期が結果に影響し得る。

ベンチマークの平均値は弱点を隠す場合もある。モデルは総合的には首位でも、特定のアクセント、チャネル、発話スタイルでは劣る可能性がある。購入者は、自社トラフィックに近いデータセット単位の結果を確認すべきだ。

Indicの評価には追加の複雑さがある。競合の一部はすべての言語をサポートしておらず、別の製品では明示的な言語選択が必要な場合もある。対応範囲の欠如と認識性能の低さは異なる制約であり、どちらも導入の成功を妨げる場合があるとしても同じではない。

Saaras V4は、対象範囲が異なる製品とも競合している。ElevenLabsは幅広い言語対応、詳細なタイムスタンプ、エンティティ検出、編集を強調する。Deepgramはリアルタイム文字起こしのインフラストラクチャに大きく注力している。OpenAIは文字起こしをより広いAIプラットフォームと統合している。

Sarvamのより狭い言語カタログは、学習の取り組みがインドの音声に集中している場合には強みになり得る。また、グローバルで単一の契約と単一のAPIを望む企業にとっては弱みになり得る。

プライバシーとガバナンスには別途の検討が必要だ。ホスト型音声システムは、個人情報、金融情報、健康情報を含む可能性がある会話を処理する。精度ランキングは、音声がどこに保存されるか、誰がアクセスできるか、保持がどのように機能するかには答えない。

モデルのクローズドな提供形態は、外部からの検証を制限する。研究者はAPI出力を評価できるが、サービスにアクセスしなければ、学習データを完全に監査したり、モデルを再現したり、エラーを研究したりすることはできない。

Saarasは、ドキュメント化されたレスポンスで単語単位のタイムスタンプも提供していない。Translateモードは英語のみを生成し、リアルタイムRESTエンドポイントの入力上限は30秒である。より長いファイルにはバッチ処理が必要だ。

これらは管理可能な制約だが、1つのモデルが文字起こしスタック全体を置き換えるという主張を複雑にする。本番システムには依然として、ストレージ、品質レビュー、ポリシー制御、フォールバック動作が必要である。

Sarvamの最も強い証拠は、音声認識精度とIndic対応に関するものだ。より弱い証拠は、顧客負荷下での長期的な信頼性、センシティブな領域でのエラー挙動、既存ベンダーに対する運用上の優位性に関するものだ。

適切な対応は、ベンチマークを退けることではない。アプリケーションにとって重要なエラーを追跡しつつ、代表的な録音で再現することだ。

カスタマーサポートチームは、口座番号や製品名を重く評価すべきだ。会議支援ツールは、発話の重なりと話者帰属を検証すべきだ。メディア向けワークフローは、句読点、タイミング、長時間音声での安定性を調べるべきだ。

開発者は、正規化済み出力と逐語出力も比較すべきだ。アプリケーションがすべてのためらい、数字、訂正を保持しなければならない場合、低いWERスコアは異なって見える可能性がある。

Sarvam AI Saaras V4のローンチが市場を変えるかどうかは、3つのシグナルによって決まる。

第一に、独立評価が、ノイズを含むインドの音声とグローバル英語において、その優位性を再現しなければならない。一貫した第三者の結果はSarvamの中核的な精度主張を強化する。大きな差異があれば、それは弱まる。

第二に、本番導入がデモンストレーションを超えて広がる必要がある。意味のある証拠には、コールセンター、音声エージェント、会議システム、多言語メディアワークフローでの継続的な利用が含まれる。

第三に、競合各社は、より優れたIndic対応、コードスイッチング、リージョナル展開オプションを通じて応答するだろう。大手ベンダーから目に見える反応があれば、Sarvamが商業的な圧力を生み出したことが裏付けられる。

開発者にとって、直近の行動は明確だ。同意を得た代表的な録音から、難しいアクセントや劣悪な音声を含む非公開の評価セットを構築する。重要なエンティティは、総合WERとは別にスコアリングする。

エンタープライズの購入者は、生の精度と併せて、レイテンシー、文字起こしの安定性、話者分離、データガバナンスをテストすべきだ。ナレッジワーカーは、編集の主導権を損なうことなく、会議・インタビューツールがSaarasを採用するかを注視すべきである。

Sarvamは、特化型の多言語音声認識が持つ技術的意義を強く示した。次にSaaras V4は、そのベンチマーク上の優位性が、実際の会話に伴う雑然とした条件下でも維持されることを証明しなければならない。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page