GPT-Live-1音声ベンチマークでOpenAIがGrokを0.2ポイント上回る
Artificial Analysisは最新のGPT-Live-1音声ベンチマークでOpenAIを首位に位置付け、Astraを組み合わせた構成に81.5の指数スコアを与えた。この結果は、Grok Voice Think Fast 2.0 Highの81.3をわずかに上回る。
差はわずか0.2ポイントだが、その背景にある構成を踏まえると結果の意味合いはより大きい。GPT-Live-1がリアルタイムの音声対話を処理し、GPT-6 Astraが中程度の推論努力でより深い推論を担う。Solを用いたGPT-Live-1構成は80.1を記録し、3位になったと報じられている。
したがって、これは自己完結型の音声モデル同士による単純な競争ではない。ライブモデル、バックエンドの知能、ツールへのアクセス、オーケストレーションの選択を含む、完全な音声エージェントシステムの比較である。
このランキングは、7月にGrok Voice Think Fast 2.0が公開された後に示された構図も覆している。当時、xAIはArtificial Analysisの以前の指数を引用し、GrokがOpenAIとGoogleの主要システムをリードしていたと述べていた。
Artificial Analysisはその後、指数の手法を改定した。OpenAIもまた、会話制御とより深い推論を分離する音声アーキテクチャを公開している。これらの変化により競争順位は再編された一方、見出しとなるスコアを単独で解釈することは難しくなった。
GPT-Live-1音声ベンチマークに新たな首位
Artificial Analysisは現在、Astraを組み合わせたGPT-Live-1を首位と報告している。ただし、リーダーボードが測定しているのは単独で動作する一つのモデルではなく、組み立てられたシステムである。
この結果は、GPT-Live-1がOpenAIのAPIで利用可能になった後に公開されたArtificial Analysisの投稿で示された。投稿では、上位3つの構成が挙げられている。
中程度の推論努力でAstraを組み合わせたGPT-Live-1:81.5
Grok Voice Think Fast 2.0 High:81.3
Solを組み合わせたGPT-Live-1:80.1
首位から3位までの差は1.4ポイントである。OpenAIの最上位構成とGrokの差はわずか0.2ポイントにすぎず、技術的優位性について広範な結論を下すのは時期尚早だ。
それでもこのランキングが重要なのは、Artificial Analysisが音声品質以上の要素を評価しているためだ。現在の音声リーダーボードでは、この指数を4つの異なる要素を等しく重み付けした組み合わせとして説明している。
Speech Reasoningは、システムが音声による推論問題を理解し、正しい音声回答を返せるかを測る。Agentic Performanceは、ツールとポリシー指示を通じて顧客サービス業務を完了できるかを検証する。
Arena Preferenceは、ライブかつブラインド化された比較で得られる人間の好みを捉える。Task Success Rateは、単に流暢に話すだけでなく、システムが実際に割り当てられた業務を完了できるかを評価する。
指数スコアを得るには、4つすべての要素で有効な結果が必要となる。この要件により、高速または心地よい音声が、一つの側面だけで優れているという理由で首位になることを防いでいる。
指数の推論要素では、1,000件の音声質問から成るBig Bench Audioを使用する。質問は、形式論理、ナビゲーション、物体数のカウント、文章問題として表現されたブール推論を対象とする。
Agentic Performanceにはτ-Voiceフレームワークを用いる。航空、小売、通信などの領域に関わる、シミュレーションされた顧客サービス問題をシステムに提示する。
エージェントは発信者を理解し、ポリシーに従い、正しいツールを呼び出し、基盤となるデータベースを求められる状態にしなければならない。依頼されたアクションが未完了のままであれば、説得力のある音声回答でも評価されない。
この設計により、GPT-Live-1音声ベンチマークは業務エージェントを構築する企業にとって意味を持つ。音声システムが会話的な振る舞いを推論と実行に結び付けられるかを評価しているためだ。
ただし、この結果をあらゆる導入形態に対する普遍的な判断として読むべきではない。これは、テストされた構成、選定されたワークロード、そして公開時点で利用可能なベンチマークのバージョンを反映したものだ。
Artificial Analysisは、モデルやプロバイダーの変化に応じて結果を更新すると説明している。そのためリーダーボードは現在のスナップショットとしては有用だが、恒久的な序列としては適していない。
わずかなリードには、通常の実行ごとのばらつき、実装の違い、将来のベンチマーク改定が入り込む余地も大きい。Artificial Analysisは、0.2ポイント差を、あらゆるGPT-Live-1アプリケーションがGrokを上回る証拠として提示してはいない。
より確かな結論は、より限定的である。公開された評価フレームワークの下では、Astraを組み合わせたOpenAIの音声システムが現在、最も高い総合結果を保持している。
OpenAIは音声モデルの定義を変えた
GPT-Live-1は、複雑な作業を委任できるリアルタイム会話レイヤーとして競争しており、開発者が評価すべき単位を変えている。
OpenAIは2026年7月8日にChatGPTでGPT-Live-1を公開した。9月10日には、更新されたArtificial Analysisの結果のわずか数日前に、このモデルをAPIでも提供開始した。
GPT-Live-1はフルデュプレックスアーキテクチャを採用しており、同時に聞き取りと発話ができる。従来の音声システムでは、多くの場合、音声認識、言語処理、音声生成を別々のコンポーネントで順に処理する。
この連鎖型の設計でも十分に機能し得るが、引き継ぎのたびに調整が加わる。また、間、割り込み、ためらい、背景音声、変化するユーザー意図に関する情報が失われる可能性もある。
OpenAIのGPT-Live-1リリースによると、このモデルは一つの会話レイヤー内で、入出力される音声を横断して推論する。対話を維持しながら、相づちや割り込みに応答できる。
このモデル自身が、すべての難しいタスクを実行する必要はない。より深い推論やツール呼び出しを、開発者が選んだバックエンドモデルへ委任できる。
この違いが、Artificial AnalysisのラベルにAstraとSolが含まれる理由を説明する。テストされたシステムは、GPT-Live-1の音声上の振る舞いと、より要求の高い推論を実行する別モデルを結び付けている。
OpenAIは、委任を、バックグラウンドで作業が進む間も会話を継続する方法として説明している。音声レイヤーは、バックエンドが検索、推論、ツール利用を終える前に、リクエストを受け取ったことを伝えられる。
このアーキテクチャは問題を関連する二つの役割に分割する。ライブモデルはタイミング、聞き取り、発話、割り込みを管理する。バックエンドは、より多くの計算や外部システムを要するタスクを処理する。
OpenAI自身の評価は、意図された利点を示している。同社によると、GPT-Live-1はFull Duplex Benchの性能をGPT-Realtime-2.1比で30パーセントポイント改善した。
また、中程度の努力設定でAstraを組み合わせたGPT-Live-1は、同社のTau3評価で1位になったと報告している。Tau3は、航空、小売、通信のシナリオにおけるエンドツーエンドの顧客サービス性能を測定する。
これらは企業による報告結果であり、あらゆる本番環境での性能を独立して証明するものではない。Artificial Analysisは別の評価を提供しているが、その指数も選ばれたプロンプト、ツール、シミュレーター、採点方法に依存する。
このアーキテクチャは、購入者が製品を比較する方法も変える。ライブ体験が独立して選ばれるバックエンドに依存する場合、従来型のモデルカードだけでは不十分になる。
81.5と80.1というスコアは、実務上の影響を示す。両方の構成でGPT-Live-1は音声レイヤーのままだが、バックエンドを変えると測定可能な1.4ポイントの差が生じる。
この差は、バックエンドが実装の細部ではないことを示唆する。システムの推論、ツール利用、タスク完了能力の測定値に直接寄与している。
開発者にとって、これは柔軟性と責任の両方をもたらす。チームはワークロードに適したバックエンドを選べるが、音声モデルの名前を信頼するだけでなく、組み合わせたシステムを検証しなければならない。
予約支援エージェントでは、高速で予測可能なアクションが優先されるかもしれない。医療予約システムでは、より厳格な指示、検索制御、エスカレーション経路が必要になる可能性がある。
技術サポートエージェントには、ドキュメント、アカウント履歴、診断ツールへのアクセスが必要になることがある。どのケースでも、同じライブインターフェースでも、異なる推論システムに接続すれば異なる結果を生み出し得る。
このモジュール型設計こそが、OpenAIの新たな首位を支える仕組みだ。GPT-Live-1は単により自然に話すだけではない。設定可能なエージェントスタックを会話的に包み込む外殻を提供する。
GPT-Live-1対Grok Voiceはシステム競争になった
主な競争軸は、もはやOpenAIの音声品質対Grokの音声品質ではない。委任型オーケストレーションと、緊密に統合された並列推論との競争である。
xAIは7月下旬にGrok Voice Think Fast 2.0を導入した。同社はこれを、推論、文字起こし、会話、ツールの信頼性を改善したspeech-to-speechモデルとして説明している。
そのGrok Voiceの発表では、Artificial Analysisの以前の比較が引用された。そのバージョンでは、Grokが82.9の総合スコアを獲得し、GPT-Realtime-2.1 Highの79.1を上回っていた。
これらの数値を、新たな81.5および81.3の結果と直接比較すべきではない。Artificial Analysisは8月中に指数を変更しており、数値は異なる総合フレームワークを表している。
現行の手法では、指数内のConversational DynamicsをTask Success Rateに置き換えている。また、音声推論と並んで人間の選好とエージェント性能も組み込んでいる。
新バージョンの下でも、Grok Voice Think Fast 2.0 Highは首位に極めて近い位置にある。81.3というスコアは、OpenAIの首位構成にわずか0.2ポイント差で続く。
Grokは速度面でも明確な実績を維持している。Artificial Analysisは現在、最初の音声出力までの時間を0.70秒と記載しており、この指標では2つのシステムに次ぐ。
最初の音声出力までの時間は、入力を受け取ってからシステムが音を出し始めるまでの速さを測る。体感上の応答性には影響するが、会話体験全体を捉えるものではない。
システムは素早く話し始めても、ユーザーを遮ったり、訂正を誤解したり、誤ったツールを呼び出したりする可能性がある。別のシステムは少し長く待つ一方で、より多くのタスクを正確に完了できるかもしれない。
xAIは、Grok Voiceが話しながら推論すると述べている。同社は、この並列プロセスにより、会話の遅延を加えることなくツールアクションを準備できると主張する。
OpenAIのアプローチは委任を重視する。GPT-Live-1が対話を管理し、その後、要求の高い作業をAstra、Sol、別のモデル、または外部エージェントフレームワークに送る。
これらのアプローチは異なるエンジニアリング上のトレードオフを生み出す。Grokはより統一された製品像を提示する一方、GPT-Live-1はバックエンドを導入時の選択肢として公開している。
OpenAIの方式では、チームはユースケースごとに推論能力を変えられる。一方で、レイテンシー、信頼性、プライバシー、デバッグに影響し得るコンポーネントの数も増える。
Grokの設計は、目に見えるオーケストレーション上の選択肢を一部減らせる可能性がある。しかし購入者は依然として、モデルを取り巻くプロンプト、ツール、ポリシー、ネットワーク条件、障害処理をテストする必要がある。
どちらのアーキテクチャも、周辺アプリケーションを不要にはしない。本番環境の音声エージェントには依然として、認証、データアクセス、可観測性、エスカレーション、意図しないアクションへの安全策が必要だ。
また、最新の組織知識も必要になる。ポリシー、記録、製品ドキュメントが不完全であれば、流暢なエージェントでもリクエストを解決できない。
そのため、音声の導入は、AIナレッジベースを維持するという、目立ちにくい作業と結び付いたままである。話し方が流暢でも、欠落または矛盾したソース資料を補うことはできない。
したがって、この競争はOpenAIとxAIの双方に対し、タスク全体の遂行能力を高める圧力となる。自然な音声対話は、唯一の競争上の境界線ではなく、当然求められる能力になりつつある。
OpenAIは、異なるバックエンドモデルやツール環境でも委任処理の信頼性を維持できることを示さなければならない。xAIは、ワークフローが長期化し制約が増しても、並列推論が引き続き強力な成果をもたらすことを示す必要がある。
新たなランキングではOpenAIが首位に立った。ただし0.2ポイント差は小さく、モデル更新、設定変更、あるいは1項目でのより強い結果によってGrokが逆転できる程度の差にとどまる。
バックエンドの差は0.2ポイントの勝利より重要
最も示唆的な数字は、OpenAIとGrokを分ける僅差ではなく、2つのGPT-Live-1構成の間にある1.4ポイントの差だ。
中程度の推論努力度でAstraを用いたGPT-Live-1は81.5点を記録した。Solをバックエンドとする構成は80.1点だった。
この内部差は、Astra搭載GPT-Live-1とGrok Voice Think Fast 2.0 Highの報告上の差の7倍に当たる。
これは、あらゆる音声タスクでAstraが優れたバックエンドであることを自動的に意味するものではない。ただし、バックエンドの選択がこの複合ベンチマークに実質的な影響を与えたことは示している。
この結果は、製品名の解釈も複雑にする。いずれもGPT-Live-1を掲げる2つのアプリケーションが、明確に異なる推論やタスク完遂の挙動を提供する可能性があるためだ。
違いはバックエンドモデル、推論努力度、システムプロンプト、利用可能なツール、検索品質、あるいはオーケストレーションロジックに由来しうる。ネットワーク状況もユーザー体験をさらに変えうる。
OpenAIは開発者にこれらの選択肢を明示的に委ねている。そのAPIアーキテクチャにより、チームはライブレイヤーを異なるモデルやエージェントハーネスと組み合わせられる。
この柔軟性により、組織は必要な場合にのみ、より強力な推論を割り当てられる。定型的なステータス照会に、係争中の口座取引と同じバックエンド挙動は必要ない。
しかし、動的ルーティングは新たな課題も生む。アプリケーションは、リクエストに委任処理が必要なタイミングを見極め、適切なバックエンドを選び、文脈を保持し、結果を自然に返さなければならない。
また、バックエンドに時間がかかる、失敗する、あるいはライブ会話と矛盾する回答を返すケースにも対応する必要がある。実際の電話対応では、こうした遷移が重要になる。
OpenAIの音声エンジニアリングに関する解説は、会話のタイミング調整がなぜ難しいかを説明している。従来のシステムは、話者が話し終えたタイミングを推測するターン検出器に依存していた。
早すぎる推測はユーザーの発話を遮る。遅すぎる推測は不自然な沈黙を生む。フルデュプレックス処理はシステムにより多くの情報を与えるが、あらゆるタイミング判断を不要にするわけではない。
OpenAIによれば、GPT-Liveは音声経路から独立したターン検出器を取り除く。モデルは自身の応答を生成しながら、入力される音声を継続的に解釈できる。
このアーキテクチャにより、割り込みはより機械的でないものに感じられる可能性がある。それでもベンチマークスコアだけでは、アクセント、騒がしい部屋、不安定なネットワーク、長時間の通話にわたって体験が信頼できるかどうかは分からない。
バックエンドへの委任は、さらに1層のタイミング問題を加える。ライブモデルは、より深いシステムが処理を完了する間に何を言うべきか判断しなければならない。
適切な応答の合図は会話の流れを維持できる。一方、繰り返しのつなぎ文句や不正確な途中経過の発言は、同じ待ち時間をより苛立たしいものにする。
タスク設計も、どのバックエンドが最も強く見えるかに影響する。推論負荷の高い評価では、短いスケジューリングワークフローとは異なる挙動が評価される。
この指標は、単一のテストへの依存を減らすために複数の側面を組み合わせている。ただし、均等な重み付けも、どの能力を同程度に重視すべきかという編集上の判断を表す。
コンタクトセンターは、アリーナでの選好よりタスク成功を重視するかもしれない。語学チューターは、割り込み処理や会話のテンポをより重視する可能性がある。
アクセシビリティ製品では、多様な話し方や環境での認識性能が優先されうる。営業アプリケーションでは、正確なツール利用、コンプライアンス、引き継ぎの品質に焦点が当たる可能性がある。
したがって開発者は、リーダーボードを候補の絞り込み手段として扱うべきだ。有望な構成を特定することはできるが、特定の導入環境に最適なシステムを選定することはできない。
実践的な評価では、実際のツールとポリシーを用いて代表的な会話を再現する必要がある。完了した成果、修正率、エスカレーション、ユーザーによる割り込みを測定すべきだ。
チームは、委任された各リクエストをどのバックエンドが処理したかも記録すべきである。この記録がなければ、障害の原因特定や再現は困難になりうる。
GPT-Live-1の音声ベンチマークは、設定可能な将来を示している。同時に、設定の選択が、製品ページに記されたモデルブランド以上のものを左右しうることも示している。
Artificial Analysis Indexで判断できないこと
81.5という複合スコアは本番環境での信頼性を証明するものではなく、ベンチマークの最近の手法変更は過去の結果との比較を制限する。
Artificial Analysisは2026年6月、Speech to Speech Indexの初版を公開した。このバージョンは、音声推論、会話のダイナミクス、エージェント的な性能を組み合わせていた。
同社は8月にSpeech Agent Arenaを追加して指標を改訂した。同月後半にはバージョン2.0で、複合スコアにおけるConversational DynamicsをTask Success Rateに置き換えた。
現行のベンチマーク手法では、Speech Reasoning、Agentic Performance、Arena Preference、Task Success Rateに均等な重みを割り当てている。
Conversational Dynamicsは、独立したベンチマークとして引き続き利用できる。これは、間、ターンテイキング、割り込み、背景音声、「yeah」や「mm-hmm」といった短い相づちを測定する。
この経緯は重要だ。7月のスコアと9月のスコアは、必ずしも同じ能力バランスを測定しているとは限らない。順位の変化は、モデルの進歩と手法の変更の両方を反映しうる。
以前に引用されたGrokの82.9という結果は、旧バージョンの指標によるものだった。新しい81.3というスコアは、モデルの性能が低下したことを示すものではない。
同様に、GPT-Live-1の81.5という結果は、同一テストで以前のGrokのスコアを上回ったことを意味しない。現在のランキングこそが有効な直接比較である。
もう一つの不確実性はベンチマークのばらつきにある。報告された首位との差は小さいが、公開された要約には複合ランキングの信頼区間が示されていない。
人間の選好スコアは、比較件数が増えるにつれて変動しうる。エージェントシミュレーションも、試行の繰り返し、プロンプト、ツール実装によって異なる挙動を示す場合がある。
Artificial Analysisは、モデルが初めて指標の対象となった時点でアリーナ評価を固定する。これによりスコアの継続的な変動は避けられるが、特定の段階における選好を捉えることになる。
ベンチマークは、モデルがすべての構成要素で結果を持つことも求める。これにより採用システム間の比較可能性は向上する一方、完全なデータを持たない製品は除外される。
そのため、リーダーボードは対象資格を満たす領域を示せても、利用可能なすべての音声システムを代表するわけではない。特化型モデルは、複合ランキングに登場しなくても、レイテンシ、文字起こし、あるいは限定的なワークフローで優れた性能を発揮する場合がある。
本番環境では、さらなる不確実性が生じる。実際の発信者は話題を変えたり、不完全な情報を提供したり、別の人の発話に重なって話したり、ポリシーの対象外となる操作を求めたりする可能性がある。
長時間のセッションでは、短いテストでは見逃される文脈の失敗も露呈しうる。ツールの権限、古くなった検索結果、バックエンドの障害は、優れた音声レイヤーであっても損なう可能性がある。
OpenAIは、初期の顧客評価で有望な結果が出ていると報告している。Speakは、従来のターンベースシステムと比べ、思考中の間における割り込みが約80%減少したとされる。
OpenAIが引用したある医療分野の導入事例では、GPT-Live-1によりカスケード型コードベースが80%削減され、23,000行が不要になったという。これらは顧客および企業の主張であり、標準化された独立検証の結果ではない。
それでも、この種の説明は有用な評価対象を示している。チームは、割り込み頻度、コードの複雑性、通話対応の成功率、人間へのエスカレーション数を測定できる。
ただし、これらの成果が自動的に移転すると考えるべきではない。アーキテクチャ、トラフィック、使用言語の構成、ポリシー、統合品質によって結果は変わりうる。
自然な音声エージェントには、より広い安全性の問題もある。非常に流暢なシステムは、事実面や運用面の信頼性が確立される前に、ユーザーの信頼を促す可能性がある。
フルデュプレックスの挙動は、エージェントが社会的に注意を払っているように感じさせることがある。その印象は、口座ルールを理解したことや正しいバックエンド操作を選んだことを保証しない。
企業は、重大な操作に明確な確認手順を設ける必要がある。また、システムに権限、文脈、または確信が欠ける場合には、分かりやすくエスカレーションする必要がある。
したがって、適切な懐疑的解釈は限定的なものだ。Artificial Analysisが特定したのは、テスト済み構成の首位であり、あらゆる状況で優れた音声エージェントではない。
OpenAIが首位を維持するかを示す3つのシグナル
次の局面を決めるのは、1つの複合スコアではなく、再現可能なタスク完遂、バックエンドの一貫性、競合各社の更新だ。
最初のシグナルは、Artificial Analysisが結果を追加しモデル構成を更新する中で、GPT-Live-1がその地位を維持できるかどうかである。
リーダーボードは継続的に更新されており、指標の開始以来、手法はすでに2回変更されている。次の更新では、基礎となる製品を変更しなくても、僅差のシステムの順位が動く可能性がある。
複数のスナップショットにわたる持続的な首位は、OpenAIの結果が再現可能であるとの根拠を強める。早期の逆転は、最先端での差がいかに小さいかを示すだろう。
順位だけでなく、構成要素ごとのスコアがより重要になる。開発者は、GPT-Live-1がタスク成功で首位に立つのか、それとも弱い側面を別の強みで補っているのかを注視すべきだ。
AstraとSolの結果も個別に監視すべきである。両者の差が続くなら、購入者はバックエンドの選択を中心的な性能判断として扱う必要がある。
2つ目のシグナルは、委任処理を用いるアプリケーションから得られる本番環境での証拠だ。OpenAIは初期シナリオとして、顧客サポート、予約、教育、医療、ソフトウェア開発を挙げている。
こうした導入からは、広範な選好に関する主張よりも有用な指標が最終的に得られるはずだ。完了率、修正頻度、割り込み、人間への転送は、アーキテクチャが機能する領域を示しうる。
開発者は、ライブでの応答の合図から委任処理による回答までの遅延も注視すべきである。この間隔が、バックグラウンド推論を自然に感じさせるか、はぐらかしに感じさせるかを左右する。
一貫した文脈転送も重要な試験となる。バックエンドは、途中の発言、訂正、重なった音声に混乱することなく、十分な会話の詳細を受け取らなければならない。
強い成果は、GPT-Live-1がユーザーの意図を失わずに長いワークフローを完遂することを示すだろう。頻繁なやり直しや矛盾する回答は、ベンチマーク主導の評価を弱める。
3つ目のシグナルはxAIの対応だ。Grok Voice Think Fast 2.0 Highはわずか0.2ポイント差で追っており、小幅な改善でもランキングは変わりうる。
xAIはすでに、音声推論、文字起こし、会話挙動、ツールの信頼性、応答速度を重視している。また、自社モデルは発話しながら推論できると主張している。
将来の更新は、過去の複合スコアではなく、現行の指標で評価すべきだ。直接比較には、同じ手法と同程度に完全な構成が必要となる。
Grokの短い初回音声出力時間は、xAIに別の競争ルートを与える。特定のワークフローで応答性がより重要なら、複合スコアがやや低くても魅力を保ちうる。
OpenAIは反対の課題に直面する。より強力な委任推論が、予測不能なレイテンシ、複雑性、あるいはバックエンド依存の障害を生まないことを証明しなければならない。
そのため、この競争では異なるアプリケーションごとに複数の勝者が生まれうる。銀行、語学チューター、レストラン、コーディング支援ツールが、単一の最適な採点式を共有することはない。
Artificial Analysisは、複数の次元を評価することで、その複雑さを可視化している。最新の結果ではOpenAIが総合首位となった一方、構成要素別の評価枠組みは、順位を運命のように扱うべきではないと警告している。
開発者にとって、次に取るべき行動は明快だ。導入を想定するバックエンド、ツール、ポリシー、言語、ネットワーク条件をそのまま用いて、GPT-Live-1をテストすることだ。
完成済みのタスクでGrok Voiceと比較し、洗練されたデモでは判断しない。中断、修正、雑音の多い音声、遅いツール、人間の承認を必要とするリクエストも含めるべきである。
現時点のGPT-Live-1音声ベンチマークでは、OpenAIが0.2ポイント差で首位に立っている。次回の評価で、その差が持続的なシステムエンジニアリングを示すのか、それとも一時的なリーダーボード上の優位に過ぎないのかが明らかになるだろう。



