top of page

Grok 4.6、Cursor xAIベンチマークで首位に。ただし差はわずか

Grok 4.6は、Cursor xAIベンチマーク競争で首位を獲得し、Extra High推論モードで70.8%を記録した。Elon Muskは固定されたX投稿でこの順位を強調し、プロの開発者を獲得しようとするxAIの最新の取り組みに注目を集めた。

この結果はCursorの現行リーダーボードに実際に掲載されているが、この勝利には慎重な位置づけが必要だ。GrokはFable 5 Maxをわずか0.3ポイント上回るにとどまり、Cursorも小さな差は統計的に有意でない可能性があると警告している。

この僅差こそが中心的な緊張関係を生む。Grok 4.6は現実的なコーディングセッションに基づくベンチマークの頂点に立つが、その順位は普遍的な優位性を示すものではない。

より重要な結果は、見出しのスコアの下にある。Grokは近い競合モデルと同等の結果を達成しながら、使用トークン数とエージェントのステップ数を抑えた。この組み合わせは、似た作業により長い実行経路を必要とする競合コーディングモデルに圧力をかける。

同時に、CursorとxAIの関係についてより難しい問いも生じる。CursorBenchはCursor環境内のエージェントを測定する一方、Grok 4.6は複数のエージェントハーネスで学習され、Cursorを通じて直接提供された。したがって、このスコアが反映するのは、静的な質問に答える単独モデルではなく、完全な稼働システムだ。

Grok 4.6がCursorBenchの首位に到達

確認された出来事はCursorBenchでの首位獲得であり、Grok 4.6があらゆる場所で最高のコーディングモデルである証明ではない。

xAIは2026年8月12日にGrok 4.6をリリースした。同社はこれを、コーディング、ナレッジワーク、長時間稼働するエージェント、インタラクティブなアプリケーション開発向けのモデルとして位置づけた。

このモデルはリリース当日、CursorとGrok Buildを通じて利用可能になった。その後GitHub Copilotにも展開され、もう一つの主要な開発者環境へと配布範囲を広げた。

Cursorは現在、CursorBench 3.2でGrok 4.6 Extra Highを首位に掲載している。このモデルは正確性スコア70.8%を記録し、タスク当たりの平均は41,136トークン、46ステップだ。

Fable 5 Maxが70.5%で続く。Opus 5 Maxは70.0%、Grok 4.6 Highは69.9%を記録している。

HighとExtra Highの違いは重要だ。xAIの当初のローンチ資料は、首位を獲得していないHighの結果を強調していた。この比較では、Fable 5 Maxが0.6ポイント上回っていた。

Extra Highでは順位が変わる。より多くの推論努力を適用することでGrokは0.9ポイント上昇し、FableとOpusの両方を上回るのに十分だった。

Muskの固定投稿は、この最高負荷の構成に焦点を当てていた。基礎となる主張は8月22日時点のCursorのライブリーダーボードによって裏付けられるが、投稿そのものは宣伝的な増幅である。

ローンチは、WallstreetCNの記事が8月22日に掲載される10日前に行われた。したがって、根本となる出来事はその朝の新モデル発表ではなかった。既存のベンチマーク結果への注目が再燃したものだった。

前モデルに対する改善は、競合システムとの比較よりも明確だ。Grok 4.5 Highは66.7%だったのに対し、Grok 4.6 Highは69.9%に達した。

これは、同じ名称の推論レベルで3.2ポイントの上昇に当たる。Extra High設定では、Grok 4.5 Highに対する差は4.1ポイントへ広がる。

xAIはこれらの変化を、より長期の追加学習によるものとしている。Grok 4.6 releaseでは、選別されたモデル生成データ、エンジニアリングデータ、教師ありファインチューニング、エージェント環境全体での強化学習について説明している。

同社はまた、複数の推論レベルとエージェントハーネスにわたり、Grok 4.5を用いて学習軌跡を再生成した。モデルベースのチェックにより、xAIが問題があると判断したトレースを除外した。

これらの詳細は、コーディングエージェントの挙動が改善したもっともらしい仕組みを示している。ただし、各学習変更がリーダーボード結果にどの程度寄与したかを独立して検証するものではない。

この区別は重要だ。xAIのローンチチャートは、競争状況が一様ではないことを示していた。Grok 4.6は複数のエージェント評価で強い性能を示したが、すべてのベンチマークで首位だったわけではない。

DeepSWE 1.1では、Grok 4.6 Highは65.9%を記録した。GPT-5.6 Sol Maxは73%、Fable 5 Maxは70%に達した。

Terminal-Bench 3.0では、Grokは26%を記録した。GPT-5.6 Sol MaxとFable 5 Maxはいずれも34%を超えた。

したがって、GrokのCursorBench首位行は、特定の一つの強みを表す。ほかのコーディングおよびターミナル評価での低い順位を帳消しにするものではない。

このより広い実績は、この出来事を単純なリーダーボード勝利から、導入コンテキストをめぐる競争へと変える。モデル、ツール、Cursor環境が一体として機能する場面で、Grokは最も強く見える。

Cursor xAIの結果が競合エージェントに圧力をかける理由

直接的な圧力を受けるのは、ほぼ同じベンチマーク品質に到達するためにより多くの作業を必要とする競合コーディングエージェントだ。

Fable 5 MaxはGrok 4.6 Extra Highにわずか0.3ポイント差で続く。しかし同じリーダーボードでは、平均103,525トークン、72ステップを要している。

Opus 5 Maxは0.8ポイント差で続く。タスク当たり61,838トークン、78ステップを使用する。

Grokの41,136トークン、46ステップは、その経路が明らかに短いことを示す。スコア差は小さいが、実行上の差は小さくない。

エージェントのステップは、コーディングワークフロー内で連続して行われるアクションを表す。これには、ファイルの読み取り、リポジトリの検索、コード修正、コマンド実行、失敗の確認、再試行などが含まれる。

ステップ数が少ないからといって、自動的に体験が優れているわけではない。追加の検証が有益なタスクもあり、早く停止するエージェントは隠れた欠陥を見逃す可能性がある。

それでも、長い実行経路はモデル利用料以外にも実務上のコストを生む。待ち時間を増やし、コンテキストを拡大し、ツール呼び出しを増やし、エージェントが逸脱する機会も増やす。

だからこそ、Cursor xAIの結果はOpenAI、Anthropic、その他のモデル開発者のシステムに圧力をかける。競争の目標は、もはや単一の正確性スコアではない。

開発者は、コーディングエージェントが繰り返しの介入なしにタスクを完了できるかをますます重視している。レイテンシー、不必要な編集、ツールの信頼性、生成された変更をレビューするための労力にも関心を寄せている。

Cursor自身の評価フレームワークも、この現実を認識している。同社が正確性を完了トークン数に対してプロットするのは、品質と計算努力が一体となって使いやすさに影響するためだ。

Grokの結果は、このトレードオフにおいて有利な位置にある。最も近いモデルよりわずかに高いスコアを出しながら、Fable 5 Maxより大幅に少ないトークンを消費する。

GPT-5.6 Sol Maxとの比較はより複雑だ。GPT-5.6 Solは28,320トークン、48ステップを使用し、Grok Extra Highよりトークン数は少ないが、スコアは67.2%だ。

したがってGrokは、より多くのトークンを使うことで3.6ポイント高いベンチマークスコアを得つつ、平均ステップ数は2つ少なく完了する。この交換が価値あるものかは、タスクに依存する。

MediumとHighのGrok構成は、競争圧力をさらに広げる。Grok 4.6 Mediumは17,942トークン、29ステップで67.1%を記録する。

このスコアはGPT-5.6 Sol Maxにほぼ並びつつ、トークン数は少なく、ステップ数も19少ない。Grok Highは32,449トークン、39ステップで69.9%に達する。

これにより、構成可能な性能の階層が生まれる。チームは日常作業にはMedium推論を選び、より深い探索が必要なタスクにはExtra Highを割り当てられる。

この柔軟性はエンタープライズ導入において重要だ。企業は、名前変更、ドキュメント更新、テスト修正のたびに、モデルの最大推論予算が発動することを望まない。

リポジトリ全体の移行、複雑なデバッグ、アーキテクチャ変更、不慣れなコードには、より強い推論努力を利用したい。こうした作業に応じて拡張できるモデル群は、社内ツールを簡素化できる。

圧力はCursor自身にも及ぶ。同社は複数の開発者によるモデルを提供しているため、その信頼性はプロバイダーをまたいで有用な比較を示し続けられるかにかかっている。

Cursorは、あるモデルのリードを恒久的なものとして扱えない。コーディングエージェントは新しいツール、コンテキスト戦略、実行パターンを得るにつれ、ベンチマークも変化する。

CursorBench 3.2は7月8日に登場し、指示追従と高度なツール利用の問題を追加した。タスク分布が変わったため、古いバージョンの結果を直接比較することはできない。

この継続的な更新は、ベンチマーク飽和の一部の形態を抑える。同時に、首位結果は固定された科学的記録ではなく、変化するテストを示すものでもある。

購入者にとって実務上の教訓は明快だ。モデル選定は、チームが実際に導入する推論レベルとハーネス構成で行うべきである。

Grok Mediumを競合モデルの最大設定と比較すれば、ある運用上の問いに答えられる。すべてのモデルを最大努力で比較すれば、別の問いに答えられる。

どちらの比較も、セキュリティレビュー、コード所有権、統合の信頼性、開発者の受容を捉えるものではない。こうした要因が、ベンチマーク上の優位性が本番リポジトリとの接点で持続するかを決める。

本当の競争はベースモデルではなく、エージェントシステムにある

CursorBenchはエージェントハーネスを通じて動作するモデルを評価するため、この順位は孤立したコーディング知識ではなく統合システムを測定している。

ハーネスとは、モデルにプロンプト、ツール、リポジトリのコンテキスト、実行ルール、フィードバックを提供するソフトウェア層である。これは、モデルが何を見られ、どのように行動できるかを決定する。

現代のコーディングエージェントは、この層に大きく依存している。利用可能なツール、検索戦略、システムプロンプト、コンテキスト方針が変われば、同じモデルでも異なる挙動を示しうる。

CursorBenchは、この統合された挙動を捉えようとしている。そのタスクは、曖昧な依頼や複数ファイルにまたがる変更を含む、実際のCursorセッションから作られている。

Cursorによれば、多くのタスクは社内コードと管理されたソースに由来する。この設計は、公開リポジトリのベンチマークで結果を押し上げうる公開学習データへの露出を減らす。

同社の評価手法では、意図的に短いタスク説明も用いられている。これらのプロンプトは、明示的な受け入れ基準を伴う詳細な課題報告よりも、通常の開発者からの依頼に近い。

エージェント型の評価器は、解決策が意図された結果を満たすかを評価する。この手法では、一つの参照パッチしか認めないテストとは異なり、複数の有効な実装を許容できる。

この設計は、既存のコーディングベンチマークのいくつかの弱点に対応する。公開タスクはモデル開発者にとって既知になりうるほか、狭いテストは妥当な代替実装を不当に低く評価する可能性がある。

しかし、非公開タスクには別の問題がある。外部の研究者は完全なデータセットを確認できず、すべての実行を再現することも、タスク選定の影響を評価することもできない。

Cursorはスコア、トークン数、ステップ数、モデル設定、プロセスの説明を公開している。これは意味のある透明性だが、完全に再現可能な独立監査ではない。

CursorとxAIの提携は、さらに別の不確実性を加える。Grok 4.6はCursor内でローンチされ、その学習にはエージェントハーネス全体にわたる軌跡が含まれていた。

これは、CursorBench向けに不適切な最適化が行われたことを示すものではない。ただし、モデルの学習目標とCursorのエージェント環境が、異例なほどよく整合している可能性はある。

こうした整合は顧客にとって有用になりうる。開発者がCursor内でGrokを使う予定なら、その特定の環境での性能は、抽象的なモデルの純粋性よりも重要だ。

ただし、この結果をすべてのコーディングインターフェースに一般化すべきではない。別のエディタ、コマンドラインエージェント、カスタムのエンタープライズハーネスを通じて動作するGrokは、異なる軌跡をたどる可能性がある。

Cursor自身も、オフラインベンチマークを評価の一部にすぎないものとして扱っている。CursorBenchを、実際のプロダクトシグナルを用いた統制済みのオンライン実験で補完している。

こうした実験では、自動採点器が見落とす失敗を捉えられる。パッチが正しく見えても、過剰な変更、分かりにくい説明、不適切なインタラクションの選択によって開発者を苛立たせることがある。

これが、Muskの首位主張の背後にある重要な反転である。CursorBenchは実際の作業に似ているためランキングには意味があるが、その現実性ゆえにスコアはCursorへの依存度も高くなる。

公開ベンチマークは一般に、標準化された条件下でモデル能力を切り分けようとする。一方CursorBenchは、特定の本番環境に近い環境内で、完全なエージェントが成功するかを問う。

どちらの問いも重要だが、互いに置き換えられるものではない。一方はモデル研究に役立ち、もう一方はプロダクト上の意思決定に役立つ。

Grok 4.6の学習戦略も、このシステムレベルの解釈を補強している。xAIによれば、強化学習は一般的なコーディング、Web開発、カーネル最適化、その他のエージェント型環境を対象とした。

このモデルには、異なる推論強度とハーネスにわたって再生成された教師あり軌跡も与えられた。この学習は、計画、ツール利用、復旧、検証といった振る舞いを促す。

xAIは、Grokがより長い軌跡で自己テストを多く行うと報告している。エージェントがコードを実行し、自身の出力を検査する必要がある場合、これは有用な振る舞いである。

ただし、これは企業側の観察であり、独立して測定された保証ではない。開発者は、自己テストが単に作業量を増やすだけでなく、意味のある欠陥を実際に捉えているかを検証すべきだ。

このシステムという枠組みは、ベンチマーク首位が急速に変わり得る理由も説明する。新しい検索手法や編集ツールは、モデル自体を変えずに実効性能を向上させられる。

逆に、コンテキスト管理の後退は、有能なモデルを弱く見せることがある。長時間のセッションでは、記憶、ツール選択、復旧戦略における小さな誤りが増幅される。

したがって、モデル競争はシステム競争になりつつある。提供者は学習を通じて競い、エージェント企業はオーケストレーション、コンテキスト、ツール、評価を通じて競う。

Grokの首位は、xAIがこのより広い環境に向けて最適化に成功したことを示唆する。ただし、最終的な優位性をどのコンポーネントが生み出したかは示していない。

CursorBenchの数値が示さないこと

70.8%というスコアは方向性として強いが、このリーダーボードだけではコーディング品質に関する普遍的な主張を裏付けられない。

第一の制約は統計的なものだ。Cursorは、結果にはばらつきがあり、わずかなスコア差には統計的な意味がない場合があると明確に警告している。

GrokのFable 5 Maxに対する差は0.3ポイントだ。Opus 5 Maxに対する差は0.8ポイントである。

公開された信頼区間や反復実行の分布がなければ、これらの差が安定した順位を表すのかは分からない。上位3モデルは、近接したグループとして扱うべきだ。

第二の制約はタスクの網羅性である。CursorBench 3.2は、実際のCursorセッションから得られた、曖昧で複数ファイルにまたがる作業に焦点を当てている。

狭いバグ修正だけよりは代表性が高いが、それでもCursorのユーザー、コードベース、ツール、そして成功した作業の定義を反映している。

モバイルアプリケーションを開発する企業は、分散インフラを保守するチームとは異なる結果を出すかもしれない。リポジトリの規模、言語構成、ビルドシステム、テスト品質はいずれもエージェントの振る舞いを変え得る。

第三の制約はベンチマークの非公開性だ。非公開タスクは汚染リスクを低減する一方で、広範な独立検証を妨げる。

研究者は、あるハーネスに有利なワークフローがタスクで過度に代表されていないかを簡単には検証できない。また、すべての採点判断を精査したり、異議のある事例を再現したりすることもできない。

第四の制約は、最大推論がプロダクト体験を変えることだ。Extra HighはGrokのスコアを改善するが、平均トークン使用量も32,449から41,136へ増加する。

平均ステップ数は39から46に増える。リーダーボードは完全なレイテンシー分布を公開していないものの、これは追加の熟考と行動を意味する。

チームは、Grok Highに対する0.9ポイントの向上が追加作業を正当化するかを判断しなければならない。日常的な開発では、最大の総合スコアよりも速度と予測可能性が報われることが多い。

Grok Mediumはさらに選択を複雑にする。67.1%のスコアには17,942トークンと29ステップが必要であり、Extra Highが使うトークンの半分未満だ。

MediumとExtra Highの差は3.7ポイントである。これは、最大の推論設定を選べという単純な指示ではなく、実際の運用上のトレードオフを生む。

第五の制約は、ベンチマーク間の性能に由来する。xAIが公開した比較では、GrokはTerminal-Bench 3.0やDeepSWE 1.1で首位ではない。

Terminal-Benchは、異なるハーネスとタスク分布のもとで、ターミナルベースのエージェント作業を評価する。DeepSWEは、ソフトウェアエンジニアリング能力の別の側面を測定する。

これらの結果は、モデルの順位が環境に依存することを示している。Cursor内で優れたシステムでも、ツール、プロンプト、タスク、採点器が変われば競合に後れを取る可能性がある。

実際のユーザー報告は、質感を加えるものの、統制された証拠にはならない。一部の開発者は、Grok 4.6による範囲を絞った強力な編集と、有能な計画立案を報告している。

一方で、過剰なファイル変更、長時間の実行、モデルバージョン間の予期しない切り替えを報告する人もいる。こうした逸話は有用なテストケースを示すが、全体の失敗率を確立することはできない。

したがって組織は、リポジトリ固有の評価を実施すべきだ。有用な試行には、よく知られた保守タスク、新機能の開発、失敗するテスト、移行、意図的に仕様を不十分にした依頼を含めるとよい。

レビュー担当者は、受け入れられた変更、見逃された欠陥、完了までの時間、不要な編集、人間による修正作業を追跡すべきだ。トークン総数だけでは、これらの結果を捉えられない。

セキュリティは別途測定するに値する。xAIは、Grok 4.6が脆弱性パッチに関連する作業を含め、これまでで最も広範な事前デプロイメント保護テストを受けたとしている。

その説明は、組織独自の統制に代わるものではない。コーディングエージェントは、機密性の高いソースコードにアクセスし、コマンドを実行し、本番システムに影響する変更を提案できる。

モデルの順位にかかわらず、チームには権限の境界、レビュー要件、ログ、テストが必要だ。ベンチマーク精度が高くても、運用リスクはなくならない。

同じ注意は、コーディング以外のナレッジワークにも当てはまる。API release notesによれば、Grok 4.6は500,000トークンのコンテキストウィンドウをサポートしている。

大きなコンテキストウィンドウにより、モデルはより多くの資料を取り込める。しかし、長いセッションを通じて、関連するすべての事実を取得したり、指示を保持したりできることは保証されない。

長いコンテキストには、矛盾する文書、古い意思決定、機密情報が含まれる可能性もある。効果的な利用には、依然として慎重な情報源の選択と検証が必要だ。

したがって、この首位主張は強いプロダクトシグナルとして読むのが最善である。Grokは主要なコーディングエージェントの一角を占めており、その効率プロファイルは注目に値する。

この主張を包括的な推奨にしてはならない。チームには、自身のリポジトリ、ツール、セキュリティルール、レビュー慣行から得られる証拠が必要だ。

Grokの首位が続くかを示す3つのシグナル

次の試金石は、Grokのベンチマーク上の優位性が独立した環境、通常の推論設定、継続的な開発者利用においても維持されるかどうかだ。

第一のシグナルは、Cursor外での性能である。Grok 4.6は、広範なリリースから2日後の8月14日にGitHub Copilotで利用可能になった。

この展開により、開発者は同じモデルを別の環境で試せる。Copilotでは、プロンプト、ツール、インターフェース、コンテキスト管理の選択が異なる。

そこで一貫して強い結果が出れば、Grokの改善は主にモデル自身に属するという見方を支持する。急激に低下すれば、ハーネスとの整合性という説明がより有力になる。

公開評価では、標準化されたエージェントフレームワーク上でもGrokをテストすべきだ。反復実行と分布の公開により、CursorBenchでの僅差の首位が安定しているかが明確になる。

第二のシグナルは、MediumおよびHigh推論モードの採用だ。Extra Highが見出しを飾るが、多くのチームが気にするのは日常的な信頼性と応答性だろう。

Grok Mediumは、より短い実行経路でCursorBenchにおいてGPT-5.6 Sol Maxにすでに迫っている。これは、最大の労力での首位よりも重要になる可能性がある。

利用パターンは、開発者が試行後にどの構成を使い続けるかを示すかもしれない。Extra Highから頻繁に設定を下げる傾向があれば、レイテンシーやリソース消費がスコア上の優位性を上回ることを示唆する。

複雑な作業でHighまたはExtra Highが継続的に利用されれば、別の見方ができる。それは、開発者がより長い実行を受け入れるほど、深い推論に価値を見出していることを示す。

第三のシグナルは、Cursorのオンライン評価における動きだ。Cursorによれば、そのライブ実験はオフラインの採点器が見落とすインタラクションと出力品質のシグナルを追跡している。

Grokがタスク完了率を高めながら、修正、繰り返しのプロンプト、途中で放棄される実行を減らせるなら、リーダーボードの結果は実用面での信頼性を増す。

オンラインでの振る舞いが依然としてまちまちなら、70.8%というスコアはベンチマーク固有のピークに近く見えるだろう。Cursorは、この問いを決着させるのに十分なプロダクトレベルの詳細をまだ公開していない。

同じ期間における競合の対応も重要になる。OpenAI、Anthropic、Cursor、その他の開発者は、モデル、推論制御、ツール、オーケストレーションを急速に変更できる。

競合は、同じスコアだけでGrokを上回る必要はない。より高速な実行、より良いレビュー動作、明確な計画、不要な変更の削減によって競争できる。

Cursorもタスクスイートを更新する可能性がある。エージェントの能力が拡大するなかで、ベンチマークはすでにバージョン3.1から3.2へ移行している。

新しいバージョンでは、より長いタスク、より強い検証要件、外部サービスとのより多くの連携が加わり、順位が変わる可能性がある。こうした変更は、Grokの優位性が一般化できるかを試すことになる。

開発者にとって正しい対応は、過小評価でも自動的な移行でもない。Grok 4.6は、実際のワークフロー内で真剣に評価する価値を得た。

正しい結果が既知のタスクから始めよう。同じリポジトリ状態と受け入れ基準を用いて、Medium、High、Extra Highの設定を比較する。

各実行で人間による修正が必要になる頻度を記録する。エージェントが関連するファイルだけを編集しているか、意味のあるテストを実行しているか、残る不確実性を説明しているかを確認する。

ベンチマークのメモは、アーキテクチャ上の意思決定やモデル評価とともに保管しよう。検索可能なengineering knowledge baseは、プロンプト、結果、失敗、レビュー担当者の判断を残せる。

CursorとxAIの見出しは、重要な一つの環境における信頼できるリーダーを示している。次の判断は開発者に委ねられる。Grokは、あなたのコード、ツール、基準に直面しても首位を維持できるだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page