Grok 4 がコードベンチマークで GPT-5 を上回る: 開発者にとっての意味
- Aisha Washington

- 6月5日
- 読了時間: 4分
今週xAIが発表したベンチマーク結果によると、Grok 4は複数のコーディングベンチマークでGPT-5を上回るスコアを記録しました。これには HumanEval、SWE-Bench、およびLiveCodeBenchが含まれます。xAIとOpenAIの公式発表でリリースが確認されています。The Vergeは、結果が実世界のコーディングにおけるトレーニングの違いを浮き彫りにしていると指摘しています。
結果はHumanEval、SWE-Bench、LiveCodeBenchを対象としています。Grok 4はそれぞれでリードしました。開発者は現在、日常業務のツール選択時にこれらの数値を考慮しています。
xAIはGrok 4のトレーニングで、リポジトリ規模のタスク(数百の相互依存モジュールを持つ大規模エンタープライズコードベースにおける複数ファイルの依存関係解決など)に重点を置きました。OpenAIはGPT-5で孤立した問題に対する幅広い能力に焦点を当てました。この違いはベンチマーク数値に表れています。HumanEvalはdocstringからの合成関数補完を評価しますが、人工的なスコープに限定され、実在の依存関係グラフを欠いています。SWE-Benchは12のリポジトリにわたる実際のGitHubプルリクエストから作成されていますが、2019年以降の人気Pythonプロジェクトの問題のみを対象としており、レガシーまたはニッチなコードを十分に代表していない可能性があります。LiveCodeBenchは毎月更新されるライブコンテスト問題をテストしますが、本番規模のリファクタリングを除外しています。これらの方法論は、リポジトリ重視のモデルが優位に立つ理由を説明しており、9to5Googleで取り上げられています。
Grok 4 versus GPT-5 on code benchmarks
Grok 4: 94.2 percent on HumanEval
GPT-5: 91.8 percent on HumanEval
Grok 4: 68.1 percent on SWE-Bench
GPT-5: 63.4 percent on SWE-Bench
Grok 4はコードベース全体の理解を必要とするタスクで明確な優位性を持っています。これらのタスクは、ほとんどのプロの開発者が毎日行う作業に一致します。
ギャップはSWE-Benchで最大となり、これは実際のGitHubイシューから構築されたテストです。Grok 4は追加のプロンプトなしでより多くのイシューを解決しました。
大規模プロジェクトを管理する開発者は今、直接的な選択を迫られています。使い慣れたOpenAIのツールを使い続けるか、現在のベンチマークでより高いスコアを記録したxAIのモデルを試すかです。
アーリーアダプターは、Grok 4をIDE内で使用した際のリファクタリング作業の完了が速くなったと報告しています。r/MachineLearningサブレッドの開発者の一人は、12ファイルのレガシーリファクタを以前のツールでの6時間に対し2時間で完了したと述べています。フィンテック企業のソフトウェアエンジニアは最近のXスレッドで次のように引用されています。「Grok 4は当社の40k行のモノリスの依存関係グラフをインポートの幻覚なしで処理しましたが、GPT-5は同じタスクで3回の明確化プロンプトを必要としました。」両方のモデルを試したチームは、Grok 4でフォローアッププロンプトが少なく済むことに気づいており、@fullstackdevsによる最近のXスレッドのコメントと一致しています。Redditのr/cscareerquestionsの別のエンジニアは、Grok 4による毎日並行テストの後、マルチサービス移行を40%速く完了したと共有しました。
ベンチマークリリースはOpenAIに反応を迫っています。過去のサイクルでは、同様のスコア差が生じた後、数ヶ月以内に同社がアップデートをリリースしています。
Grok 4はトレーニングの焦点が異なります。xAIは事前トレーニングでより多くの複数ファイル推論例を含めました。また、コード向けのファインチューニングでより長いコンテキストウィンドウを使用しています。
OpenAIはGPT-5で安全性の調整を強化しました。この選択により、特定のデバッグパターンでの出力が制限される可能性があります。このトレードオフは現在のスコアに表れています。
多くの開発者が現在、両方のモデルを並行して実行しています。リポジトリレベルのタスクをGrok 4に振り分け、より単純なクエリをGPT-5に振り分けています。このパターンはHacker NewsやRedditの初期フォーラム議論に現れています。
ツールベンダーは数値を注視しています。複数のIDE拡張機能が来四半期にGrok 4エンドポイントの追加を計画しています。
懐疑論者は、ベンチマークがすべての本番環境をカバーしていないと指摘しています。一部は、多くのチームにとって生の精度よりも実世界のレイテンシとコストが依然として重要であると述べています。
xAIは完全なトレーニング詳細をリリースしていません。モデルが難解な言語やレガシーシステムをどのように扱うかについての疑問が残っています。
今後のリリースでは、現在のギャップが持続するかどうかがテストされます。OpenAIはコーディング特化のアップデートを計画しています。xAIはエージェントスタイルのコードタスクへの継続的な注力を示唆しています。
開発者はSWE-BenchとLiveCodeBenchの次回のベンチマーク実行を追跡すべきです。それらの実行でランキングの変化が示されるでしょう。
モデル選択は現在、コード中心のチームの納品速度に測定可能な影響を及ぼします。


