Artificial Analysis Coding Agent Index、Claudeを首位に置くも、コストがリーダーの序列を変える
Artificial AnalysisはClaude Sonnet 5.5を68ポイントで首位に据えたが、新たなコーディングエージェントの結果は、コスト面でそれほど楽観できない実態を明らかにしている。
Artificial Analysis Coding Agent Indexでは、最大エフォートで動作するSonnet 5.5搭載Claude Codeが、Gemini 4 ArgonとGPT-6.1 Solを上回った。しかし、この勝者は最も近い新たな競合と比べ、タスクごとに大幅に多い時間、トークン、API支出を必要とする。
この差は、開発チームにとっての実務的な判断を変える。Claudeは総合ベンチマークで首位に立つ一方、GPT-6.1 Solを搭載したCodexは、計測リソースのごく一部でほぼ同等の結果を提供する。Gemini 4 Argonはその中間に位置し、強い総合スコアと、長期にわたるソフトウェアタスクでの顕著な優位性を兼ね備えている。
ベンチマークの原投稿は、3つのリリースを新たなリーダーとして提示している。基礎となる結果はその重要性を裏付けるが、単純な3者による表彰台ではない。Claude Opus 5.5を含む他の構成も上位付近に現れている。
さらに重要なのは、各結果がモデル、推論設定、エージェントハーネスに帰属するという点だ。リーダーボードは抽象的なモデル知能だけをテストしているわけではない。Claude Code、Codex、Antigravity CLIといった完全なコーディングシステムを評価している。
この違いこそが本題である。チームはもはや、最高スコアのモデルだけを選んでいるのではない。ベンチマークで1ポイントを上積みする価値が、どれだけの時間と計算資源に見合うかを選んでいる。
Artificial Analysis Coding Agent Indexで何が変わったのか
最新の結果は、ベンチマーク上のリーダーシップと運用効率を、これまでのモデル比較よりも明確に切り分けている。
Artificial Analysisは、個別のコード補完問題ではなく、エンドツーエンドの作業でコーディングエージェントを評価する。このインデックスは、リポジトリの変更、ターミナル操作、コードベース理解を1つのスコアに統合する。
最大エフォートでSonnet 5.5を実行するClaude Codeは、68ポイントで首位に立つ。内訳は、DeepSWE v1.1で72パーセント、Terminal-Bench 4.0で66パーセント、SWE-Atlas-QnAで67パーセントだ。
Gemini 4 Argonを実行するAntigravity CLIは64ポイントを記録する。DeepSWEでは79パーセント、Terminal-Benchでは56パーセント、リポジトリ質問では56パーセントに達する。
xhighエフォートのGPT-6.1 Solを搭載したCodexは63ポイントを記録する。この構成はDeepSWEで73パーセント、Terminal-Benchで55パーセント、SWE-Atlas-QnAで61パーセントを記録した。
この合計スコアでは、ClaudeとSolの差はわずか5ポイントである。しかしArtificial Analysisの測定では、Claude構成はタスクあたり約8.7倍のトークンを使用した。また、実行時間もほぼ6倍に及んだ。
計測されたAPIコストは、さらに大きな差を示している。最大エフォートのClaude構成は、Codex内のxhigh Solと比べて、タスクあたり約13.6倍のコストがかかる。
Gemini 4 Argonはこの両極の間に位置する。計測コストはSolの約5.6倍である一方、インデックス上の優位性は1ポイントにとどまる。トークン消費量は約4.3倍で、所要時間は2倍を超える。
したがって、ベンチマーク比較は2つの物語を示している。Claudeは最高の総合スコアを持つ一方、Solはこれら3構成の中で、計測スコアとコストの関係が最も強い。
Artificial AnalysisはSonnet 5.5について複数のエフォート設定も報告している。最大エフォートはClaude Codeのデフォルト設定ではないため、この詳細は重要だ。
xhighエフォートのSonnet 5.5は63ポイントで、Solの注目スコアと並ぶ。Solの2倍を超えるトークンを使い、計測コストも3倍を超える。
高エフォートではSonnetは55ポイントとなる。Claude Codeのデフォルトである中エフォートでは46ポイントだ。これらの結果は、推論予算が評価対象となる製品をどれほど変えるかを示している。
同じ傾向はSolの結果内にも見られる。中エフォートのGPT-6.1 Solは61ポイントで、xhigh構成よりわずか2ポイント低い。その計測コストと実行時間も大きく低下する。
最大推論が自動的に最良の結果を生むわけではない。公開された評価では、Solのxhigh結果は最大エフォート結果を3ポイント上回っている。
この直感に反する結果は、エージェントベンチマークにばらつきがあることを示す。推論時間の増加は役立つ場合もあるが、軌跡の長期化、不要なツール呼び出し、実りのない再考を生むこともある。
見出し上の勝者は、最大エフォートのSonnet 5.5を搭載したClaude Codeのままである。より重要な変化は、その最後の5ポイントにどれほど急な価格が付くかを、購入者が見られるようになった点だ。
ベンチマークが測るのはモデル単体ではなくシステムである
コーディングエージェントのスコアは、モデル、ハーネス、ツール、推論予算の相互作用を反映する。
Coding Agent Index v1.5は、同じ重みを持つ3つの構成要素を使用する。公開されているインデックス方法論によれば、各構成要素はソフトウェア作業の異なる側面をテストする。
DeepSWE v1.1には113件の長期タスクが含まれる。エージェントは既存リポジトリを変更し、別個の検証環境がコミットされたパッチの成否を判定する。
Terminal-Bench 4.0には、ソフトウェアエンジニアリング、機械学習、セキュリティ、システム管理などの領域を扱う66件のタスクが含まれる。エージェントはコマンドライン環境で作業し、その後テストスイートが結果を採点する。
SWE-Atlas-QnAには124件のリポジトリ質問が含まれる。これらのタスクは、エージェントが未知のコードを追跡し、その動作を正確に説明できるかを測定する。
各タスクには3回の試行が与えられる。Artificial Analysisは各構成要素のpass-at-one結果を算出し、その後3要素を同等の重みで総合インデックスに反映する。
この構造は、従来のコード生成テストよりも広範だ。リポジトリを調査し、ツールを選び、ターミナルを操作し、コンテキストを維持し、失敗から回復できるエージェントを評価する。
同時に、ハーネスの重要性も高める。ハーネスとは、モデルとファイル、ターミナル、指示、コンテキスト管理、ツール実行を接続するソフトウェア層である。
Claude Code、Codex、Antigravity CLIは同一のワークフローを提供していない。コンテキストのパッケージ方法、ツール使用を促すパターン、制限の設け方が異なる可能性がある。
したがって、このベンチマークはSonnet 5.5が常にGPT-6.1 Solより優れたコーディングモデルであることを確立するものではない。テストされたあるClaude Code構成が、テストされたあるCodex構成より高いスコアを記録したことを示している。
この違いは構成要素別のスコアに表れている。Gemini 4 Argonは、総合順位ではClaudeを下回るにもかかわらず、DeepSWEで79パーセントを記録し、この3者をリードする。
SolはDeepSWEで最大エフォートのSonnetをわずかに上回る。Claudeは、より大きな差をつけるTerminal-BenchとSWE-Atlas-QnAを通じて総合的な優位を築いている。
したがって、結果は異なる能力プロファイルを示している。Geminiは、ベンチマークにおける長期的なリポジトリ変更で最も強いように見える。Claudeはターミナル作業とリポジトリ理解の両面で、よりバランスが取れているように見える。
Solは、より少ない計測リソースで3つすべてに競争力を保っている。含まれる構成要素のいずれでも両競合を上回ってはいないが、深刻な弱点も避けている。
このバランスは本番利用で重要になる。大規模リポジトリを保守するチームは、リポジトリ質問への回答よりもパッチの完了を重視するかもしれない。別のチームでは、多様な環境にまたがる信頼性の高いターミナル作業が必要になる場合がある。
インデックスの単一の数値は、読者が全体像を素早く把握する助けとなる。ただし、明確に定義されたワークロード向けのツールを選ぶ際に、構成要素別の結果を置き換えるべきではない。
Artificial Analysisは、同じベンチマークスイート全体でトークン、コスト、時間のデータも集計している。欠落したテレメトリはゼロとして扱われず、関連する平均から除外される。
そのコスト計算では、プロバイダーがそれらのカテゴリを別々に価格設定している場合、通常入力、キャッシュ入力、キャッシュ書き込み、推論、出力トークンを考慮する。これはサブスクリプション価格ではなく、トークン従量制APIコストを表す。
報告されるコストには、いくつかの運用費も含まれていない。エンジニアリング統合、人間によるレビュー、環境設定、セキュリティ管理、不良パッチの結果は含まれない。
これらの除外は比較を弱めるものではない。評価対象のエージェントがこのテストでどれだけのモデル利用量を消費したか、という回答可能な範囲を定義している。
また、最も安価なベンチマーク実行が常に最も安価な受け入れ済みプルリクエストを生むとは限らない理由も説明する。低い結果は、追加のレビュー、修正、再実行のコストを生む可能性がある。
したがってチームは、直接的な推論コストと成功した成果あたりのコストの両方を評価すべきである。公開インデックスは有用な材料を提供するが、その完全なビジネス指標を計算するものではない。
Claude Sonnet 5.5は大きな効率プレミアムを伴って性能で勝利する
このベンチマークにおけるClaudeの優位は実在するが、最大エフォートは小幅なスコア優位を大きなリソース投入に変える。
Anthropicは2026年9月28日にSonnet 5.5をリリースした。同社はこれを、範囲が定まった日常タスク、デバッグ、ドキュメント作成向けに、Opus 5.5を補完するより高速で低コストな選択肢として位置付けている。
Anthropicのモデルリリース詳細では、調整可能なエフォートが強調されている。低い設定は速度と経済性を優先し、高い設定はモデルに推論と作業確認のためのより長い時間を与える。
Artificial Analysisの結果は、この設計の両面を示している。Sonnetを中エフォートから最大エフォートに移すと、インデックスは46から68へ上昇する。
この22ポイントの改善は大きい。それに伴い、トークン数は約21倍、実行時間は10倍超、計測されたAPIコストは約23倍となる。
最大エフォートは非常に長いエージェント軌跡も生む。Artificial Analysisは、首位構成について、タスクあたり約266ターン、総トークン数2,770万を記録している。
これらの数値は、現実のすべてのタスクが同じリソースを消費することを意味するものではない。数百回のタスク試行を含む厳しいベンチマークスイート全体での平均的な挙動を示している。
また、モデルがどのように勝つのかも明らかにする。最高性能の構成は、同じ予算でより賢い回答を単に生成しているわけではない。環境とのやり取りに、はるかに多くの時間を費やしている。
この戦略は総合スコアで成果を上げる。ClaudeはGeminiを4ポイント、Solを5ポイント上回る。また、3つの構成要素ベンチマークのうち2つで、この3者中最高の結果を記録している。
Claudeの低いエフォート設定を比較に含めると、このプレミアムを正当化するのは難しくなる。xhighのSonnetはSolの63ポイントに並ぶが、より多くのトークン、時間、計測支出を消費する。
高エフォートでは、ClaudeはSol xhighに8ポイント後れを取る。そのリソース使用量はSolに近づくが、性能差は意味のあるものになる。
中エフォートでは、Claudeは最大構成より大幅に安価かつ高速になる。しかし、そのスコアはSol xhighより17ポイント、Geminiより18ポイント低い。
これらの結果に矛盾はない。Anthropicはユーザーにテスト時推論の追加購入を可能にし、ベンチマークは追加推論がタスク完了率を高めうることを示している。
トレードオフは規模に関わる。個々の開発者は、難しい移行作業のために長く高額な実行を受け入れるかもしれない。定型的な変更を数千件処理する企業は、別の計算に直面する。
最適な設定は、1つのワークフローの中でも変わりうる。チームは探索に中エフォート、実装に高エフォート、そして解決困難な失敗にのみ最大エフォートを使うことができる。
そのルーティング戦略なら、すべてのチケットにClaudeの最高リソース予算を適用せずとも、Claudeの最高性能を利用できる。そのためには測定と明確なエスカレーション基準が必要だ。
したがって、Claudeのベンチマークでの勝利は、完了品質がほかのあらゆる制約を上回るタスクで最も意味を持つ。たとえば、複数リポジトリにまたがる難易度の高い修正、脆弱な移行作業、失敗コストの大きいインシデントなどが挙げられる。
一方、大量の保守作業では決定的ではない。依存関係の更新、小規模なリファクタリング、テスト生成、日常的なバグ修正では、予測可能なコストで十分な品質を得ることが重要になる場合が多い。
このため、Artificial Analysis Coding Agent Indexを購買判断の近道にしてはならない。68ポイントという結果は上限構成を示すものであり、自動的に選ぶべきデフォルトではない。
GPT-6.1 SolとGemini 4 Argon、異なる方向からClaudeに圧力
Solは効率性でClaudeに挑み、Argonは長期にわたるリポジトリ作業で対抗する。
OpenAIは9月29日、AnthropicがSonnet 5.5を公開した翌日にGPT-6.1 Solを発表した。Googleは9月30日にGemini 4 Argonを続けて発表した。
このタイミングにより、Artificial Analysisは数日のうちに3つの新たなフロンティア構成を比較できた。そのベンチマーク上の位置づけは、発表時の説明から想像される以上に大きな差別化を示している。
OpenAIはSolを、より低コストでコーディング、コンピューター操作、専門業務に対応する、フラッグシップに近いモデルと説明している。Sol model cardでは、lowからmaximumまで5段階の推論設定が示されている。
Coding Agent Indexでは、xhighがSolで最も高いテスト結果を出した設定だ。スコアは63で、maximum effortの60を上回る。
この結果は、最大の推論予算が常に最も安全という前提を崩す。チームは最高ラベルをデフォルトで選ぶのではなく、effort設定をベンチマークで検証すべきことを示唆している。
Solの主な利点は、リソース単位当たりの一貫性だ。xhigh構成では、平均タスクを約15.5分で完了し、320万トークンを消費する。
maximum-effort Claudeは約90分、2,770万トークンを必要とする。Geminiは約34.5分、1,370万トークンを要する。
Solは各コンポーネントでも競争力を発揮している。DeepSWEでは73%で、Claudeの72%を上回るが、Geminiの79%には届かない。
Terminal-Benchとリポジトリ質問のスコアはClaudeを下回る。この差が、総合スコアでの5ポイント差を生んでいる。
多くの組織にとって、この差は許容範囲だろう。Solの低いリソース使用量により、同じ予算内で試行回数を増やし、導入範囲を広げ、追加検証を行える。
この比較は、Solが普遍的により経済的であることを証明するものではない。プロバイダーの価格は変動し、キャッシュのパターンも異なり、社内ワークロードではトークン分布が異なる可能性がある。
ただし、検証に値する強い仮説は示している。チームのタスクがベンチマークに近いなら、Solを使うCodexはmaximum-effort Claudeより優れたコスト・パフォーマンスの均衡を実現できるかもしれない。
Gemini 4 Argonは別種の圧力を生む。GoogleはArgonを、複雑な専門ワークフロー全体で持続的な推論を行うモデルとして発表した。
GoogleのArgon announcementでは、コード移行、メモリ最適化、リサーチ、サイバーセキュリティに関する社内利用が説明されている。これらの例は、独立して再現されない限り、企業側の主張にとどまる。
Coding Agent Indexは、この説明の一部に対して第三者の証拠を加えている。ArgonのDeepSWEスコア79%は、ここで取り上げた3システムの中で最も高い。
この結果は、Googleが長期的な作業に注力していることと一致する。総合インデックスではClaudeが首位であるものの、Argonは長期間に及ぶリポジトリ変更で注目に値することを示している。
Argonはリポジトリ質問のスコアが弱く、総合結果を押し下げている。56%という結果はSolより5ポイント、Claudeより11ポイント低い。
また、このモデルにはSolのような測定済みの効率性がない。Argonは総合スコアでSolを1ポイント上回る一方、タスク当たりのトークン数は4倍以上を要する。
だからといって、この構成が不合理というわけではない。難しい実装作業に直面する組織にとっては、DeepSWEのより高い完了率がリソース使用量を上回る価値を持つ場合がある。
重要なのは、ワークロードとの適合性だ。Solは効率的な汎用モデルとして魅力的に見える一方、Argonは長時間に及ぶリポジトリ変更でより強いシグナルを示している。
Claudeは、最も積極的な設定においてバランスの取れた性能の首位を維持している。市場からの圧力は、その優位性の異なる部分の価値を下げる競合から生じている。
これは単一の万能ランキングより健全な競争状況だ。エンジニアリングチームに、ほぼ互換的な3つのモデルブランドではなく、明確に異なる選択肢をもたらす。
また、ポータブルなワークフローを維持する重要性も高まる。効果が測定可能でない限り、チームはプロンプト、レビュー手法、コンテキスト準備を1つのモデルに縛り付けるべきではない。
要件、意思決定、過去の変更を検索可能な形で記録しておけば、こうした比較の一貫性を高められる。チームはengineering knowledge baseを活用し、エージェント試験をまたいでコンテキストを保持できる。
目的は毎週モデルを切り替えることではない。性能の最前線が動いたときに、切り替えと評価を可能にすることだ。
数字が証明しないこと
ベンチマークでの5ポイント差は、実際の組織において、より良いコード、より安全なデプロイ、あるいはより低い総エンジニアリングコストを保証するものではない。
Artificial Analysisは、多くのリーダーボード運営者より詳細な方法論を公開している。コンポーネントタスク、試行回数、採点方法、効率性の定義が文書化されている。
それでも、ベンチマークはあくまでサンプルだ。すべての言語、リポジトリの構造、依存関係の環境、セキュリティポリシー、レビュー基準を代表することはできない。
このインデックスでは3つのコンポーネントを同等に重み付けしている。実際の企業がリポジトリ質問、ターミナル操作、パッチ完了を正確に同じ比重で評価することはほとんどない。
ある組織は、広範なテストを備えたTypeScriptサービスに大半の時間を費やすかもしれない。別の組織は、組み込みCコード、データパイプライン、規制対象の金融システムを保守しているかもしれない。
その社内ランキングは公開リーダーボードと異なり得る。DeepSWEで優れるモデルでも、独自フレームワークや文書化が不十分なレガシーコードには苦戦する可能性がある。
Pass-at-oneの採点も、重要な品質差を圧縮する。2つのパッチはいずれも自動検証を通過しても、保守性、セキュリティ、可読性、アーキテクチャへの適合性は異なる場合がある。
逆のことも起こり得る。有用な部分的解決策が検証条件の1つを満たせず、使い物にならない試行と同じ二値結果を受けることもある。
SWE-Atlas-QnAには別の依存関係もある。Artificial Analysisは、自動判定器を使ってリポジトリ回答が必要な全基準を満たすかどうかを決めている。
自動判定は大規模な評価を支える。ただし、とりわけ複数の有効な表現がある説明では、曖昧さ、モデルの偏り、採点ミスを引き継ぐ可能性がある。
ベンチマークの統合平均も分散を隠している。平均コストからは、大半のタスクが予測可能なのか、それとも一部のタスクが非常に長い処理経路を生むのかは分からない。
このばらつきは予算策定において重要だ。サービスは平均値が中程度でも、過剰なトークンを消費したり環境を何時間も占有したりする個別実行によって影響を受け得る。
エージェントの挙動は、製品アップデート後にも変わり得る。ツール選択、コンテキスト圧縮、リトライロジック、非公開のシステム指示は、新しい公開モデル名がなくても変化する可能性がある。
このため、ベンチマークは時点に依存する測定として扱うべきだ。Claude Code、Codex、Antigravity CLI、あるいはそれらの基盤モデルの恒久的な特性ではない。
maximum-effort Claudeは、上限結果をデフォルト体験と読み違えるリスクを示している。ベンチマーク対象の構成は、Claude Codeのmediumデフォルトよりはるかにリソース集約的だ。
このインデックスは、トークン単価ベースのAPI支出も比較している。サブスクリプション制限、交渉済みのエンタープライズ料金、地域ごとの処理、社内インフラは、チームの実際の経済性を変え得る。
人的コストも含まれていない。非同期で動作するなら、遅いエージェントでも許容できるかもしれない。開発者がフィードバックを待っている場面では、速いエージェントの価値がより高くなる可能性がある。
レビュー負荷も未解決の変数だ。広範な検査を必要とする安価なパッチは、短いレビューで受け入れられる高価なパッチより、全体ではコストが高くなることがある。
セキュリティにも同様の注意が必要だ。見出しのスコアだけでは、エージェントが最小権限アクセスに従うこと、悪意あるリポジトリ指示に抵抗すること、機密コンテキストの漏えいを避けることは証明されない。
Googleは段階的な安全性検証を実施する間、Argonの初期提供を限定している。この展開により、公開利用に関する証拠はベンチマーク上の注目度が示唆するより薄いままになる可能性がある。
ベンダーの主張にも慎重な帰属が必要だ。Anthropic、OpenAI、Googleはそれぞれ、異なるスイートや設定における有利な評価結果を強調している。
これらの結果は正確であっても、直接比較できるとは限らない。異なるハーネス、タスクセット、予算、採点ルールは、しばしば異なる首位者を生む。
Artificial Analysisのベンチマークは、1つのフレームワークで構成を実行することで比較可能性を高めている。ただし、独自エージェントやモデルインターフェースによって生じる違いをすべて取り除くことはできない。
エンジニアリングリーダーは、標準化する前に小規模な社内試験を再現すべきだ。有用なテストセットには、完了済みチケット、既知の失敗事例、代表的なリポジトリ制約を含める。
レビュー担当者は、正確性、不必要な変更、セキュリティ、テストカバレッジ、説明の質、受け入れまでの時間を評価すべきだ。トークン支出は、それらの結果と並べて記録する必要がある。
得られる指標は、1ドル当たり、あるいはエンジニア1時間当たりの受け入れ済み作業にすべきだ。公開の総合スコアは候補選定の指針にはなるが、その測定に取って代わることはできない。
Claudeの優位性が意味を持つかを決める3つのシグナル
次の段階は、デフォルト設定での性能、受け入れ済み変更の経済性、アップデートをまたいだベンチマークの安定性によって決まる。
最初のシグナルは、実用的なeffort設定での性能だ。maximum構成は注目を集めるが、日常利用の大半を形作るのはデフォルト設定である。
Sonnet 5.5はmedium effortではmaximum結果を大きく下回る。公開データでは、Solはxhighからmediumへ移行しても2ポイントしか失わない。
Anthropicがこのデフォルト設定の差を縮めれば、Claudeの68ポイントという上限は一般的なチームにとってより意味を持つようになる。差が続けば、Solの効率性に関する主張は強まる。
2つ目のシグナルは、受け入れ済み変更当たりのコストだ。公開ベンチマークは現在、タスク当たりのAPI支出を測定しており、要求からマージ済みコードまでの完全な経路は測定していない。
チームは、ベンダーや独立評価者がレビュー調整後の結果を公開するかを注視すべきだ。そこには、再実行、人間による修正時間、検証後に発見された回帰を含める必要がある。
Claudeのプレミアムは、そのパッチに必要なレビューが少なければ、より正当化しやすくなる。低い推論使用量が追加の修正作業を生まないなら、Solの優位性は強まる。
Argonは、DeepSWEでの強みが本番環境に移転するなら、複雑なリポジトリ変更においてこの指標で首位に立つ可能性がある。総合スコアだけでは、この問いに答えられない。
3つ目のシグナルは、ランキングの安定性だ。コーディングエージェントは、モデル更新、ハーネス改訂、ツールポリシー、コンテキスト管理の改善を通じて変化する。
安定した首位者は、反復実行とベンチマークのバージョンをまたいでも順位を維持するはずだ。小規模なシステム更新後に大きな変化があれば、僅差のスコアに対する信頼は低下する。
Artificial Analysisはすでに、コンポーネント結果、効率性指標、方法論の改訂を公開している。今後の再実行により、5ポイント差が持続的な隔たりを表すのか、一時的な構成効果を表すのかが明らかになる。
開発チームは、完璧なベンチマークを待つ必要はない。今すぐ、範囲を限定した判断を下せる。
まずは、代表的な社内タスクのセットから始めよう。アクセスが許す範囲で、複数の努力レベルにおけるClaudeをSolおよびArgonと比較する。
エージェントの権限、リポジトリのスナップショット、成功基準は一貫させる。実行時間、トークン数、失敗、レビュー時間、最終的な変更が受け入れられたかを記録する。
高い努力レベルの構成は、タスクがエスカレーションを正当化する場合にのみ使用する。定常的な作業では、チームの受け入れ基準を満たす中で最も低コストな設定から始めるべきだ。
大規模なモデル更新やハーネス更新の後には、比較を再確認する。フロンティアが動き続けているからこそ、Artificial Analysis Coding Agent Indexは有用である。
現時点で、そのメッセージは明確だ。Claude Sonnet 5.5は3つの新しい構成の中で最高の公開スコアを保持しているが、実務上の「首位」のあらゆる定義を独占しているわけではない。
GPT-6.1 Solは魅力的な効率プロファイルを提供し、Gemini 4 Argonは長期にわたるリポジトリ作業でこの3者をリードしている。適切な選択は、チームがどの結果を重視するかによって決まる。
組織は、インデックスで5ポイントを追加で得るために大きなリソース上乗せを支払うだろうか。それともSolを使って、より多くの試行と検証に資金を振り向けるだろうか。デフォルトを選ぶ前に、自社でマージされた作業を用いてその問いを検証してほしい。



