Claude Opus 5がエージェントの基準を引き上げ、AnthropicとGoogleの競争が激化
Anthropicは7月24日、Claude Opus 5を発表し、高性能で実用的なAIエージェントを巡るAnthropicとGoogleの競争における圧力を高めた。この新モデルは、Anthropic最大の最先端モデルより下位に位置付けられているにもかかわらず、複数の独立評価で首位を獲得している。この結果は、最も困難な業務には利用可能な最大モデルが必要だという前提に疑問を投げかける。
今回の発表は、単に別のチャットボットがより高いベンチマークスコアに到達したという話ではない。AnthropicはOpus 5を、結果を検証し、不足するツールを作り、曖昧な指示にも取り組む日常的なエージェントとして打ち出している。モデルが本番コードを編集し、研究を分析し、業務ソフトウェアを操作する場面では、洗練された会話よりもこうした振る舞いの方が重要になる。
Geminiは長いコンテキスト、マルチモーダル作業、コンピューター操作、エンタープライズ配布で競合してきたため、Googleは依然として最も明確な外部対抗馬である。OpenAIも、特にコーディングや専門的な評価において重要な存在であり続けている。しかし、ここでの中心的な競争は、Anthropicがエージェントの信頼性を、Googleのより広範なプラットフォーム展開力に対する優位性へ変えられるかどうかにある。
Claude Opus 5がAnthropicのモデル階層を変える
Claude Opus 5が重要なのは、Anthropicが顧客に最大モデルの利用を求めずに、最先端に近い振る舞いを提供しているからだ。
AnthropicはOpus 5を、頻繁な利用を想定した「思慮深く能動的なモデル」と説明している。同社のOpus 5 releaseによれば、タスクごとの消費リソースを抑えながら、最先端の知能においてClaude Fable 5に近づいているという。
この位置付けは、通常とは異なる階層を生み出している。Fable 5はAnthropicにおける最大規模の知能の基準であり続ける一方、Opus 5は要求の厳しい日常業務向けの実用モデルとなる。AnthropicはOpus 5をClaude Maxのデフォルトモデルにし、Claude Proで利用できる最も強力な選択肢に位置付けた。
この違いは、消費トークンだけでなく、完了した作業に左右される。エージェント型システムはしばしば手順を繰り返し、エラーから回復し、外部ツールを呼び出す。トークン単価が低いモデルでも、多くの試行が必要だったり、人間による修正が必要な成果物を生成したりすれば、高コストになり得る。
Anthropicは、Opus 5が一定のリソース水準でより多くのタスクを完了することで、この関係を改善するとしている。Frontier-Bench v0.1では、同社によるとOpus 5はタスクコストを下げながら、Opus 4.8の性能を2倍以上に引き上げた。Frontier-Benchは、単発の質問ではなく、長時間にわたる実務的な課題でエージェントを評価する。
CursorBench 3.2では、Anthropicによると、このモデルは最高の努力設定でFable 5の最高結果から0.5ポイント以内に到達した。努力設定は、回答を返す前にモデルがどれだけの計算と推論を適用するかを制御する。
このモデルにはlow、medium、high、xhigh、maxの5つの設定がある。これにより開発者は、モデルを変更せずに、より速い応答とより長い推論の間で選択できる。このアプローチはまた、単一のベンチマークスコアが実際の利用状況を表しにくくする。
Opus 5は100万トークンのコンテキストウィンドウを維持しており、1回のセッションで非常に大規模なテキストやコードの集合を処理できる。長いコンテキストだけで、モデルが正しい根拠を見つけられるとは限らない。それでも、大規模なリポジトリや文書セットを分断されたプロンプトに分ける必要性は減る。
Anthropicはコンピューター操作と業務自動化も強調している。同社によると、Opus 5はタスク資源をおよそ3分の1しか使わずに、Fable 5のOSWorld 2.0最高結果を上回った。OSWorldは、AIシステムがグラフィカルなコンピューターインターフェースを通じて作業を完了できるかをテストする。
Zapier AutomationBenchでは、Anthropicによれば、Opus 5は同程度のタスクコストで次点モデルの約1.5倍の合格率を達成した。Anthropicによると、最も低い努力設定でさえ、テストされた代替モデルより多くのタスクに合格したという。
こうした数値は、独立した組織が追加の環境で再現するまでは、ベンダー側の主張にとどまる。それでも、Anthropicの製品戦略を示している。同社はOpus 5を、説得力のある回答を生成するだけのモデルではなく、仕事を完遂するオペレーターとして評価されることを望んでいる。
これが、この発表が通常のモデル更新と異なる理由でもある。Anthropicは、最先端モデルに関連付けられていた能力を、より多くの開発者が繰り返し導入できる製品へと圧縮している。この動きは、顧客がGoogle Gemini、OpenAIのGPTファミリー、低コストのオープンモデルと比較するモデルを変える。
AnthropicとGoogleの競争がエージェントへ移行している理由
AnthropicとGoogleの競争は現在、一般的なチームが使えるほど信頼できる長時間のAI作業を、どちらが実現できるかにかかっている。
Googleには、Anthropicが容易に再現できない強みがある。GeminiはGoogle Cloud、Android、Workspace、Search、そして大規模な開発者プラットフォームと接続できる。Googleは、企業が毎時間すでに使っているツールの内部に自社モデルを配置できる。
Anthropicのより狭い道筋は、エージェントのワークフローにおけるモデルの振る舞いに焦点を当てている。Claude Codeは、モデルがファイルを調べ、コマンドを実行し、変更をテストし、誤りを修正できるソフトウェア開発分野で、同社に目立つ立場を与えた。Opus 5はその主張をコード以外にも広げる。
新モデルの登場は、AI購入者が会話型デモから完了済みの成果物へと移行する時期と重なる。有用なエージェントは、目標を解釈し、関連するコンテキストを集め、ツールを選択し、失敗を認識し、いつ支援を求めるかを判断しなければならない。各ステップは、もっともらしい誤りが生じる新たな機会になる。
Opus 5の差別化要因は、これらのステップにおける判断力であるとされている。Anthropicは、このモデルがより一貫して自身の作業を検証し、満足できる結果に至るまで反復を続けるとしている。これはワークフロー全体にわたる振る舞いに関する主張であるため、回答品質の向上より強い主張だ。
一例は、機械部品の図面に関するものだった。モデルはその対象を3次元のFreeCADモデルとして再現するよう求められたが、画像を直接見る手段を持っていなかった。
リリースによると、Opus 5は画像の生ピクセルから幾何情報を抽出するコンピュータービジョンのパイプラインを書いた。その後、その情報を使って部品を再構築した。Anthropicは、競合モデルは同じ条件下で5回の試行すべてに失敗したとしている。
重要なのはFreeCADそのものではない。Opus 5は不足している能力を特定し、ツールを作成し、元のタスクに戻った。この一連の流れは、経験豊富なエンジニアが予想外の制約に対処する方法に似ている。
2つ目の例は、広く使われているオープンソースのパッケージマネージャーにおけるバグだった。Anthropicによると、Opus 5は根本原因を見つけ、既存のコミュニティパッチが見落としていたエッジケースを修正した。競合モデルは、目に見える症状だけを修復したとされる。
別の初期ユーザーは、Opus 5に新しい取引所向けの市場データフィードを構築するよう依頼した。ライブフィードが利用できなかったため、モデルはパーサーを検証するテストハーネスを作成した。Anthropicによると、以前のモデルはエンジニアが詳細な計画を提供した場合でも失敗していたという。
これらの例は、平均的な性能を中立的に測定したものではなく、選ばれたデモにとどまる。それでも、Anthropicが開発者に注目してほしい振る舞いを示している。Opus 5は単に計画に従うだけではない。計画が現実に直面した際、不足するインフラを構築する。
この振る舞いは、Googleへの圧力を2つの面で高める。第一に、モデル比較では、孤立した推論ではなくタスク全体の実行がますます重視される。第二に、競合モデルが同程度のコンテキストウィンドウやベンチマークスコアを提供していても、エージェントの信頼性が購買判断に影響を与え得る。
Googleは、Geminiの統合面での強みと自社のエージェント製品で応じることができる。また、単独のモデル提供者がアクセスできない独自の職場シグナルも活用できる。未解決の問題は、配布力が計画、検証、回復の差を補えるかどうかだ。
OpenAIは別の方向から圧力をかけている。Artificial Analysisは、分析的な指標ではOpus 5がリードしていた場合でも、プレゼンテーション品質ではGPT-5.6 SolがOpus 5を上回ったとした。これは、プロフェッショナルな成果物のあらゆる側面を単一の提供者が支配しているわけではないことを示唆する。
したがってエンタープライズの購入者は、モデル名だけでなくシステム全体を比較することになる。アイデンティティ制御、データアクセス、可観測性、障害回復、生成物の品質を考慮しなければならない。勝つモデルは、多くの場合、説明責任のあるワークフローに適合するモデルになるだろう。
大規模な技術資料群を管理するチームにとっては、検索可能なナレッジベースが、エージェントに必要なコンテキストを提供できる。より良い検索はモデルの誤りをなくさないが、根拠を確認しやすくする。
能動的な振る舞いこそがClaude Opus 5の実際のメカニズム
Opus 5の中核となるメカニズムは持続的な検証だが、その持続性は時間をより多く消費し、予期しない行動を生む可能性もある。
Simon Willisonは、AnthropicのFreeCADの例をレビューした後、このモデルを「容赦なく能動的」になる可能性があると表現した。彼のearly assessmentは、その魅力と懸念の両方を捉えている。
モデルが不足するテスト、隠れた依存関係、誤った前提に気付く場合、能動性は望ましく聞こえる。だが、エージェントがタスクを拡張したり、無関係なファイルを変更したり、有用な回答がすでに存在する後もリソースを消費し続けたりする場合には、魅力は薄れる。
したがって、このリリースの鍵は判断力にある。有能なエージェントは、いつ追加調査すべきか、いつ止めるべきかを知る必要がある。行き詰まったタスクと、承認を必要とするタスクを区別しなければならない。
Anthropicの顧客事例は、この区別を繰り返し強調している。あるフロントエンド評価では、Opus 5がデスクトップとモバイルの幅でページを確認した。画面外にあるチェックアウトコントロールに気付き、レイアウトを修正し、作業を返す前に結果を再確認したとされる。
別のユーザーは、モデルが引き継ぎを完了する前にブランチを確認し、プルリクエストのテンプレートをレビューし、テストへの影響を検討したと説明した。以前のモデルはより速く進めたものの、内部チェックに失敗したとされる。
これらの説明は、AnthropicがOpus 5を検証ループ中心に最適化したことを示唆する。検証ループとは、作業を生成し、テストし、エラーを特定し、結果を修正するという反復的な一連の流れである。テストがタスクを正確に表している場合、このループは信頼性を高められる。
ただし、テストが常に信頼できるとは限らない。エージェントは不完全な評価に対して最適化し、実際の目標を見落とす可能性がある。また、自身の誤った解釈を確認するテストを作成することもある。
このリスクは、ソフトウェア開発以外ではより深刻になる。法務エージェントは、管轄を誤解しながらも書式チェックを満たす文書を生成する可能性がある。リサーチエージェントは、弱い証拠や循環的な証拠に依存しながらも、完全なレポートを作成できてしまう。
モデルのより長い推論経路には、時間的な代償もある。独立テストでは、最も強力な設定における複雑なナレッジワークタスクの平均所要時間は25分を超えた。最大設定はより多くのターンを使用したため、Opus 4.8より大幅に長い時間を要した。
ターンは、モデルとそのツールまたは環境との間で行われる追加のやり取りを表す。ターン数の増加は生産的な確認を示す場合がある一方、迷走を示す場合もある。組織には、どちらの解釈が当てはまるかを明らかにするログが必要だ。
Artificial Analysisは、AA-Briefcase評価における最大努力時のOpus 5の平均ターン数を103回と測定した。Opus 4.8は最も強力な設定で55ターンを使用した。この差は、Opus 5がより強い結果を出しながら時間も長くかかる理由を説明する一助となる。
これは実務上のトレードオフを生む。調査を要するプレゼンテーション作成や難しいソフトウェア修復であれば、チームはエージェントの30分の実行時間を受け入れるかもしれない。同じ遅延でも、対話型のサポートアシスタントでは許容されない。
effort設定により、開発者はその境界を管理できる。定型的な分類処理は低い設定で実行できる一方、曖昧な調査にはより多くの計算を割り当てられる。ただし、ユーザーが事前に必要な努力量を把握していることはまれであるため、モデルには依然として信頼できるルーティングが必要だ。
エージェント基盤はスコープも強制しなければならない。自律システムには、明示的な権限、支出上限、承認チェックポイントが必要である。より強力なモデルは一部の実行失敗を減らすが、運用上の統制に取って代わるものではない。
最良の導入は、モデルの判断力と制約された環境を組み合わせることになる。エージェントには限定的な認証情報、一時的なワークスペース、検証可能な完了基準、不可逆な操作に対する人間のレビューを与えられる。この設計は、自律性を段階的に付与される権限として扱う。
Opus 5は、モデルの振る舞いがループ全体を改善し得るというAnthropicの主張を補強している。しかし、ループを設計する必要性をなくすものではない。プロアクティブ性が価値を持つのは、組織がそれを監視、制限、監査できる場合に限られる。
独立スコアは主張を支持するが、重要な限界もある
独立評価ではOpus 5は上位に位置するが、詳細な結果は単一のリーダーボード順位では見えないトレードオフを示している。
Artificial Analysisは、リリース前に5つすべてのeffort設定を評価した。同社の知能評価では、最大effort時のOpus 5は61点を獲得した。Fable 5は60点、GPT-5.6 Solは59点、Opus 4.8は56点だった。
1点差の首位は、普遍的な優位性を示すものではない。複合指数は複数のテストを組み合わせており、わずかな差でもプロンプト、ハーネス、採点ルールによって変動し得る。この結果が支持する結論は限定的だ。Opus 5は、含まれるタスク全体で最前線の競争力を持つ。
より強い根拠は、エージェント型のナレッジワークに見られる。AA-Briefcaseは、数千の入力ファイルを伴う非公開の課題でモデルをテストする。出力にはレポート、スプレッドシート、プレゼンテーションが含まれ、正確性、分析、プレゼンテーションの観点から評価される。
Opus 5は最大effortでEloスコア1,720に到達した。Fable 5は1,574で、146ポイントの差がついた。Opus 5のxhighおよびhigh設定も、この評価でFable 5を上回った。
エージェント型ベンチマークでは、Opus 5の向上は主に、客観的なルーブリックの達成度と分析品質によるものだとされた。最大effort時の分析スコアは、Fable 5を約300 Eloポイント上回った。
一方で、プレゼンテーションは相対的な弱点として残った。Opus 5のプレゼンテーションEloは1,628で、GPT-5.6 Solは1,666に達した。つまり、モデルはより強い分析を生み出しても、最も見栄えのよい最終成果物を作るとは限らない。
この違いは企業導入にとって重要である。アナリストには正確な結論と、経営幹部や顧客に提示できる成果物の両方が求められることが多い。ワークフローでは、調査には一つのモデルを使い、書式設定や視覚的な洗練には別のシステムを使う必要があるかもしれない。
総合評価では、事実の信頼性に関する懸念も示された。Opus 5はAA-OmniscienceでOpus 4.8より正確性を改善したが、不確かな場合にもより多くの質問へ回答した。Artificial Analysisは、このテストでの幻覚率を50%と測定した。
幻覚率はベンチマーク固有の指標であり、あらゆるワークロードにおけるモデルのエラー率として扱うべきではない。それでも、この結果はAnthropicの検証に関する説明を複雑にする。モデルは手順を慎重に確認できても、保存された事実知識について過度に自信を持つことがある。
これが本稿の主な懐疑的論点である。エージェント型の持続性と事実に関するキャリブレーションは別個の能力だ。不確実性を認識できなければ、粘り強いエージェントは誤った前提を増幅する可能性がある。
非公開ベンチマークにも限界がある。モデル開発者が正確なタスクで容易に学習できないため、汚染リスクは低減される。しかし購入者は、ベンチマークのファイル、ツール、採点基準が自社の業務と一致すると想定できない。
初期顧客による推薦にも同様の留保がある。Anthropicはリリースに掲載する組織と引用を選定している。そうしたユーザーは、強力なテスト、経験豊富な監督者、明確に定義されたパフォーマンス指標を備える高度な開発環境で運用していることが多い。
小規模な企業では、提供できる構造が少ない場合がある。データは一貫性を欠き、権限は過度に広く、タスクには暗黙の組織的前提が含まれる可能性がある。同じモデルの振る舞いでも、こうした条件下では異なる結果を生み得る。
企業は、代表的な業務と文書化された失敗カテゴリを用いて評価を実施すべきだ。合格率だけでは不十分である。チームは、根拠のない主張、破壊的な操作、不必要なツール呼び出し、不完全な引き継ぎ、承認要求の失敗を記録すべきである。
また、最初の回答の品質ではなく、タスク全体の完了度も比較すべきだ。人間による修正時間は、モデルの実行コストを上回る可能性がある。逆に、修正がほとんど不要な成果を返すなら、遅いエージェントでも時間を節約できる。
独立した結果がAnthropicの性能主張をおおむね支持しているため、Claude Opus 5は注目に値する。しかし、その結果は無監督での導入を正当化するものではない。むしろ、Google、OpenAI、既存の社内ワークフローに対して、より真剣なテストを行う根拠となる。
安全性の向上はエージェントのリスクをなくさない
Anthropicは有意義な安全性向上を報告しているが、より強力なエージェントは、誤った指示や侵害されたコンテキストがもたらす影響も拡大する。
Anthropicによると、Opus 5は最近のClaudeモデルの中で、測定された不整合行動の割合が最も低かった。自動化された行動監査では、モデルの総合不整合スコアは2.3だった。
同社はまた、Opus 5がOpus 4.8、Sonnet 5、Fable 5よりもClaude’s Constitutionに忠実に従うとしている。Claude’s Constitutionは、モデルの振る舞いを導き、相反する指示を解決するためのAnthropicの文書化された枠組みである。
これらは企業が実施した測定である。有用な詳細は提供するが、独立研究者が未知の攻撃や実際の導入環境でモデルをテストするには時間が必要だ。ユーザーがモデルを新しいツールに接続すると、安全性の結果は変化することが多い。
プロンプトインジェクションは依然として中心的な懸念である。プロンプトインジェクションとは、エージェントが読み取るコンテンツに隠された悪意ある指示を指す。攻撃者は、エージェントに未信頼のテキストを認可されたコマンドとして扱わせようとする。
AnthropicのBoris Chernyは、Opus 5を同社で最もプロンプトインジェクションされにくいモデルだと説明した。付随するシステムカードでは、行動監査、不正利用評価、レッドチーム演習にわたるテストが報告されている。
プロアクティブなエージェントはメール、文書、ウェブサイト、ソースコード、サポートチケットを取り込むため、低い脆弱性は重要だ。あらゆる項目に、モデルを誘導し直すための指示が含まれ得る。ツールへのアクセスは、操作が成功した場合の被害を運用上のものに変える。
ただし、耐性は免疫を意味しない。組織は引き続き、データと指示を分離し、認証情報を制限し、機密性の高い操作の前に確認を求めなければならない。モデルレベルの防御を突破する攻撃があることを前提にすべきだ。
AnthropicはOpus 5のサイバーセキュリティ学習も制限した。同社によると、その制限にもかかわらず、一般的な能力向上によってモデルは脆弱性の発見能力を高めた。これらの弱点を悪用する能力では、依然としてMythos 5に及ばない。
この切り分けは、攻撃能力を最大化せずに防御上の有用性を維持することを目的としている。脆弱性の発見と悪用は知識を共有するため、その維持は難しい。専門的な学習から攻撃タスクを除外しても、推論力の向上は両方を改善し得る。
今回のリリースは、ガバナンス上の問題も提起する。Opus 5が設計者の想定しなかったツールを作れるなら、権限システムは名前付きの操作ではなく結果を評価する必要がある。モデルが代替ルートを構築できる場合、一つのコマンドをブロックしても十分な保護にはならない。
FreeCADの例は、この問題を無害な環境で示している。モデルには視覚的アクセスがなかったため、ビジョンパイプラインを構築した。機密性の高い環境では、同様の即興対応が悪意なく意図された境界を回避する可能性がある。
プロアクティブなエージェントには、能力の失敗とポリシー上の制限を明確に区別する必要がある。「この入力にアクセスできない」は、自動的に「新しいアクセス手段を作る」を意味してはならない。欠けている能力が、意図的なセキュリティ統制を表している場合もある。
開発者は、モデルがこの違いを認識するかをテストすべきだ。評価ではエージェントを明示的な境界の背後に置き、許可を求めるか、安全に停止するか、あるいは制限を回避して即興対応するかを観察できる。
監査可能性も同様に重要である。長いエージェントトレースには、数百に及ぶツール操作が含まれることがある。人間のレビュアーには、変更したファイル、アクセスしたシステム、前提、失敗したテスト、未解決の不確実性を示す要約が必要だ。
知識の来歴も重要である。knowledge blendingを使用するチームは複数の情報源を接続できるが、得られる回答には依然として追跡可能な根拠が必要である。モデルは、各重要な主張をどの情報源が支えているかを示すべきだ。
Anthropicが報告する安全性向上は、統制された試験を行う根拠を強める。しかし、無制限の自律性を支持するものではない。Opus 5がオープンエンドなタスクをより効果的に完了するほど、こうした統制の重要性は増す。
Anthropic、Google、AI購入者の次の展開
次の局面を決めるのは、本番環境での信頼性、Googleの対応、そしてベンチマーク上の改善が通常の職場環境でも維持されるという証拠だ。
最初のシグナルは、実際の組織からの導入データである。購入者は、Opus 5がコーディングとナレッジワークにおいて、人間による修正時間、失敗した実行、繰り返しのプロンプトを減らすかを注視すべきだ。完了したタスクの正確性が維持されなければ、リソース使用量の削減だけでは意味がない。
台本のない導入環境からの証拠は、Anthropicの主張を強めるだろう。スコープの拡大、完了の遅さ、確信を持った事実誤認に関する報告は、その主張を弱める。最も有用な事例研究には、成功例だけでなく失敗率も含まれる。
二つ目のシグナルは、Geminiとそのエージェントプラットフォームを通じたGoogleの対応である。WorkspaceとCloudの統合によりGeminiをより容易に統制できるなら、Googleはすべての独立ベンチマークで勝つ必要はない。ただし、計画、検証、復旧の振る舞いでは競争力を持つ必要がある。
長時間実行タスクでOpus 5に匹敵するGoogleモデルが登場すれば、競争の軸は再び流通力へと移る。対応が弱ければ、より大きなプラットフォームが配布するソフトウェア内であっても、AnthropicがClaudeの振る舞いを中心にエージェント品質を定義できるようになる。
OpenAIもこの比較に残り続ける。GPT-5.6 Solのより強いプレゼンテーション結果は、プロフェッショナルな業務が複数の独立した次元から成ることを示している。購入者は一つの恒久的な勝者を選ぶのではなく、タスクごとにモデルを使い分けるようになるだろう。
三つ目のシグナルは、独立した安全性テストである。研究者は、プロンプトインジェクションへの耐性、権限の扱い、事実に関するキャリブレーション、モデルが停止を受け入れる姿勢を検証すべきだ。外部チームが未知の環境でもAnthropicの主張を再現できれば、その説得力は増す。
失敗があっても、必ずしもOpus 5が使えなくなるわけではない。それは、モデルにより厳格な権限、より狭いタスク、またはより強い人間のレビューが必要となる場面を明らかにする。エージェントの安全性は通常、単一モデルのスコアではなく、システムの性質である。
開発者にとって当面の問いは実用的だ。Opus 5は、Opus 4.8、Gemini、またはGPT-5.6よりも少ない修正で、あなたの難しいタスクを完了できるだろうか。統制された評価では、同一の入力、ツール、権限、完了基準を用いるべきである。
企業の購入担当者は、出力品質だけを評価すべきではありません。予測可能なレイテンシ、追跡可能な情報源、制御可能なリソース使用量、繰り返し実行時の安定した挙動、そしてモデルが曖昧さに直面した際の明確なエスカレーションが必要です。
ナレッジワーカーも注視すべきです。なぜなら、エージェント競争はチャットの枠を超えつつあるからです。モデルには、完成済みのスプレッドシート、プレゼンテーション、リサーチパッケージ、運用上の変更を生み出すことがますます求められています。検証の品質が、それらの成果物が作業を削減するのか、単に別の場所へ移すだけなのかを左右します。
AnthropicとGoogleの対立には、より明確な試金石が生まれました。Anthropicは、持続的かつ自己検証的な振る舞いがGoogleの配信力における優位を上回り得ると賭けています。Googleは、自社がすでに管理しているシステム内でGeminiを同等に信頼できるものにすることで応じられます。
Claude Opus 5は現在、この賭けを裏付ける強力な証拠をAnthropicにもたらしています。独立した評価スコアは印象的であり、ツール構築の事例はエージェントの挙動における意味のある変化を示しています。一方で、事実性のキャリブレーションとレイテンシの結果が、単純な勝利宣言を妨げています。
期待される結果をすでに把握している作業でモデルを動かしてください。修正のすべて、不必要なアクション、根拠のない主張、承認リクエストを追跡します。そして、最も印象的な応答ではなく、タスク全体を比較してください。
次のリーダーは、1つのリーダーボードで決まることはありません。価値ある仕事を完了しつつ、その誤りを可視化し、影響範囲を限定し、回復可能にするシステムこそが勝者となるでしょう。



