top of page

AnthropicのAI開発指標が浮き彫りにする、自動化と監督の競争

6 日前
読了時間: 19分

Anthropicは、Claudeが同社で測定対象となるモデル研究開発業務の26%を主導するようになったことを受け、AI開発に関する3つの指標を公表した。同社によれば、この割合は2026年2月時点では1%未満だった。この伸びは難しい問いを投げかける。研究を担うシステムの進化に、監督体制の改善は同じ速度で追いつけるのだろうか。

新たな枠組みは、AI主導の研究、社内エージェントの監督、計算能力の配分を測定する。Anthropicは各カテゴリーを対象とした社内のスナップショットも公開した。同社はこれらの測定を、通常は最先端研究所の内部に隠される活動を外部の人々が追跡するための手段として位置付けている。

これは、Claudeが自律的に後継モデルを設計・展開できる証拠ではない。Anthropicによると、Claudeは測定した研究カテゴリーのいずれでも完全自律には達していない。ただし同社のデータは、監督下のAIが、より高性能なモデルの構築に必要な作業の相当部分をすでに担っていることを示唆している。

このタイミングは重要だ。AnthropicのCEO、Dario Amodei氏は、最先端開発の速度を抑制するための協調的な措置を求めてきた。一方で競合各社も、自社の内部モデルがプロセスにどこまで深く関与しているかを明らかにしないまま、研究を自動化する同じ誘因に直面している。

AnthropicのAI開発指標、社内自動化を記録に残す

Anthropicは社内でのAI利用を、非公式な生産性向上の話としてではなく、測定可能な開発投入要素として扱い始めた。

同社の測定フレームワークは、最先端モデル開発の3つの側面を対象とする。1つ目はClaudeが担う研究の割合を推定する。2つ目はAnthropicが社内エージェントを観測・停止できるかを追跡する。3つ目は、安全性研究とその他の研究の間で同社が計算能力をどう配分しているかを検証する。

注目される数値は、Anthropic R&D Automation Indexによるものだ。Anthropicはモデル開発に伴うタスクを分類して、この指標を構築した。続いて各タスクに自動化レベルを割り当て、推定される従業員の作業時間で重み付けした。

Anthropicによれば、Claudeは2026年8月時点で、測定対象となったAI研究開発業務の26%を主導した。「主導」とは、人が監督して結果を承認する状況で、モデルが高水準の指示を基にタスクの大半を完了することを意味する。

測定対象業務の90%以上は、少なくとも「協働」レベルに達した。このレベルでは、Claudeは人間による綿密な指示の下で、タスクの大部分を完了する。人間を運用ループから外す完全自律に達した測定カテゴリーはなかった。

この指標はEpoch AIが提案した6段階の尺度を使用している。その自動化尺度は、AIの関与なしから支援、協働、主導、完全自律までを示す。Epochは、この種の評価は依然として主観的であり、より良い評価手法が必要だと警告している。

AnthropicはSlackの記録と社内文書からタスクカタログを作成した。7月の各週に、モデル開発に関与する部門のスタッフの20%を抽出した。Claudeエージェントは、それらの記録から約1万5,000件の細かなタスクを抽出した。

同社はそれらのタスクを542ノードから成るツリーに整理した。このうち378件は個別のタスクカテゴリーだった。例として、評価プラットフォームの不具合診断、強化学習ネットワークポリシーの管理、提供環境でのインシデントレビューが含まれる。

この広がりは重要だ。ソフトウェアのベンチマークは、管理された条件下で選ばれた能力だけを測定する。一方、Anthropicの指標は、新モデルの実際の生産プロセスにAIがどこで参加しているかを問う。

社内の事例は、「主導」が実務上何を意味するかを示している。夜間のデータパイプラインが失敗した場合、Claudeはログを調べ、原因を特定し、修正を作成し、テストを実行し、その作業を文書化できる。人間はなお変更をレビューし、展開するかどうかを判断する。

これは自律的な研究とは本質的に異なる。モデルが独自に、どのシステムに注意が必要かを決めたり、研究方針を設定したり、本番環境への変更を承認したりするわけではない。26%という数値は、Anthropicの研究所を独立して制御することではなく、監督下で委任された実行を測定している。

それでも、半年で1%未満から26%へ変化した点は精査に値する。これは、AI支援の開発が孤立したコーディング支援から、エンドツーエンドのタスク所有へ移行していることを示唆する。また政府や競合研究所に対し、異議を唱えたり再現したりできる具体的な測定値も与える。

数値は他の最先端研究所への圧力を高める

Anthropicの開示は、競合各社に対し、自社の内部モデルが開発をどのように加速しているか、またそれらのシステムをどう統治しているかの説明を求める圧力となる。

最先端研究所はしばしば、公開モデルの能力評価を発表する。これらの報告書は、開発後にモデルが何をできるかを説明する。しかし、公開前に先進システムが研究所内でどのように使われたかについては、はるかに少ない情報しか明らかにしない。

この違いは可視性のギャップを生む。企業は、外部の人々がテスト可能になる前に、最も強力なモデルを研究、コーディング、評価、データ作業に社内導入できる。内部システムは、従来の公開ベンチマークに現れないまま、後継モデルに影響を及ぼし得る。

研究者らは、内部モデルの利用には専用の報告が必要だと主張してきた。内部リスク報告に関する2026年の論文は、最先端企業が高度なシステムを一般公開の数週間から数カ月前に社内運用できると指摘した。その期間には、外部評価者が観測できないリスクが生じ得る。

Anthropicのフレームワークは、その1つの回答を提示する。モデルがベンチマークを通過するかだけでなく、この指標は実際に稼働する研究組織全体での役割を測定する。監督指標は次に、その役割に見合う速度でモニタリング範囲が拡大しているかを問う。

当面の圧力はOpenAI、Google DeepMind、xAI、Meta、その他の先進モデル開発者に向かう。各社は異なる内部システムと組織構造を用いている。共通の定義、サンプリング手法、独立検証がなければ、直接比較はなお難しい。

それでも、報告を拒むこと自体が1つのシグナルになる。ある研究所がAI主導の研究割合を公表すれば、他社の沈黙はより目立つようになる。政策立案者は、同等のシステムを開発する企業から同様の指標が得られない理由を問うことができる。

このフレームワークは、AIの「自己改善」ループに関する主張も複雑にする。Anthropicの数値は、有意な自動化を示す一方で、モデルがより強力な後継モデルを自律的に構築する再帰的自己改善を示すものではない。

測定対象となった業務の大半には、なお人間の指示または承認が関わっている。Anthropicの8月のリスク評価も、AIが同社の開発速度を持続的に倍増させたことは観測していないとしている。同社のモデルは、研究科学者やエンジニアを置き換える段階には近づいていなかった。

この違いは公の議論にとって重要だ。「ClaudeがClaudeの構築を支援する」という表現は大まかには正確だが、複数の自動化レベルを1つの言葉に圧縮している。監督下でパイプラインを修復するシステムと、研究方向を選び、独立して変更を展開するシステムでは、異なるリスクがある。

したがってAnthropicの開示は、Anthropic自身を含む全員に対する証拠基準を引き上げる。研究所が政策立案者に内部的な加速への対応を求めるなら、劇的な説明ではなく、再現可能な測定が必要となる。

共通の報告は、研究所ごとに成功の定義が異なるかどうかも明らかにする。ある企業はAI生成コードを自動化作業として数えるかもしれない。別の企業は、継続的な人間の介入なしに完了したタスクだけを数えるかもしれない。こうした選択は、互換性のない割合を生み得る。

共有フレームワークは、開発者に分母を明示するよう求めることになる。測定がエンジニアリング、研究計画、評価設計、展開、あるいは計測しやすいタスクだけを対象とするのかを明確にする。

それまでは、Anthropicの26%という数値は、1社内のベースラインとして捉えるのが最適だ。その最大の価値は、時期尚早な順位表を支えることではなく、安定した手法の下で変化を示すことにある。

Anthropic R&D Automation Indexは知能ではなく作業を測定する

この指標は生産プロセスの変化を追跡するが、その設計ではClaudeがどれほど知的または自律的になったかを確立することはできない。

Anthropicは、時間の経過に伴う自動化を比較できるよう、研究タスクのバスケットを固定した。このアプローチは、一定の品目群によって変化を解釈しやすくする物価指数に似ている。一方で、基礎となる作業が変化する場合には、よく知られた測定上の問題も生じる。

研究者が定型作業をやめ、より難しい作業に移行すれば、研究全体の価値における同等の割合を置き換えずとも、自動化は高まり得る。固定バスケットは、新しい作業の創出よりも、古い作業の消滅をより確実に捉える。

Anthropicは、2026年1月と7月のタスク構造を比較することで、この懸念を検証した。同社によると、選定した詳細度では新規タスクカテゴリーの増加は確認されなかった。ただし同社は、バスケットを定期的に再構築し、バージョン管理する計画だ。

重み付けも別の課題をもたらす。Anthropicは、タスクの重要性の代理指標として従業員の作業時間を使う。これによりスタッフ時間をより多く要する活動の重みは大きくなるが、時間と科学的価値は同じではない。

研究方向に関する短い決定が、数週間に及ぶ実装より重要になる場合もある。Epoch AIのインタビューでは、計画と仮説の作成は費やす時間が少なくても、プロジェクト成功に不可欠であり得ることが分かった。エンジニアリングとデバッグはより時間がかかり、自動化により適しているように見える。

このパターンでは、AIが最も重要な判断を担う前に自動化指標が上昇し得る。人間が問うべき価値のある問題を選ぶ一方で、Claudeは実験の実行、インフラの修復、結果の分析を担うかもしれない。

採点プロセスも不確実性をさらに加える。Claudeエージェントは社内タスクに関する証拠を収集し、別のClaude判定モデルが自動化レベルを割り当てた。関連するモデルを使ってモデルの関与を評価することには、相関した誤りのリスクがある。

Anthropicは、これらの判断を該当作業を担当した従業員の評価と比較した。同社は、モデルと人間の評価が完全に一致したケースは59%だったと報告している。人間の評価者2人が完全に一致した割合は35%にとどまった。

モデルと人間の評価は、97%のケースで自動化レベルが1段階以内に収まった。これらの結果は、この尺度が大まかな違いを捉えられることを示唆する。同時に、協働と主導の境界には重要な曖昧さがあることも示している。

この境界が見出しの数値を左右する。タスクをレベル3からレベル4に移すと、AIとの協働からAI主導へと変わる。しかし、どちらのレベルにも相当な人間の関与が残る。

この指標は、機微な社内記録にも依存する。独立監査人は、従業員の成果物、エージェントの記録、タスク定義、重み付けの判断にアクセスする必要がある。そのアクセスはプライバシー、セキュリティ、競争上の懸念を生む。

Anthropicは、社内のリスクチームに匹敵するアクセス権を持つ第三者評価者を組み込む計画だ。この取り組みは、方法論だけを公開することよりも重要である。外部評価者には、分類を再現し、除外された作業負荷を検証するのに十分なアクセスが必要となる。

エンジニアリング組織にとって、このフレームワークは実務的な文書化の課題も浮き彫りにする。意思決定がメッセージ、コードレビュー、エージェントのトレース、実験ログに分散したままでは、自動化された作業の監査は難しくなる。

検索可能なエンジニアリング・ナレッジベースは、AI生成の成果物と並行して人間の意思決定を保存する助けになる。この記録だけで独立検証の問題は解決しないが、社内での説明責任を果たしやすくする。

したがって、この指標は運用上のゲージとして読むべきだ。これはAnthropicが現在、人とClaudeの間でどのように仕事を分担しているかを測るものである。意識、汎用知能、あるいは自律的な自己改善へ向かう必然的な道筋を測定するものではない。

3万のエージェントが監督をスループットの問題に変える

Anthropicの社内エージェント規模は、まれだが重大な失敗を見落とさずに膨大な活動を絞り込める監視システムに安全性が依存することを意味する。

Anthropicによると、8月には、最も利用されている社内プラットフォーム上で、常時およそ3万のエージェントが研究・エンジニアリング作業を行っていた。測定対象はそのプラットフォームであり、社内で利用されるすべてのエージェントシステムではない。

Anthropicによれば、測定対象プラットフォーム上のあらゆる行動は、実行前にオンライン監視システムを通過する。オンライン監視システムは行動をリアルタイムで評価し、ブロックしたり、エージェントを別の行動へ誘導したりできる。Anthropicは、このプロセスには通常数秒かかるとしている。

同社はすべての行動をオフライン監視システムにも取り込んでいる。オフライン監視は、より長い連続行動の中で生じうるアラインメント不全など、時間をかけて現れるパターンについて完了済みの活動を調べる。

この2層は異なる失敗モードに対応する。オンラインシステムは、モデルの重みをコピーしようとする迅速な試みを止められる。オフラインシステムは、複数の行動ややり取りを経て初めて疑わしくなる行動を調査できる。

Anthropicは8月中に10億件超のエージェント判断を分析した。オンライン監視システムがブロックしたのはその0.002%、すなわち約4万7,000件に1件だった。

この低い割合には、2通りの解釈がある。エージェントが危険な行動を試みることがほとんどない可能性と、監視システムが問題行動の狭い一部しか特定できていない可能性である。この数字だけでは、両者を区別できない。

オフライン監視では、追加調査の対象として約1,000件のうち1〜2件のトランスクリプトにフラグが立つ。Anthropicによると、週あたり約10万件のトランスクリプトが追加の自動レビューに回される。人間のレビュー担当者に届く高優先度案件は約50件だ。

10万件の機械的なフラグが約50件の人間へのエスカレーションに絞り込まれることは、なぜ監督がスループットの問題なのかを示している。この規模では、人間がすべてのエージェント行動を手作業で調べることはできない。何に注意を向けるべきかを決める分類器に依存せざるを得ない。

したがって、カバレッジは必要条件ではあっても十分条件ではない。監視システムは技術的には行動の100%を検査できても、未知の攻撃戦略を見逃す可能性がある。最も重要な問いは再現率、すなわち既知および新たに設計された危険行動をどの程度捕捉できるかである。

Anthropicは、この形式の監視を運用してきたのは数年ではなく数か月だと認めている。また、大規模なエージェント集団を監督する科学は大きく変化するとしている。

外部からの精査が役立ちうることを示す証拠もある。METRは2026年初頭、3週間をかけてエージェント監視システムのレッドチーミングを実施した。この調査では複数の新たな脆弱性が見つかり、その一部は後にAnthropicが修正した。

METRは、これらの発見が関連するAnthropicのリスク報告における主要な主張を深刻に損なうものではないと述べた。しかし、公表されたのは編集・削除を施した要約のみだった。そのため、攻撃、防御、残存する弱点に対する外部評価には限界がある。

Anthropicのアイデンティティシステムは、モデルのアップグレードをまたいで各エージェントに永続的なIDを割り当てる。同社の社内エージェントは私的なチャネルではなく、帰属を追跡できる共有メッセージを通じて通信する。こうした設計により、監視システムは行動や主張を個々のエージェントまで追跡できる。

永続的なIDは、エージェントが他のエージェントからのメッセージを検証が必要な主張として扱ううえでも役立つ。グループ内で流通する情報が、エージェント自身の推論と区別できなくなる可能性を抑える。

オープンな通信はより豊かな監査証跡を生むが、独立した行動を保証するものではない。類似したモデルで動くエージェントは、同じ盲点を共有しうる。同じ系統の監視モデルも、本来検出すべき推論上の誤りを再現する可能性がある。

これがAnthropicのシステムにおける中心的な葛藤だ。人間のレビューでは量に追いつけないため、同社は自動化を監視するために自動化を必要とする。しかし、自動化レイヤーを追加するたびに、検証を要するモデル依存の判断がさらに一つ増える。

コンピュート配分は透明性をもたらすが、視野は限定的だ

コンピュートは研究の質より数えやすいが、Anthropicの1週間のスナップショットでは、安全性への投資が追いついているかは示せない。

Anthropicは、2026年7月13日から7月20日に使用されたすべての計算能力を調査した。ワークロードを複数のカテゴリーに分類し、AI研究用コンピュートのうちどの程度が安全性の取り組みを支えていたかを測定した。

同社は、AI研究開発に割り当てられたコンピュートの約6%が安全性に向けられていたとした。AIによるAI研究に限ると、安全性の割合は約12%に達した。

Anthropicは両方の数値を保守的な見積もりとしている。安全性と能力を等しく前進させる作業は、一般的なAI研究として計上された。個別の安全保護用分類器も、報告された安全性の割合から除外された。

同社は、ほぼ1万件の研究トレーニングおよび評価実行のうち約14%をサンプリングした。より多くのコンピュートを消費したワークロードに重みを置いたサンプルである。各実行を安全性またはその他の研究に割り当てる前に、分類器がメタデータとコードを検査した。

Anthropicによると、機械による分類は人間のレビュー担当者と1〜2パーセントポイント以内で一致した。一部のケースは、人間が数時間分析した後でも判断が難しかった。

この曖昧さは避けられない。安全性と能力に関する研究はしばしば重なるからだ。より優れた解釈可能性は危険なモデル行動を明らかにできる一方で、エンジニアによる性能改善にも役立つ。よりスケーラブルな監督はリスクを減らしながら、エージェント製品の展開を容易にする可能性がある。

分母は割合と同じくらい重要だ。大規模なフロンティアモデルのトレーニングは、多数の安全性実験よりはるかに多くの計算能力を消費する。安全性研究は、巨大なアクセラレータクラスタよりも、研究者の時間、評価設計、分析に依存することが多い。

安全性の割合が低下しても、安全性ツールの効率化を反映している可能性があり、投資の弱まりを意味するとは限らない。逆に、割合の上昇は、有用な保護をほとんど生まない高コストの実験による可能性がある。コンピュートが測るのは投入量であり、成果ではない。

1週間という期間には別の制約もある。Anthropicはコンピュートを動的に管理しているため、配分はトレーニング実行、製品需要、利用可能な能力に応じて変化する。単一週のデータでは、持続的な傾向を示すことはできない。

定期的な報告により、この指標はさらに有用になる。安定した四半期ごとの系列があれば、安全性コンピュートが自動化された研究、モデル訓練、社内エージェントの展開とともに増加しているかを示せる。

比較可能な報告には、共通の定義も必要となる。研究機関には、デュアルユースのプロジェクトを安全性業務として分類する誘因がある。Anthropicは、あるワークロードが安全性カテゴリーに属すると証明する責任は開発者側が負うべきだと主張している。

独立検証はラベルと総計を検査できるが、監査人には機密性の高いコードや実験メタデータへのアクセスが必要となる。政府または信頼できる評価者には、独自研究を保護する手続きも求められる。

Anthropicのスケーリングポリシーはすでに、より強力なモデル能力とより強力な安全対策を結び付けている。新たなコンピュート指標は、能力のしきい値を超える前に能力がどこへ向かうかを示す、リソース面からの視点を加える。

しかし、資源を配分していることは有効な統制を実証するものではない。意味のある試験は、安全性システムが失敗を特定し、敵対的な圧力に耐え、必要なときに展開を止められるかどうかである。

コンピュート配分は、より大きな証拠パッケージの一要素として最も有効に機能する。優先事項と傾向を明らかにできる一方、能力評価、インシデント、レッドチームの結果、監視性能は成果を示す。

次の試験は、報告が検証可能になるかどうかだ

Anthropicは有用なベースラインを公表したが、このフレームワークが重要になるのは、好ましい変化と同じように不都合な変化も反復測定によって明らかにできる場合に限られる。

最初に注目すべきシグナルは、次回のR&D Automation Indexの更新だ。レベル4の作業がさらに増加すれば、監督下にあるエージェントが完全な研究タスクの責任を担い始めているという見方を強めることになる。

その増加の構成が重要になる。デバッグやインフラストラクチャに集中した成長は、より深いエンジニアリング自動化を示す。仮説の創出、実験の選定、研究の優先順位付けでの成長は、より重大な変化を意味する。

安定したタスクバスケットも、傾向を解釈しやすくする。Anthropicがカテゴリー、重み、しきい値を変更する場合は、旧結果と改訂結果の双方を公表すべきだ。バージョン管理されたデータがなければ、方法論の変更が能力の進歩に見えてしまう可能性がある。

2つ目のシグナルは独立した再現だ。Anthropicは複数組織の評価者を組み込み、社内リスクチームと同等のアクセスを提供する計画だとしている。評価者が26%という数値を再現できるかどうかは、この指標が外部への説明責任を支えられるかを試すことになる。

検証では最終的な割合以上を調べるべきだ。評価者は、サンプリングされたタスク記録、自動化評価、ワークロードのカバレッジ、監視の再現率、コンピュート分類をテストする必要がある。また、危険性や独自性の高い詳細を明かすことなく、重要な制約を開示すべきだ。

エージェント監督の指標では、外部テストが特に重要になる。4万7,000件に1件の判断をブロックしているという事実は、システムが何を見逃しているかを推定する敵対的テストがなければ、ほとんど意味を持たない。

今後の報告では、既知の不正行為と新たに設計された攻撃に対する検知率を含めるべきだ。重大な案件がどれほど迅速に人間へ届くか、エスカレーション後にどのような措置が取られるかも説明すべきである。

3つ目のシグナルは、他の研究機関による採用だ。OpenAI、Google DeepMind、xAI、Metaなどによる比較可能な開示があれば、Anthropicのフレームワークは企業固有の物語ではなく、業界の手段となる。

競合他社に同一の社内プラットフォームは必要ない。しかし、監視対象の行動、レビューの遅延、エスカレーション、研究自動化、安全性関連コンピュートについての共通定義は必要だ。

研究機関間の差異が方法論上の弱点を明らかにするため、採用はフレームワークを強化する。参加を拒むことは、自主的な透明性が正式な要件に代わりうるという主張を弱める。

このフレームワークはAnthropic内部でも信頼性の試験に直面する。今後の報告には、監視が悪化した時期、安全性配分が低下した時期、自動化が運用上の問題を生んだ時期も含めなければならない。選択的な開示では、精査が最も重要になる局面でこそ、この取り組みの情報価値が下がる。

開発者にとって当面の教訓は、自律的な研究が到来したということではない。AIが今や、組織レベルの計測・監視を必要とするほど十分な社内作業を担っているということだ。

エンタープライズの買い手にとって、これらの指標はより良い調達上の問いを提示する。エージェントに永続的なIDがあるか、すべての行動が記録されるか、アラートがどれほど迅速に人へ届くか、外部のテスターが統制を検査できるかを問うことができる。

政策立案者にとって、このフレームワークは測定可能な入力を示す一方、ガバナンス上の問題は解決していない。報告を任意のままとするのか、標準化するのか、あるいは定められた閾値でより厳格な審査を発動するのかは、各政府が引き続き判断しなければならない。

AnthropicのAI開発メトリクスは、フロンティア研究所の一つがAIを用いてAIを構築する方法について、これまでで最も明確な公開スナップショットを提供している。同時に、その多くが社内定義、自動化された判断、限られた外部アクセスに依存していることも浮き彫りにしている。

今後数回の報告が、これが説明責任のための持続的なインフラになるのか、それとも一度限りの透明性向上の取り組みに終わるのかを左右するだろう。読者は、自動化の傾向、独立した検証、競合他社による採用の順で注視すべきだ。これらのシグナルは、監督が開発の速度に本当に追いついているかを示すことになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page