Anthropic Claudeの自己改善は加速しているが、行き先を選ぶのは依然として人間
Anthropicによると、Claudeは現在、同社のモデル研究開発の26%を主導している。2026年2月時点では、この仕事を一切主導していなかったという。この急上昇により、Anthropic Claudeの自己改善は単なる挑発的なスローガンではなくなった。同社は、人間による監督は続くものの、モデルが高レベルのプロンプトから大規模な業務を完遂できるとしている。
この開示は、よく知られたコーディングの潮流を、より重大な領域へと押し進めるものだ。Claudeはもはや、エンジニアのアプリケーション開発を支援するだけではない。将来のClaudeモデルを開発するためのインフラを構築し、実験を実行し、結果を分析し、変更をレビューする役割をますます担っている。
Anthropicはこれを、AIシステムがより高性能な後継システムの構築に貢献する「再帰的自己改善」への進展と呼ぶ。しかし、その根拠は残る障壁も示している。Claudeは定義された作業を迅速に実行する一方、どの問題が重要か、結果を信頼に値するとみなすかは、依然として人が決めている。
この違いにより、Anthropicの主張は二つの競合する解釈の間に位置付けられる。一方は、モデル世代ごとに加速する複利的な開発ループを描く。もう一方は、人間がなお管理する研究アジェンダの中で稼働する高度な自動化を描く。
Anthropic Claudeの自己改善、モデルR&Dにも拡大
重要な変化は、Claudeがコードを書くことではない。後継モデルを支える作業のかなりの部分を、Claudeが主導するようになったことだ。
Anthropicは2026年9月17日に、26%という数値を公表した。同社は「主導」を、人間の監督下でありながら、高レベルのプロンプトからタスクの大半を完了することと定義している。同社によれば、Claudeは2月時点で、測定対象となった研究開発作業を一切主導していなかった。
8月までに、その割合は約4分の1に達した。Anthropicはまた、現在ではモデル研究開発のおよそ90%にClaudeとの協働が関与しているとしている。このより広いカテゴリーでは、モデルは人間の密接な指示の下で、作業の大部分を完了する。
この二つの数値は、異なる委任レベルを測っている。90%という数値には、人が密接に関与し続ける作業が含まれる。26%という数値は、Claudeが目標を受け取った後、実行に対してより大きな責任を負う業務を対象としている。
この区別は重要だ。どちらの数値も、Claudeが独立して稼働していることを意味しない。モデルがAnthropicの企業目標を選んだり、自らの展開を承認したり、トレーニングプロセス全体を管理したりするわけではない。人間の研究者が依然として問題を設定し、リソースを配分し、結果を精査し、重大な意思決定を承認している。
それでも、報告された変化は異例の速さだ。最初の開示によれば、Claudeは6カ月以内に主導割合ゼロから26%へ移行した。注目を集めている理由は、現在の割合だけでなく、この軌跡にある。
Anthropicはフロンティアモデル開発を、エンジニアリングと研究に分けている。エンジニアリングには、ソフトウェアの作成、インフラの保守、トレーニングシステムの監督が含まれる。研究には、実験の選定、結果の解釈、どのアイデアをさらに検証すべきかの判断が含まれる。
Claudeは両方のカテゴリーに深く関与するようになった。エンジニアリング業務では、Anthropicによると、人々は実装の各手順を指定せずに目標を与えることが増えている。研究業務では、Claudeは明確に定義された実験を実行し、その後の行動を提案できる。
具体的な事例は、通常のコード補完と、委任されたエンジニアリングの違いを示している。定例のアップグレードにより、数万件のトレーニングジョブがクラッシュし始めていた。エンジニアはClaudeに、背景情報と影響を受けたクラスターへのアクセスを与えた。
Claudeは環境設定をテストし、見つけにくいデバッグフラグを特定し、障害を再現して修正を確認した。Anthropicによると、この調査には約2時間かかった。同社は、人間のエンジニアなら通常2日から3日を要すると見積もっている。
これは自律的なモデル作成ではない。それでも重要なのは、トレーニングインフラが研究所によるモデルの検証・改善の速さに直接影響するためだ。数日かかるデバッグを数時間に短縮すれば、研究者は実験を実行し、障害を修正する機会をより多く得られる。
したがって、同社の研究報告は、人間の役割が消失するのではなく、狭まっていることを説明している。Claudeは実装と実験をますます担うようになり、人間は方向付け、評価、リリースに関する判断権を保持する。
この境界線が中心的な緊張関係を定義する。AnthropicはAI開発内部で進む急速な自動化の証拠を示す一方、そのプロセスが自己主導的になるのを防ぐ人間の判断も記録している。
コーディングに関する数値が示す、Anthropicが警鐘を鳴らす理由
Claudeの貢献は、コード生成、レビュー、実験が互いを強化し始めると、より重大な意味を持つ。
2026年5月時点で、Anthropicによると、同社のコードベースにマージされたコードの80%以上をClaudeが作成した。Claude Codeが2025年2月にリサーチプレビューへ入る前は、この割合は一桁台前半にとどまっていた。
同社はエンジニアリングのアウトプットが大きく増えたことも報告している。2026年第2四半期、典型的なエンジニアは2024年の1日当たりと比べて8倍のコードをマージしていた。Anthropicは、この増加の大部分を、エンジニアがあらゆる変更を自ら入力するのではなく、Claudeを指示・レビューするようになったことに帰している。
コード行数は不完全な生産性指標である。コードが増えれば、保守コストの増加、既存機能の重複、不適切な設計の隠蔽につながる可能性がある。Anthropicは、8倍の増加が実際の生産性向上をほぼ確実に過大評価していることを明確に認めている。
しかし、出力量は同社の根拠の一部にすぎない。Anthropicによると、Claude Codeのセッション全体で介入率は低下している。エンジニアがモデルを修正、軌道修正、または引き継ぐ頻度は、1年前より少なくなったとされる。
Anthropicにおける最もオープンエンドなエンジニアリング業務では、Claudeの報告上の成功率は2026年5月に76%に達した。これは6カ月間で50ポイントの上昇に当たる。Claudeベースの評価器が、セッションが修正を必要とせず、割り当てられたタスクを完了したかを判定した。
この方法論には注意が必要だ。別のモデルを社内モデルが評価しても、独立した評価と同じ保証は得られない。タスク構成も時間とともに変化し得るため、月ごとの成功率比較は複雑になる。
それでもAnthropicは、2026年中に社内でClaudeが書いたコードの品質が人間によるコードに近づいたと報告している。スタッフの見解は一致していなかった。同社によれば、2025年後半にはClaudeのコードを劣るとみなす従業員が多かったが、2026年半ばまでには概ね同等とみなされるようになった。
自動レビューは、このループにもう一層を加える。Anthropicは現在、Claudeを使って、提案されたコード変更に欠陥やセキュリティ上の弱点がないかを調べている。会社による回顧的分析では、こうしたレビューによって、過去の本番障害の原因となったバグの約3分の1を検出できたはずだとされた。
これにより、開発サイクルの両側にAIが存在することになる。あるClaudeセッションがコードを書いたり変更したりし、別のセッションが提案された変更をレビューする。人間は結果を検討し、本番環境に入れるべきかを判断し、自動チェックの結論が食い違うケースを調査する。
このパターンはプログラミングを超えて広がっている。Anthropicは、小規模なAIシステムをトレーニングするコードに関する最適化タスクでモデルをテストした。目標は、あらかじめ定めた正確性チェックに失敗せず、速度を改善することだった。
Anthropicによると、Claude Opus 4は2025年5月に平均3倍の高速化を実現した。Mythos Previewと呼ばれる社内モデルは、2026年4月までに約52倍の高速化を達成した。同社によれば、熟練した人間の研究者は通常、4倍の改善に4時間から8時間を要した。
こうした数値は、Anthropicがこの傾向を単なる自動化ではなく加速として捉える理由を示す。実装が速くなれば、実験をより多く実施できる。実験が増えれば追加の証拠が生まれ、その証拠は後続のモデルやツールの設計を導くことができる。
これらの主張における主な情報源は、依然として同社自身のデータだ。外部監査者は、社内のタスク分類、成功判定、生産性計算を再現していない。読者は報告された傾向を、独立して確立された進歩の法則ではなく、有意な証拠として扱うべきだ。
この制約があっても、その方向性を退けるのは難しい。Claudeは、コード断片の提案から、リポジトリの編集、ツールの操作、稼働中システムのデバッグ、実験ループの実行へと移行した。それぞれの段階で、AI開発の新たな部分が手作業による実行から監督付きの委任へ移されている。
真のボトルネックは、実行から判断へと移っている
Claudeは研究を実行するコストを下げているが、どの研究を行うべきかを決める必要性まではなくしていない。
Anthropicの最も強い根拠は実行に関するものだ。Claudeに測定可能な目標、関連ツールへのアクセス、結果を検証する手段を与えれば、モデルは多くの可能な解決策を探索できる。これにより、研究の実装はより高速な反復プロセスになる。
より難しい問題は方向付けである。研究者は、能力を前進させ、安全性を高め、あるいは重要な不確実性を解消する問いを選ばなければならない。また、誤解を招くベンチマーク、汚染された評価、狭い条件下でしか機能しない解決策を見抜く必要もある。
Anthropicは、研究における「センス」を継続的な人間の優位性として説明している。これには、価値ある問題の選定、どの証拠が信頼できるかの判断、行き詰まったアプローチを見切ることが含まれる。こうした選択が開発プロセス全体を形作る。
同社は、Claudeが現実的な調査において、より良い次の手順を提案できるかをテストした。研究者は、以前の作業中に人間が非生産的な回り道をしていた129の時点を選んだ。その後、異なるClaudeモデルが次に何をすべきかを提案した。
別のClaudeモデルが、それらの提案と最終的な結果を比較した。AnthropicのOpus 4.5は、2025年11月にケースの51%で元の人間の選択を上回ったと報告されている。Mythos Previewは2026年4月に64%に達した。
この結果は戦術的判断の改善を示唆するが、独立した研究リーダーシップを確立するものではない。Anthropicは、元の人間の判断に改善の余地があった時点を意図的に選んだ。完了済みセッションにアクセスできるモデルも、評価器として機能した。
したがって、この実験はClaudeが選ばれた意思決定ポイントをどのように進められるかを測るものである。Claudeが研究プログラムを定義できること、より広い影響を認識できること、あるいは新しいモデルをいつ展開すべきかを判断できることは示していない。
別のプロジェクトでは、AI安全性研究におけるより広範な自律性をテストした。複数のClaudeエージェントが、弱いモデルがより強いモデルを監督できるかを調査した。エージェントは仮説を立て、実験を実行し、知見を共有し、アプローチを調整した。
Anthropicによると、人間の研究者2人は約1週間で、弱い監督と強い監督の差の約23%を埋めた。エージェントは、累計800時間の作業と大量の計算リソースを通じて97%を回復した。
ただし、同社は重要な制約を指摘している。人間が問いを選び、スコアリングシステムを設計した。その結果は、本番規模のモデルにはきれいに移行しなかった。こうした留保が、印象的な実験ループと自律的な科学的発見とを分けている。
同じパターンは、日常的なClaude Codeの利用にも見られる。Anthropicの利用分析によると、典型的なセッションではユーザーが計画に関する意思決定のおよそ70%を行う一方、Claudeは実行に関する意思決定のおよそ80%を担う。
この分担は、「AIが自らを構築する」という表現よりも実態を明確に説明している。何を起こすべきかを決めるのは、一般に人間である。Claudeは指示をどう実行するかをますます判断するようになっており、その過程では長い連鎖にわたるファイル読み込み、コード編集、テスト、コマンド実行を伴うこともある。
もっともらしいが誤った結果を見抜く人が必要であるため、ドメインの専門知識は依然として重要だ。会計士は会計ルールを理解することで、照合スクリプトを適切に指示できる。インフラエンジニアは、提案された修正が許容できない運用リスクを生むかどうかを判断できる。
実行コストが下がるほど、判断の価値は高まる。研究者はより多くの実験を監督できるようになるが、同時に評価すべき出力も増える。ボトルネックは消えるのではなく、移動する。
この変化は、技術チームの仕事の組織化にも影響する。コードを書くことは職務に占める割合が小さくなり、仕様策定、レビュー、システム設計、検証、説明責任の比重が大きくなる。
Anthropic自身の採用評価でも、この移行は見られている。同社によれば、Claudeが従来型のコーディングテストを解ける場合でも、パフォーマンスエンジニアは難しいデバッグや設計判断を引き続き担っている。評価結果は、AIが機械的な部分を完了できるようになると、代表的な評価がより難しくなることを示している。
実務上の課題は、人が直接実装する機会が減る中で専門性を維持することにある。レビュアーには、隠れたエラーを発見できるだけの理解が必要だ。しかし、恒常的な委任は、その理解を育む実践的な経験を減らす可能性がある。
これが、Anthropic Claudeの自己改善における未解決の人間的側面だ。より高速なモデルは、各研究者が監督できる範囲を拡大しうる。一方で、研究システムを個人が完全に理解することはさらに難しくなる可能性もある。
Anthropicの主張は、すべてのフロンティアAIラボに圧力をかける
Anthropicの測定が方向性として正しいなら、競合ラボは加速そのものだけでなく、その周辺の透明性も両立させなければならない。
OpenAI、Google DeepMind、Metaなどのフロンティア開発企業は、社内でAIコーディングツールを利用している。正確な手法や委任の度合いは異なるが、いずれも同じ競争上のインセンティブに直面している。より有用な実験を行えるラボは、モデルをより速く改善できる。
報告されたClaudeの貢献は、Anthropicに潜在的なフィードバック上の優位性をもたらす。より優れたモデルは、より多くのエンジニアリング作業を実行する。その作業がインフラと実験を改善し、次のモデルの開発を支える。
このプロセスは、競争上の意味を持つために完全な自律性を必要としない。人間の研究者が目標を選び続けながら、AIが実行能力を増幅できる。Anthropicは、完全に閉じた自己改善ループがなくても、これを複利的な加速と呼んでいる。
この力学は、競合他社にエージェントのより積極的な導入を迫る。別の企業がより多くのアイデアを検証し、インフラをより速く修復し、モデル世代間の時間を短縮できる状況では、完全な信頼性を待つことには機会費用が伴う。
この競争はガバナンス上の問題を生む。各ラボは、モデル開発のどの程度が自動化されているかを示す内部証拠を管理している。外部の人々は、「協働」「主導」「タスク成功」「コード品質」「研究者の生産性」を企業間で容易に比較できない。
Anthropicは、他の開発企業に比較可能な測定結果の公表を求めている。共通の手法があれば、ラボが再帰的自己改善にどれほど近づいているかを一般の人々が理解しやすくなると同社は主張する。定期的な報告は、現在の成長曲線が継続しているのか、あるいは鈍化しているのかを明らかにすることもできる。
報じられた発表は、Anthropicの幹部らがフロンティア開発の減速も求めていた時期に行われた。この組み合わせには、避けがたい矛盾がある。
AnthropicはClaudeで自社の研究を加速させながら、その加速が制御困難になる可能性を警告している。競争圧力は、同社が単にこの技術の利用を停止しない理由を説明する一助となる。
一方的な自制は、分野全体を減速させることなく、慎重なラボだけを後れに取らせる可能性がある。協調的な基準はこの不利を軽減できるかもしれないが、経済的・戦略的利益が異なる企業や政府間の合意を必要とする。
したがって、この情報開示には複数の目的がある。公衆に情報を提供し、Anthropicの安全性に関する主張を強化し、Claudeの能力を宣伝することだ。これらの目的は共存しうるが、読者はそれぞれを認識すべきだ。
競合他社にも、Anthropicの枠組みに異議を唱える理由がある。AIが作成したコードの比率が高いことは、モデルの知能を直接測るものではない。コード量からは、Claudeが価値ある研究アイデアを生み出したのか、詳細な仕様を実装しただけなのかはほとんど分からない。
ラボごとに作業の分類も異なりうる。ある企業はエージェント主導のデバッグセッションを研究の主導と分類するかもしれない。別の企業は、同じタスクを人間の研究者が使ったエンジニアリングツールとして数えるかもしれない。
共通の測定基準では、計画、実行、検証、承認を分ける必要がある。また、独立した監査も必要になる。こうした統制がなければ、企業は比較不能なまま印象的な比率を公表できてしまう。
より広い圧力は、モデル研究ラボの外にも及ぶ。エンタープライズのエンジニアリング責任者は、Anthropicの社内ワークフローが自社にも当てはまるのかを問うだろう。多くの企業が、コーディングエージェントをリポジトリ、テスト、デプロイツール、運用データに接続する類似のシステムを追求するだろう。
答えは検証の質に左右される。Anthropicはモデルを開発し、異例の失敗をレビューできる専門家を雇用している。同等の専門性を持たない企業は、コードを評価する能力を改善するより速いペースで、コード生成を自動化してしまう可能性がある。
したがって、AI生成の出力は組織間の差を広げる可能性がある。強力なテスト、文書化、可観測性、レビュー慣行を持つチームは、より安全に委任できる。基盤が弱いチームは、より速い速度でエラーを生み出すリスクを抱える。
検索可能な組織的コンテキストが重要なのもこのためだ。エージェントには、要件、過去の意思決定、技術的制約へのアクセスが必要である。整備されたAIナレッジベースは、委任された作業に関する推論を人々が確認する助けになりうるが、技術的な検証の代わりにはならない。
エンタープライズの購入者にとって、Anthropicの発表はすべてを自動化せよという指示ではない。AI支援開発が、個別の提案から監督されたワークフローへ移行している証拠である。競争上の問いは、組織がどれだけ委任できるかではなく、どれだけの責任を検証できるかに関わる。
Anthropicの数字が依然として証明していないこと
Anthropicは急速に拡大する支援を示したが、モデルが後継モデルを独立して設計、訓練、承認できることは示していない。
「自らを構築する」という表現は、いくつかの異なる活動を一つに圧縮している。アプリケーションコードを書くことは、モデルアーキテクチャを選定することとは異なる。実験を実行することは、その結果が大規模な訓練投資を支持するかどうかを判断することとは異なる。
Anthropicによると、Claudeはその範囲全体で有意義な作業を行っている。しかし、目標、評価基準、インフラへのアクセス、リリース権限を提供しているのは依然として人間だ。こうした統制により、現在のプロセスは完全な再帰的自己改善には該当しない。
測定の質も懸念点である。中心的な数値の多くはAnthropicの内部システムに由来する。同社がタスク分類を作成し、セッションを収集し、多くの結果をClaudeベースの評価者で判定した。
モデル評価者は大規模なデータセットを一貫して処理できるが、評価対象のシステムから盲点を受け継ぐことがある。テストに合格したためセッションは成功に見えるかもしれないが、テスト範囲外で保守性、セキュリティ、アーキテクチャ上の問題を持ち込んでいる可能性がある。
コードの著者性も同様に曖昧だ。Claudeは、広範な人間の計画の後にファイル全体を生成するかもしれない。あるいは、研究者が短い目標だけを示し、モデルが実装を決定することもある。どちらのファイルもAI作成として数えられるが、独立性の水準は異なる。
8倍という出力量も、検証済みの経済的価値ではなく、マージされたコードを測定している。より多くのコードを生成するエンジニアは、より多くの問題を解決するかもしれない。同じエンジニアが、より多くのレビュー作業や、保守コストが高くなる大規模なシステムを生み出す可能性もある。
独立した研究は、Anthropicの内部主張を解決することなく、有用な文脈を提供する。2026年のあるワーキングペーパーは、Claudeとの共同作成による780万件のコミットと、5,838人の開発者パネルを調査した。この研究は、導入がより多くのリポジトリや技術にまたがる作業と関連しているとした。
その開発者研究は、コーディングエージェントが人々の取り組むタスクの範囲を広げうることを示唆している。ただし、公開GitHub上の活動はAnthropicの内部モデル研究を測定するものではなく、再帰的改善を証明するものでもない。
信頼性もタスクによって異なる。明確なテストを持つ構造化された問題は、自動化された反復に適している。自由度の高い研究課題には客観的な評価基準が欠けることが多く、もっともらしいが弱い結論がより長く残る可能性がある。
計算資源と物理インフラも追加の制約となる。高速なエージェントはより多くの実験を提案・実行できるが、フロンティアモデルの訓練にはチップ、エネルギー、ネットワーク容量、慎重に管理されたデータが必要だ。知能だけが希少な資源ではない。
出力が増えるにつれ、人間によるレビューがボトルネックになる可能性がある。Claudeが専門家による検査より速く変更を生成するなら、Anthropicはデプロイを遅らせるか、自動評価への依存をより強める必要がある。
これは循環的な検証問題を生む。Claudeがコードを書き、別のClaudeがそれをレビューし、Claudeベースのシステムがタスクの成功を判定する。人間の専門家は最終的な安全網であり続けるが、自動化の連鎖が長くなるほど、その可視性は低下しうる。
セキュリティはこの問題の重要性を高める。リポジトリ、クラスタ、コマンドへのアクセスを持つエージェントは、難しい運用上の問題を解決できる。同じアクセスは、誤った推論、侵害されたコンテキスト、操作された指示がもたらす影響も大きくする。
類似のワークフローを導入する組織には、限定的な権限、完全なログ、再現可能なテスト、明確なエスカレーション経路が必要である。また、誰がコードを生成したかにかかわらず、本番環境の変更に責任を持ち続ける人も必要だ。
Anthropic自身は、Claudeが自律性の閾値を超えたとは主張していない。より擁護可能な主張は、その距離が縮まっているというものだ。エンジニアリングの実行は高度に自動化されつつある一方、研究上の判断は初期段階ながら限定的な改善を示している。
この主張は、誇張がなくても十分に重要だ。AI開発の速度と経済性を変えるために、システムが独立した科学者になる必要はない。
ループが本当に閉じつつあるかを示す3つのシグナル
次の段階は、研究の主導、独立した検証、重要な意思決定に対する人間の統制における測定可能な変化に左右される。
第一のシグナルは、モデル研究開発の主導にClaudeが占める割合だ。Anthropicは、これが2026年2月のゼロから同年8月には26%へ上昇したと報告した。今後の開示では、その曲線が継続するのか、横ばいになるのか、反転するのかを示すべきである。
タスクの仕様がより曖昧になる中でも上昇が続けば、とりわけ複利的加速の見方を強めるだろう。横ばいであれば、実装能力の改善が研究上の判断を上回ったことを示唆する。低下すれば、測定方法の変更、より難しい課題、あるいは信頼性の問題を示している可能性がある。
リーダーシップの定義は一貫していなければならない。そうでなければ、より高い割合は自律性の向上ではなく、業務の再分類を反映している可能性がある。Anthropicは、エンジニアリング、実験、解釈、戦略的計画にまたがる事例を公開すべきだ。
第二のシグナルは、独立した再現検証である。外部の評価者は、機密性の高いモデル開発上の秘密を受け取ることなく、代表的なタスク、採点基準、結果にアクセスできる必要がある。研究所をまたいだ比較可能なテストは、個別企業が示す割合よりも有益だろう。
再現検証では、タスク完了だけでなく、時間の経過に伴うコード品質も調べるべきである。欠陥、セキュリティ上の問題、保守負荷、人間の介入頻度を測定する必要がある。研究タスクでは、エージェントが最終的な結果を見る前に、生産的な方向性を選べるかを検証すべきだ。
独立した証拠は、Anthropicの説明を補強するか、あるいは弱めることになる。異なる評価者や環境で類似した結果が得られれば、広範な能力転換という主張を支持する。一方で大きな差があれば、報告された性能の多くは社内ワークフローや評価上の選択に左右されていることが示される。
第三のシグナルは、成果量が増えるなかでAnthropicが人間による監督をどう扱うかである。同社はすでに、レビューが潜在的なボトルネックになり得ると指摘している。その対応は、人間が実質的な統制を維持するのか、それとも自動要約を通じて意思決定を承認する場面が増えていくのかを明らかにするだろう。
レビュー要件、アクセス制御、デプロイ手順、インシデント報告の変化に注目したい。また、Claudeが研究目標を単に実装するだけでなく、自ら選び始めるかどうかも見極める必要がある。
真にループが閉じるには、コード作成比率が上がるだけでは足りない。Claudeは、価値ある研究の方向性を提案し、信頼できる評価を設計し、曖昧な証拠を解釈し、限定的な人間の支援で後継モデルを改善できる必要がある。
それでも、権限付与は能力とは別の問題である。モデルがより多くの研究を主導できる技術的能力を持つようになっても、Anthropicが意図的に人間の承認を維持する可能性はある。潜在的な自律性が運用上の自律性へと変わるかどうかは、ガバナンス上の選択によって決まる。
開発者にとって、当面の教訓は実践的だ。コーディングは、仕様策定、オーケストレーション、テスト、レビューへと重心を移している。システムを深く理解するエンジニアは、エージェントの自信に満ちた出力が誤っている場面を見抜きながら、より多くを委任できる。
エンタープライズの購入担当者は、ベンダーが自律的な作業を主張する際、何を測定しているのかを問うべきだ。完了率だけでは不十分である。購入者には、監督、差し戻し、欠陥、監査可能性、失敗後の責任に関する証拠が必要だ。
ナレッジワーカーも同様の転換に直面している。AIはより多くの実行を担えるようになるが、人間には依然として信頼できる文脈と重要な意思決定の記録が必要である。knowledge blendingのためのツールは、単に別の回答を生成するのではなく、ユーザーが証拠をたどれるよう支援するときに役立つ。
したがって、Anthropic Claudeの自己改善は、限定的ではあるものの重大な意味を持つ現実である。Claudeはすでに、後続のClaudeモデルを生み出すエンジニアリングと実験の作業を加速している。同社は、後継モデルを独力で構築する自律システムを示してはいない。
この二つの記述の隔たりにこそ、次の章が展開される。リーダーシップの割合を追跡し、独立した検証を求め、誰がなお不可逆的な決定を下しているのかを検証すべきだ。この三つのシグナルが同時に動けば、「AIがAIを構築する」は見出しではなく、運用システムを表す言葉になる。
すべての組織にとっての問いは、もはやAIがより多くの仕事を生み出せるかどうかではない。人々がその仕事を検証できるか、それに異議を唱えるために必要な専門性を維持できるか、そして自動化された連鎖が拡大しても説明責任を担い続けられるかどうかである。



