Anthropicのサイバー検証プログラム、アクセスを拡大する一方でClaudeの主要な安全策を解除
Anthropicは、通常の安全策が解除された場合に複雑な攻撃的サイバーセキュリティ作業を完遂できる能力を持つにもかかわらず、3つの高度なClaudeモデルへのアクセスを拡大した。Anthropic Cyber Verification Programは現在、Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1、および将来のモデルを対象としている。承認された組織は、通常のClaudeユーザーにはブロックされる作業にこれらのモデルを利用できる。
この変更により、Anthropicが一般提供から意図的に制限してきたAI能力への、管理された経路が開かれる。セキュリティチームは、マルウェアの調査、脆弱性の発見、許可されたペネトレーションテストを実施できる。より限定されたグループは、電力網、航空運航、通信、銀行、政府サービスに関わるシステムをテストできる。
これは単なる製品アクセスの発表ではない。Anthropicは、本人確認、組織的な統制、監視、政府審査によって、モデル体験に組み込まれた制限を置き換えられるかを検証している。OpenAIも高度なサイバーモデルに対する段階的アクセスを進めており、米国当局は最先端システムを誰が利用できるかの判断でより大きな役割を担うようになっている。
中心的な問いは、AIがサイバー防御担当者を支援できるかどうかではなくなっている。Anthropicによれば、以前のパートナーはClaudeモデルと関連するスキャン作業によって、13万4,000件を超える検証済み脆弱性を発見した。より難しい問題は、プロバイダーが、攻撃者に最終的に悪用される特権的な経路を生み出さずに、安全策を選択的に解除できるかどうかだ。
Anthropic Cyber Verification Program、3段階のアクセスレベルを導入
Anthropicは、広範な一つの安全境界を、段階的に許容範囲が広がる3つのアクセスレベルに置き換えている。
拡大された検証プログラムでは、承認ユーザーをDefense Access、Red Team Access、Specialized Accessに分けている。各レベルで許可される行為の範囲と適格性要件は異なる。
Defense Accessは、インシデント対応、セキュリティ運用、マルウェア分析、脆弱性の検証、防御的研究などの作業を支援する。適格な申請者には、企業、大学、非営利団体、政府機関、オープンソースのメンテナー、信頼できる開示実績を持つ個人研究者が含まれる。
このプログラムには、規模の異なる重要インフラ事業者も含まれる。Anthropicは地域病院や自治体の公益事業者などの組織を具体的に挙げている。同社は、多くの正当な防御チームが適格になると見込んでおり、こうした申請には数日以内に回答することを目指すとしている。
Red Team Accessはさらに踏み込む。組織が所有する、またはテストの許可を得たシステムに対する、認可済みのペネトレーションテストや敵対的演習を認める。社内レッドチーム、政府チーム、セキュリティコンサルタント、ペネトレーションテスト企業が申請できる。
このレベルの組織は、追加の適格性確認とセキュリティ統制を満たさなければならない。Anthropicは審査に数週間かかると見込んでいる。同社がより許容範囲の広いティアへの申請を検討している間、申請者はDefense Accessを受けられる場合がある。
Red Team Accessにも制限はある。Claudeは、物理的被害や広範な混乱に結び付く行為をブロックすべきとされる。Anthropicは制限対象の活動として、ランサムウェアの展開、物理システムへの損害、高リスクな安全システムのテストを挙げている。
Specialized Accessでは、サイバー関連の制限の大部分が解除される。これは、障害が人命を危険にさらしたり主要市場を混乱させたりする可能性のあるシステムをテストする権限を持つ組織向けに限定される。
対象には、航空運航システム、電力網、通信ネットワーク、銀行間送金インフラ、政府の行政システムが含まれる。Anthropicは、Specialized Accessの各組織を米国政府とともに詳細に審査するとしている。
既存のProject Glasswingメンバーは、現行モデルについて新たな承認を求めることなく、このレベルへ移行する。Project Glasswingは、選定されたインフラ事業者とセキュリティ組織に、同社の最も強力なサイバー能力へのアクセスを提供するAnthropicの管理された取り組みだ。
したがって、このプログラムは、検証済みのメールアドレスや標準的なエンタープライズ契約だけに依存するものではない。モデルへのアクセスを、申請者の身元、組織上の役割、テスト権限、技術的統制、意図する対象に結び付けている。
組織は監視条件にも同意する必要がある。Anthropicは一般に、悪用の可能性を検知できるようデータ保持を求める。ゼロデータ保持の取り決めでFable 5.1またはMythos 5.1を利用している既存ユーザーは、プログラム参加後も一時的にその保護を維持できる。
AnthropicはEnterprise Frontier Safeguardsという別の選択肢も計画している。同社によれば、このシステムは悪用防止策と、参加組織が管理するクラウドストレージを組み合わせる。それが提供されるまでは、機密コードやインシデントの証拠を扱うチームにとって、データガバナンスは依然として重要なトレードオフとなる。
最も重要な区別は認可である。同じ技術的な行為でも、対象と実行者の権限次第で、防御的な検証にも違法な侵入にもなり得る。このプログラムは、Claudeの制限を緩和する前にその文脈を確立しようとしている。
この設計が記事の中心的な緊張を生む。Anthropicは、高リスクなサイバー行為が誰にとっても安全になったとは主張していない。検証済みの組織であれば、管理されたアクセスシステムの下でより強力な能力を利用できる、という主張だ。
Claudeのサイバー能力はすでに成果を生んでいる
この拡大は、高度なClaudeモデルが数か月分の脆弱性作業をはるかに短い調査に圧縮できることを示す証拠に続くものだ。
Anthropicによれば、Project Glasswingのパートナーは2026年4月から7月にかけて、少なくとも12万9,000件の検証済みソフトウェア脆弱性を発見した。別途実施したオープンソースのスキャン作業では、4月から10月にかけてさらに5,500件の検証済み脆弱性が特定された。
その発見のうち3万3,000件以上は、重大または高深刻度の評価を受けた。同社によれば、数値には33社のパートナーからの報告しか含まれていないため、合計はプログラムの効果を過小評価している可能性が高い。
このデータには重要な制約もある。参加者は、発見を確認し分類するために異なる手法を用いた。脆弱性が修正済みかどうかを開示したのは半数未満であり、修正作業が進行中であることがその理由となる場合が多かった。
脆弱性を見つけることは、修正することと同義ではない。セキュリティチームは問題を再現し、深刻度を評価し、影響を受けるソフトウェアを特定し、メンテナーに通知し、パッチを作成し、修正をテストし、安全に展開しなければならない。
モデルは発見を加速できる一方で、その後の段階の管理をより難しくする可能性がある。自動化システムが人間による検証より速く発見を生み出すなら、セキュリティチームはより大きなトリアージ待ち行列と、未解決の露出が続くより長い期間に直面する。
Anthropicは、以前のGlasswing拡大の際にこのボトルネックを認めていた。同社は、検証、開示、パッチ適用が、初期の脆弱性発見よりも制約になっていると述べた。
この圧力は、より広範なアクセスプログラムを説明する一助となる。小規模で中央管理されたグループでは、すべての病院ネットワーク、オープンソースパッケージ、決済システム、公益事業プラットフォーム、政府アプリケーションを調査することはできない。運用者は自らの環境を理解し、現実的なテストを認可できるため、直接アクセスを必要とする。
潜在的な利点はソフトウェアスキャンにとどまらない。高度なモデルは、攻撃経路を再構築し、不慣れなマルウェアを分析し、可能性のあるパッチを生成し、防御側がシステムを変更した後にテストを繰り返すことができる。
Pacific Northwest National Laboratoryとの協業は、その仕組みを示している。研究者らは、Claudeがネットワーク環境内で管理された行動を取れるようにする、一連のツールと指示、すなわちエージェントスキャフォールドを作成した。
チームはこれを用いて、水処理施設のサイバー物理モデルに対する攻撃をエミュレートした。Anthropicのインフラ研究によれば、このシステムは数週間ではなく3時間で攻撃を再構築した。
このテストでは、旧世代のClaude Sonnet 4が使われた。ある実行では、Windows User Account Controlを回避するために用意された手法が失敗した。Claudeはその失敗を検出し、シミュレーションされた攻撃を続行するため、別の既知の手法を選択した。
現実の環境は文書化された手順どおりに振る舞うことがほとんどないため、この適応力は防御側にとって価値がある。同時に、それがアクセスを危険にする理由でもある。失敗した手順から立て直せるモデルは、攻撃者が静的な指示を超えて行動する助けにもなり得る。
新たなプログラムは、正当なチームにその行動を再現するための十分な自由を与えることを目指している。基本的なコードレビューとパッチ適用は、広く利用可能なClaudeモデルを通じて引き続き利用できる。より対話的で多段階の作業には、実際の侵入活動に似ているため検証が必要となる。
この境界の定義は引き続き難しい。脆弱性分析は多くの場合、無害なコード検査として始まり、エクスプロイトチェーンへと発展する。インシデント対応者は、攻撃者の手法を遮断する前に再現する必要があるかもしれない。
Anthropicの答えは、すべてのリクエストをテキストだけで判断するのではなく、実行者と対象を評価することだ。この転換により、身元、ガバナンス、法的認可は、モデルレベルのフィルタリングと並ぶ中核的な安全メカニズムとなる。
サイバー安全策の解除はClaudeが完遂できる作業を変える
Anthropic自身のテストは、アクセスティアが単に不便さを減らすだけでなく、Claudeが攻撃的な作戦を完遂できるかを左右することを示している。
同社は、現実的な制約下で多段階のサイバー作戦を計画・実行するためのベンチマークであるCyScenarioBenchを用いて、Claude Opus 5.5を評価した。各アクセスレベルにおける10の課題について、それぞれ5回の試行を実施した。
プログラムアクセスなしでは、Claudeは最初のプロンプトですべてのタスクをブロックした。そのため、一般提供される体験では、実行者が善意の意図を持っているかどうかにかかわらず、評価を先へ進めることができなかった。
Defense Accessではわずかに多くの活動が可能になったが、安全策は依然として50回の試行のうち46回を完了前に停止させた。成功したタスクは4件だった。この挙動は、完全な攻撃シミュレーションではなく、調査、対応、脆弱性作業向けに設計されたティアと整合する。
Red Team Accessでは異なる結果となった。安全策によるブロックは発生せず、Claudeは50回の試行のうち34回を完遂した。68%の完了率は、安全策なしで達成した67.6%の結果と実質的に同一だった。
これらの数値は、Anthropicが何を提供しているのかを明確にする。承認済みのレッドチームは、リクエスト上限が大きくなった標準的なClaude体験を受け取るのではない。この評価において、制限のない性能に近いモデル挙動へのアクセスを得るのである。
Specialized Accessは、さらに進んで安全性に敏感なシステムの認可済みテストを許可する。失敗したテストが物理的な運用、公共サービス、金融市場に影響を及ぼしかねないため、通常のレッドチームアクセスでも制限が残る場面を想定している。
この構造は計算されたトレードオフである。強力で普遍的なフィルターは悪用から守ることができるが、防御側が耐えなければならない攻撃を訓練することも妨げ得る。これらのフィルターを広く解除すれば、両方のグループに対するアクセスが増加する。
Anthropicは、組織的な検証によって差別化できると見込んでいる。防衛用途のユーザーは広範な適格性を得る一方、継続的な制限を受ける。レッドチームはより深い審査を受けるが、ブロックは少ない。少数の組織は、政府との共同審査を通じて専門的なアクセスを得る。
安全性分類器は依然としてこのシステムの中核だ。分類器は、禁止された行為について要求や応答を評価する独立したモデルまたは制御レイヤーである。基盤となるClaudeモデルに継続可能な能力があっても、対話を中断できる。
Anthropicは、これらの制御がサイバー関連の要求を、明確に禁止された活動、高リスクのデュアルユース作業、低リスクのデュアルユース作業、通常の防御タスクなどのカテゴリーに分類する仕組みを説明している。同社が公開した分類器フレームワークも、悪意ある運用者と防御側の運用者がほぼ同一の技法を用いる場合があることを認めている。
この曖昧さにより、自動フィルターがプロンプトから推測できる範囲は限られる。永続化の確立、認証情報の抽出、検知回避を求める要求は、対象と認可に関する信頼できる情報がなければ危険に見える。
検証プログラムは、セッションが始まる前に欠けている文脈を提供する。ユーザーを、承認済み組織、アクセスレベル、契約上の義務、監視、許可されたシステムの定義済み範囲に結び付ける。
ただし、検証によって技術的リスクがなくなるわけではない。アカウントは侵害されうる。従業員は権限を逸脱しうる。請負業者は、権限が速やかに変更されないままアクセスを失う可能性がある。認可済みのインフラが未承認のシステムに接続する場合もある。
監視は不審な利用を検出できるが、検出はモデルが有用な攻撃経路を生成した後になる場合がある。レート制限と対象の制御は露出を狭められるものの、熟練した運用者はしばしば複数のツールやアカウントに作業を分散させる。
ベンチマークも、構造化されたシナリオのサンプルのみを評価している。68%の完了率は、未知のソフトウェア、独自の産業機器、ソーシャルエンジニアリングを含む連鎖的な攻撃においてClaudeがどのように振る舞うかを示すものではない。
Anthropicの根拠が支持する結論は、より限定的だ。アクセス制御は階層ごとに意味のある行動差を生み出せる。また、制限が緩和されれば、高度なClaudeモデルは多くのサイバータスクを完了できる。
こうした制御が大規模運用でも信頼性を維持するかどうかは、まだ示されていない。この問いは、申請者の母集団が当初のGlasswingコホートを超えて拡大するほど重要になる。
政府審査はセキュリティを加え、権限を集中させる
米国政府は、最先端のサイバーモデルにおけるアクセス制御システムの一部となりつつあり、単なる外部規制当局ではなくなっている。
Anthropicによれば、同社はすべてのSpecialized Access組織を審査する際に政府と協力している。この取り決めにより、公的機関の担当者は、どの組織が飛行システム、電力網、銀行インフラ、その他の機微な対象に対してClaudeを利用できるかを決める役割を担う。
この連携には実務上の合理性がある。政府機関は、機密の脅威、国家インフラ、輸出規制、規制対象システムへの攻撃がもたらす運用上の影響を理解している。また、民間のモデル提供者だけでは評価できない法的権限を確認することもできる。
最近の出来事は、この関係がどこまで進展したかを示している。報道によれば、Anthropicは米国情報機関と協力し、Mythosモデルを機密指定された政府システムに対してテストした。
AP通信に語った当局者は、このモデルが数時間以内に一部の脆弱性を特定したと述べた。その当局者は、弱点を特定したことは、Mythosが同じ期間内にそれを悪用したことを意味しないと強調した。
マーク・ワーナー上院議員は、6月の公聴会でこの結果をより劇的に表現した。同氏は、国家安全保障局と米サイバー軍のトップによる説明として、このシステムが数時間以内に試験対象となった機密環境のほぼすべてに侵入したと述べた。
NSAとAnthropicは、機密テストの詳細を確認することを拒んだ。公表されている説明の隔たりは、広範な主張を慎重に扱うべき理由となる。
政府の関与は対立も生んでいる。6月、トランプ政権は最先端モデルの公開を国家安全保障審査の対象とし、一部のAnthropicシステムへのアクセスを制限した。
Anthropicは、外国籍者のアクセスに関する指令を受け、Fable 5とMythos 5を一時的に撤回した。その後、政府は一部のサイバー防御担当者とインフラ提供者に対する限定的なMythosの展開を承認した。
OpenAIもGPT-5.6 Solについて同様の審査を受けた。両社は当初、最新システムを少数のグループに限定し、商用AIモデルへのアクセスを国家安全保障政策の問題へと変えた。
支持者は、並外れて高い能力を持つサイバーシステムには、並外れて慎重な公開プロセスが必要だと主張できる。モデル提供者は情報機関が把握する脅威を完全には見通せず、政府も関係するすべての最先端モデルを独力で開発することはできない。
批判者は、説明責任がより弱い仕組みだと見る。ロリ・トラハン下院議員は、明確な法律、手続き、監督体制がないまま、政治任用者が企業ごとに誰へアクセスを与えるか決めていると主張した。
この批判は、拡大されたAnthropic Cyber Verification Programにも当てはまる。政府の関与は機微な対象に対する審査を改善しうるが、その基準が完全には公開されていないプロセスに権限を集中させることにもなる。
米国外の組織には別の懸念がある。Anthropicは以前、Glasswingを15カ国以上のパートナーへ拡大しており、その多くは本国市場を超えた利用者層にサービスを提供していた。
重要なソフトウェアはグローバルだ。オープンソースのメンテナー、クラウド提供者、半導体メーカー、通信ベンダー、金融ネットワークは日常的に国境をまたぐ。一国の政府の安全保障上の優先事項によって強く形作られたシステムは、不平等なアクセスを生む可能性がある。
そのため、最も強力なサイバーモデルは、地政学的な関係を通じて配分される戦略的資源になりうる。組織は、民間提供者のルールと政府の国家安全保障要件の両方を満たす圧力を受けることになる。
このプログラムには、明確な不服申立て手続き、一貫した基準、監査可能なアクセス取り消し手順、除外に関する透明な報告が必要だ。これらの要素がなければ、検証は重要性を増す防御技術のための不透明なライセンス制度になるおそれがある。
Anthropicはこのプログラムを恒久的な公共政策として提示していない。同社は、より強力な安全対策が開発されるまでの橋渡しとして、制御されたアクセスを説明している。それでも、一時的な制度はしばしば、後に置き換えにくくなる運用上の前例を築く。
防御上の優位性は、発見ではなくパッチ適用に左右される
組織が攻撃者に同じ発見を再現される前に脆弱性を修復できる場合に限り、Claudeは防御側に優位性をもたらせる。
Anthropicが掲げる目標は、防御側へ均衡を移すことだ。この目的は直感的に聞こえる。インフラ運用者は、自らのシステムを調査し、パッチを展開し、技術的な詳細を公表する前にインシデント対応を調整できるためである。
攻撃者には異なる優位性がある。最も弱い標的を選び、成功した手法を再利用し、複数の管轄区域にまたがって活動し、組織的な承認プロセスより速く動ける。
高度なモデルは双方を増幅しうる。防御側は数百万行のコードを走査し、危険な欠陥を優先順位付けできる。攻撃者も同様の推論を使い、公開されたサービスへの見落とされた侵入経路を見つけられる。
どちらが恩恵を受けるかは時間差で決まる。非公開で発見され、迅速にパッチが適用された脆弱性はセキュリティを改善する。一方、数カ月に及ぶ修正キューに入った欠陥は、防御側が先に見つけたとしても、攻撃者にとって有用であり続ける。
したがって、Anthropicの脆弱性件数は発見を測るものであり、防御成果の全体像を測るものではない。13万4,000件を超える検証済みの発見は、相当な研究成果を示している。しかし、影響を受けたシステムのうち、いくつが依然として露出したままなのかは明らかにしない。
同社によれば、パッチ適用に関する数値を開示した参加パートナーは半数未満だった。この欠けている分母により、発見が修正を上回っているかどうかを独立して評価することはできない。
大量の自動化された発見は、運用上の問題も生みうる。メンテナーには、欠陥を再現し、その影響を理解し、悪用可能な問題と理論上の弱点を区別するための十分な証拠が必要だ。
優先順位付けが不十分な報告は、ボランティア主体のオープンソースプロジェクトを圧倒しかねない。修正が存在する前に詳細なエクスプロイト情報があまりに多くの組織を通過すれば、開示リスクが高まる可能性がある。
拡大されたプログラムは、申請者により大きな責任を課す。セキュリティチームには、脆弱性管理プロセス、隔離されたテスト環境、アクセスログ、明確なエスカレーション経路、修復を展開する権限が必要だ。
また、持続的な記録も必要になる。AI支援による調査では、仮説、ツール出力、コード変更、意思決定が長く連なることがある。検索可能なエンジニアリング知識ベースは、モデルの結論を検証済みの事実として扱うことなく、チームがその文脈を保持する助けとなる。
人間によるレビューは依然として不可欠だ。モデルはシステム境界を誤解し、安全でない修正を提案したり、実際の運用条件では成立しないパターンを特定したりする可能性がある。産業システムには、通常のソフトウェアベンチマークでは捉えられない物理的制約が加わる。
Specialized Accessは、この重要性をさらに高める。飛行制御環境、グリッド管理システム、銀行間ネットワークに対する誤った操作は、データ損失を超える結果を招きうる。
Anthropicによれば、物理的危害や大規模な混乱を引き起こしかねない活動には、低いレベルでもリアルタイムの制限が継続して適用される。Specializedのユーザーが受けるブロックが少ないのは、その作業にこうしたシナリオのテストが必要となる場合があるためだ。
したがって、このプログラムは、組織が正当に見えるかどうか以上を判断しなければならない。その組織が対象を隔離し、モデルの行動を制約し、テストを監督し、失敗から復旧し、異常を報告できるかを評価する必要がある。
政府審査はその評価を支援しうるが、運用規律は現場に残る。モデル提供者は、公益事業の研究所や機密ネットワーク内のすべてのコマンドを監督することはできない。
競争も圧力を加える。OpenAIも、制御されたプログラムを通じて高度なサイバーモデルを利用可能にしている。提供者が、どのシステムがより多くの攻撃的タスクを完了できるかで競えば、アクセス制限は商業上の不利になりうる。
安全性のみで競う場合も、防御側はブロックが少なく、より優れた攻撃シミュレーションを提供するモデルを選ぶ可能性がある。これは、検証を補完的な対策として説明しつつ、制御を緩めるインセンティブを生む。
Anthropicの階層構造は、この圧力を管理するための信頼できる試みだ。ただし、根本的な対立を解決するものではない。Claudeを高度な攻撃者への対抗に有用にする能力そのものが、検証の失敗をより重大なものにする。
防御上の優位性は、モデルベンチマークではなく修正結果に現れる。パッチ適用率、修正までの時間、再発率、防止されたインシデントは、発見された脆弱性の単純な件数より重要である。
制御されたアクセスが機能するかを示す3つのシグナル
次の試験は、Anthropicが検証を弱めたり、防御側を未解決の発見であふれさせたりせずに、参加を拡大できるかどうかだ。
最初のシグナルは登録の質である。Anthropicによれば、多くのDefense Access申請は数日以内に審査できる一方、Red Team Accessには数週間かかる場合がある。迅速な承認が有用なのは、本人確認、権限確認、セキュリティチェックの一貫性が維持される場合に限られる。
企業は、申請件数の集計、承認率、審査期間、取り消し件数、主な却下理由を開示すべきだ。システムが責任を持ってスケールできているかを示すために、機微な参加者を特定する必要はない。
監視能力の拡充を伴わないアクセスの急増は、Anthropicの主張を弱めることになる。安定した審査基準と低い不正利用率は、その主張を補強するだろう。
2つ目の指標は、発見された脆弱性と修正された脆弱性の関係だ。Anthropicが報告したパートナーによる12万9,000件の発見と、オープンソースによる5,500件の発見は、検出状況の基準線となる。
今後の報告では、確認済みの発見を、重複、異議申し立てのある報告、すでに使用されていないソフトウェアに影響した脆弱性と分けるべきだ。また、パッチが提供された問題の数と、そのパッチが実運用システムに届くまでの速さも開示すべきである。
パッチ適用率の上昇は、フロンティアモデルが防御上の優位性を生むという主張を裏付けるだろう。一方で、未解決の重大問題が積み上がっていけば、自動化された発見が解決策ではなく組織上のボトルネックを露呈していることを示唆する。
3つ目の指標は、Anthropicが最初の重大なアクセス障害にどう対処するかだ。いかなる検証システムも、通常運用時だけで評価すべきではない。
アカウント侵害、未許可の標的、分類器の回避、または本番システムとの意図しない接触は、プログラムの対応を試すことになる。重要な評価項目には、検知までの時間、封じ込め、通知、アクセス取り消し、その後の変更が含まれる。
一部の技術的詳細が非公開のままであっても、透明性の高いインシデント報告は信頼を築くだろう。沈黙は、外部組織がこのプログラムへの参加に伴う実際のリスクを評価することを難しくする。
Enterprise Frontier Safeguardsも、この指標に影響する。Anthropicは、計画中のシステムがプライバシーと不正利用対策を両立させつつ、適格な組織が自社のクラウド環境内で情報を保持できるようにすると述べている。
この仕組みは、機微なコードやインシデントデータをモデル提供者に送ることへの懸念に対処できる可能性がある。一方で、顧客管理の環境ごとに制御の挙動が異なる場合、集中監視はより難しくなる可能性もある。
競合他社の動向は背景要因ではあるが、Anthropicの選択を左右する。OpenAIの管理されたサイバー分野での展開は、購入者や規制当局に対し、アクセス、監督、インシデント対応を比較する別のモデルを提供するだろう。
競合によるアクセス拡大は、Anthropicに承認の加速を迫る可能性がある。他社で重大な不正利用事案が発生すれば、より厳格な要件へと向かう可能性がある。
読者は、Anthropic Cyber Verification Programを、フロンティアのサイバー能力が現在安全になったことの証拠として扱うべきではない。これは、身元と統制によってリスクが低減されるため、既知の組織には制約を減らしてアクセスを与えられるという難しい前提に基づく、進行中のガバナンス実験である。
その前提は検証可能だ。Anthropicは、アクセスレベルがClaudeの振る舞いを変えることを示すベンチマーク結果を公開している。また、管理された展開で確認された多数の発見についても報告している。
不足している証拠は、大規模運用に関するものだ。正当な要求がどれほど頻繁に拒否されるのか、承認済みの組織のうちどれだけがルールに違反するのか、また意図された範囲外で使用されたアカウントをAnthropicがどれほど効果的に検知できるのかは、まだ分かっていない。
開発者やセキュリティ責任者は、同様のアクセスシステムがサイバーセキュリティを超えて広がる可能性があるため、このプログラムを注視すべきだ。生物学、金融、自律的な研究能力を備えたフロンティアモデルにも、検証済みユーザーと承認済み環境にひも付く権限が必要になる可能性がある。
エンタープライズの購入者は、アクセス階層によって技術的に何が変わるのかを問うべきだ。また、データ保持、監視、インシデント開示、従業員の認可、モデル生成アクションに対する責任も検討すべきである。
ナレッジワーカーにとって、より広い教訓は、高度なAIへのアクセスが常に一律の製品アップデートとして提供されるとは限らないということだ。最も高性能な振る舞いは、ユーザーが誰であるか、どの組織が支援しているか、どのシステムをテストする権限があるかに、ますます左右される可能性がある。
Anthropicは、その未来を一歩近づけた。同社のプログラムは、他のすべての利用者にはより強い制約を維持しながら、より多くの防御側にClaudeの高度なサイバー能力へのアクセスを提供する。
結果を左右するのは、見出しを飾る脆弱性件数よりも、規律ある修正対応と説明責任を伴う監督だろう。Anthropicは、検証済みアクセスがより安全なインフラを生むことを示す十分な証拠を公開するのか。それとも最初の大きな失敗が、検証こそ最も脆弱な安全策であることを露呈するのか。



