Anthropic、Google、OpenAIのガードレールが攻撃的サイバーセキュリティ研究を遅らせている
- Ethan Carter

- 1 日前
- 読了時間: 24分
Anthropic、Google、OpenAIの安全管理は現在、難しい試練に直面している。研究者らによれば、より厳格なガードレールが、認可された攻撃的サイバーセキュリティ業務を妨げているという。制限の目的は悪意あるハッキングの阻止だが、同じ管理によって脆弱性の検証、リバースエンジニアリング、エクスプロイト開発も阻害されかねない。
この対立は、複数の攻撃的セキュリティ研究者が繰り返される拒否や一貫性のない結果を報告したことで、いっそう見過ごしにくくなった。彼らの仕事は、犯罪者に悪用される前に未知の欠陥を見つけることであり、多くの場合、管理された概念実証の開発を伴う。
問題は単に、AI企業が危険な依頼を拒否していることではない。研究者らは、システムが認可済みのテストと実際の攻撃を区別するのに苦慮していると述べる。この曖昧さが遅延を生み、再現性を制限し、機微な作業をローカルでホストするオープンモデルへと向かわせている。
OpenAIとAnthropicは、この摩擦を減らすことを意図した認証プログラムを導入している。Googleも、マルウェア、インフラの妨害、安全フィルターの回避に関わる生成AIの利用を制限している。これらのポリシーは総じて、米国の主要AI企業がデュアルユースのサイバー能力に境界線を引こうとしていることを示している。
中心的な争点は、モデルの拒否に対する通常の不満よりも鋭い。攻撃的セキュリティと防御的セキュリティでは、しばしば同じ技術的手順が必要になる。モデルは、文脈として与えられたコード、コマンド、脆弱性だけから、実行者に認可があるかを常に特定できるわけではない。
その結果、最先端のAIラボは、コストの高い二つの誤りから選ばざるを得ない。寛容なモデルは攻撃者の行動を加速させ得る。過度に慎重なモデルは、防御側が同じ弱点を理解し修正することを妨げ得る。
研究者ら、正当なサイバー業務がブロックされていると指摘
直接的な変化は、サイバー関連のガードレールが、明らかに悪意のある依頼だけでなく、実務的な研究ワークフローを中断するようになったことだ。
7月23日のサイバーセキュリティ調査は、脆弱性の発見やエクスプロイトの開発に携わる研究者からの苦情を取り上げた。複数の研究者が、最先端モデルが正当な依頼を拒否したり、認可された作業中に一貫性のない回答を返したりしたと述べた。
攻撃的セキュリティとは、所有者の許可を得て、攻撃者の視点からシステムをテストすることを指す。ペネトレーションテスト、エクスプロイト検証、レッドチーミング、一部のリバースエンジニアリングが含まれる。
これらの活動は、従来のコードレビューでは見落とされる弱点を明らかにできる。疑わしいコードパスが実際の問題となるのは、研究者が到達可能かつ悪用可能であることを立証した後だ。
NCC GroupのチーフサイエンティストであるChris Anley氏はTechCrunchに対し、モデルにバグの悪用を依頼することで、その修正が必要かどうかを確認できると語った。この段階での拒否は、単に利便性を失わせるだけではない。企業が修正の優先順位を決めるうえで役立つ、証拠構築のプロセスを中断しかねない。
Anley氏はこの技術を、道具にも武器にもなり得るハンマーに例えた。氏がより広く指摘したのは技術的な重なりである。悪用に役立つ指示は、脆弱なコードが実際のリスクを生むことを示すためにも不可欠になり得る。
この重なりは、発見時点で影響を受けるベンダーに知られていない脆弱性を意味するゼロデイで特に重要になる。研究者は欠陥を理解する前に、実行経路の追跡、メモリの操作、あるいは通常と異なる入力の構築を必要とすることが多い。
研究者は攻撃を再現しているため、これらの手順は攻撃者の振る舞いに似ている。分類器は疑わしい用語、コード、コマンドを認識する。しかし、その作業を正当なものにする契約や実験環境での認可までは把握できない可能性がある。
あるスマートフォン部品メーカーの研究者はTechCrunchに対し、Anthropicのツールは認証プログラムの外では脆弱性発見にほとんど使えなくなったと語った。その研究者によれば、システムはセキュリティ関連の作業を検知すると停止したという。
RemoteThreatのCEOであるChris Thompson氏は、別の失敗パターンを説明した。同氏によれば、制限が緩和された審査済みプログラム内も含め、ガードレールの挙動はセッションごとに異なっていた。
脆弱性研究は再現可能な実験に依存するため、この不一致は重要だ。研究者は、結果が対象システム、テスト手法、あるいはモデルの変化する介入のどれに由来するのかを判断しなければならない。
ポリシーの適用が明確な説明なく変化すると、モデルは新たな制御不能な変数となる。時間は脆弱性の分析から、プロンプトの言い換えや拒否理由の診断へと移る。
制限はすべての実務者に同じように影響するわけではない。ゼロデイを発見しエクスプロイトを開発するGiuseppe Cali氏はTechCrunchに対し、ガードレールは自身の作業を妨げていないと語った。
Cali氏はAIを初期段階のリバースエンジニアリングや、補助ツールの構築に利用している。実際の脆弱性発見と武器化は、自分で行っている。部分的には、その作業自体を楽しんでいるためだ。
同氏の経験は、この批判に重要な限界を示している。研究者がより低リスクな補助作業をモデルに割り当てる場合、最先端モデルは依然として有用であり得る。ワークフローが悪用可能性、ペイロードの振る舞い、運用テストに近づくほど、対立は強まる。
したがって現在の議論は、AIがセキュリティ分野で価値を持つかどうかではなく、特定の能力へのアクセスに関するものだ。モデルは、最も厳しいポリシー境界を越えずに、コードの要約、関数の説明、テストの提案、文書作成の支援を行える。
問題が生じるのは、研究者がモデルにそれらの手順を結び付けるよう求めるときだ。その接続こそが、多くの場合、可能性のある欠陥を検証済みのセキュリティ上の発見へと変える。
Anthropic、Googleのポリシーでは攻撃と防御を明確に分けられない理由
Anthropic、Google、その他の最先端ラボのポリシーは、プロンプトだけでは確実に解決できない分類問題に直面している。
Anthropicは、リアルタイムの安全対策によって、禁止された利用や高リスクのデュアルユース活動をブロックしていると述べる。同社の禁止カテゴリには、ランサムウェア開発や大規模なデータ流出など、正当な防御的価値がほとんどない行為が含まれる。
高リスクのデュアルユースカテゴリはより複雑だ。Anthropicは、脆弱性の悪用と攻撃的セキュリティツールの開発を明示的に含めており、いずれも正当な防御目的に役立ち得る。
こうした依頼は、対象となるClaudeモデルではデフォルトでブロックされる。認証済みユーザーは、AnthropicのCyber Verification Program(CVP)を通じて調整を申請できる。
Anthropicによれば、承認済みの実務者もブロックに遭遇する可能性がある。同社は、対象となる申請者を誤って拒否することがあり、承認済みユーザーも正当な作業で制限を受ける可能性があると認めている。
この認識は、根本的な技術的課題を反映している。ペネトレーションテスターと犯罪者が、同一のエクスプロイト開発指示をモデルに与える可能性がある。目に見える違いは、依頼内容ではなく、しばしば認可の有無にある。
Googleの禁止利用ポリシーも同様に、マルウェア、インフラの悪用、安全フィルターの回避を助長する生成AIコンテンツを禁止している。一方で、教育的、科学的、または公共的な利益が害を上回る場合には例外を認めている。
この例外規定は文脈を認識しているが、文脈を大規模に適用することは依然として難しい。ユーザーは、証明せずに対象を所有していると主張できる。正当な研究者であっても、そのインフラを管理せずに製品を調査することがある。
OpenAIは、サイバー能力は本質的にデュアルユースだと説明している。防御的ワークフローと攻撃的ワークフローは、同じ知識や技術の多くに依存しているという。
同社は2025年にサイバー性能が急上昇したと報告した。サイバー・レジリエンス計画によれば、同社モデルのキャプチャー・ザ・フラッグの成績は、8月の27%から11月には76%へ上昇した。
キャプチャー・ザ・フラッグは、意図的に脆弱な標的を用いる管理されたセキュリティ演習だ。偵察、リバースエンジニアリング、悪用、権限昇格といった技能を試す。
OpenAIは、リモートのゼロデイエクスプロイトを開発したり、複雑な侵入を支援したりできるモデルを見据え、より高い能力しきい値を用いている。この方向性が、同社があらゆるサイバー関連の依頼を通常のコーディングと同様に扱わない理由を説明している。
Google DeepMindも、モデル開発レベルで類似のリスクベースのアプローチを採用している。同社の安全フレームワークは、能力評価と段階的な緩和策を必要とする領域の一つとしてサイバーセキュリティを含めている。
これらのポリシーは現実的な懸念に応えている。高性能なモデルは、専門知識を圧縮し、反復作業を自動化し、ツールを連携させ得る。防御側が利用できる同じ効率は、悪用に必要な労力も低減し得る。
しかし、積極的なプロンプトフィルタリングは、身元と認可の問題に対する粗い対応だ。技術的な内容だけでは、ユーザーの目的について弱い証拠しか得られない。
単純な表現も誤解を招き得る。正当な評価でも、shellcode、exploit、persistence、credential extractionといった用語を含む場合がある。こうした概念は正当な評価にも登場するためだ。
悪意ある依頼は、無害化された表現を用いることもできる。攻撃者は認証情報の窃取をアカウント復旧と表現したり、悪用を互換性テストに見せかけたりする可能性がある。
分類器はコード、意図、対象、アカウント履歴、周辺の活動を評価しなければならない。それでも、法的な認可を確認するのではなく、確率的な判断を下すことになる。
誤検知は、探索的な研究で特に起こりやすい。研究者は、疑わしいコードパスが最終的に何になるかを常に把握しているわけではない。実際の脆弱性を特定する前に、複数の攻撃的仮説を試す必要があるかもしれない。
この不確実性は、開始時点で整然と定義された防御目的を期待するシステムと衝突する。研究プロセスでは、危険に見える技術的作業が始まってから初めて、その説明が生まれることが多い。
認証済みアクセスは役立つが、摩擦を取り除くものではない
認証プログラムは既知の防御側のアクセスを改善するが、制限のない、予測可能な研究ワークフローを保証することはできない。
AnthropicのCVPは、正当な高リスクのサイバー業務を対象とする申請型プログラムだ。同社は、2営業日以内に審査結果を出すことを目指しているとしている。
承認は特定の組織に紐付けられる。研究者は別のワークスペースを使用した場合や、依然として禁止されている活動に該当した場合、ブロックを受ける可能性がある。
利用可能性もプラットフォームによって異なる。Anthropicは、CVPが現在Amazon BedrockまたはGoogle Vertex AI経由では利用できないとしている。Claudeを利用するサードパーティアプリケーションも参加できない可能性がある。
こうした違いは運用上の複雑さを生む。セキュリティチームは、クラウドプロバイダー、ワークスペース構成、ソフトウェア統合によって異なる扱いを受ける可能性がある。
このプログラムにはデータ保持も求められる。Anthropicは、ゼロデータ保持を利用する組織に対し、保持を有効にした別のワークスペースを作成するよう案内している。
この条件は、ガードレールとは別の第二の問題を提起する。攻撃的研究では、機密のソースコード、未修正の脆弱性、専有ファームウェア、侵害を可能にし得る情報が頻繁に扱われる。
契約上の保護があったとしても、そうした資料をホスト型モデルに送信することは、受け入れ難い情報露出を生む可能性がある。そのため一部の研究者は、ベンダーが欠陥を修正する前には最先端サービスの利用を避けている。
Paolo Stagno氏(Crowdfense最高技術責任者)はTechCrunchに対し、同社チームはリバースエンジニアリングにフロンティアモデルを使用していると語った。一方で、脆弱性の発見やエクスプロイトの作成には使用を避けている。
Stagno氏は、機微な脆弱性情報が漏洩したり、データが将来の学習に取り込まれたりする懸念を挙げた。エクスプロイト作業では、資料をプロバイダーに送信する必要がない、ローカル運用のオープンモデルを同チームは使用している。
OpenAIのtrusted cyber accessシステムには、複数の能力レベルがある。標準アクセスは一般的な防御タスクを支援し、検証済みアクセスでは、許可された作業について一部の制限が緩和される。
より専門的なアクセスは、エクスプロイト開発、ペネトレーションテスト、リバースエンジニアリング、レッドチーミングを含む攻撃的テストを対象とする。あるアクセスレベルの承認を得ても、サイバー分野に特化したすべてのモデルが自動的に利用可能になるわけではない。
OpenAIは、このプログラムがあらゆる安全対策や拒否を取り除くものではないとも説明している。アクセスは引き続き、承認済みユーザー、内部ワークフロー、および組織が所有する、またはテスト許可を得ているシステムに限定される。
こうした条件には妥当性がある。プロバイダーが、検証をあらゆる標的への攻撃を許す包括的な許可として安全に解釈することはできない。
しかし同時に、検証だけでは研究上の問題を完全に解決できない理由も浮き彫りになる。認可は粒度の細かいものだ。特定のシステム、期間、テスト手法、または顧客案件の一つにのみ適用される場合がある。
アカウント単位の一般的な承認では、あらゆるスコープ変更を捉えきれない。継続的な文書審査は、さらなる遅延を招き、追加の顧客情報を露出させることになる。
OpenAIは以前、同社のトラステッドプログラムが、数千人の検証済み防御者と、重要なソフトウェアを保護する数百のチームに到達したと述べていた。この規模は需要を示すが、誤検知や放棄されたワークフローを測るものではない。
欠けているのは実務的なパフォーマンス指標だ。研究者が知る必要があるのは、承認済みリクエストがどの程度の頻度でブロックされるのか、不服申し立てにどれほど時間がかかるのか、そしてモデル更新の間で判断が安定しているのかである。
有用な説明も必要だ。一般的な安全メッセージでは、標的、コードの挙動、要求した出力、あるいは蓄積されたアカウント活動のどれがトリガーになったのかは分からない。
その情報がなければ、ユーザーはプロンプトの文言を試行錯誤する。この行動は、研究者が正当な結果を求めているだけの場合でも、回避の試みのように見えることがある。
より良い執行は、運用環境全体に焦点を当てるべきだ。プロバイダーは、本人確認を隔離実行、標的の許可リスト、レート制限、監査ログ、制御されたネットワークアクセスと組み合わせられる。
このモデルは、セキュリティ演習のための隔離環境であるサイバーレンジに似ている。プロンプト分類だけよりも、認可のより強い証拠を提示できる。
一方で、インフラ側にはより大きな責任が課される。プロバイダーは、隔離されているはずの標的が外部システムへの橋渡しにならないことを確認しなければならない。
このアプローチは、すべての研究者をカバーするものではない。独立系の専門家や小規模コンサルタントは、エンタープライズ向けプログラムが求める組織的な文書を用意できない場合がある。
セキュリティ研究は長年にわたり、ベンダーとの正式な関係を持たずに製品を調査する外部者の恩恵を受けてきた。高度なアクセスを、大規模で容易に検証できる組織に限定すれば、そのコミュニティは狭まる可能性がある。
その結果、二層構造のシステムが生まれる。大手企業は専門モデルと支援を受ける一方、独立研究者は消費者向けツール、ローカルのオープンモデル、あるいは手作業の手法に頼ることになる。
ガードレールが機微な作業をオープンモデルへと押し出している
ホスト型フロンティアモデルが予測不能になったり、機密作業に適さなくなったりすると、研究者にはオープンモデルをローカルで実行する理由が生まれる。
複数の研究者がTechCrunchに対し、米国のフロンティアサービスが攻撃的タスクを拒否した場合には、ダウンロード可能なモデルに頼ると語った。Thompson氏は特に、GLMなどの中国製オープンモデルを挙げた。
ローカル展開は、制御構造を変える。研究者はモデルのバージョンを選び、プロンプトを保持し、外部接続を無効化し、脆弱なコードを自分たちのハードウェア内に留めることができる。
ベンダーがホスト型サービスを更新した後も、実験を再現できる。固定されたモデルチェックポイントは、安全対策が予告なく変わり得るサービスよりも一貫して動作する。
これは、すべてのオープンモデルが有力なホスト型モデルの推論品質に匹敵することを意味しない。研究者は、能力、コンテキスト処理、ハードウェア要件、ツール統合を比較しなければならない。
オープンモデルはまた、より大きなセキュリティ責任を運用者に移す。適切に隔離されていないエージェントは、危険なコマンドを実行したり、シークレットを露出させたり、本番システムに到達したりする可能性がある。
それでもローカル制御は、二つの不満を同時に解消する。プロバイダー側の拒否をなくし、未公開の脆弱性データを外部サービスへ送る必要を減らす。
この組み合わせは、ベンチマーク上の首位よりも重要だ。少し能力が劣るモデルでも、機微で再現可能なワークフロー全体で利用し続けられるなら、より有用になり得る。
この移行は、米国AI企業にとって戦略的な緊張も生む。厳格な安全対策は自社プラットフォームでの悪用を減らせる一方、正当な専門家を、自社の統制が及ばないシステムへ誘導する可能性がある。
そうした研究者は、別のモデルエコシステムにフィードバック、統合、ワークフローに関する知識を提供することになる。その利用は、制限が少ないモデルをめぐるツールの改善につながり得る。
これは、ガードレールがインターネットの安全性を低下させる証拠ではない。攻撃者は、検証済みの防御者が何を選ぶかにかかわらず、オープンモデルを利用できる。
ただし、防御者の移行は、ホスト型の制限が責任あるユーザーの優位性を維持するという主張を弱める可能性がある。その優位性は、そうしたユーザーが意味のある作業を完遂できる場合にのみ意味を持つ。
OpenAIは、防御者により良いツールを提供しつつ、悪意ある能力向上を制限するという戦略を掲げている。Anthropicも同様に、検証済みの専門家向けに調整された安全対策を提供している。
両方の目標は、適切に調整されたアクセスに依存する。危険に見える挙動をほぼすべてブロックする制御は、悪用を減らせるかもしれないが、防御者に約束された能力を消し去る可能性もある。
移行圧力は、明示的な拒否にとどまらない。保持要件、プラットフォーム上の除外、または不明確な不服申し立てが機密案件を複雑にする場合、ホスト型モデルは魅力を失い得る。
コンサルティング会社は、それぞれ異なる認可境界を持つ複数の顧客にサービスを提供する場合がある。保持される一つのワークスペース内で、各顧客のソースコードや調査結果を気軽に混在させることはできない。
独立研究者は、開発元に連絡する前に広く導入されている製品を調査する場合がある。その人物が、認可を証明する顧客契約を常に提示できるとは限らない。
バグバウンティプログラムも、別のグレーゾーンを生む。公開されたルールの下でテストを招くものの、モデルプロバイダーが、各要求された行為がスコープ内に収まるかどうかを確認できるとは限らない。
こうした状況は、企業単位の審査の限界を示している。信頼は個人または組織に付与される一方、認可は特定の操作に付与される。
ローカル運用のモデルは、その検証ギャップを回避する。また、大規模な悪用を検知し、アクセスを停止し、不審なパターンを調査できるプロバイダーも排除する。
したがって、トレードオフはなくなるのではなく移る。ホスト型サービスは監督を提供するが、摩擦や機密性への懸念を生む可能性がある。ローカルモデルは制御を提供するが、中央集権的な執行を弱める。
米国のフロンティア研究所は、拒否を厳格化してもオープンモデルの利用可能性を覆すことはできない。より現実的な選択肢は、責任あるホスト型アクセスをローカルの代替手段より優れたものにすることだ。
そのためには、予測可能なポリシー、迅速な不服申し立て、有意義なプライバシー制御、そして制御されたエクスプロイト作業のために設計された環境が必要となる。生のモデル能力だけでは、セキュリティ研究者をプラットフォームに留めておけない。
研究者の批判には重要な限界がある
攻撃的セキュリティ研究者は実際のワークフロー上の失敗を指摘しているが、その利害によって危険なAI能力をどれほど広く提供すべきかが決まるわけではない。
一部の攻撃的セキュリティ企業は、政府顧客向けに脆弱性を発見、取得、または販売している。その作業が常に即時の開示やパッチ適用につながるとは限らない。
TechCrunchが引用した著名な研究者、Mark Dowd氏は、西側政府にゼロデイ脆弱性を販売してきた。同氏は、この経歴が企業による制限に対する自身の見方を形作り得ると認めた。
政府が未公開の脆弱性を評価するのは、標的が依然として露出した状態のまま、情報機関がそれを利用できるためだ。その市場の存在は、攻撃的研究と公共防衛を単純に同一視することを難しくする。
モデルプロバイダーは、顧客が信頼できるように見えるかどうか以上の点を考慮しなければならない。支援が監視、侵入、またはエクスプロイトの備蓄を拡大する可能性も考慮する必要がある。
法的な認可は、公共の利益と同一ではない。政府が承認した作戦でも、広く使われるソフトウェアの脆弱性に関わる場合には、論争を招いたり、システム全体のリスクを生んだりする可能性がある。
研究者の間でも、AIがどれほど中心的な役割を担うべきかについて見解は異なる。Cali氏のワークフローは、有用な支援が自動化されたバグ発見や武器化の前で止まり得ることを示している。
このアプローチは、最もリスクの高い段階で人間の判断を維持する。また、モデルが不完全なアイデアを再利用可能な攻撃手法へ変換する可能性も減らす。
一方で、プロバイダー側のリスク論は仮説ではない。OpenAIは、モデルのサイバー能力が急速に向上していると述べており、3社すべての研究所が高度なサイバー能力を深刻な安全領域として扱っている。
モデルがより長時間にわたるエージェンシーを獲得するにつれ、単一の応答よりも一連の行動が重要になる。エージェントはコードを調査し、テストを生成し、コマンドを実行し、失敗を評価し、計画を修正できる。
この能力は、状況の重大性を変える。かつて短いマルウェア要求を阻止していた拒否は、数千に及ぶ連携した行動を統制する必要があるかもしれない。
また、隔離されたテストを不可欠なものにする。ツールを用いて動作するエージェントは、テキストのみのアシスタントでは到達できない境界を越える可能性がある。
研究者には予測可能なアクセスが必要だが、プロバイダーには周辺環境が失敗を封じ込めるという証拠が必要である。検証だけでは、その証拠を提供できない。
また、正当なサイバー作業に対するガードレールの品質について、公に標準化された測定は存在しない。逸話は失敗モードを明らかにするが、全体的な誤検知率を確立するものではない。
TechCrunchの取材は、多様な組織とワークフローを扱っている。これは信頼できる警告サインを示すものではあるが、セキュリティ業界を代表する調査ではない。
プロバイダー側も、承認済みユーザーの体験に関するデータを限定的にしか公表していない。登録者数は到達範囲を示すが、タスク完了率やモデルの有用性についてはほとんど語らない。
この証拠の不足は、双方に自らの主張を誇張する余地を与える。研究者は拒否を、安全ポリシーが恣意的である証拠と解釈し得る。プロバイダーはプログラムの存在を、正当なアクセスが機能している証拠として扱い得る。
より良い評価では、複数のモデルにまたがる現実的で認可済みのワークフローをテストすべきだ。タスクの成功、不適切な拒否、危険な応答、一貫性、不服申し立ての時間、データ処理要件を測定する必要がある。
ベンチマークには曖昧なケースも含めるべきだ。容易な防御プロンプトや露骨なランサムウェア要求では、争点となる境界を検証できない。
シナリオには、サイバーレンジ内でのエクスプロイト検証、マルウェアのリバースエンジニアリング、バグバウンティ対象の分析、安全な概念実証の開発などを含められる。
独立した評価者には、最も高リスクなモデル階層へのアクセスも必要となる。そうでなければ、検証が実際に問題を解決するかを検証せずに、公開アクセスの制限だけを測定することになる。
結果は、悪用を可能にする運用上の詳細を開示すべきではない。それでも集計報告によって、制御が時間とともに正当な作業をより正確に区別できているかを示すことは可能だ。
こうした証拠が得られるまでは、強い結論を出すのは時期尚早である。ガードレールが一部の研究者に摩擦を生んでいることは明らかだが、それを取り除けば、別種で、より大きくなる可能性のあるリスクが生じる。
実務上の目標は、無制限のアクセスではない。現実的な攻撃的テスト環境でも有用性を保てる、説明責任のあるアクセスである。
Anthropic、Google、OpenAIが次に示すべきこと
次の段階は、ワークフローの信頼性、管理された実行環境、そして責任ある研究者がガバナンスのあるプラットフォームにとどまるかどうかで評価されるべきだ。
最初の指標は、検証プログラム内での測定可能なパフォーマンスだ。AnthropicとOpenAIは、承認までの期間、不服申し立ての結果、正当なデュアルユース要求に対する誤検知率を報告すべきである。
こうした数値には、モデル、アクセスレベル、タスク分類といった文脈が必要だ。プログラム全体で単一の割合を示すだけでは、エクスプロイト検証における深刻な問題を隠しかねない。
Anthropicはすでに、CVPの申請について2営業日以内に判断することを目指すとしている。より重要なのは、承認後に何が起きるかだ。
検証済みの研究者が依然として説明のないブロックに頻繁に遭遇するなら、審査は境界線を移しただけで、ワークフロー上の問題を解決していない。誤検知率の低下は、調整された安全策の有効性をより強く裏付けるだろう。
2つ目の指標は、管理された研究環境の広がりだ。フロンティアラボは、監査可能なツール、制限されたネットワーク、明確な対象承認を備えた隔離ワークスペースを提供できる。
このような環境なら、外部インフラへのオープンアクセスを与えずに、モデルが危険に見えるタスクを実行できる。また、インシデントレビューをプロンプトレベルの推測よりも具体的なものにできる。
成功には、クラウドプラットフォームやサードパーティツール全体での対応が求められる。Anthropicの現在のCVP提供範囲のギャップは、モデルが仲介事業者を通じてユーザーに届く際にアクセスが途切れうることを示している。
プライバシー管理は、実行管理と同じくらい重要になる。セキュリティチームには、独自コードや未公開の脆弱性を追加の露出を生まずに扱うための、信頼できる選択肢が必要だ。
企業がサイバーレンジと強力なデータ保持設定を組み合わせれば、より多くの研究者がホスト型モデルの利用を正当化できる。保持が依然として必須なら、機微な作業は引き続きローカルへ移っていく。
3つ目の指標は研究者の行動だ。プロバイダーは、評価の高い攻撃的セキュリティチームが、単なるコード要約ではなくエクスプロイト検証のために特化型フロンティアモデルを使っているかを見守るべきである。
GLMなどのダウンロード可能なモデルへの移行が続けば、検証済みアクセスが防御側に実用的な優位性を与えるという主張は弱まる。安定した導入は、安全策が使えるものになりつつあることを示唆するだろう。
最近の研究者アカウントが主にAnthropicとOpenAIに焦点を当てていたとしても、Googleもこの比較に含まれる。そのポリシーとフロンティアフレームワークは、同じ根本的なトレードオフを反映している。
anthropic googleというキーワードの組み合わせは、より広範な市場の現実も捉えている。セキュリティチームは、生のベンチマークスコアだけでなく、プロバイダー間でガバナンス、導入形態、プライバシー、アクセスを比較している。
どの企業も、より優れた拒否メッセージだけでデュアルユース分類を解決することはできない。決定的な改善は、本人確認、環境、承認、監視、そして誤りを訂正する透明な手段を組み合わせるものになる。
開発者や企業の購入担当者は、セキュリティ業務向けにAIモデルを採用する前に、率直な質問をすべきだ。どのタスクで強化された安全策が発動するのか。承認済みユーザーは、進行中のエンゲージメント中に不服を申し立てられるのか。
また、データ保持、地域別処理、プラットフォームの可用性、監査可能性、モデルバージョンの安定性も確認すべきである。こうした詳細が、製品が実際のセキュリティプログラムを支えられるかを左右する。
攻撃的セキュリティ研究者は、害を助長する内容を公開せずに、誤検知を記録すべきだ。比較可能な証拠があれば、プロバイダーが失敗を孤立した誤用として退けることは難しくなる。
一方でAI企業は、正当な要求に対する拒否を安全性の欠陥として扱うべきである。防御側を無差別にブロックするシステムは、意図されたバランスを達成していない。
これからの試金石は明確だ。Anthropic、Google、OpenAIは、有意義な監督を維持しながら、攻撃者がすでに求めている能力への信頼できるアクセスを、認可された研究者に提供できるのか。
検証済みプログラムが一貫性と機密性を備えるなら、ガバナンスのあるフロンティアモデルは責任ある専門家をつなぎ留められる。そうでなければ、そうした専門家は制限が少なく、プロバイダーによる監督も弱いローカルの代替手段へ移り続けるだろう。


