top of page

AnthropicとGoogleの協議、任意のAI安全性テストとリリース競争を対立させる

Anthropic、Google、OpenAI、Metaは8月4日、政府によるAI安全性テストを巡って深い対立を抱えながらも、トランプ政権の当局者らとの協議に入った。会合の焦点は、高度なモデルを審査するために完成した任意の枠組みだ。しかし、その基準、スケジュール、結果は依然としてほぼ非公開となっている。

AnthropicとGoogleをめぐる協議は、責任あるAIに関するまた別の幅広い対話ではない。連邦政府の審査官が正式な規制権限を得ることなく、最先端モデルの公開前に検証できるかを試すものだ。また、安全性審査と、性能を増すシステムを急いで市場投入する商業競争との根本的な対立も浮き彫りにしている。

この対立はすでに政策論の域を超えている。報道によれば、政府の懸念はAnthropicとOpenAIによる最近のモデル展開に影響を及ぼした。一方、Metaは公開後の封じ込めが難しいオープンウェイトモデルのリリースと密接に結び付けられている。

したがって、中心となる問いは実務的だ。不合格の審査がリリース日程、顧客、あるいは政府契約を脅かす場合、任意のテストは企業の行動に影響を与えられるのか。

ホワイトハウスには枠組みがあるが、企業にはなおルールが必要だ

8月4日の会合は、連邦政府によるAI審査の議論から、その運用方法の交渉への転換を示す。

ホワイトハウスは、Meta、Anthropic、Google、OpenAIのスタッフを招き、高度なAIモデルを評価するために完成した枠組みを検討する。報じられた会合は、最高経営責任者とドナルド・トランプ大統領による首脳会談ではなく、スタッフレベルの会合として予定されていた。

この違いは重要だ。技術・政策チームは、公の声明が答えを残してきた運用上の問題を解決する必要がある。定義、提出手続き、審査期間、開示ルール、異議のある結果の扱いに関するプロセスが必要となる。

政権は、トランプ大統領の6月2日の大統領令で定められた期限までに、任意の枠組みを完成させたとしている。ただし政府は、全文書を公表しておらず、参加企業のすべてを明らかにしたわけでもない。

評価枠組みに関する報道によると、これは開発中のモデルが連邦審査の対象となるかを開発者が判断する助けとなることを意図している。サイバー能力のベンチマークは機密扱いのままになる見通しだ。

機密のベンチマークは、既知のテストに合格することだけを目的に開発者がモデルを設計するのを防ぎうる。また、攻撃的なサイバーセキュリティ技術を明らかにしかねない詳細も保護できる。しかし、秘密主義は、顧客、研究者、立法者が審査プロセスの一貫性を判断することを難しくする。

少なくとも公表された形では、この枠組みは任意である。つまり参加企業は、従来型のライセンス要件に対応しているわけではない。低い評価を受けたモデルの公開を自動的に禁じる、公開済みの法律はない。

任意であることは、必ずしも影響がないことを意味しない。政府はAIサービスを調達し、機密ネットワークへのアクセスを管理し、輸出規制を運用し、国家安全保障政策を形成する。これらの権限は、専任のAI規制当局がなくても企業に影響を及ぼしうる。

したがって、この会合はいくつもの未解決の問題を提起する。どのモデルがテストの基準を超えるのか。開発者はどの段階で連邦審査官に連絡しなければならないのか。結果を受け取るのは誰か。当局者はリリース制限を求められるのか。

もう一つの問題は意見の相違に関するものだ。研究所は技術的な結果を受け入れつつ、政府の解釈には異議を唱えるかもしれない。また、危険な能力は非現実的な条件下でのみ現れると主張する可能性もある。

この可能性は抽象的なものではない。安全性評価は、プロンプト、ツール、権限、スキャフォールディング、反復試行に左右されることが多い。スキャフォールディングとは、モデルが計画を立て、ツールを使い、より長いタスクを完了できるよう支援するソフトウェア構造を指す。

こうした条件を変えれば、結果は大きく変わりうる。通常のチャットインターフェースでは能力が限られて見えるモデルでも、コード実行やネットワークツールに接続されれば、より高い能力を発揮する場合がある。

公開される枠組みは最終的に、審査官が信頼できるセキュリティリスクと人工的な実験室デモをどう区別するのかを説明しなければならない。それまでは、この会合はプロセス面での進展であって、有効な監督の証明ではない。

また、この記事の中心的な緊張関係も生み出している。政権は機微なシステムへの早期アクセスを求める一方、開発者は競争上のリリースを頓挫させない予測可能な審査を求めている。

Anthropic、Google、そして競合各社が今プレッシャーを受ける理由

高度なモデルが単に質問にうまく答えるだけでなく、サイバー作戦にも役立つようになっているため、連邦政府による安全性審査の緊急性は高まった。

政権の取り組みは、複数の懸念が重なり合う中で発展してきた。これには、政府調達、機密環境への展開、モデル窃取、サイバー攻撃、そして高度なエージェントが管理された環境の外で行動できる可能性が含まれる。

AIエージェントとは、タスクを計画し、外部ツールを利用できるモデルベースのシステムである。こうしたツールには、ブラウザ、ターミナル、クラウドサービス、ソフトウェアリポジトリなどが含まれる。

このアクセスは、開発者やセキュリティチームに実用的な利点をもたらす。同時に、リスクの性質も変える。チャットボットはソフトウェアの脆弱性を説明できるが、エージェントは標的を探し、悪用を試みる可能性がある。

政府は2026年初頭、テストに関する関係を拡大した。Google、Microsoft、xAIは評価に合意し、AnthropicとOpenAIとの更新された取り決めは従来の取り組みを継続した。

テストプログラムに関する5月の概要では、政府の評価者が高度なモデルについて国家安全保障上のリスクを調べているとされた。これらの関係は、現在議論されているより広範な枠組みの制度的基盤となった。

6月2日の安全保障指令は、政治的な圧力を加えた。これは、最先端モデルの開発を国家安全保障および連邦政府の導入判断と結び付けた。

AnthropicとOpenAIにとって、圧力はアクセスとタイミングに関わる。両社はクローズドモデルを開発しており、評価者に管理された公開前アクセスを提供できる。また、エンタープライズ市場と消費者市場での地位を守るため、頻繁なリリースにも依存している。

Googleも、より大きな製品ポートフォリオ全体にわたって似たタイミングの問題に直面している。同社のモデルは、クラウドサービス、職場向けソフトウェア、検索製品、政府との関係に影響を及ぼしうる。そのため審査の遅延は、1つのチャットボットの公開を超えた影響を生み出す可能性がある。

Metaは異なる課題を抱える。オープンウェイトモデルは、システムを実行・改変するために必要な数値パラメータを配布する。いったんこれらのウェイトが流通すれば、Metaも政府もすべてのコピーを確実に回収することはできない。

この違いは、オープンウェイトモデルが本質的に安全でないことを意味しない。研究者、スタートアップ、防御側はそれらを検査し、適応できる。オープンなアクセスは、クローズドなベンダーが決して認めないかもしれない独立したテストを支援できる。

ただし、このリリースモデルは配備前の管理を複雑にする。政府の審査官は公開前に懸念を特定しなければならない。公開後の制限は及ぶ範囲が限られるからだ。クローズドモデルの提供者は、ホスト型サービスとアカウント権限を通じて、より大きな管理権を維持する。

企業は互いからも圧力を受ける。長期にわたる審査に協力する開発者は、より限定的なプロセスを使う競合相手に対して時間を失うリスクを負う。大きな製品リリースが近づくほど、この誘因は強まる。

協力に不均衡なコストが伴う場合、任意の制度は機能しにくい。ある企業が待つ間に別の企業が公開すれば、慎重な参加者が商業上の不利益を負担する。この構造は、安全性へのコミットメントを調整問題に変えかねない。

政府当局者も独自の圧力に直面している。深刻な危険を検出するのに十分なアクセスが必要である一方、商業上の勝者を選んでいるように見えてはならない。曖昧な基準は、ある企業のモデルを審査に引き込みながら、同程度の競合モデルを対象外に残す可能性がある。

リスクはエンタープライズの購入者にも及ぶ。企業はますます、モデルを社内文書、コード、顧客記録、運用システムに接続している。導入後に発見された失敗は、多くの下流製品に広がる可能性がある。

調達チームは、モデルが政府のテストを完了したかを知りたがるだろう。また、その保証の限界も把握する必要がある。機密扱いの評価に合格しても、すべての民間ネットワークで安全な挙動を保証するわけではない。

開発者も同様の情報格差に直面している。最も重要な評価証拠を見ることなく、API経由でモデルを利用する場合がある。政府の関与は信頼を高めうるが、秘密主義は不透明なプロセスを別の不透明なプロセスに置き換える可能性もある。

AnthropicとGoogleの会合が重要なのは、こうした圧力が収束しているからだ。モデルの能力は進歩し、連邦政府による採用は拡大し、最近のセキュリティ事案によって行動の遅れを正当化することは難しくなっている。

任意のAI安全性テストと商業的なリリース競争の衝突

この枠組みにおける決定的なトレードオフは、有意義な精査が競合企業の管理するリリース日程と両立できるかどうかだ。

公開前テストは新しい約束ではない。2023年には、Anthropic、Google、Meta、OpenAIを含む主要な開発企業7社が、ホワイトハウスの任意のコミットメントを受け入れた。

これらの公開前コミットメントには、社内外でのセキュリティテストが含まれていた。また、情報共有、サイバーセキュリティ保護、公的報告、AI生成コンテンツを識別する手法も対象としていた。

新しいプロセスは、より狭く、より運用面に焦点を当てているようだ。特にサイバーセキュリティにおいて、国家安全保障上の懸念を生みうる高度な能力に焦点を当てている。政権は現在、政府の評価者が開発サイクルのどの時点で関与するかを定義しようとしている。

この変化が重要なのは、テストするという約束は、結果を受け入れるという約束よりも容易だからだ。企業はすでに社内評価を実施し、選択した結果を公表している。より難しい問題は、外部の審査官が遅延や制限を求めたときに生じる。

有用な枠組みには少なくとも4つの要素が必要だ。明確なモデルの基準、十分なテスト時間、結果へのアクセスに関する定義、そして異議を解決するプロセスである。

基準は、どのシステムが対象となるかを決める。トレーニング時に使用した計算量は1つの指標になりうるが、能力を直接捉えるものではない。効果的なツールを備えた小規模モデルは、特化したサイバータスクでより大規模なモデルを上回ることがある。

能力ベンチマークは別の手法を提供する。これは、高度な攻撃、防御、生物学研究、自律的な運用に関連するタスクをシステムが完了できるかをテストする。ただし、ベンチマークの性能はプロンプトとツールへのアクセスによって変動する。

タイミングも別の問題を生む。開発者はしばしば、公開直前までモデルを改善する。初期チェックポイントの審査では後の変更を見逃す可能性がある一方、遅い段階での審査は、マーケティング、インフラ、顧客との約束と衝突しかねない。

フレームワークはモデル更新にも対応する必要がある。プロバイダーは基盤モデルを再学習させなくても、システムプロンプト、安全フィルター、ツール権限、検索コンポーネントを変更できる。更新の中には、リスクを実質的に変えるものもある。

一度のレビューで、将来のあらゆる構成をカバーすることはできない。政府は再テストを発動する変更のしきい値を設ける必要があるかもしれない。そうしなければ、認証済みのバージョンが大幅に異なる製品の基盤になり得る。

結果の共有にも関連するトレードオフがある。全面公開は、悪用可能な弱点や機密試験を露出させるおそれがある。一方、完全な秘密主義では、独立研究者が政府の結論を検証できない。

実行可能な妥協案としては、評価カテゴリー、手法、概要レベルの知見を公表しつつ、悪用可能な詳細は保護する方法が考えられる。政権は、自らのフレームワークがそのモデルに従うかどうかを明らかにしていない。

異議申し立ての手続きも同様に重要だ。研究所は証拠に基づいて結果に異議を唱えられるべきである。しかし、終わりのない不服申し立ては、企業が時間を引き延ばし、解決前にリリースすることを可能にしてしまう。

ここで、自主的な監督は商業的現実とぶつかる。Anthropic、Google、OpenAI、Metaは共通のスケジュールでモデルを開発しているわけではない。各社は異なる投資家、顧客、インフラ、戦略的優先事項を抱えている。

OpenAIとAnthropicは主に、管理されたサービスを通じて主力システムを提供している。Googleはホスト型モデルと、よりオープンな提供形態を組み合わせている。MetaはAI戦略の大部分でオープンウェイトを中核に据えてきた。

政府は、これらのモデルすべてに同一の介入を適用することはできない。API機能を制限することと、ダウンロード可能なウェイトの公開を延期することは異なる。技術的な仕組みも、その後に及ぶ影響も同等ではない。

したがって、フレームワークに必要なのは同一の手続きではなく、比較可能な結果である。テストで重大なリスクが特定された場合、対象となるすべての開発者は信頼できる対応に直面すべきだ。その対応は、モデルがどのようにユーザーへ届くかを反映し得る。

その結果として、追加の安全対策、限定的なツールアクセス、段階的な展開、監視の拡大などが考えられる。オープンウェイトのリリースでは、公開後の統制が弱いため、レビュー担当者がより早期の提出を求める可能性がある。

ただし、フレームワークがより明確になるまでは、これらは推測にとどまる。ホワイトハウスは完成を確認したが、完成は採用を意味しない。会合に出席した企業も、すべての条件を公に受け入れたわけではない。

参加者が政府からの信頼を重視するなら、自主的なモデルでも機能し得る。連邦契約や国家安全保障分野の顧客へのアクセスは、強いインセンティブとなる。評判上のコストも、企業が信頼性のある知見を無視することを抑制し得る。

この制度が脆弱になるのは、争いのある知見が大規模なローンチに影響する時だ。その瞬間に、協力がガバナンスの仕組みなのか、それとも単なる公的な約束なのかが試される。

秘密のベンチマークが残す大きな説明責任の空白

政府によるテストは重大な危険を特定できる一方で、公的説明責任に必要な透明性をなお欠く可能性がある。

機密扱いのサイバーセキュリティ・ベンチマークには、正当な目的がある。すべての課題やエクスプロイト経路を公開すれば、悪意ある行為者を利し、開発者にテスト最適化を促すことになる。

しかし、非公開のベンチマークは非対称性を生む。当局者と参加企業は、顧客、研究者、競合他社が検証できない証拠を目にする。その結果、一般市民には技術的根拠を伴わない結論だけが示される。

この構造は、一貫性に関する疑問を生じさせる。すべての企業に同じツール、時間、試行回数が与えられたのか。評価者はベースモデルを試験したのか、それとも完全なエージェントシステムを試験したのか。比較可能な安全対策は有効化されていたのか。

その答え次第で、性能は大きく変わり得る。ターミナルアクセスと保存済みの認証情報を持つモデルは、制約されたチャットウィンドウ内の同じモデルとは異なるリスクプロファイルを持つ。

政府のレビュー担当者にも、複数のフロンティアシステムをテストするための十分な専門性と計算資源が必要だ。十分な資源を持たないプログラムは、信頼できる知見を生み出さずに遅延だけを招きかねない。

Center for AI Standards and Innovation、すなわちCAISIは、連邦政府の評価業務で重要な役割を担うようになっている。その影響力は、技術的能力と政権をまたいで持続する権限に左右される。

独立性も別の課題である。政府機関は、モデルを購入し、防衛分野でのアクセスを交渉し、輸出政策を管理する立場でもあるため、中立的な観察者ではない。調達上の利害は、テストを当面の運用上のニーズへと引き寄せる可能性がある。

企業側にも独自の利益相反がある。自社モデルに関する最も強い技術知識を持つ一方で、証拠とリリース判断も統制している。自己申告だけでは、この緊張を解消できない。

独立評価は、開示が精査に値する理由を示している。2023年のホワイトハウスのコミットメントに関する査読済み研究では、外部から確認可能な遵守状況に大きな差が見られた。

コミットメント評価では、最高得点の企業は約83パーセントだった一方、評価対象企業全体の平均はおよそ52パーセントだった。この研究が測定したのは開示された行動であり、すべての非公開の安全活動ではない。

この限界は重要である。公的スコアが低いからといって、企業が社内で何の取り組みもしていない証拠にはならない。外部の観察者が、一貫した履行を検証するのに十分な証拠を得られなかったことを示している。

別の2026年の評価では、主要研究所全体で不十分な点が見つかった。安全性指数はAnthropic、OpenAI、Google DeepMindにC+を付与し、MetaにはD+を付与した。

こうした評価は、各組織の方法論と判断に依存する。規制上の認定として扱うべきではない。それでも、独立レビュー、リスク管理、公的証拠に対する継続的な懸念を示している。

トランプ政権のフレームワークは、標準化された評価を導入すれば状況を改善できる。一方で、企業が参加を安全性の証明として引用しながら、参加の対象範囲を開示しなければ、不透明性を悪化させる可能性もある。

政府のレビューは、万能の承認印になってはならない。フロンティア評価は、選択された条件下で選択されたリスクに焦点を当てる。あらゆる導入におけるプライバシー、バイアス、信頼性、セキュリティ、不正利用を検証することはできない。

したがって、企業の購入担当者は限定的な質問をすべきだ。どのモデルバージョンがテストされたのか。どの能力カテゴリーが調査されたのか。どの安全対策が有効だったのか。プロバイダーは評価後に変更を加えたのか。

また、社内統制も維持すべきである。アクセス権限、ネットワーク分離、ログ記録、人による承認、インシデント対応は、連邦政府の評価後も必要であり続ける。

機密性の高い研究を扱うチームは、検索可能なAIナレッジベースを維持することで、このプロセスを強化できる。そこにはモデルバージョン、評価記録、導入判断、インシデントの証拠を保存できる。

プロバイダーがモデルをひそかに更新する場合、文書化は特に重要になる。チームは、変化した挙動が自らのワークフロー、ベンダーの更新、新たなツール統合のどれによるものかを把握する必要がある。

政治的な不確実性もある。自主的なフレームワークは法律ほどの安定性を持たないため、急速に変わり得る。将来の当局者がテストのしきい値を拡大、縮小、あるいは再解釈する可能性がある。

議会は、フロンティアモデルに対する包括的な連邦ライセンス制度を創設していない。そのため、このフレームワークは大統領権限、調達上の影響力、国家安全保障上の権限、企業の協力を通じて運用される。

この取り決めは、立法より迅速に対応できる。一方で、一貫性のないルールと限定的なレビュー手段を生む可能性もある。

懐疑的な結論は、テストに価値がないということではない。参加だけでは、安全性、独立性、平等な扱いを確立できないということだ。実施に関する証拠は、会合の発表よりも重要になる。

オープンモデルとクローズドモデルは異なる安全上の問題を生む

最も難しい政策課題は、どの開発哲学が勝つかではなく、管理可能なシステムと管理できないシステムを一つのフレームワークでどう扱うかにある。

Anthropic、Google、OpenAI、Metaは、米国のAIリーダーシップに利害を共有している。しかし、配布モデルも、オープン性がセキュリティに与える影響についての見解も共通ではない。

AnthropicとOpenAIは、最も高性能なモデルウェイトを非公開にしている。ユーザーは一般に、管理された製品や、APIとして知られるアプリケーション・プログラミング・インターフェースを通じてこれらのシステムにアクセスする。

この構造は、プロバイダーに継続的な統制を与える。アカウントの停止、リクエストの遮断、安全対策の変更、不審な活動の監視、機能の撤回が可能だ。一方で、情報と意思決定を企業内部に集中させる。

Metaのオープンウェイトのアプローチは、ユーザーと下流の開発者へより多くの統制を移す。組織は、ホスト型プロバイダーに依存せず、自らのインフラでモデルを稼働させ、変更し、評価できる。

Googleは両方のパターンにまたがって事業を展開している。管理されたフロンティアサービスを提供する一方で、より広範な適応を意図したモデルもリリースしている。このためGoogleは、テストをめぐる議論の両側に関係する。

オープンモデルの支持者は、より広いアクセスが研究、競争、防御的セキュリティを強化すると主張する。独立した専門家は、許可を求めずに挙動を検査し、知見を再現し、保護策を開発できる。

批判者は不可逆性を強調する。危険なホスト型機能は中央で無効化できる。しかし、ダウンロードされたウェイトは、私有サーバー、海外の法域、改変されたシステムにまたがって残存し得る。

クローズドシステムにも独自のリスクがある。外部の専門家は、専有の訓練データやモデルウェイトを完全には検査できない。どの研究者にアクセスを与えるか、どの知見を公開するかはプロバイダーが決める。

したがって、この比較は分散された精査と中央集権的な統制のトレードオフである。どちらのアプローチも、不正利用、セキュリティ上の失敗、誤解を招く安全性の主張をなくすものではない。

ホワイトハウスにとって実務的な課題は、同等のレビュー義務を定義することだ。オープンウェイトのプロバイダーには、より早期の評価とより強固なリリース文書が必要になるかもしれない。ホスト型プロバイダーには、導入後の継続的な監視が必要になるかもしれない。

実運用ではユーザーが予想外の能力を発見するため、リリース後の監視は重要である。管理されたAPIは、利用パターン、不正利用報告、セキュリティインシデントを通じて証拠を生み出す。

オープンモデルでは、中央集権的な可視性が低くなる。下流のホストは安全対策を追加、削除、あるいは特化版を作成する可能性がある。元の開発者は、すべての導入を観察できない。

フレームワークは、閉鎖的な既存大手を守る口実として安全性を使うことなく、これらの違いを考慮すべきだ。大規模な研究所しか満たせないルールは、リスクを減らさずに競争を弱める可能性がある。

小規模な開発者や学術団体も、オープンモデルに依存している。多くの場合、フロンティアシステムを訓練するために必要な計算資源を持たない。アクセスを制限すれば、能力が資金力のある少数企業に集中しかねない。

逆に、無制限の公開は防御側にコストを転嫁し得る。セキュリティチームは、信頼できる連絡先となるプロバイダーがいないまま、改変されたシステムに直面する可能性がある。

この緊張関係は、8月の会合にMetaが参加したことの重要性を説明する。管理されたAPIだけを前提に設計されたフレームワークでは、主要な配布経路がその論理の外に残ってしまう。

また、AnthropicとGoogleの足並みを過大評価すべきでない理由も説明する。両社は安全性研究に参加しているが、製品、政府との関係、オープン性に関する戦略は異なる。

この会合は、業界の統一見解を生み出すものではない。政府が各社の違いをまたいで機能するルールを必要としているため、競合する企業を同じ交渉の場に置くものである。

エンタープライズユーザーにとって、調達では配布アーキテクチャを考慮すべきだ。ホステッドモデルは統合的な管理機能を提供する一方、ベンダーへの依存度を高める。セルフホスト型モデルはローカルでの管理を可能にするが、より大きなセキュリティ責任を顧客側に移す。

開発者は、モデルの重み、プロンプト、認証情報、生成されたアクションがどこに存在するかを整理すべきである。また、インシデント発生時に誰がシステムを停止できるのかも特定する必要がある。

こうした問いは、オープンAIとクローズドAIのどちらが普遍的に安全かを問うよりも実践的だ。答えは、脅威モデル、導入時の統制、そしてシステムを運用する組織によって異なる。

連邦政府のテストは、こうした違いを可視化すべきだ。すべてのモデルを単一の合否ラベルに圧縮してしまえば、実世界のリスクを左右する仕組みが見えなくなる。

フレームワークに実効性があるかを示す3つのシグナル

次の試金石は実装であり、企業の参加状況、ローンチへの影響、そして開発者間で同じ基準が適用されている証拠から始まる。

最初のシグナルは、対象範囲の閾値を公に説明することだ。企業は、リリース前に協議が必要となるモデルを把握する必要がある。顧客にも、連邦政府によるレビューが何を意味するのかを理解できるだけの情報が必要だ。

明確な閾値は、フレームワークの信頼性を高めるだろう。政府当局者が非公開の交渉や政治的な選好によってモデルを選ぶ可能性を減らせる。

曖昧さが続けば、その力は弱まる。開発者はシステムがフレームワークの対象外だと主張できる一方、外部の関係者はその主張を検証できない。

2つ目のシグナルは、モデルが懸念すべき結果を受け取った後に何が起きるかだ。信頼できるプロセスであれば、追加の安全策、段階的なアクセス、さらなる評価といった、文書化された対応につながるべきである。

最も示唆に富むケースは、ローンチ間近の商業的に重要なモデルをめぐるものになる。難しいレビューがすべて当初予定どおりのリリースで終わるなら、このフレームワークは助言的なものに見えるだろう。

遅延だけで成功が証明されるわけではない。当局者は、いかなる介入も定義されたリスクとそれに見合う是正措置に結び付けなければならない。そうでなければ、テストは予測不能な行政上の障壁になり得る。

3つ目のシグナルは、Meta、Anthropic、Google、OpenAI、その他の参加開発者に対する比較可能な扱いだ。比較可能とは、手続きが同一であることを意味しない。同等のリスクには同等の精査が行われるという意味だ。

オープンウェイトのリリースが、有意義なレビューを実施できるだけ早い段階でプロセスに入るかを注視すべきである。また、クローズドな提供者が慎重に選ばれたバージョンだけでなく、大規模な更新も提出するかにも注目したい。

機密扱いのベンチマークを明かさずとも、公的な報告はこの比較を支えられる。政府は、参加日、広範なリスク分類、完了した緩和策、未解決の争点を開示できる。

企業も補完的な証拠を公表できる。モデルカード、システムカード、インシデント報告、バージョン履歴は、連邦政府の評価前後で何が変わったかを説明できる。

エンタープライズの購入担当者は、完璧な政策を待つべきではない。モデルのバージョン管理、セキュリティの証拠、更新通知、アクセス制御、インシデント対応への協力を軸に、調達要件を構築できる。

開発者は、各デプロイメントの前提条件を記録できる。実用的なエンジニアリング向けナレッジベースは、モデル評価をアーキテクチャ上の意思決定や、その後のインシデントと結び付けられる。

ナレッジワーカーも結果を重視すべきだ。モデルは単にテキストを生成するだけでなく、文書、コミュニケーション、ソフトウェアに対して行動する場面が増えている。そのため、安全性の失敗は機密情報や事業運営に影響を及ぼし得る。

8月4日の会合が重要なのは、政府と主要な研究所に運用ルールを議論させるからだ。それは、そうしたルールがすでに機能している証拠ではない。

成功するフレームワークは、高リスクのローンチ前に予測可能なテストを実施し、評価で問題が見つかった場合には信頼できる対応を行う。また、外部の関係者が一貫性を評価できるだけの情報も開示する。

弱いフレームワークは、非公開の会合、開示されない基準、協力に関する包括的な主張を生む。企業はローンチへのインセンティブを維持する一方、政府は明確な権限を持たないまま評判上の責任を負うことになる。

今後数か月で、どちらの形が現れつつあるのかが明らかになるはずだ。読者は、閾値、最初に争点となる結果、そして配布モデルをまたぐ扱いを注視すべきである。

Anthropic、Google、OpenAI、Metaにとって、本当のコミットメントは、安全性に関する知見が都合の悪いものになったときに始まる。ホワイトハウスにとっての試練は、介入に政治的または商業的なコストが伴うときに始まる。

そうした局面が訪れるまで、任意のAI安全性テストは、確立された説明責任の仕組みではなく、交渉の途上にあるフレームワークにとどまる。問題は、最初の困難なケースがローンチを変えるのか、それともローンチをめぐる言葉だけを変えるのかだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page