AnthropicのAI安全性警告、最先端モデルを誰が統治すべきかを巡りOpenAIとNvidiaを分断
Anthropicの研究者らは今月、現在の安全対策にもかかわらず、高度なAIが2030年までに人類を脅かす可能性があるとする異例の警告を発した。AnthropicのAI安全性警告はすぐに、OpenAI、xAI、Nvidia、中国のテクノロジー擁護派を巻き込む論争へと広がった。争点はもはや、最先端モデルが重大なリスクをもたらすかどうかだけではない。そうしたリスクを誰が定義し、対応を誰が管理するのかという問題だ。
元Anthropic研究者のJacob Coxonは、9月9日に公に辞任したことで最新の議論の火付け役となった。Coxonは、AnthropicとOpenAIが責任ある行動を取らないまま、自己改善する超知能の開発競争を進めていると述べた。続いてAnthropicの研究者Evan Hubingerがこの警告を支持し、10年以内に人類が絶滅するリスクについて、個人的な推定値を10%超と示した。
これらの発言は予測であり、独立して検証された測定結果ではない。現在のシステムが資源を獲得し、自律性を維持し、Coxonが描写した破滅的な結果を引き起こせることを示す公開証拠はない。それでも、OpenAI CEOのSam Altman、Anthropic CEOのDario Amodei、Elon Muskは、より強力な外部ガバナンスまたは最先端開発の減速を支持したと報じられている。
Nvidia CEOのJensen Huangは、その前提を退けた。絶滅リスクが10%あるとの主張について問われたHuangは、この推定は「作り話だ」と述べたと報じられている。彼の反応は主要な対立を浮き彫りにした。最先端開発企業が支持する厳格な外部統制と、モデル開発企業、ハードウェア企業、オープンウェイト擁護派が支持する継続開発との対立である。
AnthropicのAI安全性警告が実際に変えたこと
重要な変化は、新たな技術的発見ではない。競合する最先端AIのリーダーたちが、外部監督を公に支持する立場で足並みをそろえたことだ。
Coxonは辞任声明によれば、OpenAIとAnthropicで事前学習に3年間従事していた。事前学習とは、特化した調整の前に大規模データセットからモデルへパターンを学習させる初期プロセスである。彼の経験は声明に異例の注目をもたらしたが、その予測を実証済みの技術的結果に変えたわけではない。
Coxonは、主要AI企業の内部研究者が、高度なシステムが10年の終わりまでに人類を滅ぼす可能性があると心から信じていると主張した。彼は、各社が自らの能力を改善できるシステムを追求していると説明した。このような再帰的自己改善は、AIが後継システムの開発に用いるツールや手法を強化するという、なお理論上のプロセスである。
当初の報道ではCoxonを内部告発者と表現したが、この呼称には留保が必要だ。彼は内部文書を公開せず、隠蔽された不正行為を特定せず、特定の危険な導入事例を開示したわけでもない。彼の声明は、開発競争に対する自身の評価に基づく公の辞任と警告だった。
Hubingerの介入は、この警告に追加の重みを与えた。研究者の辞任で報じられたように、彼はAnthropicに在籍したままCoxonの懸念を支持した。Hubingerは、同社は責任ある行動を取ろうとしているものの、超知能システムを人間の意図と整合させる実証済みの解決策を持たないと述べた。
アライメントとは、未知の状況を含め、AIシステムが意図された目標に確実に従うようにすることを指す。研究者は現在のモデルでアライメントをテストできるが、そのテストから、まだ明確に定義されていない将来のシステムがどう振る舞うかを直接確立することはできない。したがって、この議論には観測可能なモデルの挙動と、まだ公に存在しないシステムに関する予測が混在している。
この区別は重要だ。現在のモデルは、安全でないコードを生成し、ユーザーを誤導し、十分に定義されていない目標を追求し、管理された評価中に弱点を悪用することがある。こうした挙動は、絶滅シナリオを証明せずとも、実践的なセキュリティ対策を正当化する。
業界リーダーによるとされる反応は、議論の政治的な重みを変えた。Altman、Amodei、Muskには競合する製品と商業的利益がある。外部監督に対する彼らの明らかな合意は、AI研究者による孤立した警告よりも強い政策的シグナルを生み出す。
その合意も、なお不完全だ。監査、国際協調、減速を求める声は、どのモデルが対象となるのか、どの試験を適用するのか、誰がリリースを止められるのかを明示していない。停止は、学習の延期、計算能力の制限、導入の制約、配布前の評価義務化などを意味し得る。
これらの選択は、まったく異なる市場を生む。導入審査は完成したシステムを対象とする一方、計算能力の制限はモデルが存在する前の研究に影響する。ライセンス制度はまた、高額なコンプライアンス要件を満たせるほど大規模な組織を優遇する可能性がある。
だからこそ、最新の業界論争は、その劇的な表現を超えて重要である。議論は非公開のリスク推定から、モデル開発に対する制度的統制へと移っている。
最先端AI企業が今、圧力を受けている理由
最先端開発企業が圧力に直面しているのは、より強力なモデルが、観測可能なセキュリティ上の問題と、安全策が機能するという証拠を求める声の双方を増大させるためだ。
AI企業は長年にわたり、より大規模なモデルをより有用なものとして提示する一方、能力の向上が追加的なリスクを生み得ることも認めてきた。そうした企業の内部研究者が既存の計画はなお不十分だと述べれば、この立場を維持するのはより難しくなる。
Anthropicは、安全性研究をアイデンティティの一部として築いてきた。OpenAIも、危険な能力を特定することを目的とした準備態勢と評価プログラムを維持している。こうした取り組みに関わる従業員が深刻な懸念を表明すれば、顧客や政策立案者が内部テストで何が明らかになったのかを問うのは自然なことだ。
しかし、公の発言がもたらす答えは限られている。Coxonの辞任には、彼の期限を裏付ける評価記録、インシデント報告、再現可能な実験は含まれていなかった。Hubingerの割合は観測された失敗率ではなく、個人的な推定だった。
公開証拠の不足は、難しいコミュニケーション上の問題を生む。企業は、悪用を助長しかねないため公開できない機微な知見を持っている可能性がある。また、現実世界での自律性との関係が不確かな管理実験から外挿している可能性もある。
どちらの可能性も精査を正当化する。信頼できるガバナンス制度は、企業が憂慮すべき証拠を持ちながら説明できないという保証に依存することはできない。同時に、未検証の予測がすべて無意味だと仮定することもできない。
外部監査は、提案されている橋渡し策の一つだ。独立した監査人は、危険な技術的詳細を公表せずに、モデル評価、セキュリティ統制、インシデント報告、リリース判断を検査できる。しかし監査人にも、共通基準、有資格者、アクセス権、そして企業が不履行となった場合の権限が必要だ。
米国にはすでに、AIリスクフレームワークという自主的な参照点がある。このフレームワークは、ガバナンス、測定、継続的な監視を軸にリスク管理を体系化している。ただし、最先端モデルに対する世界的な執行制度を作るものではない。
国際協調は、さらに大きな課題を抱える。米国企業数社が採用した制限が、海外の研究所、学術団体、オープンウェイトのコミュニティを自動的に拘束するわけではない。オープンウェイトモデルは、元の開発者が後に方針を変更しても、他者が実行・変更できるパラメータを配布する。
この違いは、クローズドモデル企業に両方向から圧力をかける。安全性擁護派は、より強い制限と独立した検証を求める。顧客と投資家は依然として、より優れたモデル、より広い利用可能性、競争力ある性能を期待している。
開発者は、即時の運用上の問いにも直面している。企業の購入者は、モデルが機密情報を扱えるか、アクションを実行できるか、社内システムへ安全に接続できるかを知る必要がある。エンジニアには、権限境界、監視、障害復旧に関する証拠が必要だ。
これらの問いは絶滅予測ほど劇的ではないが、検証しやすい。企業は、エージェントが権限のないリソースへアクセスしたかどうかを記録できる。安全策が既知の攻撃手法に耐えたか、人間がタスクを中断できたかを測定できる。
したがって、実務的な対応は将来の超知能に関する声明だけにとどまるべきではない。最先端企業には、透明な評価基準、明確に文書化されたリリース基準、重大インシデントの報告経路が必要だ。
こうしたシステムを導入するチームにも、独自の証跡が必要である。モデルテスト、ベンダーの主張、インシデント、意思決定の検索可能な記録は、安全性に関する議論が導入の現実から乖離するのを防ぎ得る。ソース文書と意思決定の文脈を保持する場合、社内の技術ナレッジベースがその作業を支援できる。
したがってAnthropicとOpenAIにかかる圧力は、単に減速することではない。懸念を呼ぶ内部の信念を、顧客、監査人、政府が評価できる検証可能な統制へと変換することだ。
OpenAIとAnthropic、Nvidiaの対立する見解に直面
中心的な対立は、外部統治される最先端開発と、投機的な予測によって技術進歩を制限すべきではないという主張の間にある。
より強力なガバナンスの支持者は、市場インセンティブだけでは破滅的リスクを管理できないと主張する。有能なモデルの公開を遅らせる企業は、より速い競合相手に顧客、人材、投資を奪われる可能性がある。この力学は、各参加者が集団として望むよりも大きなリスクを受け入れることを促しかねない。
これがCoxonの描写した競争である。この解釈では、責任ある経営者は自主的な自制だけで問題を解決できない。安全策を無視して競合相手が優位に立つことを防ぐ共通ルールが必要になる。
Amodeiは独立したモデル監査人を求めたと報じられている。公表された説明によれば、Altmanは国際協調を支持した。Muskも、xAIを通じてOpenAIとAnthropicに直接競合しているにもかかわらず、この懸念を支持した。
彼らの共通する立場には直感的な説得力がある。航空、医薬品、金融市場は、自社が最も重大なリスクを自ら判断することだけに依存していない。独立した審査は盲点を明らかにし、最低限の期待値を確立できる。
AIには、こうした比較では十分に捉えきれない複雑さがある。最先端の能力は急速に進化し、評価者は記憶されたデモンストレーションと一般的な能力を区別するのに苦労することがある。ベンチマークも、開発者が直接それに対して学習すると価値を失い得る。
Huangの反論は、安全性の望ましさではなく、証拠の基盤に異議を唱えるものだ。報じられた彼の回答、「We shouldn’t, because it’s made up」は、絶滅リスクの推定を裏付けのない予測として扱った。彼はまた、過去の予測は誤っていたと主張した。
その批判は、実在する弱点を指摘している。仮説上の超知能が人類を滅ぼす正確な確率を算出できる標準化された手法はない。推定値は、将来の能力、配備条件、人間の対応、競争行動に関する仮定に大きく左右される。
しかし、パーセンテージを退けても、根底にあるすべてのリスクが消えるわけではない。サイバーセキュリティの悪用、自動化された詐欺、生物学分野での支援、信頼性の低いエージェントは、特定の絶滅予測を受け入れずとも評価できる。したがってHuangの立場は、最も強い主張を弱めるものではあっても、より広範な安全性の論拠に決着をつけるものではない。
Nvidiaは市場においても異なる立場にある。同社の事業は、研究所、クラウドプロバイダー、企業、政府がより多くのコンピューティング・インフラを購入することで恩恵を受ける。広範な学習の減速はその需要に影響し、業界全体の実験を制限する可能性がある。
フロンティアモデル企業には、それぞれ独自の利害がある。OpenAIとAnthropicはすでに大規模な技術チーム、コンピューティング分野での関係、配備経験を蓄積している。高額なテストやライセンス取得を求める規制は、小規模な競合企業の参入を難しくする可能性がある。
これは、いずれかの側が不誠実に行動していることを証明するものではない。商業的なインセンティブは、真摯な安全性への信念と両立し得る。それでも、企業が競争環境を再編するルールを提案する際には、考慮に値する。
したがって、より有用な比較は、英雄と否定論者の対立ではない。OpenAIとAnthropicが協調的な監督を好むことと、Nvidiaが広範な制限を課す前に証拠を求めていることの比較である。
実行可能な政策には、両方が必要となる。企業名ではなく測定可能な能力の閾値を用い、同等のシステムには同等の基準を適用する。また、適切な介入を決める際には、実証された危険と推測に基づくシナリオを区別する必要がある。
このアプローチは、即時の世界的停止を求める声を満たさないだろう。同時に、不確実性が何もしないことを正当化するという考えも退ける。意見の不一致が生産的になるのは、それぞれの側が、どのような証拠が自らの立場を変えるのかを明示するときだけである。
安全性をめぐる議論はオープンウェイトをめぐる議論でもある
最大規模のクローズドモデルを中心に設計されたルールはユーザーを保護し得るが、少数の承認済みプロバイダーに支配を集中させる可能性もある。
OpenAIとAnthropicは一般に、ホスト型サービスを通じて主力システムへのアクセスを提供している。ユーザーは企業管理下のインフラにリクエストを送信し、モデルの重みは非公開のまま維持される。この構造により、プロバイダーはアクセス、更新、監視、提供停止を大幅に管理できる。
オープンウェイトの開発者は、外部組織が自らのインフラ上でシステムを実行できるようにするライセンスの下で、モデルパラメータを公開する。この用語は、必ずしも完全なオープンソースを意味しない。学習データ、コード、利用権が制限されたままの場合もある。
この違いは、ガバナンス上の問題を変える。クローズドなプロバイダーは、サービス全体にわたって安全策を更新したり、顧客の利用を停止したりできる。重みが広く流通すると、元の開発者はすべてのコピーに後から変更を確実に適用することができない。
安全性の擁護者は、この制御の喪失を深刻な懸念と見なしている。能力の高いオープンウェイトモデルは、行動上の制限を取り除くよう改変され得る。また、非公開で運用することもでき、中央集権的な監視を困難にする。
オープンウェイトの擁護者は別のリスクを指摘する。高度なAIを少数の企業インターフェースの背後に集中させれば、それらの企業は研究、言論、価格設定、アクセスに大きな影響力を持つ。独立研究者も、基盤となるシステムを検査または実行できなければ、安全性に関する主張を検証することが難しくなる可能性がある。
中国企業は地政学的な側面を加える。公開された報道によれば、中国側の論評は、西側の減速提案を恐怖をあおるもの、そして中国の開発を抑え込む可能性のある取り組みとして位置づけた。中国側の反応は、安全性ルールが競争上の障壁になるかもしれないという懸念を反映している。
この懸念は、戦略的競合相手から出たという理由だけで退けることはできない。既存の米国企業が主導するガバナンス構造は、海外の開発者やオープンウェイトの開発者を不利にする可能性がある。コンプライアンスが、そうした既存企業が管理する非公開の評価に依存する場合、この結果はより起こりやすくなる。
同時に、地政学的な疑念は本物の安全性に関する問題を解決するものではない。モデルの出身国によって、それがサイバー攻撃を支援できるか、危険な指示を生成できるか、ツールを与えられた際に信頼性なく振る舞うかは決まらない。
政策は能力と配備条件に焦点を当てなければならない。小規模な研究モデルが、脆弱性を自律的に発見してコードを実行できるシステムと同じ要件に直面すべきではない。同一のベンチマークスコアを持つ場合でも、公開されたシステムには、ホスト型アシスタントとは異なる管理策が必要になる可能性がある。
市場データはこの議論に情報を与えられるが、決着をつけるものではない。利用ランキングは人々がどのモデルを選ぶかを示し、品質・コスト指標は実用上の性能を比較する。Artificial Analysisのようなプラットフォームは有用なモデル比較を提供するが、人気が安全性を立証するわけではない。
最も深いトレードオフは可逆性に関わる。クローズドシステムは中央集権的な介入を可能にする一方、ユーザーにはプロバイダーを信頼することが求められる。オープンウェイトシステムはローカルでの制御と精査を向上させるが、公開の決定は覆すことが難しくなる。
外部ガバナンスは、どちらか一方の事業構造を正当なものと暗黙に宣言することなく、両方のモデルに対処しなければならない。そうでなければ、安全性基準は、独立した競争を減らしながら既存企業を守る許可制度になるおそれがある。
最も強固な枠組みは、公開前のテスト義務、重大インシデント後の開示要件、特定の能力閾値を超えるシステムに対するより厳格なルールを定めるものだろう。特定の企業に恒久的な承認を与えるべきではない。
そのような枠組みは、正当なセキュリティ研究も保護する。独立評価者には、主張を検証し脆弱性を報告するための保護されたアクセスが必要である。そのアクセスがなければ、外部ガバナンスは名目上は外部であっても、実際には企業が選んだ証拠に依存したままとなり得る。
絶滅という主張が証明しないこと
「私たち全員を殺す」という主張は、その発信源ゆえに重大だが、その期限と確率は公的な証拠によって裏付けられていない。
CoxonとHubingerは、関連する技術的経験を持つ。特に両者がフロンティアモデル開発の近くで働いていたことから、その見解は注目に値する。しかし、専門性が予測を測定された事実へと変えるわけではない。
報道で説明された公的記録には、現在のシステムから人類絶滅へ至る因果の連鎖が欠けている。必要な自律性、持続性、アクセス、戦略的能力を備えた特定のモデルを示していない。また、なぜ決定的な移行が2030年以前に起きるべきなのかも立証していない。
対象となるカテゴリーが定義されていない場合、予測は特に難しくなる。「超知能」は、広範な知的優位性、経済的に有用なタスク全般における卓越した性能、あるいは自律的な戦略的能力を意味し得る。これらの意味は異なるリスクを含意する。
あるシステムは、重要インフラを制御せずとも、多くのデジタルタスクで専門家を上回るかもしれない。逆に、能力の低いシステムでも、監督なしに機密性の高いツールへ接続されれば、深刻な被害を引き起こし得る。したがって、能力と配備権限は一体として評価しなければならない。
10パーセントという数字は、Hubinger個人のリスク推定として読むべきである。繰り返し起きた比較可能な事象から導かれた頻度ではない。研究者が経験的な絶滅率を算出できるような、人工超知能の歴史的事例は存在しない。
この限界は反対側の主張にも影響する。Huangは予測の精密さに合理的に異議を唱えられるが、それを作り話と呼んでも、根底にあるリスクが無視できるほど小さいことは示されない。不確実性は両方向に作用する。
歴史的な背景は、この議論が続く理由を示している。2023年、研究者とテクノロジー業界のリーダーは、GPT-4より高い能力を持つシステムについて6か月間の停止を求めるAI一時停止書簡に署名した。提案された停止は世界的な中断にはつながらず、フロンティア開発は継続した。
この前例は、基本的な執行上の問題を浮き彫りにする。十分な競合相手が参加し、境界について合意した場合にのみ、自発的な抑制は機能する。企業は、安全性の取り組みを減速と表現しながら、後続モデルを改善する研究を継続することもあり得る。
一般の人々は、破局的リスクと現在の被害も区別すべきである。偏った意思決定、プライバシー侵害、労働への影響、誤情報、安全性を欠く自動化された行動は、すでに現実のユーザーに影響を与えている。これらの問題は、2030年の絶滅期限を受け入れることに依存しない。
最も極端な結果だけに焦点を当てると、現在の問題に対する説明責任を弱めかねない。企業は、通常の失敗について限定的な詳細しか示さないまま、遠い将来の超知能を議論できる。批判者も同様に、実測可能なセキュリティ上の弱点を見落としながら、実存的リスクを退けることができる。
より良い基準は、提案が観察可能な安全性を改善するかどうかである。独立評価では、危険な能力、テスト下での欺瞞、無許可のツール利用、人間による中断への抵抗を検証できる。インシデント開示は、配備済みシステムが既定の境界を越えたかどうかを明らかにできる。
信頼できる減速提案は、いくつかの問いに答えなければならない。どの活動を停止するのか、どのシステムが対象となるのか、誰が遵守を検証するのか、そしてどのような証拠が開発再開を認めるのか。こうした詳細がなければ、「減速する」は運用計画ではなく立場にとどまる。
信頼できる拒否には、同様の具体性が必要である。懐疑論者は、どの評価を信頼するのか、どの程度の失敗が介入を正当化するのか、重大インシデント後に責任をどのように割り当てるのかを説明すべきである。
どちらの側も、この作業を公に完了していない。AnthropicのAI安全性に関する警告は事態の重大性を高めるが、議論の中心にある証拠の隔たりを埋めるものではない。
外部AIガバナンスが本物かを示す3つのシグナル
次の試金石は、リーダーたちが安全性を市場閉鎖の手段にせず、公的な合意を監査可能なルールへと転換できるかどうかである。
第1のシグナルは、Anthropic、OpenAI、またはxAIによる具体的な外部監査の提案である。モデルへのアクセス、評価者の独立性、能力の閾値、不合格時の結果を定義すべきだ。監査への一般的な賛同だけでは不十分である。
詳細な提案は、各社が執行可能な監督を求めているという論拠を強める。参加企業が管理するクローズドなプロセスは、それを弱めるだろう。決定的な問いは、独立評価者が自ら選定した証拠を用いて、公開の決定に異議を唱えられるかどうかである。
第2のシグナルは、Nvidiaの証拠基準である。Huangは見出しとなった絶滅推定を退けたが、Nvidiaは、どのリスクを認め、どのテストを有効と考えるのかを明確にすべきである。そうすれば、根拠のないパーセンテージへの批判と、外部からの精査そのものへの反対を区別できる。
公表された評価基準は、意見の相違を狭めるだろう。代替となる枠組みのない一律の否定は、自社インフラ上で構築される、ますます自律的なシステムをNvidiaがどのように評価しているのかについて、顧客を不安なままにする。
第3のシグナルは、特にオープンウェイト開発者と中国の機関からの国際的な反応である。実効性のある枠組みは、少数の米国企業を超えて適用できるルールを必要とする。また、外国製モデルやオープンモデルを、デフォルトで危険と扱うことも避けなければならない。
能力に基づく基準は、ガバナンスの論拠を強める。国籍に基づく制限や既存企業が管理するライセンス制度は、安全性が競争上の障壁になりつつあるという懸念を裏付けるだろう。
読者は、企業のリーダーが何を語るかだけでなく、企業が実際に何をしているかにも注目すべきだ。学習スケジュール、リリース慣行、安全性レポート、アクセス方針は、拡散された投稿よりも強い証拠となる。リリースが加速しているにもかかわらず減速を主張するなら、懐疑的に見るべきだ。
開発者や企業の購買担当者にとって、当面の教訓は実務的である。どのモデルにデータやツールへのアクセスを与えるかを文書化する。権限の境界をテストし、評価結果を保存し、重大な障害についてベンダーに説明を求める。提供企業の安全性に関する自己像を、導入時の統制の代替と見なしてはならない。
ナレッジワーカーも、より小さな規模で同じ規律を適用すべきだ。重要な出力を検証し、機密情報は承認済みのシステム内にとどめ、情報源の文脈を保持する。モデルの知能が高まっても、説明責任を伴う人間の意思決定が不要になるわけではない。
AnthropicによるAI安全性警告は、最も劇的な予測が依然として検証されていないとはいえ、有益な対峙を促した。最先端モデルの開発企業はいま、外部ガバナンスが運用面で何を意味するのかを示す必要がある。Nvidiaをはじめとする懐疑派も、代わりにどのような安全策を受け入れるのかを示す必要がある。
今後数か月の中心的な問いは、ある経営者が論争に勝つかどうかではない。次の能力に関する主張が現れる前に、業界が証拠、独立したレビュー、そして実効性のある閾値を整備できるかどうかだ。



