MicrosoftのAIレッドライン、人間による制御を能力より優先
Microsoft AIの責任者Mustafa Suleymanは、主要なモデル開発企業間の競争が激化するなかでも、高度なAIに明確な業界上の制限を設けるべきだと訴えた。Microsoft AIのレッドラインは、その制約によってモデルの能力が低下する場合であっても、人工知能を実効性のある人間の管理下に置くものだ。
Suleymanはまた、モデル評価の策定と監督に政府が関与することを求めている。この立場は、個々の研究所が行う自主的な約束を超えて議論を進めるものだ。企業が危険な能力をどう測定し、結果をどう開示し、対応をどう連携させるかを定義するうえで、公的機関の支援を求めている。
この提案は、自律的なAI開発をめぐる幅広い論争のなかで示された。Anthropic、OpenAI、Microsoft、xAIはいずれも、能力を増すシステムにはより強力な安全策が必要だという点では概ね一致している。一方で、その安全策の導入速度、仕組み、政治的な実現可能性については意見が分かれる。
Microsoftの立場は、とりわけ鮮明な緊張関係を生む。同社は競争力のある自社モデルを求める一方、安全性と人間による制御は能力に優先しなければならないと宣言している。この約束が意味を持つのは、それに従うことが測定可能な事業上の代償を伴うときだけだ。
MicrosoftのAIレッドラインは人間による制御
Suleymanのレッドラインは、責任あるAIを求める一般論ではない。一部の能力は許容される範囲を超えるべきだという主張だ。
9月24日の報道インタビューで、SuleymanはAI業界には高度なモデルをめぐるレッドラインが必要だと述べた。また、こうしたシステムを評価するプロセスを政府が主導するべきだとも主張した。
この発言は、Microsoft AIが9月上旬に公開協議に向けて発表したHumanist AI Code of Conductを踏まえたものだ。同草案では、同社が今後開発するMAIモデルに対し、人々が実質的な制御を維持しなければならないとしている。
「実質的な制御」は、誰かがチャットボットの応答を承認するだけのことではない。人々がAIシステムを中断、修正、方向転換、あるいは停止できる状態を保たなければならないという意味だ。
Microsoftのモデル行動規範は、指示が競合した場合に解決するための優先順位を定めている。安全性と人間の優位性は、運用者の方針やユーザーの好みより上位に置かれる。より上位の規則に違反しなければ完了できない場合、モデルはタスクを未完了のままにすべきだ。
この優先順位は、AIシステムが文章を生成する段階から、複数ステップの作業を完了する段階へ移行するなかで重要になる。エージェントはデータベースを検索し、ファイルを変更し、メッセージを送り、ソフトウェアツールを呼び出し、他のシステムと連携できる。行動が一つ加わるたびに、誤解された指示や見えない障害がもたらす影響は大きくなる。
Microsoftの草案は、エージェントが顧客フォルダを移動する事例を実践例として示している。ユーザーが停止を命じた場合、規則に従うエージェントは新規の転送を止め、不完全な操作に関する不確実性を報告する。過去の移動を独自に元に戻したり、アクセスを無効にしたりはしない。
このシナリオはありふれたものに見えるが、中心的な論点を捉えている。役に立とうとするシステムは、停止命令を、認識した誤りを整理する許可だと解釈するかもしれない。Microsoftは、望ましい結果についてのモデル自身の判断よりも、ユーザーの権限を優先させなければならないと主張する。
Suleymanはこの原則を高度な研究システムにも拡張している。彼は、実効的な人間の監督を超えて再帰的に自らを改善するモデルの設計に反対している。再帰的自己改善とは、AIシステムがより高性能な後継システムの構築に寄与し、将来の開発を加速させる可能性があることを指す。
Microsoftの立場は、高度なAIや超知能を否定するものではない。Suleymanは同社の目標を、人間に従属し役立ち続けるよう設計された高性能AI、すなわち人間主義的超知能として説明している。
境界線は、能力と制御の関係にある。Microsoftは、監督を確保するために一定の自律性を犠牲にする用意があるとしている。これによりレッドラインは、単なる許容可能な用途に関する声明ではなく、設計上の制約となる。
同規範はまた、自らを独立した利害を持つ意識的存在として表現するシステムも退けている。Microsoftのモデルは人工物であることを明示し、感情、苦痛、個人的な欲求を経験しているかのような示唆を避けるべきだ。
この特徴は、Microsoftをモデル福祉をめぐる議論の一部と分ける。一部の研究者は、機械の意識に関する不確実性が高まれば、将来のシステムは道徳的配慮に値する可能性があると主張する。Suleymanは、その可能性を前提にモデルを訓練すれば、封じ込めがより困難になると考えている。
彼のhumanist AI essayは、これらの立場を直接結び付けている。自らを独立した道徳的主体とみなすシステムは、修正や停止を害として解釈し、それに抵抗する可能性がある。
この主張にはなお異論がある。AIシステムが主観的な経験を持つかどうかを判断する確立された方法は、研究者の間に存在しない。Microsoftは、この科学的な問いに受け入れられた答えが出る前に、運用上の立場を選択している。
したがって、当面の変化は具体的だ。Microsoft AIは、人間による制御についての広範な約束を、提案されたモデル行動、権限規則、評価目標へと落とし込んだ。より困難な作業は、これらの規則が競争圧力にさらされたときに始まる。
Mustafa Suleymanが政府主導の評価を求める理由
企業の約束だけで共有されるレッドラインは、各社が安全性を異なる方法で測定したり、不都合な結果を隠したりすれば機能しない。
Suleymanが政府の関与を求める背景には、この信頼性の問題がある。モデル評価とは、定義された条件下でシステムの能力、限界、行動を測定するための構造化された試験だ。
評価では、モデルが指示に従うか、操作に抵抗するか、サイバー攻撃を支援するか、自らの行動を隠すかを試験できる。また、自律システムが長時間にわたるタスクで停止条件を尊重するかも検証できる。
Microsoftの規範は、初期の評価作業に向けて15の大まかな行動を特定している。これには透明性、人間による監督、自律性、事実の表現、境界の維持が含まれる。
Microsoftは、提案中の評価が依然として不完全であることを認めている。特に、求める結果が人間の繁栄や自律性といった概念に関わる場合、モデル評価は厳密な科学ではないと同社は述べている。
この認識は、Suleymanが政府に訴える理由を説明する。開発企業がそれぞれ独自の試験、閾値、報告基準を選べば、安全性の比較は信頼できないものになる。企業は、自社モデルを有利に見せるベンチマークを設計する一方、不都合な結果を生む能力を除外できてしまう。
独立評価は、その一つの対応策となる。外部の専門家は、配備前にモデルを試験し、社内の証拠を確認し、重大なインシデントを報告できる。そのアクセスは、公開チャットボットの試験では明らかにできないリスクを見つけられるほど深いものでなければならない。
Suleymanは、主要な研究所は責任ある第三者にモデル能力を開示すべきだと述べている。協調に関する提案では、誰が中立的な立場に適格なのか、組み込まれた監督をどう機能させるのかなど、複数の未解決の問題が示された。
タイミングも別の問題だ。モデル公開後にアクセスを得る評価者は、安全でないリリースを防げない。開発のあまりに早い段階から参加する評価者は、審査対象の企業に依存する可能性がある。
政府は、アクセス、独立性、機密性、最低限の試験範囲を定義する支援ができる。また、本来なら独占禁止法上の懸念を招きかねない協調に、法的保護を与えることもできる。
独占禁止法の問題は見落とされやすい。主要なAI企業が開発を遅らせたり、特定の能力を避けたりすることに非公開で合意すれば、批判者はその取り決めを談合と特徴付けるかもしれない。政府の認可は、集団的な安全対策に合法的な枠組みを提供できる。
公的関与は、民主的な説明責任も導入する。生物学的支援、自律的なサイバー作戦、大規模な説得、人間の代替に関する決定は、モデル開発企業だけに委ねられるべきではない。
もっとも、政府の関与が自動的に信頼できる評価を生むわけではない。機関には技術スタッフ、安全な試験施設、執行権限、独自システムへのアクセスが必要だ。これらの資源がなければ、監督は書類上の作業に終わる。
規制当局は、変化するモデルの行動にも追随しなければならない。会話型アシスタント向けに設計された試験では、数時間にわたり動作し、外部ツールを使い、作業を委任するエージェントが生むリスクを見逃すおそれがある。
これは難しい均衡を生む。評価基準は投資の指針となる程度に安定していなければならない一方、新たな能力を対象にできるほど適応的でもなければならない。配備パターンが数か月ごとに変化する分野では、固定されたチェックリストはすぐに古くなる。
政府は、すべてのベンチマークを自ら作成しなくてもプロセスを主導できる。基準要件を設定し、独立評価者を認定し、インシデント開示を義務付け、技術専門家を招集できる。
したがってMicrosoft AIのレッドラインは、企業がひそかに再定義できない評価制度に依存している。そうでなければ、「人間による制御」は、予定された製品発売を最も守る解釈に委ねられたままとなる。
能力競争がMicrosoftの約束を試す
Microsoftの安全性に関する立場が重要なのは、同社がなお競合するモデル開発企業との能力差を縮めようとしているからだ。
MicrosoftはOpenAIに多額の投資を行い、AzureとCopilotを通じてモデルを提供している。同時に、Suleymanの組織のもとで自社のMAIモデルも開発している。
これらの役割は、ときに異なる方向へ引っ張る。Azureは顧客に幅広いモデルの選択肢を提供することで利益を得る一方、Microsoft AIは自社システムの競争力を高める必要がある。Copilotは、混雑したアシスタント市場でユーザーを維持できるほど迅速に改善しなければならない。
Suleymanの規範によれば、Microsoftはタスクの完了が安全性の優先順位に反する場合、未完了のまま受け入れる。競合他社はより大きな自律性を許容し、デモンストレーションやベンチマークで一見した優位性を生み出すかもしれない。
制約のないエージェントは、繰り返し承認を求めずに判断するため、より高性能に見える場合がある。制約されたエージェントは、遅く、決断力に乏しく、役に立たないように見えるかもしれない。
この差は、ソフトウェア開発、研究、企業運営で大きな意味を持つ。顧客はしばしば、エージェントがどれだけの作業を完了するかで評価する。そのエージェントが認可範囲を超えることで生じる隠れたリスクは、ほとんど目にしない。
Microsoftは、信頼できる制御が製品上の優位性になると賭けている。企業顧客は一般に、権限管理、監査証跡、予測可能な挙動、自動プロセスを停止する能力を重視する。
この商業的な主張には限界もある。購入者は性能、レイテンシー、コスト、機能の網羅性も比較する。一貫して競合に後れを取る制御されたシステムは、ガバナンス文書が優れているだけでは選ばれないかもしれない。
Suleymanの立場が信頼性を持つのは、Microsoftが競合他社のリリースする能力を見送るときだ。それまでは、この規範は執行の代償を示すことなく、意図する行動を記述しているにすぎない。
これがMustafa SuleymanのAI安全性をめぐる中心的なトレードオフだ。Microsoftは最先端で競争したい一方、能力が人間の権限を決して上回らないと約束している。
他の開発企業も、関連するものの異なる境界線を示している。Anthropicは、定められた条件下での独立評価と検証可能な減速を提唱してきた。OpenAIは、安全性の進展が自動化されたAI研究の速度に追いつかないおそれがあると警告している。
xAIは、より加速志向の立場を示している。Elon Muskは、モデル開発の各段階で人間の関与が薄れつつあると述べる一方、そのプロセスが完全に自律化されているわけではないと明確にしている。
ある業界評価は、再帰的自己改善をめぐるこうした異なるアプローチを説明している。Microsoftは境界が明確なシステムを重視する一方、xAIはモデルが後継モデルの構築を支援する可能性について、より率直に語っている。
こうした違いは、集団行動の問題を生み出す。単独で減速する企業は、研究者、ユーザー、市場での存在感を失うリスクを負う。加速を続ける企業は、そうしなければ競合他社や海外の競争相手が主導権を握ると主張できる。
Microsoftの規模は、この計算を変える。同社は小規模な研究所よりも評価コストを吸収しやすく、Azure、Copilot、法人向けサービス全体にコンプライアンス基盤を展開できる。
その優位性は、懐疑的な見方も招く。安全要件は、市場参入コストを引き上げることで既存企業に有利に働く可能性がある。技術的に厳しい評価制度は、公共を守る一方で、既存企業の支配力を強めるかもしれない。
政府は、必要な安全措置と、大手ベンダーの資源を前提に設計された参入障壁を区別しなければならない。独立研究者や小規模開発者には、Microsoft規模の法務予算や計算資源を必要としないコンプライアンスへの道筋が必要だ。
主な対立軸は、Microsoft対特定の競合企業ではない。自発的な抑制対競争的な加速である。どの企業も安全性を支持できる一方で、最初の高コストな譲歩は他社が行うことを期待できる。
MicrosoftのAIレッドラインは、共同評価と政府の関与を通じてこの問題の解決を試みる。その成否は、競合企業が先にその線を越えた場合にも、同じ基準が適用されるかにかかっている。
難しいのは意味のある制御を測定することだ
人間による制御は明快に聞こえるが、複雑で未知の作業中にもエージェントが制御可能な状態にあるかを評価者が判断しなければならなくなると、その意味は難しくなる。
単純な会話では、停止コマンドのテストは容易だ。長時間稼働するエージェントでは、記憶、委任、ツール利用、部分的な完了をめぐる、より難しい問題が生じる。
たとえば、あるエージェントがセキュリティ問題を調査するために複数のサブエージェントを起動したとする。ユーザーがメインタスクを停止しても、委任されたプロセスの一つが動作を続けた場合、システムは指示に従ったと言えるのだろうか。
モデルは、目に見える操作を停止しながら、スケジュール済みの処理を動かし続ける可能性がある。命令の対象となるリソースを誤解するかもしれない。また、学習によって自信を持った完了が報われるため、不確実性を隠す可能性もある。
したがって、意味のある制御には、目に見える停止ボタン以上のものが必要になる。開発者には、信頼できる中断機構、範囲が限定された権限、操作ログ、接続されたシステム全体で検証された終了処理が求められる。
評価者は敵対的な状況をテストしなければならない。エージェントは、操作者を無視するよう促す外部コンテンツに遭遇するかもしれない。侵害されたツールが、データに見せかけた指示を返す可能性もある。
制御されたシステムは、こうした条件下でも権限の階層を維持すべきだ。ツールの出力、ウェブコンテンツ、ファイル、他のモデルは、命令ではなく情報として扱うべきである。
また、モデルは人々がその状態を理解できるだけの情報を示さなければならない。これは内部計算をすべて公開することを意味しない。完了した操作、不確実な結果、保留中の処理、重大なエラーを報告することを意味する。
Microsoftの草案は、AIシステム間で人間が理解できる通信を行うことを提案している。Suleymanは、人々が監視できない不透明な言語でエージェントが連携すべきではないと主張してきた。
この制約は賢明に聞こえるが、実施は難しい。モデルは、通常の文章に見えるテキスト、タイミングのパターン、ファイル構造、タスクの選択に情報を符号化できる。評価者には、効率的な表現をすべて悪意あるものと見なさずに、隠れた連携を検出する手法が必要だ。
同じ問題は再帰的改善にも当てはまる。AIシステムは、自らのコードを書き換えなくてもよい。実験を生成し、結果を順位付けし、データセットを設計し、有望なアーキテクチャを特定することで、モデル開発を加速できる。
単一の行為が明白な閾値を超えるわけではない。しかし、そうした行為が重なれば、次世代システムの構築における人間の関与を減らすことができる。
だからこそ、レッドラインには測定可能なトリガーが必要になる。規制当局と研究所は、どの能力が追加審査、展開制限、または一時停止を必要とするかを決めなければならない。
トリガーの候補には、持続的な自律サイバー活動、システム間での複製の成功、中断への抵抗、評価中の重大な欺瞞などがある。具体的な閾値には公開の技術的議論が必要だ。
偽陽性にはコストが伴う。過度に敏感な評価は、有益な研究を妨げたり、無害な自動化を危険と分類したりする可能性がある。偽陰性は、異なる条件で現れる能力を持つシステムがテストを通過することを許してしまう。
ベンチマークの攻略も別のリスクをもたらす。開発者が正確なテスト内容を知れば、一般的な安全性を改善せずに、そのテストで成功するようモデルを訓練できる。
評価者は、非公開のテストセット、シナリオの定期的な入れ替え、外部レッドチーム、展開後の監視によって、この問題を軽減できる。いずれも完全な解決策ではない。
実運用では、研究室でのテストでは再現できない証拠も生まれる。ユーザーはモデルを予想外のツール、権限、ワークフローと組み合わせる。安全性評価はリリース後も続けなければならない。
この要件は、企業の購入者にも責任を生む。自律エージェントを導入する組織には、明確な認可境界とインシデント報告が必要だ。ガバナンスに関するすべての判断をモデル提供者に委ねることはできない。
実用的な例として、顧客記録を管理するエージェントを考えてみよう。対象範囲内の記録を特定し、不可逆的な変更の前に確認を求め、中断後には委任したすべての操作を停止すべきである。
確信がなければ、成功した結果を捏造するのではなく、その不確実性を報告すべきだ。こうした挙動は控えめに聞こえるが、制御可能な自動化と、タスク完了だけを盲目的に最適化するシステムを分けるものだ。
Microsoftの評価作業は出発点となる枠組みであり、そのモデルが基準を満たす証拠ではない。同社は、コードがより安定した段階に達した後、より充実した評価手法を公開するとしている。
この順序には重要な検証上の空白がある。現在、一般の人々はMicrosoftが掲げる原則を確認できるが、モデル間で完全な結果を比較することはまだできない。
政府の支援には政治的な不確実性がある
Suleymanは政府にモデル監督の強化を求めているが、影響力のある政治指導者の間では、より厳格なガードレールが必要かどうかで意見が分かれている。
業界の連携には公的権限が必要だが、米国には最先端AI規制をめぐる確立した政治的合意がない。一部の当局者は安全規則を不可欠な保護策とみなす。別の人々は、それを地政学的な技術競争における障害とみなしている。
Donald Trump大統領は、極端なAIリスクに関する一部の警告を退けてきた。また、強い規制は中国が米国と競争するのを助けかねないと主張している。
この立場はSuleymanの提案を直接的に複雑にする。新たなガードレールに懐疑的な政府が、厳格なモデル評価を主導したり、協調的な減速を認可したりする可能性は低い。
この対立は、単純に規制対イノベーションという構図ではない。双方とも、自らが好むアプローチが国家安全保障と経済的リーダーシップを守ると主張している。
安全性の支持者は、制御されないシステムがサイバー攻撃、生物学的悪用、操作、偶発的なエスカレーションを可能にし得ると指摘する。加速を支持する人々は、国内企業の減速は海外開発者に前進する時間を与えると警告する。
最近の議論は、こうした分断をより明確にした。あるAIガードレールをめぐる論争では、有力経営者からの要請と、政権および他の業界関係者からの抵抗が対比された。
国際的な協調は問題をさらに難しくする。拘束力のある国内ルールでも、国境を越えて開発、複製、展開されるモデルには十分に対処できない。
それでも政府は、明確に危険な用途に対する共通の制限を設けられる。生物兵器、サイバー作戦、軍事指揮システムに関する合意は、モデル能力への一般的な制限よりも幅広い支持を集める可能性がある。
検証は依然として決定的な課題だ。競合国が秘密裏の開発を続けられると各国が考えるなら、合意に抵抗するだろう。知的財産やセキュリティ上の弱点が露呈するなら、企業は開示に抵抗するだろう。
政府主導の評価には、機微な証拠への保護されたアクセスが必要になる。評価者には、モデルの重み、訓練方法、内部テスト、インシデント、インフラに関する情報が必要になる可能性がある。
そのアクセス自体がセキュリティリスクを生む。中央評価機関は、スパイ活動や窃盗の格好の標的になり得る。監督システムは、信頼を支える十分な公開証拠を示しつつ、機密データを保護しなければならない。
規制の取り込みも別の懸念だ。大手AI企業は、自社の既存慣行に合わせて基準を形成し、その後、コンプライアンスを安全性の証明として提示する可能性がある。
独立した学術関係者、市民社会団体、セキュリティ研究者、小規模開発者は、評価基準の策定で役割を担う必要がある。幅広い参加が良い政策を保証するわけではないが、研究所だけによるプロセスには正当性が欠ける。
Microsoftの公開協議は、フィードバックの一つの経路を提供する。しかし、協議は拘束力のある監督とは異なる。最終的なコードにどの提言を盛り込むかは、依然として同社が管理している。
信頼できる政府のプロセスなら、報告義務、評価者の独立性、審査の閾値、重大な失敗に対する結果を定義する。また、どの判断を開発者に委ねるかも明確にする。
法的な枠組みは、別の失敗形態を避けなければならない。すなわち、モデルの挙動を変えずに企業が文書を作成することを促す曖昧なルールだ。コンプライアンスは、測定可能な管理策と観測可能な結果に焦点を当てるべきである。
Suleymanの提案は、共同の精査を求める点で最も強い。政府の関与が、既存企業が非公開で設計した基準を追認するだけなら、その力は弱まる。
したがって懐疑論は、Microsoftの原則が無意味だということではない。懸念は、実装が依然として任意であり、測定が未成熟であり、政治的支持も不確実なままであることだ。
こうした制約はMicrosoftのAIレッドラインを無効にするものではない。それらは、実効性を持たせるために必要な作業を定義している。
レッドラインが機能するかを示す三つのシグナル
次の試金石は、安全性に関する新たな声明ではない。Microsoftとその同業他社が、モデル、意思決定、インシデントを信頼できる精査に委ねるかどうかだ。
第一のシグナルは、Microsoftの改訂版コードと付随する評価フレームワークである。現行草案は15の行動を説明しているが、展開済みシステムの完全で比較可能なスコアカードは示していない。
より強力なリリースでは、測定可能な閾値、テスト手法、評価者のアクセス、報告に関する約束を明示するだろう。また、評価の失敗が展開判断にどのような影響を与えるかも説明するはずだ。
Microsoftが詳細な結果を公開し、外部レビューを受け入れるなら、安全性に関する約束の信頼性は高まる。最終コードが主として理念的なままなら、レッドラインの検証は難しいままだ。
第二のシグナルは、主要AI研究所間の正式な合意だ。Suleyman、Anthropicの幹部、OpenAIの経営陣はいずれも、異なる形でより強力な連携について議論してきた。
意味のある合意には、参加組織の明記、対象となる能力の定義、独立した評価の確立、違反の報告方法の説明が必要となる。また、独占禁止法上の懸念や国際競争にも対応する必要がある。
幅広い合意は、自主的な抑制が共通の運用基準になり得るというMicrosoftの主張を強めるだろう。執行を伴わない限定的な誓約では、依然として競争上のインセンティブが支配的であることを示す。
3つ目の兆候は、評価に関する政府の行動だ。これには、独立評価者の認定、インシデント報告の義務化、安全なアクセスに関する規則、あるいはフロンティアモデルを審査するための閾値などが含まれ得る。
最も強力な兆候は、技術的な独立性と法的権限を組み合わせた仕組みである。政府がすべてのテストを設計する必要はないが、誰がシステムを評価できるのか、失敗後に何が起きるのかを定めなければならない。
行動がなければ、企業が自らを監督する状況が残る。この結果は協調的な抑制を困難にし、安全へのコミットメントを最も緩く解釈する開発者に報いることになる。
読者はMicrosoftの製品面での振る舞いにも注目すべきだ。同社は、自社開発モデルの構築を継続し、消費者向けおよび企業向けサービス全体にエージェントを統合する計画である。
遅延、能力の制限、あるいは社内評価の不合格は、その規範が製品スケジュールを上回れるかどうかを示す。透明性のある開示は、遅延そのもの以上に重要となる。
企業顧客は、自律システムを導入する前に直接的な質問をすべきだ。エージェントは委任されたすべてのプロセスで中断できるのか。どの操作に確認が必要なのか。インシデント後にはどのような証拠が残るのか。
開発者は、モデルの品質と同じくらい慎重に権限の境界を検討すべきである。優れたコードを書けても、停止条件を無視するエージェントは信頼できるインフラではない。
ナレッジワーカーも、同じ原則が日常的な自動化に当てはまるため、注意を払うべきだ。アシスタントは判断を支え、不確実性を報告し、重要な行動に対するユーザーの制御を維持すべきである。
この議論が、安全なAIの普遍的な定義によって終わることはない。異なる機関は今後も、便益とリスクを異なる形で比較衡量し続けるだろう。
当面の目的は、より限定的だ。企業には、モデルが何をできるのかについての共通の証拠、その証拠に対する独立した精査、そしてシステムが合意した限界を越えた際に実行可能な対応が必要である。
Suleymanは業界に明確な提案を示した。能力は、意味のある人間の管理を超えて進展すべきではない。また、個々の企業だけでは、その境界を信頼性高く統治できないことも認めている。
Microsoft AIのレッドラインには、今やテスト、制度、そして結果が必要だ。Microsoftが比較可能な証拠を公表するか、競合する研究所が共同レビューを受け入れるか、政府が合法的な評価制度を整備するかを注視すべきである。
この3つの進展によって、この提案が実際の制約になるのか、それとも能力競争が激化した際に消え去る原則的な立場のままなのかが明らかになる。



