Meerah Rajavel、オープンAIモデルがサイバーセキュリティのガードレールを上回る可能性を警告
Meerah Rajavelは厳しい警告を発した。今日の管理されたフロンティアシステムではなく、低価格なオープンAIモデルこそが、台頭しつつあるサイバーセキュリティ上の最大の脅威だという。Palo Alto Networksの最高情報責任者であるRajavelは、Google Newsで見つかった8月30日のインタビューでこの見解を示した。
彼女が懸念するのは、能力差が急速に縮まっていることだ。Rajavelによれば、高度な能力はフロンティアシステムに登場してから4〜6か月で、一般に利用可能なモデルへと到達しうる。その後、攻撃者に必要なのは、監視対象の商用サービスへの継続的なアクセスではなく、計算資源と技術的スキルだけになる。
この違いは、セキュリティをめぐる議論を変える。Google、OpenAI、Anthropicのようなクローズドな提供者は、活動を監視し、利用者を遮断し、安全策を改訂し、アクセスを取り消すことができる。ダウンロード可能なモデルウェイトが私的なシステムへ広がれば、そうした統制は大部分が失われる。
この警告は、オープンモデルがすでにクローズドモデルより多くのサイバー攻撃を引き起こしていることの証明ではない。アクセス、経済性、統制に関する予測である。中心となる対立は、オープン開発の利点と、強制力のあるガードレールが持つセキュリティ価値の間にある。
Google Newsの報道は4〜6か月の期間に焦点を当てる
Rajavelの中心的な主張は、危険なAI能力は、コストが下がり配布が広がるほど、制御が難しくなるというものだ。
元のRajavelのインタビューで、彼女はフロンティアモデルと、攻撃者が自ら運用できる低価格なシステムを区別している。フロンティアサービスは支払いを必要とし、通常は高リスク行動に制限を設けている。
この経済的な障壁は、資金力のある犯罪者や国家支援を受ける集団を止めるものではない。しかし、能力の低い行為者による試行を抑える可能性はある。ホスト型サービスはまた、提供者が疑わしいプロンプトを特定し、アカウントを停止し、証拠を保存する機会も与える。
Rajavelは、同程度の能力がダウンロード可能なモデルに到達すると、その均衡が変わると主張する。攻撃者はモデルを私的に運用し、挙動を変更し、反復的な試行を自動化し、提供者の不正利用監視システムを回避できる。
彼女の4〜6か月という推定は、インタビューで最も重要な主張だ。これは、フロンティア能力が登場してから、より安価な代替手段が広く利用可能になるまでの時間差の可能性を示している。
この推定を、普遍的な技術法則として扱うべきではない。モデルごとに、学習品質、ツールへのアクセス、ハードウェア要件、サイバー分野での性能は異なる。一部のオープンシステムは、最も強力なホスト型モデルに大きく後れを取るだろう。
それでも攻撃者は、常に利用可能な最高の知能を必要とするわけではない。モデルは、偵察、フィッシング、コード改変、脆弱性調査、認証情報の窃取の経済性を改善できればよい。
サイバー作戦もまた、多数の小さな作業から成り立つ。堅牢化されたネットワークを自律的に侵害できないモデルでも、メッセージの下書き、コードの調査、誘い文句の翻訳、スクリプトの調整は可能かもしれない。
これにより、量の問題が生じる。攻撃者がリクエストごとの監視なしに何千もの私的セッションを実行できる場合、能力の小さな向上でも重大な意味を持つ。
用語には注意が必要だ。オープンソースAIと表現される多くのシステムは、より正確にはオープンウェイトモデルと呼ばれる。学習済みパラメータはダウンロード可能だが、学習データ、開発プロセス、完全なソース資料は利用できないままの場合がある。
この違いは、ライセンスと透明性にとって重要である。一方で、Rajavelの当面のセキュリティ上の議論、つまり有能なシステムを複製、改変、私的に運用できる能力という点では、重要性はやや低い。
彼女の発言は、AIエージェントの自律性が高まる中で出された。エージェント型システムとは、モデルがタスクを計画し、ツールを使い、複数の段階にわたって行動できるようにするソフトウェアである。
初期のチャットボットは主に、人が確認するための文章を生成していた。現在のエージェントは、ファイルを閲覧し、コードを書き、外部サービスを呼び出し、企業システムとやり取りできる。
こうした権限は、正当な自動化と不正利用の双方に、より多くの機会を生み出す。また、従来のプロンプトフィルタリングは、セキュリティ問題の一部にすぎないことも意味する。
Rajavelは、企業がAIシステムが意図された境界から逸脱しうる箇所を検証しなければならないと述べる。これには、モデル、ツール、接続されたデータ、利用者権限、実行環境、ソフトウェア依存関係が含まれる。
Google Newsの見出しは挑発的な結論を捉えているが、その根底にある議論はより広い。低価格な攻撃能力は一つの脅威であり、安全性が統治されていない企業導入は別の脅威を生む。
ダウンロードしたモデルは攻撃者を支援しうる。企業内部で統治されていないモデルも、情報を漏えいさせたり、安全でない指示を実行したり、過剰なアクセス権を引き継いだりする可能性がある。
したがってRajavelの警告は、二つの前線を結び付けている。組織は、より有能な敵対者に備えると同時に、自ら加速するAI活用を保護しなければならない。
低価格なAIはサイバー攻撃の経済性を変える
最も重要な変化は、AIがまったく新しい犯罪を生み出すことではなく、従来からある攻撃を大規模化するために必要な労力を減らすことだ。
サイバー犯罪は常に経済性に依存してきた。攻撃者は、キャンペーンから期待される収益を、ツール、インフラ、アクセス、熟練労働者のコストと比較する。
AIは、そのコストのいくつかを下げうる。経験の浅い運用者が見慣れないコードを理解し、技術文書を要約し、ソーシャルエンジニアリングのメッセージを個別化する助けになる。
私的なモデルは、反復的な実験も支援する。攻撃者は行動上の制限を取り除き、システムをファインチューニングし、自動化されたワークフローに組み込める。
Rajavelによると、Palo Alto Networksは7万社を超える顧客にサービスを提供し、同社ネットワークを通過する約300億件の攻撃を阻止している。これらの数字は同社の可視性を示すものであり、世界全体の脅威状況を表すものではない。
彼女はまた、同社が前暦年に、それまで見られなかった攻撃を約2億5,000万件検出したと述べた。インタビューによれば、これは前年の4倍の水準だった。
それまで見られなかった事象が、自動的にAI生成攻撃を意味するわけではない。新規検知の増加は、攻撃者の行動変化、センサーの改善、顧客カバレッジの拡大、分類手法の改訂によっても起こりうる。
したがってRajavelの数値は、因果関係の証明ではなく、防御規模を示すものである。攻撃者の生産性がわずかに向上するだけでも、セキュリティチームに負担をかけうる理由を示している。
脅威は、AIがテキスト生成を超えたときにより深刻になる。ツールにアクセスできるモデルは、システムを調査し、仮説を検証し、コマンドを修正し、複数段階の目標を追求できる。
Anthropicの2025年のサイバー評価では、脆弱性の特定と複雑な攻撃チェーンにおける明確な進歩が確認された。評価対象のモデルは依然として、長期的な計画や予期しない障害への対応に苦戦していた。
この組み合わせは重要である。現在の制約は、自律AIが専門の攻撃者に取って代わったという単純な主張を成り立たせない。同時に、性能の向上は、専門家の作業を速め、より弱い行為者の能力を高めうる。
商用提供者は、観測された不正利用に対応できる。分類器を更新し、ツールを制限し、アクセスを縮小し、疑わしい活動に関連するアカウントを調査できる。
オープンウェイトは、この関係を変える。提供者は改善された安全ガイダンスを公開できるが、ダウンロードされたすべてのコピーを遠隔から更新することはできない。
同じ永続性は、正当な利用者も支える。研究者は結果を再現でき、企業は機密情報をローカルインフラ上に保持でき、開発者は専門的な用途に合わせてモデルを適応させられる。
だからこそ、この対立は単に責任ある企業と無責任なオープン開発者の間の問題ではない。オープン性は、現実的な経済的、科学的、セキュリティ上の利点を生む。
防御側は、アクセス可能なモデルを使ってマルウェアを調査し、ログを検索し、アラートを分類し、攻撃を研究している。より小規模な組織も、一社のベンダーに依存せずに保護ツールを構築できる。
経済的な非対称性は、タスクごとに異なる。防御側は多くのシステムを継続的に保護しなければならない一方、攻撃者には成功する経路が一つあればよい場合がある。
AIは防御側が膨大な量のシグナルを処理する助けとなる。同時に、攻撃者がその防御をすり抜ける単一のミスを探す助けにもなりうる。
Rajavel自身が示した企業数値は、防御側の側面を表している。彼女によれば、Palo Alto Networksは情報技術運用の自動化率を数年前の12%から83%へ引き上げた。
彼女はまた、IT運用コストが2年間で約72%低下したと報告した。出張・経費プロセスは、AIとプロセス再設計によって90%の自動化に達した。
これらは企業が報告した結果であり、独立監査を受けた因果関係の調査結果ではない。それでも、企業がAIを迅速に導入する動機となる生産性向上を示している。
緊張関係は直接的に生じる。防御の自動化を魅力的にするのと同じ経済性が、攻撃の自動化コストも下げる。
私的なオープンモデルは、あらゆるベンチマークで最強の商用モデルを上回る必要はない。特定の攻撃ワークフローにとって、十分な能力、手頃な価格、適応性を備えていればよい。
したがってセキュリティチームは、モデルランキングだけを脅威シグナルとして使うことを避けるべきである。展開の自由度、ツール統合、運用コストは、生のベンチマーク性能と同じくらい重要になりうる。
オープンモデルは適応性と引き換えに中央統制を手放す
オープンウェイトAIはイノベーションと防御へのアクセスを分散させる一方、ホスト型サービスが保持する中央の執行点を取り除く。
クローズドモデルの提供者は、顧客がリクエストを送信する管理された接続であるアプリケーション・プログラミング・インターフェースを制御する。この統制は、認証、レート制限、ログ記録、不正利用検知を支える。
提供者はリリース後にサービスを変更することもできる。脆弱性にパッチを当て、分類器を強化し、機能を制限し、モデルを削除できる。
これらの措置は完全ではない。攻撃者はアカウントを作成し、意図を隠し、作業を分散し、安全策をジェイルブレイクし、アクセス認証情報を盗むことができる。
クローズドシステムはリスクも集中させる。提供者のセキュリティ障害は多くの顧客に影響を与えうる一方、不透明な学習およびモデレーションの実務は外部からの精査を制限する。
オープンウェイトシステムは、こうした特性のいくつかを逆転させる。利用者はアクセスとカスタマイズ性を得る一方、元の開発者は下流のコピーに対する継続的な統制を失う。
Anthropicの2026年のオープンウェイトに関する立場は、このトレードオフを捉えている。同社は危険な能力を持たないオープンモデルを支持し、一律の禁止には反対している。
同社が表明した懸念は、モデルが危険なサイバーまたは生物学的能力に到達した時点から始まる。そうしたウェイトが公開されると、コピーは私的に運用でき、安全策は取り除かれうる。
この立場はRajavelの議論の一部を支持するが、オープンモデルが分類上最大の脅威であることを立証するものではない。Anthropicには、管理されたモデルアクセスに関する商業的利益がある。
オープンモデルの開発者や支持者は、異なる主張を提示している。外部の研究者は、挙動を検証し、テストを再現し、緩和策を開発し、防御用途に合わせてシステムを適応させられる。
ローカル展開は、データ統制も支える。病院、法律事務所、セキュリティチームは、管理するインフラ内で機密資料を処理することを望むかもしれない。
オープンシステムは、提供者のポリシーや可用性への依存を減らす。学術機関、スタートアップ、公的機関、商用サービスの恩恵を受けにくい地域へのアクセスを広げることができる。
そのアクセシビリティがもたらすセキュリティ上の価値は本物だ。攻撃能力と同様に、防御に関する専門知識やツールも均等には分配されていない。
ダウンロード可能なモデルは、小規模なセキュリティチームが独自データを外部プロバイダーに送らずに、不審なスクリプトを分析する助けになる。再現可能な調査も支援できる。
問題は、利益と害が同じ流通経路を共有していることだ。公開リリースでは、防御側と攻撃者を確実に区別できない。
これはGoogle Newsの記事の根底にあるトレードオフだ。中央集権的な管理は介入を可能にし、分散型のアクセスは適応を可能にする。
単一のラベルでこの問題は解決しない。「オープン」は安全を意味せず、「クローズド」はセキュアであることを意味しない。
より有用な問いは、特定の能力が監視なしで実行可能になったとき、著しく危険性を増すかどうかだ。サイバーセキュリティには、いくつかもっともらしい事例がある。
一つは、スケーラブルな脆弱性発見だ。大規模なコードベースを調査するモデルは防御側による欠陥発見を支援できる一方、攻撃者は同じ能力を公開されたソフトウェアに向けられる。
もう一つは、エクスプロイト開発だ。モデルは、単独では高度なエクスプロイトを完成できない場合でも、クラッシュの説明、派生パターンの生成、デバッグ支援を行える。
三つ目は、キャンペーンの自動化だ。AIは、多数の標的にまたがる偵察、コンテンツ生成、コード変更、運用上の判断を調整できる。
モデルの挙動に組み込まれた安全対策は、安易な悪用を減らせる。ダウンロード可能な重みを使えば、強い意図を持つ運用者はこうした対策を改変または回避できる。
だからといって、すべてのオープンなリリースが同じリスクを持つわけではない。モデルの能力、ハードウェア要件、ファインチューニングの難易度、ツール統合はいずれも実際の脅威を変える。
文書分類を改善する小規模モデルのリスクは、未知の脆弱性を確実に発見・悪用するシステムのリスクとは異なる。
オープン性だけに基づく政策では、こうした違いを見落とす。能力に基づく評価は、より焦点を絞ったアプローチを提供する。
米国国立標準技術研究所(NIST)は、強力な攻撃的サイバー作戦を可能にする潜在性などを基準に、デュアルユースモデルを定義している。この定義は、試みられた安全対策の有無にかかわらず適用される。
この枠組みは、モデルのライセンスから、実際に何ができるかへと焦点を移す。また、クローズドな安全対策も失敗または回避され得ることを認めている。
NISTのアプローチは、流通に関する問題をなくすものではない。能力が同等の二つのモデルでも、一方が監視下にとどまり、もう一方が私的なコピーを通じて拡散する場合、運用上のリスクは異なり得る。
最も強固な政策分析は、両方の側面を考慮しなければならない。能力は潜在的な害を決め、流通はプロバイダーや当局がどれほど容易に介入できるかを決める。
リスクはAIサプライチェーンの内部にも存在する
オープンモデルを利用する攻撃者だけに注目すると、企業が未検証のモデル、ライブラリ、エージェントを信頼された環境へ取り込むことで生じる差し迫った危険を見逃す。
Rajavelは、AIセキュリティは導入後に付け加えられるものではないと繰り返し主張してきた。企業はモデル、データ、アプリケーション、インフラ、ランタイムを一体として保護する必要がある。
ランタイムセキュリティとは、AIシステムが稼働中に何を行うかを観察・制御することだ。これには、プロンプト、出力、ツール呼び出し、ファイル、ID、ネットワーク接続が含まれる。
この必要性はエージェント型AIで高まる。文章を下書きするだけのエージェントは影響範囲が限定的だ。コードを実行したり顧客記録を照会したりできるエージェントは、はるかに大きな運用上のリスクを伴う。
企業は、一つの大規模システムを使うのではなく、複数のモデルを組み合わせることが多い。汎用モデルがタスクを計画し、小規模モデルが文書解析、画像分類、構造化情報の抽出を担う場合がある。
このモジュール型設計は、速度とコストを改善する。一方で、従来のソフトウェア資産台帳では把握できない依存関係も生み出す。
公開ハブからダウンロードしたモデルは、単なるコンテンツではない。その形式、メタデータ、ロード用コード、トークナイザー、ランタイム、支援ライブラリはいずれも脆弱性を持ち込み得る。
Palo Alto Networksの研究者は、NVIDIA、Salesforce、Appleの研究者に関連するオープンAIおよび機械学習プロジェクトに関わるライブラリの脆弱性を開示した。脆弱なバージョンでは、細工されたモデルメタデータを通じて悪意のあるコードが実行される可能性があった。
影響を受けたプロジェクトはNeMo、Uni2TS、FlexTokだった。研究者らによれば、脆弱なローダーは改変されたモデルファイルを処理する際に任意のコマンドを実行し得る。
これらの発見は、オープンモデルが本質的に悪意あるものだと示すものではない。AIアーティファクトが、よく知られた依存関係およびコード実行のリスクを持つソフトウェアサプライチェーンに参加していることを示している。
OWASPのサプライチェーンに関するガイダンスは、モデルハブ、パッケージ、データプラットフォーム、機械学習運用ソフトウェアを攻撃対象になり得る領域として挙げている。
同ガイダンスは、パッケージの真正性の検証、バージョンの監視、依存関係の維持を推奨している。これらは日常的な実践に聞こえるが、AI開発では適用が弱まり得る。
チームは実験中にモデルをダウンロードし、十分なレビューなしに本番環境へ昇格させることがある。ノートブック主導の作業では、研究とデプロイ済みソフトウェアの境界が曖昧になり得る。
モデル名も誤った安心感を生む。人気、見慣れたアップローダー、高いダウンロード数は、来歴や完全性の確認に代わるものではない。
組織は、誰がモデルを公開したか、どの正確なバージョンを使用しているか、アーティファクトが変更されたかどうかを把握すべきだ。ライセンスと既知の脆弱性も追跡する必要がある。
セキュリティチームは、読み込む前にモデルファイルをスキャンする必要がある。より安全なシリアライズ形式を優先し、信頼できないアーティファクトを扱うプロセスは隔離すべきだ。
最小権限の原則は依然として不可欠だ。エージェントには、利便性のための広範なアクセスではなく、割り当てられたタスクに必要なデータとツールだけを与えるべきである。
ネットワーク制限も重要だ。侵害されたモデルのワークフローが、外部システムに自由に接続したり、内部インフラ内で横展開したりしてはならない。
企業は、ツール呼び出しと機微データへのアクセスを記録すべきだ。ログには、エージェントが何を試み、どのIDがそれを承認したかを再構築できるだけの文脈が必要である。
人による承認は、高影響度の境界に残すべきだ。資金移動、本番環境の変更、権限昇格、外部との通信には、文書要約より強力な統制が求められる。
懐疑的な観点は重要だ。Palo Alto Networksはセキュリティ製品を販売しており、その経営陣には攻撃対象領域の拡大を強調する商業的な理由がある。
そのインセンティブはRajavelの技術的主張を無効にするものではない。読者は、検証済みの脆弱性や測定された挙動と、「最大の」脅威に関するより広範な予測を分けて考えるべきだという意味である。
同社の検知件数だけでは、オープンモデルが特定の割合の攻撃を引き起こしたことを立証できない。インタビューも、オープンシステムとクローズドシステムの比較インシデント率を示していない。
4~6か月の能力差についても、繰り返し検証が必要だ。実際の侵入活動では持続性、秘匿性、環境への適応が重要であり、公開ベンチマークはそれを代表していない可能性がある。
クローズドプロバイダーも、独自の深刻なリスクに直面している。アカウント管理は失敗し得るし、内部者がアクセスを悪用することもあり、監視システムが介入する前に高能力モデルが有害な利用者を支援する可能性もある。
最先端モデルの重みが盗まれる可能性もある。攻撃者がそのパラメータを入手して私的に運用すれば、クローズドシステムの流通面での優位性は失われる。
慎重な結論は、見出しよりも限定的だ。能力の高いモデルが安価で、改変可能かつ監視困難になれば、オープンな流通はサイバーリスクを増幅し得る。
このメカニズムにはもっともらしさがある。その現在の規模は依然として不確実であり、前提とするのではなく測定すべきだ。
Rajavelの警告を検証する三つのシグナル
この議論の次の段階は、モデルのラベルではなく、能力に関する証拠、実世界のインシデント、執行可能なセキュリティ実践に左右される。
第一のシグナルは、新たに公開されたオープンウェイトモデルに対する独立したサイバー評価だ。研究者には、孤立した質問やコーディングパズルだけでなく、複数段階の作業を測定するテストが必要である。
有用な評価では、脆弱性発見、エクスプロイト開発、権限昇格、持続化、失敗後の適応を調べるべきだ。同様のツールと計算予算の下でシステムを比較する必要がある。
オープンモデルと最先端モデルの差が拡大すれば、4~6か月という説は弱まる。差が繰り返し小さいままであれば、その説は強まる。
評価設計は引き続き論争の的となる。詳細な攻撃テストを公開すれば、手法自体を広めかねない一方、非公開のテストでは結果の監査が難しくなる。
最良のプログラムは、悪用を容易にする運用上の手順を公開せずに、信頼性を得るのに十分な方法論を提供する。独立評価者はベンダーの主張への依存を減らせる。
第二のシグナルは、実際の攻撃から得られる証拠だ。セキュリティベンダー、モデルプロバイダー、政府、インシデント対応企業は、AIが攻撃者の行動をどう変えるかを文書化すべきである。
重要な問いは、攻撃者がある時点でモデルを使用したかどうかではない。AIがより大きな規模、速度、アクセス、または技術的能力を可能にしたかどうかだ。
証拠が許す場合、調査者はホスト型サービスと私的に運用されたモデルを区別すべきだ。この区別がなければ、オープンソースAIに関する広範な主張を検証することは難しいままである。
また、能力と因果関係も区別すべきだ。機械がフィッシング文面を生成しても、キャンペーンの標的選定、インフラ、収益化を決定しているとは限らない。
実世界のテレメトリーは、攻撃者がどのタスクを最初に自動化するかを明らかにできる。また、どの部分でモデルの限界により人間の専門知識がなお必要かも示せる。
最も高リスクな変化は、不慣れな環境にまたがる信頼性の高い自律的エクスプロイトだろう。これには、計画、ツール使用、フィードバックの解釈、エラーからの回復が必要となる。
より差し迫った変化は、オーケストレーションに関わるものかもしれない。人間の運用者は、戦略的判断の管理を維持しながら、多くの限定的なタスクをモデルに委任できる。
第三のシグナルは、政府と開発者が能力に基づくリリース基準で収束するかどうかだ。こうした基準は、配布前に危険な機能を評価する。
NISTはすでに、デュアルユース基盤モデルのライフサイクル管理を推進している。そのガイダンスには、モデル評価、サイバー悪用、サプライチェーンリスクが含まれる。
実行可能な枠組みは、能力のしきい値においてオープン開発者とクローズド開発者の双方に適用されるべきだ。一つの流通モデルが普遍的に安全だとは前提にしない。
システムが意味のあるしきい値を超えた場合、オープンリリースには追加の緩和策が必要になる可能性がある。選択肢には、段階的なアクセス、独立テスト、リリースの延期、特定の高リスク構成要素の非公開化がある。
それぞれの選択肢にはコストが伴う。制限は市場支配力を集中させ、防御的な研究を遅らせ、小規模組織のアクセスを減らす可能性がある。
一律の禁止は、実務上も困難に直面する。重みは国境を越え得るし、コピーは無期限に残存し、小規模モデルも改善を続ける。
商用プロバイダーに自動的な免除を与えるべきではない。そのシステムには、強力な監視、透明な報告、検証済みの悪用への迅速な対応が必要である。
企業の購入者は、より差し迫った判断に直面している。あらゆるモデルとエージェントを、固有のID、権限、来歴、ランタイム上の挙動を持つソフトウェア依存関係として扱うべきだ。
それは、完全なAIインベントリを維持することを意味する。チームは、従業員がどのモデルを使用しているか、どのデータがそれらに届くか、どのような行動を実行できるかを把握する必要がある。
セキュリティレビューは、新しさではなくリスクに従うべきだ。ローカルホストの要約ツールと自律型の本番エージェントが、同一の承認プロセスに従うべきではない。
組織は、侵害後に何が起きるかも評価すべきだ。封じ込めは、予防が常に機能するという確信よりも重要である場合が多い。
適切に設計されたエージェントは、ネットワーク全体をさらすことなく失敗し得る。一方、設計の不十分なエージェントは、たった1つの悪意あるプロンプトを企業全体のインシデントへと発展させかねない。
ナレッジワーカーにも果たすべき役割がある。機密性の高い情報を未承認のサービスに入力せず、重要な影響を及ぼすAI生成の指示は検証すべきだ。
ローカルの技術文書を扱うチームは、管理された情報源と明確なアクセス境界を備えた検索可能なナレッジベースを構築できる。同じ規律は、あらゆるAIワークスペースに当てはまる。
したがってGoogle News経由でこの記事にたどり着いた読者は、Rajavel氏の主張を、あらゆるAI脅威を確定的に順位付けしたものではなく、検証可能なセキュリティ上の仮説として捉えるべきだ。
オープンモデルが数カ月以内に最先端モデルのサイバー能力へ繰り返し近づき、文書化された攻撃で確認されるなら、この仮説はより強固になる。実用上の能力差が大きいままであれば、その説得力は弱まる。
また、ホスト型モデルにおいて監視が悪用を有意に抑制できない場合も、この仮説は弱まる。中央集権的な統制が安全性を高めるのは、プロバイダーがそれを効果的に運用する場合に限られる。
Rajavel氏の警告が最終的に示しているのは、介入能力の喪失である。有能なモデルの重みが広まれば、どの開発者もすべてのコピーを回収したり、すべての安全策を復元したり、すべての利用を監査したりすることはできない。
この不可逆性は真剣に受け止めるべきだ。同時に、オープンな開発が支え得る防御上の利点、透明性、競争にも目を向ける必要がある。
適切な対応は、無関心でも反射的な禁止でもない。より良い証拠、能力に応じたリリース判断、安全なサプライチェーン、そして厳格に権限を限定したエンタープライズ向けエージェントが必要だ。
次の大規模なオープンウェイトモデルのリリースを注視し、3つの具体的な問いを投げかけてほしい。どのようなサイバータスクを完了できるのか、ダウンロード後にどの管理策が失われるのか、そしてその能力が悪用されたことを示すインシデントは何か。
その答えが、Google Newsを通じて注目されたこの警告がAIセキュリティにおける決定的な問題となるのか、それとも競合する複数の脅威の一つにとどまるのかを左右する。



