top of page

DARPA、標準的なF-16にAIを搭載。真の試練は戦闘規模での信頼だ

DARPAと米空軍はAIが操縦するF-16を飛行させたが、この機体は無人でも、人間の監督なしで運用されていたわけでもない。安全パイロットがコックピットに搭乗し、いつでも操縦を取り戻せる状態にあった。重要な初の成果は別の点にある。携帯型の自律システムを搭載した標準的な戦闘機を、AIエージェントが操縦したのだ。

この違いにより、プログラムは一回限りの研究機を超える段階へ進む。改修されたF-16は、Viper Experimentation and Next-generation Operations Model、通称VENOMプログラムに属する。その自律性キットは、機体の中核ソフトウェアを置き換えることなく、AIエージェントを戦闘機の操縦系統と任務システムに接続する。

この飛行は、軍事自律性をめぐる競争圧力も変える。DARPAは、シミュレーションで試験されたアルゴリズムが、複数機による複雑な任務でも予測可能な挙動を維持できることを示さなければならない。一方、空軍には、これらのエージェントがパイロットを圧倒したり人間の統制を弱めたりせず、Collaborative Combat Aircraft構想を支援できるという証拠が必要だ。

DARPAがEglinで実際に飛ばしたもの

中核となる成果は、空のコックピットではない。実験的AIと実運用の戦闘機プラットフォームを結ぶ、再利用可能な橋渡しを実現したことだ。

DARPAの飛行発表は2026年7月16日に公開された。発表では、フロリダ州のEglin Air Force Baseで実施された飛行中試験について説明している。AIエージェントが、空中試験プラットフォームとして改修されたF-16の飛行を自律的に制御した。

空軍は6月に改修機の飛行を開始した。初期飛行では、追加のハードウェア、ソフトウェア、計測機器を搭載した後もジェット機が安全に動作するかを確認した。その後、チームは7月に自律操縦試験へ進んだと、同軍のVENOM飛行アップデートは伝えている。

試験中は常に人間のパイロットがコックピットに残った。パイロットはAIを監視し、機体が予想された挙動から外れた場合には介入できた。この方式はhuman-on-the-loop controlと呼ばれ、機械が行動する一方で、人間が監督し介入権限を保持することを意味する。

これはhuman-in-the-loop controlとは異なる。後者のモデルでは、システムが進む前に人間が特定の行動を承認または実行しなければならない。この違いは重要だ。将来の戦闘機は、パイロットがあらゆる動きを手動で指示するよりも速く、いくつかの判断を下す必要があるからだ。

DARPAは、詳細な機動リスト、性能評価表、あるいは7月の任務シナリオの完全な説明を公表していない。発表によれば、エージェントは飛行を制御し、今後は運用上関連性のある実飛行シナリオで複数のエージェントを試験する。したがって、入手可能な証拠からこの飛行を、監督なしの戦闘任務と表現することはできない。

F-16にはVENOM Autonomy Kit、すなわちVAKが搭載された。DARPAによれば、このキットは戦闘機の中核ソフトウェアを変更せずに、飛行制御と任務システムに接続する。コックピット内のスイッチにより、パイロットは従来の操縦とAI操縦を切り替えられる。

中核ソフトウェアをそのまま維持することには戦略的価値がある。自律性に関する実験のたびに戦闘機の飛行制御システムを書き換えれば、試験は遅れ、認証リスクも増す。独立したインターフェースなら、基盤となる機体を維持しつつ、研究者はAIモデルをより頻繁に変更できる。

このアーキテクチャは、より明確な安全境界も生む。AIは単に、ジェット機内のすべてのシステムへ無制限にアクセスするわけではない。エンジニアはインターフェースを計測し、指令を監視し、制限を設定し、意図した挙動と実際の機体応答を比較できる。

これにより、機体は自律兵器の試作機ではなく、飛行する実験室となる。研究者はエージェントを読み込み、飛行データを収集し、失敗を検証してから次の出撃に向けてモデルを改訂できる。このプロセスは反復的なソフトウェア開発に似ているが、あらゆる誤りが安全性が極めて重要な物理システムの中で生じる。

この飛行が重要なのは、航空自律性をシミュレーションだけで検証できないためだ。シミュレーターは、まれで危険な状況を含む多数の遭遇事例を生成できる。しかし、あらゆるセンサーの不完全さ、通信障害、気象条件、整備上のばらつき、予期しないパイロットの反応を再現することはできない。

実際のF-16は、エージェントにこうした物理的制約との相互作用を強いる。また、試験チームにタイミング、操縦品質、センサー統合、人間の監督に関する証拠を提供する。こうした詳細が、この技術が管理された研究環境を離れられるかを決める。

F-16試験はスケーリングの試験でもある

DARPAはすでに、AIが管理されたドッグファイトで戦闘機を飛ばせることを示した。VENOMが問うのは、その能力を再現可能な基盤へと変えられるかどうかだ。

直近の歴史的な参照点は、空軍テストパイロット学校が運用する、独自に改修されたF-16であるX-62A VISTAだ。DARPAのAir Combat Evolutionプログラムのもと、AIエージェントは視程内戦闘シナリオで、人間が操縦するF-16を相手にX-62Aを飛行させた。

DARPAは2024年4月に、これらの自律ドッグファイトを発表した。飛行試験は2023年にカリフォルニア州のEdwards Air Force Baseで始まっていた。安全パイロットが同乗し、プログラムは試験イベントの間にアルゴリズムを調整した。

これらの飛行は重要な技術的疑問に答えた。AIエージェントは試験上の統制の範囲内で、高性能戦闘機に動的な空中戦機動を指示できた。しかし、X-62Aは特定の研究任務を持つ特殊な機体であり続けた。

VENOMが狙うのは別のボトルネックだ。米国に必要なのは、印象的な実証を担える1機のジェット機ではない。多くの競合エージェントを評価するのに十分な、計測化された航空機、試験能力、ソフトウェア・インターフェース、訓練された人員だ。

ここでいう「標準的」という言葉には注意が必要だ。VENOMのF-16は改修後、通常の実運用戦闘機と同一ではない。特殊な機器と計測装置を搭載している。重要なのは、中核ソフトウェアを置き換えることなく、従来の保有機プラットフォームに自律性パッケージが追加された点だ。

このアプローチは、実世界での試験量を拡大できる。より多くの出撃により、センサーの不確実性や通信妨害を含む、より多くの条件にエージェントをさらせる。複数の航空機なら、一対一のドッグファイトでは明らかにできない協調、役割分担、競合する目標も試験できる。

DARPAのArtificial Intelligence Reinforcementsプログラム、すなわちAIRは、この次の段階でVENOMフリートを使用する。AIRは、戦闘エージェントをシミュレーションから、次第に複雑になる実飛行シナリオへ移行させることを目的とする。示された方向性には、視程外および複数機での作戦が含まれる。

視程外戦闘は、航空機が直接目視できない範囲の目標と交戦する際に発生する。パイロットはセンサー、データリンク、識別プロセス、電子戦情報、交戦規定に依存しなければならない。このため、近距離戦で相手を正面に捉え続けることよりも難しい自律性の課題となる。

ドッグファイトでは迅速な操縦と戦術的機動が求められる。視程外作戦では、不確実性のもとで情報を管理する必要がある。エージェントは、他機と協調しつつ任務上の制約を守りながら、不完全または欺瞞的な可能性のあるデータに基づいて判断しなければならない。

複数機での試験は、さらに別の層を加える。エージェントは任務を分担し、行動の重複を避け、編隊の安全を維持し、別の航空機が通信を失った場合に対応しなければならない。その挙動は、人間の任務指揮官にも理解可能である必要がある。

だからこそ、インターフェースはアルゴリズムと同じくらい重要だ。1機の研究用航空機の中でしか機能しない強力なエージェントには、運用上の価値が限られる。共通の試験パイプラインは、同様の条件下でエージェントを比較し、成功した挙動をプラットフォーム間で移行できる。

したがって、このプログラムは生の能力を実証する段階から、評価システムを構築する段階への転換を表している。DARPAは、シミュレーション、実飛行、失敗分析、モデル改訂の間のサイクルを短縮しようとしている。各段階では、人間がエージェントの行動理由を理解できる十分な証拠を保持しなければならない。

このスケーリング目標は、安全パイロットが脚注ではない理由も説明する。人間の監督により、チームは予期しないすべての指令を機体喪失事故として扱うことなく、より積極的なアルゴリズムを探究できる。パイロットは介入への統制された経路を提供し、その間にプログラムは証拠を収集する。

ただし、評価者が任務完了だけを測定すれば、監督は弱点を隠しかねない。頻繁な人間の修正を必要とするエージェントは、運用上自律的ではない。今後の開示では、介入、安全制限の作動、ソフトウェア障害、自律的な任務完了の成功を分けて示すべきだ。

AIが操縦するF-16が空軍にとって重要な理由

空軍が主に目指しているのは、パイロットを自律型F-16に置き換えることではない。パイロットが無人航空機の集団を指揮するために必要な証拠を構築することだ。

DARPAはVENOMを、Collaborative Combat Aircraftを含む将来の統合部隊作戦の基盤と位置付けている。CCAは、有人戦闘機とともに運用され、割り当てられた任務役割を果たす無人航空機を配備する空軍の取り組みだ。

この関係は間接的だが重要である。空軍はすべてのF-16を自律型戦闘機に変える必要はない。目的に特化して設計された無人システムに同様の自律性が導入される前に、エージェントを試験できる安全で十分に理解されたプラットフォームが必要なのだ。

F-16は既知の飛行特性、確立された整備手法、安全パイロットのための空間を備える。この組み合わせが実験に適している。新しい無人航空機では、自律性が予期せず挙動した場合に、同じような即時の人間による回復手段は得られない。

空軍は別途、CCAベンダーのプラットフォームをまたぐ政府所有のソフトウェア・フレームワークを試験している。そのオープンアーキテクチャのアプローチは、空軍を単一のベンダーに縛り付けることなく、自律性ソフトウェアを異なる航空機で動作させるために設計されている。

VENOMも、同じ広範な考え方を支える。航空機、自律性エージェント、任務ソフトウェアは、それぞれ異なる速度で進化すべきだ。モジュール式インターフェースにより、エンジニアは機体全体を再設計することなくエージェントを更新できる。

この分離は、従来の防衛請負企業と新興の自律性企業の双方に圧力をかける。機体メーカーは、任務インテリジェンスが一つの航空機に恒久的に結び付いたままだと考えることはできない。ソフトウェア開発者は、管理されたシミュレーションやベンダー固有の実証の外でもエージェントが機能することを証明しなければならない。

それは人間の操作者にも圧力をかける。DARPAが描く将来の役割は、単に1機を操縦するパイロットの後をドローンが固定ルートで追うというものではない。1人が、変化する脅威に対応する複数の自律プラットフォームを指揮することになる。

DARPAのACEプログラムの目標では、この体制の前提条件として信頼が示されている。このプログラムが近距離戦から始まったのは、その環境では迅速で目に見える結果が生じるためだ。より大きな目標は、より複雑な交戦における人間と機械のチームワークである。

信頼とは、AIが常に正しいと信じることではない。人間のパイロットもその基準を満たしてはいない。運用上の信頼には、エージェントがいつ信頼できるのか、どこで失敗するのか、危険な判断を人がどれほど迅速に認識し修正できるのかを把握することが必要だ。

パイロットに提示されるインターフェースは極めて重要になる。指揮官は、敵対的環境下の任務を管理しながら生のモデル出力を精査することはできない。システムは過度な認知負荷を生まずに、意図、確信度、制約、介入の要請を伝えなければならない。

将来の護衛任務を考えてみよう。ある無人機がセンサーデータを収集するため先行し、別の機体が兵器や電子戦装備を搭載するかもしれない。人間のパイロットに必要なのは、あらゆる旋回を手作業で指定することではなく、目標と制約を割り当てることだ。

通信が弱まった場合、エージェントはどの任務を継続できるかを理解していなければならない。また、いつ帰投し、待機し、責任を引き継ぐべきかも把握する必要がある。友軍部隊や民間空域の近くで航空機を運用する前に、こうした挙動を検証しなければならない。

空軍は、異なるベンダーのエージェントが協調できる証拠も必要としている。オープンアーキテクチャで解決できるのは問題の一部にすぎない。2つのシステムが技術的なインターフェースを共有していても、優先順位、確信度、脅威データを異なる形で解釈する可能性がある。

実機による複数機編隊試験は、こうした不一致を明らかにできる。エージェントが同じ目標を奪い合うか、両立しない推奨を出すか、共有情報を失った後に予測不能な振る舞いをするかを示せる。こうした失敗は、孤立したデモンストレーションでは発見しにくい。

ここでVENOMは、単なるF-16の物語を超える。この航空機は、将来の航空作戦を形作るソフトウェア間の関係を試験するための統制された環境を提供する。その価値は、そこで得られた知見を無人プラットフォームへどれだけ移転できるかに左右される。

難題は戦闘環境下での信頼

飛行の成功は制御経路が機能することを示す。しかし、戦時にAIが合法的で、戦術的に妥当かつ予測可能な判断を下すことを証明するものではない。

DARPA当局者は、彼らが現代戦の「霧と摩擦」と呼ぶ状況下での性能と信頼性が、なお未解決であることを認めている。この慎重な姿勢は、この問題の核心である。実際の戦闘では、欺瞞、損傷したセンサー、不完全な通信、そしてエージェントへの入力を積極的に操作する敵対者が持ち込まれる。

AIシステムは、訓練で扱ったシナリオでは良好に機能しても、条件が変化すると失敗する可能性がある。敵はデコイ、電子的妨害、通常とは異なる編隊、意図的に曖昧な行動を用いるかもしれない。そこで生じる問題は、通常のソフトウェア信頼性の問題ではない。

戦闘における自律性は、開発時に用いたデータと運用環境が異なることを意味する分布シフトに対処しなければならない。エンジニアはシフトが起きたことを把握できても、どの判断が失敗するかは分からない場合がある。したがって試験では、想定外の条件下での挙動を測定する必要がある。

センサーデータにも不確実性が伴う。レーダー航跡は消失し、識別情報は矛盾し、ネットワークメッセージは遅れて届くことがある。あらゆる入力を同じ信頼度で扱うエージェントは、破損した状況図から確信を持った判断を下しかねない。

プログラムはサイバー耐性も試験する必要がある。自律化キットは戦闘機内部に新たなソフトウェアおよびハードウェアの接続を生み出す。各接続は、不正なコマンド、侵害された更新、悪意あるデータ、サプライチェーン上の脆弱性から保護されなければならない。

人間による介入も、依然として未解決の変数である。安全パイロットは試験飛行中にスイッチを切り替えられるが、実運用の指揮官は複数の航空機を同時に監督する可能性がある。問題に気づくまでに要する時間が、それを防ぐために残された時間を上回るかもしれない。

自動化バイアスのリスクもある。システムが正確に見えるとき、人は機械の推奨に過度な重みを置きがちだ。圧力下にあるパイロットは、その前提を十分に理解しないままAI生成の計画を承認するかもしれない。

反対の問題も同じほど深刻である。エージェントが警告を出しすぎる、明確な説明なしに計画を変更する、あるいは繰り返し修正を求める場合、パイロットはそれを信頼しなくなるかもしれない。常時監視を必要とする航空機は、負荷を減らすどころか増やしかねない。

したがって軍事試験に必要なのは、勝敗の記録だけではない。評価者は、介入頻度、不安全コマンド率、任務完了率、説明の質、通信喪失後の復旧、未知のシナリオに対する性能を測定すべきだ。

公表情報は、VENOMについてまだこうした結果を提供していない。DARPAは、自律飛行の出撃回数、AIが制御を維持した時間、安全パイロットが介入したかどうかを明らかにしていない。また、7月の飛行で試験されたエージェントも特定していない。

軍事プログラムにおけるこの限定的な開示は理解できる。戦術的な詳細は能力や弱点を明らかにし得る。それでも外部の観察者は、大きな自律性の進展と統合上の成功という節目とを区別できなくなる。

AIプログラムが増えるなか、国防総省はより広範なガバナンス上の課題に直面している。以前のGAO assessmentは、省全体のAI戦略、リソースの説明、インベントリ、協働ガイダンスに不足があると指摘した。これらの調査結果はVENOMを具体的に評価したものではないが、技術的進歩と制度的監督をともに前進させるべき理由を示している。

兵器政策は別の境界線を設ける。自律飛行制御は、自律的な目標選定や兵器使用と自動的に同義ではない。公表された発表は、独立した致死的権限ではなく、操縦、戦術エージェント、将来のチーム運用に焦点を当てている。

執筆者と政策立案者は、この区別を維持すべきだ。人間が兵器に関する判断を保持したまま、エージェントが速度、方位、高度、戦術的位置取りを制御することは可能である。将来の構成ではより大きな権限が割り当てられる可能性があるが、7月の発表はそれを立証していない。

最も信頼できる前進の道筋は、段階的な拡張である。エンジニアは制約された飛行挙動から始め、不確実なセンサー入力を導入し、協調する航空機を加え、その後に任務レベルの意思決定を試験できる。各段階には、明確な限界と測定可能な失敗条件が必要だ。

レッドチーム演習は不可欠になる。独立したチームは、エージェントを混乱させ、通信を断ち、センサー入力を操作し、任務目標間の衝突を引き起こそうとすべきだ。目的は、敵対者より先に脆弱な挙動を見つけることである。

プログラムは、パイロットが存在することと完全な安全性を混同してはならない。人が介入できるのは、システムが自身の状態を伝え、行動に十分な時間を残す場合に限られる。一部の失敗は、人間が認識するより速く進行する可能性がある。

つまり、信頼とは繰り返し成功するデモンストレーションによって生まれる感覚ではない。それは性能の境界に関する、証拠に裏付けられた判断である。VENOMが運用上意味を持つのは、ストレス下でもその境界が明確である場合に限られる。

DARPAと空軍が次に示すべきこと

VENOMが有用な戦闘インフラとなるかを決める3つのシグナルは、透明性のある試験指標、複数機編隊飛行の成功、そしてCCAプラットフォームへの移転である。

最初のシグナルは、測定可能な評価フレームワークだ。機微な戦術的詳細が機密のままであっても、DARPAは出撃ごとにエージェントをどのように比較するかを示すべきである。介入回数、ソフトウェア障害、制御限界の作動、復旧性能は、より明確な全体像を提供するだろう。

こうした指標は、航空機の統合と自律的な推論を区別しなければならない。クリーンな飛行制御インターフェースは必要だが、任務に関する判断についてはほとんど何も語らない。別々のスコアカードがあれば、失敗が航空機、自律化キット、センサー処理、エージェントのどこに起因したのかを明らかにできる。

未知のシナリオから得られる証拠は、プログラムの主張を強化する。エージェントは、センサー劣化や予期しない航空機挙動を含め、開発者に伏せられた条件に直面すべきだ。そこで一貫した性能を示せれば、ソフトウェアが見慣れた戦略を再生しているだけではないことを示すだろう。

2つ目のシグナルは、計画されている実機による複数機編隊試験への移行である。自律航空機1機であれば、人間の敵対者に反応したり、定義された任務に従ったりできる。複数のエージェントは、協調し、任務を分担し、共有情報を管理し、参加者の1つが失敗した際に復旧しなければならない。

複数機編隊試験は、人間と機械のインターフェースも明らかにする。パイロットは、すべての制御動作を監視せず、目標と制約を通じてチームを指揮できるべきだ。航空機が1機増えるごとに作業負荷が急増するなら、運用コンセプトは弱まる。

観察者は、プログラムが通信劣化をどう扱うかを注視すべきである。自律的な僚機は、競合下の作戦で途切れないリンクに依存できない。そのフォールバック時の挙動は、人間の指揮官にとって予測可能であり、編隊の他の機体とも整合していなければならない。

複数機編隊イベントの成功は、VENOMが拡張可能な戦闘自律性を支援するというDARPAの主張を強めるだろう。厳密に台本化された条件やパイロットによる繰り返しの介入を必要とするデモンストレーションであれば、その主張の範囲は狭まる。

3つ目のシグナルは、改修F-16からCollaborative Combat Aircraftへの移転である。ソフトウェアの可搬性は、モジュール型自律性における中心的な約束だ。その約束は、VENOMを通じて開発されたエージェントが、異なるセンサー、性能限界、任務装備を備える航空機で動作するときに試される。

移転は自動的には実現しない。F-16は、無人CCAプラットフォームとは異なる飛行特性とコックピットシステムを持つ。エンジニアは、一般化可能な戦術的挙動を、試験機に固有の前提から切り分けなければならない。

空軍が保有するアーキテクチャは、この移行の管理を助けることができる。共通インターフェースは、異なるベンダーのソフトウェアを統合するための作業を軽減できる。しかし、それによってエージェントが新しい機体へ移った後に正しく振る舞うことが保証されるわけではない。

したがって、信頼できる移転試験では、技術的な互換性と任務性能の両方を検証すべきだ。ソフトウェアを読み込むのは最初の一歩にすぎない。エージェントは、速度、航続距離、センシング、搭載能力という異なる制約に適応しながら、安全な挙動を維持しなければならない。

産業界からの競争的な反応も重要になる。機体メーカーは、自社のプラットフォームが複数の自律化パッケージを支援できることを証明しようとするだろう。AIベンダーはシミュレーション結果を強調するだろうが、実機飛行の証拠がより価値の高いベンチマークとなる。

調達判断は、政府が自らの試験データを信じているかどうかを明らかにする。成功したVENOMエージェントが共通インターフェースを通じてCCA実験に入れば、このプログラムは研究以上のものに影響を与えたことになる。自律性が実運用の航空機に到達する方法を変えたことになる。

この主張を弱めるシグナルもある。飛行の節目の間隔が長く空くことは、統合または安全性の問題を示す可能性がある。1つの専門化されたエージェントへの依存が続けば、約束された試験パイプラインに疑問が生じる。

報告される介入データがないことも、別の空白を残す。機密プログラムはすべての結果を公表できないが、集計された安全性と信頼性の指標でも、技術が成熟しているかを示すことはできる。それらがなければ、公的な主張の評価は引き続き難しい。

開発者がこれを重視すべきなのは、VENOMが民生のエージェントシステムにもなじみ深い考え方を、極めて厳格な条件下で試験しているからだ。モデルの可搬性、可観測性、人間によるオーバーライド、敵対的試験、限定された権限は、軍用航空をはるかに超えるソフトウェア設計上の問題である。

エンタープライズの購入者も、同じ教訓に注目すべきだ。デモンストレーションの成功は、信頼できる導入と同義ではない。組織には、エージェントの権限を制限するインターフェース、意思決定を再構成できるログ、実際の運用条件を反映した評価が必要である。

知識労働者やAIユーザーもまた、AIが戦闘機を飛ばしたという単純化された見出しに抵抗すべきだ。より重要なのは、それを取り巻くシステムにある。人間による監督、モジュール型の制御、試験計測、段階的な検証が、この飛行を可能にした。

DARPAは、AIエージェントを改修済みのフリート機に接続することで、重要な工学上の節目を越えた。次の節目はさらに困難だ。環境が協力的でなくなったときにも、複数のエージェントが有用で、理解可能かつ制御可能であり続けることを、同機関は示さなければならない。

次の複数機による飛行、初の公開パフォーマンス指標、そしてCCA試験への初の信頼に足る移行に注目したい。これらの出来事は、AI制御のF-16が拡張可能な軍事インフラになりつつあるのか、それとも印象的な研究プラットフォームにとどまるのかを明らかにするだろう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page