DARPA 将 AI 装进标准 F-16。真正的考验是在战斗规模下建立信任
DARPA 与美国空军已经试飞了一架由 AI 控制的 F-16,但这架飞机既非无人驾驶,也并非在没有人类监督的情况下运行。座舱内仍有一名安全飞行员,随时准备重新接管控制权。真正重要的首次突破在于:一个 AI 智能体控制了一架加装便携式自主系统的标准战斗机。
这一差别让该项目不再局限于单一研究飞机。改装后的 F-16 隶属于“毒蛇实验与下一代作战模型”项目,即 Viper Experimentation and Next-generation Operations Model,更广为人知的名称是 VENOM。其自主套件可将 AI 智能体接入战机的操纵和任务系统,同时不替换飞机的核心软件。
这次飞行也改变了军事自主系统领域的竞争压力。DARPA 现在必须证明,在模拟环境中测试的算法能够在复杂的多机任务中保持可预测性。与此同时,空军需要证据表明,这些智能体能够支持其 Collaborative Combat Aircraft 计划,而不会让飞行员不堪重负或削弱人类控制权。
DARPA 在埃格林实际试飞了什么
核心成果并不是座舱空无一人,而是在实验性 AI 与现役战斗机平台之间建立了一座可复用的桥梁。
DARPA 的飞行公告于 2026 年 7 月 16 日发布,描述了在佛罗里达州埃格林空军基地进行的空中测试。一名 AI 智能体自主控制了一架改装为空中测试平台的 F-16 飞行。
空军于 6 月开始试飞这架改装飞机。这些初期飞行用于确认在增加硬件、软件和测试仪器后,飞机是否仍能安全运行。据该军种的VENOM 飞行更新称,团队随后在 7 月推进至自主控制测试。
测试期间,一名人类飞行员始终留在座舱内。该飞行员监控 AI,并可在飞机偏离预期行为时介入。这种安排称为 human-on-the-loop 控制,即机器执行操作,而人类负责监督并保留干预权限。
这不同于 human-in-the-loop 控制。在后一种模式中,系统继续执行前,人类必须批准或完成特定操作。这一区别很重要,因为未来作战飞机需要以快于飞行员逐一手动指挥每个动作的速度作出部分决策。
DARPA 尚未公开详细的机动动作清单、性能评分卡,或对 7 月任务场景的完整描述。其公告称,该智能体控制了飞行;未来工作将测试多个智能体在与作战相关的实飞场景中的表现。因此,现有证据并不支持将此次飞行描述为一次无人监督的作战任务。
这架 F-16 配备了 VENOM Autonomy Kit,即 VAK。DARPA 表示,该套件可与飞行控制和任务系统对接,同时保持战机核心软件不变。座舱内的一个开关可让飞行员在传统控制与 AI 控制之间切换。
保持核心软件完整具有战略价值。若要为每一次自主性实验重写战斗机的飞行控制系统,不仅会拖慢测试进度,也会带来额外的认证风险。独立接口让研究人员可以更频繁地更换 AI 模型,同时保留底层飞机系统。
这种架构也建立了更清晰的安全边界。AI 并非获得对机上所有系统毫无限制的访问权限。工程师可以对接口进行监测、观察指令、设定限制,并将预期行为与飞机实际响应进行比对。
这使飞机成为飞行实验室,而不是一件自主武器原型。研究人员可以加载一个智能体、收集飞行数据、复盘失败情况,并在下一次出动前修订模型。这一过程类似迭代式软件开发,但每一次错误都发生在一个安全关键的实体系统中。
此次飞行之所以重要,是因为空中自主性无法仅靠模拟验证。模拟器可以生成大量遭遇场景,包括罕见或危险的情形,但无法复现每一种传感器缺陷、通信故障、天气状况、维护差异或飞行员的意外反应。
真实的 F-16 会迫使智能体与这些物理约束互动。它还为测试团队提供有关时序、控制质量、传感器集成和人类监督的证据。这些细节将决定该技术能否走出受控的研究环境。
F-16 测试是一项规模化测试
DARPA 已经证明,AI 能在受控的近距空战中驾驶战斗机。VENOM 要验证的是,这种能力能否成为可重复使用的基础设施。
最直接的历史参照是 X-62A VISTA,这是一架由空军试飞员学校运营、经过独特改装的 F-16。在 DARPA 的 Air Combat Evolution 项目下,AI 智能体曾在视距内空战场景中驾驶 X-62A,与一架由人类飞行员驾驶的 F-16 对抗。
DARPA 于 2024 年 4 月宣布了这些自主空战测试。飞行测试于 2023 年在加利福尼亚州爱德华兹空军基地启动。安全飞行员在场,项目团队也会在各次测试之间调整算法。
这些飞行回答了一个重要技术问题:AI 智能体能够在测试控制范围内,指挥高性能战斗机完成动态空战机动。然而,X-62A 仍是一架服务于特定研究任务的专用飞机。
VENOM 瞄准的是另一个瓶颈。美国需要的不只是单架能够承载令人印象深刻演示的飞机,而是足够多的仪器化飞机、测试能力、软件接口和受训人员,以评估众多相互竞争的智能体。
这里的“标准”需要谨慎理解。经过改装后的 VENOM F-16 并不等同于普通现役战斗机;它搭载了专用设备和测试仪器。关键在于,该自主套件被加装到传统机队平台上,而没有替换其核心软件。
这种方法可以扩大现实世界测试的规模。更多架次能够让智能体接触更多条件,包括传感器不确定性和通信中断。多架飞机还可以测试协作、角色分配和相互冲突的目标——这些都是一对一空战无法揭示的。
DARPA 的 Artificial Intelligence Reinforcements 项目,即 AIR,将利用 VENOM 机队进入下一阶段。AIR 旨在将作战智能体从模拟环境推进到日益复杂的实飞场景中。其既定方向包括超视距和多机编队作战。
超视距作战指飞机在无法直接目视接触目标的情况下交战。飞行员必须依赖传感器、数据链、识别流程、电子战信息和交战规则。这比在近距离格斗中让对手始终位于视野中心,构成了更棘手的自主性问题。
近距空战奖励的是快速控制和战术机动。超视距作战则要求在不确定条件下管理信息。智能体必须基于不完整、甚至可能具有欺骗性的数据进行推理,同时与其他飞机协调,并遵守任务约束。
多机测试又增加了一层复杂性。智能体必须分配任务、避免重复行动、保持编队安全,并在其他飞机失去通信时作出响应。它们的行为也必须让人类任务指挥官能够理解。
这正是接口与算法同样重要的原因。一个只能在单架实验室飞机上运行的强大智能体,作战价值有限。通用测试流程可以在相似条件下比较不同智能体,并将成功的行为迁移到不同平台之间。
因此,该项目意味着从证明原始能力,转向建立评估系统。DARPA 正试图缩短模拟、实飞、故障分析和模型修订之间的周期。每个阶段都必须保留足够的证据,让人类能够理解智能体为何采取某项行动。
这一规模化目标也解释了为何安全飞行员并非无关紧要的注脚。人类监督让团队可以探索更激进的算法,而不必将每一个意外指令都视为飞机损失事件。飞行员提供了一条可控的干预路径,同时项目也能收集证据。
不过,如果评估者只衡量任务是否完成,监督可能掩盖弱点。一个需要频繁人类修正的智能体并不具备作战自主性。未来披露的信息应区分人工干预、安全限制激活、软件故障以及成功完成自主任务的情况。
由 AI 控制的 F-16 为何对空军重要
空军的主要目标并不是用自主 F-16 取代飞行员,而是建立所需证据,让飞行员能够指挥成群的无人飞机。
DARPA 将 VENOM 描述为未来联合部队作战的基础,其中包括 Collaborative Combat Aircraft。CCA 是空军部署无人飞机的计划,这些飞机可与有人战斗机协同作战,并执行分配的任务角色。
两者之间的关系是间接的,但很重要。空军并不需要将每一架 F-16 都变成自主作战飞机。它需要一个安全且被充分理解的平台,用于在类似自主系统进入专为无人飞行器打造的系统之前测试智能体。
F-16 拥有已知的飞行特性、成熟的维护实践以及容纳安全飞行员的空间。这种组合使其适用于实验。如果一架新的无人飞机的自主系统出现意外行为,它不会拥有同样即时的人类接管选项。
空军还在 CCA 供应商的平台上,分别测试由政府拥有的软件框架。其开放架构方案旨在让自主软件可跨不同飞机运行,避免让空军被绑定于单一供应商。
VENOM 支持同样的更广泛理念:飞机、自主智能体和任务软件应以不同速度演进。模块化接口可让工程师更新一个智能体,而无需重新设计整架飞机。
这种分离给传统国防承包商和新兴自主系统公司都带来压力。机体制造商不能再假定任务智能将永久与某一型号飞机绑定。软件开发商则必须证明,其智能体能够在受控模拟和供应商专属演示之外正常工作。
这也给人类操作员带来压力。DARPA 设想的未来角色,并不只是由一名飞行员驾驶一架飞机、无人机则沿固定航线跟随。一名人员将协调多个能够应对不断变化威胁的自主平台。
DARPA 的ACE 项目目标将信任描述为这一安排的前提条件。该项目从近距空战开始,因为这一环境会迅速产生可见的后果。更大的目标是在更复杂的交战中实现人机协同。
信任不能意味着相信 AI 永远正确。人类飞行员也达不到这一标准。运行层面的信任,要求人们知道智能体何时可靠、会在哪些地方失效,以及人在多快时间内能够识别并纠正危险决策。
呈现给飞行员的界面将变得至关重要。指挥官在管理一项受对抗任务时,无法同时审阅原始模型输出。系统必须传达意图、置信度、局限性和干预请求,同时不能造成过高的认知负荷。
设想一次未来的护航任务。一架无人机可能前出收集传感器数据,另一架则携带武器或电子战设备。人类飞行员需要分配目标和约束条件,而不是手动规定每一次转向。
如果通信减弱,智能体必须知道哪些任务可以继续执行。它们还必须知道何时返航、保持位置或移交责任。这些行为需要在飞机接近友军或民用空域之前得到验证。
空军还需要证据表明,来自不同供应商的智能体能够协同合作。开放架构只能解决其中一部分问题。两个系统可以共享技术接口,却可能以不同方式理解优先级、置信度或威胁数据。
实机多机测试可以暴露这类不匹配问题。它们能够揭示智能体是否会争夺同一目标、提出互不兼容的建议,或在失去共享信息后出现不可预测的行为。这些失效模式很难在孤立的演示中发现。
正因如此,VENOM 不只是一个 F-16 的故事。这款飞机为测试将塑造未来空中作战的软件关系提供了受控环境。它的价值取决于这些经验能否有效迁移到无人平台。
真正的难题是在作战条件下建立信任
一次成功飞行证明控制链路有效,但并不能证明 AI 会在战争中作出合法、战术合理且可预测的决策。
DARPA 官员承认,在他们所称的现代战争“战争迷雾与摩擦”之下,性能与可信度仍未得到解决。这种谨慎正是这一故事的核心。真实作战会带来欺骗、受损传感器、不完整通信,以及主动操纵智能体输入的对手。
AI 系统可以在训练所涵盖的场景中表现良好,却在条件变化时失效。对手可能使用诱饵、电子干扰、异常编队或刻意模糊的行为。由此产生的问题并非普通的软件可靠性问题。
作战自主系统必须应对分布偏移,即实际运行环境与开发时使用的数据不同。工程师可能知道发生了偏移,却不知道哪项决策会失效。因此,测试必须衡量系统在预期条件之外的行为。
传感器数据同样伴随不确定性。雷达航迹可能消失,识别信息可能相互冲突,网络消息也可能延迟到达。若智能体将每项输入都视为同等可靠,就可能基于受损态势图作出自信决策。
该计划还必须测试网络韧性。自主套件在战斗机内部建立了新的软硬件连接。每一处连接都需要防范未经授权的指令、遭破坏的更新、恶意数据和供应链弱点。
人工干预仍是另一个尚未解决的变量。安全飞行员可以在试飞中按下开关,但作战指挥官可能同时监管多架飞机。发现问题所需的时间,可能超过阻止问题所剩的时间。
自动化偏差同样存在风险。当系统看起来准确时,人们往往会过度重视机器建议。处于压力下的飞行员可能在未充分理解其背后假设的情况下,批准 AI 生成的计划。
相反的问题也同样严重。如果智能体发出过多警报、在没有清晰解释的情况下改变计划,或需要反复纠正,飞行员可能不再信任它们。一架需要持续监控的飞机,可能增加工作负担,而非降低它。
因此,军事测试不能只看胜负记录。评估人员应衡量干预频率、不安全指令比例、任务完成情况、解释质量、通信中断后的恢复能力,以及面对未见场景时的表现。
目前公开信息尚未提供 VENOM 的这些结果。DARPA 尚未披露完成了多少次自主飞行、AI 保持控制的时长,或安全飞行员是否进行了干预。它也尚未公布参与 7 月飞行测试的智能体。
对于一个军事计划而言,这种有限披露可以理解。战术细节可能暴露能力或弱点。但这也使外部观察者无法判断,这究竟是自主能力的重大进步,还是一次成功的集成里程碑。
随着 AI 项目不断增多,美国国防部面临更广泛的治理挑战。一项 GAO 评估 此前发现,该部门在全部门 AI 战略、资源说明、清单编制和协作指导方面存在缺口。这些发现并非针对 VENOM 的具体评估,但它们说明了为何技术进展与制度监督必须同步推进。
武器政策又增加了一道边界。自主飞行控制并不自动等同于自主目标选择或武器释放。公开声明聚焦于飞行、战术智能体和未来团队作战,而非独立致命授权。
撰稿人和政策制定者应保持这一界限。智能体可以控制速度、航向、高度和战术位置,同时由人类保留武器决策权。未来构型可能赋予更多权限,但 7 月的声明并未证明它们已经这样做。
最可信的前进路径是分阶段扩展。工程师可以从受限飞行行为开始,引入存在不确定性的传感器输入,增加协同飞机,随后测试任务层级的决策。每个阶段都应设定明确限制和可衡量的失效条件。
红队演练将不可或缺。独立团队应尝试迷惑智能体、切断通信、操纵传感器输入,并触发任务目标之间的冲突。目的在于抢在对手之前发现脆弱行为。
该计划还必须避免将飞行员在场误认为完全安全。只有当系统传达自身状态,并留出足够的行动时间时,人才能进行干预。有些失效的展开速度可能快于人类识别速度。
因此,信任并非由反复成功演示产生的一种感觉。它是基于证据、针对性能边界作出的判断。只有当这些边界在压力之下仍然清晰,VENOM 才具有作战意义。
DARPA 和空军接下来必须展示什么
三个信号将决定 VENOM 是否会成为有用的作战基础设施:透明的测试指标、成功的实机多机飞行,以及向 CCA 平台的迁移。
第一个信号是可衡量的评估框架。即使敏感战术细节仍属机密,DARPA 也应展示该计划如何在不同飞行架次之间比较智能体。干预次数、软件故障、控制限制触发情况和恢复表现,将提供更清晰的图景。
这些指标必须区分飞机集成与自主推理。干净的飞行控制接口必不可少,但它对任务决策说明不了太多。独立评分卡将揭示,失效究竟源自飞机、自主套件、传感器处理还是智能体。
来自未见场景的证据将增强该计划的说服力。智能体应面对开发者未接触过的条件,包括传感器退化和意外的飞机行为。在这些条件下保持稳定表现,才能说明软件并非只是在重放熟悉策略。
第二个信号是计划中的实机多机测试转变。一架自主飞机可以回应人类对手,或执行既定任务。多架智能体则必须协调、分配任务、管理共享信息,并在其中一名参与者失效时恢复运行。
多机测试也将暴露人机界面的问题。飞行员应能通过目标和约束条件指挥团队,而不必监控每一项控制动作。如果每增加一架飞机,工作负荷就大幅上升,那么这一作战概念便会被削弱。
观察者应关注该计划如何处理通信退化。自主队友在受对抗行动中不能依赖持续不中断的链路。它们的后备行为必须对人类指挥官可预测,并与编队其余部分兼容。
一次成功的多机事件将增强 DARPA 关于 VENOM 支持可扩展作战自主能力的主张。若演示需要严密编排的条件或反复的飞行员干预,这一主张的适用范围就会收窄。
第三个信号,是从改装 F-16 向协同作战飞机转移。软件可移植性是模块化自主系统的核心承诺。当通过 VENOM 开发的智能体运行在拥有不同传感器、性能限制和任务设备的飞机上时,这一承诺将接受检验。
这种迁移不会自动实现。F-16 的飞行特性和座舱系统不同于无人 CCA 平台。工程师必须将通用战术行为与依赖测试飞机的假设区分开来。
空军的政府所有架构可以帮助管理这一转变。通用接口能够减少集成不同供应商软件所需的工作量,但无法保证智能体迁移到新机体后仍能正确运行。
因此,一项可信的迁移测试应同时考察技术兼容性和任务表现。加载软件只是第一步。智能体必须在适应不同速度、航程、感知与载荷约束的同时,保持安全行为。
行业的竞争性回应同样重要。机体公司将寻求证明其平台支持多种自主套件。AI 供应商会强调仿真结果,但实机飞行证据将成为更有价值的标尺。
采购决策将揭示政府是否相信自己的测试数据。如果成功的 VENOM 智能体通过共享接口进入 CCA 实验,该计划影响的就不只是研究,而是改变了自主能力进入作战飞机的方式。
也有一些信号会削弱这一判断。飞行里程碑之间出现长时间间隔,可能意味着集成或安全问题。若持续依赖一种专用智能体,则会引发对其承诺的测试管线的质疑。
缺少已报告的干预数据也会留下另一处空白。保密项目无法公布每一项结果,但汇总的安全性和可靠性指标仍可表明技术是否正在成熟。没有这些指标,公开主张将仍然难以评估。
开发者应当关注,因为 VENOM 在异常严格的条件下测试了民用智能体系统中熟悉的理念。模型可移植性、可观测性、人工覆盖、对抗性测试和有限授权,都是远超军事航空领域的软件设计问题。
企业采购方也应注意同样的教训。一次成功演示并不等于可靠部署。组织需要能够限制智能体权限的界面、可重建决策过程的日志,以及反映真实运行条件的评估。
知识工作者和 AI 用户也应避免接受“AI 驾驶战斗机飞行”这种过于简化的标题。更值得关注的,是其背后的整个系统:人工监督、模块化控制、测试仪器以及分阶段验证,共同使这次飞行成为可能。
DARPA 通过将一名 AI 智能体接入一架经过改装的现役机队飞机,跨越了一个重要的工程门槛。下一道门槛则更加困难:该机构必须证明,当环境不再配合时,多个智能体依然能够保持实用性、可理解性和可控性。
关注下一次多机编队飞行、首批公开的性能指标,以及首次可信的 CCA 测试转移。这些事件将揭示:AI 控制的 F-16 是正在成为可规模化的军事基础设施,还是仍只是一项令人印象深刻的研究平台。



