五角大楼 AI 幻觉险些触发美军行动,暴露验证失效
五角大楼的一次 AI 幻觉险些触发美军行动规划;在官员发现一项虚假的货物声明前,飞机已升空。据称,这份情报报告称一艘位于中东的中国船只载有核武器项目所需部件。报道称,武装人员当时正准备登船,但更深入的审查叫停了行动。
问题不只是情报不准确。根据 CNN 发布并通过其附属机构分发的一份虚假情报报告,一款聊天机器人错误识别了船舶货物清单中列出的材料。一名特种作战司令部分析师曾要求该系统整合开源资料与机密信号情报。
随后,该分析师再次使用 AI,将这一结论整理成标准情报报告。第二步让缺乏支撑的主张具备了既有军事产品的外观与结构。最终文件在对伊战争期间经由指挥渠道流传,而当时速度与不确定性已在塑造决策。
官员在计划拦截前不久发现了问题。五角大楼和美国特种作战司令部太平洋分部均未就此事件公开置评。该聊天机器人的身份、实际货物,以及最终揭露错误的确切验证步骤仍未披露。
因此,核心冲突远不止一个错误答案。军方希望利用 AI 压缩信息收集与采取行动之间的时间。但同样的压缩也可能消除分析师质疑假设、检查来源并区分证据与生成文本的停顿环节。
AI 幻觉如何险些触发美军行动规划
这次失误经历了两个彼此独立的 AI 辅助步骤:先是分析,随后是呈现。
事件始于有关一艘中国船只货物清单的情报。据报道,底层报告来自驻夏威夷、负责监督印太地区特种作战行动的美国特种作战司令部太平洋分部。
一名分析师就该报告向一款身份未明的聊天机器人提问。该系统将开源情报与政府掌握的机密信号情报结合起来。开源情报是从公开可获取材料中收集的信息,而信号情报则来自截获的电子通信或电磁辐射。
随后,该模型错误识别了船上材料。AI 幻觉是指看似合理、但缺乏依据、错误或凭空捏造的输出。大语言模型生成的是可能出现的词语序列,因此措辞自信并不能证明底层主张为真。
这名分析师显然未能察觉其中的区别。聊天机器人的结论成为评估基础,称该船正经由中东运输核项目部件。据报道,一名知情人士将完成的报告形容为完全虚假。
同一技术随后又发挥了第二项作用。据这起险些酿成事故的报道,该分析师使用 AI 将发现结果转换为标准格式的情报报告。这种格式对于接收并据以行动的军事情报官员而言十分熟悉。
第二次使用之所以重要,是因为格式能够制造制度性可信度。聊天机器人窗口中的可疑陈述看起来仍属暂定;同样的陈述一旦出现在正式文件中,则可能显得已经审阅、已有来源支撑,并可用于行动。
该报告在一场进行中的冲突期间传遍军方。指挥官随即准备拦截这艘中国船只。两名消息人士称,武装的美国人员正准备登船;另有消息人士称,军机已经升空。
随后,官员对报告进行了更仔细的审查,并发现了这项 AI 辅助造成的错误。他们在美军登船前取消了计划中的行动。现有报道未说明是谁要求进行最终审查,也未说明哪项证据推翻了货物声明。
这些缺失的细节使完整重建事件经过成为不可能。目前仍不清楚,分析师是误解了工具、忽略了不确定性提示,还是在缺乏充分审查程序的情况下操作。也不清楚该聊天机器人是否引用了可供独立核查的来源。
然而,已知的过程暴露出可追溯性问题。指挥链收到的是一份经过润色的结论,却没有足够清晰地说明模型如何得出这一结论。文件形式比其证据局限传播得更有效。
这一案例也挑战了对人工监督的简单定义。有人发起查询、审阅输出、制作报告并分发;其他人则规划回应。人类参与并未阻止模型错误一路推进,接近使用武力的决策。
这一区别对所有部署生成式 AI 的组织都很重要。当人类未经独立验证便接受生成的主张时,“人在回路中”几乎没有意义。有效监督需要明确的责任人、既定的核查步骤、可获取的源材料,以及叫停流程的权限。
事件最终确实存在停止机制,因为官员在登船前审查了报告。然而,审查发生在飞机已升空、人员正准备行动之后。临近末端才启动的保障措施或许能够避免灾难,却仍暴露出系统的脆弱性。
五角大楼推动更快 AI 带来了压力
这次险情发生在一项将决策速度视为军事优势的采用战略之中。
美国军方多年来一直使用算法系统,包括图像分析、物流、维护和威胁探测。生成式 AI 扩展了这一议程,因为它能够总结文件、起草报告、搜索大型资料库,并整合不同格式的信息。
2026 年 1 月,美国国防部长皮特·赫格塞思宣布了一项AI 加速战略。该战略呼吁加快试验、减少官僚障碍,并让整个部门更广泛地使用领先模型。
其中一项优先事项是 AI 赋能的战场管理与决策支持,涵盖从战役规划到杀伤链执行的活动。杀伤链是识别、跟踪、选择并打击目标的过程。压缩这一链条,能让决策速度相当的对手面前取得优势。
该部门还试图将先进 AI 系统交到军人与文职人员手中。这种做法倾向于分散式试验,让各单位和人员无需等待单一中央项目即可发现应用场景。
分散化能够产出有价值的作战知识。后勤官员了解集中式技术办公室可能忽略的供应问题。情报分析师也清楚,哪些文件集合、报告流和重复性任务会消耗宝贵时间。
同一模式也让治理变得更困难。不同司令部可能使用不同产品、配置、数据来源和操作规则。系统之间的可靠性可能不同,而用户接受的合规使用培训也可能不一致。
CNN 的报道指出,军方和情报界所使用的各类 AI 系统并无单一验证标准。这并不能证明每个司令部都缺乏控制措施,但确实表明,普遍可用并不保证普遍采用审查做法。
船舶事件表明,即便正式政策尚未改变,采用压力也能改变人的行为。如果 AI 被宣传为加速决策的途径,分析师可能将速度理解为被看重的结果。谨慎的延迟便可能被视为阻力,而非专业判断。
年轻分析师或许尤其习惯使用聊天界面,尽管熟悉并不自动意味着粗心。更广泛的风险在于自动化偏见,即即使存在矛盾或不完整证据,人们仍倾向于偏好机器生成的答案。
大语言模型会加剧这一风险,因为它们表达流畅。较早期的分析工具可能只返回分数、警报或僵化的数据库结果;聊天机器人则能生成连贯叙事,连接来源、预判问题,并听起来像一位干练的同事。
当输出支持紧急威胁评估时,流畅性尤其危险。面对零散信息的分析师,可能欢迎一个将不确定性组织成单一解释的系统。模型作为写作工具的实用性,可能掩盖其作为事实权威的弱点。
压力也会传导至审查人员。AI 辅助工作流可以在更短时间内生成更多报告,但组织仍需要人员审查其中主张。如果审查能力未随产出同步增长,速度只会将瓶颈转移到下游。
GovAI 研究学者、前美国陆军军官杰克·斯特克勒警告称,军人必须理解大语言模型固有的不确定性。他将目标选择、情报分析和作战规划列为尤其敏感的领域,因为其后果关乎生死。
斯特克勒并未主张军方放弃 AI。他表示,在保障措施与风险相匹配时,这些工具可在适当场景发挥帮助作用。他担心的是,将采用速度置于其他一切之上,会引发削弱军人信任的事件。
这一警告指向了超越一次中止行动的战略代价。若人员看到 AI 系统生成危险主张,他们日后可能会拒绝有效输出。糟糕的部署既可能造成过度信任,也可能造成信任不足,令指挥官无法确定何时应重视这项技术。
速度与验证才是军事 AI 的真正较量
主要对手并不是美国与某一家 AI 供应商,而是更快的分析与可辩护的证据之间的较量。
军事组织有充分理由缩短决策时间。传感器产生的信息多于人工团队能够手动审查的数量。对手会隐藏活动、传播欺骗信息,并利用从发现到应对之间的延迟。
AI 可以帮助分析师在图像、通信、货物清单、报告和公共记录之间发现关联。它可以翻译材料、比对文件、检索此前评估,并揭示人在时间压力下可能遗漏的不一致之处。
船舶事件并未抹去这些优势。它表明,生成与验证必须保持为不同职能。系统可以帮助提出假设,但同一系统不应验证自己的提议,也不应以润色后的语言掩盖不确定性。
这种分离在此处失效了。聊天机器人先协助构建货物评估,随后 AI 又帮助将该评估转化为一份可信文件。第二次交互在未增加独立证据的情况下,强化了第一次交互的权威性。
更安全的工作流程应当保留每项主张与其支持来源之间的关联。审查人员应能够查阅原始舱单条目、相关截获信息、任何译文,以及将这些材料与核组件关联起来的推理过程。
置信度标签也需要具备明确含义。模型生成的概率不能替代分析置信度;后者反映来源质量、一致性、假设、知识缺口和替代性解释。当证据本身仍不确定时,数字上的精确性可能具有误导性。
五角大楼已经制定了看似适用于这一问题的原则。其AI 伦理原则要求系统具备责任性、公平性、可追溯性、可靠性和可治理性。
可追溯性要求相关人员理解该技术、其方法及其数据来源。可靠性要求在定义明确的使用场景内进行测试。可治理性要求系统能够检测或避免意外后果,并能在行为变得不安全时被停用。
据报道,这次险些发生的事件与上述每一项操作目标都存在冲突。审查人员无法立即获知报告源自 AI 辅助生成。该工具在一项高风险情报任务中得出了错误结论。组织最终叫停了行动,但当时准备工作已经推进。
这种脱节不一定意味着这些原则在正式层面被忽视。身份不明的聊天机器人可能并未获准用于此类用途,或者分析人员可能偏离了现有程序。公开报道无法厘清这些可能性。
然而,仅靠原则无法控制工作流程。它们需要在用户提交查询、转移主张或发布评估的时刻,通过可执行机制落实。培训文件不能替代产品设计和强制性审查关卡。
一项实用控制措施是:只要生成式 AI 参与情报产品,就必须进行醒目披露。该披露应说明模型、版本、查询时间、数据环境以及文档中受影响的部分。
另一项控制措施应禁止未经验证的生成式主张进入行动报告。分析人员需要将每一项重要断言与独立于模型摘要的来源相连。缺乏支撑的文本应始终被明确标注为假设。
高后果报告还可要求双人核验。第二名分析人员应在不依赖生成叙述的情况下审查原始证据。这种做法可降低排版、紧迫感或职级将不确定文本转化为既定事实的风险。
红队检查提供了另一层保障。审查人员或独立系统可被赋予推翻评估、识别货物的替代性解释,以及发现舱单与报告之间缺口的任务。目标不应是自动否决,而是形成结构化分歧。
审计日志同样重要。如果聊天机器人将机密信号情报与开源信息融合,调查人员就需要获得输入、检索结果、提示词、输出、编辑记录和引文的完整记录。缺少这条线索,组织就无法解释失败原因或改进保障措施。
这些控制措施会带来时间和人力成本。这正是核心权衡。耗时过长的核验流程可能让情报失去时效性,而推进过快的流程则可能将错误信息转化为行动。
正确的平衡应取决于后果。一名用于日常行政工作的起草助手,不需要与影响登检外国船只的模型相同的控制措施。风险等级应决定访问权限、测试、日志记录和审批要求。
军事领导人常将 AI 描述为决策支持,而非决策者。只有当人类获得足够证据以作出独立判断时,这一表述才仍然准确。只看到模型结论的人,是在批准一个输出,而不是作出知情决策。
现有保障措施未能足够早地阻止错误
关键的不确定性在于:这是某一名分析人员的失误,还是更广泛核验缺口的证据。
公开报道留下了若干重要问题未解。官员尚未披露该聊天机器人的身份,因此读者无法评估其预期用途、安全控制、检索设计或性能历史。
同样不清楚该系统是商业模型、政府托管模型,还是定制界面。一名前官员告诉 CNN,许多内部系统与商业产品高度相似。但这一说法并未揭示本案使用的是哪种技术。
这种区别很重要,因为安全部署只能解决部分问题。将模型托管在机密环境中可以保护敏感数据,但无法使生成答案变得准确,也无法消除幻觉。
检索增强生成可以通过在查询过程中向模型提供文件来减少部分错误。但它仍取决于是否检索到正确材料、是否正确解读这些材料,以及是否如实呈现不确定性。即便文件就在眼前,模型仍可能误读。
报道也没有说明错误结论是否附有引文。如果存在引文,它们可能指向无关段落,或指向并不支持该主张的来源。如果不存在引文,该评估本应立即受到审查。
我们同样不知道,聊天机器人是否将模糊的货物描述转化为与特定武器相关的结论。即使没有生成式 AI,翻译错误、缩写、不完整舱单和军民两用组件也会令航运情报变得复杂。
实际货物仍未披露。这一遗漏可能保护敏感的收集手段或行动细节,但也限制了独立评估。外部观察人士无法判断,对于合格分析人员而言,这一错误本应有多明显。
五角大楼的回应也是另一个缺口。最初报道出现时,国防部和太平洋特种作战司令部均未提供公开解释。没有任何官方说明描述纪律处分、程序调整或正式调查。
这种沉默意味着,该事件目前主要仍建立在匿名消息源报道之上。多家媒体重复了这一说法,但大多追溯至同一项 CNN 调查。相关机构尚未对基本叙事作出详细公开确认。
因此必须保持谨慎。证据支持将该事件报道为:四名知情消息人士描述的一次严重险情。但证据并不支持声称 AI 系统独立下令开展行动,或直接控制军事资产。
在所有公开描述的阶段,人类始终负有责任。一名分析人员选择了该工具并传播报告。官员将报告视为可采取行动的依据。其他人员最终对其提出质疑并叫停任务。
这条人为链条并未降低技术失败的重要性,而是改变了问责应归属的位置。相关系统包括聊天机器人、其界面、分析人员、审查程序、指挥激励机制,以及报告的制度性地位。
美国政府问责局在 2025 年发布的一份联邦 AI 审查报告已经记录了相关担忧。国防官员告诉调查人员,生成式系统可能产生看似合理但错误的输出,并制造虚假的确定感。
该审查还指出,模型如何生成答案的透明度有限。一些用户缺乏解读这些输出所需的专业能力,而严格的安全要求也使敏感任务领域的测试变得复杂。
即使该事件的行动后果异常严重,这些发现也使船只事件不那么令人意外。核心技术局限早已为人所知。失败在于,这一局限被允许贯穿整个情报生产链。
五角大楼还持续维持正式的负责任 AI 指导方针,并发布旨在帮助团队评估风险的工具。但工具包无法确保每个司令部、供应商、模型和临时使用场景都能合规。
这正是分散部署带来治理挑战的地方。本地团队需要灵活性,但高风险输出需要不因单位而异的最低控制标准。一次登检行动不应取决于某个司令部是否恰好比另一个司令部采用了更严格的提示词指导。
应持怀疑态度提出的问题,不是是否会出台更多政策,而是指挥官能否在实际行动中核验合规情况。有效治理应留下可见证据,例如模型日志、来源引文、审查签名和记录在案的置信度判断。
该事件还警示人们,不应将更好的模型视为完整解决方案。错误率可以下降,但高影响失误仍可能发生。一个被使用数百万次的模型,即使只偶尔犯错,也足以产生重大影响,尤其是在用户只挑选确认紧急怀疑的输出时。
培训是必要的,但同样并不充分。人员应理解,自信的措辞并不等于经核实的情报。他们还需要让高风险行为变得困难的系统,而不是在危机期间完全依赖记忆。
因此,军方应审视哪些条件奖励了这次失误。如果分析人员面临更快发布的压力,再增加一个警示横幅也无法解决激励问题。当可能动用武力时,领导层必须保护核验所需的时间。
三个信号将显示五角大楼是否已吸取教训
下一项考验是,军方是否会将一次被勉强避免的行动,转化为其 AI 工作流程中可衡量的变革。
第一个信号是开展正式的行动后审查,其发现应超越对个别分析人员的关注。一份可信的审查报告将识别模型所扮演的角色、被遗漏的核验步骤、指挥决策,以及最终阻止行动的控制措施。
五角大楼无需披露机密情报,也可以解释流程失败。它可以公布披露 AI 辅助、保留模型记录和验证生成式主张的标准。即使只是摘要说明,也能确立领导层是否将该事件视为系统性问题。
如果调查只聚焦于用户错误,文章的核心判断将更为有力。归咎于一名分析人员,会让采用压力、标准不一和具有说服力的生成文本这一相同组合继续存在。
如果国防部识别出工作流程失效之处,并为纠正措施指定责任人,这一判断则会减弱。此类行动将表明,现有治理结构能够在下一次险情推进到同等程度前吸取教训。
第二个信号是针对 AI 辅助情报和行动规划制定全部门核验规则。最有力的政策将区分低风险起草与高风险分析,并在作出使用武力决定前要求独立来源确认。
该规则应明确由谁核验主张,以及他们必须审查哪些证据。笼统要求让人类参与无法回应此次事件,因为在报道所述的整个流程中,人类本就始终参与。
操作系统可以直接执行这项规则。包含 AI 生成内容的报告,或许应始终保留醒目标识,直到具备资质的审阅者确认每一项重要断言。移除标识应当需要可审计的批准,而不只是简单修改格式。
这类政策还需要涵盖 AI 生成的摘要。该船只事件表明,起草内容并不天然属于低风险行为。当摘要成为指挥官赖以决策的文件时,其呈现方式对行动的影响可能与其底层分析同样强烈。
如果五角大楼在各指挥机构和不同保密级别之间采用统一控制措施,就表明速度不再凌驾于可追溯性之上。如果验证仍然零散割裂,类似错误就可能沿着流程最薄弱的单位传播。
第三个信号是开展不止衡量模型总体准确率的实战化测试。该部门应测试人员能否在真实的时间压力、数据不完整,以及旨在诱发确认偏误的情境中识别缺乏依据的主张。
评估还应考察来源归因、校准和弃答能力。校准衡量的是系统的置信度是否与实际正确性相符。弃答意味着当证据不足时,系统会明确拒绝作答。
即使一款模型在实验室中产生的幻觉更少,如果用户无法识别剩余的幻觉,它在实际行动中仍可能失效。因此,相关的衡量单位应是人机团队,而非聊天机器人本身。
测试还应包括对抗性数据。对手可以操纵公开来源、货运记录、图像或通信内容,以影响 AI 辅助分析。一个结合机密与公开数据的系统,可能会赋予被植入的开源材料不应有的可信度。
结果不必暴露军事能力。五角大楼可以披露失效类别、整改率,以及系统是否达到了特定用途的既定门槛。透明的指标将帮助军人理解哪些工具值得给予有限信任。
这三个信号的重要性不止于国家安全。企业已经在利用 AI 总结合同、评估事件、准备财务文件,并检索内部知识。一份打磨精致的输出,可能在任何人核查其底层证据之前,就迅速流转于整个组织。
团队应在生成式综合内容与已验证事实之间保留清晰可见的界限。对于会产生重要影响的主张,也应保留其背后的来源,尤其是在摘要会影响安全、合规、雇佣或财务决策时。
知识工具可以通过让源材料始终附着于结论,减轻这项负担。不过,检索和整理并不会把责任转移给软件。批准重大行动的人,仍需要审查相关证据。
据报道,这次 AI 幻觉几乎触发美国军事行动规划,原因在于多层级的人类参与者未能及时质疑一项生成的主张。最后一刻的成功审查避免了事态升级,但这不应被视为流程有效的证据。
更有价值的问题是,下一份存疑报告能否在飞机起飞和登船小组集结之前被拦下。应关注是否会有公开审查、可执行的验证规则和贴近现实的测试。若没有这些改变,更快的军事 AI 将继续压缩的不仅是决策时间,也包括发现一个看似可信的答案其实是错误的机会。



