Palantir Maven 学校空袭审查揭示 AI 辅助目标定位中的致命失误
据报道,五角大楼的一项审查将对 Palantir Maven Smart System 的过度依赖,与一次造成 123 名儿童死亡的空袭联系起来,Palantir 因此面临一场决定性考验。2 月 28 日,即美以战争爆发初期,美国对伊朗米纳卜的 Shajareh Tayyebeh 小学发动袭击,学校被夷为平地。
这份尚未公开的审查并未将 Maven 描述为一款自行选择并攻击学校的自主武器。相反,据报道,官员发现了一连串涉及人员、情报、数据库和软件的失误。中央司令部人员信赖一幅部分建立在过时信息之上的 AI 辅助作战图景,而相互矛盾的证据未能阻止该目标遭袭。
这一差别很重要,但并不能免除该技术或其操作人员的责任。Palantir Maven 学校空袭事件表明,当速度、信心与碎片化数据汇聚时,自动化可能会放大机构性错误。它也对五角大楼的承诺提出挑战:在人类参与 AI 辅助致命决策时,人类判断仍能充当可靠的保障。
据报道,五角大楼审查发现了什么
据报道,这项调查描述的是一次系统性目标定位失误,而非单一机器预测错误。
该校于 2026 年 2 月 28 日、Operation Epic Fury 的第一天遭到袭击。它位于米纳卜一处伊朗伊斯兰革命卫队营地旁,靠近霍尔木兹海峡。
该地点曾属于相邻的军事设施,但后来被围墙隔开,并多年来一直作为学校使用。据报道,袭击前的公开卫星图像已经显示了这一物理变化。
根据 Bloomberg reconstruction,五角大楼调查人员审查了卫星图像、情报数据库、目标定位材料、作战消息和计算机记录。参与调查的人士称,相关人员仍高度确信该地点是一处伊朗军事设施。
这种信心建立在陈旧情报之上。据报道,2019 年一名分析师曾对该地点的军事分类提出质疑,并指出有证据表明它已变成一所学校。该警告被录入一个未与权威目标定位数据库连接的数字情报系统。
后续审查也没有纠正该目标记录。参议员 Tim Kaine 在一项 targeting inquiry 中概述了这一据称的失误。他表示,尽管分析师提出了担忧,且存在公开可得的证据,该地点仍留在经过核实的目标清单上。
随后,Maven Smart System 协助将米纳卜记录与其他潜在目标整合。Maven 是一个由 AI 驱动的战场管理平台,为军事用户组织情报、传感器数据流、地图和作战数据。它可以协助分析师识别物体、比对信息、协调部队,并推动目标通过决策流程。
据报道,问题不只是 Maven 接收了错误标签。相关人员据称依赖系统的整合呈现,却没有充分重新审视其底层证据。一个可疑目标因统一数字界面而获得了表面上的权威性。
在以极端速度推进的行动中,这种呈现据称发挥了作用。美军在最初 24 小时内打击了逾 1,000 个伊朗目标。Bloomberg 引述官员的话称,一些目标原本需要长期协调的工作被压缩至数分钟内完成。
大约三十余人参与了米纳卜的杀伤链,即连接目标发现、验证、授权和攻击的军事流程。这个数字削弱了“某个算法做出一次致命决定”的简单说法。
但这也让结果更令人不安。多名人员和多个系统都处理过该目标,却没有任何一方强制重新评估大楼内是否有儿童。
根据 AP reconstruction,Airwars 核实了至少 157 名在袭击中死亡者的身份。其中包括 123 名 13 岁及以下儿童和 34 名成人。Airwars 估计,死亡总人数介于 157 至 168 人之间,另有 95 至 111 人受伤。
最初报道采用了多个不同数字,包括超过 150 人死亡及至少 175 人死亡。这些差异反映出在伊朗境内进行独立报道的困难,以及缺乏完整公开统计的现状。123 名儿童这一数字来自已确认身份的受害者,而不仅仅是政府早期估计。
五角大楼尚未公开完整调查报告。因此,不应将这些据称的发现视为对每一项技术或指挥决策的最终官方表述。
尽管如此,证据早已超出毫无依据的指控。独立图像分析、美国官员、国会往来信函、伤亡研究以及据报道的内部审查,都指向美国基于严重过时的目标记录发动了这次袭击。
Palantir Maven 学校空袭首先是数据失误,其次才是 AI 失误
Maven 加速了一个底层信息早已变得不安全的决策流程。
有关军事 AI 的讨论常聚焦于模型能否正确识别物体。米纳卜事件呈现了另一类问题:据报道,该系统处理了一个持续多年、错误的机构性判断。
一栋建筑在旧图像中可能被准确分类,却仍可能在后来成为危险目标。土地用途会改变,军事设施可能关闭或缩减,学校、诊所和住宅可能出现在曾被武装部队使用的空间中。
如果操作人员将过时记录视为当前事实,任何计算机视觉模型都无法解决这个问题。一个平台可以融合多个来源,但只要最关键字段出错,仍可能产生误导性结果。
据报道,Maven 调取了超过 150 个数据输入源。这种规模可以改善态势感知,但数据流的数量并不能保证其内容质量。更多输入甚至可能以大量准确细节包围一项陈旧假设,从而掩盖关键弱点。
随后,界面可能造成研究人员所称的自动化偏误。由于系统看起来全面、快速且内部一致,用户会对计算机化建议赋予过高权重。
自动化偏误并不要求用户相信软件绝不会出错。当时间压力使接受系统输出比重建过程更容易时,它就会出现。一份看似完整的目标包可能会阻碍分析师重新查看原始证据。
当平台将源材料整合为单一作战视图时,这种风险会进一步上升。用户可能看到目标、置信度、位置和支持记录,却无法清楚了解哪一项结论来自旧图像、人类分析或自动推断。
据报道,Palantir Maven 学校空袭恰恰暴露了这种边界问题。一名人类分析师曾记录相互矛盾的信息,但警告存在于决定性的目标定位数据库之外。Maven 无法呈现一个其作战流程未能妥善接收或优先处理的事实。
然而,将 Maven 描述为中立的展示界面同样不完整。软件架构决定用户会注意到什么、必须确认什么,以及哪些警告能够阻止行动。设计选择塑造了人工监督在实践中的含义。
设计良好的致命行动流程不应将数据溯源视作可选的背景信息。操作人员需要看到图像何时采集、设施分类最后一次核实的时间,以及其他系统是否包含尚未解决的异议。
系统还应区分缺乏近期证据与存在军事用途持续的证据。这两种情况并不等同。数据库中的目标记录保持不变,并不意味着实体地点也保持不变。
记录年代久远本身不应自动使每一份情报失效。一些军事地点数十年来保有相同功能。然而,当平民活动具有可能性,且拟议攻击无法提供纠正机会时,年代必须成为明确的风险因素。
据报道,2019 年的警告让这一问题更为尖锐。这不仅仅是没有人想到该地点可能发生变化。据报道,有人提出了担忧,但更广泛的信息系统未能让它在行动上成为决定性因素。
这同时是数据库互操作性失误、组织失误和用户界面失误。AI 在这些弱点形成后进入链条,随后以作战速度推动了由此产生的目标。
将事件称为 AI 错误,可能掩盖这些层面;仅称其为人为错误,则犯了相反的错误。关键问题在于,这个组合系统如何将碎片化的不确定性转化为高度确信。
速度让一个旧错误变成了首日目标
核心冲突在于更快的目标定位,与质疑既有假设所需的时间之间。
五角大楼采用 Maven,部分目的是缩短从传感器到射手的时间线。这个术语描述了从发现潜在目标到指挥武器对其发动攻击之间的时段。
速度提供了真实的军事优势。移动式发射器、飞机或指挥车辆可能在常规审查结束前消失。更快的数据处理也能通过让指挥官共享行动图景来减少混乱。
米纳卜并未被描述为新发现的移动目标。据报道,它出现在开战攻击前准备好的预选清单上。这一区别削弱了“没有时间进行更深入核实”的论点。
预先规划的袭击提供了审查图像、比对数据库、检查开放来源以及解决旧分析师异议的机会。据报道,现有记录表明,这些机会并未产生更正后的分类。
行动规模随后加大了压力。24 小时内打击逾 1,000 个目标,意味着大量信息必须经过数量有限的分析师、律师、情报官、指挥官和武器专家。
自动化有助于这类流程运转。它可以筛选候选目标、揭示关联、分派审批并同步打击。然而,这些相同能力也让错误目标能够更快推进。
这是该事件的核心反转。Maven 原本旨在帮助人们理解碎片化的战场信息;据报道,在米纳卜,整合视图却让碎片化信息显得比实际情况更确定。
五角大楼对 Maven 的公开宣传一直强调决策优势、规模和更快行动。Palantir 在其 2026 business update 中将该系统作为重点内容,称正在整个部门部署 Maven。
这些说法如今面临更严峻的考验。决策优势不能只意味着更快得出答案;它还必须包括识别现有证据何时不足以支持得出答案。
这件事的影响不止于一家供应商。Anduril、Microsoft、Amazon、Clarifai 及其他技术提供商都参与了不断扩大的国防 AI 市场。它们的产品覆盖技术栈的不同环节,从传感器处理到云基础设施,再到战场协同。
因此,真正相关的对比并不是 Palantir 与某一家竞争对手之间的对比,而是加速的、由软件介导的目标打击流程,与一种较慢、能为疑虑保留空间的流程之间的对比。
两种路径都不会天然更安全。缓慢的官僚系统同样可能多年保留过时情报,据报道,Minab 的记录本身就是如此。人工审查也可能复制群体思维和制度性假设。
更安全的路径需要速度,也需要被强制执行的阻力。某些条件应自动延缓目标打击流程,包括影像陈旧、靠近平民、分类结果相互矛盾,以及分析师异议尚未解决。
这种阻力必须带来实际后果。用户无需解释就能忽略的警告,只是装饰。严肃的控制机制应要求重新收集情报、形成书面解决记录,或取得更高层级的批准。
据报道,此次打击涉及许多人工参与者,但人数并不等于独立判断。如果每位审查者看到的都是同一套集成显示界面,并信任同一份既有记录,那么这条链条包含的是重复,而非有意义的冗余。
军事领导人常说人类仍然“处于回路之中”。Minab 说明,这种说法过于模糊。一个人可以在技术上批准一次打击,却没有足够的时间、信息源访问权限或权力来质疑系统。
真正的人类控制需要的远不止最后按下按钮。它需要可理解的证据、可见的异议、充足的时间,以及重新审查不确定分类的责任。
Palantir 否认责任,但软件设计仍塑造责任归属
Palantir 有理由对政府情报责任提出异议,但 Maven 如何传达不确定性仍值得追问。
Palantir 发言人告诉 Bloomberg,该公司不对底层数据或识别情报缺陷负责。该发言人还表示,没有证据表明 Palantir 软件在 Minab 打击期间发生故障。
这一辩护涉及一个重要区别。承包商并不拥有政府机构加载至其产品中的每一份情报记录,也不负责授权军事打击。
一个平台可能完全按规格运行,却仍帮助操作人员基于错误前提采取行动。按传统软件标准,这未必构成缺陷。
致命系统需要更广泛的标准。当软件为军事决策整理证据时,它的设计会影响哪些信息变得可见、可信和可执行。系统可以按代码设计正常运行,同时仍促成不安全的作战结果。
“人类处于回路之中”这一说法,往往将责任转移给最终操作员。这种框架可能忽视了限制操作员所见内容的大量上游决策。
政府机构选择数据库、权限、审查规则、人员配置和作战时间表。承包商选择界面层级、置信度展示、警报行为、数据谱系功能和默认工作流程。
指挥官决定对平台赋予多大权重。分析师决定是否质疑其输出。政治领导人决定行动的节奏和规模。
因此,责任是分散的,但不应被稀释。当每个参与者只负责一个组件时,可能没有人会对组合结果承担责任。
据报道,Palantir 在打击后新增了功能,可重新核查底层情报中可能使目标失去资格的因素。这些改动也可以标记人工审查者可能遗漏的不一致或不准确之处。
这些新增功能表明,更深入的自动化审查在技术上是可行的。它们并不能证明早期版本存在缺陷,也不能确立究竟哪项功能本可阻止 Minab 事件。
但它们揭示了应对方向。军方及其承包商并未放弃 AI 辅助,而是用更多自动化手段来核查为现有自动化提供输入的数据。
如果第二层审查引用独立来源并采用明确的停止规则,这可能提高安全性。如果两层继承相同的记录、假设或激励机制,则可能失败。
AI 审查者不能变成一枚合成的批准印章。如果它只是重述目标材料包,而没有独立检验其中最薄弱的主张,它带来的只是表面审查,而不是真正审查。
据报道的应对措施还引出了审计问题。调查人员和国会监督者需要获取版本历史、来源出处、警告日志、用户操作、置信度变化和模型输出。
没有这些记录,问责将依赖访谈和重建的记忆。有了这些记录,审查者才能确定系统展示了什么、出现了哪些警告、谁忽略了这些警告,以及哪些数据仍无法获取。
商业保密和机密情报使这种访问变得复杂。然而,两者都不应阻止获授权的调查人员理解一个致命决策系统。
进入军事行动领域的供应商,应预期接受比普通企业软件提供商更深入的审查。后果不同,而且用户无法在部署后纠正一次错误打击。
Palantir 的辩护最终可能在狭义上被证明准确,即 Maven 没有发生技术故障。更棘手的问题是:对于帮助将致命决策压缩至数分钟的软件而言,避免故障是否已是充分的安全标准。
关于 Maven 调查结果,哪些事实仍未获验证
现有证据支持严肃审查,但尚未公开的调查仍留下关键技术和法律问题未解。
五角大楼尚未公布完整的 Minab 报告。Bloomberg 的报道基于对参与调查人员的访谈、未分类军方材料,以及现任和前任官员的描述。
这些报道内容扎实,但未向公众提供底层目标材料包或完整审计轨迹。读者应区分媒体报道的发现与正式发布的结论。
Maven 的确切角色仍部分不明。公开报道尚未展示向每位操作员显示的精确建议、附带的置信度,或发射前可见的每一项警告。
同样不清楚的是,Maven 是生成了一项新的目标建议,还是为执行而整理既有目标记录。这个区别在划分技术责任时很重要。
据报道,这项审查称,一些中央司令部人员过度依赖嵌入 Maven 的 AI。但这并不能证明每位操作员都是如此,也不能证明系统独立将学校归类为目标。
另一个尚未解决的问题涉及武器使用序列。报道显示,至少一枚美国 Tomahawk 导弹击中这所学校,但公开报道对所涉弹药数量说法不一。
伤亡总数在边际上也仍有争议。Airwars 核实了 157 名遇难者,其中包括 123 名儿童,而其他报道则称死亡人数超过 165 人或 175 人。完整的官方名单尚未公开。
伊朗当局控制着该地点的进入,并将平民苦难用于政治宣传。这一背景使独立核实更加复杂,但并不能抹去外部研究人员收集到的证据。
卫星影像、破坏模式、该地区的军事活动以及美国官员的声明,都支持美军应对该事件负责这一结论。以色列否认实施打击,而美国承认曾袭击附近目标。
法律判断仍应与技术重建分开看待。一个由联合国支持的事实调查团表示,它发现有合理理由相信美军在包括 Minab 在内的两次伊朗境内打击中犯下战争罪。UN findings并非具有约束力的法院判决。
据报道,该调查团认定,未能更新目标数据库和核实该地点,超出了单纯疏忽的范畴。美国官员尚未接受这一表述。
国会已要求提高透明度。拟议的报告措辞将要求在平民伤害调查完成后公布一份未分类说明。
议员们询问了谁批准该目标、使用了哪些系统、为何忽视 2019 年的关切,以及是否遵循平民伤害程序。这些问题仍居核心地位,因为软件责任无法脱离指挥政策进行评估。
五角大楼的沉默造成了严重的可信度问题。据报道,官员们在数小时内便已知悉美军击中了该地点。数月后,公众仍未获得最终解释。
美国过去的目标打击失误提供了一个令人不安的对比。2021 年 8 月,一次无人机打击在喀布尔造成 10 名平民死亡后,五角大楼在数周内承认责任并披露了行动细节。
据报道,Minab 打击造成的死亡人数超过前者的 15 倍,但调查数月未予公布。这种延迟使判断纠正措施是否针对真正原因变得更加困难。
因此,最负责任的结论应比一些标题所暗示的更为有限。现有报道表明,陈旧情报、彼此脱节的数据库、被压缩的审查流程以及对 Maven 的过度信任,促成了此次打击。
这些报道并未显示,一个自主的 Palantir 模型独立决定杀害儿童。它们也不支持因为人类人员保有正式权力,就将软件视为无关紧要。
三个信号将显示军事 AI 监督是否已发生改变
接下来的考验在于,五角大楼是否会将内部教训转化为外部人员可以审查的可执行控制措施。
第一个信号是公布平民伤害调查。一份有用的报告必须说明目标的历史、2019 年分析师警告、此后的每一次验证,以及 Maven 在最终流程中的作用。
报告应明确决策者最后一次查看当前影像的时间,以及是否有开源证据可供使用。它还应说明有多少审查者能够访问相互矛盾的情报。
若报告将事件归因于笼统的“流程失败”,将削弱对改革的信心。一份详细审计,明确责任归属和纠正措施,则会增强这种信心。
第二个信号是数据库陈旧程度和分歧是否能够阻止目标获批。据报道,中央司令部在 Minab 事件后改变了工作流程,增加了开源信息源,并为 Maven 引入了数十项更新。
有意义的衡量标准并不是改动数量,而是如今未解决的冲突是否会阻止批准,除非合格官员记录为何应拒绝较新的证据。
系统应保留分析师异议,而不是将其孤立在彼此脱节的工具中。系统应显示一项分类何时依赖旧影像,并要求对学校或其他受保护地点重新核实。
独立红队测试将强化这些控制措施。审查人员可以在非战斗环境中插入陈旧、矛盾和不完整的记录,然后衡量 Maven 用户是否能发现这些问题。
第三个信号是对 Palantir 及其他军事 AI 供应商的监督。国会应要求获取技术日志和安全评估,而不应接受商业保密或保密等级成为一概而论的障碍。
采购规则可能要求可复现的审计轨迹、源级溯源、模型版本追踪,以及每一次人工覆盖操作的记录。这些要求应在部署前落实,而非等到发生大规模伤亡事件之后。
五角大楼正在扩大 Maven 的应用,而不是从中撤退。这使得 Minab 事件后确立的标准尤为重要。一个在各军事指挥部广泛采用的平台可以迅速推广良好的保障措施,但也可能将隐蔽的弱点标准化。
据报道,Palantir 在袭击后作出的调整表明,该产品将越来越多地使用 AI 来发现目标情报中的问题。这种方法值得针对真实的历史失败案例进行测试,其中包括 Minab 事件。
成功意味着系统能及早暴露关键矛盾、强制进行独立审查,并保留每次批准背后的推理依据。失败则意味着工作流程更快,却叠加了更多由机器生成的确信感。
对开发者而言,这一教训并不局限于国防领域。任何汇聚记录的 AI 系统,都可能让不确定性消失在简洁的界面背后。医疗、金融、基础设施和公共部门软件都面临类似风险,尽管后果各不相同。
对企业采购方而言,Minab 案例挑战了一种常见的销售说辞:汇集更多数据并不会自动带来更好的决策。结果取决于溯源、时效性、互操作性、对异议的处理方式以及用户激励机制。
对知识工作者而言,它说明了为何一个看似自信的答案仍必须能够追溯到其来源。摘要应呈现冲突,而不是将其抹平。预警应反映判断出错的代价,而不只是模型赋予的概率。
因此,Palantir Maven 学校袭击事件并不是一个关于计算机取代所有人类决策的故事。它关乎软件如何让一项存在缺陷的制度性决策推进得更快,并显得更具一致性。
五角大楼如今必须证明,人类控制并不只是把一名军官放在自动化工作流程的末端。Palantir 则必须证明,Maven 在揭示不确定性方面,能够与其组织行动的能力一样有效。
决定性的问题非常具体:当下一个目标包含过时情报和一条被埋没的警告时,系统会叫停袭击,还是只会更快地交付同样的错误?



