OpenAI 五角大楼合同记录揭示了一项存在争议的要求:AI 极少说“不”
五角大楼记录描述军用模型应具备“最低拒答率”,而 OpenAI 与五角大楼双方均否认这一要求被纳入已签署协议,OpenAI 因此面临新的审视。这段存在争议的表述出现在通过《信息自由法》诉讼获得的一份 OpenAI 五角大楼合同 P00003 版本中。文件描述了一类专门系统,旨在尽可能少地拒绝国家安全相关请求。
这一表述并不能证明五角大楼获得了不受限制的模型。OpenAI 表示其拒绝了该条款,国防部则称现行合同中并不包含这一条款。然而,据这项合同调查报道,政府在回应一项明确排除草案的请求时,仍公布了 P00003。
这些文件还造成了一个不寻常的核验难题。五角大楼一名律师起初确认,公开的记录是最终合同;但在记者联系 OpenAI 后,他撤回了这一确认。与此同时,另有文件表明,双方于 2 月 6 日签署了一份扩展后的 P00003 协议,随后又在 2 月 27 日通过另一份协议,授权其在机密网络中部署。
因此,这场争议不止涉及一句存在分歧的表述。它检验的是:当先进 AI 进入保密军事系统时,合同承诺、模型层面的限制以及公开保证能否受到审计。
Anthropic 提供了最直接的参照。其与五角大楼的争议聚焦于大规模国内监控和自主武器的限制。OpenAI 此后宣布在机密环境中部署,同时表示其自身协议保留了这些领域的保护措施。
核心冲突很明确:政府希望模型能够在合法军事任务中持续发挥作用,而 AI 提供商则表示,某些用途仍必须设定明确限制。经过优化、较少拒答的模型,能够帮助分析人员完成正当工作;但当提示涉及监控、目标选择或致命武力时,同样的设计目标也可能削弱一层重要保护。
OpenAI 五角大楼合同存在两套相互冲突的说法
已公开的文件与官方解释,目前仍无法构成关于双方究竟签署了什么的一致叙述。
争议始于 2025 年授予 OpenAI Public Sector 的一项原型协议。一则联邦合同公告称,这项固定金额原型协议的价值最高可达 2 亿美元,其既定目的在于开发应对关键国家安全挑战的前沿 AI 能力。
OpenAI 并非唯一参与者。五角大楼还与 Anthropic、Google 和 xAI 建立了军用 AI 原型合作关系。据报道,应用场景包括后勤、情报决策支持以及更广泛的作战活动。
P00003 扩展了此前与 OpenAI 的合作安排。通过 FOIA 诉讼公开的版本将“OpenAI Mission Models”定义为面向国家安全应用设计的系统。文件称,这些模型将具有“最低拒答率”,并提供为军事用户定制的作战能力。
当模型因政策、安全或技术控制认定任务不被允许而拒绝完成请求时,就会发生拒答。若保护措施错误拦截正当工作,拒答率也可能上升。因此,在许多场景下,减少不必要的拒答是合理的产品目标。
军事场景改变了其中的利害关系。拒绝无害的文档格式处理请求只会带来不便;拒绝涉及目标选择、人口监控或武器操作的请求,则可能是一道有意设置的安全边界。
OpenAI 发言人 Nate Evans 告诉 The Intercept,公司从未接受要求最低拒答率的表述。他称公开文本是 OpenAI 拒绝的一份早期政府提案。Evans 表示,最终签署的协议未包含这一要求。
五角大楼发言人 Jacob Bliss 同样表示,该措辞未出现在该部门与 OpenAI 之间的任何现行协议中。这些否认直接挑战了 P00003 文件的地位,但并未解释它为何会被纳入最终记录的公开材料。
The Intercept 与 Legal Advocates for Safe Science and Technology 曾请求获取已签署的合同、修改文件和相关最终文件。据报道,该请求明确要求该部门不要提供草案。这一区分至关重要,因为 FOIA 公开材料可能包含初步文件,但请求方曾明确试图避免这种模糊性。
五角大楼一名律师最初告诉该媒体,P00003 是最终合同。在 OpenAI 收到有关该表述的问询后,这名律师改口,并要求记者忽略此前说法。该部门随后表示,需要更多时间来确定究竟公开了哪些文件。
这一过程留下了多种可能。政府可能误将草案作为正式文件提供。该文件可能混合了已接受的条款,以及后来通过另一份文书删除的表述。它也可能代表一项已签署的修改协议,但在部署前被后续协议取代。
在缺少签署页、修订历史或具有约束力的替代文本的情况下,无法有把握地选定其中任何一种可能。关键事实并不是 OpenAI 确实提供了低拒答模型;关键在于,公开记录目前尚无法确定究竟是哪一版本约束了相关工作。
为什么“最低拒答率”改变了安全问题
低拒答目标衡量的是可用性,却无法揭示模型在高风险情境下是否仍受到约束。
面向消费者的 AI 产品经常拒绝涉及恶意软件、个人数据滥用、武器制造或针对性暴力的提示。这些控制并不完美,有时会拒绝无害的研究、虚构创作、网络安全测试,或缺乏危险意图的请求。
政府用户有正当理由寻求不同的行为方式。情报分析师可能需要概述极端主义宣传内容,但并不表示认同。网络安全团队可能会要求模型解释恶意代码,以便防御人员识别它。军事规划人员或许需要分析涉及武器、对手和战场条件的问题。
标准的消费者政策可能仅因识别到危险词汇而拦截这些任务。专用模型能够通过考虑用户权限、操作环境和预定任务,减少这类误判。
这项存在争议的条款并不止于描述任务专属访问权限。“最低拒答率”将系统极少说“不”作为成功表现的衡量标准。若没有配套指标、例外情况或评估规则,这一表述几乎没有揭示哪些拒答应当保留。
一个模型可以通过更好地区分正当请求与禁止请求来减少拒答;另一个模型也可以通过移除保护措施达到相同的数值结果。即使总体拒答率看似相同,这也是两种根本不同的系统。
AI Now Institute 首席科学家、曾任 OpenAI 系统安全工程师的 Heidy Khlaaf 告诉 The Intercept,这段表述很可能指向很少或根本没有模型保护措施。她还质疑,在缺乏透明限制的情况下建立国家安全专属护栏这一前提。
这种解读仍是专家评估,而非已部署配置的证据。合同措辞并未披露训练数据、系统指令、访问控制、评估结果,或触发人工审查的条件。
这些缺失细节具有决定性意义。军用模型可以广泛回应,同时仍无法发起行动。它可以在受控云环境内运行,使用经过身份验证的用户、留存记录的提示,以及独立的授权系统。或者,它的输出也可能流入作战工作流程,在这些流程中,速度会压缩审查机会。
建议与行动之间的界线也可能变得模糊。模型无需扣动扳机,也能影响致命结果。它可能对潜在目标进行排序、整合情报报告、建议监控优先级,或为指挥官汇总证据。
每一步都可能影响最终决定。即使最后由人类签字,如果人类没有足够时间、信息或权限来质疑系统,这一签字也并不自动构成有意义的监督。
拒答行为只是这条链条中的一项控制措施。采购限制界定允许的用途;模型政策决定哪些请求能获得回答;技术架构控制数据访问和外部行动;军事条令则在人员依据输出采取行动时分配责任。
可信的安全主张必须说明这些层次如何相互强化,也应指出其中一层失效时会发生什么。
OpenAI 表示,其部署包含技术保障措施,并要求人类对涉及致命武力的决定承担责任。其公开说明还禁止大规模国内监控。这些都是实质性承诺,但未公开的协议限制了外界独立评估其具体运作方式的能力。
因此,即使 OpenAI 成功移除了这段措辞,它仍然值得关注。它揭示了至少一份政府草案在谈判期间所优先考虑的内容。该条款将回应可用性置于核心位置,却没有在公开文本中说明可接受拒答的边界。
OpenAI 的公开保障措施遭遇五角大楼宽泛的任务标准
主要张力在于 OpenAI 承诺的红线,与围绕一切合法用途构建的军事采购模式之间。
2 月 27 日,OpenAI 达成一项协议,允许其模型在机密军事环境中运行。这一时间点紧随 Anthropic 与五角大楼就可接受限制谈判破裂之后。
OpenAI 次日发布了自己的说明。在其协议声明中,公司表示,随着潜在对手将类似技术整合进其系统,军方需要先进 AI。
OpenAI 还提出了若干保障措施。该公司表示,其技术不得支持大规模国内监控;对于涉及致命武力的决定,包括自主武器,必须由人类承担责任。公司进一步表示,OpenAI 人员将参与部署,并监督系统的运行方式。
这些承诺听起来与 Anthropic 提出的担忧相似。Anthropic 曾抵制要求其在未纳入所要求合同限制的情况下,为一切合法军事用途提供 Claude 的要求。五角大楼随后将该公司列为供应链风险,而政府则指示联邦机构停止使用其产品。
“一切合法用途”这一表述看似无所不包,但合法性并非完整的安全规范。法律可能发生变化、在不同司法辖区之间存在差异,或对具体行动问题未作明确规定。政府律师和技术提供商也可能对同一授权作出不同解读。
OpenAI 表示,其条款提供的保护超出现行法律要求。批评者质疑,这些条款是否构成可执行的禁止性规定,还是主要重述了现有政府政策。完整的有效合同将有助于解决这一问题,但其尚未以可供独立审查的形式公开。
“最低拒绝率”措辞加剧了这种不确定性。如果最终协议删除了该措辞,说明 OpenAI 至少成功抵制了一项宽泛的政府要求。如果类似要求以不同表述得以保留,公开说明可能无法反映实际执行标准。
政府的立场带来了另一重矛盾。官员希望商业 AI 系统能够支持消费产品无法应对的任务,同时也反对私营供应商对军事政策行使无限制的控制权。
这种担忧并非毫无道理。未经选举产生的公司不应仅仅通过修改模型使用规则,就决定国家安全政策。军事权力应当置于合法且民主的指挥链之中。
然而,供应商仍掌控着存在已知局限的系统。模型可能生成虚假信息、遵从对抗性指令、泄露敏感数据,或给出缺乏证据支持却颇具说服力的回答。采购条款无法消除这些技术风险。
解决方案不只是决定由 OpenAI 还是五角大楼拥有最终决定权。合同需要明确禁止用途、可衡量的保障措施、日志记录要求、升级处理程序以及违规后果。
独立监督至关重要,因为双方都有强调兼容性的动机。五角大楼希望获得能力更强、操作障碍更少的系统。OpenAI 则希望接触这一具有影响力的客户,同时维持其公开的安全立场。
Anthropic 的争议说明了这些动机发生分歧时会发生什么。Anthropic 拒绝接受政府偏好的条款,导致其遭遇政治报复和运营排除。这一结果会迫使其他竞争供应商表现得更为配合。
OpenAI 正是在那场冲突期间进入机密环境。该公司称其保留了更强而非更弱的保障措施。如今存在争议的 P00003 记录,使得评估这一说法时必须依赖书面证据。
机密部署带来的风险不止于模型拒绝
即使模型的边界经过谨慎限定,在保密性限制外部测试、事件报告和公众问责的情况下,仍可能带来严重风险。
机密网络可防止敏感情报落入未经授权的用户手中。它们也使研究人员、记者和更广泛的公众无法审查已部署模型的行为方式。
这种保密对许多军事行动而言是必要的,但也造成了验证缺口。外部观察者无法进行测试、比较拒绝行为、检查日志,或确定保障措施是否在部署后发生变化。
政府可以进行内部评估,但这些审查必须回答的不只是模型能否完成任务。它们还应衡量幻觉、自动化偏见、数据泄露、提示注入,以及模型在对抗性条件下的表现。
幻觉是指模型以自信的形式生成缺乏支持或虚假的内容。在普通办公流程中,用户或许会发现一条伪造的引文;但在快速推进的行动中,看似合理却错误的综合分析可能影响具有重大后果的决策。
自动化偏见带来了另一个问题。人们往往会过度信任机器生成的建议,特别是在系统处理的信息量超过他们可审阅范围时。低拒绝率模型可能会因在证据不完整时仍给出答案,而加剧这种倾向。
模型还可能接触包含恶意指令的机密材料。提示注入是一种攻击方式,即将命令隐藏在系统被要求分析的数据中。遭到攻陷的文件可能指示模型泄露信息、忽略政策或操纵其结论。
这些失效模式不需要政府具有恶意意图。它们源于技术本身的局限,以及军事信息系统的复杂性。
OpenAI 表示,其部署采用云端环境,而非将模型直接置于武器平台上。这种隔离可以降低即时行动风险,但不会消除模型对情报分析、规划、后勤或目标支持的影响。
五角大楼曾将 AI 描述为在复杂作战环境中增强决策的一种方式。截至 5 月,该部门已宣布与 Google、Microsoft、Amazon Web Services、Nvidia、OpenAI、Reflection 和 SpaceX 就机密网络达成安排。机密 AI 扩张表明,这一政策问题远不止涉及一家供应商。
多家供应商可降低对单一公司的依赖,但也可能造成保障措施不一致、问责重叠,以及向最宽松竞争对手看齐的压力。
更频繁拒绝的模型,可能会在侧重任务完成度的评估中失利。回答更自由的模型则可能显得在运营上更出色,直至发生严重故障。因此,即使没有明确要求取消护栏,采购指标也可能塑造安全行为。
公众讨论不应将拒绝一概视为有益。过度拒绝会使系统变得不可靠,并促使用户寻求控制更少的替代方案。真正相关的问题是,拒绝是否发生在正确的边界上。
回答这一问题需要基于情景的测试。评估人员应审查模型是否会拒绝非法监控、缺乏支持的目标识别、自主致命行动以及规避授权的尝试。他们还应验证模型能否完成合法的情报和防御任务。
必要时,结果可以保持机密,但监督机构需要获得访问权。监察长、国会委员会以及获得适当安全许可的独立专家,可以在不公开行动机密的情况下评估控制措施。
OpenAI 与五角大楼合同争议暴露了当合同和评估框架均无法接受审查时会发生什么。公众得到供应商和客户的保证,却缺乏检验这些保证所需的证据。
文档缺口如今已成为核心风险
最有力的结论并非 OpenAI 已取消其保障措施,而是政府的记录保存方式使一项影响重大的协议无法接受审计。
公开文件包含一项双方均称已拒绝的条款。FOIA 请求寻求最终记录,并排除了草案。一名政府律师最初将 P00003 视为最终版本,随后又撤回了这一结论。
每一项事实都可能有无辜的行政解释,但合在一起,它们削弱了人们对官方合同历史的信心。
在涉及机密前沿 AI 的采购中,版本控制应当是基本要求。审查者需要知道谁提出了一项条款、它何时变更、谁批准了修订,以及哪份文件管辖部署。
2 月的时间线增加了复杂性。据报道,另一份文件显示 OpenAI 于 2 月 6 日接受了扩展版 P00003。2 月 27 日,双方完成了机密网络安排。
这些协议之间的关系仍不明确。2 月 27 日的文件可能取代此前的修改,也可能是对其补充。它还可能管辖一项独立部署,同时保留原型协议的一部分继续有效。
OpenAI 的否认很具体:该公司称,已签署的合同并未要求最低拒绝率。这一断言值得被清晰记录。但不应将其延伸为证明公开文件从未被签署,或其他地方不存在类似性能要求。
五角大楼的否认同样有限。称该表述未出现在任何现行合同中,并不能确定它是否曾出现在已签署的修改文件里。一个条款可在修订或替换后从现行协议中消失。
政府无需暴露机密行动,就能解决这场争议的大部分问题。它可以公开相关签字页、修订时间线、替代条款以及有效要求中的非机密部分。
OpenAI 也可以在必要删节后,公布支持其公开保障措施的准确合同文本。该公司已经披露了其对协议的解读,因此确认有效条款会为这一说法增加实质内容。
批评者也需要避免夸大。“最低拒绝率”并不能证明某个模型控制武器、实施监控,或无视所有限制。该文件描述的是一种期望特征,而非特定被禁止部署的证据。
该表述同样未揭示实际拒绝率。现有报道中没有经过验证的百分比、基准测试,或与面向消费者的 ChatGPT 的比较。因此,声称军方获得了完全不受限制的模型,超出了现有证据所能支持的范围。
不确定性本身就会带来后果。开发安全系统的人员需要相信,部署承诺能够经受采购压力。企业买家也需要准确文件,以应对不同模型配置在不同政策下运行的情况。
知识工作者同样需要理解,一个熟悉的模型名称并不保证熟悉的行为。军事配置、企业部署和公共聊天机器人可能使用不同的指令、工具、权限和拒绝阈值。
维护可搜索的政策、评估和修订记录,是负责任 AI 治理的核心。一套管理良好的知识库无法替代公共监督,但同样的原则适用:影响重大的决策需要可追溯的来源和版本历史。
因此,在更有力的证据证明其他情况之前,这场争议应被视为一次文档失效。这种表述既对潜在指控保持谨慎,也承认在如此高风险的层面,合同模糊性不可接受。
“最低拒绝率”披露后值得关注的事项
三个信号将决定,这一事件会成为可纠正的记录争议,还是更深层问责问题的证据。
第一个信号是实际有效合同链的公开。五角大楼应说明 P00003 是否已签署、被替换,或是意外生成。它还应展示 2 月 6 日的修改与 2 月 27 日机密部署协议之间的关系。
如果清晰的时间线表明争议条款仅保留在被拒绝的草案中,将支持双方的解释。持续拒绝公开或给出相互矛盾的回答,则会加深人们对公开说明遗漏相关条款的担忧。
第二个信号是针对军事 AI 拒绝行为的具体评估框架。官员无需披露敏感提示词或情报数据,仍可公开禁止用途类别、测试方法、报告义务,以及负责调查失效的机构。
这样的框架应区分错误拒绝与必要拒绝,还应测试幻觉、未经授权的工具使用、提示注入,以及在行动时间压力下的人类监督。
公布有实质意义的评估标准,将强化 OpenAI 关于更实用的军事模型仍可保留明确边界的论点。若性能计划只关注回答率,则会削弱这一论点。
第三个信号是五角大楼如何对待各家竞争供应商的安全护栏。Google、Microsoft、Amazon、Nvidia、Reflection、SpaceX、OpenAI 及其他承包商,不应在监控或致命决策方面适用实质上不同的规则,除非有书面记录的理由。
Anthropic 的对峙使这种比较尤为重要。据报道,在谈判破裂前,五角大楼谈判的重点在于该公司是否会允许更广泛的军事用途。随后,OpenAI 宣布达成一项协议,保留了在公开描述中看来相近的限制。
如果各供应商逐渐形成共同的安全护栏,这一事件看起来会更像是一场艰难谈判,随后实现了政策趋同。若供应商因更愿意减少拒绝而获得不同条款,竞争压力可能会持续降低安全底线。
OpenAI 与五角大楼的合同事件,归根结底关乎谁来界定这条底线,以及任何人如何验证它。无差别拒绝与不受限制的服从,都不是军事 AI 的恰当标准。
读者应关注文件、可量化的控制措施和一致的供应商规则,而不是又一轮保证。在这些尚未出现之前,“最低拒绝率”条款仍存争议,据称在该条款下交付的系统也尚未得到验证。下一次披露应回答一个简单的问题:当一项合法军事请求仍会造成不可接受的风险时,哪些安全护栏约束着已部署的模型?



