top of page

随着 GenAI.mil 扩张,五角大楼 AI 安全风险加剧

4小时前
讀畢需時 13 分鐘

在 GenAI.mil 用户数达到 170 万后,五角大楼将两套企业级 AI 系统纳入该平台。尽管已有正式安全保障措施,此举仍加剧了五角大楼 AI 安全风险。ChatGPT Mil 和政府版 Grok 于 2026 年 8 月 31 日进入军方日常数字工作环境。两者均获准处理受控非密信息(Controlled Unclassified Information,CUI),安全等级为影响级别 5,即 IL5。

这已不再是少数技术团队参与的小范围试验。GenAI.mil 于 2025 年 12 月上线,在九个月内覆盖了该部门 300 万员工中的逾半数。其工具可支持规划、政策、采购、物流、行政、文件分析及持续性项目工作。

五角大楼将这种覆盖范围视为作战优势。批评者则看到,工作提速与严谨的信息处理之间存在一种不那么显眼的取舍。Foreign Policy in Focus 发布的一项分析指出,企业 AI 的常态化使用会扩大攻击面,同时让敏感信息披露显得稀松平常。

核心问题并不在于一款获得认证的聊天机器人是否会立即泄露军方文件。目前没有公开证据表明 GenAI.mil 已造成重大泄密事件。人们担忧的是,数百万次日常互动是否会带来更多凭据、存储项目、软件连接,以及人为失误的机会。

这一区别至关重要。认证可以建立安全的技术边界,却无法预测在该边界内发生的每一次提示、上传、推断或决策。因此,五角大楼 AI 安全风险取决于人类行为和系统架构,而不只是模型的安全标签。

GenAI.mil 刚刚成为日常军事基础设施

8 月的扩张,使 GenAI.mil 从一项快速增长的服务转变为覆盖大部分国防人员的多模型工作平台。

该部门在同一天推出了 ChatGPT Mil 和 Starshield AI 的政府版 Grok。两款产品加入了一个旨在通过政府平台,让军方人员接入多种商业前沿模型的环境。

ChatGPT Mil 的发布公告将聊天、文件、项目和自定义 GPT 列为核心体验。该部门表示,更多功能将逐步推出。

这一组合的重要性远超一个基础聊天窗口。文件功能让用户能够将源材料带入对话;项目功能可在不同会话间保留上下文;自定义 GPT 则能固化可重复使用的指令与工作方式。

每项功能都能减少重复劳动。合在一起,它们也可能将 AI 服务变成不断演进的组织知识库。该系统不再只回答孤立问题,还可能成为团队存储上下文、解读文件和重复执行工作流的一部分。

Grok 的部署公告增加了持续性项目、可自定义工作区、推理模式和可复用的操作手册。该部门表示,这些手册可捕捉并规模化运用机构知识。

官员将多模型设计定位为防范供应商锁定的措施。用户可以获得不同的 AI 能力,而不必将整个部门的工作流都置于单一商业供应商之后。

这种做法在采购层面提升了韧性,但也增加了需要监管的模型接口、集成点、权限结构和更新周期数量。

GenAI.mil 的规模提高了风险权重。该部门表示,九个月内已有超过 170 万名独立用户。ChatGPT Mil 的设计目标是支持超过 300 万名人员,这表明更广泛的采用仍是目标。

预期用途十分广泛,但大多限于非机密工作。一名采购专业人员可能比较市场调研结果;物流团队可能分析供应约束;政策官员则可能总结长篇文件,或重组政策指导草案。

这些任务看起来很日常,这正是它们具吸引力的原因。但其中涉及的信息,其敏感性往往来自语境,而非单一的密级标识。

一份供应记录或许透露不出什么。多份记录若与部署时间表和维护问题结合,便可能暴露某些模式。当有用的信息聚合也产生非预期洞见时,安全挑战便由此开始。

原始评论并未发现 GenAI.mil 存在泄密事件或技术缺陷。它提出的是结构性主张:与持续性 AI 工作区更频繁的互动,会为累积信息变得对对手有价值创造更多机会。

即使尚未发生事件,这一扩张仍构成安全议题。五角大楼已将对话式 AI 纳入日常工作,而在这种规模下,其多年使用行为的公开证据尚未形成。

为什么便利性会加剧五角大楼 AI 安全风险

安全平台能够减少使用公共聊天机器人的风险,但仍可能通过信息聚合、访问权限和习惯性披露带来新的风险。

影响级别 5 是美国国防部针对处理受控非密信息(CUI)系统的云安全分类。CUI 是需要采取保护措施、但不属于国家安全机密的信息。

ChatGPT Mil 和政府版 Grok 获得 IL5 认证具有重要意义。这表明它们满足了特定信息环境的安全要求,但并不意味着每一种可能的使用方式、连接或人为决策都是安全的。

这一区别正处于当前争论的核心。技术授权评估的是系统周围的控制措施;作战安全则取决于人们长期如何使用这些控制措施。

对话式界面在设计上就是为了降低操作摩擦。用户可以提出非正式问题、粘贴文本、上传文件,并通过自然对话优化输出。这些功能之所以实用,是因为它们更像协作,而非数据库管理。

它们也可能改变用户对披露行为的认知。一个人在公开发布文件前会犹豫,却可能愿意在获批环境中与助手讨论文件内容。

这种安心感并不必然构成违规。GenAI.mil 的存在,部分正是为了提供公共 AI 服务之外的获批替代方案。与不受管理的外部使用相比,将授权工作留在受监控的政府平台内可以提升安全性。

复杂之处在于,审批可能带来心理上的安全感。用户可能将“获准处理 CUI”理解为广泛保证,而不是一条附带持续责任的边界。

安全团队将未经授权的工作场所 AI 使用称为“影子 AI”。它包括员工使用未经批准的服务,或在缺乏充分审查的情况下启用内嵌 AI 功能。

美国国防反情报与安全局在 2026 年 6 月的一份公告中称,影子 AI 是导致未经授权披露、数据泄露和作战安全失误的主要途径。该机构建议人员使用 GenAI.mil 等获批平台,而非公共模型。

这一建议合乎情理,但它是将活动转移到共享的企业环境,而非消除根本行为。管理员仍需掌握提示、文件、代理操作、权限及保留项目数据的可见性。

最棘手的危险在于信息聚合。当单独来看均属非机密的一系列事实被汇集和解读时,可能揭示一项机密能力、脆弱点或行动。

在 GenAI.mil 达到当前规模之前,美国政府问责局就已记录了这一担忧。在其联邦 AI 审查报告中,国防部官员表示,生成式模型可能将非机密训练信息结合起来,并无意中生成机密输出。

同一审查还发现了另一项人为因素。国防部和 NASA 官员表示,一些政府用户缺乏理解生成式系统如何得出答案的专业能力。这一缺口可能使人们对看似合理的输出产生虚假信心。

这两类风险会相互强化。聚合信息可能揭示超出用户预期的内容,而流畅的回答也可能获得超过其来源依据所应有的信任。

当项目保留上下文时,问题尤其棘手。持续性可帮助用户继续复杂工作,无需每次都重建提示;但它也可能将文件、指令和推导结论集中在一个极具价值的账户中。

攻击者未必需要攻破整个网络。被盗凭据、权限范围不当的集成、暴露的项目或权限过高的账户,都可能提供足以造成损害的上下文。

多模型访问又增加了一层复杂性。不同供应商采用不同的架构、安全方法、更新节奏和数据处理安排。共享平台必须在这些差异之上实施一致的安全结果。

这并不能证明 GenAI.mil 不安全。它说明,即便每种产品都通过认证渠道接入,安全负担仍会随着采用规模扩大而增长。

五角大楼希望提速,但安全依赖于摩擦

核心冲突在于 AI 优先的运营模式,与保护敏感军事信息所需的刻意摩擦之间。

该部门推动快速采用的理由不难理解。商业 AI 可以总结文件、起草常规材料、协助分析供应链,并减少行政工作。更快的综合分析能让决策者将更多时间投入高价值任务。

军事组织同样面临在竞争对手获得持久优势前采用技术的压力。中国和俄罗斯正投资将 AI 用于情报、网络行动、影响力行动和战场系统。

无限期等待本身也有风险。一个阻止有用 AI 的组织,可能迫使员工转向未经批准的工具,也可能延续限制作战响应速度的缓慢流程。

在 GenAI.mil 出现之前,五角大楼已开始应对这一压力。2024 年 12 月,其首席数字与人工智能办公室和国防创新部门成立了 AI 快速能力小组。

该小组在 2024 和 2025 财年获得约 1 亿美元,用于试点项目和基础设施建设。其初始应用场景包括指挥支持、规划、物流、情报、网络行动、采购、医疗管理和软件开发。

这一议程反映出从试验走向部署的刻意转变。GenAI.mil 为该部门提供了一条企业级路径,可将这一战略带入日常工作。

传统安全体系依赖摩擦。密级标识、分隔访问、日志记录、审批流程和独立网络,会迫使人们在移动信息前停下来。这种延迟往往是有意为之。

对话式 AI 则朝相反方向运作。它的价值来自缩短问题与有用结果之间的步骤。持续性工作区免除了重复说明上下文的需要,文件上传则省去了手动提取。

因此,五角大楼希望从同一界面获得两种相互冲突的特性:商业级便利与军事信息纪律。

这种张力无法通过绝对地选择便利性或安全性来化解。一项有用的军用工具必须支持实际工作;而安全的工具必须在情境、权限或数据组合构成危险时,对这些工作加以约束。

安全弱点论聚焦于常态化问题。Michael Aaron Cody认为,日常对话式使用会逐渐削弱用户在使用传统系统时所保持的谨慎。

这是一项分析性主张,而非已被证实的失效证据。随着用户数量上升,这一观点会显得更可信,因为规模扩大也会增加行为差异。

试点项目可以依赖经过筛选的参与者、密切监督和有限场景。覆盖所有军种的企业级服务则会面对新用户、地方实践、不断变化的任务,以及参差不齐的技术知识。

培训有助于建立规则,但无法消除错误。人们会忘记流程、误读标识、过度接受模型输出,或将截止期限置于优先位置。对手正是围绕这些可预测的行为来设计网络钓鱼和社会工程攻击。

AI带来了新的操纵路径。例如,提示注入会将恶意指令隐藏在模型读取的内容中。即使用户没有察觉,AI系统也可能遵循这些指令。

检索系统也可能引入类似问题。检索使AI助手能够在回答问题前搜索获批准的信息来源。如果权限控制或来源验证失效,模型可能会呈现超出用户预期访问范围的内容。

持久化项目同样需要生命周期控制。管理员必须知道项目由谁创建、包含哪些数据、谁可以访问,以及何时应当删除。

这些都是常见的知识管理问题,但AI让存储的材料变得可交互。当模型能够迅速推断数千条记录之间的关联时,可搜索的资料库会变得更加敏感。

私营组织在构建可搜索知识库时也面临类似挑战。随着检索变得更容易,访问边界和来源可追溯性的重要性随之上升。

五角大楼面临的后果则严重得多。看似轻微的信息披露可能影响情报方法、部队防护、采购谈判,或盟友共享信息的意愿。

因此,速度并非没有代价。通过自动化综合分析节省的每一分钟,都相应要求进行日志记录、监控、访问审查和模型评估。

GenAI.mil 的安全风险不止于数据泄露

该平台必须同时防御遭入侵的访问权限、被操纵的知识、不可靠的回答以及权限过高的自动化。

数据泄露最受关注,因为它容易想象:用户上传敏感材料,随后未经授权的一方获得这些材料。然而,五角大楼AI的安全风险远不止于此。

其中一种风险是完整性。对手可能试图影响模型检索的信息,或训练过程中使用的来源。其目标是在不明显破坏系统的情况下塑造回答。

研究人员已研究过国家支持的信息行动如何出现在商业聊天机器人的输出中。2026年4月的一份 National Defense 报告描述了涉及 ChatGPT、Grok、Gemini 和 DeepSeek 的测试,测试围绕俄乌战争相关问题展开。

研究人员报告称,五分之一的测试查询引用了俄罗斯国家媒体。结果因模型和提示语框架而异,因此这一发现不应被视为对 GenAI.mil 的直接评估。

但它仍说明了一个重要问题:模型可以保持可用、流畅且响应迅速,同时提供受敌对叙事影响的信息。

第二种风险涉及不可靠的推理。生成式模型产生的是概率性输出,而非经过验证的结论。它们可能虚构引用、遗漏限定条件,或混合相互矛盾的事实。

对一份一般文件作出错误总结或许只会浪费时间;但在后勤规划或情报支持中出现同样行为,则可能扭曲决策。

人工审查仍然至关重要,但审查质量取决于专业能力和工作负荷。如果用户假定系统已经完成了困难的分析工作,自动化可能会削弱监督。

第三种风险来自过高权限。与标准聊天机器人相比,Agentic AI 能够采取行动、使用工具,并在较少即时人工指导下追求目标。

GenAI.mil 在8月的公告主要聚焦于对话和工作区功能。然而,两份公告都承诺将增加更多能力或高级工作流,因此权限设计将成为未来的重要关切。

美国国家安全局在2026年4月发布的Agentic AI 指导意见警告称,权限过高的智能体可能放大单一入侵事件的影响。该指导意见还将攻击面扩大、复杂互连、不透明行为和问责薄弱列为主要风险。

该指导意见建议渐进式部署、持续演进的威胁评估、严格监控、明确问责和人工监督。这些建议挑战了以用户增长为中心的简单采用指标。

更多用户并不一定代表更高的军事价值,它们只说明了覆盖范围。决策质量、节省的时间、错误率、安全事件和任务结果,才提供更有意义的证据。

第四种风险关乎供应商。多模型平台降低了对单一公司的依赖,但政府仍依赖商业供应商进行模型开发和更新。

供应商可能改变模型行为、淘汰某个版本、发现漏洞,或调整某项功能。该部门必须验证具有重大影响的变更,同时又不能完全冻结创新。

这需要版本跟踪。安全团队需要知道是哪一个模型生成了输出、由何种配置控制,以及调查人员审查事件前模型是否已发生变更。

国会已经认识到这一要求。2026财年国防法要求该部门建立AI治理机制,涵盖安全测试、数据投毒、越狱、未经授权的访问、采购风险和模型评估。

该法还要求建立登记系统,用于跟踪版本历史、性能、安全状态和合规情况。这些措施表明,现有网络安全控制需要扩展出针对AI的机制。

这项法律既强化了怀疑论者的论点,也回应了其中一部分。五角大楼并非在毫无治理架构的情况下扩展 GenAI.mil;国会和安全机构已经识别出许多相关风险。

仍不确定的是企业级规模下的执行情况。公开公告提供了用户总数和功能说明,却很少披露事件发生率、权限错误、保留实践或对抗性测试结果。

IL5 认证无法回答所有这些问题。它为 CUI 建立了安全基线,并不能永久证明每次模型更新和每个用户工作流都维持在可接受风险范围内。

因此,最有力的批评并非该平台缺少防御措施,而是部署推进的速度快于外部人士评估这些防御措施在日常压力下表现的速度。

什么能证明五角大楼找到了正确平衡

下一项考验在于,该部门是否会以报告采用情况同样清晰的方式,披露安全和性能证据。

三项信号将决定 GenAI.mil 的扩展是增强部队能力,还是形成持久弱点。

第一项是运营安全报告。五角大楼应追踪全平台的数据泄露事件、可疑提示、遭入侵账户、权限失效和政策违规情况。

由于该环境涉及敏感活动,公开报告仍将受到限制。但国会和独立监督机构仍可获得详细指标,并发布汇总性发现。

如果使用量增长时事件发生率保持稳定或下降,就会削弱“常态化必然侵蚀纪律”的论点。若事件上升、访问失效反复发生,或存在被隐瞒的入侵事件,则会强化这一论点。

第二项信号是2026财年AI安全授权要求的落实情况。国会要求制定覆盖整个部门的AI和机器学习系统网络安全与治理政策。

AI安全条款包括对抗性测试、供应链评估、采购要求、受控沙盒和跨职能模型监督团队。这些要求同时应对技术和组织层面的风险。

关键问题在于,这些控制是否持续运行。一个在部署前接受评估的模型,可能因更新、连接工具、检索数据和新的用户配置而改变。

有效监督应覆盖完整生命周期,包括模型版本、数据来源、权限、集成、事件和退役决策。

明确的里程碑将增强人们对该部门正随采用规模同步扩大治理的信心。规则延迟出台或执行不一致,则会支持“部署仍领先于保障”的担忧。

第三项信号是 GenAI.mil 如何引入可执行行动的功能。聊天和文档辅助已经需要谨慎控制,而智能体系统可以通过连接的服务执行多步骤任务。

当模型能够编辑记录、发送请求、查询受限资料库或触发运营工作流时,安全边界就会发生变化。此时,人工批准和最小权限访问变得更加重要。

最小权限意味着只向用户或系统授予完成特定任务所需的访问权限。它能限制错误、操纵或凭证被盗造成的损害。

该部门应逐步引入智能体功能,并在贴近现实的攻击场景中进行衡量。安全团队应测试恶意文件、被投毒的知识来源、遭入侵的插件和误导性指令。

这一过程会放慢部分部署。当AI系统能够跨连接资源采取行动时,这种延迟本身就是一项安全功能。

对国防领域之外的开发者和企业采购方而言,教训很直接:私有模型、获批平台或合规认证并不能消除运营风险。

组织仍需要访问控制、保留政策、来源可追溯性、版本跟踪、用户教育和事件响应。它们还需要证据证明AI能够改善工作,而不是掩盖错误。

GenAI.mil 正成为敏感机构内部企业级生成式AI最具规模、最可见的测试之一。其结果将影响各国政府如何评估多模型平台、持久化工作区和AI智能体。

五角大楼已经证明自己能够快速推广AI。现在,它还需要证明监控、评估和信息纪律能够以同样速度扩展。

这些证据应比下一个用户里程碑更重要。只有每次扩展都带来可衡量的控制措施、透明监督,以及用户无法随意绕过的限制,五角大楼AI安全风险才能保持可控。

未来数月的问题很简单:五角大楼会公布安全表现正在改善的可信迹象,还是只会宣布有更多人能够使用这些工具?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page