Salesforce 为 Agentforce 360 AI Agents 获得 DOD IL5 授权
- Olivia Johnson

- 8月6日
- 讀畢需時 13 分鐘
Salesforce 在为 Agentforce 360 获得 Impact Level 5 授权后登上 Google News,为其进入敏感的 Department of Defense 工作流程打开了通道。该批准涵盖受控非密信息以及非密的 National Security Systems 数据,但不涵盖机密工作负载。
这一区别界定了事件的核心。Salesforce 现在可以在获授权的国防环境中提供自主和辅助型软件 agents。然而,授权证明的是该环境符合所需的安全控制要求,并不意味着每个 agent 都能在每项任务中可靠运行。
该公司首个公布的部署项目涉及 Army Human Resources Command。Salesforce 表示,该机构每天处理超过 1,500 个案件,并管理每月超过 5,500 万次对话。这些数字反映了庞大的行政工作量,但仍是公司估算,而非独立披露的性能结果。
因此,眼前的竞争并非 Salesforce 与另一家软件公司之间的较量,而是授权与运营证据之间的较量。Pentagon 可以允许一个平台处理敏感数据,但每项部署仍需明确的权限、人类审核、可靠的源数据以及可衡量的成果。
这一差距至关重要,因为 Agentforce 360 不只是回答问题。Agentic AI 指的是能够理解目标、选择行动并利用已连接系统完成任务的软件。让这类软件访问军方记录,会同时带来价值与风险。
Salesforce 现已获准进入这一环境。更艰难的考验将在其 agents 开始在其中采取行动时到来。
Salesforce 授权实际改变了什么
Agentforce 360 现可处理敏感的非密国防数据,消除了在整个部门范围内推广的一大障碍。
Defense Department 已批准该平台达到 Impact Level 5,通常称为 IL5。该授权允许获批准的云环境存储和处理受控非密信息,即 CUI,也涵盖非密的 National Security Systems 信息。
CUI 并非公开信息,但也不属于机密信息。它可能包括人员、物流、采购、运营支持及其他受保护记录。不当处理这类信息仍可能造成严重的安全与隐私后果。
因此,该授权使 Salesforce 能够接触更广泛的实际国防工作流程。这些流程可能涉及商业 AI 服务在没有获批准环境和运营边界的情况下无法接收的记录。
根据 DOD agent plans,Agentforce 360 将运行在 Salesforce Government Cloud Plus Defense 中。该环境托管于 AWS GovCloud,并为符合资格的政府客户隔离部署。
Salesforce 将 Agentforce 360 描述为一个构建 agents 的平台,这些 agents 可与企业数据、应用程序和预定义操作协同工作。一些 agents 通过准备信息来辅助人员;另一些则可在无需每一步都等待指令的情况下执行获批准的步骤。
IL5 的决定适用于获批准的平台边界,而不是一套不受限制的 Salesforce 功能集合。Salesforce 自己的 government product matrix 警告称,单项功能可能具有不同的授权状态。
这一限制很容易被忽视。组织不能假定所有商业 Agentforce 功能都会自动在国防环境中可用。管理员必须确认哪些模型、集成、渠道和操作处于授权边界之内。
IL5 也不授权处理机密信息。国防云分级在 IL6 时会变得更严格,IL6 支持机密级 Secret 信息;IL7 则涵盖更敏感及绝密环境。
Salesforce 表示,其 Missionforce 组织运营着一个独立、物理隔离的绝密环境。物理隔离环境与普通网络隔绝,以限制数据流动。这一声明并不意味着新的 IL5 授权等同于机密级授权。
这一新状态仍然具有重要意义。在此之前,对 Agentforce 感兴趣的国防部门机构面临的是合规门槛问题。如今,官员可以在符合资格的环境中,将重点放在用例、权限、集成、测试和采购上。
授权将答案从“该平台无法处理这些数据”转变为“可以评估该平台是否适用于这一工作流程”。它打开了大门,却没有决定哪些内容应当通过。
为什么 Army Human Resources Command 率先部署
Salesforce 从行政案件处理着手,因为重复性强、可审核的任务更容易通往有效自动化。
Army Human Resources Command 为士兵、退伍军人、文职人员和家属提供人事流程服务。其工作涉及大量通信、案件记录、福利问题,以及需要从多个系统获取信息的请求。
Salesforce 高管将自动案件摘要确定为 Agentforce 360 的早期用例。一个 agent 可以汇集案件的相关细节,并为人工分析师准备摘要。分析师随后可在决定下一步处理方式前审核结果。
这比要求 agent 作出运营决策更具边界。输入来源可以被明确定义,预期输出具有可识别的格式,人类也能将摘要与底层记录进行比对。
Salesforce 表示,每日可能有超过 1,500 个案件获得这类支持。该公司还估计 Human Resources Command 每月管理超过 5,500 万次对话。但公司尚未公布部署时间表、基准处理时间、准确率或预计积压减少幅度。
这些缺失的指标很重要。对话量并不等于自主 agent 能解决的案件数量。有些互动属于常规事务,另一些则涉及资格规则、争议记录、医疗情况或影响重大的人员决策。
一项有效的试点应区分这些类别。低风险请求可能适合更高程度的自动化;敏感案件则应让人工审核者保持控制权,并保留 agent 所用来源和所采取行动的清晰记录。
Salesforce 此前获得的 Army contract 为这项工作提供了商业路径。这项不定期交付、不定量采购合同的上限为 56 亿美元,期限包括五年基础期和五年选项期。
合同上限并不代表保证支出。它规定了参与机构可在该合同机制下下达订单的最高金额。实际工作仍取决于获得资金支持的任务订单和成功实施。
Human Resources Command 项目隶属于该合同。它为 Salesforce 提供了一个可见的首个客户,同时也为 Army 提供了一个评估 agent 行为的受控场景。
不过,行政工作并不简单。一份错误的案件摘要可能遗漏证据、混淆身份、错误陈述政策,或将分析师引向不正确的结论。即使错误率很低,高处理量也可能放大其影响。
这些 agents 还将依赖已连接记录的质量。如果系统中存在重复身份、过时政策、缺失字段或不一致术语,agent 可能基于薄弱证据生成看似完善的答案。
这也是为何构建以文档为依据的系统的团队,往往需要先建立一个可搜索知识库,再引入自动化。检索质量、权限、版本控制和溯源会在模型开始推理之前塑造答案。
Human Resources Command 为 Salesforce 提供了证明其平台能够管理这些基础要素的机会。真正有意义的结果,不是有多少对话接入了 AI,而是在不增加更正、申诉、隐私事件或分析师隐性工作量的前提下实现更快服务。
Google News 的关注掩盖了更大的国防平台布局
标题聚焦 AI agents,但 Salesforce 正在谋求成为更广泛意义上的主要国防软件承包商。
Salesforce 于 2025 年成立了以国家安全为重点的 Missionforce 组织。其领导者将该部门描述为在成熟公司内部运营的一家创业公司。该组织面向 Defense Department、情报机构及其他联邦任务。
这一结构反映了其雄心的转变。Salesforce 历来通过管理政府项目的大型系统集成商提供技术。如今,该公司的高管希望更直接地参与国防业务竞争,并以主要承包商身份承担更多责任。
Army 合同支持了这一战略。它涵盖数据集成、分析、云服务、协作软件以及未来的 agentic systems。Agentforce 成为更广泛架构中的一层,而非独立的 chatbot。
这很重要,因为 agent 的价值取决于它能够访问的系统。一个模型无需进行广泛集成就能总结文本;但除非它能够找到正确记录、应用现行政策并写入获批准的更新,否则无法解决人事案件。
Salesforce 的优势在于其在工作流程软件领域的既有地位。其平台已经连接了记录、权限、业务规则、仪表板、API 和案件管理。Agentforce 可以构建在这些组件之上,而不必从一个孤立模型开始。
该公司表示,其平台与模型无关,这意味着客户可以在支持的语言模型之间进行选择。不过,IL5 配置存在一个重要例外。据报道,Salesforce 官员必须证明 Anthropic 模型已被禁用,才能获得授权。
这一限制将企业软件的故事与 Pentagon 围绕 Anthropic 的军方访问权限及模型安全保障的争议联系起来。Salesforce 表示,如果该部门改变立场,其受政策控制的设置可以恢复 Anthropic 支持。
目前,模型选择仍遵循政府政策。这一条件揭示了供应商中立性的局限。一个平台可以提供技术灵活性,但获授权的部署仍须遵循采购决定、安全规则和更广泛的国家安全政策。
Defense Department 也扩大了与其他 AI 和基础设施供应商的合作。其机密 AI 扩展计划包括与 OpenAI、Google、Microsoft、AWS、Oracle、Nvidia、Reflection 和 SpaceX 相关的协议。
这些公司并非都以相同方式与 Salesforce 竞争。基础模型供应商提供推理引擎,云公司提供基础设施,企业平台将模型连接到记录和工作流程,系统集成商则组装并运营完整环境。
Salesforce 正在押注工作流层将变得具有战略重要性。如果国防机构在 Salesforce 内构建智能体,该公司就能影响数据、权限、自动化和人工审查如何协同运作。
这一位置可能具有持久性,因为替换一个运营工作流比替换一个模型端点更困难。但它也可能造成依赖。各机构必须评估智能体定义、数据映射、监控记录和行动逻辑是否仍具备可移植性。
Google News 的标题反映了一项合规里程碑。更大的竞争在于:谁掌控商业 AI 模型与政府任务之间的运营层。
授权并不等于验证 AI 智能体
IL5 批准针对的是安全环境,而运营保障则需要独立且持续的评估流程。
云授权会审查一个系统是否满足处理特定信息所需的控制要求。这些控制措施可涵盖访问、身份、加密、审计、事件响应、人员、基础设施和数据处理。
这一流程至关重要。它降低了敏感信息进入缺乏必要保护环境的可能性,也为各机构评估和接受既定风险提供了文档依据。
然而,安全授权并不能证明一个智能体回答准确。它不能证明智能体会选择正确行动、识别不确定性,或在请求超出其权限时停止。
智能体系统带来的风险超出了普通的信息存储范畴。智能体可能检索到错误记录、误解政策、遵循嵌入文档中的恶意指令,或为错误对象执行本身有效的操作。
用户也可能提出模糊请求。智能体可能将该请求解读得比预期更宽泛,并修改多条记录。传统软件通常遵循明确规则,而基于语言模型的智能体可以自行选择中间步骤。
权限有助于控制这种风险,但无法将其消除。拥有只读权限的智能体无法更改案件,但仍可能错误披露信息。拥有写入权限的智能体一旦推理失误,后果会更严重。
美国国防部的负责任 AI 工具包要求在产品生命周期内识别并缓解风险。这种生命周期方法至关重要,因为模型、提示词、工具、数据或政策发生变化时,智能体的行为也可能改变。
因此,测试必须反映真实任务。通用语言基准无法说明智能体能否正确总结一宗陆军人事案件。评估人员需要具有代表性的记录、棘手的例外情况、对抗性输入以及明确的评分标准。
人工监督同样需要落实到运营细节。仅仅说有人参与其中,并不能说明这个人是批准每一项行动、抽查随机样本、只处理升级事项,还是在完成后纠正错误。
每种模式都会带来不同的工作量和风险。要求批准每一个微小步骤,可能会抵消原本承诺的效率;允许不受限制的行动,则可能让错误在任何人察觉前流经相互连接的系统。
实际部署可以按后果划分行动。智能体可以起草摘要和建议,而涉及福利、身份、资格或官方记录的变更则由人员批准。在测试结果支持的情况下,常规检索任务可以采用较轻的审查机制。
日志记录同样重要。运营人员应能够重建智能体访问了哪些记录、接收了哪些指令、由哪个模型版本作出响应,以及尝试了哪些行动。
系统还应展示不确定性,而不是将其掩盖。一份基于相互矛盾记录却显得信心十足的摘要,可能比明显的失败更危险。当证据不完整时,用户需要能够触发审查的信号。
NIST 的生成式 AI 概要强调了可靠性、隐私、安全、透明度和第三方组件相关的风险。这些类别直接适用于结合模型、数据存储、集成和自动化行动的平台。
Salesforce 表示其护栏已内置于平台中。在各机构公布测试方法和运营结果之前,这仍只是供应商的说法。关键问题不在于护栏是否存在,而在于它们能否阻止现实中的失效情形。
真正的权衡是速度与控制
五角大楼希望加快采用速度,但扩大智能体自主性,也意味着需要更严格的权限限制和更有力的证据。
国防机构面临真实的生产力问题。人员要花时间在割裂的系统中搜索、准备摘要、传递信息,并回答重复性问题。延误会影响行政服务和任务战备状态。
AI 智能体提供了一种压缩这些工作流的方式。一个智能体可以收集记录、应用指令、准备输出并路由结果。人类可能收到一份已完成的材料包,而不必手动重复每一个步骤。
这也解释了为何 IL5 此时如此重要。该部门已将商业生成式 AI 推向广泛使用,而各个组成部门正在探索将智能体用于物流、数据运营、规划和劳动力支持。
但速度和控制相互拉扯。智能体能独立作出的决定越多,错误行动可能造成的损害就越大。限制智能体可以降低这种风险,但也会限制节省的人力。
Salesforce 高管曾区分与人协同工作的智能体和独立行动的智能体。这一区分有用,但对于采购或监督而言并不充分。
一个智能体可能在某一步提供辅助,在另一步则具备自主性。它可能独立收集记录、起草摘要并建议行动,而由人员批准最终变更。每一步都需要各自的权限和评估。
任务背景同样会改变可接受的平衡。总结一项例行查询,与对稀缺装备进行优先级排序不同。更新联系信息,与更改军人的资格状态不同。
首批部署应公布任务级边界。各机构需要知道智能体能读取什么、能写入什么、何时必须停止,以及哪些决定始终需要人类参与。
它们还需要后备程序。如果模型服务不可用,工作流应能安全地回退到人工处理。如果监控发现异常行为,管理员应能暂停行动,同时不丢失案件历史。
供应商集中度又带来另一项权衡。统一平台可以减少集成工作,并建立一致的控制措施;但它也可能将数据、工作流、智能体定义和监控置于单一商业环境中。
Salesforce 的模型无关设计可以降低对单一模型供应商的依赖,但不会自动让更广泛的工作流具备可移植性。各机构应测试自己能否以可用格式导出提示词、政策、评估、日志和行动定义。
Anthropic 限制表明了可移植性为何重要。政治、法律或合同决定都可能将某个模型移出获批环境。国防工作流不应因为某一供应商不可用而崩溃。
数据访问也带来类似挑战。一个有用的智能体需要广泛的上下文,但广泛上下文可能与最小权限安全原则冲突。最小权限是指仅授予完成已定义任务所必需的最低限度访问权限。
团队应优先采用规模更小、可审计的权限集,而不是对整个数据资产授予通用访问权。人力资源智能体不应仅因平台能够连接,就访问无关的运营系统。
这种方法会放慢早期部署,但也能形成更好的证据。各机构可以先在狭窄边界内衡量表现,再扩大自主性,而不是一开始就作出覆盖全部门的承诺。
如果 Salesforce 能帮助客户安全地完成这种扩展,它就会获胜;如果授权成为部署纪律的替代品,它就会失去可信度。
三个信号将显示 DOD 推广是否奏效
下一阶段应以任务级结果、授权扩展,以及各机构能否保留实质性控制权的证据来衡量。
第一个信号是陆军人力资源司令部的表现。Salesforce 和陆军应报告初始案件处理的基准处理时间、积压变化、纠正率、升级情况以及用户满意度。
这些指标应将起草摘要与完成处理区分开来。即便由人类完成案件,智能体准备出有用草稿也已创造价值。若将两种活动都计为自主解决,就会掩盖真实结果。
错误严重程度比单一准确率评分更重要。格式错误与错误的福利判定并不具有同等后果。报告应区分无害缺陷与影响人员或官方记录的错误。
如果处理速度加快,同时没有出现更多申诉、返工或隐私事件,推广的可信度将增强;如果分析人员把节省的时间花在检查不可靠的摘要上,可信度就会减弱。
第二个信号是陆军合同下新任务订单的范围。56 亿美元的上限创造了容量,但实际订单才能揭示需求。其他组成部门的加入将表明初始部署正在建立信心。
工作类型同样重要。从摘要扩展到物流、维护或运营支持,会同时提高平台价值和风险。每个使用场景都应获得独立评估。
全部门推广不应意味着将一项配置复制到所有地方。不同组成部门维护不同的记录、政策、任务和风险容忍度。可复用的基础设施仍需要本地测试。
第三个信号是 Salesforce 与国防客户是否会公布具体治理细节。有价值的证据包括权限模型、评估周期、事件处理程序、人工批准节点以及模型变更控制。
还应关注 Anthropic 限制如何演变。恢复 Claude 将展示技术灵活性,但无法解决更广泛的政策争议;继续禁用则表明,平台中立性仍从属于政府指引。
Google News 很可能会持续跟进新合同和部署公告。读者应超越这些里程碑,追问底层证据是否变得更加具体。
最重要的数字不是合同上限或总对话量,而是经验证的处理时间缩短、严重错误率、人工升级率以及安全完成任务的数量。
Salesforce 已跨过一道艰难的合规门槛,并获得了一位可信的首个客户。但它尚未证明自主智能体能够大规模运行于 DOD 的各类工作负载中。
对于技术采购方、开发者和公共部门领导者而言,下一步很直接:追踪人力资源司令部的部署,阅读任务级绩效数据,并将获授权的基础设施与经验证的行为区分开来。Salesforce 会公布足够证据,证明其智能体改善了结果,还是授权仍将是最强的成果?


