Salesforce Koa 模型以 CRM 推理与智能体控制挑战前沿 AI
Salesforce 在 Dreamforce 上推出了其首个 CRM 推理模型,挑战了企业智能体应始终依赖前沿 AI 提供商的假设。Salesforce Koa 模型基于 NVIDIA Nemotron 构建,并针对多步骤销售、服务和营销工作流进行了调优。
该模型发布的同时,Salesforce 还推出了覆盖智能体、模型、数据访问与成本治理的更广泛控制能力。这些公告共同揭示了 Salesforce 更大的押注:企业上下文和运营控制的重要性,应超过拥有最聪明的通用模型。
这一立场使 Salesforce 处于两种竞争路线之间。OpenAI 和 Anthropic 通过专有前沿模型提供广泛的智能能力。Salesforce 则认为,专门化推理、业务上下文和可强制执行的权限,能够造就更实用的企业智能体。
Koa 并未终结这场争论。Salesforce 自身的研究显示,该模型在多项评估中仍落后于最强的前沿系统。其更广泛控制架构的部分可用性细节,也将延续至 Salesforce 的 2028 财年。
这些公告依然重要,因为 Salesforce 已不再将模型视为完全由外部实验室提供、可相互替代的基础设施。它如今拥有一个推理模型、其后训练流程、周边业务上下文,以及治理智能体行为的控制机制。
Salesforce Koa 模型瞄准 CRM 工作,而非所有可能的问题
Koa 将模型的职责收窄至企业工作流,在这些场景中,准确使用工具比开放式对话更重要。
Salesforce 与 NVIDIA 于 9 月 15 日在旧金山举行的 Dreamforce 2026 期间发布了 Koa。Salesforce 将其称为首个专为 Agentforce 内部客户关系管理工作设计的推理模型。
推理模型会在生成答案或执行动作之前,投入额外计算进行规划或评估步骤。对于 Koa 而言,这一过程聚焦于涉及业务记录、政策和软件工具的工作流。
示例包括判断销售机会是否合格、分派支持工单、安排后续跟进,或决定下一步应采取何种行动。这些任务看似普通,但所需能力不止是生成流畅文本。
智能体必须选择正确的工具、提供有效参数、观察结果,并在不违反组织规则的情况下继续执行。一次错误操作就可能修改客户记录,或暴露受限信息。
根据 Koa 公告,Salesforce 通过后训练 NVIDIA 的 Nemotron 3 Super 创建了该模型。该基础模型拥有 1,200 亿参数,并采用混合专家架构,即每个 token 仅激活网络中的部分模块。
Salesforce 表示,其使用公开信息和合成交互训练 Koa,而非客户数据。这些合成场景模拟了 CRM 情境,包括销售对话、服务工单、变化中的客户行为以及多步骤工具调用。
这一差异对企业买家至关重要。基于真实客户记录训练可能引发隐私、同意、保留和知识产权方面的担忧。合成训练使 Salesforce 能够复现工作流模式,而不将实际客户数据纳入模型权重。
Koa 也运行在 Salesforce 的信任边界内。Salesforce 控制其模型权重、后训练和推理过程,从而减少 Agentforce 处理敏感业务信息时所涉及的外部系统数量。
这并不意味着 Koa 是可供客户下载并在任意环境运行的开放模型。更准确地说,它是一个由 Salesforce 托管、源自 NVIDIA 开放权重基础模型的模型。
Agentforce 客户仍可使用其他模型。Koa 会成为 Salesforce 模型路由系统中的另一种选择,而非对 OpenAI、Anthropic 或 Google 模型的强制替代。
这种基于选择的方式,避免 Salesforce 将一切押注于单一模型提供商。同时,它也让公司能够围绕自身 API、Agent Script 规范和 CRM 工作流优化模型。
因此,眼前的变化远不止一次模型发布。Salesforce 已从编排外部智能,转向开发可由其自行调优和运营的专门化推理层。
Salesforce 为何现在构建自己的 CRM 推理模型
Salesforce 需要证明,其客户数据、工作流定义和权限体系能够形成通用 AI 平台难以轻易复制的优势。
Agentforce 此前在高要求推理任务上依赖外部前沿模型。Salesforce 曾开发过较小的特定任务模型,但长时间运行的工作流往往需要 Claude、ChatGPT 或其他外部系统。
Koa 改变了这种依赖关系。Salesforce AI 执行副总裁 Jayesh Govindarajan 在接受 TechCrunch 采访时表示,公司此前一直依赖前沿提供商来完成推理,“直到现在”。
这一时点反映出一种战略威胁。前沿 AI 公司正在围绕其模型增加工具、记忆、集成和企业连接器。它们的智能体越来越能够与销售、支持、法务和分析系统互动,而无需用户停留在传统 Salesforce 界面中。
Salesforce 的回应并不是争夺能力最强的通用聊天机器人。它要做的是,将其长期积累的企业工作理解转化为模型训练材料和运行时上下文。
该公司表示,Koa 的合成数据集反映了近三十年的 CRM 部署经验。这并不意味着模型包含 27 年的客户记录。Salesforce 表示,它在不基于客户数据训练的前提下,对企业工作流和运营模式进行了建模。
这一差异应保持明确。Koa 的优势取决于合成场景能否准确呈现智能体在真实组织中遇到的复杂情况。
销售流程很少遵循单一、清晰的顺序。不同角色的权限各异,字段可能不完整,区域政策可能冲突,而人工审批也可能中断自动化工作流。
Salesforce 的 Agent Script 提供了部分答案。这是一种声明式语言,用于定义智能体的路由、子智能体、可用操作、工具范围、工作流指令和终止条件。
该公司的研究人员利用这些规范生成模拟环境和训练任务。随后,Koa 因通过成功使用工具解决请求而获得奖励,而不仅仅是生成看似合理的文本。
这一机制在智能体配置与模型后训练之间建立了直接联系。用于控制已部署智能体的同一份工作流规范,也可以帮助生成用于改进底层模型的场景。
对 Salesforce 而言,这种联系构成了潜在的反馈循环。更详细的智能体规范可以产生更好的模拟,而更好的模型又能更可靠地执行这些规范。
这也支撑了 Salesforce 更广泛的论点:随着基础模型愈发普及,企业上下文会变得更有价值。模型可以更换,但组织的客户历史、政策、业务定义、权限和工作流始终是该组织特有的。
Salesforce 通过其 Enterprise AI Harness 正式提出了这一理念。该架构在共同的控制层下整合了上下文、自主性、行动、治理、安全和模型选择。
这正是 Koa 与安全公告相连之处。仅有专门化模型无法安全地运营企业系统。它还需要经过验证的上下文、受限工具、经认证的身份、可观测行为,以及即使模型犯错时仍可强制执行的政策。
知识工作者也会在较小范围内面对类似的上下文问题。实用的 AI 取决于通过 knowledge blending 连接可靠的源材料,而非要求模型从通用训练中重建每一个细节。
Salesforce 正将这一原则应用于整个企业系统。其战略资产不仅是模型,更是围绕每项决策和行动的受治理上下文。
Koa 的结果挑战通用模型,但尚未击败最强者
Salesforce 公布的结果支持专门化路线,但并未显示 Koa 能够稳定超越领先的前沿模型。
Salesforce Koa 模型附带一篇技术论文,为买家提供了比单场主题演讲演示更充分的证据。论文解释了训练过程、基准设计和若干重要局限。
Salesforce 研究人员在 Tau2Bench、Berkeley Function Calling Leaderboard 和一项 CRM 基准上评估了 Koa。这些测试涵盖对话式工具使用、函数调用和企业 CRM 任务。
在 Tau2Bench 上,Koa 获得了 69.41 的任务加权得分。其 Nemotron 基础模型得分为 68.64,而 GPT-4.1 得分为 54.48。
Koa 在 Berkeley 函数调用评估中取得了 66.63%。Nemotron 基础模型达到 64.73%,而 GPT-4.1 达到 53.96%。
CRM 基准呈现出更温和的差异。Koa 的总体得分为 0.86,Nemotron 为 0.84,GPT-4.1 为 0.81。
Koa 在该 CRM 评估中的函数调用准确率达到 0.77,高于基础模型的 0.71。这一结果具有相关性,因为选择正确工具是可靠智能体行为的核心。
不过,最强的前沿模型仍在关键比较中领先。OpenAI 的 GPT-5.5 在 Tau2Bench 上得分 83.99,在 CRM 基准上的总体得分为 0.90。Claude Opus 4.8 在函数调用测试中得分 78.18,在 CRM 上得分 0.87。
Koa 研究论文 明确指出,Koa 仍低于最强的前沿模型。这一披露避免了将其解读为 Salesforce 已超越领先 AI 实验室。
相反,这些结果支持一个更为狭窄的结论:围绕工作流规范对开放权重基础模型进行后训练,改善了多项工具使用指标,并超过了一个较早的专有基准模型。
Salesforce 还表示,Koa 在其自有 CRM 基准上产生的错误减少了三倍。买家应将这一数字视为公司自行报告的结果,尤其是因为基准构成可能显著影响结果。
围绕 Agent Script 工作流训练的模型,在与这些工作流相似的评估中预计会具备优势。这并不意味着结果无效,但限制了这一发现可被泛化的范围。
论文还指出了另一项约束。在 Salesforce 开始比较进一步强化学习与监督微调之前,Nemotron 已经接受过强化学习。
研究人员发现,从这一出发点来看,强化学习对多步骤工具使用更有帮助。他们提醒,这一结果未必适用于此前没有接受任何强化学习的基础模型。
实际部署将比受控基准带来更严峻的考验。客户数据可能不完整,API 可能失效,工具可能变化,而请求也可能超出训练场景所涵盖的范围。
安全故障也不同于一般的推理错误。略有偏差的摘要或许只是带来不便;错误的权限决策或未经授权的工具调用,则可能演变为需要上报的安全事件。
这种差异解释了 Salesforce 为何将 Koa 与智能体控制机制结合。更好的推理能力能降低一类故障,但企业部署需要的系统,必须能在推理仍然出错时限制后果。
智能体安全成为 Salesforce 布局的另一半
Salesforce 将智能体安全视为运行时控制问题,而非相信只要模型足够准确,就始终能做出正确行为的承诺。
传统软件执行预先定义的指令。AI 智能体则会在运行过程中理解目标、选择工具并调整计划。这种灵活性也带来了更大、更难预测的攻击面。
智能体可能从文档中获取恶意指令,通过已获批准的连接器暴露数据,选择权限范围过宽的工具,或在原始上下文已不可靠后继续行动。
仅靠模型改进无法消除这些风险。安全控制需要在模型之外,对身份、权限、数据访问、操作和行为进行治理。
Salesforce Guardian 是该公司面向这一环境的安全、合规、隐私和韧性产品组合。现有能力包括 Shield、安全监控、备份、恢复、沙箱测试,以及围绕敏感数据的控制机制。
Salesforce 表示,Shield 可以监控智能体推理并阻止未经授权的数据访问。其更广泛的 Guardian 产品组合旨在帮助管理员观察智能体行为、执行访问策略、保留记录并从非预期变更中恢复。
在 Dreamforce 上,Salesforce 将这些控制机制置于更大的架构之中,而非将其呈现为孤立的附加功能。Enterprise AI Harness 包含 Trusted Security 能力,涵盖身份、权限、隐私、数据保护和运行时安全。
该公司还宣布推出 AI Control Plane。Salesforce 表示,该界面将让组织能够发现智能体、注册能力、建立身份与策略、管理生命周期、评估性能、观察结果并控制成本。
这一范围超出了 Agentforce。Salesforce 表示,该控制平面旨在同时管理 Salesforce 和第三方智能体,反映出组织会使用多种模型和智能体平台的现实。
这种多供应商立场带来了一个重要张力。Salesforce 希望 Koa 承担更多 CRM 推理工作,但也预计客户会继续使用外部模型和智能体。
因此,控制层在战略上比 Koa 更广泛。如果 Salesforce 成为企业治理智能体的场所,那么即使底层智能由其他公司提供,它仍能保持核心地位。
Security Mesh 则通过将多个安全工具的信号汇集到共享视图中,为这一战略增加了另一部分。整合后的信号可帮助团队识别风险模式;当身份、配置、数据和智能体活动被分别审查时,这些模式可能会被隐藏。
不过,已宣布的架构尚未完全可用。Salesforce 表示,许多基础技术已经存在,而新能力和统一体验计划从 2028 财年初开始陆续推出。
这一时间表至关重要。企业无法仅通过架构图来评估控制平面。它们需要文档、支持的集成、策略行为、事件日志、延迟测量数据,以及当智能体越过边界时的明确处置机制。
Salesforce 自己的 Agentforce security 指南正确地强调了监控、权限、数据保护和恢复。困难的问题在于:这些控制是否能在第三方模型、无头接口和外部工具之间保持一致。
Model Context Protocol,即 MCP,为智能体提供了发现和调用工具的标准方式。它提升了互操作性,但也可能使智能体暴露于恶意或误导性的工具实现。
Salesforce 研究人员还单独提出了 ToolGuardian:一个根据声明式安全策略检查智能体与工具交互的框架。这项工作强化了 Dreamforce 公告背后的核心设计原则:授权必须存在于工具边界,而不是存在于模型的意图之中。
对于企业采购方,关键测试并非智能体能否解释安全策略,而是当模型忽视、误解或被操纵以绕过该策略时,平台能否阻止相关操作。
真正的竞争是企业控制力与前沿智能之间的较量
Salesforce 正在押注:专业化推理加上受治理的上下文,将在企业实际自动化的工作流中胜过不受约束的模型能力。
这并不是一场简单的 Salesforce 对 OpenAI 的竞争。Salesforce 仍在其平台中支持 OpenAI、Anthropic、Google 和其他供应商的模型。
分歧在于企业价值将在哪里积累。前沿实验室强调能够跨众多领域提升的通用智能;Salesforce 强调的是数据、策略、工具和业务后果交汇的运营层。
Koa 让 Salesforce 能够更好地控制这一技术栈中的一部分。它可以围绕 CRM 行为调整模型,在其信任边界内部托管推理,并优化 Agentforce 如何路由适用工作负载。
这种控制也可能影响经济性。专业化模型可针对熟悉任务使用更少 token 或更短的推理路径,尽管 Salesforce 尚未发布足够的独立生产数据来证明其可带来广泛节省。
前沿供应商仍保有重大优势。它们的模型在多项公开基准中领先,支持更广泛的任务,并以企业软件公司可能难以匹敌的发布节奏持续改进。
因此,Salesforce 需要让模型路由发挥良好作用。直接的 CRM 任务可以交给 Koa,而更困难的请求仍可能需要能力更强的前沿模型。
路由本身也带来了复杂性。平台必须在选择模型前预测任务难度、理解安全要求、比较预期准确性,并考虑成本和延迟。
糟糕的路由决策可能抵消专业化带来的好处。将困难任务发送给较弱模型会增加失败风险,而将所有任务都发送给前沿模型则会降低 Koa 的实际价值。
公司还需要证明企业上下文始终准确。智能体无法基于过时的客户记录、相互矛盾的策略或不完整的知识做出可靠决策。
这使数据治理成为模型性能的一部分。以不可靠信息为基础的智能体,可能比更简单的系统更自信地失败。
因此,Salesforce 最有力的论点在于架构:Koa 负责专业化推理,AI Harness 提供受治理的上下文,Guardian 限制访问,控制平面则跨供应商观察行为。
最薄弱的版本则是一系列相互重叠、但集成仍不完整的产品名称。Salesforce 必须证明,管理员可以配置和审计系统,而不会由此再增加一层运营复杂性。
客户还应区分确定性控制与基于模型的监控。由身份系统强制执行的权限,比 AI 分类器预测某项操作似乎是否存在风险更可靠。
最佳设计会同时使用两者。确定性规则应阻止绝不能发生的操作,而监控模型则可以识别固定策略未曾预见的异常行为。
这种权衡决定了企业智能体平台是实用,还是仅仅是一场有说服力的主题演讲。Salesforce 已描述了各个组件;生产环境证据必须证明这些组件能在真实工作负载下协同运作。
三个信号将表明 Salesforce 的战略是否奏效
下一项考验不是又一个基准测试头条,而是客户是否采用 Koa、信任这些控制机制,并在混合模型环境中继续让 Salesforce 保持核心地位。
第一个信号是生产可用性和路由行为。Salesforce 需要披露 Koa 何时实现广泛可用、哪些 Agentforce 任务可以使用它,以及客户如何选择或避开它。
有价值的证据将包括路由标准、延迟、token 消耗、失败率,以及使用客户定义工作流进行的比较。如果 Koa 能以更少错误处理重要的 CRM 工作,Salesforce 的专业化论点将得到加强。
如果 Koa 仍局限于演示或范围狭窄的预览,前沿模型将继续承担大部分困难推理工作。这一结果会削弱 Salesforce 能够掌控其更多 AI 技术栈的主张。
第二个信号是 AI Control Plane 及相关安全控制机制的推出。企业需要明确日期、支持的第三方平台、策略定义、审计格式和事件响应工作流。
最有力的证明将是在 Agentforce、外部智能体、MCP 工具、API 和无头接口之间实现一致的执行。安全团队应能够识别是谁授权了智能体、它访问了什么、尝试了哪些操作,以及平台为何允许这些操作。
延迟或碎片化的推出将迫使客户从多个产品中拼凑控制机制。这会削弱 Salesforce 统一架构的价值。
第三个信号是独立的客户证据。Salesforce 已发布基准分数和精选客户案例,但企业需要来自多样化部署的长期数据。
重要指标包括成功完成任务的比例、人工升级率、未经授权操作的拦截次数、恢复事件,以及维护智能体规格所需的工作量。
客户采用情况还应揭示,Koa 是扩大了 Agentforce 的使用,还是仅仅替换了现有工作流背后的一个模型。前者将支持 Salesforce 关于专业化推理解锁更复杂自动化的主张。
若只是替换而未增加使用量,尽管仍会降低对前沿供应商的依赖,但这将是一场较小的战略胜利。
Salesforce Koa 模型为公司应对来自通用智能体日益增长的压力提供了可信的技术回应。它将 Salesforce 的 CRM 经验转化为训练场景,并将该模型连接到受治理的企业操作。
智能体安全工具则解决了这个问题中更困难的一半。能够跨企业系统行动的模型,需要在其推理不可靠时依然可信的控制机制。
Salesforce 现已清晰界定了这场竞争。企业 AI 不会只根据哪种模型能回答最困难的问题来评判;它还将取决于哪一个平台能够将上下文转化为已获授权的行动,同时不失去可见性或控制力。
对于技术领导者而言,实际的下一步是测试完整工作流。衡量模型的决策,检查每一次工具调用,挑战其权限,并在扩大自主性之前验证恢复机制是否有效。



