top of page

Salesforce Koa 推理模型在 CRM 工作上挑战前沿 AI

9月19日
讀畢需時 14 分鐘

Salesforce 于 9 月 15 日推出 Salesforce Koa 推理模型,声称其在 CRM 操作中的错误率比领先的通用模型低三倍。Koa 与 Nvidia 联合打造,面向 Salesforce 此前交由外部前沿模型处理的多步骤销售、服务和商务工作流。

这一转变的重要性超过又一次基准测试胜利。Koa 将 Salesforce 长期积累的 CRM 流程知识转化为一个由 Salesforce 自主控制、托管,并能在自身信任边界内适配的模型。

直接承压的是 OpenAI 和 Anthropic 等前沿 AI 提供商。它们的模型在多项广泛测试中仍更强,但 Salesforce 不再认为广泛智能必须处理每一项有价值的企业任务。

Koa 则提出了一个更聚焦的问题:专用模型能否比更大的通用模型更可靠、更私密、更高效地执行重复性业务流程?

Salesforce 尚未完全回答这一问题。其结果来自公司主导的评估,而在预计于 2026 年冬季在美国发布之前,Koa 仍仅限于部分试点项目。

不过,此次发布为不再向前沿提供商租用所有推理任务建立了可信的替代方案。它也让企业采购方能够具体检验:领域专业化是否会比通用基准测试领先地位更重要。

Salesforce Koa 推理模型进入 Agentforce

Koa 让 Salesforce 从前沿推理服务的客户,转变为专用推理层的所有者。

Salesforce 和 Nvidia 通过后训练 Nemotron 3 Super 开发了 Koa,后者是 Nvidia 拥有 1,200 亿参数的开放权重基础模型。开放权重意味着开发者可以检查和修改模型参数,但这并不自动意味着每个组件都是开源的。

该模型将在 Agentforce 内运行。Agentforce 是 Salesforce 用于创建可调用公司数据和业务工具的智能体平台。这些智能体能够筛选销售线索、更新商机、分配案例、安排跟进并解决服务请求。

在 Koa 之前,Salesforce 依赖通用前沿模型为复杂、多步骤任务提供核心推理能力。规模较小的 Salesforce 模型已处理更狭窄的任务,包括分类、评估、毒性筛查和搜索重排序。

Koa 承担了更具挑战性的中间层职责。它必须理解请求、选择合适的工具、在多轮交互中保持状态,并判断所请求的工作是否真正完成。

Salesforce 将其描述为 CRM 推理,而非通用智能。这一区分限制了 Koa 的范围,但也为模型提供了更明确的成功定义。

询问退款的客户并不需要一段对退款政策措辞优雅的说明。客户需要的是一个智能体核查账户、应用正确政策、调用获授权工具,并记录结果。

Salesforce 表示,Koa 从基于其 27 年 CRM 经验建模的合成场景中学习了此类流程。该公司的 Koa 公告称,这些场景覆盖了 14 个以上行业。

训练集包含制造业、金融服务、医疗保健和旅游业的模拟工作流。每个场景都结合了人物角色、任务、所需操作,以及获得有效结果所需的工具调用。

Salesforce 表示,未使用任何客户数据来创建该训练语料。Koa 也在由 Salesforce 控制的基础设施内运行,客户数据和推理轨迹均留在公司的信任边界内。

这种架构是其主张的核心。Salesforce 并非只是在拥挤的选择菜单中提供另一种模型选项。它提供了对模型权重、推理环境、工作流知识和运营数据路径的控制。

Koa 已在 Slack 中支持一款内部 Salesforce 员工智能体。Salesforce 还公布了包括 Formula 1、UChicago Medicine、Xero、Engine、Baxter Credit Union 和 1-800Accountant 在内的试点参与者。

该模型现已向部分 Agentforce 试点客户开放。Salesforce 预计将在 2026 年冬季于美国地区全面上线。

这些试点如今承载着不同寻常的分量。它们必须证明,在受控 CRM 评估中的表现能否迁移至数据不一致、政策持续变化且审批规则复杂的真实组织中。

专用 CRM AI 为前沿模型带来压力的原因

Koa 挑战了“能力最强的通用模型必然也是企业工作的最佳模型”这一假设。

前沿模型旨在覆盖编程、写作、数学、研究、分析和开放式对话。这样的广泛能力帮助企业处理多样任务,而无需为每条工作流训练独立模型。

但对于重复性的运营工作,这也会造成不匹配。销售流程很少需要不受限制的创造力,而是需要对每一条线索一致地应用相同的资格判定政策。

Salesforce 认为,通用模型会从第一性原理出发处理每项请求。它们接收指令和上下文,推断所需流程,并在每次交互中重建解决方案。

专用模型则可在后训练期间内化更多流程知识。它仍会接收组织特定的指令,但会以对工作流、工具和有效结果更强的预期作为起点。

Salesforce AI 执行副总裁 Jayesh Govindarajan 清晰概括了这种依赖关系。他告诉 TechCrunch,Salesforce 在推理方面“直到现在”都依赖前沿提供商。

这句话点明了 Koa 的真正对手。它并非某一款特定的 OpenAI 或 Anthropic 模型,而是将每一项困难的企业推理任务都发送给封闭式通用系统的默认做法。

Salesforce Koa 推理模型不会在 Agentforce 中全面替代这些系统。Salesforce 表示,其编排层仍可继续将不同任务分配给专用模型和前沿模型。

这种路由方式将模型视为组件,而非完整平台。分类任务可以交给小型分类器,CRM 推理可以交给 Koa,不常见的通用任务仍可交由前沿模型。

这样的路由也改变了供应商关系。Salesforce 在协商模型访问、部署条款、延迟、治理和未来集成时获得了替代选择。

企业软件提供商还有另一项动机。它们拥有多年的流程设计、模式、实施经验和领域术语,而这些并非通用模型开发商所拥有。

Koa 将其中一部分知识封装进 Salesforce 的 AI 层。这可能加深 Salesforce 平台的价值,同时减少外部模型提供商可获得的差异化空间。

这一战略并不局限于 CRM。Constellation Research 指出,企业软件供应商正日益将 Nemotron 模型适配至专用工作负载,并控制 AI 成本。

Palantir 已通过定制模型和受控企业部署采取了相关方向。如果开放权重基础模型保持竞争力,其他应用供应商也可以作出类似选择。

这并不意味着每家软件公司都应训练推理模型。这项工作需要高质量的任务模拟、评估环境、基础设施,以及足够多的重复工作流来证明专业化的合理性。

Salesforce 以非同寻常的规模拥有这些要素。它拥有数十年的 CRM 产品开发经验,以及一个智能体已可与结构化记录和定义明确的操作交互的平台。

前沿实验室仍保有重大优势。它们可以将研究成本分摊给众多客户、频繁发布改进,并支持超出单一供应商运营领域的任务。

因此,Koa 在不消除依赖的情况下带来了压力。它迫使前沿提供商证明,为何广泛的外部模型应获得每一项企业工作负载,而不是默认接收这些工作负载。

Nvidia Nemotron 如何成为 CRM 专家

Koa 的核心机制是在模拟工作流中进行强化学习,而非仅仅接触更多 CRM 文档。

Salesforce 以 Nvidia Nemotron 3 Super 为起点,而非从零训练基础模型。该基础模型提供了可访问的权重和通用推理能力,供 Salesforce 进行适配。

后训练是在模型完成广泛基础训练后对其进行调整。它可以针对特定任务优化行为,而无需重复构建原始基础模型所需的庞大过程。

Salesforce 最初探索了监督微调,即教导模型模仿成功工作的示例。这类似于向员工展示已完成的案例,并要求他们复现相同模式。

该公司表示,这种方法在多步骤工具使用上带来的改进有限。阅读成功的记录不足以充分教会模型从错误中恢复,或验证任务是否真正完成。

因此,Salesforce 和 Nvidia 着重采用强化学习。在这一过程中,模型尝试完成任务,根据结果获得评分,并将行为调整为更倾向于能取得更高奖励的策略。

训练采用了 Group Relative Policy Optimization,即 GRPO。这种强化学习方法会比较同一任务的多个回答,并强化与较优相对结果相关的行为。

Salesforce 生成了具有不同目标和情绪状态的人物角色。它还构建了可读取或修改模拟业务记录的工具,同时保留先前操作造成的后果。

随后,评判器会评估工作流是否真正达到预期结果。这种以结果为基础的奖励很重要,因为一个智能体可以生成看似可信的消息,却没有执行承诺的操作。

团队还测试了正确工具不可用的情形。治理不善的智能体可能调用相似工具、修改错误记录,或声称未获支持的操作已成功。

Koa 接受了识别这些边界的训练。在错误使用工具可能造成运营或合规问题的系统中,这种行为至关重要。

这篇 技术论文描述了一条基于 Salesforce Agent Script 规范的模拟到奖励流水线。Agent Script 是一种声明式语言,用于定义 Agentforce 路由、操作、工具和工作流指令。

该系统将这些规范转换为可执行的工作流图。这些图描述可用工具、参数格式、路由条件、状态变化以及结束任务的规则。

训练环境随后可以围绕这些图生成基于人物角色的对话。同一工作流定义有助于配置智能体、生成训练任务,并判断模型是否完成任务。

这种联系比模型掌握 CRM 词汇更重要。Koa 学习的是工作流如何改变状态、何时应使用工具,以及什么结果算作已解决。

以销售线索资格判定为例。有效流程可能需要核查公司规模、账户历史、销售区域、客户意图以及组织的路由阈值。

通用模型可以从提示词中读取这些要求。Koa 的优势应会在流程涉及多个工具、信息缺失、纠正操作和反复交互时显现。

该机制也使 Koa 的知识与检索有所不同。检索会将相关文档带入模型上下文,而后训练会改变模型已经习得的行为。

两种方法仍然都不可或缺。Koa 可以学习 CRM 工作的总体结构,但它依然需要最新的客户账户详情、公司政策、权限和客户记录。

对于知识工作者而言,这一区别进一步凸显了结构清晰的源材料的价值。一个个人知识库有助于提供最新事实,而专用模型则决定如何据此采取行动。

Salesforce 也为其他模型保留了角色。其技术说明称,Koa 将与 HyperClassifier、TextEval 和 Moirai 等专用系统协同工作,而不是成为单一的通用引擎。

这种组合式方法提供了一种务实的企业架构:通用模型用于广泛任务,小型模型用于可预测的功能,领域模型则用于重复性的运营推理。

基准测试的胜利真实存在,但范围有限

Koa 在已公布测试中表现具有竞争力,但这些结果更有力地支持了专业化,而非证明其全面优于前沿模型。

Salesforce 表示,Koa 在 CRM 操作中的错误减少了三倍,同时性能达到或超过领先模型。这一说法需要谨慎解读,因为不同评估衡量的是不同能力。

该公司的论文将 Koa 与 Nvidia 的 Nemotron 基础模型及三款专有模型进行比较,分别是 OpenAI GPT-4.1、OpenAI GPT-5.5 和 Anthropic Claude Opus 4.8。

Koa 在 Tau2Bench 的任务加权平均分为 69.41。该基准测试衡量了航空、零售和电信场景中的多步骤客户服务对话。

Nemotron 3 Super 得分为 68.64,GPT-4.1 为 54.48。Claude Opus 4.8 达到 74.00,GPT-5.5 则以 83.99 领先。

在 Berkeley Function Calling Leaderboard 上,Koa 得分为 66.63%。基础 Nemotron 模型为 64.73%,GPT-4.1 为 53.96%。

Claude Opus 4.8 在该测试中得分为 78.18%。GPT-5.5 得分为 67.63%,比 Koa 高一个百分点。

最有利的对比出现在 CRM Bench,这是 Salesforce 对 CRM 和 Agentforce 工作流进行的评估。Koa 的加权得分达到 0.86。

这一结果超过了 GPT-4.1 的 0.81 和 Nemotron 的 0.84,接近 Claude Opus 4.8 的 0.87,而 GPT-5.5 达到 0.90。

Koa 的 CRM 函数调用准确率为 0.77,高于基础模型的 0.71。GPT-4.1 得分为 0.85,Claude 为 0.83,GPT-5.5 在该子类别中为 0.82。

这些结果呈现出比简单胜负更细致的图景。Koa 改进了开源权重基础模型,在所报告的综合基准中击败 GPT-4.1,并在 CRM 领域接近前沿性能。

它并未在每项测试中领先。论文明确指出,Koa 的整体表现仍低于最强的前沿模型。

这一承认反而强化了核心论点。Salesforce 并不需要 Koa 在每项任务上击败所有前沿模型;它需要的是在高价值 Salesforce 工作流上提供足够的性能。

最大的公开问题涉及评估的独立性。Salesforce 的研究人员开发了 Koa 并报告了结果,而 CRM Bench 聚焦的正是该公司自身的运营领域。

这并不会使数据失效,但意味着买家应等待外部测试、试点结果,以及基于自身工作流的透明比较。

所报告的三倍错误降低同样缺乏足够公开背景,因而无法进行普遍解读。错误率取决于所选基线、任务集、评分规则以及对错误的定义。

生产系统还会带来更多复杂性。记录可能存在缺口,自定义字段可能冲突,集成可能失败,政策可能变化,用户也可能提出训练场景未曾预料的请求。

合成数据提供隐私和可控性,但也可能复现设计者的假设。模拟可能忽略真实员工视为理所当然的组织习惯。

Salesforce 表示,其场景涵盖不同行业、不同性格以及工具不可用的情况。这种多样性有所帮助,但即便超过 14 个行业,仍包含数千种专门流程和监管差异。

该模型拥有 1,200 亿参数的基础,也带来了基础设施层面的影响。Salesforce 尚未公布有关延迟、服务效率或工作负载级成本比较的完整生产信息。

更稳妥的结论应当更具体:Koa 提供了可信证据,表明基于工作流的强化学习能够将一个开源权重模型转化为具有竞争力的 CRM 推理器。

至于它将在真实客户部署中全面优于前沿系统这一更广泛的主张,在正式全面上市前仍未得到证实。

控制与隐私也是竞争的一部分

Koa 的竞争力不仅来自原始推理分数,也来自部署控制能力。

Salesforce 控制 Koa 的权重,并在自己运营的基础设施内执行推理。该公司表示,模型处理 Agentforce 任务时,任何客户信息都不会跨越其信任边界。

Salesforce 还表示,客户提示、数据和推理轨迹不会用于训练 Koa。当智能体能够更改业务记录时,这种安排解决了一个日益严肃的担忧。

起草文本的助手只能看到有限的上下文;CRM 智能体则可以查看客户历史、应用折扣、分派工单、安排通话或更新销售机会。

每增加一项操作,治理范围就会扩大。买家需要知道由哪个模型处理了请求、调用了哪些工具,以及敏感信息是否离开了获批环境。

封闭式前沿服务可以提供强大的企业隐私控制。Koa 的区别在于,Salesforce 对这些控制背后的模型和服务栈拥有更多控制权。

这种所有权可以支持更严格的部署要求。Salesforce 和 Nvidia 也在将基于 Nemotron 的系统扩展至 Missionforce,后者面向政府和受监管机构。

两家公司称支持私有云、机密环境和气隙网络。气隙网络在物理或逻辑上与公共基础设施保持隔离。

Missionforce Operations 已在美国地区正式全面上市。经后训练的 Nvidia 模型预计将于 2026 年 10 月面向部分 Missionforce 客户推出。

这一合作部分扩大了事件的重要性。Koa 展示了软件供应商如何在保留数据、部署和模型行为控制权的同时,适配开源权重基础模型。

这也让 Nvidia 获得了超越销售加速器的战略角色。Nemotron 成为企业平台可转化为自有品牌、领域专用智能的基础。

对于 Nvidia 而言,每一次成功的专业化都可能增加对其训练软件、推理栈、模型和计算基础设施的需求。即使 Salesforce 拥有面向客户的模型,该公司仍可从中受益。

对于 Salesforce 而言,这一安排降低了对单一封闭供应商的依赖。它也让公司能够将模型选择呈现为治理决策,而非排名竞赛。

不过,私有推理并不能消除所有风险。周边智能体仍取决于权限、检索质量、应用逻辑和正确的工具配置。

模型可以始终处于信任边界内,却仍然作出错误决策。它可能误解政策、选择获授权但不恰当的操作,或依赖不完整的记录。

对权重的控制也将更多责任转移给 Salesforce。该公司必须评估更新、可靠地运行模型、修补弱点,并证明其行为保持稳定。

因此,最有意义的客户测试应衡量已完成的工作,而不只是对话质量。有用指标包括未经授权的操作、恢复失败、人工升级以及被纠正的记录。

企业还应在相同权限和工具定义下,将 Koa 与前沿模型进行比较。否则,集成质量差异可能看起来像模型智能差异。

Koa 的隐私架构对部分买家而言仍是一项显著优势。然而,最有力的证据将来自经过审计的部署,在这些部署中,控制能力带来可量化的更安全或更一致的结果。

Koa 更广泛发布前值得关注的事项

三个信号将决定 Koa 是成为企业 AI 战略的范例,还是停留在一项前景可期的 Salesforce 实验。

第一个信号是对基准测试主张的独立验证。研究人员和客户需要在公开测试和真实 CRM 实施中复现 Koa 的提升。

技术论文已经提供了有关方法和局限性的有用细节。它确认 Koa 在所报告的综合结果中超过 GPT-4.1,但仍落后于更强的前沿系统。

独立测试应检验的不仅是准确率,还应衡量工具选择失败、虚假确认、操作不可用后的恢复、延迟,以及多次运行的一致性。

如果 Koa 在陌生数据和定制工作流下仍保持优势,这类测试将强化 Salesforce 的论点。若迁移表现不佳,则可能表明它对 Salesforce 设计的模拟存在过拟合。

第二个信号是来自已点名客户试点的证据。Formula 1、UChicago Medicine、Xero、Engine、Baxter Credit Union 和 1-800Accountant 的运营环境截然不同。

它们的结果可以揭示 Koa 是否能跨医疗保健、金融、旅行、会计和客户互动等领域实现泛化。具体证据应包括完成的工作流和人工干预率。

Salesforce 的训练说明称,早期试点覆盖服务、销售和商业领域,但尚未提供生产规模的结果数据。

成功的试点将验证模拟优先的方法;反复出现的例外情况或大量人工审核,则会暴露建模工作流与真实组织之间的距离。

第三个信号是前沿 AI 供应商和企业软件竞争对手将如何应对。OpenAI 和 Anthropic 可以改进工具使用、隐私选项、定制能力和部署灵活性。

其他应用供应商也可以适配开源权重基础模型。Constellation Research 将此视为一场更广泛的转变:迈向企业专用模型,而不仅仅是 Salesforce 的发展。

一波由供应商自主拥有的推理模型将强化 Koa 的战略意义。这将表明,企业平台日益将领域推理视为知识产权。

反应有限则意味着前沿 API 在经济和技术层面依然具有吸引力。许多供应商可能认为,模型训练和运营会分散其对应用层的关注。

Salesforce 还必须实现其宣布的 2026 年冬季可用窗口。若发布延迟或受到限制,将削弱 Koa 已准备好替代重要前沿工作负载的论点。

正式全面上市应明确模型访问方式、路由控制、支持的 Agentforce 工作流、区域覆盖范围和评估工具。买家还需要能够将 Koa 与替代模型进行比较。

实际教训并不是专用模型已经获胜。Koa 表明,企业如今在构建基础模型与租用每一个决策之间,拥有了一条可信的路径。

考虑采取这一路径的团队,应从可重复、高价值的工作流开始。他们应记录成功结果、获准使用的工具、升级规则,以及采取任何行动前所需的证据。

结构化的 AI workflow 能帮助人们在将工作委派给智能体前,保留这些运营背景信息。

如果 Salesforce Koa 推理模型能够以更少的错误、更严格的控制和可接受的运行要求完成这些工作流,它将赢得一席之地。

在客户证据出现之前,Koa 应被视为对前沿模型依赖的一项严肃技术挑战,而非通用模型已经失去企业 AI 市场的证据。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page