top of page

Salesforce Koa CRM 模型挑战通用 AI 的默认地位

9月27日
讀畢需時 13 分鐘

Salesforce 推出了专为 Agentforce 构建的首个推理模型 Salesforce Koa CRM,直接成为通用前沿模型的替代选择。该模型于 2026 年 9 月 15 日与 NVIDIA 共同发布,面向销售、服务、商务及其他客户运营背后的多步骤工作。

关键变化并不在于 Salesforce 的产品目录中又增加了一款语言模型。Koa 将 Agentforce 的部分核心智能置于由 Salesforce 控制的基础设施和模型权重之中。该公司称,这种安排可改善工具选择、上下文回溯和一致性,同时将客户数据保留在其信任边界内。

这使 Koa 与当前主流的企业 AI 路径形成对照。大多数智能体平台依赖 Anthropic 和 OpenAI 等公司提供的通用模型,再在其外围叠加业务数据、指令、权限和工具。Salesforce 认为,复杂 CRM 工作需要围绕工作本身训练的推理能力,而不只是为一款强大模型提供更好的提示词。

Salesforce Koa CRM 模型带来了什么变化

Koa 为 Salesforce 提供了一层专业化推理能力,使其能够直接运营、调整并集成至 Agentforce。

Salesforce 和 NVIDIA 在旧金山 Dreamforce 期间发布了 Koa。根据两家公司发布的公告,Koa 已向部分 Agentforce 试点客户开放。Salesforce 预计将于 2026 年冬季在美国区域正式全面推出。

Koa 基于 NVIDIA Nemotron 3 Super——一款拥有 1200 亿参数的开放权重基础模型。开放权重意味着 Salesforce 可以访问并修改模型学习到的参数,而不是只能通过另一家供应商的封闭 API 进行连接。

Salesforce 并未从零开始训练 Koa。它对 Nemotron 3 Super 进行了后训练,即在模型完成初始训练后对其进行适配。这一选择降低了构建专业化系统所需的时间和数据量。

该公司为此构建了一套专有的合成 CRM 场景集合。这些生成的场景涵盖线索资格判定、商机更新、服务案例处理、工具选择,以及判断何时请求人工协助等活动。

Salesforce 表示,这些场景反映了其在 27 年 CRM 部署中积累的知识。训练材料覆盖医疗保健、金融服务、制造业和旅游业等超过 14 个行业。

据 Salesforce 称,模型训练未使用任何真实客户记录。该公司表示,其使用的是虚构客户、业务情境、情绪状态、政策和预期操作序列。

这一差异很重要,因为训练数据与运行时数据带来的是不同风险。合成训练避免将客户记录写入 Koa 学得的模型权重中。部署期间,客户上下文仍会进入系统,以便智能体完成其被分配的任务。

Salesforce 表示,推理和后训练均在其基础设施内进行。该公司控制模型权重,并将 Koa 定位为现有信任边界内的托管选项。

客户无需重建每一个 Agentforce 工作流即可进行测试。Salesforce 计划让用户可在 Data Cloud 生成式模型目录、全组织 Agentforce 设置,以及单个智能体或子智能体层面选择 Koa。

这一设计将模型选择变成一项管理决策。企业可以在服务工作流中使用 Koa,同时为写作、研究或其他需要更广泛知识的任务保留通用模型。

Koa 已在 Salesforce 的内部员工智能体中运行,帮助员工在 Slack 中查找信息并完成日常任务。外部试点客户包括 1-800Accountant、Baxter Credit Union、Engine、Formula 1、UChicago Medicine 和 Xero。

这些试点覆盖的环境中,仅有看似合理的回答远远不够。会计智能体必须遵循税务规则和客户具体情况。医疗保健工作流必须协调信息,同时不能跳过必要步骤。旅行智能体可能需要调用多种工具,才能处理一次受干扰的行程。

这些例子阐明了此次发布的核心主张。Salesforce 并不试图让 Koa 成为适用于每项智力任务的最佳模型。它试图让该模型在 Agentforce 智能体必须解读 CRM 状态并执行一系列获准操作时更加可靠。

为什么专业化 CRM 推理此刻尤为重要

企业智能体越来越常在语言必须转化为正确且获授权的操作这一环节失败。

聊天机器人可以回答产品问题,而无需修改任何业务记录。自主 CRM 智能体面临更高标准,因为它可能更新商机、分派案例、批准退款或安排后续跟进。

每项操作都依赖业务特有的约束条件。智能体必须知道哪条记录相关、用户可更改什么、哪种工具匹配请求,以及公司政策是否允许该操作。

通用模型可以在运行时根据这些指令进行推理。但 Salesforce 认为,反复从提示词和上下文中重建工作流会造成不必要的差异。

其后训练说明将模型专业化比作员工培训。一名能力出色的新员工,仍需了解组织的阈值、升级规则、定义和流程,才能稳定地采取行动。

Koa 将这一论点应用于模型行为。Salesforce 在模拟工作中对其进行训练,在这些工作中,完成任务需要跨越多个对话轮次正确使用工具。

模拟包含合作和沮丧等不同角色设定。工具会响应 Koa 的调用,而评估器则检查底层问题是否确实得到解决。失败尝试会生成额外的训练信号。

Salesforce 使用了群组相对策略优化,即 GRPO,进行强化学习。GRPO 会比较针对同一任务的多个候选回答,并根据既定标准奖励表现更好的行为。

这种方法让模型获得练习,而不只是向它展示成功的对话记录。Salesforce 表示,监督式微调——即教模型模仿示例——对于复杂多步骤交互带来的提升有限。

该公司还训练了拒绝和升级处理行为。一些模拟任务刻意缺少必要工具。在这些情况下,Koa 会因解释限制、请求缺失信息或将任务交由人工处理而获得奖励。

这是企业 AI 的一个重要目标。虚假确认操作已完成的智能体,可能比拒绝执行的智能体造成更大损害。直到客户、员工或审计人员发现底层记录从未改变,故障才可能暴露出来。

因此,压力落在通用模型供应商以及将所有任务都经由这些模型处理的软件公司身上。广泛适用性依然有价值,但企业买家越来越需要在狭窄的运营边界内实现可预测的执行。

专业化模型也让 Salesforce 对部署拥有更多控制权。它可以将模型行为与 Agentforce、CRM 架构、工具定义和内部评估系统一同调优。

同一策略还可能减少对任何单一外部模型供应商的依赖。Salesforce 已经支持模型选择,与前沿实验室的合作仍然重要。Koa 则增加了一个模型权重和服务环境均由 Salesforce 控制的选项。

这并不意味着通用模型变得没有必要。通用模型仍更适合开放式分析、创意工作,以及跨越众多知识领域的任务。

更可能出现的企业架构是模型组合。较小的模型可以分类意图、筛查内容或对搜索结果重新排序。专业化推理模型可以管理受治理的工作流。前沿模型可以处理需要更广泛智能的任务。

Salesforce 已通过 HyperClassifier、TextEval 和 Moirai 等模型朝这一方向迈进。Koa 将这一组合扩展至推理环节,而该环节此前在很大程度上仍依赖通用智能模型。

对买家而言,关键问题变成了路由。将每个请求都发送给能力最强的前沿模型,可能浪费资源,并让更多工作暴露于不可预测的行为之下。将每个请求都发送给专业化模型,则可能限制灵活性。

Koa 的战略价值取决于 Agentforce 能否为每项工作选择正确模型。这一选择必须考虑任务复杂度、风险、延迟、数据边界,以及智能体能够访问的工具。

Koa 与通用模型的差异归根结底在于工作流训练

Koa 的主要技术赌注是:在模拟业务流程中反复练习,能够胜过从第一原则出发的推理。

Salesforce Koa CRM 模型以 Nemotron 3 Super 为基础,而非未经训练的网络。因此,它继承了 NVIDIA 基础模型的通用语言、推理和工具使用能力。

随后,Salesforce 将智能体规范连接至模拟环境。智能体规范描述路由、子智能体、可用操作、工具权限和工作流指令。

这些规范随之转化为可执行的训练情境。不同角色会与智能体进行多轮交互,而环境会随着工具读取或更新数据而发生变化。

奖励系统评估任务是否解决,而不仅仅是回答是否与参考答案相似。这一点很重要,因为多种对话路径都可能有效,但只有部分路径能产生正确的业务结果。

随附的技术论文将其称为“仿真到奖励”管线。其独特之处在于,将用于配置智能体的同一套声明式规范,与用于训练模型的任务关联起来。

这一机制在产品配置与模型行为之间建立了更紧密的联系。工作流定义不再只是推理时读取的一条指令;它还可以塑造模型的练习环境。

以线索资格判定为例。一家公司可能要求最低账户规模、受支持地区、经验证的联系信息,以及购买意向的证据。智能体必须检索这些字段、应用规则、记录结论并分派线索。

通用模型会接收这些规则,并针对每条线索进行推理。Koa 的训练方法则试图将这一序列变成熟悉的工作,包括预期的工具调用和失败条件。

同样的理念也适用于服务案例。处理退款请求的智能体可能需要检查购买记录、确认资格、识别例外情况、请求批准、发放退款并记录结果。

流畅的回答只是这项任务的一部分。智能体必须以正确顺序调用正确系统,同时遵守权限,并在整个对话过程中保持状态。

Salesforce 报告称,Koa 在按任务加权计算的 Tau2Bench 平均分上获得 69.41 分,相比之下,其 Nemotron 基础模型为 68.64 分,GPT-4.1 为 54.48 分。Tau2Bench 评估航空、零售和电信场景中的多步骤客户服务任务。

在 Berkeley Function Calling Leaderboard 上,Koa 得分为 66.63%。其 Nemotron 基础模型得分为 64.73%,而 GPT-4.1 在报告所列对比中得分为 53.96%。

Koa 在 Salesforce 的 CRM Bench 上取得了 0.86 的总分。GPT-4.1 得分为 0.81,Nemotron 基础模型为 0.84,Claude Opus 4.8 为 0.87,GPT-5.5 为 0.90。

这些结果支持一个审慎的结论:后训练提升了 Nemotron 的性能,尤其是在函数调用和多步骤工具使用方面。Koa 在报告所列的综合基准测试中,也超过了一个专有基线模型 GPT-4.1。

这些结果并不意味着 Koa 超越了所有前沿模型。论文明确指出,Koa 仍落后于最强的前沿系统;其自身表格也显示,GPT-5.5 在 Tau2Bench 和 CRM Bench 上均高于 Koa。

Salesforce 的产品页面还展示了额外的内部测试数据。该公司表示,Koa 在调用正确操作时的准确性提高了 11%,召回客户上下文的可靠性提高至 2.1 倍,并且在更长的对话中,上下文保留能力提升了 15%。

该公司还宣称,在 CRM 操作中,Koa 的表现达到或超过领先模型,同时错误数量减少至三分之一。这些数据来自 Salesforce 自身的评估,应视为公司报告的结果。

其机制比单一排行榜名次更重要。Salesforce 正在验证:领域实践是否能够缩小可适应的开放权重模型与更大规模封闭前沿系统之间的部分差距。

如果这一论点能在生产环境中成立,拥有深厚工作流知识的软件厂商将获得新的优势。它们积累的专业经验可以转化为训练环境、评估器、工具规范和任务奖励。

这比提示词库更难复制。它也改变了专有数据的含义。真正有价值的资产,可能是工作的结构——包括规则、结果、失败案例和操作序列——而不只是客户文本本身。

Salesforce 的 Koa 基准测试尚未解决的问题

早期结果足以支持开展试点,但尚不足以证明它能在不同 Salesforce 组织中实现可靠的生产运行。

Salesforce 值得肯定,因为它发布了一篇列明模型名称和基准分数的技术论文。论文还表示,Koa 落后于最强的前沿模型;这比未经限定的领先宣称更具参考价值。

不过,基准表现并不等同于在企业实时 CRM 中可靠运行。真实组织往往存在自定义对象、陈旧的自动化流程、不一致的数据、未记录的例外情况以及相互冲突的指令。

CRM Bench 包含诸如分配案例、更新商机和安排后续跟进等任务。这些都是有价值的测试,但 Salesforce 同时控制着模型及其面向 CRM 的评估环境。

独立研究人员尚未复现 Koa 的结果。该模型目前也仅通过有限试点提供,这限制了外部在多样化实施环境中的测试。

报告中的相对提升仍需要更多背景信息。如果没有基础错误率、样本量、置信区间和按类别划分的失败情况,“错误减少三倍”就很难解读。

正确操作选择率的提升,也无法说明剩余错误的严重程度。选错后续跟进日期,与修改错误的客户记录或发起未经授权的退款,性质并不相同。

论文公开的基准表提供了更好的校准依据。Koa 的 CRM Bench 得分为 0.86,接近 Claude Opus 4.8 的 0.87,但低于 GPT-5.5 的 0.90。其函数调用准确率达到 0.77,仍存在不可忽视的出错空间。

其表现也因基准而异。Koa 在 Tau2Bench 上的加权平均分为 69.41,明显低于 Claude Opus 4.8 和 GPT-5.5 的报告分数。

这未必会成为 Salesforce 战略的问题。即使不在每项基准中领先,一个模型仍可能具有实用价值,尤其是在它能够提供更强的数据控制、更可预测的部署或更低的运营复杂度时。

不过,买方不应将 CRM 专业化理解为性能必然更优。他们需要围绕自身记录、政策、权限、集成以及失败成本进行测试。

合成训练带来了另一项不确定性。生成式场景更便于实施隐私控制,也让研究人员能够构建罕见或危险的案例,而无需暴露真实用户。

然而,模拟客户和工作流可能遗漏生产环境中常见的不规则行为。员工会使用不完整的语言,记录会彼此冲突,集成会超时,政策中还会存在无人写入代理规范的例外情况。

经过训练以遵循正式工作流定义的模型,会反映这些定义本身的质量。如果一个组织的指令并不完整,专业化反而可能使系统持续遵循错误流程。

因此,治理仍是系统层面的责任。模型权重、权限、检索、工具设计、可观测性和人工升级机制必须协同运作。

Salesforce 表示,Koa 以温度值零运行,这一设置旨在减少生成回复的随机性。更低的变化性可以提高可重复性,但并不保证事实正确性或安全的工具使用。

信任边界的说法也需要谨慎解读。Salesforce 表示,客户数据不会用于训练 Koa,并且在推理过程中始终保留在 Salesforce 控制的基础设施内。

对于担心将记录发送到外部模型 API 的组织而言,这一点很有价值。但这并不能免除访问控制、保留政策、审计日志、区域可用性以及防范提示词注入等方面的需求。

Koa 的首次正式发布预计仅覆盖美国区域。Salesforce 尚未公开详细说明更广泛的区域可用性、最终商业条款,或将随发布提供的全部管理控制措施。

客户试点应能提供比发布演示更有价值的证据。买方应关注任务完成率、人工干预频率、回滚行为、延迟以及按严重程度划分的错误情况。

他们还应将 Koa 与其 Agentforce 部署中已在使用的确切模型进行比较。与较旧专有基线的对比,未必能预测它相对于配备强大工具和领域上下文的当前前沿模型的表现。

评估代理的团队需要长期保存需求、测试、例外情况和已观察到的失败记录。可搜索的 AI knowledge base 有助于在各轮试点中保留这些证据,但不能替代技术监控。

因此,核心不确定性在于真实条件下的采用。Koa 拥有合理的机制和令人鼓舞的基准数据,但它仍必须证明,在客户特定的 Salesforce 环境中,专业化推理能够减少代价高昂的错误。

三个信号将表明 Salesforce Koa 是否有效

Koa 的成败将由试点证据、模型路由和正式发布的质量决定,而非其发布时的宣称。

第一个信号是来自具名试点客户的生产数据。Salesforce 已确认参与组织涵盖会计、医疗保健、金融服务、旅游、体育和软件领域,但尚未公布详细的结果衡量数据。

有价值的证据应将任务完成与回答质量区分开来。它应说明 Koa 有多大比例能够在无人干预下完成工作流、选错工具的频率,以及哪些失败会改变业务数据。

如果性能能在高度定制化的组织中保持稳定,客户证据将强化 Salesforce 的论点。反复出现的例外情况或大量人工审核,则会削弱 CRM 专业化能够形成可靠运营专长的说法。

第二个信号是 Salesforce 如何在 Koa 与其他模型之间路由工作。该公司仍与 Anthropic、Google、OpenAI 及其他提供商合作,因此 Koa 并不会取代模型选择。

成熟的 Agentforce 部署应将范围狭窄、受治理的工作流分配给 Koa,同时将更广泛的任务导向其他模型。管理员还需要在组织、代理和子代理层级上提供清晰的模型选择控制。

路由质量将决定专业化是成为实际优势,还是另一项配置负担。客户需要易于理解的默认设置、评估工具,以及可追溯的解释,以了解特定模型为何处理某项任务。

在这里,Koa 与通用模型的取舍成为一项架构决策。最强的系统可能会结合两种方法,而不是迫使所有工作负载都经过同一个推理引擎。

第三个信号是 Salesforce 在 2026 年冬季的正式发布。其在美国区域的可用性将揭示,Koa 是否能按计划从受控试点进入普通客户环境。

该发布应澄清所支持的 Salesforce 版本、容量、延迟、区域限制、监控和最终管理控制措施。它还应展示,客户是否能够在更改生产代理前,使用同一套评估集比较不同模型。

正式普及后的独立测试同样重要。开发者和企业买方需要在自定义操作、大型架构、权限边界和长对话场景中获得可复现的结果。

NVIDIA 的角色也值得关注。Nemotron 为 Salesforce 提供模型权重和训练溯源,而 NVIDIA 则提供用于适配的 NeMo 工具和计算栈。

如果 Koa 表现良好,这一合作关系将为其他软件厂商提供模板。厂商可以从开放权重模型起步,将自身的工作流专长转化为模拟场景,并针对其产品已管理的操作进行训练。

这一模式挑战了企业 AI 中的一个普遍假设:规模最大的通用模型并不会自动带来最安全或最准确的运营结果。

专业化模型同样不会自动胜出。它必须在考虑集成工作、模型更新、测试和错误成本之后,仍优于配置良好的前沿系统。

对于开发者而言,Koa 使代理评估变得更加核心。工具调用、状态变更、拒绝响应和升级路径,都需要像普通软件测试一样严格的测试。

对于企业买方而言,此次发布创造了议价空间。他们可以询问供应商:其代理依赖的是封闭的外部模型、内部受控模型,还是由专业化与通用系统组成的路由混合方案。

对于知识工作者而言,短期影响将不那么明显。Koa 位于 Agentforce 底层,因此用户可能会将其感知为更少的重复提问、更好的连续性,或更准确地完成多步骤请求。

因此,Salesforce Koa CRM 模型并不只是又一个换了新名字的助手。它是 Salesforce 试图将产品知识转化为模型行为,并将这种行为置于自身运营边界内的尝试。

独立发布报道 确认了其当前范围:一个专业化的 Agentforce 模型、选定的试点项目,以及对使用工具的 CRM 工作流的关注。更艰难的验证将在公告发布后才真正开始。

在采用 Koa 前,团队应确定一个边界明确的工作流,记录其预期操作,并衡量当前的错误率和升级率。随后,他们可以在相同权限和数据条件下,将 Koa 与现有模型进行比较。

关注试点结果、路由控制以及冬季版本发布。如果这些信号表明,在不牺牲灵活性的前提下,能够减少具有重大影响的错误,那么 Salesforce 将有力证明专门化 CRM 推理的价值。否则,具备更优上下文和工具的通用模型仍将是更简单的默认选择。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page