Salesforce Koa 推理模型向通用 AI 实验室发出挑战
Salesforce 推出了首个专为 CRM 打造的模型,使 Salesforce Koa 推理模型成为对通用 AI 实验室的直接挑战。
该公司基于 Nvidia 的开放权重 Nemotron 3 Super 模型构建 Koa,随后针对销售、营销和客户支持工作流训练该模型。Salesforce 表示,该模型在 CRM 操作中的错误率降低至三分之一,同时性能可媲美或超越领先模型。
这一说法仍需独立测试验证。然而,即使每项基准测试结果尚未得到确认,Koa 背后的战略也已值得关注。Salesforce 可以将可适配的基础模型、数十年的工作流知识、自身软件平台,以及对企业买家的即时触达能力结合起来。
OpenAI、Anthropic 和 Google 一直将巨额资源投入能够处理几乎所有智力任务的模型。Koa 则在检验:企业客户是否会偏好更聚焦、更易控制,且已嵌入员工日常工作环境的产品。
威胁不在于 Salesforce 突然打造出了最聪明的模型,而在于它或许根本不需要这么做。
Salesforce Koa 将 Nemotron 打造成 CRM 专家
Koa 以通用开放权重基础模型为起点,围绕令企业软件真正产生价值的操作进行训练。
Salesforce 和 Nvidia 于 2026 年 9 月 15 日宣布推出 Koa。该模型正面向部分 Agentforce 客户开展试点,预计将在 2026 年冬季于美国更广泛推出。
该模型基于 Nvidia 的 Nemotron 3 Super——一款拥有 1200 亿参数的基础模型。开放权重意味着模型训练完成的参数可用于受控适配,而非只能通过外部 API 访问。
Salesforce 并非只是为 Nemotron 接入一套 CRM 搜索系统。其研究人员对底层模型进行了后训练,使其能够跨企业工作流进行推理,并执行所需工具。
这一区别很重要。检索能够向通用模型提供相关记录或文档,却不会自动教会模型在业务流程的每一阶段应采取何种操作。
以一个停滞不前的销售机会为例。智能体必须检查近期活动,识别缺失信息,核对业务规则,建议下一步行动,并安排后续跟进。每一个决定都会改变工作流的状态。
客户支持工单则形成另一套流程。模型可能需要对问题分类、验证账户信息、检索适用政策、转派工单,并更新其状态。仅有流畅的回答并不足够。
Salesforce 通过监督微调和强化学习训练 Koa。监督微调向模型展示所期望行为的示例;强化学习则在模型成功完成任务时给予奖励。
该公司在强化学习阶段采用了群组相对策略优化,即 GRPO。GRPO 会比较多项尝试性回答,并强化与更优结果相关的行为。
Salesforce 表示,训练场景覆盖超过 14 个行业。它们将模拟人物设定与任务、预期操作及工具调用相结合,覆盖制造业、医疗保健、金融服务、旅游及其他领域。
据 Salesforce 称,训练没有使用客户数据。相反,该公司生成了基于其 27 年 CRM 部署经验中积累的业务模式构建的合成场景。
这一表述需要谨慎解读。Salesforce 并未声称 Koa 吸收了机密客户记录。其表示,长期积累的知识塑造了用于训练的模拟工作流。
该模型也不只是研究演示。Salesforce 已通过一款 Slack 智能体在内部使用 Koa,帮助员工查找信息并完成日常任务。
试点客户包括 1-800Accountant、Baxter Credit Union、Engine、Formula 1、UChicago Medicine 和 Xero。这些部署将揭示受控评估中的表现能否转化为生产环境中的可靠性。
因此,眼下的产品变化十分具体。Agentforce 正获得一款由 Salesforce 托管、围绕平台自身操作设计的推理模型,而不再完全依赖通用外部模型。
Salesforce Koa 推理模型为何对 AI 实验室构成压力
Salesforce 的竞争重点是工作流所有权、分发能力与控制权,而非赢下每一项通用智能基准测试。
前沿 AI 实验室将通用性视为一项重要优势。一个能力强大的模型可以编写软件、分析文档、开展研究、回答问题,并支持多种业务职能。
这种广泛适用性仍然很有价值。不过,企业智能体运行在更为狭窄的环境中,涉及精确的权限、数据结构和可接受的结果。这些限制更有利于理解应用层的公司。
Salesforce 掌握定义其平台内工作方式的记录、对象结构、权限和自动化系统。它还控制着许多员工接触 CRM 软件的界面。
这一位置赋予 Salesforce 相较于通过 API 接入的模型提供商三项优势。
首先,Salesforce 能以平台原生的方式定义任务成功。它知道销售机会是否已更新、工单是否进入正确队列,或者后续跟进是否已出现在日历中。
其次,它可以围绕这些结果构建训练模拟。模型获得奖励的依据可以是完成一个流程,而不只是生成看似优质回答的文本。
第三,Salesforce 可以通过 Agentforce 交付最终模型。客户无需在使用现有工作流测试模型前,先搭建独立的编排层。
底层研究使这一战略更加清晰。Koa 研究论文介绍了一套从模拟到奖励的流程,用于生成基于角色设定的多轮任务。
这些任务包含依赖数据的请求,必须成功使用工具才能完成。Salesforce 使用其用于指定 Agentforce 行为的声明式语言 Agent Script,来定义企业领域内的工作流。
这形成了一种应用公司特别适合利用的训练闭环。它们的软件本身已包含结构化操作、权限、业务规则和任务完成信号。
通用模型开发商可以通过合作伙伴关系、客户提示和工具文档学习其中的一部分结构。应用所有者则从一张详尽的环境地图起步。
这种压力不止于 Salesforce。ServiceNow 可以围绕 IT 和员工工作流专门训练模型。SAP 可以聚焦财务、采购和供应链。Workday 可以围绕人力资源流程训练模型。
每家公司都可以使用可适配的基础模型,而无需为前沿规模的预训练项目提供资金。Nvidia 则从中受益,因为这些公司依然需要模型、训练软件、加速器和推理基础设施。
这种竞争模式改变了经济层面的问题。企业软件公司不再需要思考自己能否复制一整家前沿实验室。
它们可以转而思考:更小、更专门的模型能否完成自身产品内部的高价值任务。这是一个更容易实现的目标。
Salesforce 还掌握客户关系。它可以将 Koa 与 Agentforce 打包,应用现有的治理控制,并通过管理员早已熟悉的工具提供该模型。
AI 实验室则面临沦为这一体验之下可替换供应商的风险。客户可能知道 Agentforce 完成了任务,却不知道哪一个基础模型为结果作出了贡献。
这正是 AI 实验室应当担心的部分。它们的技术仍可能很重要,但其品牌、定价权以及与企业用户的直接联系可能会被削弱。
开放权重将价值转移至基础模型之上
Koa 展示了开放权重模型如何将竞争价值从预训练转向专业化、部署和工作流反馈。
Nvidia 通过其 Nemotron 模型中心发布模型、训练资源和参考实现。这种方式鼓励其他公司改造一款有能力的基础模型,而不是从零开始。
Salesforce 将 Nemotron 3 Super 作为原材料,随后利用 Nvidia 的 NeMo 工具进行领域特定数据生成、监督训练和强化学习。
这一过程体现了一种分工。Nvidia 提供模型架构、训练技术栈和计算平台;Salesforce 提供工作流规范、企业上下文、分发能力和产品边界。
封闭模型提供商通常通过提示、检索、微调或托管训练服务提供定制能力。这些选项可能效果很好,尤其是在底层模型拥有显著能力优势时。
但它们也会让重要决策留在提供商手中。模型更新、推理位置、运营政策和对权重的可见性,可能仍不受应用公司控制。
Koa 让 Salesforce 直接控制其权重。Salesforce 表示,后训练和推理均在其自身信任边界内进行,客户信息始终处于 Salesforce 的安全控制之下。
这种安排对受监管买家具有吸引力。它也使 Salesforce 能够修改模型,而无需等待第三方实验室的产品路线图。
控制权并不自动意味着成本更低或性能更好。Salesforce 尚未发布足够的生产环境证据,无法在多样化客户环境中证明上述任一结论。
不过,控制权创造了战略选择。即使某些任务在广泛的学术评估中显得不重要,Salesforce 也可以优先处理那些能在 Agentforce 内部创造价值的任务。
Koa 论文指出,专业化在多轮工具使用方面带来了最显著的改进。这恰恰是企业智能体经常遇到困难的领域。
单次工具调用相对容易评估。更长的工作流要求模型保持状态、根据工具结果作出反应、遵守权限,并从意外情况中恢复。
对服务经理而言,这些能力比数学测试分数再提高一个百分点更重要。它们也与 Salesforce 既有的业务流程知识相契合。
模型的合成训练设计还引入了另一项重要机制。客户记录很有价值,但也十分敏感、缺乏一致性,且难以跨组织整合。
合成场景让 Salesforce 能够复现企业工作的结构,而无需将真实客户数据复制进共享训练语料库。它们还可以按需生成罕见故障或边缘案例。
不过,合成数据也有自身弱点。模拟反映的是设计者的假设。它可能奖励在干净测试环境中有效、但在复杂组织中失效的行为。
真实 CRM 系统包含不完整的记录、相互冲突的政策、自定义对象、过时的自动化机制和不寻常的权限结构。生产环境试点必须让 Koa 面对这种复杂性,同时不损害安全性。
这也是为何 Salesforce Koa 推理模型代表的是一种机制,而非必然胜利。开放权重让专业化成为可能,Salesforce 的工作流地位则使这种专业化具备可信度。
实际客户结果将决定:这一组合系统是否优于连接至相同工具的前沿模型。
基准测试主张需要更严苛的检验
Salesforce 报告的结果令人期待,但由公司自行设计的 CRM 基准测试无法定论其与前沿模型之间的比较。
Salesforce 表示,Koa 在 CRM 操作中的表现达到或超过领先模型,同时错误数量减少了三分之二。评估任务包括更新商机、分派案例和安排后续跟进。
该公司并未将这一说法描述为衡量智能水平的通用标准。它涉及的是与 Koa 预期应用领域相匹配的基准测试中的特定 CRM 操作。
随附论文提供了一项重要限定。据称,Koa 的表现优于其 Nemotron 基础模型,并超过了一个强大的专有基线模型,但整体上仍低于最强的前沿模型。
这一结果支持更为审慎的解读。专业化能够帮助开放权重模型在目标代理任务上展开竞争,但不会抹去顶级闭源模型在广泛能力上的优势。
买家还应将操作准确性与完整的运营价值区分开来。代理可能调用了正确的工具,却误解了客户意图、执行了不当政策,或制造了不必要的升级处理。
错误数量需要结合背景判断。错误更新字段、未经授权的信息披露和糟糕的邮件草稿,带来的业务风险并不相同。
独立评估者需要获取任务定义、对比模型、评分规则和执行轨迹。否则,外部人士无法判断所报告的优势来自何处。
该基准测试可能会奖励对 Salesforce 特定模式的熟悉程度。这对于 Salesforce 产品而言是合理的,但无法证明其在其他商业应用中也具有优势。
生产环境还会增加一层难度。Salesforce 自身警告称,沙盒环境表现无法可靠预测生产环境行为,因为基础设施和使用模式存在差异。
同样的原则也适用于代理。受控任务无法完整复现不断变化的数据、并发用户、自定义集成、延迟限制和模糊请求。
因此,对 Koa 的客户试点不应只衡量基准测试完成情况。有用的指标包括成功解决率、人工干预率、撤销操作、政策违规情况和客户满意度。
这些衡量指标需要明确的基线。将 Koa 与完全不使用自动化进行比较,能回答一个问题;将其与采用前沿模型的 Agentforce 系统比较,则能回答一个更严苛的问题。
Salesforce 还必须证明客户能够治理这一专业化模型。管理员需要了解代理尝试了什么、使用了哪些工具,以及某项操作为何失败。
对于影响重大的流程,人工审查仍将十分重要。信贷决策、医疗沟通、合同承诺和账户变更,要求的不只是平均基准准确率。
安全性带来了另一个尚未解决的问题。在 Salesforce 的信任边界内运行推理能够降低暴露给外部模型 API 的风险,但并不能消除提示注入或权限过大的问题。
攻击者可能将恶意指令植入代理读取的内容中。即使是受信任且拥有广泛访问权限的模型,在输入被操纵时仍可能采取有害行动。
客户必须限制工具权限、验证输出,并保留审批关卡。拥有模型并不能取代应用安全。
市场层面也存在问题。一些企业更倾向于让同一家前沿供应商覆盖多个部门。采用一组专业化模型可能增加治理和集成工作。
前沿实验室可以通过让其模型更易于专业化、托管和评估来应对。它们还可以与企业软件供应商建立更深入的合作关系。
最强的通用模型对于处理困难的例外情况可能仍不可或缺。Salesforce 可以让 Koa 处理常规 CRM 工作,并将异常案例路由给更大的外部模型。
这种混合方式会削弱“唯一赢家”的说法。但它仍会减少自动流向前沿供应商的企业推理份额。
Koa 挑战了最初的 Agentforce 模型战略
Salesforce 正从模型选择转向模型所有权,扭转了应用层早先对外部 AI 供应商的依赖。
当 Salesforce 在 2023 年推出 AI Cloud 时,它强调可接入多家供应商的模型。客户可以使用合作伙伴模型,而 Salesforce 提供数据锚定、治理能力和商业应用。
Agentforce 在 2024 年推出时引入了 Atlas 推理引擎。Atlas 协调模型、数据、工作流和工具,使代理能够决定下一步该做什么。
Koa 并不会替代该架构中的所有部分。语言模型和推理引擎承担不同角色:引擎管理更广泛的流程,模型则负责理解任务并选择操作。
不过,Koa 使 Salesforce 更深入地进入智能层。该公司不再只是选择和编排模型,而是开始控制专业化模型的权重、训练、托管和部署。
这正是战略上的逆转。企业软件供应商过去看似依赖少数前沿实验室来提供先进推理能力。如今,开放权重让这些供应商能够将更多模型能力吸收进自身产品。
在这一架构下,Salesforce 积累的工作流知识变得更有价值。Marc Benioff 认为,Koa 将有关交易、服务案例和行业流程的知识置于模型本身之中。
这一说法不应被字面理解为客户历史记录被嵌入权重。Salesforce 表示,Koa 使用的是公开和合成训练数据,而非客户数据。
有价值的资产在于对工作如何推进的抽象。Salesforce 可以描述常见 CRM 情境中的角色、对象、工具序列、例外情况和完成条件。
这些描述能够训练模型,使其在 Agentforce 内部表现得更有效。随着 Salesforce 改进其应用,这些描述也可以同步更新。
分发环节则完成了闭环。公司可以观察试点表现、识别反复出现的失败类型、生成相关场景,并开展下一轮后训练。
隐私规则将限制 Salesforce 可收集和复用的信息。不过,汇总后的运营模式仍可为评估设计和产品改进提供参考。
前沿实验室同样在数百万用户的使用中拥有反馈优势。但其中大量活动是对话、编程会话或一般性请求。
Salesforce 可以聚焦于与业务结果相关的更狭窄信号:案例是否被分派到正确团队?记录是否已更新?人工是否撤销了该操作?
这些信号对于强化学习格外有用,因为它们让成功更容易被定义。
Koa 还改变了 Salesforce 的谈判地位。该公司可以继续提供外部模型,同时为特定工作负载维持内部替代方案。
这种灵活性降低了对任何单一实验室的依赖,也让 Salesforce 可以将其他供应商与针对其主场优化的模型进行比较。
对于 AI 实验室而言,这一教训不止适用于 CRM。它们最强劲的企业竞争者未必会构建前沿模型,而可能会适配开放模型,并掌控围绕推理调用的一切。
Koa 进入生产环境后值得关注什么
三个信号将显示,Koa 是企业 AI 的持久转变,还是一次定位精准的产品发布。
第一个信号是来自客户试点的证据。Salesforce 已点名来自会计、金融、医疗、旅游、软件和体育领域的组织。
重要的结果不在于有多少公司参与试点,而在于它们是否将 Koa 纳入可重复的生产工作流,并可衡量地减少错误和人工处理。
关注那些披露任务量、干预率、评估方法和部署边界的详细案例研究。关于生产力的模糊表述无法验证该模型的优势。
强劲的生产结果将强化 Salesforce 的核心论点:领域训练能够弥合足够大的能力差距,使模型在有价值的工作上优于更广泛的模型。
频繁的撤销操作或狭窄的部署范围则会削弱这一论点。它们将表明,该基准测试对受控 CRM 操作的捕捉优于对运营复杂性的反映。
第二个信号是计划于 2026 年冬季在美国发布的版本。全面可用性将检验 Koa 在更广泛 Salesforce 环境中的可靠性、容量、管理能力和集成表现。
客户希望获得配置控制,而不是固定不变的模型行为。他们还需要监控、审计轨迹、审批机制,以及针对失败操作的清晰流程。
此次发布将揭示 Salesforce 如何让 Koa 与外部模型并存。若 Koa 在 Agentforce 中担任默认角色,将表明公司充满信心,并形成实质性的分发优势。
若它只是为少数工作流保留的可选模型,则意味着更审慎的战略。这仍可能有用,但对前沿供应商施加的压力会更小。
第三个信号是竞争反应。OpenAI、Anthropic、Google、Microsoft、ServiceNow、SAP 及其他供应商,都有理由捍卫自己在企业代理技术栈中的位置。
前沿实验室可以发布更强的工具使用评估、改进私有部署选项,或提供更深入的后训练。应用供应商则可以基于开放基础模型构建自己的领域模型。
Salesforce 早先推出 Agentforce,已经使企业代理进入一个拥挤市场。ServiceNow 等竞争者和专业客户服务公司瞄准了许多相同的买家。
战略问题在于,Koa 能否形成持久优势,还是会成为其他公司迅速复制的模式。Nvidia 有动力帮助众多软件供应商走上同样的路径。
这种可能性对 Salesforce 是一把双刃剑。Koa 受益于开放模型基础设施,但同一基础设施也降低了其竞争对手的进入门槛。
政府部署带来了另一项检验。Salesforce 计划将后训练的 Nvidia 模型引入 Missionforce,用于受控私有云和隔离网络。
预计部分客户将在 2026 年 10 月获得这些模型。若能成功,将支持模型控制在受监管环境中至关重要这一观点。
更广泛的结论并不取决于 Salesforce 击败每一家 AI 实验室。Koa 只需证明,企业价值能够集中在基础模型之上。
对于开发者和企业买家而言,下一步是务实的:在真实工作流中比较模型,记录失败的工具调用,并追踪每一次人工修正。
团队可以使用可搜索的 AI 知识库,在整个部署过程中保留这些评估、决策和运营规则。
不要只问哪个模型得分最高。还应问谁控制工作流、谁定义成功、数据流向何处,以及失败能以多快的速度得到改进。
如果 Salesforce Koa 推理模型能够交付可靠的生产结果,通用 AI 实验室仍将提供关键技术。只是它们将拥有更少的企业最终成果。



