Salesforce Agentforce AI 智能体获得职位名称、持久记忆与更严苛的考验
Salesforce 推出了七款具名 AI 智能体,但关键变化并非其更具亲和力的命名。其中一款智能体旨在连续数周乃至数月推进销售目标。
这些 Salesforce Agentforce AI 智能体配有涵盖服务、销售、商业、员工支持和供应链运营的岗位说明。其中六款已正式推出,而外呼销售智能体 Hunter 仍处于试点阶段,计划于 2026 年 11 月发布。
这一时间点很重要,因为 Hunter 承载着 Salesforce 最大的技术承诺。其新的长周期运行机制旨在跨多个会话保留上下文、维持计划并调整持续进行的工作。Microsoft 已在 Dynamics 365 中提供自主销售智能体,因此 Salesforce 必须证明,更长的记忆能够带来更好的结果,而非形成更长的隐蔽错误链条。
这意味着 AI 的定位正从助手转向可交付的劳动力。名称和职位让每款产品更易于理解、分配、衡量,并纳入运营计划之中。同时,它们也让权限、监督和问责等棘手问题变得更加突出。
Salesforce Agentforce AI 智能体现已可直接胜任特定岗位
Salesforce 正在用一套与明确业务角色相对应的智能体目录,取代空白的智能体构建画布。
该公司于 2026 年 9 月 11 日发布了 Casey、Paige、Carter、Hunter、Marshall、Piper 和 Fin。每款智能体一开始就承担明确的职责范围,而不是提供通用聊天界面。
Casey 通过语音、短信、WhatsApp 和网页聊天处理客户服务请求。其预设工作流程涵盖常见问题、退货、账户管理以及升级至人工客服代表。
Paige 专注于员工支持。它可通过 Slack、公司门户及其他工作场所系统处理 IT 和人力资源请求。
Carter 服务于购物者。它可以帮助客户查找和比较产品、回答问题,并在对话中完成购买。
Marshall 面向供应链和后台流程。Salesforce 表示,它结合了 AI 推理与确定性执行,即由固定规则控制那些不应依赖模型判断的操作。它还会记录每项操作,以便后续审查。
Piper 可通过网站和收件箱筛选流入的商业线索。Fin 则处理涵盖消息、电子邮件、电话和 Slack 的客户体验工作流程。
Hunter 是其中的例外。根据官方 智能体产品组合,它可研究潜在客户、开展外联,并在数周或数月内与销售人员协作。Salesforce 计划于 11 月将其正式推出。
客户可以更改智能体名称,并调整其行为。这种定制使这些名称成为模板,而非永久的产品身份。
这些职位名称仍具有重要的商业作用。买家可以将“帮助智能体”的表现与支持团队现有指标进行比较。销售负责人可以依据销售管道目标评估外呼智能体。供应链经理可以检查自动化流程是否遵循了所需审批程序。
通用助手缺乏这样清晰的问责单位。它可以回答众多主题的问题,却不对可衡量的结果负责。这些新智能体则被定位为承担边界明确的工作。
这种定位也降低了构想应用场景所需的投入。企业不再需要先思考智能体可能做什么,而可以直接评估预设角色是否匹配现有流程。
Salesforce 表示,其七款智能体均包含完成指定工作所需的技能、操作和数据模型。买家仍需连接公司数据、配置权限、定义业务规则、测试边缘情况,并选择升级处理节点。
因此,“胜任工作”并不意味着无需准备即可运行。它意味着 Salesforce 在部署前已将更多设计决策纳入产品之中。
这种方式让企业 AI 更容易采购,也让失败更容易归因。如果 Casey 错误处理退货,或 Hunter 追踪了不合适的账户,买家就能明确需要调查的是哪款智能体和哪项工作流程。
此次发布构成了本文的核心张力:Salesforce 正让智能体更像可靠的同事,与此同时,它们承担的工作也变得更具持续性、更难监督。
长期记忆让 Hunter 成为真正的考验
Hunter 的重要性在于,它试图在发起任务的对话结束后,持续维持一项业务目标。
大多数工作场所聊天机器人都在请求—响应循环中运行。用户提出信息需求,获得答案,再决定下一步如何进行。
Hunter 专为时间跨度更长的工作而设计。销售人员可能要求它在季度结束前识别存在风险的交易。随后,该智能体可以将这一目标转化为任务、查找相关信息、开展外联,并更新计划。
Salesforce 将这一行为归因于三项相互关联的能力:记忆、持久执行和动态引导。
记忆可在会话之间保留上下文和进度。持久执行可让计划保持活跃,并使智能体在中断后恢复运行。动态引导则让智能体在用户提供新信息或指示时调整行为。
持久记忆不同于大上下文窗口。上下文窗口是模型在单次推理中可处理的信息;持久记忆则存储选定状态,使工作能够跨不同交互持续进行。
持久执行同样重要。智能体需要记录已完成步骤、待执行操作、依赖关系、失败情况和审批要求。否则,记住目标对于确保可靠推进并无太大帮助。
动态引导引入了另一层复杂性。销售人员可能改变优先级、移除某个账户、修改信息内容,或要求在进一步外联前取得审批。Hunter 必须在不丢失先前约束的情况下纳入这些指示。
这种组合类似于具有 AI 规划层的工作流引擎。模型提出并调整行动,而周边系统则维护状态并执行边界限制。
它也带来了一种新的失败模式。聊天机器人中的错误答案通常会立刻显现;而月度计划中的错误假设,可能悄然影响许多后续操作。
例如,Hunter 可能错误分类某个账户、选择不合适的联系人,或将沉默解读为允许继续外联。之后的每项任务都可能在内部保持一致,却依然建立在错误前提之上。
这种风险使可追溯性至关重要。买家需要看到智能体相信什么、使用了哪些信息、是什么改变了其计划,以及人工何时批准了某项操作。
Salesforce 表示,Hunter 能区分可自主执行的操作与需要销售人员批准的操作。该公司尚未公布独立证据,证明这些边界在多样化部署环境中能够多么可靠地得到遵守。
长期记忆也需要主动维护。存储的事实可能过时、重复,或脱离原始上下文。实用的 AI 知识库 需要来源追溯和检索控制,而不仅仅是存储更多文本。
同样的原则也适用于 Hunter。只有在正确的时间检索到正确的历史记录,记住数月活动才有价值。
Salesforce 计划将长周期运行机制扩展至其他智能体,并最终允许客户构建自己的长周期智能体。因此,Hunter 既是一款产品,也是对底层架构的生产环境测试。
如果 Hunter 能如描述般运作,Agentforce 就能从孤立式辅助迈向持续运营。如果它需要持续纠正,更长的时间跨度将放大监督成本。
压力落在 Microsoft、ServiceNow 与企业买家身上
Salesforce 并非在创造企业智能体市场,但它正在迫使竞争对手解释:随着时间推移,究竟由谁对结果负责。
Microsoft 已为销售线索筛选、商机研究、成交和推荐行动提供专用智能体。其销售智能体目录包含可研究潜在客户、发送外联信息、识别商机风险,并在整个销售周期中提供协助的智能体。
这使 Microsoft 成为 Hunter 最直接的竞争参照。两家公司都可以将智能体建立在客户记录和工作场所通信之上,也都在将记录系统转变为能够主动发起工作的系统。
Microsoft 的优势来自其对 Outlook、Teams、Microsoft 365 Copilot、Power Platform 和 Dynamics 365 的广泛覆盖。会议、电子邮件、文档和 CRM 记录中的信号,可在员工已使用的工具中支持销售决策。
Salesforce 的论点则围绕 Customer 360、业务流程和长周期运行机制。它希望买家相信,深度嵌入 CRM 的智能体比在生产力应用之间切换的助手更能持续维持目标。
因此,这场竞争并不只是 Salesforce 与 Microsoft 在模型质量上的较量,而是关乎编排、上下文、权限与状态持久性。
ServiceNow 则从工作流和治理角度处理这一问题。其扩展后的 AI Control Tower旨在发现、观察、治理、保护和衡量跨多个企业系统部署的智能体。
当智能体持续活跃数周时,这种侧重点会变得更具相关性。一家公司可能使用 Salesforce 处理销售、ServiceNow 处理 IT 运营、Microsoft 支持工作场所生产力,并利用自定义智能体处理内部流程。
具名智能体在追求一个结果时,仍可能跨越多个系统。买家必须决定由哪个平台记录权限、监控行为,以及解决智能体之间的冲突。
Salesforce 正以自身的编排和优化功能作出回应。据该公司称,Multi-Agent Orchestration 已正式推出。当一项工作跨越角色或系统时,它会在专业智能体之间路由任务。
Agent Optimizer 计划于 2026 年 10 月正式推出。Salesforce 表示,它将分析会话追踪记录,帮助团队测试表现,并识别可能的改进方向。
面向 Agentforce Coworker 的 AI Skills 也计划于 10 月推出。它们旨在让员工演示一项任务,并在整个员工队伍中复用这些知识。
这些能力揭示了真正的竞争层面。打造一款令人印象深刻的智能体已不再足够。企业厂商需要一套用于教授、协调、评估和治理智能体集群的系统。
压力同样落在买家身上。预设角色减少了初始设计工作,却可能促使企业在审视流程是否稳定之前就将其自动化。
定义不当的销售政策,不会因为 Hunter 更频繁地执行而变得更好。不一致的退货政策,也不会因为 Casey 将其应用到更多渠道而变得一致。
企业必须区分自动化准备度与产品可用性。正式可用意味着供应商提供并支持某款产品,但这并不代表每家组织都具备足够的数据质量或运营纪律,能够负责任地部署它。
Microsoft、ServiceNow 和 Salesforce 如今都将智能体描述为业务流程中的积极参与者。下一阶段的竞争将较少聚焦于智能体能否行动,而更多聚焦于组织能否信任其产出的工作成果。
具名智能体让 AI 更容易采购,也更难被推卸责任
人性化名称简化了采用过程,但职务头衔也会形成仅靠功能品牌本身无法满足的预期。
软件供应商长期以来一直围绕角色来封装复杂系统。销售平台服务于销售人员,服务平台服务于支持团队,商业平台服务于商家。
Salesforce 正在将这种熟悉的结构再向前推进一步。如今,产品本身获得了角色。
这种定位有助于非技术背景的高管理解产品组合。与一组服务操作、检索组件、渠道集成和模型设置相比,Casey 更容易被讨论。
名称创造了一条思维捷径,职务头衔则提供了预期产出。部署讨论可以从职责开始,而不是从架构开始。
这是一种有效的营销方式,但也可能模糊软件与雇佣关系之间的界限。一名人类同事具备情境判断、非正式知识、伦理责任,以及质疑不适当指令的能力。
AI 智能体在已配置的系统和权限范围内运行。即使其界面使用名称和对话式语音,它也不具备个人问责性。
实际的责任主体仍然是组织。管理者决定智能体可以访问哪些数据、可以采取哪些行动、何时需要审批,以及如何调查事件。
这种区别对于长期运行的工作尤为关键。聊天机器人出错可能只影响一次回复;外呼销售智能体则可能联系大量潜在客户、修改记录,并在有人发现规律之前影响销售管道。
因此,一个具名角色应配套正式的运营说明。该文件需要明确允许的行动、禁止的行动、升级阈值、数据来源、保留规则、负责人和审查周期。
智能体还需要兼顾质量的结果指标。仅以销售管道量衡量,可能会激励低质量触达;仅以解决率衡量,则可能掩盖重新开启的工单、客户挫败感或错误答案。
Salesforce 提供了若干客户报告的结果。Engine 表示,其帮助智能体可完全解决 50% 的聊天咨询。Perk 报告称,Hunter 构建了其 60% 的销售管道。
Autism Queensland 表示,Paige 解决了 70% 的行政请求。Hibbett 报告称,在部署六周后,其购物智能体处理了 90% 的核心购物旅程。
Asana 表示,Piper 带来的对话量达到此前的四倍,而客户平均可在 45 天内部署 Piper。Salesforce 还表示,Fin 可自主解决其处理的 Anthropic 对话中的 79%。
这些数据说明了为什么封装好的智能体会吸引买家。它们将智能体直接与运营结果相连接,而不是与模型基准测试相连接。
然而,这些都是由 Salesforce 及其客户筛选并发布的案例。它们并不能证明典型表现,而且不同企业的统计口径可能不同。
“已解决”会因升级政策、案例定义和衡量窗口不同而具有不同含义。“已构建销售管道”也不必然意味着收入已经成交。
有用的回应并不是否定这些结果。买家应要求明确的定义、基线比较、异常率,以及与自身情况相似的部署证据。
名称帮助人们记住产品,职务头衔帮助管理者分配预算。只有在真实运营条件下经过衡量的表现,才能将这些标签转化为持久的信任。
Salesforce 的证据令人鼓舞,但仍主要由供应商报告
支持 Agentforce 的最有力论据来自具体的使用数据,但大多数发布证据仍由 Salesforce 及其客户掌控。
Salesforce 表示,其已在 Agentforce 和 Slack 中交付了 70 亿个 Agentic Work Units。Agentic Work Units 是该公司用于衡量智能体行动及相关工作的消耗单位。
其中,32 亿个单位是在公司第二财季交付的。该数字表明活动规模可观,但并未说明有多少任务成功完成,或需要纠正。
Salesforce 在 8 月 26 日发布的季度业绩中表示,Agentforce 年度经常性收入同比增长超过 240%。该季度的 Agentic Work Units 较上一季度增长 97%。
这些数据表明,Agentforce 对 Salesforce 的商业重要性正在提升。它们也解释了为何该公司正围绕易于识别的职位来包装智能体。
仅靠使用量增长无法验证自主性。一名客户可能产生大量低风险操作,而另一名客户则可能产生较少、却伴随严重财务或声誉后果的操作。
这七个智能体还处于不同的风险类别。Carter 回答产品问题,与 Marshall 修改供应链流程并不相同。Hunter 发送外部消息,也不同于 Paige 检索内部政策。
每种角色都需要自己的评估设计。一个整体的 Agentforce 成功率会掩盖这些运营差异。
Fin 为 Salesforce 带来了更成熟的客户服务产品和既有客户基础。该公司在宣布扩展智能体产品组合的前一天,完成了对 Fin 的收购。
Salesforce 表示,Fin 服务超过 30,000 家公司,平均解决率为 76%。Fin 在加入更广泛的 Agentforce 产品组合后,仍将在 Salesforce AI Labs 内运营。
这段历史使 Fin 与新推出的模板不同。它带来了现有产品、专门的客户体验模型、部署知识和客户关系。
这也揭示了一项战略现实。Salesforce 正在将内部开发与收购产品相结合,以加快其智能体产品组合的发展。Piper 同样反映了 Salesforce 此前对 Qualified 的收购。
这种组合可以缩短构建实用智能体的路径,但也可能在数据模型、管理工具、评估方法和产品身份之间带来集成工作。
客户应关注 Fin、Piper 和 Salesforce 自研智能体最终是否共享一致的控制机制。当管理员能够应用通用政策并检查可比较的表现时,产品组合的价值更高。
记忆还带来了有关隐私和数据治理的独立问题。长期运行的智能体必须保留足够的信息以持续完成任务,但不应无限期保存每一项细节。
企业需要控制哪些内容进入记忆、保存多久、谁能检查,以及用户能否纠正或删除。Salesforce 的发布内容将记忆解释为一种能力,但没有针对每一种部署场景公布详细答案。
安全团队还会希望测试间接提示注入。销售智能体可能会在电子邮件、网页、文档或 CRM 字段中遇到恶意指令。
能够跨数周行动的智能体,会给攻击者更多影响计划的机会。即使原始内容已从即时视野中消失,记忆仍可能保留敌对指令。
这些风险并不意味着长周期智能体不切实际,但它们改变了证明标准。
一次成功的试点不应只衡量完成情况。它还应检查授权错误、过时记忆检索、错误的计划变更、不必要的外联、人类覆盖率,以及中断后的恢复情况。
Salesforce 已为买家提供了可供测试的具体产品。但该公司尚未证明,一个具名智能体能够以类似员工的可靠性完成数月的工作。
三项信号将显示长周期智能体是否已准备就绪
下一项考验不是又一次精心打磨的演示,而是 Hunter 能否在生产环境中经受住使用考验,并具备可衡量的控制能力和可接受的监督成本。
第一个信号是 Hunter 计划于 2026 年 11 月正式可用。Salesforce 必须证明,这一长周期运行时能够摆脱试点状态,同时不缩窄其核心承诺。
可用性细节将至关重要。买家应审查 Hunter 可以执行哪些行动、哪些行动需要审批,以及管理员能否检查计划随时间发生的变更。
部署文档应说明如何选择、更新和删除记忆,也应展示中断的任务如何恢复,而不会重复工作或忽略较新的指令。
如果 Hunter 在具备明确控制机制的情况下实现正式可用,发布主张将更具说服力。延期、更窄的范围或严格的审批要求,则意味着跨周自主性仍然困难。
第二个信号是来自生产部署的证据。Salesforce 当前的案例具有参考价值,但买家需要更广泛的质量和人工干预报告。
对于 Hunter,关键衡量指标包括合格销售管道、回复质量、不受欢迎的联系率、人工纠正,以及超越初始互动后的转化。单纯的外联量几乎说明不了什么。
对于 Casey 和 Fin,解决率应与重新开启的工单、升级、客户满意度和已验证的答案准确性一起衡量。对于 Paige,组织应追踪错误的政策指引以及对员工数据的不必要访问。
对于 Marshall,可审计性值得特别关注。买家需要了解,当供应链条件变化时,确定性控制能否可靠地约束 AI 生成的计划。
独立案例研究将增强 Salesforce 的主张。跨行业的稳定结果,比另一组表现突出的客户案例更重要。
第三个信号来自 Microsoft 和 ServiceNow 的竞争回应。Microsoft 已将 Dynamics 365 Sales 描述为一个行动系统,具备自主研究、资格认定、外联和成交智能体。
如果 Microsoft 强调可持续数周的计划,Salesforce 的运行时将很快成为一项类别要求,而非持久差异。如果 Microsoft 聚焦于统一的 Microsoft 365 上下文,竞争可能会围绕哪种数据环境最能支持销售智能体展开。
ServiceNow 的回应可能会聚焦于治理和跨平台观测。随着企业部署来自多家供应商的智能体,这种方式将变得更有价值。
买家最终可能会选择 Salesforce 用于客户工作流,同时使用另一平台来监督更广泛的智能体体系。Salesforce 必须证明,其编排和优化工具能够在这种混合环境中发挥作用。
更大的问题是:智能体行动时间更长时,是否会变得更有价值,还是只会变得更难监控。名称和职务头衔无法回答这个问题。
Salesforce 已做出明确押注。企业 AI 将通过明确角色、预先准备的技能、持久记忆和可衡量的业务结果获得采用。
这一押注让该公司走出了聊天机器人时代。但它也提高了失败的代价,因为这些智能体被期待承担责任,而不只是提出建议。
对于企业买家而言,合理的下一步是在明确控制下开展有限范围的生产测试。选择一个流程,记录其决策权限,同时衡量结果和纠正成本。
开发者应重点关注状态管理、可观测性、评估和恢复路径。知识工作者则应追问:哪些判断仍由自己负责,以及系统是否提供了足够的上下文来质疑其决策。
Salesforce Agentforce AI agents 如今更像一个团队,因此也更容易理解。决定性的证据将来自组织能否证明:这些具名角色能够长期保持准确、可控,并且值得投入监督。



