top of page

AutoSynthData:为企业代理生成训练数据,将失败转化为课程

6天前
讀畢需時 15 分鐘

ServiceNow CoreAI 于 10 月 2 日发布了 AutoSynthData,报告称该系统在两项企业代理实验中利用近 4,000 个合成任务取得了提升。AutoSynthData:为企业代理生成训练数据,先从模型失败出发,再将这些弱点转化为可执行且可验证的训练示例。矛盾也很明确:合成数据可以迅速扩展,但生成的任务同样可能教会模型错误的行为。

这使 AutoSynthData 不只是又一个让模型编造提示词的系统。它试图围绕目标代理、其运行环境以及更强大的教师模型,建立一个封闭的训练循环。每个被接受的任务都包含初始系统状态、用户请求、成功轨迹,以及用于评估最终状态的验证器。

ServiceNow 表示,该方法在两个 EnterpriseOps Gym 领域提升了 Gemma 目标模型的表现。不过,这些提升来自同一基准测试体系内的受控实验,而该体系本身也塑造了训练课程。这一结果对依赖静态、人工编写数据集的团队形成压力,但外部迁移能力和生产环境可靠性仍未得到解决。

AutoSynthData:为企业代理生成训练数据,从失败开始

关键变化在于,ServiceNow 将代理失败视为下一步应生成何种训练数据的指引。

传统的合成数据流水线通常从主题、模板或种子示例开始。它们将这些输入扩展为更大的集合,筛选结果,并使用保留下来的样本进行训练。这一过程可以制造大量数据,却无法证明新数据针对了模型的实际弱点。

AutoSynthData 颠倒了这一顺序。它首先在运行环境中评估目标模型,并研究模型在哪些地方失败。更强大的教师模型随后尝试完成相同的诊断任务,从而对失败行为与成功行为进行比较。

系统会分析所涉及的能力、所需工具、工作流结构,以及构成成功的最终状态。它还会识别那些可以变化、但不会移除底层能力的细节。这些观察结果会形成 ServiceNow 所称的经过净化的能力规格卡。

这些卡片在不暴露原始评估提示词、实体、轨迹或验证器细节的情况下指导生成。这样的分离旨在降低直接泄露基准测试内容的风险,也迫使生成器创建新场景,而非仅仅改写测试问题。

任务格式由三个相互关联的部分组成。系统规格定义策略、可用操作和初始环境状态。用户提示词说明所请求的结果,而验证器决定代理是否达到了可接受的最终状态。

这一结构很重要,因为企业工作很少以一段文本回答告终。一名 IT 服务代理可能需要检查事件、核实权限、更新记录并保留审计轨迹。一段流畅的回复并不能证明这些操作中的任何一项都被正确执行。

AutoSynthData 发布公告描述了两个生成阶段。目标阶段围绕已识别的能力缺口创建并验证核心示例。扩增阶段则基于已接受的目标样本生成新的变体。

每个变体都拥有自己的请求、实体、初始状态、参考轨迹和验证器。扩增后的样本不能再成为另一条扩增样本的种子。这一限制旨在避免多轮合成扩展逐渐偏离经过验证的核心。

该流水线将中央生成控制与特定环境的执行分开。控制器负责覆盖范围、质量检查和数据集构建。适配器则运行工具、管理状态、重放参考解决方案、评估代理,并应用确定性验证。

这种分离让该方法有机会超越单一基准测试。理论上,一家公司可以保留共享控制器,同时为自身系统编写适配器。不过,每个新适配器都需要准确的工具、真实的状态转换和可靠的成功标准。

因此,这项新闻不只是 ServiceNow 生成了合成任务。该公司构建了一套根据当前模型弱点选择任务的流程。随着这些弱点变化,它也会随之调整训练目标。

这一自适应循环挑战了静态数据集开发。一个固定集合一旦被模型大部分攻克,价值就会下降。AutoSynthData 则在模型当前能力边界附近搜索,在那里示例依然困难,但仍具备可学习性。

这一理念也改变了评估失败所代表的意义。失败不再只是一个分数或错误报告,而成为后训练的原材料。同一环境可以诊断弱点、生成有针对性的练习,并测试更新后的模型。

这正是 AutoSynthData:为企业代理生成训练数据背后的核心主张。ServiceNow 尚未证明它能在彼此无关的企业环境中发挥作用。不过,它已经为不加区分地扩展合成数据提供了一种具体替代方案。

静态代理数据集如今面临移动的目标

AutoSynthData 对那些收集大量训练数据、却不衡量每个样本是否教授缺失能力的团队构成压力。

企业代理开发者面临棘手的数据问题。生产记录包含有价值的工作流模式,但也可能包含个人信息、机密商业数据和不一致的结果。人工编写的任务可以避免部分隐私问题,但创建足够多样且可验证的示例成本很高。

合成数据能够提供规模,但规模本身无法挑选正确的课程。一款已经能处理密码重置请求的模型,无法从数千个类似示例中获得太多收益。它需要暴露尚未解决问题的任务,例如策略检查、跨系统规划和安全拒绝。

EnterpriseOps Gym 为 ServiceNow 的实验提供了受控环境。其基准测试论文描述了有状态任务:代理必须跨工具推理,并使底层系统处于正确状态。这与仅评估最终文本回答的基准测试不同。

ServiceNow 将 EnterpriseOps Gym 描述为覆盖八个业务领域。相关环境包含 512 个功能性工具和 164 张相互关联的数据库表。这些资源支持 IT 服务管理、客户服务和人力资源等领域的工作流。

据 ServiceNow 称,更广泛的基准测试包含 1,150 个企业任务。它们测试跨互联系统的规划、策略合规性和状态变更。已发布的数据集也让外部研究人员能够获取基准测试材料。

这些数字说明了为何有针对性的生成如此重要。单个工作流可能结合多种工具、记录、策略和依赖关系。初始状态的细微变化,都可能改变何种步骤序列有效,或请求的操作是否本应发生。

ServiceNow 此前报告称,在困难的企业领域提供专家任务计划可将表现提升 15% 至 35%。这一发现表明,即使代理能够正确调用单项工具,规划仍然是主要制约因素。AutoSynthData 试图将这类规划缺口转化为反复出现的训练机会。

压力首先落在静态评估团队身上。固定测试集可以识别弱点,但不会自动创建解决这些弱点的课程。研究人员仍需将失败转化为多样化示例、有效解决方案和可靠的评分逻辑。

第二重压力落在通用模型提供商身上。强劲的基准测试平均分可能掩盖由本地策略、表结构或工作流规则引发的失败。企业需要证据证明模型能够在其特定系统内运行,而不只是回答有关这些系统的问题。

第三重压力落在构建代理平台的公司身上。若自适应训练被证明有效,评估基础设施将成为模型开发的一部分,而非最终质量关卡。平台将需要可复现的环境、任务生成、执行日志和基于状态的验证。

这一要求有利于拥有运营模拟器或数字孪生的组织。Salesforce 已通过 CRMArena-Pro 探索相关方向,该系统使用模拟企业环境来评估代理在业务工作流上的表现。这种重叠表明,行业正更广泛地转向可执行、以环境为基础的代理测试。

两条路径并不相同。基准测试可以在不修改模型的情况下比较模型,而 AutoSynthData 则利用基准测试失败生成后训练数据。前者衡量能力,后者试图提升能力。

这一差异对企业买家而言很重要。排行榜识别的是在既定条件下最强的模型。自适应课程则关注:成本更低或规模更小的目标模型,能否在组织自身反复出现的任务上实现提升。

ServiceNow 报告的结果使这种可能性变得具体,但尚未定论。训练后,目标模型仍仅完成少数 IT 服务任务。优于基线并不意味着已准备好获得无人监督的生产访问权限。

知识质量仍是现实制约。代理无法遵循缺失、相互矛盾或无法访问的策略。构建可搜索知识库的团队,在生成的训练任务能够反映真实工作之前,仍需要清晰的源材料。

因此,AutoSynthData 是转移了瓶颈,而非消除了瓶颈。团队需要更少人工编写的变体,但需要可信赖的环境和精确的验证。当代理能够修改客户、员工或基础设施记录时,这种交换将变得决定性。

该机制依赖可执行任务和严格验证器

只有当生成的请求、参考解决方案和验证器对成功的含义达成一致时,AutoSynthData 才能发挥作用。

该流水线首先识别能够区分目标模型和更强教师模型的任务。在报告的配置中,ServiceNow 倾向于选择目标模型在三次试验中最多只解决一次的候选任务。更强的求解器则必须在三次试验中至少完成两次。

这一筛选旨在确定一个有用的难度区间。两种模型都无法完成的任务无法提供可靠示范。两者都能稳定完成的任务则会消耗训练容量,却没有针对明确弱点。

一旦候选任务进入流水线,AutoSynthData 就会执行其参考轨迹。轨迹是用于达到请求状态的工具调用和操作序列。随后,验证器会根据任务的成功条件检查结果。

这种正向检查询问预期的解决方案是否确实有效。它可以暴露无效的初始状态、不可用的工具、中断的操作序列,或请求与验证器之间的不一致。一个看似合理的示例若无法经受执行检验,便会失败。

该流水线还会执行反向验证。它会改变预期结果,并确认错误状态不会通过验证。这一步十分重要,因为薄弱的验证器可能会奖励跳过必需操作或违反重要约束的智能体。

设想这样一个请求:只有在与受影响员工确认问题已解决后,才能关闭 IT 事件。如果验证器只检查事件状态,就会接受这种不安全的捷径。更强的验证器还应要求提供确认记录以及任何规定的备注。

当存在多种有效解决方案时,同样会出现这一问题。验证器应识别可接受的结果,而不是强制要求某一条精确的参考操作序列。ServiceNow 将此称为完整性,并将其与请求一致性及对错误行为的可靠拒绝并列。

这些要求带来了棘手的平衡。过于宽松的验证器会奖励未完成的工作;过于狭窄的验证器则会惩罚合理策略,并训练模型模仿任意指定的操作序列。

未通过的候选项会进入有限次数的评审与修复循环。评审器会检查任务构造、初始状态、解决方案和验证逻辑。系统会应用有针对性的修正,重新运行相关检查关卡,并接受或拒绝修订后的候选项。

修复已有候选项可以保留有价值的工作,也避免只要某一组件存在可修复缺陷就重新开始生成。重试上限可防止系统在产出率低的任务类型上无限消耗资源。

随后,AutoSynthData 会审查整个批次的质量。单个有效示例仍可能构成重复性很高的数据集。生成器可能过度产出常见工作流,却忽略政策、工具或系统状态的困难组合。

控制器会跟踪已接受和被拒绝的样本、重复模式、能力覆盖情况以及反复出现的评审发现。它会减少在过度代表区域中的生成,并将工作重定向至覆盖缺口。这在单个任务之上形成了反馈机制。

target 和 multiply 阶段支撑了这一策略。Target 样本围绕特定能力缺口建立经过验证的任务类型。Multiply 样本则改变措辞、实体、工具组合和环境状态,而不会对先前变体进行递归扩展。

这一设计降低了一种常见的合成数据风险。递归生成可能放大微小错误,因为每个新样本都会继承另一个生成样本的假设。将所有变体锚定在经过审查的 target 示例上,可限制这种传播链条。

这种方法也为企业提供了更具可辩护性的审计轨迹。每个训练示例都可以关联其初始状态、预期操作序列、验证器和验证结果。这比一个只存放提示词、却没有可执行上下文的文件夹更有价值。

不过,确定性检查无法编码所有有意义的质量维度。即使智能体在过程中泄露了敏感信息,最终数据库状态也可能看起来正确。另一条轨迹也可能先制造不必要的变更,再恢复到预期状态。

执行日志和具备政策意识的检查仍然必不可少。ServiceNow 自己的智能体评估工具强调数据集、执行记录和多个质量维度。AutoSynthData 将这一理念延伸至训练数据生产。

该机制也依赖于教师模型。更强的模型能够演示成功行为,但其操作仍受限于可用工具和已编码的政策。若教师模型选择风险较高的捷径,这种行为可能会传播到监督微调中。

这引出了一个治理问题。企业需要了解谁来定义有效行为、环境实施哪些政策,以及如何审查验证器变更。否则,自动化生成可能会规模化放大未被察觉的规范错误。

《AutoSynthData:为企业智能体生成训练数据》最有说服力之处,在于其对可执行数据的论证。生成器备受关注,但环境和验证器承载了该系统的大部分可信度。没有它们,合成任务仍只是看似可信的故事,而非经过证明的训练示例。

报告中的提升具有意义,但范围仍然有限

ServiceNow 报告了明确的基准改进,但这些实验尚不足以证明生产可靠性或广泛迁移能力。

第一项实验在 EnterpriseOps Gym 的 Hybrid 域中,以 Gemma-4-26B-A4B-it 作为目标模型,Qwen3.8-27B 作为教师模型。AutoSynthData 在约 18 小时内生成了 2,000 个合成训练示例。

ServiceNow 使用监督微调对 Gemma 进行了微调,即训练模型模仿成功示例。报告中表现最佳的检查点来自第五个 epoch。一个 epoch 代表对训练数据集完成一次完整遍历。

据该公司称,平均 Pass@1 提高了 7.2 个百分点。ServiceNow 将这一变化描述为 35% 的相对提升。验证器成功率也从 63.01% 提升至 68.55%。

该公司表示,所得检查点弥合了 Gemma 与其参考模型之间原始 Pass@1 差距的 59%。这些结果表明,有针对性的合成示例影响了不止一个衡量指标。但它们并未揭示该模型在测试环境之外的表现。

第二项实验聚焦 IT 服务管理。它同样使用 Gemma-4-26B-A4B-it 作为目标模型,DeepSeek-V4.1-Flash 作为教师模型。该流水线在 66 小时内产出了 1,994 个被接受的样本。

在 ITSM 评估中,平均 Pass@1 从 18.77% 升至 27.18%,即提高了 8.41 个百分点。这也意味着,按照该基准的评分方法,训练后的模型在大多数首次尝试中仍会失败。

这一剩余差距是关键背景。实验支持这样的主张:有针对性的合成微调可以提升模型。但它并不支持以下主张:所得智能体已准备好在商业系统中独立运行。

ServiceNow 表示,Hybrid 生成器从未接收原始评估提示词、实体、轨迹或验证器细节。它接收到的是从评估行为中提炼出的能力规范。这种隔离降低了一种明显的测试集污染形式。

不过,该课程体系仍源于 EnterpriseOps Gym 内观察到的失败。因此,训练和评估共享同一环境、工具结构和总体任务分布。在该环境中的改进,并不能证明其可迁移至无关软件或企业私有配置。

报告中的数字也来自设计该系统的团队。独立复现将增强结果的说服力。研究人员需要获得足够的代码、生成设置、被接受样本和评估细节,才能复现这一流水线。

Artificial Analysis 目前基于 EnterpriseOps Gym 运营一个独立排行榜。其评估同样强调有状态、多步骤的工作以及最终数据库条件。这一外部测试框架为更独立地测试训练后检查点提供了一个可能的平台。

跨环境评估会更具信息价值。在一种 ITSM 配置上训练的模型,可以针对变更后的政策、重命名的工具、调整过的模式和陌生的记录分布进行测试。在这些变化下的表现,将显示模型究竟学会了一种能力,还是记住了一种环境模式。

安全性也需要单独衡量。ServiceNow 此前描述了 30 个不可行的基准任务,涉及不可用资源、缺失权限或政策违规。据称,其测试中表现最强的模型仅能识别约一半任务不可行。

AutoSynthData 可以针对这类失败进行训练,但当前发布内容并未展示专门的安全弃权结果。如果模型在应当拒绝时也变得更愿意采取行动,提升任务完成率可能带来新的风险。

教师模型与目标模型之间的关系值得审视。Hybrid 实验采用了规模相对接近的模型配对,而 ITSM 运行则使用了大得多的教师模型。生成时长存在显著差异,部分原因是 ServiceNow 表示,较早的 ITSM 运行发生在吞吐量优化之前。

这些差异使直接比较变得困难。两个领域涉及不同的教师模型、处理时间,以及可能不同的能力分布。证据表明该方法可在两种设置中重复,而非对每个系统组件进行受控研究。

缺少消融研究也限制了解读。公开结果没有分离失败定向、教师示范、验证器筛选、任务扩增或批次级平衡各自带来的改进幅度。每个组件听起来都合理,但它们各自的贡献仍不明确。

成本和资源使用也是另一个悬而未决的问题,即使不附带商业数字也是如此。生成数千个任务需要反复进行模型调用、环境执行、求解器试验、评审、修复和验证。被接受的数据集仅代表最终产出,而非尝试过的全部工作量。

企业必须将这一工作量与替代方案进行比较。人工编写的示例可能更慢,但更容易审查。检索和编排方面的调整,或许无需更新模型权重就能修复部分失败。

一个工作流失败,也可能是因为其知识不完整,而非模型缺乏推理能力。更好的知识融合可能更直接地解决一些缺口。训练不应成为对每次智能体运行失败的默认回应。

这种谨慎解读依然令人鼓舞。AutoSynthData 从围绕已观察弱点选择的任务中,产生了可衡量的改进。更强的主张——自适应合成课程能够泛化为更安全的生产级智能体——仍未得到证明。

三个信号将决定 AutoSynthData 能否超越基准测试而产生影响

下一步证据应展示可复现性、迁移能力和更安全的行为,而不只是原始环境内又一个更高的分数。

第一个信号是可由独立方复现的发布。ServiceNow 已发布 EnterpriseOps Gym 材料,但研究人员还需要 AutoSynthData 实现及完整实验方案。该软件包应包括能力卡构建、生成设置、验证器测试、拒绝标准和检查点评估。

独立团队应能够基于相同的诊断失败重新生成可比数据集。多次运行中出现类似改进,将减少对有利抽样的担忧。公布被拒绝任务的统计数据,也能揭示最终数据集需要多少筛选。

这一信号最有力的形式应包括消融实验。研究人员可以逐项移除反向验证、批次平衡、扩增或失败定向。由此产生的性能差异,将揭示哪些机制带来了改进。

如果独立复现成功,将加强 ServiceNow 的核心技术主张。若收益在不同运行间剧烈波动,则表明该流水线仍对生成器、教师模型或选择方式较为敏感。

第二个信号是跨环境迁移。训练后的模型应面对保留底层能力、但改变工具、实体、政策和模式的工作流。这项测试将区分通用学习与对 EnterpriseOps Gym 结构的熟悉。

一项有用的实验可以在一个 ITSM 环境中训练,并在另一个环境中进行评估,且不再进行额外微调。另一项实验可以从单一领域工作流转向需要客户、员工和资产数据的跨领域任务。

企业还应关注 ServiceNow 导向系统之外的适配器。AutoSynthData 的控制器—适配器架构表明其具备可移植性,但软件设计并不保证实际兼容性。每个新环境都需要可执行的操作与可靠的验证机制。

成功的跨平台结果将使这一方法与更广泛的智能体市场相关。若迁移效果不佳,其作用则会被限定为一种面向严格定义环境的高效定制化流程。

第三个信号是,任务完成率能否在不削弱拒绝能力和政策合规性的前提下提升。企业智能体必须知道何时不该行动。如果训练会促使智能体在权限缺失或指令相互矛盾时仍自信执行,那么更高的 Pass@1 分数并不足够。

未来的评估应报告不可行任务的识别情况、未经授权的状态变更、政策违规以及不必要的工具调用。评估还应检查中间操作,而不只是最终数据库状态。恢复后的最终状态可能掩盖一段不安全的操作序列。

对于高影响力工作流,人工审核仍然至关重要。审核人员应检查涉及员工记录、访问控制、客户权益、安全事件以及不可逆变更的样本。自动验证器可以支持这一过程,但不应在缺乏可追责监督的情况下自行定义政策。

因此,未来一到三个月应带来三类具体证据:可运行的流水线代码、跨环境测试,以及针对安全性的结果。每一类都将回应当前发布中不同的不确定性。

《AutoSynthData:为企业智能体生成训练数据》提出了一种可信的机制,可将评估失败转化为有针对性的练习。其报告的提升表明,这一思路值得关注,尤其适合拥有可执行工作流环境的团队。

如今,更大的决策权掌握在企业 AI 构建者手中。他们应当思考,自己智能体的失败能否被表述为可复现的状态、有效的轨迹和可测试的结果。若不能,生成更多任务只会放大模糊性。

如果这些基础具备,自适应课程就能让评估发挥更大的价值。它可以展示失败之处,生成聚焦训练,并衡量同一弱点是否依然存在。下一步需要证明的是,这一闭环能够在创建它的环境之外依然有效。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page