Anthropic 称 Claude Tag 完成产品工程团队 65% 的 PR,同时系统提示词缩减 80%
Anthropic 表示,Claude Tag 完成了 Claude Code 团队 65% 的产品工程 PR,而其前沿模型的系统提示词已缩减 80%。这两个数字共同描绘出一种比加快代码生成更深层的变化。Anthropic 正在将软件开发工作从交互式编码会话转移到持久运行的智能体上;这些智能体可以监控团队对话、创建拉取请求,并在更少的指令性引导下开展工作。
Cat Wu 和 Thariq Shihipar 在由开发者兼作家 Simon Willison 主持的一场炉边谈话中分享了这些细节。他发布的炉边谈话文字记录是迄今最完整的公开资料。这些百分比来自 Anthropic 的内部测量,尚未经过独立审计。
核心矛盾已不再是 AI 生成的代码与人类编写的代码之间的竞争,而是交互式辅助与委托式执行之间的竞争。Wu 表示,Claude Code 仍然是处理需要主动迭代的复杂任务的主要工具。Claude Tag 则负责那些可以在 Slack 中发起,并且无须工程师反复启动新会话就能持续进行的例行工作。
这一转变给所有销售 AI 编码助手的公司带来了压力。一个等待开发者逐项描述任务的工具,如今要与能够监控错误报告、记住团队偏好、查询产品数据并提出修复方案的智能体竞争。竞争的焦点正从代码补全转向对代码周边工作流的掌控。
Anthropic Claude Tag 完成产品工程团队 65% 的 PR
值得注意的变化并不是 Claude 能够编写代码,而是据称某个内部智能体完成了 Anthropic 一个团队的大多数产品工程拉取请求。
Claude Tag 是 Anthropic 为 Claude 打造的 Slack 协作集成。团队成员可以要求它调查报告、搜索内部讨论、操作代码仓库、创建拉取请求,并通知相关工程师。它还可以接收在频道内持续有效的常设指令。
Wu 表示,内部版本的 Claude Tag 目前完成了 65% 的产品工程 PR。她澄清称,这个数字适用于 Claude Code 产品工程团队,而不是 Anthropic 的所有工程团队。这一区别非常重要,因为一个高度聚焦的产品团队并不能代表所有公司或代码库。
“完成”这个词也值得关注。它意味着 Claude Tag 的贡献会进入代码仓库,而不仅仅是生成建议。不过,这场谈话并未公开说明其中有多少变更需要修正、每个 PR 获得了多少人类指导,或团队是如何计算这一百分比的。
Anthropic 的示例展示了这一工作流如何启动。团队可以要求 Claude Tag 监控某个 Slack 频道中的每一份错误报告、准备修复方案,并标记最后修改过受影响代码的工程师。该指令可以在频道的整个生命周期内持续有效,而无须针对每份报告重新输入提示词。
这种方式将 Slack 从沟通界面转变为工程工作的事件流。一份报告、一场讨论或一个产品问题,都可以在任何人将其复制到问题跟踪器之前变成智能体任务。Claude Tag 的团队记忆使智能体能够保留通过自然语言传达的偏好,并将其应用于频道之后的活动。
智能体也可以记住边界。团队可以指示它调查服务中断,但忽略警告。据谈话内容称,这项偏好随后会影响频道中所有用户今后的使用行为。
Shihipar 还介绍了直接编码以外的用途。Claude Tag 可以搜索 Slack 内部讨论以获取发布信息、查询事件存储中的产品指标,或向市场营销人员解释某项功能。由于它能够检查代码库,据称它可以展示功能的实际行为,而不必仅仅依赖文档。
这些示例揭示了其真正的产品野心。Claude Tag 并不是作为一个更好用的开发者聊天界面出现的。它被设计为组织中的参与者,可以访问对话、代码仓库、指标、权限以及不断积累的团队上下文。
这种广度使它有别于传统的编码助手。助手在编辑器内作出响应。持久运行的智能体则会在团队原本就用于讨论、确定优先级和评估工作的系统中发现任务。
不过,不应将 65% 这个数字理解为 65% 的工程工作量。拉取请求在规模、风险和复杂度方面差异巨大。十个小修复的工作量可能还不如一次架构变更。
Anthropic 尚未公开这些 PR 的代码变更行数、问题严重程度、审核时间、缺陷率或生产环境结果。这个数字证明了该工作流在一个团队中的渗透程度,但并未量化整个开发生命周期中的自主工程能力。
即便存在这一局限,该指标仍表明其运营方式发生了重大变化。Claude Tag 已经从偶尔的实验转变为交付变更的常规路径。交互式编码依然重要,但它已不再是智能体辅助开发的唯一中心。
系统提示词缩减改变了提示工程的惯用方法
Anthropic 将系统提示词缩减 80%,这表明当运行框架提供上下文和工具,但不对每个决策作出规定时,其最新模型的表现反而更好。
系统提示词是在用户提交请求之前定义助手行为的隐藏指令层。早期的编码智能体通常需要冗长的提示词,其中充斥着示例、限制、首选流程和工具使用提醒。
Shihipar 表示,Claude Code 现在针对不同模型使用不同的系统提示词。只有最先进的模型采用了减少 80% token 的提示词。据 Wu 称,旧款模型仍然使用内容更完整的提示词。
这一细节避免了过于宽泛的结论。Anthropic 并不是说系统提示词已经变得毫无必要,而是认为提示词的复杂程度应与模型能力相匹配,并且对某一代模型有用的指令可能会限制另一代模型。
Shihipar 解释称,团队此前对 Claude 施加了过多限制。早期的 Opus 级模型能够从大量示例中受益。而对于较新的模型,据称移除示例后,它们表现出的创造力和有效性反而超出了示例所允许的范围。
这对提示工程中最常见的规则之一构成了挑战。少样本提示法通过向模型提供预期输出示例来引导模型,长期以来一直是一项标准技术。Anthropic 的经验表明,当模型拥有足够的判断力来寻找更好的方法时,示例反而可能成为其能力上限。
团队还缩减了禁止操作列表。Shihipar 表示,强硬的“不要”类指令可能会与之后的用户请求或技能发生冲突,使模型无法确定应按照哪个方向完成任务。
取而代之的并不是一个空白的指令层。Anthropic 表示,它提供了更多相关上下文、更少的硬性限制,以及一套设计更合理的工具。智能体获得了足够的信息来理解环境,同时仍有空间自行选择处理方法。
Wu 以验证为例,说明为什么绝对化规则可能失效。一条指令可能适用于 90% 的情况,但在剩余 10% 的情况下却会适得其反。将其编码为绝对要求,可能会迫使模型在合理的边缘场景中作出不良行为。
这是机制层面的变化,而不只是对提示词的表面修改。长篇指令试图在工作开始前预判各种决策。更短的提示词则将更多决策委托给模型,同时依靠评估、工具边界、审核系统和运行时控制来保障结果。
Anthropic 表示,它使用评估来确定哪些内容可以删除。评估通常称为 evals,是用来衡量模型或智能体在选定任务中表现的可重复测试。这意味着提示词缩减是一项基于观察结果的工程决策,而不仅仅是为了节省 token。
这一区别对其他团队十分重要。如果不复现其评估流程,只照搬 80% 的缩减幅度,就会错过真正的经验。一个组织不能仅仅因为 Anthropic 针对 Claude Code 中的特定前沿模型删除了指令,就安全地照做。
相反,团队需要识别哪些规则是在弥补模型判断力的不足,哪些规则会造成不必要的冲突。他们还需要测试此前由提示词文本控制的各种决策。
这一变化呼应了软件智能体领域更广泛的转型。早期系统依赖规定每一个步骤的编排代码。如今,越来越多的新型智能体只需获得目标、工作环境和工具,之后便可自行选择行动顺序。
Anthropic 的 Fable 5 概述介绍了能够跨阶段规划、委派工作并检查自身输出的智能体。这些说法来自 Anthropic,但有助于解释为什么详细的流程示例可能会形成限制。
因此,更短的提示词并不意味着更少的工程工作,而是工程投入发生了转移。团队减少了为理想执行路径编写脚本的时间,将更多精力投入到工具、权限、上下文检索、评估集和恢复路径的设计中。
这种转移与 Claude Tag 直接相关。一个持久运行的 Slack 智能体会遇到各种无法在单个指令文件中提前预料的请求。它需要具备判断力,因为周围的对话、权限、代码仓库状态和业务上下文会随任务而变化。
委托式智能体正在给交互式编码工具带来压力
Claude Tag 将竞争的核心问题从“谁编写的代码更好?”转变为“谁能安全地承担无人值守工作的责任?”
Wu 表示,Claude Code 仍然用于处理 Anthropic 最复杂的交互式任务。工程师可以与它协作、检查中间结果、调整其处理方法,并在活跃会话中不断完善解决方案。
Claude Tag 则处于不同的位置。它会主动处理重复出现的报告和运营信号。工程师变成审核者、问题升级接收者或决策者,而不再是每次编码周期的发起者。
这种分工形成了一张实用的竞争格局图。一边是交互式编码智能体,由人类启动任务并始终密切参与执行;另一边是委托式智能体,由组织事件触发工作,人类只在必要时选择性介入。
对于常规产品工作,委托式路径具有结构性优势。错误报告本来就会出现在反馈频道中,指标本来就存放在分析系统中,所有权信息本来就存在于版本历史中。一个相互连接的智能体可以整合这些信号,无须人工在工具之间转移信息。
这可以缩短从发现问题到提出修复方案之间的延迟。它还可以承接那些开发者可能会推迟的小型任务,因为这些任务的协调成本往往高于预期收益。
不过,工作流访问能力与模型智能同样重要。一个没有代码仓库权限、产品上下文、组织记忆或事件数据的智能体,仍然只是一个孤立的聊天机器人。Claude Tag 的潜力来自于在持久运行的操作环境中整合这些资源。
这就是为什么团队知识会成为一项工程依赖。智能体需要可靠的产品决策、编码规范、客户报告、历史事故和职责归属记录。一个可搜索的工程知识库可以帮助人类组织这些上下文,不过自主智能体仍然需要受到审慎治理的访问权限。
这一变化给以编辑器为中心的产品带来了压力,因为开发者的注意力十分稀缺。交互式助手需要争夺开发者在编辑器中的时间。委派式智能体则承诺在工作进入工程师的活跃队列之前就将其处理完毕。
这并不意味着编辑器已经过时。架构决策、模糊的需求、在理解不足的系统中进行调试,以及敏感变更,仍然受益于紧密协作。Anthropic 自己也会让人类参与 Claude Code 的关键环节。
短期内更可能出现的是一种分工式工作流。持久运行的智能体处理边界明确的维护任务并准备变更。交互式智能体协助完成高难度实现。人类负责确定优先级、作出风险决策并承担最终责任。
来自 GitHub、OpenAI、Google 以及专业编码智能体供应商的竞品也在朝着类似的委派形式发展。有意义的比较不会取决于单一的基准测试分数。买家会考察代码仓库集成、任务持久性、审查质量、身份控制、可审计性以及失败后的恢复能力。
Claude Tag 的 65% PR 声明为 Anthropic 提供了一个引人注目的内部采用案例。不过,内部使用具有外部客户可能并不具备的优势。Anthropic 可以围绕同一套系统协调其模型、智能体框架、产品团队、安全团队和职场文化。
典型企业往往权限分散、文档不一致、代码仓库陈旧,而且审批流程横跨多个部门。其 Slack 历史记录中可能包含敏感材料、相互矛盾的指令或不完整的决策。
Anthropic 还处在一个异常重视 AI 的工作环境中。员工了解模型行为,能较早测试新功能,并提供详细反馈。在这种环境中的采用情况,并不能保证其在医疗、银行、政府或受监管的基础设施领域取得同等效果。
因此,真正相关的竞争力测试是可复现性。当代码库属于其他人、上下文混乱,而且组织无法围绕智能体调整自身实践时,Claude Tag 能否实现相近程度的工作流渗透?
在客户公布可比较的结果之前,65% 这一数字仍然只是一个颇具说服力的案例研究,而非行业基准。
自动化审查正在扩展,但核心部分仍由人类负责人把关
Anthropic 的审查流程依据风险,在外围变更与关键代码之间划定界限,而不是以同样的方式对待每一个由 AI 生成的 PR。
Wu 表示,对 Claude Code 和其他产品核心部分的关键变更,仍然会由指定的代码负责人进行人工审查。对于产品“外层”的变更,Anthropic 越来越多地依赖 Claude 完成全部代码审查。
“外层”这一标签很有用,但不够精确。这场对话并未公布正式的分类方法、符合条件的文件清单,也未说明 Claude Tag 的 PR 中有多大比例会绕过人工审查。读者不应假设每一项由智能体生成的变更都会直接进入生产环境。
据称,Anthropic 用了六个多月才形成当前的流程。团队最初对每一项变更都进行人工审查,随后识别出自动化审查能够持续发现其所关注问题的领域。
Wu 表示,当事故发生时,团队会检查引发事故的拉取请求,并更新其审查系统。团队还会将该 PR 添加到评估集中。之后对审查器所做的变更,都会针对这一失败案例进行测试。
这会将生产环境中的错误转化为审查智能体的回归测试。这一思路类似于传统软件测试:已经修复的缺陷会成为一项测试,防止同样的问题再次出现。
更困难的问题是发现此前从未出现过的故障。评估集衡量的是已知场景,而在该评估集上表现出色,并不能保证能够覆盖新的攻击路径或异常交互。
自动化编写与自动化审查也可能存在相同的盲点。如果相似的模型以同样的方式理解需求、代码仓库和测试,审查器可能会批准编写者产生的错误。独立工具和人类判断能够提供单一模型家族所缺乏的多样性。
安全问题进一步提高了风险,因为 Claude Tag 会接收来自协作渠道的输入。恶意或已遭入侵的消息可能会尝试进行提示词注入,也就是利用隐藏指令改变智能体的行为方向。当智能体能够读取代码仓库、访问内部系统并执行工具时,风险会进一步扩大。
Anthropic 将 Claude Tag 与 auto mode 相连接。auto mode 是一种权限系统,会根据当前对话和工具调用评估所请求的操作。Shihipar 表示,一个 Sonnet 分类器会判断某项操作是否符合用户的指令。
auto mode 还会与沙箱配合使用,以限制智能体能够访问的内容。当某项操作需要跨越边界时,例如发起网络请求,系统会判断该请求是否符合任务要求。
Anthropic 表示,在 3 月 24 日公开发布之前,员工从 2026 年 1 月起就已在内部使用 auto mode。Wu 表示,公司使用了数千项评估,并委托开展了针对对抗性环境的红队演练。
她也承认,该系统无法捕获所有威胁。Anthropic 计划公布更多评估结果,而 Willison 则认为,该公司关于其安全性可与人工审查相比较的说法是一项需要证据支持的重大声明。
企业买家应当以这种审慎态度作为指导。供应商的内部攻击测试确实具有参考价值,但客户需要了解测试方法、威胁类别、失败率、模型版本和部署条件,才能比较不同的安全声明。
身份设计提供了另一层保护。Shihipar 表示,Claude Tag 可以使用自己的凭据,而不是冒充某位员工。这使智能体的操作更容易接受检查,也能将智能体的权限与个人账户分离开来。
凭据注入可以进一步减少暴露风险。Anthropic 的方法允许智能体通过代理调用经过身份验证的服务,而无需直接获得底层密钥。代理可以注入凭据并记录请求。
这些控制措施说明了为什么自主 Slack 机器人并不只是一个连接到 webhook 的模型。该系统需要范围受限的身份、动态权限、沙箱、审计日志、评估套件、事故反馈以及受保护的凭据处理机制。
提示词减少 80%,使这些外部控制变得更加重要。当模型接收到的强制指令更少时,安全性就不能只依赖提醒文本。即使模型选择了意外的路径,外围系统也必须能够约束会产生重大后果的操作。
这正是 Anthropic 叙事中的权衡。给予模型更大的自主裁量权可以提升性能和适应能力,但同时也需要更强的运行时治理,以及围绕哪些变更可以在未经人类批准的情况下继续执行所设定的更清晰边界。
该公司自己的工作流体现了这种平衡。Anthropic 正在将人类从部分审查环节中移除,但并未取消责任归属。人类仍然负责界定关键区域、分析事故、更新评估,并决定自动化审查在哪些领域已经赢得了足够的信任。
Fable 的视频工作展示了任务边界已经扩展到何种程度
发布视频的例子之所以重要,是因为它展示了智能体如何组合陌生的工具和媒体工作流,而不仅仅是生成另一段应用程序代码。
Shihipar 通过 Claude Code 使用 Fable 编辑了 Fable 自己的发布视频。他描述说,自己从一个内容充实的单一提示词开始,然后让智能体自行决定如何处理可用素材。
据称,该智能体通过 HTML 源代码检查了演示幻灯片,转录了口述内容,在 Shihipar 于舞台上移动时追踪他的位置,并调整了画面裁剪。它使用了命令行媒体处理工具 FFmpeg,以及用于生成视频的 React 框架 Remotion。
随后,Shihipar 要求它添加动画和图形。这个例子横跨多个任务类别,包括源代码检查、转录、视觉追踪、编辑、界面组合和渲染。
Anthropic 的说法不应被解读为 Fable 可以取代专业视频编辑人员的证明。Shihipar 提供了指导、评估了结果并提出了修改要求。公开叙述中并未包含与经验丰富的编辑人员进行的对照比较。
相反,这个案例说明了任务打包方式的变化。用户不再需要先要求生成一段脚本,然后手动操作每一个应用程序。智能体可以将各种工具组合成一套工作流,并交付更加完整的成果。
同样的能力也支撑着 Claude Tag 的工程角色。修复缺陷很少只是生成代码。智能体必须定位用户反馈、理解产品界面、找到相关文件、复现问题、修改实现、运行测试、准备 PR,并通知负责人。
能力更强的模型可以在一次运行中完成这条链路中的更多环节。Anthropic 将 Fable 描述为能够支持长时间运行的多阶段工作,但目前来自各种生产环境的外部证据仍然有限。
面对能力日益增强的智能体,Shihipar 建议人们树立更大的目标。如果模型可以更快完成熟悉的任务,开发者就能尝试过去因规模过大或跨越太多专业领域而难以开展的项目。
这一建议也承认了其中的情感代价。Willison 使用“Deep Blue”来描述一些专业人士在软件吸收其职业核心工作时感受到的失落。编码智能体可能会让经验丰富的开发者开始怀疑,哪些技能仍然具有价值。
Anthropic 团队的回答并不是专业知识会消失,而是专业能力的重心将转向选择有价值的问题、评估结果、提供上下文、识别未知因素,以及设计能让智能体始终处于可接受边界内的系统。
视频案例支持了这一观点。智能体可以操作媒体工具,但仍然由人类决定发布视频需要传达什么。当判断取决于受众、审美或组织目标时,执行能力本身并不能决定答案。
对于软件团队而言,这意味着一种新的劳动分工。智能体会越来越多地负责程序化组装。人类仍然负责定义成果、解决相互冲突的优先事项、识别不可接受的风险,并判断技术上有效的工作何时在战略上是错误的。
这种分工不会保持不变。模型能力、评估方法和治理工具将继续演进。重要的问题是,随着证据不断积累,组织愿意委派哪些职责。
Anthropic 提出 65% 和 80% 的声明之后,需要关注什么
接下来的证据必须表明,Anthropic 的内部工作流能否在 Claude Code 团队之外依然保持安全、可衡量且实用。
第一个信号是 Anthropic 承诺公布的 auto-mode 评估。具有参考价值的披露应当说明测试类别、攻击方法、模型版本、沙箱假设和观察到的失败率。详细结果将增强 Claude Tag 能够安全处理来自不受信任协作输入的可信度。如果只有缺乏可复现方法的高层摘要,那么核心安全声明仍将悬而未决。
第二个信号是外部客户证据。关注各组织报告的由 Claude Tag 发起的 PR 占比、这些变更的规模与严重程度、纠正率、审查时间、事故以及生产环境结果。Anthropic 之外若能取得类似成果,将有力证明持久化智能体是一种可迁移的工程模式。采用率低或需要大量监督,则意味着 65% 这一数字可能依赖于 Anthropic 的特殊环境。
第三个信号是 Anthropic 将自动化审查扩展到更敏感代码的频率。符合条件的代码仓库范围不断扩大,意味着其评估与事故反馈系统正逐步赢得信任。如果持续在相同边界内保留人工审查,则表明前沿模型仍难以证明扩大自主权的合理性。
团队在验证这些说法时,还应将两个核心数字区分开来。Claude Tag 的 PR 占比衡量的是工作流采用情况。系统提示词缩减幅度衡量的是 Anthropic 如何配置选定的前沿模型。这两个百分比都无法证明另一个成立。
Anthropic 表示,Claude Tag 完成了产品工程 PR 的 65%,与此同时,Claude Code 将前沿模型的系统提示词缩减了 80%。这一组合表明,智能体正承担更广泛的责任,同时接收更少的程序性指令。但这尚不能证明该方法适用于普通企业。
对于开发者和工程负责人而言,实际的下一步是按风险和结果衡量委派工作,而不是按生成的代码量衡量。如今,哪些维护任务可以进入智能体队列?哪些代码仓库需要由人工负责人监管?需要哪些证据才能证明调整这一边界是合理的?
这些问题将决定持久化编码智能体会成为可靠的队友,还是仅仅制造出积压速度更快的审查任务。



