top of page

Anthropic Claude 将 Claude Code 的系统提示词削减 80%,挑战“规则越多越好”的做法

Anthropic Claude 为其最新模型移除了 Claude Code 系统提示词中超过 80% 的内容,但表示内部编码评估未显示出可衡量的能力损失。这项于 7 月 24 日进行的调整涵盖 Claude Opus 5 和 Claude Fable 5 等先进模型。它颠覆了一个关于 AI agents 的常见假设:更详细的指令并不总能带来更可靠的行为。

Anthropic 表示,旧版 Claude Code 需要明确规则,以防止糟糕的注释、不需要的文档和不安全的文件操作。这些保护措施逐渐累积在系统提示词、项目指令、技能、工具描述、记忆以及单独的用户请求中。最终形成的上下文可能包含重复甚至相互矛盾的指示。

Claude 5 的上下文工程如今从不同前提出发。Anthropic 希望团队给有能力的模型留出判断空间,设计更清晰的接口,并且仅在需要时加载专门指令。主要竞争已不再是 Anthropic 与其他模型提供商之间的竞争,而是规定式提示与选择性上下文之间的竞争。

这种差异的重要性不止于 Claude Code。开发者正在构建能够读取代码仓库、调用工具、编辑文件、审查代码,并在长时间会话中维持状态的 agents。每一条永久指令都在与任务、当前文件、工具结果和用户意图争夺注意力。

不过,该公司的证据仍然有限。Anthropic 尚未公布支撑其“未见可衡量损失”说法的评估套件、基线分数、任务分布或逐模型结果。80% 的削减幅度意义重大,但其实际适用范围仍需独立测试。

Anthropic Claude 移除了曾被视为必不可少的规则

眼下的变化并非更大的上下文窗口,而是大幅缩小的永久指令层。

Anthropic 将上下文工程定义为:除用户即时提示外,模型所接收到的一切内容的组合。这些材料包括系统指令、项目文件、技能、记忆、工具定义、对话历史和检索到的参考资料。

系统提示词是塑造 agent 在整个对话中行为的初始指令集。它可以定义行为、工具使用方式、回应风格、安全边界以及对运行环境的假设。

根据 Anthropic 的上下文工程指南,该公司为 Opus 5 和 Fable 5 删除了 Claude Code 系统提示词中超过 80% 的内容。该公司称,此后编码评估未显示可衡量的能力损失。

这项公告并非表示指令已经不再必要。相反,它将永久规则与应放在其他位置的信息区分开来。安全边界、权限、工具契约和明确的用户要求,仍然需要清晰地表达。

改变的是这些指导信息的默认放置位置。Anthropic 过去将详细的编码、审查、文档和验证行为放进主提示词中。即便某项具体任务不需要它们,这些指令也会一直伴随模型。

一些旧规则还试图控制狭窄的失败模式。Anthropic 举例称,过去有一项指令要求 Claude 除非得到请求,否则避免编写多段式 docstrings 和规划文档。该规则减少了不需要的输出,但也抑制了复杂代码中有用文档的生成。

替代方案更短,也更依赖具体上下文。Claude 应当匹配周边代码的注释密度、命名方式和惯用写法。该指令不再规定一种通用输出模式,而是告诉模型应在哪里寻找相关标准。

这种转变构成了本文的核心张力。详细规则看起来可能更安全,因为其行为可见且可测试。但当代码仓库、用户请求或任务需要例外时,每一条僵化指令都可能变得不再正确。

Claude Code 也会通过多个相互重叠的渠道接收指令。用户可能要求适当的文档,而全局规则却在抑制注释;某项技能可能要求验证,而另一个文件却告诉 agent 尽量减少额外工作。

模型必须先解决这些冲突,才能处理实际的工程问题。因此,更多文字会带来另一项推理任务,而不只是增加有用知识。

Anthropic 为此加入了一种诊断手段。该公司表示,/doctor 命令可以帮助用户适当调整其技能和 CLAUDE.md 文件。这些文件提供持久的项目上下文,包括代码仓库约定和重复出现的指令。

实际传递的信息比“删除你的提示词”更有限。团队应识别哪些信息确实适用于每一项请求。其他所有内容都需要更精确的触发条件、放置位置或交付机制。

为什么 Claude 5 的上下文工程偏向选择性上下文

Anthropic 正在押注:更好的模型判断力会降低永久性行为微观管理的价值。

旧方法的出现有其原因。早期编码模型经常生成过多注释、创建不必要的规划文件、错误使用工具,或过于字面地遵循示例。详细指令缩小了可选择的行为范围。

这种限制伴随着权衡。避免一种常见失败,可能会阻碍对特殊任务的正确回应。禁止长注释或许能改善日常编辑,但会损害复杂算法或安全敏感代码的工作。

Claude 5 的上下文工程将这一决策拉近任务本身。模型接收用户请求,检查附近代码,并应用本地约定。Anthropic 将此称为对 Claude 的“解除束缚”,因为系统移除了那些已经失去原有意义的限制。

这个词不应被误解为不受限制的自主性。Claude Code 仍在一个 harness 内运行,即负责管理工具、权限、上下文和执行的周边软件。Anthropic 只是在简化这个 harness 中的一层。

该公司概述了几项“过去与现在”的变化:规则让位于判断;工具示例让位于表达力更强的接口;预先提供的指令让位于渐进式披露;重复内容让位于简洁的工具描述。

渐进式披露意味着在任务需要时才加载详细信息,而不是将所有内容都放入初始上下文。Claude Code 现在针对代码审查和验证等领域使用专用技能。

这种做法既保留访问能力,又不会持续占用注意力成本。审查流程可以继续保持详细,但 Claude 只会在执行审查时加载它。一次常规文件编辑无需携带整个流程。

Claude Code 对工具采用相同原则。一些工具使用延迟加载,即最初只展示轻量级描述。只有当 agent 通过搜索选择该工具后,完整 schema 才会出现。

Anthropic 的上下文窗口指南显示了这种区别为何重要。项目指令、记忆、技能描述、文件、回应和隐藏的运行时内容,都占据同一个工作上下文。

更大的上下文容量并不能消除选择问题。模型可以接受更多 token,却仍可能接收到无关、过时或相互矛盾的材料。容量回答的是能容纳多少,而不是哪些内容值得关注。

选择性上下文也改变了团队应如何组织代码仓库知识。单个 CLAUDE.md 文件不应成为囊括所有工程偏好的百科全书。Anthropic 建议建立一个参考资料树,让 agent 在适当时加载。

这种设计类似于良好的软件架构。稳定接口保持精简,而专门行为则置于明确边界之后。agent 可以了解有哪些内容存在,而无需在启动时接收每一项实现细节。

在这种模式下,工具定义变得尤为重要。Anthropic 认为,示例可能通过将模型引向此前展示过的模式而限制探索。清晰的参数和状态定义可以传达意图,而无需规定唯一的路径。

其 Todo 示例使用了待处理、进行中和已完成等枚举状态。一次只允许一个活动项目的约束描述了有效的系统状态。模型随后可在该接口范围内选择行动。

这实质上改变了 agent 可靠性所在的位置。过去,提示词作者主要试图通过散文式文字编码可靠性。如今,Anthropic 将更多责任交给接口设计、上下文路由、权限和模型判断。

真正的竞争是规定式提示与模型判断之间的竞争

这次削减 80% 的举措挑战了这样一种信念:每一次观察到的 agent 失败都值得增加一条永久指令。

AI agent 团队往往会通过增加规则来应对错误。如果 agent 跳过测试,提示词就加入测试要求;如果它编辑了无关文件,就再增加一段文字来缩小范围;如果它解释过多,随之而来的便是冗长度限制。

这一过程会形成棘轮效应。指令会不断累积,因为增加规则看起来比删除规则更安全。很少有团队会定期测试,旧规则是否仍能改善当前模型、工具和工作流的表现。

Anthropic Claude 现在认为,这种棘轮效应可能降低质量。问题不只是 token 消耗。相互冲突的指令迫使模型推断优先级、解释例外,并将过时保护措施与当前用户意图协调起来。

规定式提示仍然具有吸引力,因为团队可以审计它。安全审查人员可以找到明确的禁止条款;产品经理可以指向格式规则;开发者可以复现请求中包含的文字。

模型判断提供灵活性,但更难预测。它让 Claude 能够识别:尽管总体偏好最少注释,复杂函数仍然需要文档。同样的自由裁量也可能导致不同任务之间出现不一致的选择。

因此,Anthropic 论点最有力的版本取决于模型能力。能力较弱的模型可能仍需要详细示例、重复警告和狭窄规则。混合模型部署不能假定每个 agent 都能同样准确地理解简洁指导。

这会给支持多代模型的团队带来压力。为 Opus 5 或 Fable 5 优化的指令,可能不足以为旧模型或小型模型规定行为;为旧模型编写的提示词,则可能过度约束最新模型。

版本化上下文成为一项运营要求。团队需要了解哪些规则适用于每个模型、评估如何变化,以及共享指令何时不再带来价值。否则,简化本身会变成另一种未经测试的惯例。

这一变化也给销售提示词模板作为持久资产的公司带来压力。长模板可能编码了有用的专业知识,但长度不再是完整性的可靠替代指标。它的价值取决于相关性、路由和可衡量的结果。

构建自定义 agents 的开发者面临类似抉择。Anthropic 的系统提示词文档区分了完整的 Claude Code 预设、最小默认设置和完全自定义指令。

完整预设适合由人类监看并引导工作的编程智能体。自定义提示词则更适合具有不同身份、界面或权限模型的智能体。Anthropic 警告称,自定义构建者必须替换掉他们移除的任何安全指导。

这一警告揭示了新方法论的边界。移除行为冗余并不等同于削弱权限。精简的智能体仍需要对破坏性操作、敏感数据、外部通信和无人值守执行设置明确限制。

团队应在删除指令前先进行分类。风格偏好通常可以交由代码仓库约定处理。验证工作流可以转化为技能。权限边界应属于可执行的软件机制,而不应仅是一句礼貌性的文字。

这种划分正推动行业走向上下文架构。关键工作变成了决定哪些内容保持全局可用,哪些按路径加载,哪些按任务激活,以及哪些内容由独立于模型的软件来强制执行。

对工程团队而言,这种架构也会成为组织记忆。代码仓库约定、决策和技术参考资料需要明确的归属和检索路径。可搜索的工程知识库可以帮助团队将长期有效的事实与短暂的智能体指令分离开来。

这场竞争的胜者并不一定是每种情况下都使用“短提示词”的一方,而是能够提供最小充分上下文,同时保持安全性、任务保真度和可复现性能的系统。

Claude Code 系统提示词的结果仍需独立测试

Anthropic 的核心结论值得关注,但公开证据尚不足以证明每个团队都能移除同样的 80%。

该公司表示,缩减 Claude Code 系统提示词并未导致编程评测出现可衡量的性能损失。这种表述留下了几个重要问题尚未解答。

Anthropic 尚未披露用于这项比较的评测任务。读者无法得知该评测套件是否侧重于代码生成、调试、代码仓库导航、测试、文档编写、工具使用或长时间自主执行。

该公司也尚未公布基线分数或置信区间。“没有可衡量的损失”可能意味着结果完全相同、差异在统计上不显著,或变化小到所选基准无法检测。

这一说法针对的是 Anthropic 为先进模型配置的内部 Claude Code 环境。它并不能证明用户可以删除自己 CLAUDE.md 文件、技能或自定义智能体提示词中的 80%,且不会产生后果。

这些文件通常包含组织特定要求,例如构建命令、受监管的工作流、审查标准、依赖策略、部署限制,以及基础模型无法从邻近代码中推断出的约定。

代码仓库也可能包含不一致的模式。要求 Claude 匹配周围代码,只有在周围代码代表目标标准时才有效。当新旧约定并存时,这种做法可能复现技术债。

渐进式披露也带来了自身的失效模式。智能体必须识别何时需要专门的技能或参考资料。如果路由失败,正确的信息虽然存在,却永远无法进入当前上下文。

延迟加载的工具也会形成类似依赖。轻量级描述能节省初始上下文,但必须足够具体,才能让智能体发现正确的能力。命名不佳的工具在实践中可能变得不可见。

上下文压缩让情况更加复杂。当上下文填满时,Claude Code 会总结长对话。Anthropic 的文档称,一些项目指令和记忆会在之后重新加载,而路径范围内的规则可能要等到再次读取匹配文件时才会加载。

因此,在一次会话中,重要信息可能在持久层和瞬态层之间迁移。测试上下文变更的团队应纳入跨越压缩边界的长任务,而不应只测试孤立的编程提示词。

提示词缓存同样影响架构。它会复用稳定的请求前缀,以减少重复计算。Anthropic 表示,Claude Code 会将静态内容置于前面、动态消息置于后面,以保持缓存命中。

该公司的提示词缓存经验警告称,在会话中途更改工具或模型可能使缓存前缀失效。因此,选择性上下文必须在相关性与稳定性之间取得平衡。

Claude Code 的延迟加载策略缓解了部分张力。轻量级工具存根可以保持稳定,而完整架构在后续加载。这种方法既节省上下文,也避免持续改变基础工具集。

不过,更小的系统提示词并不自动保证总上下文使用量更低。智能体可能通过读取更多参考资料、调用更多技能,或花费额外轮次发现指令来进行补偿。

提示词缩减也不能保证行为一致。移除重复指导可能暴露广泛编程评测未能发现的罕见失败。对安全敏感和受监管的团队而言,应测试尾部风险,而非只看平均任务得分。

恰当的回应是开展受控评估。团队可以在具有代表性的代码仓库、固定任务、重复运行和明确定义的失败类别中,对比旧配置和精简配置。

有用的指标包括任务完成情况、非预期文件更改、测试覆盖率、审查发现、工具错误、用户修正以及总上下文消耗。团队还应记录智能体实际加载了哪些指令。

自主性越高,举证责任就越重。逐次监督编辑的开发者可以迅速发现判断错误。无人值守地创建拉取请求或修改生产系统的智能体,则需要更严格的控制和更深入的评估。

Anthropic 的结果最适合被视为提示词债务存在的证据。它不是通用的删除目标,而且该公司尚未在自身模型和测试框架之外独立验证这一发现。

更小的提示词将更多责任转移到智能体架构中

上下文简化并不会消除复杂性。它会将复杂性转移到路由、工具、记忆、评估和权限之中。

这种转移是此次公告最重要的商业影响。过去将提示词视为智能体产品本身的团队,现在需要审视围绕模型的完整系统。

可靠的智能体需要一种识别相关知识的方式。它需要名称清晰、参数表达力强且状态受限的工具。它需要能够将长期偏好与临时会话细节分开的记忆。

它还需要可观察的执行过程。开发者必须能够看到智能体读取了哪些文件、调用了哪些技能、选择了哪些工具,以及哪些指令影响了某项决策。

Claude 5 上下文工程使这些能力更加重要,因为主提示词承载的显式流程更少。如果路由层失败,模型可作为后备的冗余指导也会更少。

Anthropic 的自动记忆功能说明了这种变化。Claude Code 可以保存它认为与工作相关的信息。这降低了将 CLAUDE.md 用作手动维护的记忆库的压力。

不过,自动化记忆带来了治理问题。团队需要知道存储了什么、这些信息是否仍然准确,以及如何解决相互冲突的记忆。即便主提示词很精简,过时的上下文也可能误导智能体。

丰富的参考资料带来了另一种架构转变。Anthropic 表示,Claude 可以处理更复杂的工件,而不再只依赖简单的 Markdown 计划。这扩展了智能体在设计和实现期间可检查的内容。

这种优势取决于可发现性。详细工件只有在智能体知道它存在,并理解何时应查阅它时才有帮助。参考树需要信息明确的名称、简洁的索引和针对任务的入口点。

工具设计成为提示词的一种形式。枚举会传达有效状态。必填参数提示必要信息。权限边界可以阻止无效操作,无论模型如何理解文本说明。

这种方法应会吸引企业买家,因为软件控制比自然语言警告更容易强制执行。权限系统可以阻止一项操作。提示词只能要求模型不要执行它。

然而,接口设计比增加一段文字需要更多工程投入。团队必须建模工作流、处理工具错误、暴露状态,并在模型和产品变化时维持兼容性。

因此,这 80% 的缩减可能会拉大简单演示与生产级智能体之间的差距。更少约束可以让演示看起来更好。生产系统则必须在必要时用更强的架构替代被移除的提示词行为。

这种影响也会延伸到软件开发之外使用 AI 的知识工作者。研究、运营和分析智能体面临相同的上下文问题。大型指令文档常常混合目标、偏好、参考资料和一次性流程。

分离这些类别可以改善检索和维护。稳定的身份和安全规则保持全局可用。领域参考资料在相关时加载。任务流程成为可调用的工作流。临时事实则保留在当前会话中。

这并不意味着每个工作流都需要一个复杂的平台。该原则可以从简短的项目索引、范围明确的参考文件,以及基于重复性工作的测试集开始。

关键是停止将上下文视为一块未经区分的文本。每一部分都应有加载理由、明确范围、责任人,以及测试其价值的方法。

Anthropic 的举措也间接对竞争对手的编程智能体供应商施加压力。用户将越来越多地比较的不只是基准分数,还包括各产品如何管理指令、记忆、工具、压缩和上下文可见性。

原始能力很强的模型仍可能在杂乱的测试框架中表现不佳。工具和任务边界狭窄时,较小模型依然可能有用。智能体竞争正在成为一场系统竞赛。

新兴优势将属于那些让上下文可被检查的产品。用户需要理解哪些内容进入了模型、哪些内容仍被隐藏、哪些内容跨越压缩得以保留,以及不同运行之间发生了什么变化。

Anthropic 已明确其方向。更好的模型应承载更少通用行为规则,而周边系统则在需要之时提供精确的信息。

80% 缩减后值得关注什么

三个信号将表明 Anthropic 的小提示词策略会成为行业规则,还是仍是一种 Claude 专属优化。

第一个信号是独立评估。开发者应关注在真实代码仓库和重复运行中,对早期 Claude Code 系统提示词与精简版本进行受控比较。

有力的证据应包括任务级得分、分布而非平均值,以及针对安全性和非预期变更的明确类别。可比结果将强化 Anthropic 的主张:许多永久规则已经变成提示词债务。

如果不一致行为增加,这一主张就会被削弱。罕见但代价高昂的失败同样重要,尤其是在智能体未经持续人工审查的情况下。最有价值的研究将测试长会话、工具发现和上下文压缩。

第二个信号是其他模型代际如何处理相同上下文。Anthropic 的公告特别提到了 Opus 5 和 Fable 5。团队需要了解 Sonnet 级别、更小或更旧的模型是否同样能适应如此精简的指令。

如果精简配置能跨模型生效,选择性上下文将成为通用的智能体设计模式。如果性能差异显著,团队将需要为每个模型系列维护版本化的提示词和路由策略。

这一结果会让多模型产品变得更复杂。切换供应商或模型规模,不再只是更改一个 API 标识符。每个模型可能都需要在判断、示例、重复和约束之间采用不同的平衡。

第三个信号来自围绕 /doctor、技能、记忆和延迟工具的产品行为。Anthropic 表示,/doctor 可以识别过于臃肿的项目指令和技能。它给出的建议将揭示,该公司希望用户以多大力度进行精简。

值得关注的是,Claude Code 是否会报告哪些规则彼此冲突、哪些文件很少被激活,以及哪些指令重复了内置行为。这类诊断将把提示词清理从主观编辑转变为可量化的维护工作。

还应关注 Anthropic 是否会发布更完整的评估细节。目前的说法缺少任务构成、原始分数和针对不同模型的比较。更高的透明度将帮助团队判断,这一发现是否能迁移到他们自身的环境中。

对开发者而言,眼下要做的并不是不加区分地删除 80% 的内容。应按用途审计指令:保留可执行的安全限制,移除明显重复项,并将专门流程置于清晰的触发条件之后。

随后,应在团队实际执行的工作中测试精简后的配置。测试应涵盖常规编辑、模糊请求、审查任务、代码库约定、工具故障和长时间会话。除了完成情况,也要衡量纠正率。

企业采购方应询问供应商:上下文是如何组装和检查的。更大的上下文窗口并不够。采购方需要能够控制范围、记忆、权限、检索、压缩以及特定模型的行为。

知识工作者也应对持久化 AI 指令采取同样的纪律。稳定的偏好应保持简洁。参考材料应存放在可被检索的位置。避免让每一次未来请求都承载过去的所有经验教训。

Anthropic 关于 Claude 的这一结果之所以重要,是因为它重新定义了“复杂性”。最先进的智能体未必拥有最长的提示词;它可能拥有一套最清晰的系统,能判断模型此刻真正需要什么。

独立测试会复现 Anthropic 的结果,还是会揭示那些被删除的规则仍然重要的任务?未来几个月,这一答案应当指导每一次严肃的 Claude Code 上下文审计。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page