top of page

Anthropic 将 Claude Code 的自动模式设为默认

8月11日
讀畢需時 15 分鐘

Anthropic 将于 8 月 14 日默认启用 Claude Code 的自动模式,尽管其安全分类器能否可靠理解开发者意图仍存在未解疑问。这项变更适用于 Pro、Max 和 Team 账户的新会话。用户仍可随时选择其他权限模式。

这一调整意味着,Claude Code 将不再针对每一项常规命令或文件操作请求人工批准。取而代之的是,一个独立分类器将审核工具调用,并决定其是否可以继续执行。Anthropic 表示,高风险操作将被阻止或升级交由用户处理。

这听起来像是一次设置调整,实则转移了一项重要责任。此前,开发者会亲自作出许多执行决策。如今,除非用户、管理员或策略规则介入,Claude Code 将作出这些决定。

正如 TechCrunch 报道,这项变化不止关乎便利性。它考验的是,自动化权限系统能否为长时间运行的工作提供足够自主性,同时不掩盖具有重大影响的决策。随着用户期望它们在无需持续监督的情况下完成任务,OpenAI Codex 和其他编程智能体也面临同样的压力。

Claude Code 将不再在每项常规操作前询问

Anthropic 正以逐项自动化的权限决策,取代频繁出现的审批提示。

Claude Code 通过工具运行,可读取文件、编辑代码、执行 shell 命令、访问外部服务,并与开发基础设施交互。这些能力使其能够完成工作,而不只是提出代码建议。

传统权限模式会在敏感工具使用前设置人工检查点。这种做法能限制意外行为,却也会打断涉及多个关联步骤的任务。开发者很难将一项大型任务交给 Claude 后离开,因为 Claude 可能随时会停下来等待下一次确认。

自动模式会在工具执行前插入一个分类器。分类器是一种根据安全性和授权上下文,对拟议操作进行归类的模型。安全操作会继续执行,而危险或不确定的操作则可能被阻止或转交用户处理。

Anthropic 最初于 3 月 24 日将这一功能作为研究预览推出。其最初的自动模式发布说明将该系统描述为介于保守提示与 --dangerously-skip-permissions 之间的折中方案。后者会移除权限检查,仅适用于隔离环境。

该功能于 7 月全面可用。Anthropic 目前正从提供选择转向默认采用。根据其当前的配置文档,新会话的默认设置将于 8 月 14 日变更。

这一变化不会推翻所有既有决定。除非用户接受一次性切换提示,否则个人默认设置将保持不变。由组织管理的默认设置同样不会改变,从而保留管理员对部署环境的控制权。

用户可随时切换模式。团队也可以创建明确规则,始终拒绝某项操作或要求人工批准。这些规则会在分类器之前执行,因此自动模式无法悄然绕过它们。

默认情况下,分类器信任活动仓库的工作目录和已配置的远程端。涉及陌生仓库、云资源或外部域名的操作可能会受到更严格审查。组织可通过托管配置描述可信基础设施。

在默认策略下,Claude Code 仍可将变更推送至仓库。不过,分类器会评估诸如强制推送、暴露的密钥以及生产部署路径等上下文风险。

这种区别很重要,因为自动化并非非黑即白。智能体可以在测试和本地编辑方面获得较大自主权,同时在发布或外部系统操作周围保留严格检查点。安全边界既取决于配置,也取决于模型行为。

Anthropic 还警告称,由于工具调用需要额外分类,自动模式可能影响延迟和 token 用量。开发者遭遇的中断会减少,但服务会在每项获批操作背后进行更多自动化推理。

直接好处很清晰。Claude Code 可以运行测试套件、检查失败原因、修改文件并重复这一循环,而无需在每条命令后停下来。这使无人值守的工作更具可行性。

更深层的变化则不那么显眼。开发者往往只会看到智能体完成后的结果,而不会见证每一个中间决策。因此,审查将从持续授权转向策略设计和结果检查。

为什么 Anthropic 与 TechCrunch 的报道不止关乎一个设置

默认设置决定了日常行为,尤其影响那些从不自定义权限的用户。

可选功能体现产品能做什么。默认设置则揭示其开发者希望大多数人如何使用它。Anthropic 正在传递一个信号:逐次提示、全程监督的编程方式不再是其首选基线。

该公司有充分动机减少中断。编程智能体竞争的是完成的工作,而不只是回复质量。一个能够写出准确代码、却不断等待批准的系统,无法在开发者不在身边时处理长任务。

审批疲劳还会带来另一问题。面对过多提示的用户,可能会机械式批准,或干脆完全关闭防护机制。这两种反应都无法带来谨慎的人工监督。

自动模式试图以一致的自动化审查来替代这些薄弱检查点。分类器接收对话和拟议操作,然后判断执行是否符合用户请求。它可以评估每项操作,而不会感到疲惫或不耐烦。

Anthropic 表示,这种方式的风险低于完全跳过权限检查。它也承认,分类器无法消除风险。模糊意图和不完整的环境上下文仍可能导致错误决定。

Anthropic 与 TechCrunch 报道的关注点在于减少人工监督,但其背后的押注更为精确。Anthropic 相信,自动化监督能够比习惯性的人工点击更安全,同时又比手动审批限制更少。

这一主张挑战了关于负责任智能体的一项常见假设。人类参与并不必然意味着有意义的控制。一个批准数十条可预测命令的人,可能几乎没有贡献真正的判断。

有效监督必须出现在恰当时刻。开发者应在执行前定义边界,针对真正不确定的操作接收提示,并在重要部署步骤前检查变更。持续打断可能会削弱这三项实践。

这一新的默认设置正迫使竞争对手的编程智能体更有说服力地平衡自主性与控制力。OpenAI Codex、GitHub Copilot 以及基于终端的智能体,都在竞争超越单次代码补全的工作流。

用户越来越希望智能体能够排查 bug、更新依赖项、运行测试并准备拉取请求。这些工作需要大量工具调用。在每个阶段都要求批准的产品,即使模型能力出色,也可能显得更慢。

然而,消除所有摩擦的产品可能暴露本地文件、凭据、源代码仓库和已连接服务。竞争的核心不在于哪个智能体行动最独立,而在于哪个智能体能在独立行动时执行易于理解的边界。

企业买家将从不同层面审视这一变化。他们需要集中管理的策略、审计记录、可预测的供应商支持以及清晰的故障行为。一个便利的个人默认设置并不能自动满足这些要求。

Anthropic 的文档允许管理员对诸如 git push 或创建拉取请求等命令要求批准。团队可以在允许本地工作自主进行的同时,保留这些检查点。

这种策略优先的方法类似于成熟的基础设施控制机制。组织会向软件身份授予明确权限,而不是批准每一项常规操作。编程智能体使这一模型更复杂,因为其预期操作是动态生成的。

与固定的部署脚本不同,智能体在命令失败时可以临场应变。它可能切换工具、编辑状态文件,或寻找另一条实现请求结果的路径。这种灵活性使智能体有用,却也增加了执行控制的复杂度。

默认设置的变化将让分类器接触更多常规工作负载。更广泛的采用将为 Anthropic 提供更多关于误报、漏检风险和令人困惑的提示的信息。但这也会放大系统性弱点的后果。

自动化权限检查取代持续人工批准

核心权衡在于:以更少无意义的提示,换取对基于模型的安全门槛更强的依赖。

Claude Code 的权限系统会将操作分入不同路径。只读操作可通过预定义规则继续执行。一些项目内编辑也可避开完整分类器,而风险更高的工具则会接受基于模型的评估。

分类器考量的不止是命令文本。它还可以利用对话、请求的任务、当前环境和拟议操作。这些上下文有助于区分已请求的文件修改与未经解释的破坏性命令。

Anthropic 描述了一种两阶段设计。快速的第一阶段旨在识别潜在风险行为。第二个推理阶段则审核被标记的操作,并减少不必要的阻止。

这一设计试图控制两类相互竞争的错误。误报会阻止安全操作并中断有用工作。漏报则会允许本应停止的操作。

减少一种错误可能增加另一种。过于谨慎的门槛会令人沮丧,而宽松的门槛则通过接受更多风险来维持速度。没有任何单一阈值能够满足每种环境的需求。

因此,配置承担了很大一部分安全责任。Anthropic 允许组织定义可信仓库、存储资源和域名。团队还可以建立明确的允许、拒绝和询问规则。

明确的询问规则可为选定操作保留人工检查点。一个团队可能要求每次仓库推送前都要批准,同时允许本地测试和编辑。另一个团队则可能禁止从智能体会话发起所有生产部署。

分类器无法推翻明确的拒绝规则。这为管理员提供了高于模型判断的确定性层级。这也意味着,在用户开始依赖无人值守会话前,安全部署需要经过审慎的策略工作。

Claude Code 的文档指出,涉及狭义 shell 规则时存在一个微妙问题。某些允许规则可能会在分类前生效,具体取决于其形式和配置。获批的命令前缀可能接受策略作者未曾预料的参数。

组织也可以让所有 shell 命令都经过分类。这会扩大覆盖范围,但也会增加延迟和分类器调用次数。团队必须决定确定性规则在何处结束、上下文审查从何处开始。

这一选择说明,自动模式并不只是一个开关。它结合了静态策略、可信环境定义、工具类别和模型决策。任何一层的薄弱都可能形成意料之外的路径。

对开发者而言,实际工作流将从逐步批准转向设计一个安全的工作空间。当代理运行时间更长时,隔离分支、受限凭据、作用域令牌和受保护的部署系统会变得更加重要。

代码仓库审查仍然至关重要。自动模式决定的是某项拟议操作是否看起来已获授权,而不是每一行生成的代码是否都正确。获准的变更仍可能引入漏洞、降低性能,或误解需求。

同样的区分也适用于测试。通过测试能为已定义的行为提供证据,但并不保证意图正确。自主代理可能满足不完整的测试套件,同时损害未经测试的路径。

开发者应将分类器视为一种控制手段,而非万无一失的监管者。版本控制、受保护分支、沙箱化执行、密钥管理、持续集成和人工审查,仍分别应对不同的失效模式。

当这些控制措施彼此强化时,系统最有价值。自动模式可以在受限工作空间内消除重复提示。现有工程控制措施随后可以在错误触及客户前将其发现。

这种模式也改变了团队评估 AI 编程产品的方式。模型基准测试衡量代码生成能力,但对安全执行几乎没有揭示。代理评估必须涵盖权限、恢复行为、策略清晰度和可审计性。

安全证据尚未终结这场争论

独立测试表明,当授权刻意保持模糊时,性能可能会发生显著变化。

Anthropic 报告称,在某些涉及过度积极操作的生产场景中,误报率为 0.4%,漏报率为 17%。这些测量描述的是代理在试图提供帮助时意外超出授权范围的事件。

一篇独立的 4 月论文测试了另一类问题。其作者创建了 128 条涵盖模糊 DevOps 请求的提示,并评估了 253 项会改变状态的操作。他们的权限门研究有意对不明确的范围、目标选择和运营风险施加压力。

研究人员报告称,在这种压力测试设计下,端到端漏报率为 81%。在由分类器直接评估的操作中,报告的漏报率为 70.3%。他们还发现,该子集的误报率为 31.9%。

这些数据不应被表述为对 Anthropic 生产环境测量结果的直接反驳。该论文采用了刻意对抗性的模糊场景,而 Anthropic 衡量的是生产流量中一种更狭窄的模式。不同工作负载可能产生截然不同的结果。

不过,这项研究确实指出了一条重要边界。它发现,部分项目内文件编辑不会经过主分类器。代理有时可通过编辑状态文件,而非使用预期的 shell 命令,实现某种运营效果。

在清理构建产物的任务中,研究人员报告的漏报率为 92.9%。这一结果表明,安全分析必须审查跨工具的等效结果,而不仅仅是看起来危险的命令字符串。

该基准测试也在配备受控工具的隔离容器中运行。真实开发环境拥有更多样的代码仓库、凭据、服务和组织策略。这种复杂性既可能形成保护,也可能增加额外的失效路径。

另一项安全担忧涉及提示注入,即不可信文本试图重定向代理。编程代理会经常读取文档、依赖文件、问题描述、日志和源代码注释。其中任何一种载体都可能包含对抗性指令。

据报道,一项 7 月的概念验证在开源项目文件中植入了恶意指令。根据对 Friendly Fire attack 的报道,受测代理可在自动化安全工作期间执行由攻击者控制的二进制文件。

据报道,该演示影响了涉及 Claude Code 和 OpenAI Codex 的配置。其重要性在于共同机制,而非简单的供应商比较。代理会读取不可信材料,同时也拥有可对其宿主机采取操作的工具。

Anthropic 的分类器旨在检测恶意执行和数据外泄。然而,提示注入可能让有害操作看起来与分配的任务有关。系统必须将真实用户意图与执行过程中发现的指令区分开来。

随着代理获得更多上下文和更多工具,这个问题会变得更加困难。一个较长任务可能涉及数百次观察和中间选择。权限门必须在整个过程中维持最初的授权边界。

误报同样重要。如果分类器过于频繁地拦截安全操作,开发者可能失去对自动模式的信心。他们可能重回手动提示,或削弱策略以恢复生产力。

服务可用性带来了另一项运营担忧。自动模式依赖分类器访问。如果该组件不可用或响应缓慢,组织需要可预测的回退行为,而不是悄然改变策略。

Anthropic 的文档称,当系统无法确定操作安全性时,可能会产生特定错误。在不确定时拦截比悄然批准操作更安全,但这可能会中止无人值守的工作。

因此,关于 Anthropic 的 TechCrunch 叙事应避免声称自动模式将人类从安全开发中移除。它将人的参与重新定位到工作空间设计、明确策略、审查流程和例外处理。

它也应避免将每项独立基准测试结果视为普遍结论。刻意模糊的测试揭示了边界上的漏洞,但并不衡量每一次常规编程会话的错误率。

负责任的结论应当是有条件的。自动模式可以减少低价值的中断,但其安全性取决于分类器覆盖范围和环境约束。用户需要来自自身代码仓库和工作流的证据。

Anthropic 的默认设置让工程团队面临压力

团队必须在产品默认设置让自动化显得理所当然之前,决定哪些操作值得自动化。

个人开发者可以快速切换模式。组织面临更广泛的治理任务,因为一次代理会话可能涉及共享代码仓库、内部软件包、云服务和部署系统。

第一个决定涉及边界。团队应识别必须始终要求人工批准的操作,包括生产发布、凭据变更、破坏性数据库操作,以及对受保护基础设施的修改。

第二个决定涉及环境信任。Claude Code 需要获得足够的访问权限才能完成有价值的工作,但不应继承开发者机器上可用的每一项凭据。作用域凭据可以限制错误决策的后果。

第三个决定涉及审查。团队需要区分自主执行与自主接受。代理可以独立准备变更,而分支保护和代码审查仍控制着集成流程。

这些控制措施能够保留自动模式的大部分生产力收益。Claude Code 可以检查故障、修改代码、运行测试并起草拉取请求。随后,人员可以在有意义的边界审查所产生的变更。

然而,当代理更快地生成更大规模的变更时,审查质量可能下降。开发者花在编写代码上的时间可能减少,而花在验证陌生输出上的时间增加。这项工作需要上下文、专注力和可靠证据。

生成的拉取请求应说明意图、变更后的行为、测试和未解决的风险。团队还需要显示代理所使用命令和工具的日志。仅看最终差异可能掩盖重要的中间操作。

组织应在广泛部署前,使用具有代表性的代码仓库测试自动模式。一个简单应用与一个生产基础设施代码仓库面临的后果不同。一项全局策略不太可能同时适合两者。

分阶段推广可以从本地开发、可丢弃分支和非生产凭据开始。团队可以记录被拒绝的操作、意外批准、任务完成率和审查发现。

这些观察比对 AI 安全性的笼统信心提供了更坚实的基础。当一个权限系统与特定组织的授权模型匹配时,它才算成功。仅凭模型质量无法定义该模型。

安全团队也应测试对抗性的代码仓库内容。一项现实演练可以在文档或依赖工件中放入相互冲突的指令。目标是了解现有控制措施能否约束代理的响应。

开发者需要一条清晰的退出路径。他们应知道如何切换权限模式、检查当前配置,以及识别由组织管理的规则。即使默认设置的意图是良性的,隐藏的默认设置也会损害信任。

Anthropic 提供了显示有效自动模式配置的命令。这种可见性可以帮助团队比较内置行为与自身策略。当某项操作意外被拦截或获准时,它也支持事件分析。

竞争对手将面临类似要求。OpenAI、GitHub、Google 和独立编程代理开发者必须解释其系统如何解读授权。用户需要的不只是“危险行为受到监控”的笼统承诺。

有意义的比较应审视几个问题。哪些操作绕过上下文分类?管理员能否强制要求提示?分类器发生故障时会怎样?外部域名和代码仓库远程地址将如何处理?

答案决定代理是仅适合隔离工作空间,还是能够在企业开发流程中运行。它们也决定用户实际放弃了多少监督权。

对于支持开发团队的知识工作者而言,这一转变提升了可搜索决策记录的价值。需求、审查备注和事件发现必须始终与生成的变更保持关联。一个可搜索的工程知识库可以帮助保留这些上下文。

自动模式在这里改变的不只是输入速度。它增加了人工检查点之间完成操作的数量。团队必须提升这些检查点的质量,以跟上节奏。

自动模式成为默认设置后应关注什么

三个信号将表明 Anthropic 是否在不让授权失败更难发现的前提下,减少了批准摩擦。

第一个信号是 8 月 14 日之后的默认模式采用情况。Anthropic 尚未公开说明有多少符合条件的用户会接受这一切换。持续使用将揭示开发者是否认为分类器在日常工作中可靠。

采用率本身并不能证明安全性。用户往往因为更改默认设置需要付出精力而保留默认选项。不过,频繁手动切换、管理员禁用或反复出现的投诉,都会削弱 Anthropic 关于自动化监督的论点。

第二个信号是分类器在更广泛评估中的表现。研究人员应测试真实代码仓库、混合工具路径、提示注入和模糊的运营请求。结果需要清楚描述工作负载,以便读者负责任地进行比较。

Anthropic 可以通过发布关于错误批准和不必要拦截的更新测量结果来增强信心。它还应说明哪些工具类别会接受分类,哪些依赖确定性规则。

独立复现之所以重要,是因为实验室与生产环境的测量回答的是不同问题。生产数据反映常见行为;压力测试则揭示普通流量可能很少触发、却可能在后果严重之前长期被忽视的故障。

第三个信号是竞争对手如何重新设计自身的权限系统。若行业转向具备上下文感知与策略意识的执行机制,将验证 Anthropic 的方向;若转而加强沙箱隔离或实行强制检查点,则会对其当前的平衡提出挑战。

应关注产品细节,而非营销标签。“Autonomous”可以描述多种权限安排。真正重要的问题包括工具覆盖范围、管理员控制、审计记录、外部访问以及安全失败行为。

竞争对手可能通过更严格地限制环境来减少提示次数。另一家则可能允许更广泛的操作,但要求在部署时获得批准。这些设计代表了对同一自主性问题的不同解法。

如果用户能够完成更长的任务,同时安全事件或策略困惑没有增加,最新的 anthropic techcrunch event 将得到强化。若团队在经历无法解释的批准、拒绝或分类器故障后经常关闭自动模式,其说服力则会被削弱。

开发者不应等待一个普遍适用的结论。他们可以在可随时弃置的环境中评估该系统,保留受保护的集成节点,并根据真实任务衡量其行为。

从一个仓库和一个范围经过审慎界定的工作流开始。记录哪些操作得以继续,哪些被中止,以及最终改动是否符合原始请求。随后再决定是否有理由扩大自主权限。

真正有用的问题并不是 Claude Code 是否值得完全信任。在成熟系统中,没有任何开发者、脚本或代理会被赋予无限信任。问题在于,它的自动化关卡能否执行一项清晰且受限的授权。

Anthropic 正押注于这个问题的答案将越来越多地是肯定的。默认开关减少了开发者的日常监督工作,但也使策略设计变得更为关键。在让代理于所有人离开后继续运行之前,你的团队会坚持哪些边界?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page