Anthropic Claude 自我改进正在加速,但目的地仍由人类选择
Anthropic 表示,Claude 目前主导了其 26% 的模型研究与开发工作,而在 2026 年 2 月,这一比例还是零。这一迅猛增长让 Anthropic Claude 自我改进不再只是一个引人争议的口号。该公司称,其模型能够根据高层级提示完成大型任务,但仍由人类监督工作过程。
这一披露将人们熟悉的编程趋势推向了影响更深远的领域。Claude 不再只是协助工程师构建应用程序,它正越来越多地编写基础设施、运行实验、分析结果,并审查用于开发未来 Claude 模型的变更。
Anthropic 将这一进展称为迈向递归自我改进:AI 系统参与构建能力更强的后继系统。但其证据也揭示了仍然存在的障碍。Claude 能够迅速执行已定义的工作,而人们仍决定哪些问题重要,以及结果是否值得信任。
这种区别使 Anthropic 的说法介于两种相互竞争的解读之间。一种认为,这是一个会随每代模型不断加速的复合式开发循环。另一种则认为,这是在人类仍掌控的研究议程中运行的高级自动化。
Anthropic Claude 自我改进现已延伸至模型研发
关键变化不在于 Claude 会写代码,而在于 Claude 如今主导了其后继模型开发工作的实质性部分。
Anthropic 于 2026 年 9 月 17 日披露了 26% 这一数字。该公司将“主导”定义为:根据高层级提示完成一项任务的大部分工作,同时继续接受人类监督。据该公司称,Claude 在 2 月尚未主导任何被衡量的研发工作。
到 8 月,这一比例已达到约四分之一。Anthropic 还表示,目前约 90% 的模型研发工作都涉及与 Claude 协作。在这一更广泛的类别中,模型在密切的人类指导下完成大部分工作。
这两个数字衡量的是不同层级的委派。90% 的数字包括人类仍深度参与的工作;26% 的数字则涵盖 Claude 在接收目标后,对执行承担更大责任的任务。
这一区别很重要,因为两个数字都不意味着 Claude 能够独立运作。模型不会选择 Anthropic 的企业目标、批准自身部署,或控制完整训练流程。人类研究人员仍负责界定问题、分配资源、审查结果,并授权具有重大影响的决策。
不过,这一变化的速度异常之快。最初披露称,Claude 在六个月内从零主导份额升至 26%。相比当前比例本身,正是这一轨迹解释了外界的关注。
Anthropic 将前沿模型开发分为工程和研究。工程包括编写软件、维护基础设施以及监督训练系统。研究则包括选择实验、解读结果,以及决定哪些想法值得进一步测试。
Claude 已深度参与这两个类别。在工程任务中,Anthropic 表示,人们越来越多地只提供目标,而不规定每一个实现步骤。在研究任务中,Claude 能够执行定义明确的实验,并建议后续行动。
一个具体事件说明了普通代码补全与受委派工程工作之间的区别。一次常规升级开始导致数以万计的训练任务崩溃。一名工程师向 Claude 提供了背景信息和受影响集群的访问权限。
Claude 测试环境设置,定位到一个鲜为人知的调试标记,复现故障,并确认了修复方案。Anthropic 表示,调查耗时约两小时。该公司估计,人类工程师通常需要两到三天。
这不是自主创建模型。但它仍然意义重大,因为训练基础设施会直接影响实验室测试和改进模型的速度。将数天的调试压缩至数小时,能让研究人员获得更多运行实验和修正故障的机会。
因此,该公司的研究说明描述的是人类角色的收窄,而非其消失。Claude 越来越多地负责实施和实验;人们则保留对方向、评估和发布决策的权力。
这一边界界定了核心张力。Anthropic 展示了 AI 开发内部快速自动化的证据,同时也记录了防止该过程变成自我导向的人类判断。
编程数据说明了 Anthropic 为何拉响警报
当代码生成、审查和实验开始相互强化时,Claude 的贡献就变得更具影响力。
Anthropic 表示,截至 2026 年 5 月,Claude 编写了其代码库中超过 80% 的已合并代码。在 Claude Code 于 2025 年 2 月进入研究预览之前,这一比例仍处于个位数低位。
该公司还报告称,工程产出大幅增加。2026 年第二季度,其普通工程师每天合并的代码量是 2024 年的八倍。Anthropic 将其中很大一部分增长归因于工程师指导和审查 Claude,而非亲自输入每一处变更。
代码行数并不是完美的生产力指标。更多代码可能带来维护成本、重复已有功能,或掩盖糟糕设计。Anthropic 明确承认,八倍增长几乎肯定夸大了真实的生产力提升。
不过,产出量只是其论据的一部分。Anthropic 表示,Claude Code 会话中的人工干预率已经下降。据报道,与一年前相比,工程师更少需要纠正、重新引导模型,或接管其工作。
在 Anthropic 最开放式的工程任务中,Claude 报告的成功率于 2026 年 5 月达到 76%。这意味着六个月内增加了 50 个百分点。一个基于 Claude 的评估器判断各会话是否无需修正便完成了被分配的任务。
这种方法值得谨慎看待。由内部模型评判另一模型,并不能提供与独立评估相同的保证。任务构成也可能随时间变化,使不同月份成功率之间的比较更复杂。
尽管如此,Anthropic 报告称,到 2026 年期间,公司内部 Claude 编写代码的质量已接近人类编写代码的水平。员工观点并不一致。该公司表示,许多员工在 2025 年末认为 Claude 的代码较差,但到 2026 年年中已认为其大致相当。
自动化审查为这一循环增加了另一层。Anthropic 现在使用 Claude 检查拟议代码变更中的缺陷和安全弱点。一项公司回顾性分析发现,这类审查本可以检测出导致早期生产事故的约三分之一漏洞。
这形成了一个两端都有 AI 参与的开发循环。一个 Claude 会话编写或修改代码;另一个会审查拟议变更。人类检查结果,决定其是否应进入生产环境,并调查自动化检查意见不一致的情况。
这种模式并不局限于编程。Anthropic 曾在一项优化任务上测试模型,该任务涉及训练小型 AI 系统的代码。目标是在不违反预定正确性检查的前提下提升速度。
Anthropic 表示,Claude Opus 4 在 2025 年 5 月实现了平均三倍加速。到 2026 年 4 月,一个名为 Mythos Preview 的内部模型实现了约 52 倍加速。该公司称,熟练的人类研究人员通常需要四到八小时才能实现四倍提升。
这些数字说明了 Anthropic 为何将这一趋势描述为加速,而非简单自动化。更快的实施意味着可以进行更多实验;更多实验会产生额外证据,从而指导后续模型和工具的设计。
该公司自身数据仍是这些主张的主要来源。尚无外部审计机构复现其内部任务标签、成功判断或生产力计算。读者应将所报告的趋势视为有意义的证据,而非已被独立确立的进步规律。
即使存在这一限制,其发展方向仍难以忽视。Claude 已从提出代码片段,发展到编辑代码库、操作工具、调试在线系统以及运行实验循环。每一步都将 AI 开发的另一部分从人工执行转移为受监督的委派。
真正的瓶颈正从执行转向判断
Claude 正在降低开展研究的成本,但尚未消除决定哪些研究值得开展的需求。
Anthropic 最有力的证据涉及执行。只要向 Claude 提供可衡量的目标、相关工具的访问权限,以及测试结果的方法,模型就能探索许多可能的解决方案。这让研究实施成为一个更快的迭代过程。
更困难的问题是确定方向。研究人员必须选择能够推进能力、改善安全性或解决重要不确定性的问题。他们还必须识别误导性的基准、受污染的评估,以及只在狭窄条件下有效的解决方案。
Anthropic 将研究品味描述为人类持续拥有的优势。这包括选择有价值的问题、决定哪些证据可信,以及放弃已走入死胡同的方法。这些选择塑造了整个开发过程。
该公司测试了 Claude 是否能在现实调查中建议更好的下一步。研究人员选取了 129 个时刻:在此前的工作中,人类曾在这些时刻作出无效绕行。随后,不同 Claude 模型提出了下一步应采取的行动。
另一个 Claude 模型将这些建议与最终结果进行比较。据报道,在 2025 年 11 月,Anthropic 的 Opus 4.5 在 51% 的案例中优于原始人类选择。Mythos Preview 在 2026 年 4 月达到 64%。
这一结果表明战术判断正在改善,但并不能证明独立的研究领导能力。Anthropic 有意选取了原始人类决策存在改进空间的时刻。一个能够访问完整会话记录的模型也担任了评估器。
因此,该实验衡量的是 Claude 能否在选定的决策节点中导航。它并未表明 Claude 能够定义一项研究计划、认识其更广泛的后果,或决定何时应部署新模型。
另一个项目测试了 AI 安全研究中更广泛的自主性。多个 Claude 智能体研究较弱模型能否监督较强模型。它们生成假设、运行实验、共享发现,并调整方法。
Anthropic 表示,两名人类研究人员在约一周内弥合了弱监督与强监督之间差距的约 23%。这些智能体则通过累计 800 小时工作和大量计算资源,弥合了 97%。
但该公司也指出了重要限制。人类选择了问题并设计了评分系统。结果未能顺利迁移至生产规模模型。这些保留条件将令人印象深刻的实验循环与自主科学发现区分开来。
同样的模式也出现在日常使用 Claude Code 的过程中。Anthropic 的使用情况分析发现,在一次典型会话中,用户大约做出 70% 的规划决策,而 Claude 则做出约 80% 的执行决策。
这种分工比“AI 自我构建”的说法更清晰。人们通常决定应该发生什么;Claude 则越来越多地决定如何执行指令,有时会经历漫长的文件读取、代码编辑、测试和命令执行链路。
领域专业知识依然重要,因为必须有人能够识别看似合理但实际错误的结果。会计师可以凭借对会计规则的理解来指导对账脚本。基础设施工程师则能够判断某个拟议修复方案是否会带来不可接受的运营风险。
随着执行成本降低,判断力变得更有价值。研究人员可以监督更多实验,但也会面对更多需要评估的输出。瓶颈并未消失,而是发生了转移。
这一变化影响着技术团队组织工作的方式。编写代码在工作中所占的比重变小,而需求定义、审查、系统设计、验证和责任承担所占的比重变大。
Anthropic 自身的招聘评估也遇到了这一转变。该公司表示,即使 Claude 能完成常规编程测试,性能工程师仍需处理复杂的调试和设计决策。其评估发现显示,当 AI 能完成机械性的部分时,具有代表性的评估会变得更困难。
实际挑战在于:当人们较少亲自实施时,如何保持专业能力。审查者需要具备足够的理解力来发现隐蔽错误。但持续委派任务也可能减少培养这种理解力所需的实操经验。
这正是 Anthropic Claude 自我改进尚未解决的人类层面问题。更快的模型可以扩大每位研究人员所能监督的范围,也可能让研究系统变得更难由任何一个人完全理解。
Anthropic 的主张给每家前沿 AI 实验室施压
如果 Anthropic 的测量结果在方向上正确,竞争实验室就必须同时匹配这种加速能力及其透明度。
OpenAI、Google DeepMind、Meta 和其他前沿开发者都在内部使用 AI 编程工具。它们的具体方法和委派程度不同,但都面临同样的竞争激励:能够运行更多有效实验的实验室,可以更快地改进模型。
Claude 被报告的贡献为 Anthropic 带来了潜在的反馈优势。更好的模型能承担更多工程工作;这些工作改善基础设施和实验流程,进而帮助产出下一代模型。
这一过程无需完全自主,也能在竞争中产生影响。人类研究人员可以继续选择目标,而 AI 则成倍提升其执行能力。Anthropic 将此称为复合式加速,即使尚未形成完全闭合的自我改进循环。
这种动态迫使竞争对手更积极地部署智能体。当另一家公司能测试更多想法、更快修复基础设施,并缩短模型迭代之间的时间时,等待完美可靠性会带来机会成本。
由此产生的竞争带来了治理问题。每家实验室都掌握着显示模型开发自动化程度的内部证据。外部人士很难跨公司比较“协作”“领导力”、任务成功率、代码质量或研究人员生产力。
Anthropic 一直敦促其他开发者公布可比较的测量结果。它认为,共通的方法有助于公众理解实验室距离递归式自我改进还有多远。定期报告也可能揭示当前增长曲线是持续还是趋于平缓。
这则报道所述的公告发布之际,Anthropic 的领导层也在呼吁放缓前沿 AI 开发。这种组合带来了无法回避的矛盾。
Anthropic 一边借助 Claude 加速自身研究,一边警告这种加速可能变得难以控制。竞争压力有助于解释为何该公司不会简单地停止使用这项技术。
单方面克制可能会让谨慎的实验室落后,却无法放缓整个领域。协调一致的标准能够减少这种劣势,但这需要经济和战略利益各异的公司与政府达成共识。
因此,这种披露服务于多重目的:向公众提供信息、强化 Anthropic 的安全论证,并宣传 Claude 的能力。这些目标可以共存,但读者应当认识到其中每一个目标。
竞争对手也有理由质疑 Anthropic 的框架。高比例的 AI 编写代码并不能直接衡量模型智能。代码量几乎无法说明 Claude 是提出了有价值的研究想法,还是仅仅实现了详细规格。
不同实验室可能会以不同方式归类工作。一家公司可能将智能体主导的调试会话标为研究领导力;另一家公司则可能将同一任务视为人类研究人员使用的工程工具。
共享的测量标准需要区分规划、执行、验证和授权,也需要独立审计。没有这些控制措施,公司可能会发布令人印象深刻、却仍无法比较的百分比。
更广泛的压力也延伸至模型实验室之外。企业工程负责人会问,Anthropic 的内部工作流是否适用于他们。许多企业将追求类似系统,把编程智能体与代码仓库、测试、部署工具和运营数据连接起来。
答案取决于验证质量。Anthropic 开发模型,并雇佣能够审查异常故障的专家。缺乏可比专业能力的公司,可能会比提升代码评估能力更快地实现代码生产自动化。
因此,AI 生成的输出可能会扩大组织之间的差异。拥有强大测试、文档、可观测性和审查实践的团队,可以更安全地委派任务。基础薄弱的团队则有以更高速度产出错误的风险。
这也是为什么可检索的机构知识背景很重要。智能体需要访问需求、既有决策和技术约束。维护良好的 AI knowledge base 能帮助人们审查委派工作背后的推理,尽管它无法取代技术验证。
对于企业买家而言,Anthropic 的公告并不是要求自动化一切。它表明,AI 辅助开发正从个人建议转向受监督的工作流。竞争问题关乎组织能够验证多少责任,而不只是能够委派多少任务。
Anthropic 的数据仍未证明什么
Anthropic 展示了迅速扩大的辅助能力,但尚未证明模型能够独立设计、训练并批准其继任者。
“自我构建”这一说法压缩了多种不同活动。编写应用代码不同于选择模型架构。运行实验不同于决定其结果是否支持一项重大的训练投入。
根据 Anthropic 的说法,Claude 在这一范围内承担了有意义的工作。然而,人类仍然提供目标、评估标准、基础设施访问权限和发布授权。这些控制措施意味着当前过程尚不能被认定为完全递归式自我改进。
测量质量也是一个担忧。大多数核心数据来自 Anthropic 的内部系统。该公司创建了任务类别、收集了会话,并通过基于 Claude 的评审器评估了许多结果。
模型评审器可以一致地处理大型数据集,但也可能继承其所评估系统的盲点。一次会话或许因测试通过而被视为成功,却在测试范围之外引入了维护、安全或架构问题。
代码归属同样存在歧义。在经过大量人工规划后,Claude 可能生成整个文件;另一种情况下,研究人员可能只提供简短目标,而模型自行决定实现方式。两类文件都会被算作 AI 编写,尽管它们代表不同程度的独立性。
八倍产出这一数字衡量的也是已合并代码,而非经过验证的经济价值。生成更多代码的工程师可能解决更多问题,也可能制造更多审查工作,以及维护成本更高的大型系统。
独立研究提供了有用背景,但无法证实 Anthropic 的内部主张。一篇 2026 年的工作论文考察了 780 万次 Claude 协作编写的提交记录,以及由 5,838 名开发者组成的样本。该研究将采用 Claude 与跨更多代码仓库和技术开展工作联系起来。
其开发者研究表明,编程智能体可以扩大人们尝试的任务范围。但公开的 GitHub 活动无法衡量 Anthropic 的内部模型研究,也无法证明递归式改进。
可靠性也因任务而异。具有清晰测试的结构化问题更有利于自动化迭代。开放式研究问题往往缺乏客观评分,因此看似合理但薄弱的结论可能存留更久。
算力和物理基础设施带来了更多限制。更快的智能体可以提出并运行更多实验,但训练前沿模型需要芯片、能源、网络容量和经过审慎管理的数据。智能并非唯一稀缺资源。
随着输出增长,人工审查可能成为瓶颈。如果 Claude 生成变更的速度超过专家审查的速度,Anthropic 就必须放慢部署,或更严重地依赖自动化评估。
这会形成循环验证问题:Claude 编写代码,另一个 Claude 审查代码,而基于 Claude 的系统判断任务是否成功。人类专家仍是最后的保障,但随着自动化链条变长,其可见性可能下降。
安全风险进一步提高了利害关系。拥有代码仓库、集群和命令访问权限的智能体可以解决复杂的运营问题。同样的访问权限也会放大错误推理、被篡改的上下文或遭操纵指令所带来的后果。
采用类似工作流的组织需要严格的权限、完整的日志、可复现的测试和清晰的升级路径。无论代码由谁生成,它们也需要有人对生产环境变更持续负责。
Anthropic 本身并未声称 Claude 已跨越自主性门槛。其更站得住脚的论点是,距离正在缩短。工程执行已高度自动化,而研究判断力则显示出早期但有限的提升。
这一主张本身已足够重要,无需夸大。一个系统不必成为独立科学家,便能改变 AI 开发的速度和经济性。
三个信号将表明这一循环是否真正闭合
下一阶段取决于研究领导力、独立验证以及人类对重大决策控制权的可衡量变化。
第一个信号是 Claude 在模型研发领导力中所占的比例。Anthropic 报告称,该比例从 2026 年 2 月的零上升至 8 月的 26%。未来披露应显示这条曲线是继续上升、趋于平稳,还是出现逆转。
如果这一比例持续上升,特别是在任务规格更少的情况下,将强化复合式加速的论点。若趋于平稳,则表明实施能力的提升快于研究判断力。若出现下降,则可能意味着测量方式变化、任务难度增加或可靠性问题。
领导力的定义必须保持稳定。否则,更高的百分比可能反映的是工作被重新分类,而非独立性增强。Anthropic 应当发布涵盖工程、实验、解读和战略规划的示例。
第二个信号是独立复现。外部评估者需要获得具有代表性的任务、评分标准和结果,同时无需接触敏感的模型开发机密。跨实验室的可比测试,比孤立的公司百分比更具参考价值。
复现研究应检验代码质量随时间的变化,而不只是任务是否完成。它应衡量缺陷、安全问题、维护负担以及人工干预的频率。研究任务则应测试,智能体是否能在看到最终结果之前选择富有成效的方向。
独立证据可能强化,也可能削弱 Anthropic 的说法。不同评估者和环境中出现相似结果,将支持能力发生广泛转变的主张。若差距很大,则表明内部工作流程或评估选择推动了大部分报告中的性能表现。
第三个信号是,随着产出增长,Anthropic 如何处理人工监督。该公司已经指出,审查可能成为潜在瓶颈。其应对方式将揭示人类是否仍保有实质控制权,还是越来越多地通过自动化摘要批准决策。
留意审查要求、访问控制、部署流程和事件报告方面的变化。还应关注 Claude 是否开始选择研究目标,而不只是负责落实这些目标。
真正实现闭环,需要的不只是更高的代码署名比例。Claude 还需要提出有价值的研究方向、设计可信的评估方法、解读模糊证据,并在有限人工指导下改进其后继版本。
即便如此,授权仍与能力是两回事。一个模型或许在技术上已能够主导更多研究,但 Anthropic 仍可能有意保留人工审批。治理选择将决定潜在自主性是否会成为实际运行中的自主性。
对开发者而言,眼前的启示很实际。编程正转向规格定义、编排、测试和审查。深入理解系统的工程师能够委派更多工作,同时识别智能体看似自信的输出何时是错误的。
企业采购方应询问:当供应商声称能够自主工作时,他们具体衡量的是什么。仅有完成率并不足够。采购方需要关于监督、回退、缺陷、可审计性以及故障后的责任归属的证据。
知识工作者也面临类似转变。AI 可以承担更多执行工作,但人们仍需要可靠的上下文和重要决策的记录。当 知识融合 工具能够帮助用户追溯证据,而不只是再生成一个答案时,它们便会变得有用。
因此,Anthropic Claude 自我改进在一种有限但影响深远的意义上是真实存在的。Claude 已在加速工程和实验工作,而这些工作会产出后续的 Claude 模型。该公司尚未展示一个能够独立构建其后继版本的自主系统。
这两种表述之间的差距,正是下一章故事将展开的地方。关注领导力百分比,要求独立验证,并审视谁仍在作出不可逆的决定。如果这三个信号同步变化,“AI 构建 AI”将描述一种运行系统,而不只是一条新闻标题。
每个组织面临的问题,不再是 AI 能否产出更多工作,而是人们能否验证这些工作、保留挑战其结论所需的专业能力,并在自动化链条不断延伸时继续承担责任。



