Anthropic Claude AI 研发占比达到 26%,但人类仍掌握控制权
Anthropic 表示,Claude 目前主导其内部 26% 的 AI 研究与开发工作,尽管在被衡量的工作中,没有任何一项完全由其自主完成。Anthropic Claude AI 研发这一数据,指的是主要基于高层级提示完成的任务,同时仍由人员监督、纠正并批准输出结果。
这种区别并未削弱这项披露的重要性,反而令其更具意义。Claude 已不再局限于回答研究人员的问题,或生成孤立的代码片段。它正越来越多地承担用于开发后续 AI 系统的连贯工作环节。
这一发现也让 Anthropic 的公开立场显现出一种张力。该公司希望前沿实验室能更多披露开发加速的情况,并围绕安全问题进行协调。与此同时,它自身的系统也正在帮助这一开发进程加速。
因此,核心问题并不是 Claude 是否在独立设计自己的继任者。Anthropic 表示,它并没有这样做。问题在于,人类监督能否像其必须评估的自动化研究一样快速扩展。
Anthropic Claude AI 研发实际衡量的是什么
这 26% 衡量的是 AI 在受监督下主导任务,而不是一个自主运行的 AI 实验室。
Anthropic 在 9 月 17 日一份关于衡量前沿 AI 实验室内部开发情况的报告中披露了这一数字。该公司发布了三项拟议指标,涵盖 AI 主导研究、智能体监督以及计算资源分配。
其开发衡量指标将研究任务划分为六级自动化尺度。该尺度从没有实质性 AI 参与,一直到无需人类参与即可完成工作。
在被称为“协作”的第三级中,AI 在人类密切指导下完成任务的大部分内容。人员仍负责作出关键决策,并整合最终工作成果。
在被称为“主导”的第四级中,AI 根据高层级请求完成任务的大部分内容。人类监督流程,在需要时重新引导,并批准最终结果。
Anthropic 表示,2026 年 8 月,Claude 在至少 26% 被衡量的 AI 研究与开发工作中达到了主导级别。根据该公司的报告,这一比例在 2 月时还不足 1%。
超过 90% 的被衡量工作至少达到了协作级别。这一更广泛的数字包含被归类为 AI 主导的 26%,因此两项数据不应相加。
该公司表示,没有任何被衡量类别达到第五级,即只需极少或无需人类参与的端到端工作。Claude 因此仍是人类主导开发系统中的一部分。
这一基础指数试图衡量的不只是工具使用情况。它关注的是谁承担任务、谁决定方向,以及仍然需要多少干预。
这种方法将有意义的工作流控制与更简单的统计数据区分开来,例如生成代码的数量。一个模型可以生成大量代码,但仍将架构、评估和部署决策交给人员。
Anthropic 通过查阅包括公司文档和工作场所通信在内的内部记录,构建了其任务目录。随后,它将这些活动组织为涵盖研究和工程职责的层级结构。
该公司使用 AI 对任务进行分类,同时也请员工评估各自专业领域内的工作。这些评分按预估员工工时加权,使规模更大的工作类别拥有更大影响力。
这种方法为观察一家实验室提供了异常细致的视角,但并不能构成经独立验证的行业基准。
这些定义同样涉及判断。被标记为“主导”的任务,可能仍需要大量人工审查、专业背景知识,或经历多轮纠正后,其结果才会变得有用。
这正是措辞精确如此重要的原因。Anthropic Claude AI 研发衡量显示了工作分配方式的快速变化。它并不能证明 Claude 理解或控制了完整的模型开发流程。
即便存在这一限制,所报告的增长仍值得关注。在数月内从几乎没有 AI 主导工作转变为 26%,表明该实验室的内部生产系统变化速度快于其人员结构。
这一结果引出了本文的核心张力。研究能力可以通过软件扩展,而可靠的监督仍依赖于时间和注意力有限的人员。
更快的研究令人工审查承压
自动化执行带来了更多供人类检查的实验、代码和提案,使审查成为下一个关键瓶颈。
AI 实验室传统上通过招聘专家和增加计算能力来扩展研究规模。智能体系统则引入了另一条路径,让现有团队能够并行开展更多工作。
AI 智能体是连接工具、记忆与执行循环的模型。它能够推进多步骤任务,而不只是回答单一提示。
Anthropic 报告称,在其衡量期间,公司内部任一时刻约有 30,000 个智能体在进行研究和工程工作。这一数字描述的是同时运行的软件进程,而非彼此独立的自主研究人员。
该公司表示,智能体操作在执行前会经过在线监控。它还报告称,离线系统会在之后审查这些操作。
这种安排可以扩大人类团队发起的工作量,也可能成倍增加监控系统必须处理的决策、中间结果和异常行为数量。
Anthropic 报告称,8 月期间智能体作出了超过 10 亿次决策。根据该公司的内部衡量,其监控系统大约每 47,000 次决策拦截一次。
低干预率存在多种可能的解释。大多数操作可能是常规且可接受的,也可能是监控系统采用了较窄的拦截标准。仅凭公布的比例无法区分这些解释。
该公司承认,智能体监控仍是一门新兴学科。其报告称,Anthropic 运行这些监控系统的时间以月计,而非以年计。
这段有限的运行历史很重要,因为研究环境中的失败并不总是显而易见。编码错误可能触发测试失败,但有缺陷的实验前提仍可能产生看似合理的结果。
人类审查者必须评估的不只是输出能否运行。他们还需要检查假设、方法、安全影响,以及一个表面成功的结果是否回答了原定问题。
Anthropic 还曾将人工代码审查描述为日益严峻的约束。在其关于递归改进的讨论中,该公司表示,代码产量增加已将压力转向审查环节。
这正是阿姆达尔定律的一个例子:系统的整体速度仍受其最慢组件限制。加速代码生成无法消除验证、协调或判断环节的延迟。
同样的约束也适用于代码之外。智能体可以提出许多实验,但实验室仍需筛选有用的想法、分配计算资源,并解读相互矛盾的结果。
这改变了前沿实验室内部“生产力”的含义。研究人员可能会减少编写单个实现的时间,转而投入更多时间定义任务、核查证据和管理自动化工作者。
这些职责需要不同的系统与技能。团队需要可追溯的记录、明确的责任归属,以及可靠地还原智能体决策背景的方法。
可检索的AI 知识库可以帮助普通团队保留这些背景信息。前沿实验室则需要更严格的版本,包括访问控制、监控和可复现日志。
这种压力延伸至 Anthropic 之外。如果受监督的智能体让一家实验室能够测试更多想法,竞争对手也会受到激励,提高自身对自动化研究的使用程度。
OpenAI、Google DeepMind 及其他前沿开发者不必采用 Anthropic 的确切指数,也会感受到这种竞争压力。他们仍必须决定要委派多少开发工作,以及披露多少信息。
这种被迫作出的回应既是技术性的,也是制度性的。竞争者需要更强大的智能体,但也需要可信证据证明其评估系统能够跟上步伐。
这场竞赛不会由拥有最多智能体数量的一方决定。更重要的优势将属于那些能够将并行工作转化为可靠模型改进、同时不压垮人工监督的实验室。
真正的竞争是加速与可验证性之间的较量
Anthropic 的披露表明,在外部尚未形成验证其速度或安全性的共同方法之前,AI 辅助开发已经在加速。
主要冲突并非 Claude 与另一款聊天机器人之间的竞争,而是自动化研究能力与人类及机构验证这一能力的能力之间的较量。
Anthropic 的衡量框架部分基于 Epoch AI 开发的自动化分类体系。这项工作将 AI 参与程度划分为六个等级,并将其应用于研究任务。
Epoch 的自动化分类体系也强调了不确定性。其作者将这些评级描述为主观判断,并邀请更多研究来完善任务定义和验证方式。
主观性并不意味着该指数毫无用处。这意味着读者应将 26% 视为一种结构化的内部估计,而非可在各处通用比较的性能分数。
实验室可以以不同的细节程度定义任务。“运行一次评估”可能被计作一项任务,而另一种框架则会将其拆分为设置、执行、分析和报告。
这些选择会影响最终的自动化比例。宽泛任务会赋予人类规划更大权重,而狭窄任务则可能突出智能体完成的步骤。
按员工工时加权也引入了另一层判断。历史劳动力分配未必反映哪些任务在战略上更重要,或哪些错误会造成最大风险。
该框架还在衡量过程中使用 AI。Anthropic 表示,模型生成的分类结果与熟悉相关工作的员工评估进行了比较。
这种交叉核查很有用,但无法消除所有循环性。该公司正使用 Claude 来帮助分类 Claude 在公司内部贡献了多少工作。
因此,独立评估至关重要。Anthropic 表示,计划引入外部评估人员,并给予他们与内部风险团队相当的访问权限。
这种访问将超越审查公开演示或精选基准测试结果。评估人员需要具备足够可见性,以检查定义、样本、日志和分类程序。
Anthropic 已宣布与 Accenture 建立一项相关评估合作伙伴关系。该公司将这一安排描述为让独立评估人员更接近内部系统和数据的一步。
这种模式的价值将取决于权限和报告自由。评估人员需要接触不利证据,而不只是为审查准备的材料。
定期发布同样重要。8 月的单次快照建立了一个基线,但无法显示这一增长是否会持续、放缓或逆转。
来自其他实验室的可比报告将增加一层证据。没有这些报告,没人能判断 Anthropic 是自动化程度异常高,还是仅仅透明度异常高。
竞争动机会令这种比较更加复杂。实验室可能希望向投资者和招聘对象宣传研发加速,同时限制那些会帮助竞争对手的信息细节。
安全动机则可能指向相反方向。披露快速自动化可能会强化支持监管、协调性限制或强制外部评估的论据。
Anthropic 正在公开尝试兼顾这两种立场。它将更快的内部开发既视为能力的证据,也视为需要加强公众可见性的理由。
这正是核心反转:打造更快系统的公司,同时也在主张社会需要更好的工具来监测这种加速。
这种张力并不意味着披露自相矛盾,而是让拟议测量方法的质量成为 Anthropic 可信度的关键。
如果该指数能够重复验证并接受独立审计,它将帮助政府在完全自主性出现前识别有意义的变化。若它始终只是自报数据,则可能沦为又一项企业进展指标。
最初报道恰当地强调了主导与自主之间的区别。随着这一头条数字被广泛传播,这一区别应始终保持清晰。
Anthropic Claude AI 研发数据最适合作为衡量工作流边界变化的指标,而不适合作为通向智能爆炸的倒计时。
经过验证的趋势仍可能成为早期预警信号。挑战在于,在战略竞争令透明度更难实现之前建立这种验证机制。
26%这一数字并不能证明什么
Claude 扩大的角色并不能说明它能够独立选择有价值的研究方向,或安全地验证自己的结论。
最明显的风险,是过度解读“主导”一词。在 Anthropic 的量表中,主导仍包含人工监督、纠正和批准。
这些活动可能包含研究中最困难的部分。选择有前景的问题、识别误导性的结果,以及判断证据是否充分,仍是至关重要的判断。
一个智能体或许能完成大部分可见步骤,却仍依赖人类作出决定工作是否重要的判断。基于任务完成度的百分比可能会低估这种依赖。
该指数也只涵盖一家公司的内部工作。Anthropic 的工具、文档、员工实践和模型访问条件,都不同于大学或其他实验室。
Claude 可能在围绕 Claude 设计的环境中表现尤其出色。这种优势说明了垂直整合的某些特点,却较少说明普遍意义上的研究自主性。
另一个不确定性涉及错误关联。使用相关模型的数千个智能体,可能重复同一项假设、编码模式或评估弱点。
并行化并不保证独立推理。它可能比小型人工团队更快地在众多工作流中复制同一个盲点。
Anthropic 表示,其智能体拥有持久身份,并通过共享系统进行沟通。这些特性有助于追溯,也让智能体能够检查彼此的主张。
然而,共享的架构和训练仍可能造成相关性故障。智能体之间的审查并不等同于由独立模型、人类专家或外部机构进行的审查。
监测本身也会带来测量问题。系统能够拦截已知模式,但新型故障可能无法匹配既有检测规则。
Anthropic 公开指出了这一局限。该公司称,无法确定现有监测是否捕捉到其智能体活动中的每一种相关行为。
算力分配提出了另一个问题。Anthropic 衡量了 7 月某一周内,有多少研究算力支持安全工作。
该公司报告称,约 6% 的 AI 研发算力用于安全工作。在专门用于 AI 驱动的 AI 研究的算力中,这一比例约为 12%。
Anthropic 称这些估算较为保守,并警告算力并不是完美的代理指标。安全工作可能需要大量人工分析,却不消耗大量处理资源。
因此,这些数据不应被简化为安全评分。更适合将其视为运营信号,并在持续追踪时获得更完整的意义。
定义再次至关重要。可解释性研究、监测工具和能力评估都能支持安全,同时也可能改进产品或提升开发速度。
Anthropic 表示,同时推进安全与能力的工作被计入研发,而非安全。另一家实验室可能会采用更宽松的边界。
外部审查者应检验这些边界。否则,即使运营情况相似,分类方法的变化也可能看起来像安全投入的变化。
公司关于更广泛递归改进的论述同样需要克制看待。更快的编码和实验可以加速开发,但并不意味着会产生一个自行设计其继任者的自主系统。
研究还存在模型执行以外的瓶颈。硬件供应、训练数据、物理基础设施、组织决策和评估时间,都可能限制进展。
人工批准并非无关紧要的技术细节。它目前正是 Anthropic 所报告的主导类别与完全自主之间的分界线。
只有当监督负担下降、任务复杂度上升时,26%这一结果才更值得担忧。如果更好的监测和独立审计以同样速度增长,担忧则会减弱。
因此,最准确的解读仍应保持狭义:据报道,在持续的人类控制下,Claude 已负责 Anthropic 开发工作流中更大的部分。
这项披露提供了加速的证据,但并不能证明自我改进、独立的科学判断,或在更大规模下的可靠控制。
Claude 扩大角色改变 AI 开发的经济学
直接影响在于组织杠杆:一个研究团队可以启动更多工程和实验工作,而无需相应增加人员规模。
前沿模型开发本已需要庞大的计算集群、专业研究人员和广泛的数据基础设施。AI 智能体在这些固定资源之上增加了一层软件劳动力。
这一层能够缩短实施实验、修复评估系统、分析结果和准备技术文档所需的时间。
这种优势可以不断累积。更好的模型协助研究人员,研究人员改进后续模型,而新系统又成为能力更强的助手。
累积效应并不需要完全自主。只要这种协助足以减少开发时间,使每一代系统更快问世或包含更多经过检验的想法即可。
Anthropic 报告的占比从不足 1% 升至 26%,为这一机制提供了具体的内部指标。不过,该测量并未揭示由此带来的模型质量提升。
实验室可以完成更多任务,却未必作出成比例更好的决策。更多实验可能带来噪声、重复工作或额外审查义务。
因此,商业优势取决于转化效率。公司必须将智能体产出转化为可靠的研究成果,而不只是更大的活动规模。
这一要求有利于拥有强大内部数据系统的组织。智能体需要在遵守安全边界的同时访问代码、实验历史、文档和反馈。
它也有利于负担得起大量推理使用的实验室。持续运行数千个智能体,需要的算力容量超过训练一个前沿模型本身。
这将 Anthropic 的故事与更广泛的基础设施竞赛联系起来。融资、数据中心建设、芯片供应和电力可用性,决定实验室能够在多大程度上扩展自动化研究。
这些约束解释了为何资本提供者和基础设施公司仍是 AI 竞争的核心。更快的软件研究会增加对其底层物理系统的需求。
然而,基础设施本身并不能决定胜负。无法验证智能体工作的实验室,可能消耗更多算力,却带来可靠性更低的进展。
组织模式也可能改变。研究人员将成为包含实验、智能体、评估器和监测系统的工作组合的负责人。
入门级技术工作可能最先转变,因为当前智能体能够处理边界明确的实施任务。随着生成工作量增加,高级判断力可能变得更有价值。
这种转变带来了培训问题。初级研究人员传统上通过完成这些日益由智能体承担的细致工作来培养判断力。
实验室将需要新的方式教授调试、实验设计和故障分析。否则,它们可能削弱未来有资格监督先进系统的人才储备。
这种影响可能在自主研究到来前就波及企业软件团队。公司已经使用编码智能体编写测试、更新依赖项和检查代码库。
Anthropic 的披露表明,这一工作流的前沿版本正扩展至模型评估和研究工程。这些任务的不确定性高于常规应用开发。
企业不应将头条百分比照搬为生产率目标。它们应识别智能体能够执行哪些任务、仍需哪些审查,以及如何检测错误。
一个有用的运营指标不只是 AI 生成产出的占比,而是审查后被接受的比例、纠正负担,以及遗漏错误的严重程度。
同样的逻辑也应适用于前沿实验室。当自动化指数与可靠性、研究质量和人工审查时间的证据相结合时,其信息价值更高。
Anthropic 的框架开启了这场讨论,但尚未完成它。当前数据描述的是参与度和控制情况,而非由此产生工作的全部价值或风险。
三个信号将显示这种转变是否真实
下一项考验是:Anthropic 能否验证这一趋势、维持人类控制,并促使竞争实验室作出可比披露。
第一个信号是 Anthropic 下一次发布其自动化指数。一次一致的更新应采用稳定的任务定义,并解释所有方法论变化。
如果 AI 主导的占比上升、人工干预下降,加速论点将更具说服力。若定义发生重大变化,与 8 月的比较将变得更弱。
读者还应关注头条数字之下的分布。自动化集中于编码,与自动化覆盖研究规划、评估设计和战略决策,含义截然不同。
第二个信号是有实质意义的第三方访问。Anthropic 表示,外部评估者将获得与内部风险团队相当的可见性。
可信的评估应涵盖抽样、任务边界、分类器行为、监测覆盖范围,以及人类与模型评分之间的分歧。公开发现应包括局限性。
独立验证将强化 Anthropic 关于这些测量能够支持治理的主张。受限或带有宣传性质的报告,将使核心证据缺口依然存在。
第三个信号是其他前沿实验室的回应。OpenAI 和 Google DeepMind 可以发布可比信息,或解释为何 Anthropic 的框架不适用于它们的工作。
可比数据将显示,由 AI 主导的研究是否已成为全行业的运营模式。若持续沉默,Anthropic 的相对位置仍将难以判断。
监管机构也可能开始要求披露这些指标。他们的关注,可能会使一项实验性信息披露演变为前沿开发者的潜在报告标准。
原始的 Bloomberg 节目 将 Anthropic 的发现置于有关 AI 融资与基础设施的更广泛讨论中。这个背景很重要,因为自动化研究仍依赖资本、芯片、能源和数据中心。
然而,最具决定性的限制因素或许会是验证能力,而非原始算力。实验室推出更多智能体的速度,可能快于机构建立可信监督机制的速度。
对于开发者、企业买家和知识工作者而言,实际问题已经显现:在必须由人检查其假设和证据之前,一个智能体应完成多少工作?
不要把 Anthropic 的 26% 视为人类研究人员正变得不再必要的证明。应将其视为一个警示:监督正成为一项核心工程职能。
关注 Anthropic 下一次 Claude AI 研发更新、其评估人员的独立性,以及竞争对手是否会公布可比数据。这些信号将共同表明,透明监督能否跟上自动化发现的步伐。



