top of page

Anthropic AI 开发指标揭示自动化与监督之间的竞赛

7天前
讀畢需時 14 分鐘

Anthropic 在发现 Claude 如今已主导其所衡量模型研发工作中的 26% 后,发布了三项 AI 开发指标。该公司称,这一比例在 2026 年 2 月时还不足 1%。这一增长带来了一个棘手的问题:监督能力能否以与执行研究的系统同样快的速度提升?

这一新框架衡量由 AI 主导的研究、对内部代理的监督,以及计算资源的分配。Anthropic 还发布了一份涵盖各类别的内部快照。该公司将这些衡量指标定位为一种方式,让外部人士得以追踪通常隐藏在前沿实验室内部的活动。

这并不意味着 Claude 能够自主设计并部署其继任者。Anthropic 表示,在所有衡量的研究类别中,Claude 距离完全自主仍有差距。不过,其数据表明,在监督之下,AI 如今已承担构建更强大模型所需工作中的相当大一部分。

时机很重要。Anthropic CEO Dario Amodei 此前曾呼吁采取协调措施,控制前沿开发的速度。与此同时,竞争对手也面临同样的激励:在不披露内部模型对该过程影响有多深的情况下,实现研究自动化。

Anthropic AI 开发指标将内部自动化摆上台面

Anthropic 已将内部 AI 使用转化为可衡量的开发投入,而不再将其视为一种非正式的生产力叙事。

该公司的衡量框架涵盖前沿模型开发的三个部分。第一部分估算 Claude 执行了多少研究工作。第二部分追踪 Anthropic 是否能够观察并中断其内部代理。第三部分考察该公司如何在安全研究和其他研究之间分配计算资源。

最受关注的数据来自 Anthropic R&D Automation Index。Anthropic 通过梳理开发模型所涉及的任务来构建该指数,随后为每项任务分配自动化等级,并以预估的员工投入时间进行加权。

Anthropic 表示,Claude 在 2026 年 8 月主导了其所衡量 AI 研发工作中的 26%。“主导”意味着,模型根据高层级请求完成一项任务的大部分内容,而由人员负责监督并批准结果。

超过 90% 的已衡量工作至少达到“协作”级别。在这一层级中,Claude 在密切的人类指导下完成任务的大部分内容。没有任何已衡量类别达到完全自主,即将人类移出实际操作循环的状态。

该指数采用 Epoch AI 提出的六级量表。其自动化量表涵盖从完全没有 AI 参与,到辅助、协作、主导和完全自主。Epoch 提醒称,这类评级仍带有主观性,并需要更好的评估方法。

Anthropic 根据 Slack 记录和内部文档构建了任务目录。在 7 月的每周,该公司从参与模型开发的各部门员工中抽样 20%。Claude 代理从这些记录中提取了约 15,000 项细粒度任务。

该公司将这些任务整理为一棵包含 542 个节点的树,其中 378 个为单独的任务类别。示例包括诊断评估平台缺陷、管理强化学习网络策略,以及审查服务事故。

这种广度很重要,因为软件基准测试只衡量受控条件下的部分能力。Anthropic 的指数则关注 AI 在新模型实际生产流程中的参与位置。

一个内部示例展示了“主导”在实践中的含义。当夜间数据管道发生故障时,Claude 可以检查日志、识别原因、提出修复方案、运行测试并记录工作过程。人类仍会审查这一变更,并决定是否部署。

这与自主研究有实质性差异。模型不会独立决定哪些系统需要关注、制定研究议程,或批准生产变更。26% 这一数字衡量的是监督下的委派执行,而不是对 Anthropic 实验室的独立控制。

尽管如此,六个月内从不足 1% 上升至 26%的变化值得审视。这表明,AI 辅助开发正从零散的编码支持转向端到端的任务负责制。它也为政府和竞争实验室提供了一项可供质疑或复现的具体衡量标准。

这些数字将压力转向其他前沿实验室

Anthropic 的披露促使竞争对手说明,其内部模型如何加速开发,以及这些系统如何受到治理。

前沿实验室经常为公开模型发布能力评估。这些报告描述模型在开发完成后能够做什么,但对于高级系统在发布前如何被用于实验室内部,揭示得要少得多。

这种差异造成了可见性缺口。一家公司可能在外部人士能够测试之前,先在内部将其最强模型用于研究、编码、评估和数据工作。内部系统可能影响其继任者,却不会出现在传统的公开基准测试中。

研究人员认为,内部模型的使用值得专门报告。一篇 2026 年关于内部风险报告的论文指出,前沿公司可能在公开发布前数周或数月内部运行高级系统。这段时期可能暴露出外部评估者无法观察到的风险。

Anthropic 的框架提供了一种回应。该指数并不只问模型是否通过某项基准测试,而是衡量其在实际运作的研究组织中所扮演的角色。监督指标则进一步追问,监测覆盖范围是否能跟上这一角色。

眼下的压力落在 OpenAI、Google DeepMind、xAI、Meta 及其他高级模型开发者身上。每家公司使用不同的内部系统和组织结构。若没有共同定义、抽样实践和独立验证,直接比较仍将十分困难。

即便如此,拒绝报告本身也会释放信号。一旦一家实验室公布由 AI 主导的研究占比,其他机构的沉默便会更加显眼。政策制定者可以追问,为何开发类似系统的公司无法提供类似衡量指标。

该框架也让有关 AI“自我改进”循环的说法变得更复杂。Anthropic 的数字显示出有意义的自动化,却没有显示递归式自我改进;后者要求模型自主构建更强的继任者。

大部分已衡量工作仍需要人类指导或批准。Anthropic 8 月的风险评估也表示,尚未观察到 AI 导致其开发速度持续翻倍。其模型尚未接近取代公司的研究科学家和工程师。

这种差异对公共讨论很重要。从广义上说,“Claude 帮助构建 Claude”是准确的,但这一表述将多个自动化等级压缩为一句话。在监督下修复管道的系统,与独立选择研究方向并部署变更的系统,带来的风险不同。

因此,Anthropic 的披露提高了所有人的证据标准,也包括 Anthropic 自身。如果实验室希望政策制定者对内部加速作出回应,就需要可重复的衡量方法,而非戏剧性的描述。

统一报告还会揭示实验室是否以不同方式定义成功。一家公司可能将 AI 生成的代码计为自动化工作;另一家公司可能只计入无需持续人类干预即可完成的任务。这些选择可能产生无法兼容的百分比。

一个共享框架将迫使开发者明确分母。它将澄清衡量范围是否包括工程、研究规划、评估设计、部署,还是仅包括易于监测的任务。

在此之前,Anthropic 的 26% 数据最适合作为单一公司内部的基线。其最大价值将来自在稳定方法下展示变化,而不是支持一张为时过早的排名表。

Anthropic R&D Automation Index 衡量的是工作,而非智能

该指数追踪生产流程的变化,但其设计无法证明 Claude 已变得多么智能或自主。

Anthropic 固定了一组研究任务,以便随时间比较自动化程度。这种方法类似价格指数:一组保持一致的项目能让变化更容易解释。但当基础工作发生演变时,它也会带来一个熟悉的衡量问题。

如果研究人员不再从事例行任务、转而从事更难的工作,自动化水平可能上升,却未必替代了等值的全部研究工作份额。固定任务篮子比起捕捉新工作的产生,更能可靠地反映旧工作的消失。

Anthropic 通过比较 2026 年 1 月和 7 月的任务结构测试了这一担忧。该公司称,在其选定的细化程度下,分析未发现新型任务类别的增长。不过,公司计划定期重建并对任务篮子进行版本管理。

加权带来了另一项挑战。Anthropic 使用员工投入时间作为任务重要性的代理指标。这会赋予耗费更多员工工时的活动更大权重,但时间与科学价值并不等同。

有关研究方向的短暂决策,可能比数周实施工作更重要。Epoch AI 的访谈发现,规划和提出假设所耗时间可能更少,但对项目成功仍至关重要。工程和调试耗时更长,也似乎更容易实现自动化。

这种模式可能在 AI 尚未控制最具决定性决策之前,就推高自动化指数。Claude 可能执行实验、修复基础设施并分析结果,而人类仍决定哪些问题值得研究。

评分过程又增加了一层不确定性。Claude 代理收集内部任务的相关证据,而另一套 Claude 评判模型负责分配自动化等级。使用相关模型评估模型参与程度,会带来关联性错误的风险。

Anthropic 将这些判断与负责相关工作的员工评分进行了比较。该公司报告称,模型与人类在 59% 的案例中完全一致。两名人类评分者则仅在 35% 的情况下完全一致。

模型和人类评分在 97% 的案例中相差不超过一个自动化等级。这些结果表明,该量表能够捕捉广泛的差异。它们也揭示了协作与主导边界附近存在显著模糊性。

这一边界决定了标题数据。将一项任务从第三级移至第四级,会使其从 AI 协作变为 AI 主导。但这两个等级都保留了大量人类参与。

该指数还依赖敏感的内部记录。独立审计人员需要访问员工工作成果、代理记录、任务定义和加权决策。这种访问会引发隐私、安全和竞争方面的担忧。

Anthropic 计划引入第三方评估人员,使其获得与内部风险团队相当的访问权限。这一承诺比单独发布方法论更具实质意义。外部评估者需要获得足够访问权限,才能复现分类并审查被遗漏的工作负载。

对于工程组织而言,该框架还凸显了一个实际的文档问题。当决策分散在消息、代码审查、代理轨迹和实验日志中时,自动化工作将难以审计。

可检索的工程知识库能够帮助团队将人类决策与 AI 生成的产物一并留存。这类记录无法替代独立验证,但能让内部问责更具可行性。

因此,该指数应被视为一种运营指标。它衡量的是 Anthropic 当前如何在人类与 Claude 之间分配工作,而非意识、通用智能,或通往自主自我改进的必然路径。

三万名代理让监督成为吞吐量问题

Anthropic 的内部代理规模意味着,安全性依赖于能够筛选海量活动、又不会掩盖罕见且后果严重故障的监控系统。

Anthropic 报告称,8 月期间,在其使用最广泛的内部平台上,任一时刻约有 30,000 个代理在从事研究和工程工作。相关测量覆盖的是该平台,而非公司内部使用的所有代理系统。

据 Anthropic 介绍,受测平台上的每项操作都会在执行前经过在线监控器。在线监控器会实时评估操作,并可将其拦截或重定向。Anthropic 表示,这一过程通常只需数秒。

公司还会将每项操作导入离线监控系统。离线监控会检查已完成的活动,以发现逐渐形成的模式,包括在更长序列中可能出现的失配问题。

这两层系统应对的是不同的失效模式。在线系统可以阻止快速复制模型权重的尝试;离线系统则可调查只有在多次操作或交互后才显得可疑的行为。

Anthropic 在 8 月分析了超过 10 亿项代理决策。其在线监控器拦截了其中的 0.002%,即大约每 47,000 项决策中有一项。

这一低比率有两种可能的解读:代理可能很少尝试危险操作,或者监控器可能只识别出问题行为中较窄的一部分。仅凭这一数字无法区分这两种解释。

离线监控大约会在每千份记录中标记一到两份,以供进一步检查。Anthropic 表示,每周约有 100,000 份记录进入额外的自动化审查,其中约 50 起高优先级案件会提交给人工审查人员。

从 100,000 个机器标记缩减至约 50 起人工升级案件,说明了为何监督是一个吞吐量问题。在这一规模下,人类无法手动检查每一项代理操作;他们必须依赖分类器来决定哪些内容值得关注。

因此,覆盖率是必要条件,但并不充分。监控器可以在技术上检查 100% 的操作,却仍可能遗漏陌生的攻击策略。最关键的问题是召回率,即系统捕捉已知和新设计危险行为的频率。

Anthropic 承认,这类监控已运行数月而非数年。该公司还表示,对大规模代理群体进行监督的科学方法将发生显著变化。

独立研究提供了一些证据,表明外部审查可能有所帮助。METR 在 2026 年早些时候花了三周时间对代理监控器进行红队测试。调查发现了若干新的漏洞,其中一些后来已由 Anthropic 修补。

METR 表示,这些发现并未严重削弱相关 Anthropic 风险报告中的主要结论。不过,公开的只有经过删节的摘要,这限制了外界对攻击、防御措施和剩余弱点的评估。

Anthropic 的身份系统会为每个代理分配跨模型升级持续有效的身份。其内部代理通过共享且可归属的消息进行通信,而不是使用私密渠道。这些设计选择让监控器能够将操作和声明追溯至具体代理。

持续身份也有助于代理将其他代理发来的消息视为需要验证的主张。它降低了群体中流传的信息与代理自身推理变得难以区分的可能性。

开放通信能形成更丰富的审计轨迹,但并不能保证独立行为。由相似模型驱动的代理可能共享盲点;来自同一模型家族的监控模型,也可能复现它本应发现的推理错误。

这正是 Anthropic 系统中的核心矛盾。由于人工审查无法匹配活动规模,公司需要用自动化来监督自动化。但每增加一层自动化,都会引入另一项依赖模型的判断,而它同样需要验证。

算力分配带来透明度,但视野有限

算力比研究质量更容易统计,但 Anthropic 的一周快照无法证明安全投入是否正在同步增长。

Anthropic 审查了 2026 年 7 月 13 日至 7 月 20 日期间使用的全部计算能力。该公司将工作负载划分为多个类别,并衡量有多少 AI 研究算力支持安全工作。

公司发现,分配给 AI 研发的算力中约有 6% 用于安全工作。在 AI 驱动的 AI 研究内部,这一安全占比约为 12%。

Anthropic 将这两个数字都描述为保守估计。同时推进安全性与能力的工作被计入通用 AI 研究;独立的安全防护分类器也未计入报告中的安全占比。

该公司对近 10,000 次研究训练和评估运行中的约 14% 进行了抽样。样本向消耗更多算力的工作负载倾斜。在将每次运行归类为安全或其他研究之前,分类器会检查元数据和代码。

Anthropic 表示,机器分类与人工审查人员的判断相差一到两个百分点。一些案例即便经过数小时人工分析后,仍然难以界定。

这种模糊性不可避免,因为安全与能力研究经常重叠。更好的可解释性可以揭示危险的模型行为,但也可能帮助工程师提升性能。更具扩展性的监督既能降低风险,也能让代理产品更易部署。

分母与百分比同样重要。一次大型前沿训练运行消耗的计算能力,远超许多安全实验的总和。安全研究通常更依赖研究人员时间、评估设计和分析,而非庞大的加速器集群。

安全占比下降,可能反映安全工具效率提高,而非投入减弱。反过来,占比上升也可能来自成本高昂却几乎无法提供有效保护的实验。算力衡量的是投入,而非结果。

一周的观察期还带来另一项限制。Anthropic 会动态管理算力,因此分配会随着训练运行、产品需求和可用容量而变化。单周数据无法确立持久趋势。

定期报告会让这一指标更有价值。稳定的季度序列可以显示,安全算力是否与自动化研究、模型训练及内部代理部署同步增长。

可比报告仍需要共同定义。实验室有动机将双用途项目归为安全工作。Anthropic 认为,开发者应承担举证责任,证明某项工作负载确实属于安全类别。

独立验证可以检验标签和总量,但审计人员需要访问敏感代码和实验元数据。政府或可信评估机构也需要制定保护专有研究的程序。

Anthropic 的扩展政策已将更强的模型能力与更强的安全防护联系起来。新的算力指标增加了资源视角,展示能力阈值被跨越之前,算力流向何处。

然而,配置资源并不能证明控制措施有效。真正有意义的检验在于:安全系统能否识别故障、承受对抗性压力,并在必要时阻止部署。

算力分配最适合作为更大证据包中的一个组成部分。它可以揭示优先事项和趋势,而能力评估、事故、红队结果及监控表现则揭示结果。

下一项考验是报告能否得到验证

Anthropic 已发布了有价值的基线,但只有当重复测量能像揭示有利变化一样揭示不利变化时,该框架才有意义。

首先值得关注的信号是下一次 R&D Automation Index 更新。四级工作进一步增加,将强化这样一种判断:受监督的代理正在承担完整研究任务的所有权。

这种增长的构成同样重要。如果增长集中在调试和基础设施领域,将表明工程自动化正在深化;如果增长体现在假设提出、实验选择或研究优先级设定上,则意味着更具重要性的转变。

稳定的任务篮子也会让趋势更容易解读。如果 Anthropic 更改类别、权重或阈值,就应同时公布旧结果和修订后的结果。没有版本化数据,方法变化可能看起来像能力进步。

第二个信号是独立复现。Anthropic 表示,计划让来自多个组织的评估人员嵌入团队,并提供与内部风险团队相当的访问权限。他们能否复现 26% 这一数字,将检验该指数是否能够支持外部问责。

验证不应只考察最终百分比。评估人员需要测试抽样任务记录、自动化评级、工作负载覆盖率、监控召回率和算力分类。他们还应在不暴露危险或专有细节的前提下披露重要限制。

外部测试对于代理监督指标尤为重要。若没有估算系统遗漏内容的对抗性测试,每 47,000 项决策中拦截一项的意义有限。

未来报告应纳入对已知不当行为和新设计攻击的检测率。报告还应说明关键案件多快会提交给人工,以及升级后会采取哪些措施。

第三个信号是其他实验室是否采用这一框架。来自 OpenAI、Google DeepMind、xAI 或 Meta 的可比披露,将使 Anthropic 的框架成为行业工具,而非公司专属叙事。

竞争者不需要拥有完全相同的内部平台,但需要对受监控操作、审查延迟、升级机制、研究自动化和安全相关算力采用共同定义。

采用该框架会增强其可信度,因为跨实验室的差异将揭示方法上的弱点。拒绝参与则会削弱一种主张:自愿透明能够替代正式要求。

该框架还面临 Anthropic 内部的可信度考验。未来报告必须纳入监控恶化、安全分配下降或自动化引发运营问题的时期。选择性披露会让这一项目恰恰在最需要审查时变得不那么有参考价值。

对于开发者而言,眼下的教训并非自主研究已经到来,而是 AI 目前已承担足够多的内部工作,因此需要在组织层面建立监测机制。

对于企业采购方而言,这些指标提供了一组更好的采购问题。买方可以询问代理是否拥有持续身份、每项操作是否被记录、警报多久能传达人类,以及外部测试人员能否审查这些控制措施。

对政策制定者而言,该框架明确了可衡量的输入指标,但并未解决治理问题。各国政府仍须决定:报告机制是维持自愿性质、转为标准化,还是在达到既定阈值时触发更严格的审查。

Anthropic AI development metrics 为外界提供了迄今最清晰的公开视角,展示一家前沿实验室如何利用 AI 开发 AI。它们也揭示出,其中仍有多少内容依赖内部定义、自动化判断以及有限的外部访问。

接下来的几份报告将决定,这会成为支撑问责的持久基础设施,还是一次性的透明度实践。读者应依次关注自动化趋势、独立验证和竞争对手的采用情况。这些信号将表明,监督机制是否真正跟上了开发速度。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page