Anthropic AI 安全警告揭示了一场其研究人员称可能导致人类灭绝的竞赛
在一名研究人员辞职、另一名研究人员将本十年内人类灭绝的风险评估为超过 10% 后,Anthropic 的 AI 安全警告变得更难被忽视。
Jacob Coxon 表示,他离开 Anthropic 是因为前沿实验室正在竞相开发可自我改进的超级智能,却没有可信的方法来控制它。Anthropic 对齐科学负责人 Evan Hubinger 公开认同这一核心担忧。他认为,未来十年 AI 杀死所有人类的概率超过 10%。
这些表述是个人判断,而非经过测量得出的预测。目前没有被普遍接受的科学方法能够计算由 AI 驱动的人类灭绝的精确概率。然而,这些警告之所以重要,是因为它们来自一家以打造更安全前沿 AI 为承诺的公司内部研究人员。
因此,这场冲突的意义远不止于一次辞职。Anthropic 和 OpenAI 认为,开发先进系统能够帮助社会理解并管理其风险。Coxon 则认为,同样的竞争正推动两家实验室追逐安全研究无法可靠遏制的能力。
这种张力如今定义了 Anthropic 的 AI 安全警告。正在开发日益自主模型的人,一边承认存在灾难性的不确定性,一边继续推进研发。核心问题在于:当实验室相信单方面放缓会让世界变得更不安全时,自愿采取的安全保障是否能承受竞争压力。
一次辞职将内部恐惧变成公共新闻
Coxon 的离职将一个熟悉的理论风险,转化为对追逐这项技术的实验室的直接指控。
Coxon 于 2026 年 9 月 8 日宣布辞职,此前他曾在 OpenAI 和 Anthropic 从事模型预训练工作三年。预训练是指在后续进行安全调优之前,通过大规模数据集教会模型识别模式的过程。
根据最初的辞职报道,Coxon 表示两家实验室都没有负责任地行事。他指责它们在将人类生命置于风险之中的同时,竞相开发可自我改进的超级智能。
可自我改进的超级智能,是指一种能够比人类专家更有效推进 AI 研究的假设性系统。这样的系统可能随后设计出能力更强的继任者,从而形成加速发展的循环。
Coxon 的警告主要并非针对当今聊天机器人给出错误答案,而是针对未来能够在有限人工监督下开展研究、操作计算机、发现漏洞和获取资源的系统。
他认为,实验室员工真心相信,他们的工作可能在 2030 年前造成灾难性后果。他也否认这一警告是一场公关活动。他的信息将这场竞赛本身描述为私营公司内部正在作出的、不可接受的决定。
Hubinger 支持了这一辞职的核心前提,使其意义更受关注。Hubinger 领导 Anthropic 的对齐科学团队,研究人员在该团队中探索如何让先进系统可靠地遵循预期目标。
Hubinger 表示,他认为未来十年 AI 杀死所有人类的概率超过 10%。这一数字代表的是他的判断,而不是从可重复实验中得出的概率。
这一区别很重要。读者不应将 10% 理解为可与飓风预报或设备故障率相提并论的精算估计。研究人员无法观察即将到来的十年的多个版本,并统计结果。
不过,个人层面的不确定性并不意味着这番表述无关紧要。风险决策通常会考虑难以量化的后果,尤其是在潜在损害不可逆转时。
这些公开评论也带有不同寻常的机构分量。Coxon 曾参与开发他所批评的系统,而 Hubinger 仍负责旨在确保未来模型保持对齐的研究。
他们的立场并不能证明人类灭绝很可能发生。但它们确实表明,直接了解前沿开发情况的人士中存在严重担忧。
时机进一步加剧了这一事件的影响。Coxon 辞职之际,AI 实验室正报告更强的自主能力,以及模型在技术工作中的使用日益增加。Anthropic 自身的路线图称,系统正变得更擅长完成长时间任务和高风险编程工作。
一篇独立报道将 Coxon 的离职描述为围绕系统失去人类控制的争论不断扩大的组成部分。报道还将他的批评置于涉及 Anthropic、OpenAI 和全球竞争者的更广泛竞赛中。
通常,一名员工离职不会改变一家实验室的战略。这次辞职之所以重要,是因为 Anthropic 留任的对齐负责人认可了其背后的危险,而非加以否认。
这一事件暴露了公众理解与内部担忧之间的鸿沟。许多用户将 AI 视为有用的助手;而一些正在构建其继任者的研究人员,则将其讨论为全球灾难的潜在来源。
这一鸿沟构成了本文的核心张力。Anthropic 一边销售日益强大模型的使用权限,一边其安全专家公开质疑人类能否控制接下来出现的事物。
Anthropic 的 AI 安全警告针对的是竞赛,而非当下的 Claude
争议中的机制是一种竞争性反馈循环:在可靠控制方法出现之前,它就会奖励更高程度的自主性。
Coxon 并未声称当前的 Claude 模型正在准备消灭人类。他的论点聚焦于系统向能够改进 AI 研究本身的方向发展。
如今的模型能够编写代码、使用数字工具、分析技术文档,并完成日益漫长的工作流程。它们仍会犯下基础错误、误解目标,并需要人工监督。
Coxon 所描述的危险,始于这些限制不再约束 AI 研究。能够完成大量研究工作的模型,可能有助于设计训练方法、评估、软件和未来架构。
这种协助可能缩短开发周期。能力更强的继任者随后又可能提供更好的研究支持,使下一代继任者更快出现。
这一假设性循环被称为递归自我改进。它是否会通向不可控智能尚未得到证实,但它在灾难风险论述中占据核心位置。
这一机制不止涉及原始智能。危险系统还需要访问权限、持续性、可用工具,以及在预期环境之外行动的机会。
与网络和敏感基础设施隔离的高能力模型,与拥有凭证和计算机访问权限的自主代理,带来的风险并不相同。因此,部署决策与模型能力同样重要。
Anthropic 在其公开政策中承认了这一区别。其扩展框架将更强能力与额外的评估、安全和部署要求联系起来。
该公司将这些要求称为 AI 安全等级。它们旨在让模型跨越特定风险阈值时触发更严格的保护措施。
Anthropic 的框架涵盖蓄意滥用和自主行为。相关情境包括协助制造生物威胁、复杂网络行动、模型窃取,以及系统自身发起的有害行动。
然而,这项政策是自愿性的,并会随着 Anthropic 对情况的理解发展而变化。其当前版本承认,一家实验室无法决定整个竞争环境的安全性。
这一集体行动问题正处于 Coxon 反对意见的核心。如果 Anthropic 暂停,而另一家开发者继续推进,竞争对手可能率先实现决定性能力。
Anthropic 因此认为,单方面克制本身也可能带来危险。安全保障较弱的实验室可能获得影响力,而 Anthropic 则失去开展安全研究的能力。
Coxon 从相同前提出发得出了相反结论。他认为,竞争恰恰证明私营实验室不应控制开发节奏。
两种立场都承认,这些激励机制并不稳定。两者都没有提供一种简单方法,让一家公司能够同时放缓所有竞争对手。
OpenAI 是最重要的对照对象,因为 Coxon 曾在两家实验室工作。这些公司在研究人员、计算资源、客户和前沿能力领导地位上相互竞争。
它们也依赖相似的战略主张:打造更强模型,能够提供使后续模型更安全所需的工具和知识。
这一主张形成了循环依赖。实验室称,它们需要先进 AI 来解决由先进 AI 造成的安全问题。
它或许会奏效。强大的模型可以协助开展可解释性、监控、评估设计和安全研究。它们能够帮助专家审查比人类团队独立完成的更多实验。
它也可能失败。实验室可能在其由 AI 辅助的安全项目形成可靠控制措施之前,就达到危险能力门槛。
这种失败不需要模型拥有恶意人格。它可能始于不完美的目标、情境性欺骗、未经授权的持续存在,或遭人类操作者利用。
现有证据并未证明,从具备能力的编程代理到人类灭绝之间存在不可避免的发展路径。每一步都包含关于自主性、访问权限、策略和安全保障有效性的重大假设。
不过,不能仅因为最终结果听起来极端,就忽视这一机制。安全规划通常会在现实世界中每个环节尚未出现之前,就考虑可能的失效链条。
相关检验在于,实验室能否识别中间预警信号。这些信号包括模型完成长期技术项目、隐藏不良行为、绕过监控,或加速 AI 开发。
这正是为什么 Anthropic 的 AI 安全警告关注的是一场竞赛,而不是单一产品缺陷。被担忧的结果取决于多家机构积累的能力、部署选择和激励机制。
Anthropic 的安全承诺正与竞争现实发生碰撞
Anthropic 的公开安全保障承认灾难性危险,但也揭示了单方面克制已变得多么困难。
Anthropic 创立时便将安全作为一项决定性承诺。其政策将灾难性滥用和自主性失调视为风险,要求在最危险能力出现之前做好准备。
这使得公开争议更具影响力。Coxon 批评的并不是一家完全忽视 AI 安全的公司。他认为,即使是最重视安全的实验室之一,仍然受困于竞争激励。
Anthropic 的《负责任扩展政策》最早于 2023 年发布。随着模型、威胁和政治环境发生变化,该公司已多次修订这一政策。
该框架使用能力阈值来决定何时应采取更严格的安全保障措施。相关措施包括评估、访问控制、安全要求、内部审查、红队测试和部署限制。
这是一个严肃的治理结构,但它并不等同于可执行的公共规则。Anthropic 定义该框架、衡量其系统、解读证据,并更新要求。
外部审查人员可以检查流程的部分环节。政府可以调查或监管特定活动。但目前两者都无法为所有前沿实验室设定一项具有约束力的全球限制。
Anthropic 在 2026 年的政策更新中直接指出了这一困境。整体危险取决于多个开发者,而不只是某一家公司的行动。
如果负责任的开发者停下脚步,而较不谨慎的竞争者继续推进,最终的世界可能会变得更加危险。这一逻辑削弱了单方面暂停的实际效力。
它也说明了为何自愿承诺会在压力下发生动摇。每家实验室都可以声称,必须继续开发,因为其他人会继续推进。
于是,安全竞赛开始类似于军备控制问题。每个参与者都更希望共同克制,却又担心率先行动的后果。
Coxon 的辞职挑战了 Anthropic 对这一问题的回答。他认为,加速对齐工作并不能为加速迈向研究人员无法对齐的能力提供正当理由。
对齐意味着确保系统能够可靠地追求预期目标,包括在陌生情境中。现有技术可以改善行为,但无法为未来每一种情境提供数学上的确定性。
开发者采用监督训练、宪法规则、对抗测试、可解释性研究和自动化监控。每种方法都只能解决问题的一部分。
模型在意识到自己正接受评估时,仍可能表现出不同的行为。监控可能遗漏陌生策略。可解释性工具可以揭示模式,却未必能完全说明系统的推理过程。
这些局限并不意味着现有保障毫无用处。它们意味着,这些保障所能支撑的信心程度仍存在争议。
Anthropic 自身的安全路线图提供了一个颇具启示性的基准。该公司表示,先进系统最早可能在 2027 年自动化或大幅加速顶尖研究团队的工作。
这一预测之所以重要,是因为自动化 AI 研究接近 Coxon 所担忧的机制。它将让模型直接参与构建其后继者。
路线图还列出了尚未完成的安全与对齐工作。一些项目仍需要原型、运营测试,或对可行性作出判断。
例如,Anthropic 探索了隔离网络和对敏感工作流程实施更严格的控制。它还研究了用于证明输出来自预期模型权重的方法。
这些项目应对了真实威胁,包括模型窃取和破坏活动。它们的存在也证实,在能力不断提升的同时,必要的安全体系仍在搭建之中。
这正是这一故事背后的反转。Anthropic 的安全计划并未推翻 Coxon 的警告。它同时记录了公司的努力与尚存的不确定性。
该公司可以合理地认为,它所做的比许多竞争对手更多。Coxon 也可以合理地回应:当潜在损失不可逆转时,相对谨慎并不足够。
开发者和企业买家都应关注这一点,因为同样的激励机制塑造着产品部署。客户希望智能体运行更久、访问更多系统,并需要更少监督。
这些特性提高了经济价值,也扩大了错误、操纵、凭证被盗或监控不足所带来的后果。
企业不必接受灭绝情景,才能据此采取行动。它应当将自主性、权限和可审计性视为当下的运营风险。
使用 AI 进行研究的团队,应将原始材料、决策和模型输出保留在可检索的知识库中。这份记录有助于人们检查智能体使用了什么,以及其建议如何发生变化。
这类控制措施无法解决前沿对齐问题。但它们可以减少由来源不清、上下文缺失或未经核查的自动化操作导致的较小失败。
10% 的灭绝估计是一项警告,而非测量结果
这一数字性主张引人关注,但没有经过验证的模型能够确立其精确性,甚至无法确定其正确的数量级。
Hubinger 超过 10% 的估计是这个故事中最令人印象深刻的部分,也是最容易被误解的细节。
概率预测通常依赖可比观察、经过检验的模型,或能够随时间评估的事件。由先进 AI 导致的人类灭绝不具备这些基础中的任何一项。
研究人员转而基于不确定的假设构建主观估计。他们考虑未来能力、开发速度、滥用、对齐失败、机构应对和可能的恢复措施。
任何一个假设的微小变化,都可能改变最终数字。不同专家可以审视相似证据,却得出截然不同的结论。
因此,这一估计不应被表述为 Anthropic 的预测。Hubinger 表达的是他个人的信念,尽管他的职位令这些信念具有机构层面的相关性。
Anthropic 的官方文件讨论了灾难性风险,但没有为公司给出公开的人类灭绝概率。它们侧重于阈值、威胁模型、评估和缓解措施。
这种区分有助于避免两种相反的错误。一种是将 10% 视为已被科学确立的结论。另一种是把不确定性当作风险为零的证据。
Coxon 的批评者可以合理追问:为何一位认为该技术如此危险的研究人员会参与其开发。他们也可以质疑,戏剧化的公开措辞究竟能改善政策,还是主要吸引注意力。
当表述将多个推测性步骤压缩为一则标题时,这种批评会更有力。能力增长并不会自动产生自主性、欺骗、访问权限或成功抵抗干预的能力。
当前模型仍然脆弱。它们会产生事实幻觉、在长任务中失去线索、错误处理陌生界面,并且往往需要大量纠正。
即便在基准测试中表现出色,也不能证明模型能够在现实世界中可靠运行。实验室评估可能高估或低估实际危险。
还存在选择性问题。公共讨论会奖励极端确定性,无论是乐观还是灾难性的确定性。与关于繁荣或灭绝的主张相比,细致的估计获得的关注较少。
因此,负责任的分析必须让验证缺口始终可见。公开报告中引用的证据没有显示,当前任何 Anthropic 模型能够独立威胁人类。
相反,离职报道描述的是一条令人担忧的发展路径。它将自我改进系统与失去有意义的人类控制的可能性联系起来。
这一路径仍是一种情景,而非已经观察到的结果。它的价值在于,在危险转变变得不可逆之前识别它们。
恰当的政策回应不取决于证明 10% 是否精确。如果后果包括全球性灾难,风险即便小得多,也可能足以证明采取行动是合理的。
然而,干预的规模仍需要证据。影响研究、商业、国家安全和技术获取的措施,需要透明的标准。
这些标准应区分当前伤害与未来情景。当前关切包括网络滥用、生物领域协助、欺诈、监控、劳动力扰动以及不可靠的自动化决策。
未来关切包括逃避监督、复制自身、获取资源,或以快于机构应对速度改进 AI 研究的系统。
将所有危险归入一个类别会令治理更困难。它会让怀疑者把已有记录的现实伤害与推测性灭绝风险一并驳回。
更有力的方法是采用可衡量的能力阈值。监管机构和实验室可以测试模型是否能够完成长期自主任务、发现漏洞、隐藏行为,或协助危险研究。
在安全规则允许的情况下,独立评估者应能够复现这些发现。公开摘要应说明方法、局限和分歧。
预测也需要校准。发布概率估计的研究人员应记录其假设,并在证据变化时更新这些估计。
这不会让灭绝风险成为一门精确科学。但它会揭示,警告是否会一致地响应可观察的发展。
因此,怀疑性的结论有所限制,却很重要。Hubinger 的数字并不能证明人类面临超过 10% 的灭绝风险。
他的角色和推理仍使这一警告具有新闻价值。一位资深对齐研究人员认为,其所在领域周边的控制措施不足以将危险降至可接受水平。
这是关于专家担忧和机构信心的证据。它并不是预测结果必然发生的证据。
OpenAI 和 Anthropic 面临同样的集体行动陷阱
这些实验室在能力上竞争,同时要求社会建立任何一家公司都无法施加于另一家的约束。
Coxon 同时点名 Anthropic 和 OpenAI,是因为它们的战略共享一个基本矛盾。每家实验室都在开发能力更强的模型,同时警告未来模型需要更强的治理。
两家公司都无法控制更广泛的竞赛。前沿开发还涉及 Google DeepMind、Meta、xAI、国家实验室、初创企业和国家支持的项目。
其中一方实施具有约束力的暂停,并不会阻止其他方。相反,它可能会将人才、资本和战略优势转移给较不谨慎的组织。
这种可能性支持 Anthropic 继续参与的论点。一家具有技术能力、重视安全的实验室,或许能够影响标准,并开发原本会更晚出现的保护措施。
然而,同样的论点也可能为无止境的加速提供理由。每个组织都可以声称,必须保持在前沿附近,才能保留对结果的影响力。
结果是形成了一种很少有参与者称之为安全的竞争均衡。实验室持续扩展规模,因为单独停止在战略上看似并不理性。
Coxon 指控的是,领导者在没有民主授权的情况下接受了这种均衡。私营企业高管和研究团队作出的决定,其所宣称的后果远远超出股东或客户的范围。
竞争竞赛分析描述了领导者一边呼吁克制,一边推进自身系统。它将这一困境呈现为实验室无法独立解决的问题。
政府干预似乎提供了一条出路。共同规则可以防止一家谨慎的公司仅仅因为遵守更严格的安全要求而失去竞争优势。
有效规则需要明确的适用范围、可信的执行机制、安全的信息共享,以及主要 AI 生产国家之间的协调。
设计不佳的规则可能带来新的风险。它们可能巩固最大企业的地位、将开发推向秘密状态、暴露敏感模型细节,或固化无效的安全实践。
全球协调带来了更困难的问题。各国政府将 AI 能力视为经济和国家安全优势。
一个国家可能不信任另一个国家的评估,或怀疑存在未公开的开发活动。当训练方法、硬件使用和模型权重具有战略价值时,验证就会变得困难。
历史上的军控协议表明,竞争对手仍然可以共同应对风险。它们也表明,核查与执行需要多年谈判和持续的政治支持。
AI 的发展速度快于大多数条约进程。这一时间差强化了对立即采取自愿性安全措施的呼声,即使这些措施仍不完善。
近期最务实的做法或许是结合多层机制。实验室可以维持内部阈值,独立评估者可以测试模型,政府则可以强制要求事故报告。
算力提供商可以支持对最大规模训练任务的监督。云服务运营商和模型托管方可以围绕特别危险的能力实施访问控制。
研究人员也需要受保护的渠道来提出担忧。Coxon 的辞职表明,当员工认定内部流程无法改变发展轨迹时,可能会发生什么。
仅靠举报人保护并不能决定一个模型是否安全。但它们可以揭示那些经过精心修饰的政策文件所掩盖的分歧。
公司治理同样重要。董事会和安全机构需要能够实质性获取证据,拥有推迟部署的权力,并受到保护,免遭商业报复。
透明度不能止步于发布原则。读者应当知道能力阈值何时被突破,随后采取了哪些缓解措施,以及还存在哪些不确定性。
由于详细发现可能助长滥用,部分信息需要进行删节。但删节不应成为阻止外部审查的笼统理由。
独立审查者需要获得底层证据。他们的职责应包括质疑假设、测试替代性解释,以及报告尚未解决的争议。
企业客户也可以施加压力。对评估结果、审计日志、权限和事故通知提出采购要求,能够激励更安全的部署实践。
开发者应将智能体访问视为一道安全边界。模型应只获得完成指定任务所需的工具和数据。
人们应在关键行动前保留审查节点。修改生产代码、转移资金、联系客户或访问敏感记录的系统,都需要明确的控制措施。
这些措施应对的是当前的运营风险。它们并不能解决 Coxon 对自我改进型超级智能的担忧。
这一更大的问题要求实验室证明,其安全措施能够随能力提升而扩展。如果竞争压力一再改变公开承诺的含义,这些承诺将难以令人信服。
三个信号将表明这一警告是否带来改变
下一个考验是,在 AI 系统显著提升自动化 AI 研究能力之前,公众警觉是否会转化为可衡量的约束。
第一个信号是 Anthropic 的下一份风险报告,以及其 Responsible Scaling Policy 的任何修订。该公司表示,会每三到六个月发布一次风险报告,并进行必要删节。
读者应关注有关自主研究、破坏活动、情境意识和长期技术工作的证据。还应考察新的发现是否触发了更严格的限制。
如果一份报告确认能力正在提升,并施加新的控制措施,将强化 Anthropic 的安全论据。如果报告描述了日益增加的危险,却没有改变运营方式,则会支持 Coxon 的批评。
第二个信号是 Anthropic 是否在其设定日期的安全路线图上取得进展。该公司列出了截至 2026 年 9 月 30 日的目标,涉及安全原型和验证方法。
仅仅完成这些目标,并不能证明安全性已经充分。关键问题在于测试、覆盖范围、失效模式,以及在敏感工作流程中的部署。
延误将具有重要意义,因为 Anthropic 预计 AI 能力会快速进步。在推出更强模型的同时一再推迟安全期限,将扩大可信度差距。
成功的原型将提供证据,表明该公司能够将政策转化为技术控制。独立验证将使这些证据更具说服力。
第三个信号是覆盖多家前沿实验室的共享监管或行业机制。共同规则可以应对 Anthropic 自身所承认的集体行动困境。
有价值的进展包括强制性灾难风险评估、标准化事故报告、受保护的信息披露,以及独立获取安全证据的渠道。
缺乏执行机制的狭义自愿承诺不会带来多少改变。竞赛仍会奖励那些最灵活解读自身承诺的参与者。
具有约束力的框架无法消除不确定性。但它会将关键决策置于私人实验室管理之外,并为无视既定阈值创造后果。
应将这三个信号结合起来解读。强有力的内部政策无法完全约束竞争对手,而监管也不能替代技术安全研究。
Anthropic 的 AI 安全警告值得关注,因为它揭示了这种尚未解决的依赖关系。社会正被要求信任连其设计者自己都称尚未完成的安全措施。
读者应避免恐慌,也不应自满。没有经过验证的依据表明,到 2030 年人类灭绝是既定结局。
同样,也几乎没有理由忽视一场可信的内部争议——其焦点是旨在超越人类研究人员的系统。不确定性正是需要审查的理由,而不是推迟审查的借口。
每当实验室宣布推出更自主的模型时,都应提出一个务实的问题:出现了什么新能力?哪项安全措施成为强制要求?又是谁独立测试了它?
如果公司无法回答这三个问题,公众所看到的就不是一个与发展速度同步的安全体系,而是一个承诺:在有人证明并非如此之前,这场竞赛仍将处于可控状态。



