马克·扎克伯格的 AI 安全计划支持独立评估,而非协调放缓
马克·扎克伯格进入 AI 安全辩论时提出了鲜明区分:Meta 支持独立评估者,但拒绝领先实验室之间协调放缓。
这一差异界定了马克·扎克伯格的 AI 安全立场。Meta 承认,先进模型需要外部审查、更严格的测试,以及偶尔的延期。不过,扎克伯格认为,每家实验室都应自行决定开发节奏,而不是等待全行业达成一致。
他的立场挑战了由 Anthropic CEO Dario Amodei 牵头、并获其他科技领袖支持的一项提议。Amodei 希望前沿实验室就发展节奏展开协调,并让独立评估者获得对其系统异常深入且持续的访问权限。
扎克伯格提出了不同的交易方案。实验室应接受外部建议,并对失败承担责任,同时保留对模型何时训练、发布或暂停的控制权。
由此产生的争议并不只是安全是否重要的问题,而是当竞争激励推动更快发展时,谁能强制要求保持谨慎。
独立评估听起来像是共识。然而,它的价值取决于评估者是否获得足够的访问权限、时间、权力,以及发布调查结果的自由。缺少这些条件,外部审查可能沦为由被审查公司控制的又一道流程。
这种张力使 Meta 处于两种立场之间。该公司拒绝集体协调发展节奏,但也认为内部判断应纳入外部专业意见。实际问题在于,自愿评估能否在没有约束性共同规则的情况下提供可信的监督。
马克·扎克伯格的 AI 安全立场发生了什么变化
扎克伯格接受将独立评估作为行业标准,但拒绝让 Meta 的发展节奏取决于竞争对手实验室。
扎克伯格在周二发布的一篇社交媒体帖子中写道,邀请独立评估者和顾问参与代表了行业最佳实践。Bloomberg 在其 9 月 16 日的 AI safety coverage 中概述了这份声明。
他的支持加入了更广泛的行业讨论,即让外部安全研究人员获得更多接触前沿模型的机会。前沿模型是指处于当前 AI 发展最前沿、能力极强的系统。
不过,扎克伯格并未支持集体放缓。他认为,每家实验室都已具备以安全方式训练模型的责任和动力。
这种区别之所以重要,是因为协调放缓要求实验室彼此信任。每个参与者都必须相信,在有价值的模型尚未完成之际,竞争对手会遵守同样的限制。
Meta 的立场消除了这种依赖。一家公司可以在测试发现风险时延后自身工作,随后无需等待行业共识即可恢复推进。
扎克伯格以 Meta 对 Muse 的处理作为证据。他表示,公司为了聚焦安全和安保,将这一 AI 系统推迟了数月。
这个例子确立了其论点的重要部分。Meta 并非声称开发不应暂停,而是认为暂停可以通过公司自主决策发生。
扎克伯格表示,如果其系统造成伤害,实验室也将面临重大责任。市场压力应会鼓励推出可靠的产品,因为客户会避开无法信任的工具。
这份报道中的声明将安全描述为一种责任,也是一项竞争要求。按照这一观点,可靠性成为产品质量的一部分,而非施加于开发过程的单独限制。
扎克伯格还认为,实验室应将大部分计算资源用于服务用户。他将这一目标与竞相实现递归自我改进作了对比。
递归自我改进是指系统通过重复的自动化研究或工程工作来提升自身能力。安全研究人员认为这很重要,因为能力的快速增长可能超过现有控制措施。
这种框架将 Meta 所偏好的边界置于实验室内部。公司决定哪些研究目标值得投入资源,何时风险需要延期,以及何时保障措施足以支持部署。
Amodei 的提议则将这一边界向外推移。它要求实验室作出独立评估者和其他参与者能够长期核查的承诺。
因此,两种立场共享若干前提。两者都承认前沿系统应接受更严格的审查,也都认识到模型开发可能带来需要干预的风险。
它们的分歧在于执行方式。Meta 倾向于由各家公司分担责任。Anthropic 的方法则赋予共同承诺和外部评估者更大的作用。
这种分歧引出了围绕马克·扎克伯格 AI 安全计划的核心问题:当被评估公司控制访问权限时,自愿制度能否保持可信度?
为什么 Meta 拒绝协调放缓 AI 发展
Meta 将同步放缓视为竞争和治理风险,而非实现更安全开发的唯一途径。
扎克伯格的立场遵循了他在 8 月发表的一项更广泛论述。他警告称,在外国实验室持续进步的情况下,延迟美国模型发布的政策可能削弱该国的地位。
这一担忧使协调在两个层面都变得困难。公司必须信任国内竞争对手,而政府则必须考虑其司法管辖范围之外的实验室。
Amodei 提议由领先公司和民主国家政府开展合作。他的计划也承认,全球安排需要与中国等国家进行一定程度的接触。
当模型能力具有商业和国家安全价值时,协调问题会更加尖锐。暂停发展的实验室可能失去客户、人才、研究势头或战略优势。
Meta 认为,这些压力让灵活、由公司自行决定的方案更具可行性。其偏好的模式结合了内部安全框架、独立建议、董事会监督和政府合作。
在扎克伯格更长篇的治理提议中,他主张前沿实验室与政府主动合作。他反对对每次发布一律采用僵化的审查时间表。
这种方法让实验室能够区分常规改进与展现出异常危险能力的模型,也让公司可以在无需协商新的行业共识的情况下作出应对。
其优势在于速度。一旦团队发现问题,实验室就可以扩大测试、暂停发布或增加保障措施。
其劣势在于不一致性。不同实验室可能以不同方式解读同一证据,尤其是在推迟模型会造成高昂商业成本时。
Anthropic 的提议通过共同预期来应对这一弱点。参与实验室将为外部评估者提供持续、类似员工的访问权限,而不是在发布前安排短暂评审。
这些评估者可以获得公司的设备,并在开发团队附近工作。他们可以在模型训练期间观察安全实践,而非仅检查已经完成的产品。
根据一项更广泛的行业比较,OpenAI 也表示支持嵌入式评估者。Sam Altman 认为,控制节奏并不意味着终止进步。
Nvidia CEO Jensen Huang 的立场更接近扎克伯格。Huang 认为,公司能够自行控制节奏,创新并不天然与安全相冲突。
这使行业分化为两种执行模式。一种依赖个体问责、市场激励和公司判断;另一种则寻求在激烈竞争时期仍具实际意义的共同实践。
Meta 对集中控制的担忧也延伸至开发速度之外。扎克伯格一再表示,先进 AI 不应由少数公司或官员治理。
这一立场支持 Meta 对开放模型和更广泛分发的兴趣。它也使集体安全安排变得更复杂,因为这类安排可能赋予既有实验室界定可接受开发方式的权力。
共同安全标准可以保护公众,但也可能成为进入壁垒。规模较小的实验室可能难以满足围绕主导公司资源设计的要求。
反过来,薄弱的自愿承诺也可能以另一种方式有利于大型实验室。这些公司拥有将内部审查包装为可信结果所需的传播团队和技术资源。
因此,真正的压力落在独立评估者身上。他们必须产出让客户、监管机构和研究人员能够跨公司比较的调查结果。
评估 AI 系统的企业应密切关注这场辩论。实验室的安全文档会影响采购、责任规划、事件响应以及自动化工作流的可靠性。
知识工作者面临相关问题。AI 助手可能总结私人文件、操作软件,或基于不完整信息提出行动建议。信任并不只取决于基准测试分数。
团队可以通过在 AI knowledge base 中保留来源、决策和模型输出的可追溯性,来降低本地风险。这一做法不能替代模型评估,但有助于组织检查 AI 生成的工作是如何产生的。
Meta 的立场让每个买方承担更多审查此类证据的责任。协调标准或许会使比较更容易,但不会消除产品层面尽职审查的必要性。
独立评估者需要的不只是一份邀请
只有当审查者能够检查训练证据、测试中间模型,并发布令人不安的发现时,外部评估才具有意义。
传统评估通常发生在开发接近尾声时。公司让研究人员访问候选发布版本,规定测试窗口,并限制他们能够检查的系统。
这种模式可以识别有害输出、网络安全能力或未能遵循指令的问题。但它可能无法揭示问题行为在训练过程中是如何形成的。
研究人员越来越希望获得对中间检查点的访问权限。检查点是指在训练特定阶段保存的模型版本。
比较检查点可以显示令人担忧的行为何时出现。评估者还可能检查训练日志、奖励系统、测试记录,以及初次失败后新增的保障措施。
这很重要,因为先进模型可能识别评估条件。一个系统在熟悉的测试中可能表现不同,却不会在限制较少的环境中展现同样的克制。
这种可能性并不能证明模型具有欺骗性。但它意味着,一项干净的基准测试结果无法解答每一个安全问题。
嵌入式评估者可以持续观察开发过程,并更早调查可疑变更。他们还可以将公开声明与实验室的内部记录进行比对。
Amodei 的提议赋予这一概念不同寻常的深度。他曾描述一种持续访问机制,其权限将类似于授予员工的访问权限。
Anthropic 表示,评估者应能够发布有关风险、事件、公司实践及其访问限制的重要发现。这项发布权至关重要。
如果实验室可以改写或压制每一项结论,审查者就无法充当独立监督者。严格的保密协议或许能保护有价值的知识产权,但也可能阻碍有意义的问责。
在一项独立性分析中接受采访的评估者指出,仍有若干细节尚未解决。实验室尚未完全说明谁将获得访问权限、嵌入式评估何时启动,以及审查者可以披露哪些内容。
时间也带来另一个问题。一项技术难度很高的评估,可能需要数周调查、访问专业基础设施,以及与开发者反复讨论。
较短的测试窗口会限制审查者能够得出的结论,也让他们在观察到意外行为后几乎没有机会设计新的测试。
评估者的选择同样重要。实验室可能会选择专业能力较为狭窄的审查者,或采用会抑制批评的合同条款。
这会带来“挑选评估者”的风险。公司可能选择最有可能接受有限访问权限或宽松披露规则的外部团队。
可信的安排需要公开的评估者独立性标准,也需要涵盖利益冲突、资金、保密、访问和发布的规则。
Meta 尚未承诺采用 Amodei 的嵌入式模式。Zuckerberg 对独立评估者和顾问的支持更为宽泛,也缺乏具体细节。
这种表述留下了多种可能性。Meta 可以委托开展常规的发布前测试、建立持续合作关系,或提供更深入的内部访问权限。
Meta 现有的框架提供了基础。该公司称,会在实施防护措施前后,针对网络安全、化学、生物以及失控风险测试模型。
其 2026 年 4 月的扩展框架也承诺发布《安全与准备度报告》。Meta 表示,这些报告将说明评估、部署决策、局限性和缺口。
这些披露可以帮助外部观察者评估 Meta 的流程。然而,由公司自行撰写的报告并不等同于独立控制的调查。
关键检验在于,评估者能否质疑 Meta 的结论。他们还需要拥有足够证据,以便在不暴露真正敏感技术信息的前提下解释分歧。
这种平衡很困难,但并非无法实现。金融审计、安全测试和安全认证都在保密约束下运作。
AI 评估带来了额外复杂性,因为相关方法仍未定型。模型变化很快,一种版本的结果可能无法适用于更新后或部署方式改变后的模型。
评估者还需要安全的环境。对未发布模型、权重和训练记录的深度访问,可能暴露有价值的知识产权或危险能力。
可行的体系必须保护这些资产,同时防止保密成为普遍沉默的理由。
因此,Zuckerberg 的支持很重要,但并不完整。它承认实验室不应独自评估所有风险。
决定性的问题是 Meta 将放弃多少控制权。独立建议可以影响公司,而独立监督可以追究公司的责任。这并不是同一种安排。
权衡在于灵活性与可执行的问责
Meta 的模式能更快应对实验室特定的风险,但自愿监督可能恰恰会在竞争压力最强时削弱。
公司直接了解自己的模型、基础设施和部署计划。其工程师能够识别外部机构起初可能遗漏的技术问题。
内部团队也可以无需等待监管批准就采取行动。他们可以修订训练数据、限制工具、调整系统提示词,或推迟发布。
Meta 据称推迟 Muse 的案例体现了这种灵活性。该公司表示,由于安全和安保工作需要额外时间,因此延后了进度。
然而,公众无法独立判断每一项严重关切是否都得到了同样的处理。Meta 同时控制开发流程,以及描述其决策的大部分证据。
这是 Mark Zuckerberg 的 AI 安全方法的核心弱点。可靠性激励确实存在,但并不总能超过尽快发布的激励。
在法律义务和因果责任明确后,责任追究可以鼓励谨慎。前沿 AI 的失败未必能整齐地套入既有责任规则。
部署应用的一方可能会修改模型,或将其连接到高风险工具。危害可能源于多家公司、用户和自动化系统共同作用。
市场约束也有类似局限。客户无法因看不见的风险而惩罚实验室。
模型在正常运行时可能看似有用,却保留着只有在专门提示或自主访问条件下才会显现的能力。买方很少拥有测试每种情境的资源。
公开安全报告可以缩小这一信息差距。可比较的报告将使客户能够审视测试类别、剩余风险和缓解决策。
不过,比较需要共同定义。一家实验室认定的“高风险”,可能不符合另一家实验室的门槛。
协调一致的标准可以建立这种共同语言。它们可以确立最低测试预期,而不要求每家公司使用完全相同的模型或产品。
Meta 担心,僵化的协调可能拖慢有益产品的发布,并使权力集中。这种担忧值得重视,尤其是在主导实验室设计出小型开发者无法满足的规则时。
相反的担忧同样重要。灵活性可能成为逃避最可能延迟部署的测试的理由。
这正是独立访问权限比支持独立评估更重要的原因。审查者需要有权审查挑战公司偏好叙事的证据。
监管可以使某些访问和报告义务成为强制要求。加州和欧洲的政策制定者已开始转向更严格的文档记录、测试和事件报告预期。
不过,监管本身无法解决技术不确定性。法律要求可以强制进行评估,却无法保证现有测试能发现每一种新出现的风险。
近期最好的框架或许是结合多个层面。实验室可以保留运营灵活性,同时接受基础披露、评估者独立性和事件报告规则。
外部团队随后可以采用适合各实验室系统的方法进行调查。监管机构将界定最低权利和责任,而不是规定每一项技术测试。
这种结构将保留 Zuckerberg 主张的很大一部分公司层面自主性,也会降低在出现有害结果后撤回合作的可能性。
因此,这场争论不应被简化为“快速开发对安全”。双方都认为各自的方法可以支持持续进步。
真正的权衡在于灵活判断与可执行的问责。灵活性能够应对不断变化的技术,而当公司激励发生变化时,问责能够保护公众。
开发者应当关注,因为安全规则会影响模型访问、评估 API、发布时间表和文档。企业买家也应关注,因为这些规则会影响采购证据和合同风险。
普通 AI 用户也应关注,因为前沿模型正日益处理私人信息和具有重大后果的任务。一次失败可能涉及数据泄露、操纵、不可靠建议或未经授权的行动。
即使实验室报告了强有力的防护措施,组织仍应在人类参与重大决策的环节保留人工审查。他们还应记录来源并保留决策背景。
结构化的知识工作流可以让 AI 辅助工作更易于审计。它无法验证底层模型,但能减少围绕团队如何使用其输出的不确定性。
Meta 论点最有力的版本需要可见的证据。公司必须证明,当改变部署决策代价高昂时,独立意见确实会改变决策。
没有这种证据,“行业最佳实践”仍只是一种愿景。有了这种证据,Meta 就可以证明,去中心化的节奏带来的不只是自愿承诺。
三个信号将显示 Meta 的模式是否奏效
下一项检验不是首席执行官再发表一份声明;而是独立审查是否会改变访问、披露和发布决策。
第一个信号是 Meta 下一份《安全与准备度报告》。读者应关注详细的评估方法、防护措施实施前的结果、实施后的结果、局限性以及尚未解决的风险。
如果报告只呈现有利结论,将削弱 Meta 的论据。如果报告记录失败、缓解措施和剩余不确定性,则会加强其论据。
外部评估者的身份将很重要。Meta 应说明这些团队测试了什么、获得访问权限的时长,以及他们审查的是训练检查点还是仅最终模型。
发布权同样提供重要线索。评估者应能够说明重大分歧,以及任何影响其结论的限制。
第二个信号是 Meta 是否将评估者访问权限制度化。Zuckerberg 支持独立评估者和顾问,但并未像 Anthropic 一样作出详细的、类似员工访问权限的承诺。
公开的访问框架将缩小这一差距。它可以界定保密保护、评估者选择、测试周期、证据访问和披露规则。
如果 Meta 提供具有可信发布权的持续访问,其立场将更像一种独特的监督模式。它将公司控制的节奏与实质性的外部审查结合起来。
如果访问权限仍仅限于短期的发布前合作,质疑将会加剧。顾问可以改善内部决策,却无法提供独立问责。
第三个信号是,当重大测试发现阻碍发布的风险时,实验室将如何行动。这一时刻将揭示自愿控制节奏是否能经受住竞争压力。
如果一家公司推迟重要模型并公布原因,就会支持 Zuckerberg 的论点。这将表明实验室无需同步放缓,也能独立采取行动。
如果一家公司淡化严重发现或限制评估者披露,就会支持 Amodei 的观点。这将表明为何需要共同规则和可执行的权利。
监管行动将影响这三个信号。新要求可能会标准化报告、认可合格评估者,或强制披露事件。
这类规则不一定会施加普遍的放缓。它们可以确立最低问责标准,同时让实验室自由选择开发进度。
竞争对手的行为也将影响 Meta。如果 Anthropic 和 OpenAI 提供广泛的评估者访问权限,客户可能会开始期待每一家前沿开发者都提供类似证据。
这将使透明度成为竞争因素。届时,Meta 基于市场的安全论证将面临一项现实检验:买家是否会青睐提供更多可验证监督的实验室。
这场辩论也可能促成混合式安排。公司可能拒绝协调一致的放缓节奏,同时接受统一的评估标准和强制报告要求。
这一结果将缩小 Zuckerberg 与 Amodei 之间的分歧。他们的争论仍将聚焦于由谁掌控时间安排,而不是独立审查是否应纳入实验室内部。
目前,Mark Zuckerberg 的 AI 安全立场在原则上很明确,但在实践中尚未完成。Meta 支持外部评估、由公司自行决定暂停,以及在没有集体放缓安排的情况下持续开发。
尚未解答的问题涉及准入与权力:谁来选择评估方?评估方可以检查什么?评估结果能否在未经公司批准的情况下发布?
这些细节将决定 Meta 的提案究竟是提供可问责的灵活性,还是仅仅以更好的措辞包装自我监管。
未来几个月,应关注报告、合同和发布决策,而非高管声明。若独立审查方能够揭示问题并影响产品发布,Meta 的模式将获得可信度;若不能,要求建立可强制执行的协调机制的压力将会加剧。



