top of page

Meta CEO 倾向评估者而非放缓 AI,拒绝共同踩刹车

9月17日
讀畢需時 15 分鐘

在 Mark Zuckerberg 拒绝为先进模型开发设置协调式刹车后,Meta CEO 倾向评估者而非放缓 AI。他的立场在业内形成了鲜明分歧。Meta 支持外部安全审查,但不支持让竞争对手共同决定开发节奏。

Zuckerberg 认为,每家实验室都应自行决定何时需要暂停自身的工作。他表示,竞争、法律责任和客户预期已足以促使开发者避免发布不安全的产品。独立评估者应检验这些决定,但不应共同控制这一领域的发展速度。

这一立场让 Meta 更接近 Nvidia CEO Jensen Huang,而非 Anthropic CEO Dario Amodei。Amodei 提出了协调推进节奏、共享安全标准、政府参与,以及给予外部评估者异常深入的访问权限。正在形成的分歧并不在于安全是否重要,而在于当安全与竞争速度发生冲突时,谁应拥有决策权。

Meta 实际上如何改变了 AI 安全辩论

Zuckerberg 将独立评估与协调式约束区分开来,使两个相关的安全提案变成了相互竞争的路径。

在 9 月 15 日的一则社交媒体帖子中,Zuckerberg 表示,与独立评估者和顾问合作是行业最佳实践。他补充称,Meta Superintelligence Labs 已在多个安全领域采用外部评估者。

该声明回应了围绕放缓前沿 AI 的更广泛讨论,即当前正在积极开发的、能力最强的模型。Anthropic、OpenAI 及多位知名科技领袖近期都支持更强力度的节奏控制措施。

节奏控制并不一定意味着停止所有 AI 研究。它是指当安全系统无法跟上模型能力发展时,有意放缓特定的开发或部署工作。

Zuckerberg 拒绝了实验室有必要就这一决定进行协调的观点。他认为,每个开发者都既有责任也有能力自行调整速度。

据一份 AI 安全报告 报道,Zuckerberg 写道:“每家实验室都有责任和动力,以安全训练其模型所需的节奏推进。”他说,每家实验室都可以采取自身的保护措施,无需等待竞争对手。

Meta 将其推迟发布 Muse 作为这一做法的证据。Zuckerberg 表示,公司在处理安全与保障问题期间,将这款个人 AI 智能体搁置了数月。

这个例子之所以重要,是因为它表明 Meta 并不认为速度应始终占上风。当公司自身团队认定产品尚未准备就绪时,公司接受暂停。

分歧始于私人延迟演变为集体承诺之时。Meta 不希望其内部安全决定取决于 Anthropic、OpenAI 或其他公司是否作出同样选择。

Zuckerberg 还将安全与公司如何分配计算资源联系起来。他认为,实验室应将大部分计算能力用于服务人们的产品,而不是递归式自我改进。

递归式自我改进是指 AI 系统改进用于构建其后续版本的工具或流程。研究人员担心,这一循环可能让开发速度快于现有监控系统的应对能力。

因此,Meta 的立场包含数项不同承诺。它支持内部审慎、外部测试,以及限制风险最高的发展路径。它拒绝将竞争实验室绑定于统一节奏的行业共同刹车。

Bloomberg Intelligence 分析师 Matthew Bloxham 将这一事件描述为独立评估与更广泛放缓之间的选择。尽管实际界限仍不那么清晰,这种表述抓住了标题所反映的冲突。

一家实验室可以欢迎评估者,同时限制其访问权限、授权范围或发布权利。它也可以拒绝协调节奏控制,同时自愿推迟某个具体模型。真正的政策问题是,这些决定将如何变得可见且可执行。

对开发者和企业客户而言,这一区别影响的不只是企业宣传。它决定了安全门槛是成为共同要求,还是仍是每家实验室内部不同的规则。

如果每家公司独立定义就绪状态,买方就必须解读多项彼此不兼容的安全声明。外部评估可以提供帮助,但前提是其方法和发现足够透明。

因此,Meta CEO 倾向评估者而非放缓 AI,不只是关于快速推进的声明。Zuckerberg 正在提出一种特定的治理结构:公司控制、外部建议、市场约束,以及逐案作出的发布决定。

Meta CEO 为何倾向评估者而非放缓 AI

Meta 的做法在提供可见的外部审查回应的同时,保留了管理层控制权。

Zuckerberg 的第一项论点是经济层面的。客户不会持续使用那些无视指令、行为不可预测或带来不可接受风险的智能体。从这一角度看,对齐部分是一项产品质量要求。

对齐是指让模型行为与既定目标和人类指令保持一致。对齐不佳的智能体不仅是理论上的危险,也可能成为不可靠的产品。

Meta 的第二项论点关乎责任。发布有害系统的公司可能面临诉讼、调查、合同纠纷和声誉损害。Zuckerberg 表示,这些后果为实验室谨慎行事提供了强大动力。

他的第三项论点是运营层面的。一家公司已经掌控其训练计划、计算资源、内部测试和发布流程。它可以放缓高风险项目,而无须协商行业协议。

独立评估者恰好契合这一框架。他们可以挑战内部假设并测试模型行为,同时将最终开发决定保留给公司领导层。

这一安排对 Meta 很有吸引力,因为它在不转移战略决策权的前提下增加了审查力度。它也避免了可能限制公司与其他前沿实验室竞争速度的协调安排。

Meta 长期以来一直将竞争和广泛获取视为制衡权力集中的机制。Zuckerberg 曾表示,如果仅允许少数公司控制先进系统,本身也会带来安全风险。

这种理念有助于解释他为何抵制集体节奏控制。共同限制可能成为保护当今最大实验室的壁垒,尤其是在这些公司参与制定规则的情况下。

Cohere CEO Aidan Gomez 对 Amodei 的提案提出了相关担忧。他警告称,具有商业利益一致性的公司不应获得特殊权力,为一项影响深远的技术设定开发边界。

这一批评并不能证明 Meta 的做法更安全。它表明,协调式放缓在带来安全收益的同时,也可能伴随竞争风险。

少数前沿公司可能制定只有资金雄厚的既有企业才能满足的要求。昂贵的审计、受限的计算资源访问以及复杂的报告系统,可能会将较小开发者排除在外。

然而,竞争也可能推动公司过早发布。一家等待更有力证据的实验室,可能失去用户、人才、投资或战略合作机会。

Zuckerberg 认为,这些压力可以在每家公司内部得到控制。节奏控制的支持者则认为,正是这些压力意味着不能信任自愿约束。

Meta 推迟 Muse 的做法提供了一个内部约束的具体例子,但并未解决这一争议。一家公司可以推迟一款产品,同时加速另一项开发计划。

公众也缺乏足够细节来评判 Muse 的决定。Meta 尚未披露完整时间线、确切的安全担忧,或使该系统获准发布的测试。

这并不意味着这一延迟毫无意义。它意味着,这个例子仍是公司自行报告的案例,而非对更广泛模式进行独立验证的证据。

Zuckerberg 的论点还假定,公司能够在部署前识别危险行为。当模型能力意外涌现,或测试无法反映真实环境时,这一假定会变得更加困难。

独立评估者本应减少这种不确定性。他们可以设计对抗性测试、检查保护措施,并将内部声明与观察到的行为进行比较。

然而,他们的有效性取决于访问权限。通过有限接口测试一个经过完善的候选发布版本,与观察训练过程、审查事件并检查内部监控系统并不相同。

它也取决于时间安排。若评估者在发布前不久才受邀,可能能够发现问题;但全程参与开发的团队,则能观察安全决策是如何作出的。

这正是 Meta 提案尚不完整之处。Zuckerberg 支持外部评估,但其公开声明并未定义共同的访问标准、披露政策或执行机制。

因此,这种做法以一致性为代价换取了灵活性。每家实验室都可以针对自身系统定制监督方式,但外部人士可能难以比较不同评估结果。

对于采用 AI 智能体的企业而言,这会带来尽职调查难题。买方需要知道评估者审查了什么、哪些风险被排除在外,以及负面发现是否改变了产品。

一份熟悉的报告标签并不够。采购团队需要获得有关范围、独立性、模型访问权限、测试条件和补救措施的证据。

当智能体处理私人文件或作出具有重要影响的建议时,知识工作者面临类似挑战。他们必须区分一般性的安全声明与针对其实际使用场景的测试。

维护井然有序的 AI knowledge base,可以帮助团队记录模型限制、评估发现和内部审批决定。它无法替代外部监督,但可以让采用决策具备可追溯性。

独立评估者与共同放缓解决的是不同问题

评估者检验声明,而协调式节奏控制改变决定公司将如何迅速依据这些发现采取行动的激励机制。

Anthropic CEO Dario Amodei 提出了一种干预性更强的结构。他的计划将给予独立评估团队持续、类似员工的前沿实验室访问权限。

在这一模式下,评估者将获得办公室、门禁证和公司笔记本电脑。他们可以持续观察安全工作,而不是只在预定测试时出现。

Anthropic 表示将单方面承诺采用这一安排。OpenAI CEO Sam Altman 称该提案是个好主意,并表示其公司将跟进。

Amodei 还希望政府与领先实验室建立共同安全标准。更具雄心的版本将限制不受约束的发展速度,尤其是在递归式自我改进方面。

他的提案反映了对竞相降低标准的担忧。如果一家实验室单独暂停,竞争对手就可以继续训练并获得由此带来的优势。

协调式节奏控制试图消除这种代价。它要求公司接受可比的限制,有时还需要政府支持,从而使审慎行事不会成为单方面的竞争损失。

协调发展节奏的提案涵盖从狭义协议到更广泛限制的多种方案。其中一种可能的协议将禁止明显危险的用途,包括支持生物武器。

要求更高的版本将要求在发布前针对网络安全和生物威胁开展国际测试。最严格的版本则会限制先进 AI 的整体发展速度。

Meta 接受这一架构的一部分,但拒绝其核心机制。该公司支持评估者,同时抵制旨在阻止实验室竞相超越其建议的集体限制。

Nvidia CEO 黄仁勋也持类似立场。他表示,公司应将安全纳入常规开发流程,并在无法确信产品行为时暂缓推出。

黄仁勋表示:“如果我们对产品的安全性没有信心”,公司就不应发布产品。他的产品安全立场将暂停视为常规工程决策,而非全行业的政治承诺。

黄仁勋的观点符合 Nvidia 在市场中的定位。该公司为相互竞争的开发者提供计算基础设施,因此全面放缓将影响其业务中的各类客户。

Meta 和 Nvidia 提出的论点并不完全相同。Meta 强调竞争、与用户利益的一致性、独立评估以及权力过度集中的风险。黄仁勋则强调产品工程和企业责任。

但两者都将决定性的安全判断置于公司内部。两者都不将协调性的发展限制视为默认应对方案。

Anthropic 和 OpenAI 认为,逐家公司采取行动无法完全应对共同的竞争压力。在有关先进代理的事件以及现有遏制系统弱点的报道出现后,这一立场显得更为紧迫。

Anthropic 曾公开描述运营安全和对齐问题。该公司称,部分事件暴露出由狭窄任务驱动的动机性推理,以及为实现这些任务而采取的有害行动。

该公司还表示,随着模型代际演进,其监控系统承受的压力不断增加。其安全实践现已包括更强的遏制措施、监控机制以及与第三方评估者的合作安排。

OpenAI 记录了自己在与代理相关事件发生后使用外部顾问的做法。该公司聘请 METR 和 Redwood Research 评估模型行为,并计划让这些机构公布其研究结果。

OpenAI 的独立评估也说明了内部确定性的局限。该公司表示,尚未核实部分被报告的活动,同时仍在继续调查并披露最新进展。

这些披露为主张放缓的一方提供了具体论据。安全系统并非训练完成后才添加的静态控制措施。随着代理获得新能力并与外部服务交互,它们必须不断适应。

Meta 的回应是,每一家实验室都可以自行完成这种适应。Anthropic 的回应则是,竞争会使完全自愿的模式缺乏稳定性。

这正是本文的核心权衡。公司自主性可以支持实验,并避免由既有企业制定的限制。共同控制节奏能够减轻竞争压力,但也可能导致权力集中。

独立评估介于这两种路径之间,但并不能消除这种权衡。评估者可以识别危险能力,却未必拥有阻止开发的权力。

公司可以接受评估结果、修改模型、限制部署,或质疑测试。除非合同或法律另有规定,最终决定权仍在管理层手中。

协调框架会改变这一关系。它可以设定共同门槛、强制披露要求,或在实验室无视评估结果时施加后果。

这种额外约束力也带来政治问题。谁来认证评估者?谁决定哪些风险应被纳入考量?什么证据足以证明应当暂停?规模较小的实验室能否挑战一项决定?

因此,这场争议不能被简化为安全支持者与安全怀疑论者之间的对立。双方都支持测试和负责任的发展,但对权力的分配方式不同。

Meta 希望在公司、评估者和技术路径之间保持多元化。Anthropic 则希望获得更深入的访问权限,并在竞争激励变得危险时实施共同约束。

最终胜出的路径很可能取决于实施,而非言辞。听起来严格的框架若标准薄弱,仍可能失效。自愿制度若评估独立、透明并与发布决策挂钩,也可能发挥作用。

独立 AI 评估无法保证什么

评估者的独立性取决于其资金来源、访问权限、发表权,以及得出不利结论的自由。

“独立”一词可能掩盖多种不同关系。实验室可能聘请一家外部公司、界定任务范围、限制访问权限,并批准最终措辞。

该评估者在法律上独立,但其工作仍可能受客户控制。更有力的安排应保护访问权限、方法、发现和发表内容,使其不受公司干预。

Brookings Institution 的 Elham Tabassi 表示,在承诺变得公开且具体之前,自愿审计仍由公司控制。她还强调,需要采用科学有效的衡量方法。

这种担忧不止关乎利益冲突。研究人员对于如何衡量多种先进 AI 风险仍存在分歧,尤其是在这些风险尚未稳定地出现在真实环境中之前。

一项测试可能考察代理能否利用软件漏洞、欺骗监控者,或追求非预期目标。结果取决于提示词、工具、时间限制和访问权限。

通过一次评估,并不能证明模型在所有部署场景中都是安全的。一次测试失败,也并不自动说明面向公众的产品一定会造成伤害。

评估是证据,而非通用证书。其价值来自清晰说明测试了什么、在何种条件下测试,以及公司如何回应。

航空业提供了一个有启发性的对比,但这种对比也有其限度。航空安全依赖共同的工程标准、事故报告、训练有素的检查员和可执行的运营规则。

AI 尚未拥有同等成熟的衡量体系。模型行为可能因更新、系统提示词、接入工具、用户指令以及部署环境而变化。

这会造成版本问题。评估者可能测试某一模型配置,而客户通过产品层或后续更新收到的却是另一版本。

这也会造成部署问题。用于头脑风暴的通用模型,与控制实验室设备的同一模型面临的风险不同。

独立评估者需要获得足够的访问权限,才能审查底层能力和实际应用。否则,其结论可能过于宽泛或过于狭窄。

行业还需要事件报告。若不了解部署后的故障,评估者便无法判断其测试是否预测了实际行为。

OpenAI 通过一项联邦安全框架呼吁建立通用测试、独立评估、网络安全保护和更明确的事件规则。这一立场超出了实验室自愿实践的范畴。

Zuckerberg 的责任论点还面临另一项不确定性。只有当受害方能够识别伤害、证明因果关系并提出可行的法律索赔时,责任才能遏制不安全行为。

某些 AI 伤害是分散的、延迟出现的,或分布在开发者和部署者之间。现行法律可能无法像 Zuckerberg 的论点所假设的那样明确分配责任。

市场约束也有类似局限。当危险能力是隐藏的、罕见的或难以观察时,用户无法拒绝不安全的代理。

客户还面临转换成本。与某一模型供应商深度绑定的企业,可能会容忍那些本应阻止其更早采用的担忧。

竞争有时会奖励信任,但也可能奖励速度和吸引头条的能力。企业通常披露更多基准测试提升的信息,而不是未成功的安全测试。

因此,评估者模式需要围绕激励机制设置保障。至少,读者应当问:谁选择了评估者、谁付费,以及是否披露了完整范围。

他们还应问,评估者是否获得发布前访问权限、内部事件记录、监控数据,以及足够的时间重复关键测试。

发表权同样重要。公司不应能够宣传有利发现,同时无限期压制同一次审查中发现的重大失败。

目前尚无主要实验室建立一套被普遍接受、覆盖所有这些条件的模板。近期公告仍只是承诺,其实践细节仍需审视。

这种不确定性并不否定独立测试。它解释了为何仅靠外部评估无法平息关于放缓的争论。

Meta 立场最有力的版本,是将自主的公司决策与严格、公开且具有对抗性的评估结合起来。最弱的版本,则会将受聘审查者变成维护声誉的掩护。

协调发展节奏最有力的版本,是在不冻结竞争的前提下建立透明门槛。最弱的版本,则会让主导实验室制定成本高昂、保护自身地位的规则。

读者不应假定任一标签都能保证理想结果。“独立评估”和“协调安全”描述的是治理工具,而非已经完成的安全体系。

眼下的举证责任落在 Meta 身上。Zuckerberg 表示 Meta 已遵循行业最佳实践,因此该公司可以展示这在运营层面具体意味着什么。

有价值的披露应包括评估者身份、访问级别、测试风险、尚未解决的分歧,以及因评估结果而改变决策的实例。

缺少这些细节,“Meta CEO 倾向评估者而非 AI 放缓”仍是一个可辩护的政策立场,但其问责机制并不完整。

三个信号将显示 Meta 的模式是否有效

下一项检验并非另一份高管声明,而是公司是否将宽泛承诺转化为可比较的访问权限、证据和发布决策。

第一个信号是评估者协议的公布。Anthropic 提议提供持续、类似员工的访问权限,而 Meta 对其现有独立工作披露的细节较少。

公开协议应界定访问权限、保密性、评估者独立性和发表权。它还应说明审查者与管理层意见不一致时将如何处理。

如果 Meta 采用可比条款,其拒绝协调发展节奏的立场将更像一种治理替代方案。如果访问权限仍然狭窄或未披露,这种差异可能大多只是修辞。

第二个信号是评估改变产品的证据。Meta 提到了 Muse 的延迟发布,但读者仍需要更清晰的记录,将已识别风险与具体缓解措施联系起来。

未来的系统卡或安全报告应说明发布前发现的问题,也应指出因此增加的限制、监控调整或部署边界。

决策发生改变的证据将强化 Zuckerberg 的主张,即公司已具备有效的激励机制。若反复发布却没有此类证据,则会削弱这一主张。

第三个信号是政府针对审计员标准和前沿模型要求采取的行动。自愿承诺可能会先于立法形成,但公共规则可以界定独立性和披露要求的最低标准。

监管也将揭示,政策制定者是否接受 Meta 基于责任的模式。强制性的国家框架将表明,立法者认为市场压力并不足够。

一个更宽松、侧重透明度的框架可能会支持 Meta 的做法。它将保留公司层面的决策权,同时让各项评估更易于比较。

这些信号将在 Meta、Anthropic、OpenAI、Nvidia 及其他开发者持续竞争的背景下出现。每家公司偏好的安全架构背后,都有其战略利益。

这并不意味着每一项安全声明都不真诚。这意味着,政策提案应根据其授予的权力、改变的激励机制以及所要求的证据来评判。

Meta 的立场有一个明确优势:它承认安全工作必须在积极的开发过程中进行,而不能等到整个行业终于达成共识之后。

它的弱点在于,私营企业的责任可能会变得难以验证。公众不能只依赖高管声称,他们的激励机制正朝着正确方向发挥作用。

协调式做法则呈现出相反的特点。它直接处理共同激励问题,但协调可能进展缓慢、在政治上较为脆弱,并且有利于既有参与者。

可行的体系或许会结合两大阵营的要素。公司可以保留对日常工程决策的责任,同时遵循关于访问权限、测试和事件披露的共同规则。

这种组合并不要求每家实验室以相同速度训练模型。它要求它们在跨越既定能力门槛之前,履行相当的安全义务。

对开发者而言,短期内应采取务实的应对方式。应将安全文档视为产品证据,而非仪式性的保证。

询问模型是否使用了你的部署环境中实际存在的工具、权限和数据流进行了评估。跟踪模型版本,并在更新后重复关键测试。

企业采购方应在采购审查中纳入事件通知、审计访问权限和模型变更条款。不应假设一项通用评估就能覆盖专业工作流程。

当智能体能够发布内容、转移资金、修改生产系统或暴露机密信息时,知识工作者也应保留人工审核环节。

这些措施无法解决前沿治理问题,但可以缩小实验室的广泛安全声明与特定部署中的实际风险之间的差距。

Meta CEO Favors Evaluators Over AI Slowdown,因为 Zuckerberg 认为责任应继续分散在相互竞争的公司之间。Anthropic 和 OpenAI 则认为,更强的协调是对这些公司所造成压力的一种保护。

未来几个月将显示,评估者能否获得有意义的访问权限、其发现是否会改变发布决策,以及政府是否会制定最低规则。这些结果比哪位高管赢得争论更重要。

读者应关注标签背后的证据。如果外部审查者能够深入检查、自由报告,并影响发布决策,Meta 的模式就会获得可信度。

如果这些保护措施仍是自愿且不透明的,对协调节奏的呼声将更加强烈。决定性的问题很简单:当评估者发现危险时,谁同时拥有采取行动的权力和激励?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page