OpenAI 希望为 AI 进步装上刹车,但没人掌控油门
OpenAI 支持为放缓前沿 AI 开发做准备,尽管它本身正身处一场围绕发布能力日益增强模型展开的竞赛。该公司表示,AI 辅助研究最终可能加速到超出社会理解、保护或治理其产出系统的能力。
这一立场并未要求立即暂停。相反,OpenAI 希望美国政府牵头开展技术和治理工具的相关工作,以便未来能够控制发展节奏。根据其公开声明,其他实验室和开源社区也将参与其中。
这种区别很重要。OpenAI 并非要求政策制定者今天就踩下刹车,而是希望他们在自动化 AI 研究大幅加快开发周期之前先设计好刹车机制。超过 1,100 名来自领先 AI 公司的员工已支持相关的 Pacing the Frontier 声明。
这项提议暴露了能力与风险之间尚未解决的冲突。独自放缓脚步的实验室可能失去人才、客户、资本和战略影响力。一个足以解决协调问题的政府体系,也可能将权力集中到既有实验室周围。
因此,这并非又一次泛泛呼吁负责任 AI。问题已从先进系统是否需要保障措施,转向谁有正当性决定何时应当放缓进展。
OpenAI 要求华盛顿建立一种选择,而不是下令暂停
眼下的变化体现在制度层面:OpenAI 现在支持筹备一项由政府主导的机制,以便未来能够为前沿开发设定节奏。
相关的前沿声明聚焦自动化 AI 研究。该术语指能够承担模型研究中大量工作的系统,包括提出实验、编写代码、评估结果以及改进开发流程。
这种自动化带来的治理问题不同于普通产品更新。更强的研究智能体能够协助构建其后继者,下一代系统随后又能在下一轮开发周期中贡献更多工作。
这一过程无需完全自主,就可能压缩时间线。即使只是部分自动化,也能让研究人员在同一时期测试更多想法、生成更多代码并进行更多评估。
OpenAI 此前曾表示,社会可能需要在接近具备递归自我改进能力的系统时放缓该领域。递归自我改进是指 AI 系统能够推动进展,使后续 AI 系统更擅长带来进一步进展。
在其更广泛的AI 建议中,该公司称,超级智能系统带来的灾难性风险严重到值得开展实证研究。它还呼吁制定共享安全原则、控制评估,以及降低竞争性竞速的机制。
新声明将这一担忧收窄为一项具体的政府请求。美国应支持一项国际努力,以开发能够有意调控自动化开发前沿节奏的工具。
“工具”一词承载了提议的大部分模糊性。它可能包括共享评估、报告要求、算力监测、安全标准,或与可量化能力阈值挂钩的协议。
不过,OpenAI 的社交媒体帖子和简短公开声明均未确立这些细节。它们没有定义触发条件、决策流程、执行体系或最长延迟时间。
这一缺失并不意味着请求毫无意义。建立可信的评估和国际机构需要时间。等到危险能力出现时才行动,会让各国政府在紧急状况本身发生期间进行谈判。
但缺少运行模型,也限制了读者能够作出的推断。OpenAI 支持的是为节奏调控选项做准备,而非某项具体法规或暂停措施。
该公司还表示,当前模型应在几乎不增加额外负担的情况下广泛传播。其早期建议将当下系统与涉及超级智能和异常快速改进的未来类别区分开来。
这种区分是 OpenAI 立场的核心。它希望在当前能力水平实现广泛访问,同时为另一种技术范式准备更严格的协调机制。
这两种范式之间的边界仍未厘清。模型能力的出现并不均衡,基准测试分数的提升也不总能转化为可靠的现实表现。
一个系统可能在编程测试中表现良好,却在长期、陌生的研究任务中失败。另一个系统可能在成为普遍有用的自动化研究员之前,就展现出危险的网络能力。
因此,任何节奏调控体系都不能只依赖一个醒目的分数。它需要关于自主性、可靠性、可复制性、安全性,以及改进 AI 开发本身能力的证据。
这正是该公告制造的主要张力所在。OpenAI 已指出可能需要集体克制,却没有定义集体克制将如何启动。
为什么自动化 AI 研究改变了时间节点
担忧不只是模型正在进步,而是 AI 可能缩短产生下一次改进所需的过程。
当前的前沿开发依赖人类设定研究议程、设计训练运行、检查失败情况,并决定哪些结果值得继续投入。AI 系统已经在代码、文献综述、数据分析和实验规划方面提供帮助。
随着这些工具不断改进,实验室可以用同样的人类团队运行更多研究循环。每个循环都可能包含假设、实施、实验、评估,以及对下一项测试的决策。
节奏调控倡导者所描述的风险,始于这些循环变得大幅自动化之时。人类团队或许仍然承担责任,但其审查能力将面对日益庞大的机器生成工作量。
更快的产出并不必然不安全。自动化测试可以发现缺陷、改善防御措施,并缩短理解故障所需的时间。
问题出现在能力开发的加速速度超过控制研究、安全实践和公共机构的发展速度时。这种错配可能产生行为难以评估的系统,而部署压力却已经到来。
OpenAI 的论点也依赖于不确定性。没有公开证据表明不受控制的递归改进迫在眉睫。关于自动化研究的预测包含了对可靠性、算力、数据、硬件和人类协调的假设。
OpenAI 自身也承认预测可能出错。其已发布建议将未来科学进步描述为基于内部研究的预期,而非确定无疑的时间表。
这种不确定性会产生双向影响。它削弱了政府需要立即放缓发展的说法,也支持在明确紧急情况出现之前启动制度建设。
安全评估说明了时间节点问题。实验室创造新能力的速度,可能快于政府招聘专家、建立安全访问渠道和就测试标准达成一致的速度。
模型在不同工具和环境中的表现也可能不同。限制网络访问或许降低一种风险,同时也可能掩盖系统在现实条件下的表现。
长周期智能体带来了额外挑战。一次短测试可能显示其具备较强的代码生成能力,却无法揭示同一系统在持续、多阶段任务中的表现。
评估者需要区分偶尔出现的惊艳结果与可靠的自主性能。这一区别决定了一个模型能否真正加速研究,而不仅仅是辅助个别研究人员。
这一问题对网络安全尤其重要。一个能够自主发现漏洞、在失败后调整,并跨多个系统运行的模型,带来的风险与回答安全问题的聊天机器人不同。
OpenAI 已敦促联邦政府为能力最强的系统建立一致的网络测试。其治理蓝图支持联邦评估、事件报告、独立审计、强力安全措施和吹哨人保护。
这些措施可以产生节奏决策所需的信息。但它们本身并不能解释实验室何时必须推迟训练或部署。
评估也面临策略性行为。公司知道哪些阈值重要,并可能围绕它们优化展示方式。政府需要独立访问权、可重复的方法,以及调查意外结果的权力。
技术触发条件必须足够易于理解,才能实现公共问责。在政府实验室内部产生的秘密分数,不可能拥有无限的正当性。
与此同时,公开每一项测试可能帮助对手瞄准弱点,或专门针对评估进行训练。因此,有效监管需要在透明度与安全之间取得艰难平衡。
这一机制解释了 OpenAI 为何要求做好准备,而不是今天就制定固定规则。政府首先需要能够支撑可辩护决策的测量体系。
该提议的价值将取决于这些体系能否衡量真正的研究加速。关于智能的模糊表述会给官员留下过多自由裁量权,也给公司留下过多游说空间。
OpenAI 的节奏调控提议向每一家前沿实验室施压
核心对手并非某一家竞争公司,而是惩罚任何单独选择克制的实验室的竞速动态。
OpenAI、Anthropic、Google DeepMind、Meta 和其他开发者在模型、产品、研究人才、企业合同和基础设施等方面展开竞争。它们的战略各不相同,但当另一家实验室发布更强系统时,每一家都会面临压力。
单方面延迟会立即带来风险。客户可以转移工作负载,开发者可以采用另一套 API,研究人员也可以加入能够接触更新系统的竞争对手。
投资者和商业伙伴同样期待进展。前沿训练需要在芯片、能源、数据中心和专业团队方面投入巨额资源。这些投入使闲置能力在商业上难以被容忍。
安全承诺往往与这种结构发生冲突。公司可以设定内部阈值,但管理层仍有动机以允许发布的方式解读不确定结果。
政府协调旨在改变这些激励。如果能力相当的实验室面临同样的要求,克制对于任何单一参与者而言都会变得成本更低。
国际参与更加困难。国内规则无法约束在其他国家运营的实验室,先进研究也可以跨越司法管辖区转移。
一项可行协议需要对相关能力形成共同认知,也需要确信参与者会报告事件并遵守限制。
当开发通过软件和分布式计算进行时,验证尤其困难。政府无法像清点大型实体武器系统那样轻易清点模型。
算力可以提供一个可观察信号,但它并不是能力的完美替代指标。算法改进可以在训练资源未按比例增加的情况下带来更好的结果。
小型团队也可以改造现有模型。开放权重系统让模型参数可供本地使用,使实验不再局限于少数受监管的实验室。
这种分散既带来韧性,也带来风险。独立研究人员可以审查模型行为、构建替代方案,并防止少数公司控制访问权。
同样,这种开放性也让对整个前沿领域暂停发展的验证变得更困难。模型权重一旦发布,后续协议便无法将其完全收回。
随着大型科技公司为开放权重开发辩护,这种紧张关系愈发明显。Nvidia、Microsoft、Meta 等公司近期支持了一个围绕研究访问、竞争和防御性用途建立的开放权重联盟。
OpenAI 表示,希望开源社区参与开发节奏控制机制。这一承诺很重要,但参与本身并不能消除社区对监管俘获的担忧。
大型实验室能够承担高昂的测试、法律审查和报告体系成本。即使模型风险较低,小型开发者也可能难以承担同样的固定成本。
围绕训练资源设计的门槛可以保护较小项目。然而,它可能会忽略异常高效的模型,或通过修改已发布权重构建的系统。
能力门槛或许更准确。但能力测试可能不稳定、存在争议,而且管理成本高昂。
因此,行业面临一个没有简单中立答案的设计问题。基于公司规模的规则会偏向某些参与者,而基于算力或性能的规则则会带来不同的扭曲。
OpenAI 在这场辩论中也处于不同寻常的位置。它既是警告竞赛风险的开发者,也是其产品推动这场竞赛持续发展的参与者。
这并不意味着其警告无效。实验室员工掌握与内部研究流程、新兴能力和运营压力相关的知识。
但这意味着,政策制定者应将技术证据与机构自身利益区分开来。一家成熟公司可以真诚担忧危险的加速,同时又从抬高市场准入门槛的规则中获益。
政府参与又带来了另一层冲突。美国将先进 AI 视为经济和国家安全资产,而不仅仅是一项公共安全挑战。
如果官员认为外国竞争对手仍会继续推进,他们可能不愿放缓国内实验室的步伐。国际竞赛的感知越强烈,自愿克制看起来就越缺乏约束力。
因此,“节奏控制”不能只是华盛顿命令某一家公司等待。该提案需要在实验室和国家之间具备可信的覆盖范围,并明确例外情况和独立审查机制。
缺少这些要素,机制可能造成最糟糕的组合:合规开发者放慢脚步,不够透明的参与者继续推进,而公众监督仍然过于薄弱,无法核实任何一种结果。
刹车可能变成护城河
最有力的批评是,安全机制可能悄然演变成保护既有企业、集中权力的制度。
节奏控制的倡导者从协调失灵问题出发。每家实验室都有继续推进的理由,因为它们无法相信竞争对手会停下来。
他们的解决方案是将部分决策权移交给公共机构。这可以减少私营部门的冲突,但也带来了专业能力、透明度和政治正当性的问题。
谁来决定能力门槛已经被跨越?实验室可能提供技术证据,联邦机构可能进行审查,民选官员则可能权衡国家利益。
每个参与方都有不同的激励。公司希望发布节奏可预测,机构希望获得权力,政治领导人希望取得战略优势,公众则希望在不失去有用访问权的情况下获得安全保障。
封闭流程可能会让前沿 AI 治理沦为少数公司与安全机构之间的谈判。外部研究人员或许只能得到摘要,而非证据。
这种担忧已经出现在围绕政府模型评估的辩论中。批评者质疑,独立专家是否获得了足够机会参与发布决策和审查安全发现。
有关发布监督的报道强调了这样一种诉求:应让安全、对齐、可解释性和数据领域的专家更广泛参与。
公众信任不只需要“合格人员审查过系统”的保证。政策制定者需要有程序说明:谁进行了测试、采用了哪些标准,以及如何处理相互冲突的证据。
有些信息仍将具有敏感性。详细的网络安全评估可能暴露方法、目标或漏洞。但安全不能成为掩盖制度设计的笼统借口。
独立审计可以有所帮助,但审计人员需要适当的访问权限,并应受到保护,免受商业压力影响。支付评估费用的公司仍可能影响审查范围、时间表或结论解读。
政府对审计人员进行许可又会引入另一种依赖。官员必须防止少数获批群体在经济上与其审查的公司捆绑。
开源开发者面临另一项风险。围绕大型封闭实验室实践制定的规则,可能将开放性本身视为危险证据。
开放权重并不会天然安全或不安全。风险取决于模型能力、可用的防护措施、下游修改,以及人们部署该系统的环境。
因此,限制措施应基于有关具体能力的证据。对开放开发作出宽泛的负面推定,会削弱独立研究,同时让封闭系统仍难以被检验。
该提案也缺少对执法机制的公开说明。自愿协议提供了灵活性,但竞争压力可能恰恰在克制最重要时侵蚀合规性。
强制性控制提供更有力的保障,但需要法律定义和申诉权。它们还必须区分训练、评估、发布和部署。
阻止公开发布不同于阻止内部研究。限制部署不同于阻止一项可能改善安全性的实验。
定义不清的刹车机制可能会促使公司在闭门环境下开展更多工作。官员可能收到经过筛选的报告,而外部研究人员则失去可见性。
该机制也可能在政治上变得不稳定。未来的政府可能利用安全权力偏袒盟友、惩罚批评者,或出于无关的政策原因限制模型。
国际协议会放大这些担忧。各国可能对可接受的监控、军事用途、审查、隐私以及先进系统访问存在分歧。
共同的能力测试并不会创造共同的价值观。政府可以识别相同的技术风险,却偏好不同的应对方式。
因此,恰当的检验标准并不是节奏控制听起来是否负责任,而是拟议机制能否在不制造不受约束的公共或私营控制的前提下提升安全性。
这需要在可能的情况下公布门槛、进行独立评估、报告事件、保护吹哨人,并确保前沿实验室之外的群体得到代表。
它还需要设置日落条款和审查机制。为一代模型制定的规则,可能会随着架构、硬件和部署模式变化而失去相关性。
应将 OpenAI 的支持视为一个起点信号,而非某个机构理应拥有权力的证明。该公司指出了一个集体问题,但解决方案需要通过民主方式构建。
AI 节奏控制获得可信度之前必须发生什么
三个信号将表明,这一提案正在成为可执行的安全体系,还是仍停留在宽泛的担忧表态。
第一个信号,是为自动化 AI 研究设定可衡量的触发条件。政策制定者需要明确哪些能力足以证明干预合理,以及独立评估者将如何测试这些能力。
可信的触发条件应考察系统在真实研究工作流中的持续表现。它应评估系统是否能够提出假设、开展实验、解读结果,并在失败后调整。
测试还应衡量可靠性。一个模型完成一项经过精心挑选的任务,并不足以支持其能够自我维持地加速研究的说法。
如果 OpenAI 和其他实验室公布共享评估框架,节奏控制提案就会更具实质内容。如果它们继续使用未定义的术语,核心决策仍将留给政治谈判。
第二个信号,是美国建立具有外部监督的正式程序。OpenAI 已通过 Center for AI Standards and Innovation 倡导更强的联邦角色。
值得关注的是,立法、行政框架或机构规则是否会确立评估访问、事件报告、独立审计和决策权限。
该程序的组成与其名称同样重要。学术研究人员、民间社会专家、开源开发者、安全专家和受影响行业都需要明确角色。
由前沿公司主导的框架会削弱该提案。排除实验室专业知识的流程,同样难以评估快速变化的系统。
最有力的设计应将保密技术审查与公开标准和申诉程序结合起来。它应说明哪些证据可以延迟发布,以及谁可以对这一结论提出质疑。
第三个信号,是 OpenAI 之外的参与。Anthropic、Google DeepMind、Meta、开放模型开发者、云服务提供商和主要国际政府都会影响协调能否奏效。
支持性声明还不够。实验室需要采用兼容的测试、报告实践,以及覆盖相同开发阶段的承诺。
开源参与将尤其具有揭示意义。如果独立开发者帮助制定门槛和访问规则,这一流程将获得技术多样性和正当性。
如果最终体系给开放模型施加负担,同时为大型实验室保留保密例外,监管俘获的批评就会更加有力。
国际参与所需时间将超过一到三个月。早期外交措辞仍可揭示,各国政府将节奏控制视为风险管理,还是战略遏制。
读者还应关注实验室在讨论克制期间的实际行为。发布计划、安全披露和事件报告能够显示,公开承诺是否影响当前决策。
对开发者而言,这场辩论可能决定哪些模型仍然可用、发布前需要进行哪些评估,以及先进工具是否需要额外批准。
企业采购方也应关注,因为不一致的监督会带来运营风险。一个模型可能在组织围绕其构建重要工作流后受到限制、延迟或修改。
知识工作者面临不同的问题。自动化研究有望加快软件、科学和分析工作,但随着工作流变得更加自主,可靠性故障也更难识别。
无论未来监管如何,保持源材料、决策和模型输出的可追溯性都很重要。一个可搜索的知识库可以帮助团队在 AI 参与研究或技术工作时保存证据。
OpenAI 已将一个棘手命题带入公众视野。社会或许需要具备在尚不完全清楚何时应使用这一能力之前,放缓前沿发展步伐的能力。
这一理念不应被立即接受或否定。它需要可检验的门槛、可被质疑的制度,以及适用于不止一家公司的规则。
接下来的问题很实际:那些要求政府建立制动机制的公司,会接受由独立机构来控制它吗?关注评估标准、联邦层面的流程以及跨行业承诺。这些信号将显示,OpenAI 支持的究竟是真正的共同约束,还是一个让人安心、却无人能够启动的选项。



