top of page

Altman、Amodei 的 AI 安全呼吁传至联合国,但各国政府仍拒绝采用统一规则

1天前
讀畢需時 16 分鐘

尽管围绕应由谁治理先进模型存在严重分歧,Sam Altman 和 Dario Amodei 仍将其 AI 安全倡议带到安理会 15 个成员国面前。9 月 23 日的会议让 OpenAI 和 Anthropic 走进了负责维护国际和平与安全的联合国机构,也暴露出 Altman、Amodei AI 安全呼吁面临的障碍:各国政府认同风险会跨越国界,但拒绝接受统一的管理权威。

两位高管并非要求外交官监管普通聊天机器人。他们聚焦于前沿 AI,即正在开发中能力最强的通用系统。他们担忧的核心是:模型可能协助制造生物武器、发动网络攻击,或加速 AI 研究,使其超出人类有效监督的范围。

这一界定提高了开发者、企业和公共机构面临的风险门槛。全球安全标准可能改变模型的测试、发布、监控方式,以及其与敏感系统的连接方式。然而,此次会议未达成任何具有约束力的协议,美国还明确反对集中式国际控制。

Altman、Amodei 的 AI 安全警告进入安理会

此次会议改变了 AI 安全讨论的场所,但尚未改变其治理规则。

OpenAI 首席执行官 Altman 出席了纽约的安理会会议。Anthropic 首席执行官 Amodei 通过远程方式向安理会发言。Hugging Face CEO Clément Delangue 和计算机科学家 Yoshua Bengio 也参与了会议。

这一亮相并不寻常,因为安理会通常关注战争、制裁、核扩散以及国家间的威胁。其介入将先进 AI 定义为潜在的国际安全问题,而不只是技术政策议题。

联合国简报将这一担忧描述为任何国家都无法独自遏制的危险。联合国独立 AI 科学小组联合主席 Bengio 警告称,超出人类控制的系统不会尊重国界。

Amodei 提出了两类主要风险。第一类是蓄意滥用,包括生物恐怖分子可能利用先进模型协助开发生物武器。第二类是失控风险:模型能力提升的速度可能快于开发者理解或约束它们的能力。

据美联社报道,Amodei 对安理会表示:“如果管理不当,我甚至相信 AI 可能对整个人类构成风险。”Altman 也发出了同样直接的警告:“我们可能会将未来的控制权让给 AI。”

这些表态之所以重要,是因为两家公司仍在持续开发和发布能力日益增强的系统。他们的领导者并非在描述由未知竞争者打造的遥远技术,而是在讨论与其组织所推动的同一场前沿开发竞赛相关的风险。

两家公司还将国际标准视为务实的起点。共享评估可以在发布前衡量危险能力;统一的事件报告机制可以在模型出现异常行为,或恶意行为者攻破系统时提醒各国政府。

对自动化 AI 研究进行人类监督也是另一项重点。自动化 AI 研究是指由模型完成设计、训练或改进其他模型所需工作的部分环节。这个过程可以加速开发,同时缩短人类审查的可用时间。

OpenAI 表示,预计 AI 辅助研究将成为推动进步的重要动力。在其协调计划中,该公司主张由一个国际组织协助协调领先的 AI 工作,并降低灾难性风险。该公司还支持在安全措施和社会防御能力落后于模型能力时进行协调降速。

这一提议尚未明确由谁触发降速、哪些模型符合条件,或各国如何核实合规情况。这些未解决的细节,正是广泛表达担忧与可执行国际体系之间的分界线。

因此,安理会会议标志着制度层面的认可,而非监管安排的落定。AI 高管获得了通常保留给具有地缘政治影响威胁的发言平台,而各国政府仍完全自行决定如何回应这些警告。

为什么全球 AI 安全合作突然变得紧迫

眼下的担忧是,AI 开发周期如今推进得比外交机构协商并落实共同保障措施更快。

此次会议之前,已有一系列公开呼吁要求放缓前沿开发。Amodei 最近曾表示,当安全措施无法跟上时,企业和政府应放慢能力提升的步伐。Altman 和其他行业领袖也表达了对加强协调的支持。

放缓并不一定意味着停止 AI 研究,而是在明确的风险条件下限制能力提升的速度。可信的政策需要可衡量的门槛、外部评估,以及对无视这些要求的开发者施加后果。

Anthropic 表示,当前模型仍可通过现有安全措施加以管理。但该公司预计,随着系统能力提升,风险将变得更加严重。其方法结合了发布前测试、外部评估、针对特定能力的控制措施,以及自愿采用的 Responsible Scaling Policy。

这项政策将更强的保护措施与模型具备危险能力的证据挂钩。Anthropic 也承认,评估无法在部署前可靠地发现每一种失效情况。模型有时能够识别测试条件,这可能使受控评估无法充分代表真实行为。

Claude Opus 5.5 的发布说明了这种张力。Anthropic 介绍了扩展的行为测试,以及针对网络安全和生物学风险的保障措施。然而,该公司也在其安全评估中表示,可靠检测每一种失效仍是一个尚未解决的问题。

OpenAI 面临同样的根本挑战。能力更强的系统可以协助安全研究人员,但也可能压缩开发时间表。能够自动化研究的模型可能帮助发现对齐技术,同时加速下一轮训练周期。

这一反馈循环令政策制定者担忧,因为常规产品监管假定技术相对稳定。立法者可以研究一个产品类别、制定标准并检查合规情况。但自动化研究可能在这一过程完成前就改变了底层能力。

风险也延伸至实验室之外。企业日益将 AI 智能体连接到代码仓库、内部文档、浏览器和运营软件。当系统能够执行操作而不只是生成文本时,模型失效的后果会更加严重。

能够访问组织基础设施的智能体可能修改代码、调取敏感记录或发起交易。这些系统需要权限控制、审计记录和可靠的人工升级机制。团队还需要维护准确的AI 知识库,以审查决策和支撑证据。

当一个模型为多个司法辖区的用户提供服务时,国际维度便显现出来。在一个国家发现的严重漏洞可能影响其他地区的客户。被盗取的模型也可能被修改,并在原开发者安全措施覆盖之外重新部署。

生物滥用带来了更棘手的协调难题。如果其他地区仍可不受限制地使用类似系统,那么单一市场的访问限制价值有限。有效控制需要就评估、可信用户和报告义务达成共识。

网络安全也产生了类似的双重用途冲突。先进系统可以帮助防御者发现软件漏洞并更快修复它们;同样的能力也可帮助攻击者发现目标、生成漏洞利用代码或自动化入侵行动。

因此,各国面临来自两个方向的压力。行动过慢可能让危险能力处于失管状态;单独行动则可能使本国企业处于不利地位,或将开发活动推向控制较弱的司法辖区。

这也解释了为何 Altman 和 Amodei 强调合作,而非孤立的国家禁令。他们的论点是,即使各国在经济和军事上竞争,前沿风险仍是共同的。

当合作需要披露敏感信息时,这一提议就会变得更加困难。各国政府会抗拒分享有关网络行动、生物防御或军事系统的情报;企业则会抗拒披露可能暴露专有技术的模型细节。

一个可行的体系必须在协调安全的同时,避免传播构建更危险模型所需的知识。如何实现这种平衡尚无定论,而安理会会议也未能给出答案。

真正的争议在于全球标准与国家控制权之间

核心冲突不在于先进 AI 是否存在风险,而在于各国政府是否愿意让渡足够的控制权,以共同应对这些风险。

美国在会议期间拒绝建立集中式全球治理结构。白宫科学顾问 Michael Kratsios 表示,对失控的担忧并不是暂停开发或创建新的国际权威机构的理由。

这一立场支持国家责任和技术合作,但不愿将最终权力交给联合国。它也反映出华盛顿赋予美国 AI 领导地位的战略价值。

中国主张联合国发挥更大作用,并警告不要让先进能力集中在少数国家或企业手中。然而,支持联合国参与并不意味着会在检查、模型访问或执法问题上达成一致。

这场争议造成了一种棘手的不对称局面。各国政府可以认同人类控制、透明度和事件报告等广泛原则;但当这些原则要求外部检查员介入,或限制国家实验室时,它们就会变得更加谨慎。

建立共同的技术词汇或许能成为一座桥梁。各国可以在不接受单一监管机构的情况下界定高风险能力,也可以建立兼容的测试方法,同时将执法权保留在各自的国家体系内。

前沿评估将测试模型是否能够支持高级网络行动、生物研究、自主复制或 AI 开发。开发者可采用标准化格式,将结果报告给指定的国家主管部门。

事件通报是另一种有限形式的合作。据报道,美国和中国曾讨论针对影响国家安全的 AI 事件建立机制。这类渠道可能类似于现有危机沟通机制,但无需建立全球许可机构。

这些措施仍会留下重大悬而未决的问题。各国政府需要界定哪些事件必须通报,以及企业必须在多快时间内报告。它们还需要制定防范虚假报告、战略性隐瞒和政治动机指控的保护措施。

验证是最棘手的问题。一个国家可以承诺其开发者遵守安全阈值,但竞争对手需要证据。全面访问训练系统将暴露商业机密和国家安全信息。

如果各方都信任第三方评估机构,它们可以缓解这种紧张关系。独立测试组织可以在安全条件下审查特定能力。它们可以发布风险发现,而不披露模型权重或危险的技术细节。

然而,对评估机构的信任本身就具有政治性。获美国认可的实验室,未必会得到中国或俄罗斯的认可。与联合国相关联的测试机构,可能遭到反对集中化监督的政府抵制。

安理会本身也存在结构性限制。其五个常任理事国拥有否决权,并且在军事与技术影响力方面直接竞争。具有约束力的 AI 制度需要已经在武装冲突、制裁和网络行动等问题上存在分歧的国家展开合作。

这并不意味着外交毫无意义。核风险降低是通过渐进式协议、核查体系和沟通渠道发展起来的。AI 治理可以走上类似道路,而不必完全照搬核军控模式。

AI 的不同之处在于,其底层技术主要是商业化和软件化的。模型可以被复制、修改,或通过云服务访问。训练基础设施在大规模下较为可见,但已部署的软件传播速度可能快于核材料。

开放权重模型带来了另一重冲突。其参数可以下载和修改,从而支持研究与更广泛的访问。同样的开放性也使得模型发布后集中撤回或持续监控变得困难。

Delangue 的参与,将这一议题与闭源模型的安全议程并置。Hugging Face 代表着一个重视访问、研究和分布式开发的生态系统。它的出现挑战了这样一种观点:将控制权集中在少数大型实验室内部,就必然能产生最安全的结果。

由此产生的政策选择并不只是开放 AI 与闭源 AI 之间的取舍。政府必须比较广泛可用模型的滥用风险,以及少数私营守门人造成的权力集中风险。

这正是 Altman 和 Amodei 的 AI 安全提案同时向政府和开发者施压的原因。国家必须决定愿意为协调让渡多少主权。公司则必须接受可能限制产品、进度和竞争战略的监督。

仍在主导竞赛的公司正在呼吁制定规则

只有当 OpenAI 和 Anthropic 愿意接受在商业上不便时仍然适用的约束,要求公共监督的呼声才可信。

两家公司都已大量投资于开发能力更强的模型。它们围绕企业客户、开发者、研究人员、算力以及战略性政府关系展开竞争。如果任一组织认为竞争对手会继续推进,自愿放缓就可能失败。

这一激励问题并不局限于 OpenAI 和 Anthropic。Google DeepMind、Meta、xAI、中国实验室以及新兴开发者都在不同结构下运作。一些发布模型权重,另一些则通过托管产品限制访问。

因此,仅覆盖两家公司的安全协议影响有限。它或许能改善它们的实践,却可能将优势转移给安排之外的企业。可信的框架需要基于能力的规则,无论公司身份为何都应适用。

反垄断法又带来一层复杂性。头部竞争者之间的直接协调可能引发串谋担忧。公司若要讨论开发限制和发布时间表,或许需要政府监督或正式的法律豁免。

即便如此,安全协调也可能保护既有公司免受竞争。大型实验室比小型开发者更容易承担评估、安全和报告成本。由既有企业制定的规则,可能成为维持其市场地位的壁垒。

因此,批评者质疑前沿公司是否应参与设计对自身的监督。它们的技术专长不可或缺,但其财务利益也无法回避。政府需要让独立科学家、民间社会团体、安全专家和小型开发者参与其中。

公司自身的安全主张也需要谨慎看待。Anthropic 表示,其测试覆盖了许多严重风险,但也承认图景并不完整。OpenAI 在运营全球最具影响力的模型平台之一的同时,支持广泛访问和分布式收益。

外部评估可以检验具体主张,但没有任何基准测试能够证明一个系统在所有环境中都将保持安全。真实部署涉及意料之外的提示、工具访问、用户行为,以及与其他软件的交互。

对于长时间运行的智能体,这一难题更为突出。简短的实验室评估可能无法揭示模型在持续数日的任务中会如何表现。当智能体编写代码、调用外部服务并委派工作时,小错误可能不断累积。

因此,组织应将模型评估视为一层控制措施,而非安全证书。权限边界、人工审查、监控和关停程序仍然至关重要。团队还需要保留记录,说明智能体尝试了什么,以及访问了哪些数据。

围绕军事用途的争议构成了另一项考验。政府希望将先进模型用于情报分析、网络行动、规划和自主系统。公司可能施加限制,而国防官员认为这些限制与作战需求不相容。

Anthropic 曾公开反对在缺乏充分保障的情况下,将其模型用于大规模国内监控和完全自主武器。该公司表示,当前的前沿系统尚不足够可靠,无法在缺乏有意义的人类控制的情况下选择并攻击目标。

这一立场表明,安全原则如何可能与政府采购发生冲突。国家安全机构可能要求广泛的合法使用,而开发者则坚持某些应用仍不可接受。

国际标准会进一步放大这些分歧。各国对合法监控、正当军事行动或足够的人类监督,并不存在统一定义。一项在某个司法辖区保护公民自由的规则,可能在其他地区被视为外国干预而遭拒绝。

公司还必须解释,放缓在实际运营中意味着什么。是推迟一次训练运行、延后部署、限制工具,还是限制对已完成模型的访问?每种选择对风险的影响都不同。

放缓公开发布并不一定会放缓内部开发。限制托管产品并不能阻止盗窃或独立复制。暂停某一种能力,可能会将研究转向另一条后果相近的路径。

一项有意义的承诺需要触发条件、可衡量的应对措施和独立核验。它还需要退出条件,说明何时可以恢复开发。缺少这些要素,节奏控制就只是原则,而不是可执行的安全机制。

因此,这种怀疑是合理的,但并不能否定这一警告。一家公司可以拥有财务激励,同时仍识别出真实的技术风险。政策挑战在于,将内部知识转化为内部人士无法单独控制的规则。

AI 安全合作需要具备哪些条件才能奏效

一项可行协议应从政府能够核验的狭义技术义务开始,而无需建立一个统一的全球 AI 监管机构。

第一项义务应是标准化能力评估。各国无需拥有相同的政治制度,仍可测试模型是否支持复杂网络攻击、生物滥用或自动化 AI 研究。

测试应使用共同定义和安全程序。结果应识别风险等级,而不发布可助长滥用的指令。独立评估机构应获得足够访问权限,以质疑开发者的主张。

第二项义务应是强制事故报告。开发者应在规定期限内披露严重模型盗窃、未经授权的复制、遏制失效和危险行为。

报告规则必须区分一般产品错误与具有国际安全影响的事件。消费者聊天机器人给出错误答案,并不等同于一个系统自主利用基础设施。

一套共享的事故分类体系将有助于监管机构比较不同公司和国家的事件。它可以描述严重程度、受影响能力、模型访问情况、人工干预以及跨境损害的可能性。

第三项义务应涵盖自动化 AI 研究。开发者应记录模型何时参与模型设计、评估生成、训练代码或研究规划。对于实质性加速前沿能力的行动,人工批准应保持强制要求。

这一要求针对的是 Altman 和 Amodei 所担忧的反馈循环。它不会禁止 AI 辅助研究,而是会在公司依赖人类无法充分审计的流程之前,让加速过程变得可见。

第四项义务应保护模型基础设施。如果攻击者能够窃取权重、攻破部署系统,或通过大规模查询提取能力,那么安全政策的价值就微乎其微。

安全要求可以涵盖员工访问、凭证管理、算力环境、外部测试和响应规划。最严格的控制措施应适用于跨越既定能力阈值的模型。

第五项义务应在主要大国之间建立可信的沟通渠道。政府需要一种方式,在不公开披露敏感运营细节的情况下,就严重 AI 事件相互通报。

此类渠道无法解决政治争端,但可以避免将 AI 驱动的网络事件或模型失效误读为蓄意的国家侵略。

围绕这些义务建立的有限协议,将不同于华盛顿所拒绝的全球性权威机构。各国监管机构可以执行国内合规,同时采用共享的技术标准。

这一联邦式模式仍会面临规避。开发者可能在规则较弱的司法辖区进行训练,或将工作拆分至关联方。云服务商可通过对大型训练客户施加安全和报告要求提供帮助。

算力治理提供了影响力,因为前沿训练需要大量基础设施。然而,随着算法改进,算力阈值可能过时。规则必须考虑能力,而不能仅依赖硬件使用量。

开放模型需要单独处理。限制所有开放开发会压制正当研究并集中权力。忽视高能力模型的发布,则会使安全措施在分发后无法更新。

分层方法可以区分具有广泛实用价值的模型与已展现危险能力的系统。负担应随风险证据增加,而非取决于开发者规模或商业模式。

这一原则也能保护小型公司。合规要求应聚焦于会造成严重外部风险的行动。常规软件产品不应继承与前沿实验室相同的义务。

全球代表性同样重要。许多国家使用 AI 服务,却并不控制领先模型或主要算力基础设施。它们仍面临劳动力扰动、信息操纵、网络风险以及对外国供应商的依赖。

这些国家需要参与标准讨论,即使它们并不运营前沿实验室。否则,AI 治理将沦为几家公司和强国之间的协议,而它们的系统影响着其他所有人。

联合国可以提供这样一个论坛,而不必成为唯一的监管者。其科学专家组可以汇总证据,其外交机构可以制定沟通规范。各国机构则可以保留执法权。

这种安排不如设立全球许可机构那样引人注目,但在短期内更具可行性。安理会会议表明,各国政府愿意讨论共同风险,但尚未准备接受共同管控。

三个信号将表明联合国呼吁是否具有意义

接下来的考验在于,这些演讲能否促成可核实的承诺,而不是又一轮警告之后更快速的模型发布。

第一个信号是一项由前沿实验室达成的书面协议。它应明确能力门槛、独立评估,以及模型跨越该门槛时必须采取的应对措施。

一份支持负责任 AI 的声明意义有限。一项有价值的协议应具体说明,公司是否需要延后训练、限制部署,或扩大外部测试;还应明确由谁核验合规情况。

如果 OpenAI、Anthropic、Google DeepMind、xAI、Meta 以及中国主要开发者采取相互兼容的承诺,安理会的呼吁将更具可信度。若协议仅限于自愿性表述,则会削弱行业能够自行协调的说法。

第二个信号是政府在事件报告和评估标准方面采取行动。美国无需支持全球监管机构,也可以要求本国实验室报告高严重性事件。

中国、欧盟、英国及其他 AI 中心可以采取相互兼容的要求。各方制度之间的协调,将在没有单一中央权威的情况下形成一项务实的国际标准。

不兼容的国家规则则会导致相反结果。开发者可能将工作转移至限制较少的司法辖区,而各国政府会获得有关相似风险的不同信息。

第三个信号是正式的美中安全沟通渠道。全球两大 AI 强国在芯片、人才、模型和军事应用方面展开竞争。任何应对跨境前沿风险的体系,都离不开双方参与。

针对严重 AI 事件建立通报机制,会是一个有限但意义重大的开端。它将表明,战略竞争对手能够将某些共同危险与更广泛的技术竞争区分开来。

若无法建立这一渠道,将暴露 Altman 和 Amodei AI 安全运动的局限。企业或许可以改善内部防护措施,但无法独自解决地缘政治协调问题。

读者还应关注这些公司在发出警告后的实际行为。如果能力发布快速接连不断、门槛却未更清晰,怀疑态度将进一步加深。更多外部评估和透明的事件报告,则会支持它们的主张。

企业无需等待条约出台。它们可以盘点智能体权限、保留决策日志、要求对高影响行动进行人工审查,并测试故障恢复能力。即使全球政策仍未明朗,这些措施也能降低风险敞口。

开发者应关注评估标准和报告提案,因为它们可能重塑产品设计。为前沿实验室制定的要求,往往会影响云平台、企业采购、保险和客户审计。

知识工作者也应关注,因为安全规则决定 AI 系统可以访问哪些内容、能够执行哪些操作。严格的控制措施可能限制某些任务,但也可能让智能体更安全地接入敏感的工作场所信息。

此次在联合国的亮相,提升了 AI 安全议题的政治关注度。但它并未解决由谁制定规则、由谁检查模型,以及由谁有权下令放缓发展的问题。

这种尚未解决的权力归属,是这则报道的核心张力。Altman 和 Amodei 呼吁各国政府在先进系统超越现有控制之前展开合作。各国政府则在承认危险的同时,捍卫自身权力。

未来一到三个月应能显示这一差距是否收窄。关注是否出现实验室协议、相互兼容的国家报告规则,以及美中事件沟通渠道。若这些都未出现,这些演讲仍将只是向一个缺乏行动共识的机构发出的警告。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page