top of page

古特雷斯AI护栏让全球合作直面AI竞赛

9月17日
讀畢需時 15 分鐘

António Guterres于9月16日呼吁协调推进AI安全保障措施,并警告称,自愿暂停无法遏制跨越国界扩散的风险。古特雷斯AI护栏提案将政府、前沿AI开发者和彼此竞争的国家战略置于同一场冲突之中。AI能力正伴随全球竞赛快速发展,而大多数安全承诺仍局限于本地、自愿性质,或难以验证。

这位联合国秘书长在纽约举行的第81届联合国大会高级别周前发表了这一呼吁。他认为,各国政府必须在保护公众免受AI风险影响的同时,保留这项技术在教育、医疗、发展和气候韧性方面带来的益处。

他的介入比泛泛呼吁负责任创新更为具体。古特雷斯认为,孤立的暂停措施并不足以应对问题;他呼吁具备先进AI能力的国家之间保持联系、交换信息,并建立共同的安全保障措施。这一立场同时挑战了不受限制的竞争,以及单个企业能够独自管理系统性风险的看法。

核心问题在于执行。各国政府普遍认同AI应当安全、透明且可追责,但对于谁来设定边界存在分歧。它们也对放缓发展究竟是保护公众,还是会让渡经济与战略优势,持有不同看法。

古特雷斯AI护栏将讨论推进至自愿暂停之外

古特雷斯要求各国政府以协调机制取代零散承诺,用于识别和管理前沿AI风险。

在其9月新闻发布会上,古特雷斯表示,AI的发展速度已超过社会对其危险的理解速度。他指出,一些开发者曾呼吁暂停,而更多人希望建立护栏。

他的回应并非支持立即在全球范围内停止发展。相反,他表示,当自愿暂停措施彼此孤立、无法验证且执行不均衡时,便难以奏效。若竞争对手仍在其他地区继续开发能力更强的模型,一家实验室放慢速度的作用将十分有限。

这一差异界定了该提案。暂停关注的是发展速度,而护栏则规定了研发、测试或部署可以继续进行的条件。这些条件可能包括独立评估、事件报告、访问控制、安全要求,或触发额外监管的阈值。

古特雷斯并未提出一套完整的监管框架。他呼吁形成共识,明确能力日益增强的系统在何种情况下需要更严格的保障措施。因此,眼下的目标是政治协调,而非制定一部细致的全球性法律。

他还将首要责任放在政府身上。AI公司负责设计和运营这些系统,但政府拥有法律授权、外交渠道和公共问责机制。他的论点是,当故障影响到企业所在市场之外的人群时,企业承诺无法替代这些职能。

国际层面之所以重要,是因为同一模型可以服务多个国家的用户。网络能力、欺骗性合成媒体工具或自动化研究系统,都可以通过软件访问跨越国界。国内规则可以约束供应商,却无法完全遏制在其他地区产生或传播的危害。

古特雷斯将AI与气候危机和日益加深的不平等并列,称其为世界面临的三大生存性威胁之一。这一表述将AI治理置于联合国应对共同风险的更广泛职责之中,但并不意味着当前每一个AI系统都构成生存性危险。

他还表示,AI将成为他在随后一周与世界领导人会谈的重要议题。不过,他否决了在联合国大会期间立即召开AI峰会的想法。一场严肃的峰会需要充分准备,并有政府、企业、科学家和公民社会参与。

这一审慎的时间安排意义重大。它避免将一次外交会议包装成技术与地缘政治难题的解决方案,同时也提出了更严苛的考验:联合国必须将高级别周期间获得的关注,转化为能够产生具体、可验证承诺的进程。

因此,古特雷斯AI护栏提案改变了政策问题。讨论不再只是先进AI是否应当放缓,而是各国政府能否在竞争压力令克制在政治上难以接受之前,建立共同的触发标准、测试方法和沟通渠道。

压力落在政府与前沿AI实验室身上

各国政府如今面临界定可执行安全预期的压力,而AI实验室必须证明,其内部控制措施在经过精心管理的演示环境之外同样有效。

古特雷斯将最尖锐的制度性主张指向各国政府。他将保护公民免受AI威胁视为政府的基本责任。这一立场挑战了那些倾向于将安全决策主要交给开发者的政策制定者。

这同样给前沿实验室带来压力,也就是开发最强大通用模型的机构。这些公司经常发布安全框架、模型评估和部署政策。然而,每个机构自行定义阈值、自行选择许多测试项目,也自行决定披露多少证据。

一项自愿承诺即便出于真诚,仍可能无法成为有效的公共政策。竞争对手或许采用不同的风险衡量方式,新入局者可能拒绝参与,政府和外部研究人员也可能缺乏必要的技术访问权限,无法验证一家公司是否遵循了其声称的流程。

竞争激励加剧了这一弱点。实验室若为额外测试而延迟发布模型,便要承担成本;另一家开发者却可能获得用户、收入、人才和战略影响力。安全由此成为集体行动问题:个体理性的决策会导致整体上更不安全的结果。

近期的行业讨论说明了这种冲突。一些领先高管支持模型评估、监测和有限形式的协调节奏控制。另一些人则警告,广泛限制会将权力集中在既有实验室手中,或让外国竞争对手获益。

这场争议并不只是安全倡导者与科技公司之间的对立,也存在于AI开发者内部。各家公司对哪些风险应优先处理、评估者应如何运作,以及政府能否在不冻结竞争的情况下监管技术工作,都存在分歧。

其中一个担忧是监管俘获。如果少数大型实验室参与界定全球阈值,这些规则可能会反映其系统、资源和商业利益。对成熟开发者而言看似可承受的合规成本,可能将较小公司和学术团队排除在外。

Cohere CEO Aidan Gomez在围绕协调AI发展节奏的更广泛讨论中提出了这一担忧。他认为,影响重大的技术规则不应由少数商业利益一致的公司制定。他的反对并未否定安全保障的必要性,但质疑了由谁来设计这些规则。

独立专家也质疑,嵌入式评估者是否能够真正保持独立。依赖公司提供访问权限、资金或持续合作的审计人员,在报告不利结果时可能受到限制。只有外部人士能够检验其实际运作方式,共同标准才有意义。

与此同时,各国政府对前沿研发缺乏完整可见性。官员可能不知道模型何时获得危险能力、内部评估如何构建,或已报告的缓解措施在部署后是否仍然有效。专业能力在不同机构和国家间分布并不均衡。

这种不对称赋予实验室对用于监管它们的证据以影响力。这也解释了古特雷斯为何将政治协调与独立科学评估联系起来。政策制定者需要共同的技术基础,才能就阈值达成一致或比较各国的执行情况。

企业采购方也面临相关压力。它们正越来越多地将AI用于软件开发、研究、客户支持、招聘和知识工作。全球监管碎片化可能迫使这些组织评估不同市场的披露和合规要求。

良好的内部记录有助于团队了解哪些系统处理过敏感信息、哪些输出影响了决策,以及政策何时发生变化。可检索的AI知识库无法取代监管,但可以保留审计和事件复盘所需的证据。

因此,被迫作出的回应有两个方面。各国政府必须制定能够经受国际竞争考验的可执行要求。AI实验室则必须接受不完全依赖外界信任其自身安全主张的测试和披露形式。

全球协调正与AI竞赛发生碰撞

核心冲突在于协调安全与战略竞赛之间:每个国家都担心,自我克制会让竞争对手获益。

古特雷斯承认,地缘政治分歧可能推动主要国家尽可能快地发展AI。在这种环境下,一国政府可能将另一国提出的安全方案视为限制自身能力的尝试,而非保护公众的措施。

美国和中国主导着这一紧张关系,但古特雷斯明确表示,协调应当超越这两个最大力量。其他国家同样拥有先进实验室、半导体供应链、数据中心、研究机构和重要的技术人才储备。

任何普遍框架都无法有效运作,如果它仅将这些政府视为规则接受者。算力较弱的国家也有不同利益:它们希望获得AI带来的经济收益、在标准制定中拥有代表权,并免受其他地区开发系统造成的影响。

这使AI治理不同于简单的产品安全制度。其底层技术影响科学研究、军事规划、网络行动、产业竞争力和信息系统。各国政府从同一批模型中看到商业机会与国家力量。

美国一直强调保持相对于中国的领先地位,并避免削弱本国开发者的限制措施。对广泛节奏控制措施的政治阻力,反映了对就业、投资、国防和战略优势的担忧,也体现了对集中式国际控制的怀疑。

中国也有自身的安全、发展与治理优先事项。任何有意义的全球安排,都需要包含双方均认为可信的机制。关于负责任AI的笼统声明,无法解决围绕模型访问、半导体管制、检查或敏感技术信息的争议。

古特雷斯以冷战时期的沟通机制作为历史参照。尽管存在深刻敌意,美国和苏联仍保持联系,并就降低风险措施展开谈判。这一类比表明,竞争对手之间可以开展有限协调,而无需实现政治一致。

然而,AI 并不等同于核武器。前沿开发分布在私营公司、研究机构、云服务提供商和各国政府之间。与大型武器平台相比,AI 系统的复制、修改和部署速度也更快。

相关的教训更为具体。当事故、误判或失控竞争同时威胁双方时,竞争大国可以建立沟通渠道。对于 AI 而言,这些渠道可以支持事故通报、共享评估概念,或在部署具有异常危险能力的系统前进行磋商。

一项有效的协议必须界定可观察的行为。各国政府可以比较实验室如何评估网络或生物风险,明确严重事件的报告要求,或相互认可不同司法辖区内等效的测试程序。

验证仍然困难重重。模型能力可能通过新的提示方式、工具访问、微调,或与外部系统的交互而显现。在受控测试中看似可控的模型,在部署后或接入自主工作流程时,可能表现出不同的行为。

信息共享带来了另一项权衡。监管机构需要获得足够的访问权限来评估安全性,但企业和政府希望保护知识产权与国家安全。一套要求无限制披露的框架会招致抵制;一套接受保密声明的框架则会缺乏可信度。

欧盟展示了一种区域性替代方案。其 AI Act 为提供商和部署者设定了法律义务,包括涉及通用 AI 和系统性风险的要求。欧洲主管机构已于 2026 年 8 月根据官方 AI Act framework 开始执行相关条款。

该体系提供了一个具体的监管范本,但它并非全球协调机制。它通过欧洲的法律权限和市场准入发挥作用。其他司法辖区可以采取不同的门槛、执法结构和定义。

这种对比阐明了古特雷斯 AI 护栏的目的。它们未必会取代区域或国家层面的法律。其实际价值在于,为任何单一国家监管机构都无法独自应对的严重风险建立最低限度的共同语言。

联合国拥有科学基础,但没有全球监管机构

联合国已建立用于共享证据和对话的机构,但这些机构无法执行 AI 规则,也无法强制实验室披露敏感信息。

古特雷斯的提议并非产生于制度真空。2024 年 9 月,联合国会员国通过了《未来契约》中的《全球数字契约》。该协议呼吁开展国际合作、实施人工监督、强化问责,并推动以证据为基础的 AI 治理。

Global Digital Compact 还承诺各国政府将设立独立科学小组和全球政策对话机制。这些机制旨在将技术证据与国家及其他利益相关方之间的谈判联系起来。

联合国大会于 2025 年 8 月 26 日推进了这一承诺。第 A/RES/79/325 号决议设立了人工智能独立国际科学小组和人工智能治理全球对话。该决议未经表决即获通过,表明各方对这些机构拥有广泛支持。

该小组由 40 名以个人身份履职的成员组成。他们来自联合国所有五个区域,涵盖学术界、产业界、公民社会和技术领域的专业人士。遴选过程通过公开征集进行,吸引了来自 140 多个国家的逾 2,600 份申请。

其职责是每年编写基于证据的评估报告,分析 AI 的机遇、风险和影响。这些报告旨在为全球对话提供参考,各国政府可在其中与产业界、研究人员、公民社会和技术社群讨论治理方案。

该小组的初步报告指出,大规模部署 AI 存在多类风险,包括心理健康危害、破坏性用途、对社会和环境系统的影响,以及控制先进技术的困难。这些类别为外交官提供了起点,以决定哪些风险需要集体应对。

这一结构回应了国际 AI 讨论中反复出现的一项弱点。各国政府谈判时往往依赖彼此不兼容的定义、私有证据或推测性主张。共同的科学评估可以厘清专家在哪些方面存在共识、哪些领域的证据仍有限,以及哪些评估方法需要改进。

但该小组明确并非监管机构。根据联合国的小组授权说明,它不能制定规则、执行标准或规定具有约束力的政策。其影响力取决于工作质量以及各国政府采取行动的意愿。

全球对话也有类似局限。它可以扩大参与并形成共同理解,但无法强迫任何国家通过一项法律。它同样无法迫使 AI 开发者提供模型权重、训练细节、内部测试结果,或允许外部评估人员访问系统。

这构成了本文的核心权衡。包容性机构能提升正当性,尤其是对于被排除在较小技术论坛之外的国家而言。然而,普遍参与可能拖慢达成协议的进程,并产生足够宽泛、能够容纳相互冲突国家立场的措辞。

规模较小的联盟或许能够更快推进。拥有前沿实验室和先进算力基础设施的国家可以建立技术标准或紧急沟通机制。然而,这样的组织可能会边缘化那些承受 AI 影响、却并不控制其开发的国家。

古特雷斯似乎正在寻求这两个层面。联合国小组可以提供全球科学评估,而有能力的国家则建立更直接的联系和共同护栏。更广泛的成员国随后可以就正当性、准入、发展和人权影响展开讨论。

这种做法类似于其他国际风险治理机制,它们将科学评估、政治谈判和国家执法分开处理。它避免假装一个机构能够承担所有职能,但也创造了多个可能停滞的环节。

科学共识不会自动转化为政治共识。各国政府可以同意某项能力具有危险性,却对如何衡量它存在分歧;可以接受一项测试,却拒绝接受检查;可以支持报告制度,却以国家安全为由隐瞒事件。

因此,联合国的基础具有重要意义,但并不完整。它可以组织证据与谈判,却尚无法保证最具能力的实验室或政府会在竞争激烈时遵守相同规则。

最棘手的问题是如何验证克制

如果护栏没有可观察的门槛、独立测试和对违规行为的后果,它仍只是另一项自愿承诺。

古特雷斯将验证视为单方面暂停的核心弱点。这一检验同样适用于他所支持的任何替代方案。协调一致的保障措施必须明确衡量什么、由谁核查证据,以及参与方未能遵守时会发生什么。

第一个挑战是界定受监管的能力。模型规模和训练算力比许多下游行为更容易衡量,但它们并不能完美预测风险。较小的模型也能通过工具、专业数据或微调获得显著能力。

能力测试同样存在局限。实验室或许能够评估模型是否可以协助网络攻击或生物研究,但其表现取决于提示、访问权限、支撑框架和评估人员的技能。通过一项基准测试,并不能证明模型在实际部署中的全面安全性。

第二个挑战是评估者的独立性。企业掌握关键技术知识和系统访问权限,因此评估需要合作。然而,由提供商控制的评估无法拥有与外部机构设计和审查的评估相同的可信度。

各国政府可以授权经认证的评估者、建立安全测试环境,或要求向监管机构进行保密报告。这些方案在提供监督的同时保护敏感信息,但仍依赖清晰的利益冲突规则和足够的技术能力。

第三个挑战是国际可比性。如果一个国家评估网络风险,另一个国家则关注虚假信息,那么“安全”这样的共同标签几乎说明不了什么。共同护栏需要最低测试类别、文档标准和事件定义。

第四个挑战是时机。发布前评估只能捕捉模型在测试条件下已知的行为。部署后,当用户将模型接入软件工具、敏感数据库、金融系统或实体设备时,风险可能才会显现。

因此,部署后监测必须补充发布前审查。提供商和部署者需要建立流程,记录严重故障、分享相关发现,并更新保护措施。当证据发生变化时,监管机构也需要拥有要求采取纠正行动的权力。

第五个挑战是后果。如果参与方可以无视门槛,却不会失去市场准入、许可证、公共合同、算力资源或其他实质性利益,那么协议的价值就十分有限。执法必须足够可信,才能改变行为。

然而,强力执法也可能带来意外影响。围绕大型实验室资源制定的规则,可能固化现有主导者。对开放模型的限制,可能限制独立研究,却让封闭式提供商获得更大的控制权。

治理也可能成为保护主义的掩护。一个国家可能在没有透明证据的情况下,将外国模型标记为不安全;一家公司可能支持一项对竞争对手负担更重、而对自身架构影响较小的门槛。

这些担忧支持分阶段推进的方式。各国政府可以从危害严重、测试可行且利益重叠的狭窄领域开始。例如,限制协助制造生物武器,或要求报告重大模型赋能型网络事件。

它们还可以通过联合演练建立互信。独立团队可以在受保护的条件下,针对相同风险类别测试可比模型。监管机构随后可以比较结果,而无需要求公开敏感技术细节。

这些措施都不能保证对未来系统的控制。牛津大学技术监管学者 Sandra Wachter 将在当前地缘政治条件下开展广泛全球协调形容为极不现实。这种怀疑应始终处于核心位置,而不应只是脚注。

因此,古特雷斯 AI 护栏提议并不表明一个可执行的体系已经存在。它要求各国政府直面验证问题。衡量成功的标准不是另一份原则声明,而是能够改变高风险系统测试、发布和监测方式的可观察合作。

三个信号将表明合作是否成为现实

接下来的检验在于,政治关注是否会转化为具体机构、技术程序,以及来自推动前沿开发的国家和公司的参与。

第一个信号是古特雷斯在联合国大会高级别周期间讨论的具体内容。对安全 AI 的笼统支持几乎不会增加什么。更有力的信号将是,有能力的国家同意建立定期联系、交换严重事件信息,或制定共同评估类别。

参与的重要性不亚于语言。一个将美国或中国排除在外的进程,无法管控古特雷斯所描述的战略竞赛。它还需要其他拥有先进研究能力、算力基础设施和监管能力国家的参与。

如果各国政府宣布建立一个有明确参与方和既定范围的长期沟通渠道,核心论点就会获得支持。如果它们只发布宽泛的声明,外交层面的担忧与实际协调之间的鸿沟仍将存在。

第二个信号是,独立国际科学小组如何将其初步工作转化为可重复开展的评估。其年度报告职责可以建立共同的事实基础,但前提是它能说明证据质量、尚未解决的分歧以及切实可行的评估方法。

应以监管机构、研究人员和企业能否使用其分类体系来评判该小组。一份能够区分已证实危害与不确定的未来风险的报告,将有助于加强政策讨论。清晰的方法也会让各国政府更难只挑选支持既有立场的结论。

其独立性值得审视。成员以个人身份履职,必须披露相关利益,但该小组仍需要获得前沿系统和最新证据。其公信力将取决于方法的透明度,以及是否明确愿意质疑危言耸听和轻描淡写的说法。

如果该小组发布有用的测试概念并被各国政府采纳,联合国进程就将超越单纯召集会议的阶段。如果它始终与各国监管机构和实验室评估脱节,其影响力将主要停留在咨询层面。

第三个信号是,各国政府是否为任何共同承诺附加核查机制和后果。应关注独立评估、标准化事件报告、受保护的监管机构访问权限,以及为强化保障措施明确设定的门槛。

AI 放缓辩论已经显示,各方围绕测试和监测形成了初步共识。它也显示,在全面放缓、审计机构独立性、竞争以及标准制定控制权方面仍存在深刻分歧。

一项范围狭窄、可核查的协议,比雄心勃勃却无法执行的暂停措施更有意义。各国政府或许可以先从针对灾难性网络或生物滥用的模型评估开始,随后进行保密报告,并就严重事件协调应对措施。

缺乏后果会削弱这一信号。一项允许参与方在模型未通过评估后隐瞒证据或重新界定门槛的承诺,将重演古特雷斯所批评的自愿体系。

企业应关注这些进展,因为碎片化监管会提高合规成本,并使全球部署更加复杂。开发者也应关注,因为安全门槛可能影响算力获取、测试要求、发布进度和法律风险。

知识工作者和普通用户同样与此息息相关。护栏措施可能影响 AI 生成内容是否被标注、自动化决策是否接受人工审查,以及服务提供商在模型造成严重伤害时如何应对。设计不当的规则也可能限制有用工具,却无法应对风险最高的系统。

问题不在于每个国家是否都会采取完全相同的 AI 法律。这种结果既不现实,也没有必要。当下的问题是,竞争对手政府能否就一小部分没有任何一方愿意独自面对的风险达成共识。

古特雷斯已清晰界定了这一选择:孤立的克制无法控制一种无国界技术,而毫无限制的竞争则会引发逐底竞赛。如今,各国政府必须证明,古特雷斯提出的 AI 护栏能否成为可衡量的义务,而非又一项外交愿景。

关注接下来的三个动作:前沿 AI 国家之间的正式沟通、联合国科学小组具有技术实用价值的工作,以及由独立核查支持的承诺。这些信号将揭示,全球合作是否开始约束这场竞赛,还是仅仅在描述其危险。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page