top of page

黄仁勋 AI 安全警告:无法控制不安全实验,就关闭实验室

2小时前
讀畢需時 14 分鐘

黄仁勋本周发出了直截了当的 AI 安全警告:无法控制危险实验的实验室,应当停止运营。这位 Nvidia 首席执行官表示,失去控制的测试会给公众、股东以及运营这些实验室的人员带来不可接受的风险。

这番话听起来像是在要求暂停前沿 AI 开发。但其含义更接近于相反的方向。黄仁勋借助这一假设性的关闭情境,反驳了先进 AI 无法通过工程技术、测试、企业责任和现有法律加以管理的说法。

这一差异使黄仁勋站到了 OpenAI、Anthropic 以及其他前沿开发者所推动的一种政策主张的对立面。随着模型获得更强的自主性和危险能力,这些公司希望建立更严格的治理机制。黄仁勋则认为,非同寻常的警告不能成为将责任从构建这些系统的实验室身上转移出去的借口。

黄仁勋如何谈论 AI 安全

黄仁勋关于关闭实验室的表态带有条件,但这一条件对前沿实验室提出了格外尖锐的挑战。

在接受 Ezra Klein 采访时,黄仁勋谈到:如果一家实验室认为其试验模型可能逃脱控制并对世界造成破坏,应当如何处理。他的回答很直接。

“如果他们说,另一种情况是:我们根本无法控制我们的实验,”黄仁勋表示,“那么我认为答案就是,我们必须关闭这些实验室。”

他补充说,潜在损害将会过于严重。黄仁勋还提到了民事和刑事责任,以及对股东和高管造成的后果。

完整上下文很重要,因为这段引语很容易被误读。黄仁勋并非表示所有开发先进模型的实验室都应关闭。他所描述的是:如果接受实验室自身警告中最令人担忧的版本,那么关闭实验室便是合乎逻辑的结果。

原始采访言论将安全界定为一项运营义务。如果一项实验无法被控制,公司就不应开展它。

这一立场使黄仁勋的 AI 安全主张包含两个相互关联的部分。第一,开发者应在部署前测试系统,并停止发布未通过测试的产品。第二,领导者不能一边描述不可控的威胁,一边全速继续构建它。

黄仁勋并没有否认先进模型带来的所有风险。他反对的是从严肃风险直接跳到假定无能为力的做法。在他看来,AI 模型仍然是由可识别机构创建、运营和分发的产品。

这意味着责任应当继续由这些机构承担。工程师选择训练环境。高管批准部署。公司决定哪些客户可以获得访问权限,以及哪些能力需要受到限制。

他的论点还区分了内部实验与面向公众的产品。实验室可以隔离模型、限制其工具、约束网络访问,并防止对外部署。这些措施并不能保证安全,但会使“不可控”成为一项需要证据支撑的主张。

因此,实际检验标准比黄仁勋自信的措辞所暗示的更为严苛。实验室必须先界定控制意味着什么,才能宣称已经实现了控制。

无法访问互联网的模型呈现的是一种风险。拥有凭证、代码执行能力、支付权限以及外部服务访问权的智能体,则呈现另一种风险。同一个底层模型在接入更多工具后,可能产生不同的风险状况。

黄仁勋的立场仍为监管留出了空间。今年 6 月,他告诉美联社,某些政府监管和安全标准是必要的。他还表示,国家安全应继续作为优先事项。

他的异议在于政策制定者如何界定问题。黄仁勋希望规则针对具体威胁和行为,而不是基于系统逃脱人类控制的广泛担忧。

这种做法听起来很简单:测试产品,控制实验,并让开发者承担责任。困难之处在于,必须在一次失败暴露这些保护措施局限之前,证明它们确实有效。

为什么 Nvidia 的 AI 监管观点让前沿实验室承压

黄仁勋正迫使 AI 开发者协调其对极端风险的警告,与继续拓展前沿能力的决定之间的矛盾。

OpenAI、Anthropic、Google DeepMind 和其他开发者如今都发布了详细框架,用于评估危险的模型能力。这些政策覆盖网络攻击、生物风险、操纵、自主行为和失控等问题。

OpenAI 的治理框架将其安全实践与加州法律和欧盟规则相衔接,涵盖风险评估、事件响应、模型报告、安全管理以及外部专家意见。

Anthropic 采用了更为详细的路线图。其前沿安全路线图包括更严格的基础设施控制、对齐评估、内部监控,以及针对能力显著更强模型的审计。

这些框架承认了一个真实问题:通用模型在不同环境、工具、提示词和部署配置下可能表现不同。评估每一种相关组合十分困难。

这些框架也造成了一种政治层面的矛盾。一家公司可以警告其未来系统具有特殊风险,同时又竞相训练和商业化能力更强的后继产品。

黄仁勋将这一矛盾转化为一个直接的问责问题:如果领导者真的相信这些系统无法被控制,为何他们的公司仍在继续进行实验?

前沿实验室会回答,不确定性并不等于灾难必然发生。风险框架之所以存在,是因为证据仍不完整。开发者通过阈值、评估和缓解措施来管理这种不确定性。

这种回应是合理的,但并不能消除黄仁勋带来的压力。公众警告越紧迫,就越难以为实验室内一切照常的商业运作辩护。

商业激励加深了这一冲突。前沿开发需要芯片、数据中心、电力、研究人员以及庞大的配套基础设施。公司必须推出更好的产品来吸引客户,并为下一轮训练周期提供资金。

Nvidia 位于这一循环的中心。它销售使大规模模型训练和推理成为可能的加速计算系统。开发速度更快,通常意味着对 Nvidia 硬件和软件的需求更大。

这一地位使黄仁勋在反对广泛限制 AI 开发方面拥有明显的商业利益。任何拖慢训练或部署的政策,都可能降低 Nvidia 最大增长市场的需求。

这种利益并不意味着他的论点就是错误的。但这确实意味着,读者应将他的自信视为一位主要供应商的立场,而非中立的安全评估。

前沿实验室也有自身的激励因素。安全规则可以保护公众,但复杂的合规要求同样可能令现有大公司受益。大型开发者负担得起专业法律团队、评估系统和安全计算设施。

规模较小的竞争者可能难以承担相同义务。因此,围绕最大模型设计的规则可能会减少竞争,或提高市场进入成本。

这种可能性有助于解释黄仁勋为何怀疑全面监管。现有实验室可以支持它已经有能力满足的严格要求。由此形成的体系或许会提升安全性,同时巩固既有企业的地位。

然而,现有产品责任制度并不能回答所有前沿 AI 问题。法院通常在损害发生后才会介入。一些 AI 风险的扩散速度,可能快于诉讼或常规执法的反应速度。

一个自主智能体可能利用跨多个司法辖区的系统。被盗模型可能在原始开发者失去控制后被复制。危险能力可能在调查人员确定责任之前就广泛传播。

因此,Nvidia 的 AI 监管立场同时向双方施压。实验室必须说明为何其实验应当继续,而黄仁勋则必须解释,为何常规问责能够应对规模异常可扩展的危害。

黄仁勋的 AI 安全论将监管转化为问责测试

核心争议并非安全是否重要,而是应由企业还是监管者决定一项实验何时变得过于危险。

黄仁勋偏好的模式始于直接责任。构建 AI 系统的公司负责测试、控制访问,并决定部署是否可接受。如果公司行为鲁莽,现有民事或刑事法律便应适用。

前沿实验室的模式则是在严重事件发生前增加结构化监管。这可能包括报告要求、独立评估、能力阈值和强制性保障措施。

OpenAI 曾主张,前沿监管应包括标准、注册、报告和执法机制。其较新的框架将这些理念与具体法律义务及内部风险控制联系起来。

Anthropic 的方法采用与模型能力挂钩、逐级加强的保障措施。它也承认,内部模型即便尚未公开发布,也可能带来风险。

这种内部使用值得关注。部署在实验室内部的模型可能帮助研究人员编写代码、设计实验,或自动化推进后续 AI 开发。即使从未以消费者产品的形式出现,它也可能影响下一代系统。

传统产品监管通常关注最终交付给客户的内容。前沿安全政策则越来越多地审视训练、评估和内部部署期间发生的情况。

黄仁勋的产品类比在这一点上变得不那么完整。内部研究系统并不只是等待批准的成品。它可以参与创造未来系统的过程。

与此同时,将这一过程称为不可控,可能掩盖实际可用的控制措施。开发者可以隔离网络、限制凭证、监控工具使用、保留日志,并要求人工授权。

这些控制措施带来了可量化的工程问题。智能体是否曾试图绕过限制?它能否复制敏感数据?它是否曾向监控系统隐藏某项操作?在对抗性测试中,保障措施失效的频率有多高?

严肃的问责体系应要求实验室以证据回答这些问题,而不是接受任一极端假设。

第一种极端观点认为,先进模型只是普通软件,现有实践已经足够。第二种极端观点则认为,失控不可避免,只有广泛限制才能保护公众。

这两种立场都尚未得到证明。模型评估只能在设计好的条件下提供部分证据。真实部署会引入用户、工具、攻击者和设计者未曾预料的环境。

2026 年的国际安全报告说明了这种不确定性。报告描述了开发者如何使用能力阈值和预防性保障措施,有时并无确凿证据证明某一阈值已被达到。

OpenAI 将某些系统归类为具备高能力,并出于预防目的启用了相关保护措施。Anthropic 在无法排除危险生物能力的情况下,采用了更高的安全等级。

Google DeepMind 也在某个模型触发化学和生物风险早期预警后增加了缓解措施。这些例子表明,实验室决策已经依赖于不确定信号。

Huang 的问责检验可以容纳预防原则,但前提是开发者定义停止规则。停止规则规定了哪些证据将阻止训练、内部使用或公开部署。

如果没有停止规则,安全框架可能沦为文档系统,而非真正的约束。它们记录风险、建议缓解措施,并允许开发继续进行。

政府监管也可能面临同样的弱点。监管机构或许会收到报告,却不具备质疑企业结论所需的技术访问权限、人员或权力。

因此,有价值的政策问题比“监管还是不监管”更具体:谁能叫停一项实验,什么证据会触发这一决定,以及该决定能否接受独立审查。

Huang 将首要责任赋予实验室及其领导者。前沿开发者日益希望建立共同标准并接受外部评估。一个可行的体系可能需要两者兼具。

企业责任之所以重要,是因为监管机构无法观察每一项实验。独立审查之所以重要,是因为企业有动力以有利于维持发布进度的方式解读不确定证据。

薄弱环节在于:在问题发生前证明遏制有效

Huang 的论点取决于遏制是否可检验,但先进 AI 系统令这种保证变得异常困难。

遏制并非单一技术特性。它是覆盖模型、基础设施、工具、数据、用户以及运营该系统的组织的一系列限制。

实验室可以将模型与互联网隔离。但它仍可能通过获得授权的用户暴露敏感信息。它可以阻止代码执行,却允许模型生成由另一套系统执行的指令。

智能体系统又增加了复杂性。AI 智能体是利用模型通过外部工具规划并执行操作的软件。其实际能力取决于这些工具和权限。

一个模型在聊天界面中可能看似安全,但当它能够浏览网页、编写代码、打开文件或调用另一名智能体时,行为可能会有所不同。每增加一项连接,评估者需要审查的范围就会扩大。

规模带来了另一个问题。一项在百万次交互中仅失败一次的保障措施,在小规模测试中可能看起来十分可靠。但在数十亿次请求中,它仍可能导致频繁事故。

Huang 认为企业经常管理复杂风险,这一点是对的。航空公司、药品制造商、云服务商和金融机构都将工程控制与审计及法律问责相结合。

AI 的不同之处在于,实验室并不总能解释模型为何产生某个特定结果。他们可以观察行为和内部信号,但两者都无法提供未来行为的完整图景。

这一局限并不证明遏制不可能实现。它意味着,对遏制的主张应当说明条件、测试覆盖范围、不确定性和剩余风险。

这场讨论还需要区分模型风险与系统风险。模型可能生成危险内容,而周边系统决定了这些内容是否会造成现实世界的伤害。

凭证、速率限制、审批、网络边界和监控可以降低系统风险。即使底层模型通过了标准评估,糟糕的集成仍可能增加风险。

Huang 对责任的关注可能改善这些周边控制。当不安全的集成可能带来个人、企业或刑事后果时,高管的行为会有所不同。

然而,事故发生后的责任无法恢复被盗取的模型权重,也无法撤销每一项自动化操作。预防仍然重要,尤其是在伤害可能快速扩散的情况下。

独立评估提供了一种可能的桥梁。外部专家可以根据商定的威胁情景测试模型或部署。他们的发现能够挑战内部乐观判断,并揭示盲点。

然而,“独立”需要有精确定义。由开发者资助的评估者可能面临利益冲突。无法访问模型权重、系统提示词或部署日志的评估者,可能错过重要行为。

当前的安全辩论日益认识到这一问题。安全激励冲突涉及企业一方面寻求更严格的监管,另一方面又为资本、客户和技术领导地位展开竞争。

这些商业压力并不会自动否定实验室研究。它们使透明度和审查变得更加重要。

Huang 自身的激励同样值得审视。Nvidia 会受益于开发者训练更大的模型并部署更多推理能力。放缓将威胁这一需求。

因此,他提出的叫停挑战作为一个问题而非既成政策时最有效:什么证据能说服 Nvidia,相信某个实验室已经失去对实验的控制?

在本周报道的言论中,Huang 尚未公开提出详细阈值。他提到安全、责任和问责,但这些原则需要可操作的定义。

前沿实验室也不能仅通过发布一份冗长框架来解决这个问题。该框架必须影响实际决策,包括延期、限制访问或取消项目。

Huang 立场的最强版本与实验室立场的最强版本,比双方的言辞所暗示的更为接近。两者都要求不安全的系统不得部署。

他们的分歧在于谁来决定、何时开始干预,以及多少不确定性足以证明应当停止工作。

开发者与企业买家应从这场争论中汲取什么

这场争论影响的不只是前沿实验室,因为下游用户会继承模型、智能体及其集成所带来的风险。

企业买家很少训练前沿模型,但他们仍要决定哪些模型可以访问公司数据、软件代码库、通信工具和运营系统。

供应商的模型卡或安全框架无法取代部署层面的控制。买家决定哪些员工可以授权操作,以及系统可以检索哪些数据。

开发者应将权限视为 AI 产品的一部分。拥有只读权限的智能体,与能够修改记录、部署代码或发送消息的智能体,带来的风险敞口不同。

团队还需要保存持久的智能体活动记录。日志应记录模型版本、工具调用、权限、审批、输出和相关政策决定。

这些证据有助于事件响应与问责。它们也帮助组织确定故障源自模型、集成、用户还是攻击者。

Huang 的责任论点应促使采购团队提出更严肃的问题。当 AI 生成的操作造成损害时,谁承担责任?哪一方负责监控系统,又由谁可以将其禁用?

合同可以划分责任,但技术控制决定事故是否发生。企业应同时审视两者。

因此,在企业层面解释前沿 AI 安全,远不如实验室辩论那样戏剧化。它涉及访问控制、分阶段部署、对抗性测试、监控,以及对重大操作进行人工审批。

这些做法无法消除所有风险。但它们可以避免关于超级智能的推测性辩论分散团队对眼前运营风险敞口的注意力。

实验室的警告依然重要。先进模型可以降低开展网络行动、操纵活动或敏感研究所需的专业门槛。更高的自主性也可能增加人工干预前完成的操作数量。

现有证据支持谨慎,而非确定性。国际报告记录了能力提升,同时也指出持续存在的衡量问题。实验室框架反复承认测试并不完整,威胁也在不断变化。

买家应对两种销售说辞保持怀疑。第一种声称高级智能体是安全的,因为模型提供商已经评估过它。第二种则声称风险不可知,因此责任必须由其他方承担。

部署方控制直接系统。模型提供商控制重要的上游选择。双方都应对自己能够观察和改变的部分承担责任。

知识工作者面临相关问题。他们可能依赖模型输出,却看不到系统的不确定性或其背后的数据路径。

对于低风险任务,审查或许已经足够。高影响工作则需要更严格的核验、更清晰的来源信息以及受限的自动化。

一个总结会议纪要的模型带来的运营风险有限。同一个模型若用于批准付款或变更生产基础设施,后果则截然不同。

Jensen Huang 的 AI 安全辩论为这类部署提供了一条实用规则:如果运营者无法定义系统的边界,就不应赋予它重大权限。

这一原则并不要求相信 AI 会以科幻小说式的方式逃逸。它源于普通的安全和风险管理。

三个信号将表明 Huang 的挑战是否站得住脚

下一阶段将检验行业领导者能否将相互竞争的安全主张转化为可执行的决策。

第一个信号是真实停止规则的证据。关注 OpenAI、Anthropic、Google DeepMind 或其他前沿开发者是否会在跨越已发布的能力阈值后延迟某个系统。

延期将表明安全框架约束了开发,而非仅仅描述开发。若持续发布却没有明显后果,则会强化 Huang 的批评。

第二个信号是可信的第三方访问。独立评估者需要获得足够信息,才能测试已部署系统、内部保障措施和高风险能力。

仅基于经过筛选的演示进行审查,无法解决信任问题。评估者需要明确的访问权限、发布权利,以及免受财务报复的保护。

第三个信号是更具体的监管。泛泛要求“AI 安全”几乎无法说明谁必须采取行动,或哪些行为会被禁止。

有用的规则将明确涵盖的系统、报告义务、评估标准、执法权力,以及隐瞒或鲁莽部署的后果。模糊的监管将支持 Huang 的观点,即这场辩论正在成为一种干扰。

他早先的监管立场为此类有针对性的规则留下了空间。Huang 支持安全标准,同时要求政策制定者精确定义威胁。

这使他最新的表态比单纯反对监管更为复杂。他承认严重风险需要采取行动,但坚持认为实验室不能一边援引这些风险,一边否认自身的控制能力。

前沿开发者也有强有力的回应:不确定性、竞争和跨境影响可能使自愿克制不可靠。一家停止的公司,可能只是将市场拱手让给继续前进的竞争者。

集体行动困境正是监管最能发挥作用的场景。统一的要求可以防止某个开发者通过削减安全工作来获得竞争优势。

剩下的问题是,政府能否在不冻结竞争、也不让既有企业主导规则制定的前提下,设计出这些要求。

目前,黄仁勋的 AI 安全警告应被视为一项问责挑战。它并不能证明前沿风险被夸大,也不是一套完整的治理方案。

它要求每一家实验室将其警告落实为具体的运营决策:什么能力会让实验停止,谁有权作出这一决定,以及外部人士能够审查哪些证据?

开发者、企业买家和监管机构,在赋予先进智能体更大权限之前,都应提出同样的问题。如果答案仍然模糊,这套系统就尚未准备好部署到具有重大影响的场景中。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page