top of page

特朗普与 Anthropic 的 AI 安全冲突从公开发文延伸至晚餐

9月30日
讀畢需時 14 分鐘

据报道,在围绕 AI 安全和发展速度进行了两周异常直接的冲突后,美国总统 Donald Trump 与 Anthropic CEO Dario Amodei 共进晚餐。

Bloomberg 于 9 月 28 日重点报道了这场会面,令特朗普与 Anthropic 围绕 AI 安全的争议从公开声明转入私下场合。然而,双方均未披露任何协议、政策让步,甚至没有公布这次对话的详细内容。

这种沉默之所以重要,是因为分歧并非一场有关监管的常规争论。Amodei 希望当前沿开发者在安全防护落后于模型能力时,考虑协调放缓发展节奏。特朗普则认为,延迟和新增限制可能会让中国获益。

因此,这场晚餐让两个看似难以调和的立场直接交汇。一方认为,发展速度本身是一种有时需要加以限制的风险;另一方则将速度视为美国不能拱手让出的战略资产。

OpenAI、Google、Meta、Nvidia 及其他大型公司同样身处这场政策博弈之中。任何可行的框架都将影响它们如何训练模型、测试危险能力、共享事件数据,以及发布产品。

核心问题在于,一场私下对话能否促成有限的妥协。大范围放缓在政治上仍不太可能,但共同测试规则或保密事件报告提供了更具现实性的共同基础。

特朗普与 Anthropic 的 AI 安全晚餐改变了什么

这场晚餐并未结束辩论,但在双方最显眼的两位对立人物之间建立了直接沟通渠道。

Bloomberg 报道称,在特朗普与 Amodei 公开就 AI 风险提出截然不同的看法后,双方举行了会面。现有报道无法证实晚餐的具体地点、完整宾客名单、持续时间或政策成果。

这些信息缺口要求保持克制。该事件不应被描述为促成协议的谈判。更准确地说,这是一场高层讨论,发生在政府和 AI 高管面临越来越大压力、需要界定可行护栏之际。

会面时机进一步增加了其重要性。9 月早些时候,特朗普公开否认先进 AI 可能威胁人类的警告。他还点名批评 Amodei,并称放缓发展将帮助中国。

根据有关特朗普 AI 立场的报道,这位总统称灾难性 AI 风险是骗局。他表示,这项技术唯一需要的护栏就是一位强大而睿智的总统。

Amodei 则持相反立场。他的提议常被概括为 Dario Amodei AI 放缓方案,但并非呼吁立即叫停所有模型或 AI 产品。

相反,Amodei 主张,当安全研究、监控和评估无法跟上时,开发者应放缓最先进系统的推进节奏。前沿模型是指处于当前最高可用能力水平附近的一小类系统。

他的论点建立在 AI 能力发生的特定变化之上。早期聊天机器人主要根据单个提示生成文本。较新的系统能够使用工具、编写代码、执行更长期的任务,并在较少直接监督下协调行动。

这种演进提高了评估的重要性。评估是旨在揭示危险能力或不可靠行为的结构化测试。与此同时,发布前测试也变得更加困难,因为模型在现实世界中的行为取决于工具、权限和部署条件。

这场晚餐将这些技术问题带入了一场由经济竞争驱动的政治辩论。特朗普的公开立场强调国家领导力、基础设施、投资和快速部署。Amodei 的立场则强调,能力可能会超出社会控制能力的可能性。

两种立场仍有比公开冲突所显示的更多共同点。双方都希望美国及其民主盟友保持对威权竞争对手的领先地位。双方也都认识到,先进系统具有国家安全影响。

它们的分歧在于应如何保护这一领先优势。特朗普将更少限制视为维持领先的最明确途径。Amodei 则认为,经过精心设计的安全措施可通过降低破坏性事故的可能性来维护领先地位。

这一区别对开发者和企业买家至关重要。它决定了安全性是自愿性的产品决策,还是构建和发布最强大模型的前提条件。

一场晚餐无法解决这一制度性问题。不过,它可以澄清双方是否将对方视为谈判伙伴,而非仅仅是公开场合的对手。

特朗普为何反对放缓 AI 发展

特朗普对控制发展节奏的抵制,遵循一项既有政策策略:加快美国 AI 发展、减少监管阻力,并防止中国缩小差距。

政府的框架早于这场晚餐出台。其AI Action Plan呼吁美国主导 AI,并将加速创新置于联邦政策的核心位置。

该计划要求各机构识别不必要地限制 AI 开发或部署的规则、指导意见和协议。它还支持基础设施扩张、美国系统的国际采用,以及先进模型所需计算资源的获取。

这一框架使得特朗普的 AI 护栏难以与产业政策分开看待。测试要求在支持者看来可能是一项安全措施,但政府也可能将同样的要求视为战略竞赛中施加给国内企业的延误。

中国处于这一考量的中心。先进 AI 依赖芯片、数据中心、能源、研究人才、软件,以及大规模部署产品的能力。华盛顿已通过出口管制和其他限制,限制中国获取部分关键投入。

特朗普的方法假定,国内加速将强化这些限制。美国更快的进步能够扩大能力差距、吸引投资,并提升美国平台在海外的影响力。

国内放缓则带来相反的可能性。如果美国实验室延迟训练或发布模型,而海外竞争者持续推进,美国可能失去技术或商业优势。

这一论点具有直观说服力,但其中包含一个尚未解决的假设。它将发展速度视为决定领导地位的主要因素,即使安全防护不足可能导致模型权重、研究方法或基础设施暴露。

模型权重是编码系统大部分行为的已学习参数。若攻击者窃取这些权重,对公开访问或授权使用的限制可能会大幅失效。

因此,Amodei 将安全与竞争联系起来,而非仅将其视为人道主义关切。更好的实验室安全、更强的模型盗窃防御,以及严格的能力测试,都能够保护美国的领先优势。

分歧部分源于时间视角不同。特朗普的策略优先考虑可见的部署、基础设施、投资和短期地缘政治优势。Amodei 则关注在先进系统广泛分发后更难控制的风险。

政治激励更倾向于特朗普的时间表。数据中心带来建设项目、能源需求、企业投资和生产率提升的承诺。这些好处以企业和政府官员可以立即描述的形式出现。

成功预防带来的好处则不那么显眼。一个从未促成重大网络攻击的系统,不会产生醒目的头条。被延后的事件,在人们能够想象被避免的失败之前,可能看起来像是不必要的谨慎。

政府还面临协调问题。仅在美国境内适用的规则,可能给国内实验室增加负担,却无法约束外国开发者。国际限制更难以核实和执行。

中国也有理由拒绝主要由美国公司或西方政府设计的框架。它可能将控制发展节奏解读为试图冻结当前权力平衡,而美国目前正占据优势。

这一担忧并不意味着安全协调不可能实现。核监督、航空标准、网络安全报告和金融管制提供了一些部分先例。但没有任何一种为可被复制、更新并跨境部署的系统提供完整模板。

特朗普的立场将举证责任放在监管一方。支持者必须证明,拟议规则针对可衡量风险、适用公平,并且不会演变成创新的普遍障碍。

Amodei 的立场则将举证责任放在开发者身上。接近危险能力阈值的公司,应在继续推进前证明其评估、安全与控制方法已经准备就绪。

这场晚餐之所以重要,是因为这些责任无法通过口号来调和。“AI 安全”一词既可指普通内容过滤,也可指旨在防止生物滥用或人类失去监督的控制措施。

一项狭义政策必须明确哪些系统符合条件、哪些风险会触发干预、由谁进行测试,以及模型未通过测试时将如何处理。缺少这些细节,争议仍将政治声量很大,却在操作层面含糊不清。

Dario Amodei 的 AI 放缓方案实质上是一套检查点系统

Amodei 的提议并非全面暂停,而是一系列将先进能力与安全防护已准备就绪的证据相连接的检查点。

在其控制发展节奏提议中,Amodei 表示,将前沿发展放缓一到两年,能够让研究人员有更多时间理解和控制先进系统。他将这一立场与早期的暂停要求区分开来。

Amodei 表示,2023 年可用的模型能力尚不足以支持广泛限制。他如今认为,当前系统已经为有用能力和危险行为提供了更多证据。

他的第一项具体承诺涉及嵌入式外部评估人员。这些独立专家将在模型开发期间获得与内部安全团队相当的访问权限。

评估人员将审查实践、调查事件,并评估公司是否遵守自身承诺。Amodei 表示,在狭窄的安全和法律限制范围内,他们应能够不受公司编辑控制地发布重要发现。

这项提议旨在解决自愿安全计划的结构性弱点。公司自行定义阈值、自行进行大量测试,并决定公开多少信息。

外部研究人员通常只能在模型发布后或通过受限访问了解模型。他们未必能够检查训练流程、内部事件、隐藏评估,或保护模型权重的安全控制措施。

嵌入评估人员无法解决所有问题。他们的独立性将取决于资金、访问权、法律保护,以及报告不利发现的自由。

审查人员即使拥有办公室门禁证,也仍可能缺乏挑战发布决定所需的信息。公司也可能对哪些发现足够重要、应当公开存在分歧。

阿莫代伊的下一步,是推动民主国家的前沿实验室开展协调。共同标准可以防止某家公司因接受竞争对手拒绝承担的风险,而获得短期优势。

“检查点”概念是核心。一旦模型达到既定能力水平,开发者就需要提供已采取特定对齐、安全和评估措施的证据。

对齐是指让系统行为持续符合预期目标与约束的努力。当模型能够规划、使用工具、隐瞒错误或利用环境中的弱点时,对齐会变得更困难。

检查点只有在触发条件可衡量时才能发挥作用。算力提供了一个可能的阈值,但仅凭算力无法揭示模型实际能做什么。

能力测试能提供更直接的信号,但它们可能并不完整,或很快过时。一个模型可能在实验室测试中失败,却在配合更好的提示词、工具或额外软件后取得成功。

这正是达里奥·阿莫代伊提出的 AI 放缓方案面临最棘手设计问题的地方。过早启动的保护措施可能会限制较小的开发者和有益研究;过晚启动的措施则会成为危险的记录,而非预防性控制。

阿莫代伊还提出了全球协调的分阶段方案。较低层级针对明确危险的用途,包括生物武器,并要求对严重的网络、生物和对齐风险进行测试。

更具雄心的阶段将对递归式自我改进施加限制。该术语指的是系统帮助研究人员创造更好的 AI 系统,从而可能压缩开发周期。

最强阶段将涉及由核验支持的广泛节奏控制或暂停。阿莫代伊将其描述为一种愿景,而非一项可立即实施的政策。

这一结构解释了为何他的提案不能被简化为“停止 AI”。它试图将限制与具体能力相联系,同时保留前沿能力以下的常规开发空间。

这也解释了为何特朗普仍持怀疑态度。能力检查点会赋予评估者和监管机构对发布时间的影响力。这种影响力可能波及投资、采购、产品排期,以及特朗普所重视的国家竞争。

其他主要开发者让局面更加复杂。OpenAI CEO Sam Altman 也曾警告,先进系统可能失去控制,但各家公司并不总是支持相同的阈值或执行机制。

Meta 一直推动开放权重发布,使外部各方能够下载或修改模型参数。Nvidia CEO Jensen Huang 则反驳过部分最严厉的 AI 风险警告。

Google DeepMind 支持前沿安全研究与评估,同时继续在模型和产品领域积极竞争。这些差异使行业协调远比公开声明共同关切更加困难。

因此,严肃的框架必须约束那些拒绝自愿承诺的公司。否则,最谨慎的实验室将承担延迟,而较不谨慎的竞争对手则获得客户和数据。

检查点方法为与特朗普达成妥协提供了可能。它可以豁免大多数应用,并将重点放在少数能力极强的训练项目上。

这种妥协需要证据证明,所选阈值衡量的是真实危险。它还需要足够快速的程序,避免让每一次先进模型发布都变成无限期的政治审查。

安全论证面临可信度问题

Anthropic 的论点意义重大,但它不能只要求政策制定者相信该公司的判断。

Anthropic 开发 Claude,同时警告 Claude 这样的系统最终可能带来严重风险。这种双重角色赋予该公司相关知识,但也造成了明显的利益冲突。

安全标准可以保护公众,也可能抬高较小竞争对手的成本、拖慢开放权重竞争者,并有利于已经拥有庞大合规团队的实验室。

基于算力阈值的规则可能会巩固资金雄厚公司的地位。基于专有评估的规则则可能让领先实验室对用于监管它们的证据拥有过多控制权。

因此,批评者会问:节奏控制究竟服务于公共安全、既有企业优势,还是两者兼而有之?答案不必非此即彼。

一家公司可以真诚地担忧安全问题,同时支持改善其竞争地位的规则。政策制定者应评估机制本身,而非试图推断私下动机。

Anthropic 可以通过可核验的承诺来强化其论证。独立测试、公开事件摘要、明确的能力阈值,以及受保护的员工关切反馈渠道,都将创造超越高管声明的证据。

该公司已经公布了有关其负责任扩展政策和自愿承诺的信息。其透明度框架描述了外部协作、内部报告渠道以及与政府评估者的合作。

仅仅公开并不能证明其有效性。政策只有在改变艰难决策时才重要,尤其是涉及一项高价值模型发布的决策。

最有力的检验将是:Anthropic 是否会在自己的系统跨过阈值后接受实质性延迟。在可观察条件下出现这种情况之前,该公司是否愿意牺牲速度仍在一定程度上未经检验。

政府同样面临可信度问题。特朗普的 AI 护栏目前高度依赖行政判断、既有刑法、公司实践和有针对性的国家安全权力。

这些工具可以应对不当行为,但前沿风险往往涉及明显违法行为发生之前的情形。现有授权并不会自动提供技术评估或可靠的事件可见性。

特朗普关于中国的论点同样值得审视。竞争可以成为加速发展的理由,但也可以成为加强安全的理由。被窃取的模型或本可避免的网络事件,可能比短暂的评估延迟更直接地削弱国家领导地位。

政策辩论往往将速度和安全视为对立价值。实际上,糟糕的安全可能因触发紧急限制、公众反弹、诉讼、采购冻结或基础设施中断而摧毁速度。

过于宽泛的规则也带来相应风险。它们可能迫使开发者经历无法衡量实际危险的缓慢流程,促使研究转移到其他地方或保持隐蔽。

这场晚宴的私密形式带来了另一层不确定性。个人外交可以缓和紧张关系,并帮助参与者理解技术分歧;它也可能以非正式的接触取代透明的政策制定。

较小的实验室、独立研究人员、劳动者和用户无法获得与总统同等的接触机会。如果政策主要从与顶级高管的晚宴中形成,他们的利益可能被忽视。

联合国安全辩论表明,这场冲突不止存在于特朗普与 Anthropic 之间。阿莫代伊和 OpenAI 的 Sam Altman 曾警告世界领导人,先进 AI 可能逃脱有意义的控制。

美国的回应反对暂停或建立新的全球治理结构。中国也警告,不应形成可能迫使其他国家选边站的排他性集团。

这种国际分歧限制了任何美国政府能够保证的事项。国内标准可以改善美国实验室的实践,但无法阻止每个国家或私人团体开发有能力的系统。

全球协议面临核验难题。政府需要确信竞争对手会披露重大训练运行、能力结果、安全失败事件和被禁止的活动。

AI 项目不像大型实体设施那样容易由卫星监控。训练需要大量基础设施,但模型复制和训练后工作可能更难观察。

对于企业买家而言,这一可信度问题体现在采购中。客户需要了解供应商能否保护敏感数据、控制智能体权限、报告事件并支持审计。

关于生存性安全的宽泛主张无法取代这些运营层面的答案。国家竞争也不会免除买家评估系统在自身环境中如何表现的责任。

最可信的框架将结合公司的专业知识与独立权威。实验室了解自己的系统,而外部评估者可以降低自我认证的风险。

政府将定义法律义务和执法机制。研究人员、民间社会和受影响行业将在标准固化前帮助质疑相关假设。

这种模式比单方面的公司行动更慢,但也更持久。它也更能回应这样一种担忧:一位 CEO 的风险预测可能塑造整个行业的规则。

三个信号将显示晚宴是否会成为政策

下一项检验不是又一份公开声明,而是这场会议是否会在评估、协调或发布决策方面带来可衡量的变化。

第一个信号是针对前沿模型的明确联邦测试框架。它应确定覆盖的系统、评估的能力、负责机构、时间表,以及测试失败的后果。

若框架仅限于严重的生物、网络安全或控制风险,将表明政策正朝阿莫代伊的检查点模式发展。对低能力系统作出明确豁免,将减轻初创企业和学术研究者的负担。

如果政府转而继续完全依赖公司自愿流程,特朗普的加速议程仍将占据主导地位。届时,这场晚宴将代表对话,而非政策转变。

第二个信号是 Anthropic 对嵌入式外部评估的实施。应关注是否有具名评估者、明确的访问授权、报告独立性以及公开的发现结果。

由公司挑选、访问权限有限的审查者,无法建立有意义的监督。能够审查内部事件并批评发布决定的评估者,才能让这项承诺更可信。

这一信号很重要,因为 Anthropic 无需等待国会便可采取行动。其选择将表明,达里奥·阿莫代伊提出的 AI 放缓究竟是一项实际运行的计划,还是主要面向其他开发者的政策论点。

真正的实施也会迫使 OpenAI、Google DeepMind、Meta 和 xAI 解释各自的监督模式。竞争对手可能采取类似审查,或主张现有程序已提供同等保证。

第三个信号是实际的发布决定。当实验室接近能力阈值,必须在发布、增加保护措施或延迟之间作出选择时,辩论就会变得具体。

基于独立证据、有记录的延迟将加强阿莫代伊关于节奏控制可行的主张。绕过先前声明阈值的发布则会削弱这一主张。

政府的回应同样重要。支持一项理由充分且范围有限的延迟,将表明特朗普能将针对性风险控制与普遍放缓区分开来。

若将任何延迟都攻击为向中国让步,则会证实一种更严格的立场。在这种做法下,安全措施只有在不会明显影响开发速度时才可接受。

开发者还应关注政府采购是否开始要求标准化评估。采购规则能够在不实行普遍许可制度的情况下影响公司行为。

企业买家现在也可以采用同样原则。在扩大部署前,他们可以要求提供有关模型测试、智能体权限、事件处理、数据保留和独立保证的证据。

知识工作者面临着这一权衡更为紧迫的版本。能力更强的智能体能够完成更长周期的任务,但更高的自主性也会放大错误操作或过度访问所造成的损害。

组织不应等到全国层面达成共识后,才建立内部控制措施。敏感部署需要明确的权限设置、对重要行动的人类审批,以及支持调查的记录。

特朗普与 Anthropic 围绕 AI 安全的冲突,不会因为简单地认定一方支持进步、另一方畏惧进步而得到解决。双方都声称在维护美国的领导地位,但对威胁的定义不同。

特朗普认为,延误、监管阻力以及来自中国的竞争是迫在眉睫的危险。Amodei 则认为,不受控的能力、薄弱的验证机制和准备不足,都会危及同一战略领先地位。

这场晚宴为以具体门槛和证据取代这种二元争论创造了机会。目前尚无公开信息显示任何一方接受了这样的框架。

因此,未来的决策比这次会面本身更具揭示意义。应关注联邦测试规则、真正独立的 Anthropic 评估机构,以及一项迫使相关方遵守安全门槛的发布决定。

这些信号将表明,这场晚宴是否改变了政策,还是仅仅为下一次分歧营造了更缓和的氛围。读者应依据这些可衡量的选择来判断特朗普与 Anthropic 的 AI 安全争论,而非看谁在餐桌上说出了最后一句话。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page