top of page

Scott Bessent 对 AI 风险的警告将责任重新推回实验室

5天前
讀畢需時 14 分鐘

Scott Bessent 于 10 月 3 日向 AI 领导者发出质问,要求那些警告可能失去控制的实验室放缓开发速度,并为自身技术承担责任。Scott Bessent 对 AI 风险的立场拒绝没有实际安全措施的警告,也让前沿实验室陷入两难:它们必须放慢部署步伐,或证明其安全体系足以支撑持续加速。

这位财政部长是在回应与 Anthropic、OpenAI 及其他主要 AI 组织相关领导人的警告。Bessent 称,没有解决方案的危言耸听是领导力的失职。但他并未否认所有危险。他支持加强防御、开展自愿模型评估,以及建立美国与中国之间的紧急沟通渠道。

这种组合比最尖锐的引语更值得关注。Bessent 主张“安全加速”,由实验室承担第一层责任,政府则保留潜在的兜底角色。因此,冲突并非安全与漠不关心之间的对立,而是行业主导的风险管理与可强制执行的外部监督之间的分歧。

Scott Bessent 对 AI 风险的言论将负担转移给开发者

Bessent 的核心要求很简单:实验室不能一边警告其系统危险,一边期待其他人来设计解决方案。

在 10 月 3 日发布的一次 Axios 采访中,Bessent 表示,在 AI 实验室内部工作的人必须为其模型承担责任。他补充说,实验室似乎正朝这一方向转变。当被问及担心失去对先进系统控制权的高管时,他回答:“那么,他们就应该放慢速度。”

这一回应将熟悉的 AI 安全辩论重新推回最具影响力的参与者身上。前沿实验室,即开发能力最强的通用模型的公司,往往最了解新兴能力。它们也掌控发布时间表、访问限制、评估程序以及许多部署安全措施。

Bessent 的批评针对的是这些权力与行业公开警告之间的落差。Anthropic CEO Dario Amodei、OpenAI CEO Sam Altman 及其他科技领袖一直倡导加强安全措施。他们的警告包括敌对行为者的滥用、自主网络攻击、生物威胁,以及人类可能失去控制权。

根据对 Bessent 采访的报道,他将没有解决方案的危言耸听描述为无益之举。他还认为,美国不能将其技术地位拱手让给中国。

这为开发者带来两项相互关联的义务。第一,在发布自主性不断增强的系统之前识别风险。第二,将这些发现转化为运营限制、安全控制和事故处理程序。

这些言论并未确立法律要求。Bessent 表示,按政府的做法,模型评估仍属自愿。他称,如果某个实验室在存在严重安全担忧的情况下仍继续推进,政府保留介入的权利。

这一保留让该政策比不受限制的自律监管更有分量。即使官员尚未正式动用权力,政府兜底机制也能影响公司的决策。然而,其有效性取决于明确的干预门槛以及可靠的证据获取渠道。

Bessent 的公开言论目前尚未体现这两项要素。他没有说明哪些能力会触发评估、由谁审查证据,或一次未通过的评估将导致何种政府行动。

因此,政府的立场结合了一项即时要求与一套尚未解决的机制。实验室现在必须为其风险负责。华盛顿将随后决定它们的应对是否充分。

Bessent 还将讨论从推测性的灭绝情景扩展出去。他强调了失控的智能体、网络安全威胁、生物滥用,以及非国家行为者发动的攻击。这些风险将前沿研究与政府和企业已经需要防御的系统联系起来。

AI 智能体是指能够在有限人类指引下规划并执行多项行动的软件。这类系统可以浏览信息、编写代码、调用工具,并与其他服务交互。更高的自主性能够创造价值,但也会扩大错误或恶意行动的后果。

这种务实重点增强了 Bessent 的论证。若辩论只围绕人类灭绝,容易引发两种无益反应:恐慌或轻视。网络防御、访问控制、监测和事故报告,则为检验行业责任提供了更具体的标准。

因此,Scott Bessent 对 AI 风险的挑战并非要求再发布一份原则声明,而是要求实验室将其警告与约束自身行为的决策联系起来。

安全加速令 Anthropic、OpenAI 及其竞争对手承压

实验室如今面临压力:它们必须证明,持续部署与其对系统能力不断增强的警告能够相容。

“安全加速”听起来平衡,但它给开发者施加了严苛负担。企业既必须继续推进美国的能力,也必须证明其控制措施以相近速度改善。任一方面落后,都会带来政治和商业风险。

时机加剧了这一压力。AI 高管近期呼吁加强测试、监管和协调。一份独立报道称,Anthropic 和 OpenAI 的领导者警告,先进模型在发布前需要接受独立评估。

人们可以从多种角度理解它们的安全倡议。这些警告可能反映了最接近该技术的组织的真实担忧,也可能帮助大型实验室塑造较小竞争对手难以遵循的规则。

第二种可能性并不能否定风险本身,但确实让政治问题更加复杂。涉及昂贵评估、专业安全团队和受控计算基础设施的要求,可能巩固最大型公司的地位。

Bessent 的回应并未立即赋予这些公司其偏好的监管结构。相反,他要求它们使用已经拥有的权力。若实验室认为其下一代模型带来不可接受的危险,便可以推迟发布、缩小访问范围或加强保障措施。

这正是 Anthropic 和 OpenAI 面临最尖锐矛盾之处。公开警告会让人期待其内部部署决策反映所表达的担忧。一家公司很难一边将某项能力描述为危险,一边广泛发布它,然后又将责任完全归咎于立法者。

随着模型获得浏览器、编程环境、金融系统和企业数据的访问权限,这一矛盾会进一步扩大。聊天机器人输出答案;智能体则可以将答案转化为一连串具有实质后果的行动。

采用这些系统的组织应关注实验室如何界定权限边界。它们还应审查管理员能否禁用工具、保留审计记录、隔离敏感环境,以及调查异常行为。

这些问题比“模型已通过安全测试”的笼统保证更重要。评估覆盖的是某一时刻下的特定条件。实际部署会引入不同的数据、工具、用户、激励因素和攻击者。

Bessent 的言论也让 Anthropic 和 OpenAI 之外的竞争者承压。开放模型的开发者必须考虑,在用户下载并修改软件后,安全措施如何继续有效。封闭模型的提供者则必须解释,为何客户应信任外部人士无法全面审查的控制措施。

开放与封闭系统之间的区别很重要,但不应成为本文的核心冲突。两种方法都可能带来风险,也都需要就实际能力、滥用模式、访问控制和响应程序提供证据。

Bessent 声称,一些中国模型在缺乏同等护栏的情况下,已具备领先美国系统的大部分能力。他将其描述为可能达到美国模型性能的 80% 至 90%。这一估计是他的表述,并非独立确立的基准。

即使不依赖单一百分比,潜在担忧依然可信。一种跨司法管辖区分发的高能力模型会更难监测或撤回。其原始开发者施加的限制,也可能在修改后消失。

封闭服务则呈现出不同的责任集中形式。其运营商可以监测使用情况、调整安全措施并暂停访问。这些公司也掌握判断其系统是否仍然安全所需的证据。

这就是为什么 Scott Bessent 对 AI 风险的评论加大了对每一种开发模式的压力。开放分发检验安全措施能否持久有效;封闭部署检验内部监督是否值得公众信任。

企业同样面临这一问题的自身版本。采购团队不能将供应商的安全声明视为内部控制的替代品。它们需要明确的权限、对关键行动的人类审批、事故升级路径,以及支持后续调查的记录。

对知识工作者而言,眼前的担忧不是抽象的机器接管,而是自主系统是否可能发送错误信息、泄露机密材料、篡改记录或执行有害指令。

这些实际风险并不能解决存在性风险的争论。但它们表明,等待就最极端情景达成一致将是错误的。行业如今已有足够证据来改善防御措施。

自我监管具有效率优势,但仍存在问责缺口

行业主导的安全机制能够快速响应,却无法独立判断商业激励何时削弱了开发者的判断力。

支持自我监管的主要理由始于专业知识。前沿实验室比大多数政府机构更了解自身架构、训练流程、评估方法和基础设施。其工程师可以比立法者通过法律更快地调整模型或部署系统。

自愿制度也可以随技术演进。为某一代模型制定的僵化规则,可能会在能力、界面或攻击方法变化后过时。

Bessent 偏好的方向正是利用这些优势。实验室识别严重风险、构建缓解措施,并为发布决策承担责任。如果这些保护措施失效,政府仍可介入。

问题在于,责任需要后果。公司或许真诚地重视安全,但也可能面临在竞争对手之前推出产品的强大压力。高管可能对证据存在分歧、容忍不同程度的风险,或在出现不利结果后缩小评估范围。

外部观察者通常无法判断究竟发生了哪一种情况。大部分证据仍留在公司内部。自愿披露使公众只能依赖实验室选择发布的内容。

布鲁金斯学会研究人员近期在探讨AI 监管时指出,自我监管可能留下显著的透明度缺口。他们呼吁建立独立监督机制,并强制披露重大事故。

这项批评指出了贝森特方法的核心弱点。实验室无法同时充分承担开发者、评估者、证据持有者以及可接受风险最终裁决者的角色。即使员工秉持善意行事,这些角色之间依然会产生利益冲突。

独立测试或许有所帮助,但“独立”需要精确定义。由公司资助并受严格协议约束的评估方,可能没有权力披露严重发现。嵌入式团队在临近发布期限时也可能失去影响力。

因此,行业责任最有力的版本需要外部制衡。实验室可以持续开展内部评估,而具备资质的独立审查者则检验重大主张。政府机构可以界定报告义务并调查失误。

这种混合模式不同于不受限制的自我监管,也不同于政府对模型设计进行细致管控。它将公共权力聚焦于证据、问责和最低义务。开发者则保留履行这些义务的灵活性。

政治辩论已经开始转向责任追究。参议员 Josh Hawley 和 Chris Murphy 正在准备立法,旨在为某些由 AI 促成的黑客事件分配民事和刑事责任。拟议的代理责任规则与政府依赖现有法律的做法形成对比。

责任追究能让“承担风险”具有具体含义。如果一家公司明知存在危险失效模式,却未采取合理防护措施便部署系统,法律风险可能会影响其决策。

然而,损害发生后的责任追究并不是完整的安全框架。有些事件扩散速度可能快于法院的反应速度。另一些事件则可能涉及多个开发者、部署者、用户和基础设施提供商。

规则还需要区分可预见的失效与蓄意滥用。通用模型可能通过类似的技术步骤,同时支持合法研究与有害活动。若对每一种滥用都施加责任,可能会鼓励广泛限制,却未必能改善针对性的安全保障。

尚未解决的任务,是在部署链条中分配责任。模型开发者控制训练和核心防护措施。云服务提供商控制基础设施。企业控制权限、数据访问和工作流设计。用户提供指令和上下文。

每个参与方只能看到系统的一部分。因此,有效的事故分析需要共享记录和清晰的报告渠道。否则,一旦出现问题,各方都可以将责任指向别处。

这也是贝森特要求提出解决方案时需要更多细节的地方。放缓发布是一项决定,而不是完整的安全计划。可信的计划必须说明:哪些证据足以支持部署、什么会触发限制,以及谁能够叫停这一过程。

公共安全框架也应报告有意义的变化。如果实验室降低阈值、取消审查,或接受更高的部署风险,外部利益相关方需要获得足够信息,以评估这一选择。

企业有理由保护模型权重、安全方法和商业敏感数据。透明度并不要求公开能帮助攻击者的操作说明。但它确实要求以可用形式披露治理变更和重大事故。

没有这些承诺,自我监督便很难与公关区分开来。有了这些承诺,行业就能证明,其警告会转化为可衡量的运营纪律。

中国沟通渠道揭示了更务实的安全策略

贝森特提议的美中通报流程,将严重 AI 事故视为需要共同应对的安全问题,即使双方仍处于技术竞争之中。

贝森特告诉 Axios,他计划提议在华盛顿与北京之间建立紧急沟通机制。该渠道将在 AI 出现严重问题时启用。他表示相信中国会接受这一想法。

该提议源于他与中国国务院副总理何立峰就 AI 安全进行的讨论。根据 Axios 的报道,会谈涉及失控代理以及恶意网络或生物用途。

事故沟通渠道将借鉴其他高风险领域的一个常见原则:当误解或信息延迟可能加剧危机时,竞争对手也能从快速沟通中获益。

AI 存在多种可能令这种沟通变得重要的情境。模型可能协助跨境网络攻击、暴露敏感数据,或在互联服务中出现意外行为。官员起初可能将事故误读为蓄意的国家行为。

直接沟通渠道无法解决技术失效本身,但可帮助政府核实信息、遏制升级并协调防御响应。其价值取决于速度、可信联系人和一致认可的定义。

这些定义将很难达成。美国和中国可能会对何为 AI 事故存在分歧。双方也可能不愿披露漏洞、情报来源或先进系统的细节。

但这一流程仍为检验贝森特更广泛的政策提供了有用机会。如果政府认为 AI 风险严重到需要双边危机沟通,国内的自愿审查就不能无限期保持模糊。

政府需要可靠信息,才能向另一个国家发出警报。这类信息通常始于实验室、云服务提供商、网络安全团队或受影响组织。因此,沟通渠道依赖于有效的国内事故报告。

这种关系将国际协调与企业问责联系起来。实验室不能只承诺在危机中合作;它们需要具备发现事故的监测系统,以及能够迅速将事件上报给官员的升级流程。

同样的要求也适用于使用自主代理的企业。安全团队必须知道哪些模型和工具在其环境中运行,也必须明确当异常活动出现时,谁有权暂停访问。

韧性同样值得重视。贝森特表示,美国高度专注于抵达模型前沿,却在防御方面投入了过少注意力。这一观察将安全工作从预测转向准备。

没有任何评估者能预见每一种有害用途。防御系统必须假设某些防护措施会失效。组织需要分段访问、经验证的备份、异常检测、人工授权以及经过测试的恢复程序。

这种方法不如关于灭绝风险的警告那样引人注目,却更容易衡量。官员可以询问关键基础设施运营商是否完成演练;客户可以询问提供商是否报告事故;审计人员可以测试代理是否超出权限。

国际协调也暴露了纯粹国家监管的局限。模型、云服务、研究论文和攻击技术都会跨越国界。在一个司法辖区开发的危险能力,可能影响其他地区的用户。

但全球协调不应成为拖延的借口。各国可以在就每一种前沿风险达成共识之前,先改善报告机制和基础设施保护。共享协议可以从范围较窄的领域起步,并在实践测试后扩展。

一个有用的初始版本可以明确指定联系人、响应时限、验证程序以及受保护的技术信息类别。演练可以在不暴露敏感模型细节的情况下测试这一流程。

最困难的问题在于信任。战略竞争对手可能利用安全讨论收集情报,或限制对手。双方都需要一种结构,将披露限制在管理事故所必需的信息范围内。

即使是范围狭窄的渠道,也将代表重大变化。它会将某些 AI 失效视为具有地缘政治后果的事件,而不仅仅是产品缺陷。这种认识提高了对创建和部署这些系统的企业的期望。

贝森特的立场包含一种刻意的张力。美国应加速发展以保持领先,但当共同风险超越竞争利益时,也应与中国合作。实验室必须在这两项优先事项之中运作。

这种张力不会通过一句口号消失。它需要在竞争、自愿协调和强制干预之间划定具体边界。拟议的通报渠道可能成为第一项可见的考验。

三项信号将显示责任是否真正落地

下一阶段的评判标准,将是报告规则、发布决定和可运行的危机程序,而非又一轮安全宣言。

第一个信号,是实验室是否公布明确的发布阈值并遵守它们。阈值将经过测量的能力与必要的防护措施或部署限制关联起来。只有在跨越阈值后公司接受延迟发布时,它才具有意义。

读者应关注 Anthropic、OpenAI 和其他开发者如何描述未来的模型评估。强有力的框架会说明哪些结果将触发额外测试、受限访问或推迟发布,也会解释谁可以推翻这一决定。

如果一家主要实验室因自身评估发现尚未解决的危险而放缓部署,贝森特的论点便会获得支持。这一行动将表明,公共警告能够在没有立即政府强制要求的情况下促成内部克制。

如果企业反复警告极端风险,却仍维持激进发布节奏,这一立场就会削弱。这种模式将表明,商业竞争压倒了自愿承诺。

第二个信号,是华盛顿是否建立一致的事故与审查框架。贝森特表示,当前模型审查属于自愿性质,干预仍有可能。缺失的要素,是从一种状态转向另一种状态的可见标准。

可信的框架应确定需要报告的严重事故、负责机构、受保护的披露方式和响应权限。它还应明确何时必须进行独立评估。

这项国际安全审查提供了广泛的科学参考点。100 多名专家参与了对通用 AI 能力、风险和防护措施的评估。不过,证据综合本身并不会形成可执行的义务。

国会责任提案将揭示立法者是否接受政府依赖现有法律的做法。若两党推动建立具体的 AI 义务,将削弱“自愿控制与现行法规已经足够”的主张。

第三个信号,是美中事故沟通渠道是否真正投入运行。公开宣布只是开始。官员需要指定联系人、升级规则、受保护通信,以及至少一次实际演练。

可运行的沟通渠道将强化贝森特的安全加速战略。它将表明,政府在要求实验室承担主要责任的同时,也在建立防御能力。

若提议未能推进,便会留下重要缺口。贝森特已经指出跨境风险,但仅有认识并不能改善危机响应。没有程序,政府将在高压事件中临时应对。

企业不应等到这些政策信号出现后,才着手加强自身控制措施。它们可以盘点已部署的模型、限制工具权限、要求对重大行动进行审批,并保留记录以供事件审查。

个人用户也应将能力与可靠性区分开来。一个模型可能完成令人惊叹的任务,却依然容易受到操纵、隐藏上下文或自信错误的影响。自主性越强,错置的信任代价就越高。

Scott Bessent 对 AI 风险的立场值得关注,因为它迫使人们作出选择。开发者不能无限期地同时发出灾难性警告、快速部署产品,并要求政府决定每一项保障措施。

政府同样无法逃避责任。自愿性标准需要独立证据、可信的后果机制,以及一条可进行干预的路径。否则,公众只能信任那些承受着最强烈持续发布压力的同一批组织。

现在最有价值的问题,并非某一方是否赢得了这场哲学辩论,而是下一次模型发布、被报道的事件或国际演练,是否会带来可验证的改变。

关注实验室在安全测试与部署时间表发生冲突时会如何行动。关注华盛顿是否会将其兜底机制转化为明确的权力。然后,再关注拟议中的危机沟通渠道能否在战略竞争中存续下来。

这些行动将显示,“承担风险”究竟会成为一项运营准则,还是仅仅停留在一句令人印象深刻的话。对于开发者、企业采购方和 AI 用户而言,这一区别将决定日益自主的系统究竟配得上多少信任。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page