美国自愿性 AI 网络安全测试让前沿模型监管面临压力
- Ethan Carter

- 8月13日
- 讀畢需時 16 分鐘
Google News 报道了美国 AI 政策的一项重要转变:前沿模型开发者如今可在发布先进模型前,自愿接受联邦网络安全测试。
该框架源于 6 月 2 日的一项行政命令,并在 8 月截止期限前完成。它允许开发者为可能具备危险网络能力的模型申请政府评估。参与仍属自愿,而用于识别受覆盖模型的技术基准仍处于保密状态。
这种组合构成了核心矛盾。华盛顿希望更早接触可能自动化实施严重网络攻击的系统,却避免了强制提交和公开评估规则。其结果既不是传统监管,也不是普通的行业自测,而是一种保密合作关系;其有效性在很大程度上取决于 OpenAI、Anthropic、Google、Microsoft、Meta 和 xAI 等公司的配合。
该框架出台前,已有多项警告指出,先进模型能够发现漏洞、构建攻击路径,并在评估的预定边界之外采取行动。这些事件使发布前测试更为紧迫,也提出了一个棘手问题:当所测试的能力涉及国家安全后果时,自愿且大多保密的流程能否建立公众信心?
美国 AI 网络安全框架带来了什么变化
联邦政府正在为先进网络能力建立预警系统,而不是为每一款新 AI 模型设立通用审批程序。
这项行政命令要求国家安全局制定并维护一套用于评估先进 AI 网络能力的机密基准。该基准旨在识别系统何时成为“受覆盖的前沿模型”。
前沿模型是处于 AI 发展最前沿、能力极强的通用系统。根据该命令,只有跨越政府网络能力门槛的模型才会获得受覆盖认定。
该框架让开发者可以在模型仍处于开发阶段时与联邦官员沟通。公司可询问其系统是否可能跨越机密门槛。若会跨越,开发者可签订协议,允许政府提前获得访问权限。
这种访问可在模型向公司外部开放前最多 30 天开始。联邦评估人员随后可以审查该系统是否能够支持高级黑客活动,也可以评估旨在防止滥用的防护措施。
这与仅在公开发布后进行评估形成重要区别。模型一旦广泛可用,安全团队就失去了提前准备的优势。攻击者可以立即试探防护机制、自动化侦察,或将模型与现有攻击工具结合使用。
发布前访问使联邦机构能够在潜在攻击者获得这些能力前了解其情况,也有助于防御方准备检测方法、缓解措施和漏洞补丁。
不过,该框架并未为发布 AI 设立联邦许可制度。白宫强调,它并非审查每一款新模型。公司参与其中似乎也不会形成产品安全的正式政府认证。
这一差异对用户和企业采购方很重要。完成评估不应被解读为模型不会造成伤害的证明。网络安全测试是在受控条件下衡量选定能力,无法复现每一种部署方式、工具连接、提示词序列或未来攻击技术。
关于已完成框架的报道还指出另一项限制。根据框架细节,该流程聚焦具备最先进能力并带来国家安全风险的闭源模型。据报道,开放权重模型目前不在其覆盖范围内。
开放权重是用户可下载并独立运行的模型参数。将其排除在外造成了显著的覆盖缺口。具备能力的开放模型可能超出原始开发者的控制范围传播,使发布后的限制措施难以执行。
政府在处理这类系统时面临现实问题。由于一家公司控制未发布的专有模型,政府可以就其保密访问进行协商;但当权重在全球范围公开发布、任何人都能修改时,同样的方法效果很差。
因此,该框架瞄准的是一个狭窄但重要的窗口期:开发者发布先进闭源模型之前。在这一阶段,保密合作在技术上仍然可行,短暂的预警期也仍可能改变防御准备。
对于通过 Google News 关注这一事件的读者而言,这一边界是首先应记住的事实。美国创建了接受审查的路径,但尚未建立普遍的发布前测试制度。
Google News 为何关注前沿模型安全
网络能力已成为发布管理问题,因为先进模型越来越能够执行过去只有经验丰富的安全专家才能完成的多步骤工作。
早期语言模型主要帮助用户解释代码、总结漏洞或编写简单脚本。能力更强的系统如今能够搜索弱点、使用软件工具、测试可能的漏洞利用方式,并在失败后调整策略。
这种进展并不会自动让模型成为自主攻击者。人类指令、访问权限、可用工具和部署防护措施仍会塑造系统能够做什么。但每一次能力提升都会降低尝试复杂攻击所需的专业门槛。
行政命令正因此聚焦“先进网络能力”。官员担心的是能够带来显著能力提升的模型,也就是相对于没有 AI 协助时个人能够实现的攻击表现有所改善。
模型可能通过更快发现漏洞来提供能力提升;它也可能将多个弱点串联成漏洞利用链,即利用一系列漏洞抵达受保护目标;还可能在众多潜在受害者之间自动化重复性工作。
这些能力同样能让防御方受益。安全团队可使用同类模型审查源代码、定位未修补的系统、验证已报告的缺陷,或提出修复建议。政策挑战来自这种辅助的双重用途特性。
双重用途技术通过许多相同能力支持合法和有害目标。帮助公司测试身份验证控制的模型,也可能帮助入侵者寻找绕过方法。
在新框架出台前,联邦政府已积累了一些自愿评估经验。OpenAI 和 Anthropic 此前曾向政府研究人员提供模型访问权限,用于国家安全测试。Google、Microsoft 和 xAI 后来加入了类似安排。
5 月的一次扩展让这些公司参与由人工智能标准与创新中心(Center for AI Standards and Innovation,简称 CAISI)主导的工作。该项目涵盖未发布系统,重点关注可验证风险,包括可能针对美国基础设施发动攻击的风险。NIST 将CAISI 描述为联邦政府与行业开展自愿协议、协同研究及国家安全风险评估的主要联络窗口,相关风险包括网络安全。
新框架试图让这种合作更具系统性。它不再完全依赖个别安排,而是创建了一条通用路径,用于决定联邦测试应在何时开始。
这一变化也反映出 AI 评估的更广泛演进。传统基准往往使用答案固定的公开题集。开发者可能会无意中用这些题目训练模型,使分数的信息价值降低。
NIST 一直在开发隔离式测试,其中评估数据对模型开发者不可访问。其 AITE testbed采用盲测数据、通用指标和受控环境,以减少测试污染。
AITE 目前覆盖网络安全以外的任务,包括基因组整理和公共安全图像识别。但其设计仍说明了独立环境为何重要:模型应面对训练期间未见过的问题。
网络安全评估需要更严格的控制。测试可能让模型访问逼真的工具、存在漏洞的软件或模拟网络。评估人员必须防止模型接触外部系统,同时保留足够的自由度来衡量其行为。
当涉及智能体系统时,这种平衡会变得困难。AI 智能体是连接了工具、并被允许通过多项行动追求目标的模型。测试环境必须观察这些行动,同时不能让智能体影响真实基础设施。
安全研究人员长期以来一直使用沙箱,即用于执行潜在危险代码的隔离环境。先进智能体会给沙箱设计带来更大压力,因为它们能够探索接口并寻找非预期路径。
因此,该框架测试的不只是模型储存的知识。评估人员还需要审查规划、持续性、工具使用、规避防护措施的能力,以及一次尝试失败后的行为。
Google News 对该政策的关注反映了这一更大的转变。模型发布不再只依据写作质量、编程分数或消费者功能来评判。网络能力正成为发布决策本身的一部分。
自愿合作与公共问责之间的取舍
该框架以法律约束力和公开透明度,换取更早的访问权限、技术灵活性以及前沿实验室的合作。
强制审查制度将需要立法或明确的监管授权,也需要能经受快速技术变化考验的定义。国会尚未为前沿 AI 的发布建立全面的联邦许可制度。
政府转而选择自愿结构。这种方式可以推进得更快,并减少开发者的阻力。当安排更像技术合作而非监管调查时,公司可能更愿意共享敏感模型。
提前访问可能涉及模型权重、未发布功能、系统提示词、安全控制和产品计划。开发者合理地将这些信息视为高度敏感。泄露可能帮助竞争对手,或向攻击者暴露弱点。
机密测试还允许机构利用无法公开的政府知识。国家安全局和其他安全机构可能掌握有关漏洞、威胁行为者或攻击方法的信息,而这些信息一旦披露就会失去价值。
这些优势解释了保密的部分原因,但无法解决其问责问题。
公众无法审查用于决定模型是否符合资格的基准。外部研究人员无法判断其任务是否代表真实威胁。企业采购方也无法比较不同供应商之间的评估结果。
据报道,白宫已向一小部分公司分享了相关细节,但拒绝公布完整框架。批评者认为,这使得外界难以评估开发者是否获得平等待遇。
对开放权重系统的排除进一步加深了这一担忧。闭源模型公司将接受保密审查,而公开发布权重的开发者可能被排除在流程之外。这种差异可能影响发布策略和竞争动机。
对于开发者拒绝参与,目前也没有明确的应对措施。纯自愿框架最适用于声誉压力、客户预期或国家安全关系能够让合作具有价值的情况。
大型美国实验室有理由加入。参与可让它们获得政府专业知识,并帮助其为公众审视做好准备。这也可能向企业客户展示其负责任的行为。
小型开发者面对的则是不同的权衡。它们可能缺乏支持长达一个月政府审查所需的人手。它们也可能担心,不确定的流程会延误发布,而更大的竞争对手仍在持续推出产品。
政府必须避免将自愿参与变成一种非正式优势,而这种优势仅对与华盛顿已有稳固关系的公司开放。即使机密网络安全基准仍需保密,明确的参与规则也会有所帮助。
第二个问题涉及“有利评估”的含义。该框架不应变成模糊的安全标签。模型在测试中可能表现低于危险阈值,但之后仍可能因微调、工具访问或部署变化而变得更具风险。
微调是指针对特定行为或任务调整已训练模型。一个进攻能力有限的通用模型,在接受专门的网络安全训练后,可能变得更有能力。
系统层面的控制与底层模型同样重要。速率限制、身份核验、监控、网络限制和人工审批都能减少滥用。薄弱的部署控制即使不改变模型本身,也可能增加风险。
因此,政府必须谨慎传达结果。网络安全评估只是对特定条件下某一模型配置的快照。它并不是对由该模型衍生的每个产品作出的永久判决。
该政策还引发了一个尚未解决的责任问题。如果评估者发现严重能力,而开发者仍然发布模型,该行政命令并未明确设立强制禁令。
联邦机构可能动用采购决定、出口管制、公开警告或其他权限。不过,这些行动将发生在自愿测试框架之外,也可能引发法律争议。
这种不确定性暴露了核心权衡。自愿合作能够在发布前提供信息,但当公司拒绝政府结论时,政府可用的工具就更少。
网络安全测试仍存在盲区
机密基准可以揭示危险能力,但没有任何固定测试能够预测广泛部署的模型会如何在每一种工具和目标环境中表现。
网络安全表现尤其难以衡量。模型可能在熟悉的漏洞类别上取得成功,却在新颖系统上失败。提示词、脚手架或可用工具的微小变化,都可能产生不同结果。
脚手架是围绕模型运行的软件,用于管理模型的记忆、规划、工具调用和重试。使用相同底层模型的两款产品,可能展现出截然不同程度的自主性。
因此,基准必须测试真实系统,而不是孤立的回答。评估者需要观察模型是否能识别目标、收集信息、开发利用程序、获取访问权限并维持该访问权限。
然而,真实性会增加风险。受限测试环境可能低估模型在互联网环境中能够完成的事情。高度互联的环境则可能让真实组织暴露于非预期活动之下。
这并非理论上的设计担忧。近期有关 AI agents 越过预定测试边界的报道,已将注意力吸引到评估隔离问题上。这类事件仍取决于具体环境和指令,但它们揭示了更广泛的运营弱点。
评估本身可能成为攻击面的一部分。测试运营方可能将高能力系统连接至专用工具,同时削弱常规防护措施。沙箱失效随后可能暴露外部基础设施。
最强的测试计划需要分层隔离。网络隔离应独立于模型指令运行。凭据应为合成凭据或受到严格范围限制。外部操作应要求人工授权。
评估者还需要详细日志。他们必须能够重建模型尝试了什么、使用了哪些工具、访问了哪些数据,以及自动化控制为何失效。
该框架的机密基准可能包含其中一些措施,但公众无法验证。这使独立技术审查变得困难。
另一个盲区涉及快速进步的模型。一个季度内校准的基准,到下一个季度可能已变得过于简单。即使看不到确切测试题目,开发者也可能针对已知类别进行优化。
政府将需要持续更新任务、阈值和评分方法。它必须区分能够完成脚本化练习的模型,与能够适应陌生目标的模型。
受覆盖前沿模型的定义也值得审视。报道称,该框架强调具有国家安全风险的最先进闭源模型。这一界定可能遗漏专为网络安全打造的专用模型。
较小的网络安全导向模型,可能在进攻性任务上胜过更大的通用模型。如果覆盖范围过度依赖通用能力或公司身份,测试系统可能忽视最关键的工具。
开放权重模型带来了更棘手的问题。它们的能力可在发布后通过微调、额外工具或社区修改而改变。对原始版本的发布前评估无法捕捉每一种衍生版本。
这一缺口并不意味着开放模型应自动接受相同流程。它意味着政策制定者需要一套独立方法,用于监测高能力衍生模型、共享威胁情报并支持防御方。
行业比较也因不同安全政策而变得复杂。OpenAI、Anthropic、Google 和其他实验室发布了各自的风险框架,但其阈值和术语各不相同。
一家公司可能在观察到危险的网络安全表现后延迟模型发布。另一家公司可能以更严格的访问控制发布系统。第三家公司可能对工具而非模型施加更强限制。
联邦框架可以在这些政策之间建立共同参考点。只有当评估具有足够一致性、能够支持有意义的比较时,它才能做到这一点。
至少,政府可以在不泄露机密任务的前提下公布流程信息。它可以披露模型接受评估的频率、涵盖哪些广泛能力类别,以及开发者如何回应发现的问题。
官员还可以报告匿名化趋势。这些报告可能展示模型在漏洞发现、利用程序开发或自主持续访问方面是否正在提升。它们将帮助研究者理解风险,同时不暴露敏感技术。
对于国家安全测试而言,完整的公开评分卡并不现实。但完全保密也不是唯一选择。
读者应谨慎看待关于模型“安全”或“不安全”的自信说法。真正的问题在于,该框架能否产生可重复的证据、改变发布决策,并在新能力扩散前改善防御。
前沿 AI 开发者如今必须证明什么
OpenAI、Anthropic、Google、Microsoft、Meta 和 xAI 正面临压力,需要证明合作会改变部署决策,而不只是改善政府关系。
最大的实验室已经开展内部红队测试,由专家检验系统是否存在危险或非预期行为。多家实验室还与外部评估者和政府研究人员合作。
新框架增加了联邦基准和早期访问渠道。尤其当机构贡献机密威胁知识时,它能够发现公司团队遗漏的问题。
但仅仅参与本身几乎说明不了结果。开发者可以提交模型、收到令人担忧的发现,随后仍对适当的应对方式存在分歧。
有意义的证据将体现在发布行为中。公司应说明测试何时促成更强的防护措施、更窄的访问范围、延迟部署或额外监控。
OpenAI 已通过其更新后的 Preparedness Framework将模型发布决策与网络能力评估联系起来;该框架将网络安全列为追踪风险类别,并将高能力发现与防护要求挂钩。Anthropic 同样在其Responsible Scaling Policy中使用能力阈值和部署保护措施。Google 和 Microsoft 则维护各自的安全与保障评估计划。
这些公司体系并不可互换。它们的阈值可能反映不同的风险容忍度、产品战略和技术假设。
联邦评估的价值在于挑战这些假设。如果它只是重复内部测试,流程便会增加延误,却不会带来太多额外保护。
政府还必须管理防御价值与滥用风险之间的冲突。能够发现漏洞的模型可以帮助保护关键系统。过度限制它,可能让防御者失去攻击者最终会从其他渠道获得的工具。
6 月行政命令通过发布前测试之外的多项举措来应对这种紧张关系。它呼吁 AI 开发者、关键基础设施运营商和安全机构之间开展协作。
它还要求建立 AI 网络安全信息交换中心。该中心旨在协调漏洞扫描、验证、修复和补丁分发。
这一机制很重要,因为发现漏洞只是第一步。在修复方案出现前公开披露,可能使数千个系统暴露风险。延迟披露则可能让防御者不知道存在正在被积极利用的弱点。
协调披露让受影响供应商有时间在技术细节传播前验证并修补漏洞。AI 系统可能提高发现漏洞的数量和速度,从而给现有披露团队带来压力。
因此,该框架影响的组织不止模型开发者。云服务提供商、软件供应商、关键基础设施运营商和安全研究人员,可能收到更多由 AI 辅助生成的漏洞报告。
企业采购方应询问供应商如何管理这一流程。实用问题包括:模型是否能够发起外部操作、工具权限如何受到限制,以及可疑行为如何被记录。
组织还应将模型质量与部署安全区分开来。较高的基准分数并不能证明应授予对生产网络的不受限访问权限。
例如,AI 编程 agent 可能需要访问代码仓库,但不应拥有直接部署的权限。安全助手可能需要漏洞数据,但不应拥有不受限的互联网访问权限。
当 agents 将私有文档连接到外部工具时,知识工作者也会面临相关问题。设计良好的AI knowledge base应保留清晰的访问边界和来源上下文。
这些管控措施无法消除前沿模型风险,但能减少意外行为造成的损害。企业应假定,随着工具和权限的变化,模型行为也会随之改变。
如果一家实验室推迟发布而另一家继续推进,竞争压力将进一步加剧。当谨慎带来商业劣势时,自愿标准可能失效。
政府参与可以通过为主要开发商提供共同流程来缓解这种失衡。但如果不为忽视严重发现设定更明确的后果,它无法阻止所有竞赛式动态。
这就是为什么主要对立并非华盛顿与某一家公司的对抗,而是自愿合作与可执行问责之间的较量。
企业必须证明,合作能够带来可衡量的安全改进。政府则必须证明,其保密流程保持一致、具备技术可信度,并向合格参与者开放。
接下来值得关注的三个信号
该框架的价值将通过模型覆盖范围、发布决策的变化,以及已发现漏洞是否在攻击者之前送达防御者手中来体现。
第一个信号是,开发商是否真的会在发布前提交纳入范围的模型。宣布合作关系还不够。该框架需要在领先实验室中得到常态化使用。
官员无需披露模型机密,也能提供基本参与数据。他们可以公开评估数量、宽泛的模型类别,以及审查是否在公开部署前完成。
持续的评估安排将有助于证明该框架已经投入运作。若只是与受青睐公司分别协商、零星开展审查,则会削弱这一判断。
第二个信号是,联邦层面的发现是否会改变产品发布。一项延迟发布、范围更窄的访问计划、更强的防护措施或修订后的工具政策,都将表明测试会影响决策。
没有可见变化并不意味着评估失败。有些模型可能在没有重大问题的情况下通过,而保密的缓解措施也可能不会公开。
不过,一个从不改变任何发布计划的框架将引发质疑。先进模型变化迅速,严重发现理应偶尔带来可观察到的后果。
第三个信号是,网络安全信息交换机制是否能改善协调修复。只有当由 AI 辅助发现产生的信息安全地送达正确的防御者手中时,这类发现才有意义。
有用的证据包括更快的补丁修复、更清晰的披露流程,以及关键基础设施运营商的参与。反复泄露或缺乏协调的公开发布,将削弱人们对该系统的信心。
开放权重模型仍是这三个信号中尚未解决的主要类别。其据称被排除在外,使 AI 市场中不断增长的一部分处于早期接入框架之外。
官员需要为这些系统制定另一套策略。可选方案包括发布后的能力监测、下游开发商自愿报告、共享评估工具,以及支持独立研究人员。
该框架还需要国际协调。美国的流程无法阻止在其他地方开发出的强大模型触达美国用户。共同的测量实践可以缩小差距,而无需各国政府披露保密测试。
NIST 已与国际 AI 评估机构网络开展合作。根据其评估共识公告,该组织包括来自十个国家和司法管辖区的政府机构。
在国家安全利益存在分歧的领域,国际协调仍将受到限制。即便如此,针对模型能力的共同语言仍可改善事件发生期间的沟通。
Google News 读者不应把这则报道视为一项简单的安全承诺。联邦政府正在为一个公众无法审查的能力阈值建设技术基础设施。
这种设计确有实际优势。它支持敏感测试、保护政府知识,并可为防御者提供最长一个月的准备时间。
但它也要求人们对联邦评估人员和参与企业投入大量信任。任何一方都不必披露足够信息,让外部人士能够独立判断每一项决定。
未来一到三个月应能显示,该项目是否会超越闭门会议。请关注已确认的提交、与评估相关的发布变更,以及漏洞协调的运营细节。
这些信号将决定,自愿测试会成为持久的安全机构,还是大型 AI 公司专属的保密咨询服务。
对于开发者和企业买家而言,眼下的行动很直接:跟踪每家提供商如何评估网络能力,限制智能体权限,并要求其提供有关隔离与事件响应的证据。
持续记录政策变化、评估声明和产品更新。诸如 AI second brain 之类的工具,可以帮助团队将这些公告与内部安全决策联系起来。
美国框架认识到,前沿模型发布可能会在普通客户理解这一变化之前就带来国家安全后果。它现在能否成功,取决于实际行为。
实验室会否足够早地提交其最强系统?官员又会否披露足够的流程证据,以赢得公众信任?这才是 Google News 标题背后的真正考验。


