白宫 AI 网络安全审查让秘密规则承压
- Aisha Washington

- 8月13日
- 讀畢需時 14 分鐘
白宫已完成一套自愿性的 AI 网络安全框架,但参与审查的实验室能够看到公众无法获知的细节。政府官员安排与 OpenAI、Anthropic、Google 及其他科技公司展开讨论后,这一进展进入了 Google News 的报道视野。
这正是核心矛盾所在。华盛顿希望前沿实验室在发布前将先进模型提交政府审查。然而,决定审查标准的机密门槛,仍对独立研究人员、小型开发者和大多数企业客户保密。
该框架源于 6 月 2 日一项涉及具备先进网络能力模型的行政命令。它允许政府审查人员最多在模型公开发布前 30 天获得早期访问权限。从法律形式上看,这项安排是自愿的,但政府采购、出口管制和国家安全权力使参与其中的利害关系大幅提高。
OpenAI、Anthropic 和 Google 在截止日期前协助制定了草案。它们也拥有应对机密流程所需的资源、安全团队和政府关系。较小的实验室则面临另一个问题:封闭的审查体系是否会成为参与前沿竞争的非正式门槛。
这并非又一次普通的华盛顿咨询。它试图监管一种能够发现漏洞、编写漏洞利用代码,并以日益增强的自主性操作工具的软件。悬而未决的问题是:谁有权判定这些能力何时变得危险。
Google News 将封闭的 AI 审查带入公众视野
白宫已建立发布前审查渠道,却未公布决定哪些模型纳入其中的规则手册。
政府表示,它已在 8 月截止日期前完成这套自愿框架。据最初报道,官员随后计划与 AI 公司举行工作人员层面的讨论,审阅已完成的文件。
该框架规定,当模型接近机密能力门槛时,开发者应如何与政府接洽。这一门槛涉及先进网络安全表现,包括发现或利用软件漏洞的能力。
它也涵盖政府访问所附带的条件,包括保密、网络安全、内部风险控制、知识产权保护、模型使用以及保密义务。
政府最多可在公开发布前 30 天获得对受覆盖模型的访问权限。“可信合作伙伴”也可获得早期访问权限,但政府尚未公开确认所有符合资格的机构。
这使该框架不只是技术评估指南。它创建了一个受控圈层,允许其中的机构在客户、研究人员和竞争对手看到之前,检查部分最强大的系统。
一名政府官员告诉 Axios,该框架本身已按时完成。该官员还表示,与业界就后续步骤的讨论正在进行。
不过,白宫并未公开发布该文件。它也没有说明企业何时会开始使用该框架、争议将如何解决,或不同开发者之间的评估如何保持一致。
因此,这一封闭框架带来了两层不确定性。企业不了解所有操作细节,而公众无法审视适用于这些企业的标准。
机密基准又形成了一道障碍。开发者和经过筛选的研究人员可在“适当情况下”获得门槛信息,但更广泛的安全社区无法独立评估这条界线。
国家安全可以为保护敏感测试提供理由。公布精确的漏洞利用基准,可能帮助对手训练模型规避测试,或暴露防御弱点。
但保密范围不止于单个测试题目。外部人士同样缺乏对审查方法、证据标准、申诉流程和汇总结论的公开说明。
Google News 在此更像一个传播渠道,而非政策制定者。聚合报道正在揭示一项政策流程,而政府本身基本将其置于公众视野之外。
搜索这一词组的读者,可能会看到一个简单的会面新闻。真正重要的变化是,机密的发布前流程如今已经存在,尽管其实际边界仍未明确。
政府称,除 OpenAI、Anthropic 和 Google 外,它还在与更多企业合作。但这种更广泛的参与并未回答:每位开发者是否都能获得可比的访问权限或待遇。
它也未澄清企业是否可以安全地拒绝审查。当联邦采购决定、安全指令或出口限制能够影响模型的商业覆盖范围时,自愿体系就不再那么自愿。
这种张力使事件超越了一场会面。它将前沿实验室置于一项政策试验中:合作意味着获得影响力,但也意味着其模型将接受政府评判。
白宫为何在规则尚未就绪前采取行动
AI 系统逼近网络安全门槛的速度,快于政府建立透明、可重复评估流程的速度。
6 月 2 日的命令回应了一项现实风险。先进模型可以协助防御者,但同样也能帮助攻击者识别漏洞、自动化侦察并生成漏洞利用策略。
前沿模型是处于当前能力领先边缘的先进通用系统。其风险并不只来自文本生成,而是来自推理、代码执行、外部工具和持续完成任务能力的结合。
该行政命令要求联邦机构建立流程,用于评估具备先进网络能力的模型。它还强调关键基础设施、联邦网络以及美国 AI 知识产权的保护。
根据该命令,政府的基准测试流程属于机密。相关机构可判定模型是否跨越门槛,从而需要在部署前接受额外审查。
白宫将这一做法描述为创新与国家安全之间的平衡。其更广泛的AI 安全指令将前沿发展与军事战备、关键基础设施和美国技术领导地位联系起来。
近期的模型行为增加了紧迫性。OpenAI 表示,无法排除其即将推出的 Astra 模型在公司内部准备度体系下具备“关键”网络安全能力的可能性。
OpenAI 在引入更严格控制措施的同时,放缓了该模型部分测试。这些措施据称包括隔离的测试环境,以及在 Astra 可通过工具行动的应用场景中扩大监控范围。
该公司的选择之所以重要,是因为它表明:在成熟的政府流程尚未形成之前,一家实验室已在运用自己的能力门槛。OpenAI 仍控制着测试设计、证据、缓解措施以及最终发布决定。
Anthropic 对 Mythos 采取了另一种审慎做法。该公司声称,该模型在发现和利用部分漏洞方面能够胜过人类网络安全专家,因此限制了其访问权限。
这些说法需要谨慎看待。它们来自开发者,独立研究人员尚未获得不受限制的访问权限,以复现每一项结果。
即便如此,政府官员的回应仍表明,潜在风险值得关注。白宫幕僚长 Susie Wiles 与 Anthropic CEO Dario Amodei 会面,讨论该模型及相关安全问题。
一名官员告诉美联社,计划供联邦使用的先进模型将需要经历技术评估期。Anthropic 将这次会面描述为围绕网络安全、美国 AI 领导地位和安全性的讨论。
这场Mythos 会面说明了为何华盛顿不愿等到破坏性事件发生后再行动。它也暴露出,在缺乏共享测试的情况下评估非凡主张的困难。
NIST 还基于其 Cybersecurity Framework 2.0 制定了 Cyber AI Profile。这项工作涉及三个领域:保护 AI 系统、使用 AI 进行防御,以及抵御 AI 赋能的攻击。
逾 6,500 人加入了为初步框架作出贡献的社区。NIST 还通过研讨会、会议和公开征求意见期收集反馈。
这份Cyber AI Profile展示了更开放的标准流程可能是什么样子。它公开其概念,并在定稿前邀请广泛参与。
白宫框架服务于更狭窄的国家安全目的。然而,这种对比使其不透明性更加显眼。
NIST 为管理 AI 相关风险的机构提供公开指导。白宫流程则决定哪些前沿系统在发布前需要获得政府的机密关注。
这两种职能可以并存,但两者之间的关系仍不清楚。企业需要知道,通过联邦审查是否意味着具备普遍安全性、仅代表一项特定网络能力评估,还是两者皆非。
模型可能低于机密网络门槛,却仍可能因数据泄露、提示注入、恶意集成或不安全的智能体权限而带来严重风险。
同样,跨越门槛的模型也可能为防御者提供非凡价值。被归类为受覆盖模型,并不自动意味着公开部署是不负责任的。
压力源于这种不匹配。模型通过快速工程迭代不断提升,而公共机构则需要稳定的定义、法律授权、合格的评估人员和一致的程序。
华盛顿选择先建立审查渠道。缺失的规则如今将随着企业已在准备可能触发该流程的模型而逐步形成。
顶级 AI 实验室获得影响力,也接受新的审视
OpenAI、Anthropic 和 Google 能够影响这一体系,因为它们拥有政府所需的模型、专业知识和安全基础设施。
三家公司在框架完成前提供了反馈。它们的参与可以理解,因为政府评估者若无法接触前沿系统和开发者专业知识,就无法设计出切合实际的测试。
OpenAI 已公开支持为先进 AI 建立持久的联邦架构。其治理蓝图呼吁加强联邦机构,并建立一套受新兴州法律启发的国家框架。
Google 带来了不同的经验积累。其 Secure AI Framework 为 AI 开发和部署构建保护体系,而 Coalition for Secure AI 则将这项工作延伸至多家公司。
这套安全 AI 框架聚焦于实用控制措施,包括威胁检测、自动化防御、模型风险管理,以及覆盖整个软件供应链的保护。
Anthropic 已将能力风险置于其企业身份的核心。其方法是在内部评估显示模型能够支持日益危险的活动时,逐步升级安全防护措施。
这些实验室共同掌握着政府难以独自获取的证据。它们了解模型如何训练、安全层如何运作、哪些评估可靠,以及内部系统曾在哪些方面失效。
这种依赖关系构成了本文最主要的对立面:私人影响力与公共问责之间的冲突。
行业参与能够提升该框架的技术可信度,但也可能让资源最雄厚的公司围绕自己早已采用的做法来定义合规标准。
要求建立安全测试环境听起来很中立,但建设这类环境可能需要专业人员、访问控制、监控系统以及大量计算资源。
大型实验室早已配备专门的安全、安全保障、政策和政府事务团队。规模较小的开发者可能需要将更大比例的资源投入同一流程。
提前接触讨论也会带来另一项优势。参与讨论的公司能够在模型接近发布前预判政府的关切。
未参与讨论的开发者,可能只有在已对训练投入大量资金后才会发现这些预期。这种不确定性可能抑制前沿项目,或将其推向规则更明确的司法辖区。
该框架还可能影响投资者和企业买家。参与其中可能成为一种可信度信号,即使政府从未将某个模型描述为安全。
这种信号很容易被过度解读。机密评估无法替代企业自身的测试、访问控制、数据治理和事件响应。
采购团队应询问联邦审查实际涵盖了什么,也应要求获得可能落在政府国家安全重点之外的风险文档。
安全团队需要为这些评估保留持久记录。一个可搜索的知识库可以将模型卡、评估发现、部署决策和后续事件关联起来,而无需依赖分散的文件。
审查流程同样会让领先实验室面临风险。与政府机构共享未发布模型会带来知识产权、内部人员风险和信息安全方面的担忧。
模型权重、系统指令、评估数据或未发布的能力,都可能具有可观的战略价值。每增加一位审查者,潜在攻击面就会扩大。
据报道,该框架涉及保密和知识产权保护。公开报道尚未明确这些承诺将如何执行,或发生泄露后责任将如何分配。
实验室还面临失去发布时间控制权的风险。30 天审查可能影响产品发布、云容量规划、客户承诺和竞争定位。
政府将审查窗口从此前设想的 90 天缩短。对于开发者密切追踪彼此发布节奏的市场而言,30 天仍然意义重大。
政府审查还可能放大声誉损害。如果官员提出关切,客户可能在尚未理解问题究竟涉及理论能力还是可被利用的产品缺陷之前作出反应。
反过来,一家公司也可能将参与审查用于营销。它可能暗示获得政府背书,却不披露评估人员测试了什么,或还存在哪些弱点。
因此,白宫需要明确区分完成审查与获得认证。没有这条界线,保密的安全流程可能催生误导性的公开说法。
实验室获得了接触渠道和影响力,但也接受了与国家建立一种新关系。这种关系可能在本届政府离任后很久仍会影响发布决策。
自愿审查遇上机密权力
该框架最大的弱点不在于缺少强制性措辞,而在于政府压力可以在其公开条款之外发挥作用。
行政命令拒绝对发布 AI 模型实行强制许可、预先审批或许可制度。这一表述为企业将该安排称为自愿性质提供了正式依据。
但周边政策环境并不如此简单。联邦机构采购 AI 系统、控制对机密网络的访问、调查网络事件,并实施出口限制。
这些权力能够影响开发者,而无需将该框架转变为法定许可项目。一家公司可以在法律上拒绝参与,却在其他方面面临商业或国家安全后果。
这种区别之所以重要,是因为白宫已经与 Anthropic 发生冲突。争议涉及军事用途限制、联邦采购,以及围绕该公司先进系统的担忧。
一名联邦法官阻止执行一项禁止政府机构使用 Anthropic 产品的指令。但更广泛的冲突仍表明,政治、合同和安全分歧能够多么迅速地交汇。
政策倡导者对于该框架究竟是姗姗来迟的防护措施,还是非正式许可制度,意见不一。
支持者认为,在危险模型出现后临时干预,不如建立结构化审查。他们将 30 天流程视为一个初步制度,国会以后可以进一步强化。
Alliance for Secure AI 的 Caleb Knapp 称该命令是良好开端,但认为自愿审查并不足够。他呼吁国会要求开发者在发布前共享受覆盖的模型。
行业倡导者担心,自愿安排很少会始终保持有限范围。他们预计未来政府会继承这一审查渠道,并可能扩大其用途。
前政府顾问 Saif Khan 支持部署前安全评估,但质疑情报机构是否应成为国内技术监管的前门。
由于评估基准属于机密,这一担忧变得更加尖锐。开发者被要求遵守一个无法完全披露或公开质疑的门槛。
一定程度的保密是可以辩护的。公开敏感的网络任务可能暴露尚未修补的弱点,或教会敌对行为者政府如何衡量进攻能力。
问题在于将每一个程序细节都视为同等敏感。机构可以保护漏洞利用数据,同时公开有关决策权、证据标准、利益冲突和申诉的治理信息。
独立监督仍然不足。公众无法比较两家实验室如何接受评估,无法判断政治考量是否进入某项决定,也无法审视不一致的处理方式。
公民社会组织也提出了隐私和问责担忧。该框架聚焦网络能力,而非监控、画像或政府获取先进模型所带来的更广泛影响。
这些议题不应被强行纳入网络评估基准,但它们仍需要并行的防护措施,尤其是在情报机构获得特权访问权时。
该系统还可能将知识集中在少数实验室手中。这些公司之外的研究人员无法审查机密门槛,也无法验证它是否衡量了现实世界的伤害。
评估基准可能成为优化目标。一旦开发者知道哪些测试重要,他们就可能针对这些测试优化模型或其安全防护,而不改善其在陌生环境中的整体安全性。
这有时被称为评估过拟合。一个系统看起来更安全,是因为它在已知评估中表现良好,但它在新工具或攻击路径下的行为仍不确定。
前沿模型在训练后也会发生变化。系统提示词、工具权限、监控、检索来源和部署政策都可能改变风险,而无需改变底层模型。
因此,模型级审查可能遗漏某个特定产品配置所带来的危险。即使受控部署的风险较低,它也可能限制基础模型。
白宫应避免将单一门槛描述为网络安全的完整衡量标准。更恰当的理解是,它触发政府进一步关注。
企业也应采取同样谨慎的态度。模型参与联邦审查,并不能回答某个智能体是否能够访问生产环境机密,或执行未经批准的操作。
开发者需要围绕凭证、数据边界、人工批准、日志记录和回滚建立控制措施。无论模型是否跨越政府的机密门槛,这些保护措施都不可或缺。
如果该框架能够在危机发生前建立可预测的沟通机制,仍可能改善安全性。它的可信度将取决于这种沟通是否遵循一致规则,而不是政治上的临时应对。
三个信号将表明该框架是否有效
下一场考验在于实施,而不是又一次政策公告。
第一个信号是白宫是否发布非机密框架摘要。该文件应说明资格条件、审查阶段、决策权限、开发者义务和申诉机制。
它无需披露漏洞利用任务或能力门槛,但必须表明处境相似的公司将获得相似待遇。
一份有用的摘要还应说明,完成审查并不等同于政府认证。这条界线将降低实验室把参与审查作为广泛安全背书的风险。
发布该摘要将增强框架的合法性。持续沉默则会支持一种担忧:该流程在实质上是一个不具其名的不透明许可制度。
第二个信号是政府如何处理下一次被延迟或受限制的模型发布。OpenAI 的 Astra 提供了一个即时测试,因为该公司表示无法排除其具备关键网络能力的可能性。
OpenAI 已经引入隔离测试和更广泛的监控。它还表示,已主动放缓研究活动以改善安全性。
Astra 延迟为比较公司防护措施与新联邦流程提供了机会。请关注政府审查是否改变发布方式、访问规则或缓解计划。
清晰且有记录的互动将强化结构化协作的理由。缺乏解释的突然指令则会削弱这一理由。
第三个信号是审查流程是否扩展到最大的实验室之外。政府表示正在与众多行业伙伴接触,但尚未证明存在平等访问机会。
请关注较小的前沿开发者、独立评估机构、学术安全团队和公民社会专家是否参与。它们的参与将降低由既有参与者制定封闭标准的风险。
受信任合作伙伴的身份同样重要。审查人员需要具备技术专长、强大的安全实践,并且独立于商业利益冲突。
如果同一批领先实验室帮助设计测试、接受测试,又提供解读测试的专家,问责仍将不完整。
国会可以弥补其中一些缺口。它可以规定报告要求、授权独立审计、保护敏感证据,并建立对政府决定提出质疑的程序。
政府可以更早采取行动。它可以发布汇总发现、公开治理规则,并将机密技术细节与非机密程序性防护措施区分开来。
AI 公司也负有责任。它们应披露内部能力类别,说明重要的部署限制,并报告事件,同时不得将自我评估包装成独立证据。
企业采购方应关注这些信号,而不应将 Google News 的新闻标题视为最终答案。关键问题不在于会议是否举行,而在于审查能否带来更安全的部署和更可预测的决策。
对开发者而言,这一框架可能影响产品发布时间表、安全架构、文档以及面向联邦客户的准入。接近前沿能力的团队,应在官员提出要求之前准备好相关证据。
对知识工作者和 AI 用户而言,其影响将通过产品可用性体现。一些模型可能会更晚推出、触达更有限的受众,或在更严格的工具权限下上线。
延迟并不自动意味着失败。它可能表明,开发者在将先进系统置于控制较少的环境之前发现了不确定性。
政府干预同样不自动意味着成功。若缺乏明确标准,干预可能变得不一致、政治化,或难以受到质疑。
白宫如今已具备其此前表示将建立的架构。OpenAI、Anthropic、Google 和其他实验室已帮助推动这一架构从理论进入非公开审查。
未来一到三个月将揭示,它是否会成为可重复执行的安全流程。也将显示,保密是否仍局限于敏感测试,还是会蔓延到每一项重要决策。
通过 Google News 跟进这一事件的读者,不应只关注会议日程。应留意是否发布非机密摘要、如何处理 Astra,以及评估流程能否获得更广泛的访问权限。
这三项进展将决定,该框架究竟是为前沿 AI 建立问责机制,还是仅仅把关键决策转移到闭门之后。


