top of page

美国 AI 巨头面临白宫自愿安全测试,却缺乏强制执行力

Google、OpenAI、Anthropic 和 Meta 收到了白宫邀请,将讨论一项已经完成的框架:在先进 AI 模型发布前对其进行测试。8 月 4 日的会议将主要开发商纳入一项以机密网络安全基准为核心的政府审查流程。然而,参与仍属自愿,这立即造成了准入与问责之间的冲突。

白宫表示,已完成总统唐纳德·特朗普 6 月 2 日网络安全行政命令所要求的框架。不过,白宫尚未公开发布该框架、确认所有参与企业,也未说明当模型表现不佳时官员将如何应对。因此,这次会议标志着谈判的开始,而非一套可强制执行的安全制度正式到来。

这一差别至关重要,因为政府希望更早了解具备复杂网络行动能力的模型。开发商则希望获得保密性、可预期的发布节奏,并避免落入非正式审批体系。核心争夺如今已很清晰:发布前的政府访问权,对阵企业对模型是否、何时及如何触达客户的控制权。

白宫要求 AI 公司审查什么

白宫已完成一项允许政府自愿访问的流程,但具体操作规则仍大多不公开。

据报道,8 月 4 日的会议将包括 Google、OpenAI、Anthropic 和 Meta 的代表。官员计划向企业展示新框架如何适用于正在开发的先进模型。受邀企业采取不同的产品战略、发布方式,并对政府监管持有不同立场。

根据有关该框架的报道,一名白宫官员表示,政府已在截止日期前完成该框架。政府尚未公布其完整内容,官员也未宣布企业何时会开始使用它。

该框架源于特朗普 6 月 2 日关于人工智能与网络安全的行政命令。该命令要求联邦机构在 60 天内与 AI 开发商建立一项自愿安排。由于其目标是先进网络能力,关注范围比一般 AI 监管更为狭窄。

根据已公布的行政命令,开发商可以要求政府判断某个模型是否属于“涵盖的前沿模型”。该术语指达到联邦安全机构设定的机密能力门槛的模型。

符合条件的开发商可在向其他可信合作伙伴发布前最多 30 天,向联邦官员提供模型访问权限。政府和开发商也可选择可信组织进行早期访问。这些合作伙伴将研究该模型可能如何增强关键基础设施的安全性。

该措辞并未建立公开的许可制度,也没有说明机构可以自动禁止模型发布。相反,它建立了一条渠道,企业可借此寻求联邦能力评估。

这一渠道改变了华盛顿与 AI 实验室之间的关系。官员不再必须完全依赖公开发布、企业演示,或部署后的自愿披露。他们可以在发布决策仍在制定时审查选定系统。

然而,该框架的价值取决于参与情况。自愿流程为愿意合作的企业提供了一条结构化的信息共享路径。对于合作意愿较低的开发商而言,除非采购压力或公众预期使退出代价高昂,否则仍有空间置身流程之外。

因此,这篇 Google News 报道并不只是关于又一次科技会议。政府已经完成了发布前访问机制的设计。受邀企业现在必须决定,参与对其模型、客户和发布时间表意味着什么。

为什么 Google News 读者应关注机密基准

该框架中最重要的标准属于机密,公众因此无法判断政府将安全边界划在何处。

该行政命令指示联邦机构维持一套机密基准测试流程。基准是一种标准化测试,用于比较模型在既定任务或风险门槛上的表现。在这里,测试评估的是先进网络能力。

该基准决定一个系统何时成为涵盖的前沿模型。这一认定可能触发有关发布前访问和可信测试合作伙伴的讨论。但由于底层评估涉及国家安全,开发商和公众无法审查完整的评分流程。

保密具有实际理由。公开详细的网络任务可能暴露敏感漏洞,或揭示政府认为具有战略重要性的进攻技术。透明的测试套件也可能成为模型及其开发商的学习指南。

这种保密性带来了第二个问题。外部研究人员无法独立评估该门槛是否严格、一致,或是否为受到青睐的企业量身定制。买家也无法将政府的担忧与模型系统卡中的安全声明进行比较。

官员表示,将在适当情况下与开发商和研究人员共享评估结果。这一表述保留了很大的裁量空间,并不能保证每家参与实验室都会获得同样的证据或解释。

企业需要尽早明确情况,因为模型开发和部署涉及基础设施、客户及合作伙伴的紧密排期承诺。如果政府审查开始得太晚,即便是自愿请求也可能扰乱既定发布计划;如果开始得太早,官员审查的模型在发布前也可能发生重大变化。

该命令试图通过保密、网络安全、内部人员风险、知识产权和保密协议保护来回应这些担忧。这些保障承认,尚未发布的模型可能是实验室最具价值的资产之一。早期访问创造了开发商必须保障安全的另一套环境。

联邦政府也面临能力问题。先进模型测试需要专业研究人员、安全计算系统和真实的网络环境。书面框架并不会自动产生足够多合格的评估人员,以同时审查数个重大版本发布。

商务部此前已将美国 AI 安全研究所改组为 AI 标准与创新中心,即 CAISI。该机构表示,CAISI 将支持自愿标准,并对商业 AI 系统开展测试。这项测试任务为华盛顿提供了既有的技术基础。

其他机构同样发挥核心作用。该命令将模型门槛决定权交给国家安全局,并由国家网络安全和技术官员协同开展。CISA 和其他安全机构则围绕关键基础设施和软件漏洞提供专业知识。

这种分布式结构带来了更深厚的专业能力,但也可能使问责变得复杂。开发商需要知道由哪个机构控制进度、解决分歧并传达最终评估。公众则需要知道,在经审查的模型进入市场后出现失败时,谁来负责。

机密基准可以帮助防止开发商只针对可见测试进行优化。但它们也可能使安全评估变成联邦机构与少数企业之间不透明的谈判。该框架必须在不公开最敏感细节的前提下平衡这些结果。

自愿 AI 安全测试让合作与执行相互冲突

该框架要求企业暴露最敏感的模型,却没有明确说明拒绝或未通过测试会发生什么。

自愿测试的推进速度可能快于立法。随着模型能力变化,联邦机构和开发商可以修订流程。他们也可以在国会解决有关责任、联邦权限和州 AI 法律的更广泛争议之前启动评估。

这种灵活性有利于开发商。企业可以讨论新兴能力,而不必立即进入正式执法流程。政府评估人员可以分享不适合纳入公开合规文件的威胁信息。

同样的灵活性也削弱了框架的可信度。面临不利评估的开发商可能延迟提供访问、缩小测试条件,或继续发布。已公布的命令并未针对这一决定设定明确处罚。

政府影响力仍可通过间接方式发挥作用。联邦采购决定、国防关系、公开批评以及获取威胁情报的渠道,对 AI 企业都很重要。由这些杠杆支撑的自愿框架,其分量可能超过名称所暗示的程度。

这种影响力也引发公平性担忧。联邦官员的私下警告可能影响一次发布,却不会形成公开记录或申诉程序。即使行政命令否认政府拥有正式发布权限,企业仍可能将这种安排视为非正式审批制度。

压力不会在受邀企业之间均等分布。Google 和 OpenAI 运营着广泛使用的托管服务,访问可受到限制或监控。Anthropic 也通过受控服务和云合作伙伴分发模型。

Meta 的开放权重战略带来了不同挑战。开放权重允许外部各方下载并修改重要模型参数。一旦发布,这些副本无法通过中心化服务收回。

发布前审查可以识别开放模型中的风险,但无法管理之后的每一次修改。因此,政府可能会比审查能力相当的托管系统时,更严格地审查可下载模型。这种差异可能演变为关于分发方式而非仅仅技术表现的政策争议。

开放模型的支持者认为,广泛访问有助于防御者检查系统并构建安全工具。批评者则回应称,同样的访问也可能帮助恶意团体移除防护措施或自动化攻击。两种立场都取决于能力、分发条件以及下游控制措施的质量。

该框架并未公开解决这场开放与封闭之争。相反,它建立了一项可适用于不同发布模式的机密能力门槛。这种做法至少在原则上将重点放在系统能够做什么上。

但在实践中,单靠能力测试无法涵盖部署风险。托管模型可能通过代理拥有广泛权限;代理是一种获授权执行多步骤操作的软件。开放模型可能较弱,却更容易被修改和分发。

因此,审查流程必须考察访问权限、自主性、防护措施和可能的部署条件。单一基准分数无法解释一个在企业网络中运行的模型所面临的完整风险。

自愿开展的 AI 安全测试仍然可以改善决策。企业可在发布前发现漏洞,政府机构则能直接了解新兴能力。只有当参与者清楚测试结果将如何影响发布决策时,这种安排才具有可信度。

白宫尚未公开回答这一问题。一次未通过的评估会导致建议延期、限制部署、增加防护措施,还是除讨论外不采取任何行动?在官员明确这种后果之前,该框架只能衡量风险,无法建立可靠的应对机制。

Anthropic 的网络安全模型改变了政治考量

随着先进 AI 系统令网络安全风险不再容易被视为遥远情景,政府开始转向发布前审查。

直接的政策转变源于人们对能够发现、利用和修复软件漏洞的 AI 系统日益担忧。网络能力之所以重要,是因为软件弱点可能影响金融服务、通信、能源系统和政府网络。

Anthropic 的 Mythos 模型成为这场讨论的重要参照点。Anthropic 将该系统定位为先进的网络安全模型,而官员则在评估其对国家安全和关键基础设施的影响。

4 月的一次安全会议,让 Anthropic CEO Dario Amodei 与白宫办公厅主任 Susie Wiles 会面。这场讨论源于政府对能力更强的 AI 可能给软件安全带来何种影响的担忧。

这一事件在政治上值得注意,因为政府此前曾与 Anthropic 发生冲突。但当该公司的模型引发安全疑问时,白宫仍与其接触。能力带来的压力压过了既有的政治争端。

联邦政府的担忧随后扩展到一家开发商之外。Google、Microsoft 和 xAI 同意让 CAISI 提前访问新模型,以开展国家安全评估。OpenAI 和 Anthropic 则早在上一届政府期间就已有测试安排。

这些协议让政府积累了与个别公司合作的经验。6 月的行政命令旨在将类似互动转化为更广泛的机制,覆盖达到联邦门槛的模型。

其历史还可追溯得更远。2023 年,Amazon、Anthropic、Google、Inflection、Meta、Microsoft 和 OpenAI 接受了白宫提出的自愿承诺。这些承诺包括在公开发布前进行内部和外部安全测试。

新框架在侧重点上有所不同。2023 年的承诺涉及广泛议题,包括偏见、隐私、生成内容识别和公开报告。2026 年的命令则聚焦于先进网络能力与国家安全。

这种更窄的范围反映出对威胁的认知发生了变化。早期讨论常将 AI 安全视为有害内容、歧视、虚假信息和推测性灾难风险的组合。具备网络能力的智能体则带来了更直接的实际操作问题。

AI 系统无需具备完全自主性,也能提升风险。它可以协助操作者扫描系统、解读漏洞、编写利用代码,并协调多个技术步骤。每一项能力提升都可能减少实施攻击所需的时间或专业技能。

同样的能力也可以帮助防御者。安全团队可以利用模型审查代码、确定补丁优先级、调查警报,并解释陌生系统。政府评估必须区分有益的防御表现,与那些会显著降低攻击者门槛的能力。

这种区分很困难,因为许多任务都具有双重用途。一个为防御者识别漏洞的模型,也可能向入侵者提供同样的信息。访问控制和监控会影响结果,但不会改变底层能力。

该框架中的可信合作伙伴条款试图覆盖防御性用途。关键基础设施运营者可以获得受控的早期访问权,并利用先进模型强化其系统。这项工作可能在全面发布前揭示实际益处和意外风险。

不过,可信合作伙伴测试也带来了另一项保密挑战。每个参与组织都会增加接触未发布模型的人员和系统数量。严格的安全要求可降低这一风险,但无法将其完全消除。

白宫如今将先进模型访问同时视为安全风险和防御资源。这正是本报道核心的政策转向。政府希望获得更早的访问权,因为仅凭公开演示已越来越难以评估 AI 模型。

该框架仍无法证明什么

完成一套框架并不能证明,测试能够可靠预测模型在部署后的表现。

AI 评估通常在受控环境中衡量表现。现实部署还会引入用户、外部工具、不断变化的提示词、专有数据、网络权限和意外互动。在一种测试中表现安全的模型,可能在不同条件下失效。

网络评估还面临额外挑战。防御者无法公开每个目标、方法或漏洞,否则会削弱测试本身的安全性。因此,独立专家掌握的信息有限,难以核查政府结论。

开发者也可能针对熟悉的评估形式进行优化。如果实验室了解测试的大致形态,就可以围绕该环境训练防护措施。这些防护措施未必能迁移到新型攻击上。

稳健的流程需要多层机制。它应结合标准化基准测试、专家红队测试、真实环境和发布后监控。红队测试指的是有意探测系统,以发现不安全行为或可被利用的弱点。

即便如此,这种组合也无法提供保证。测试可以识别已知的失效模式并估计能力,但无法证明一个复杂模型会在每种部署环境中始终保持安全。

该框架的自愿性质使比较变得复杂。企业可能提供不同程度的访问权限、文档或技术支持。即使测试条件不同,评估者也可能得出表面上可比的结果。

公开报告会有所帮助,但保密等级限制了政府机构能够披露的内容。官员可以发布高层级结论、审查日期、广泛风险类别和缓解结果,而不暴露敏感任务。政府尚未承诺采用此类报告格式。

目前也没有公开说明模型必须多久重新测试一次。开发者会在发布后更新托管系统、调整防护措施、连接新工具,并修改推理设置。这些改动可能同时改变能力和风险。

该命令聚焦于模型向可信合作伙伴发布之前。对于部署后的持续审查则着墨较少。对于通过频繁更新不断演进的服务而言,单一的发布前窗口可能并不足够。

开放权重发布带来了相反的问题。原始开发者可能在发布时冻结模型,但外部各方可以无限期地修改它。政府对原始版本的测试并不能覆盖所有衍生版本。

另一个不确定性涉及市场集中度。大型实验室可以维持专业的合规团队和稳固的政府关系。即使参与仍属自愿,小型开发者也可能难以应对同样的流程。

这种负担可能有利于既有企业。它也可能使小团队远离与政府合作,从而降低框架的覆盖范围。白宫需要制定与能力相称、而非与公司规模挂钩的程序。

批评者还会质疑,私下会议是否会赋予主要开发商对其评估者过大的影响力。企业掌握必要的技术知识,因此咨询是必需的。然而,如果独立研究人员和基础设施运营者缺乏实质性角色,咨询就可能演变为由有限群体主导的规则制定。

政府披露的信息过少,无法消除这一担忧。会议出席名单只能显示哪些公司收到了邀请,而不能说明是谁塑造了最终规则。缺乏已发布的框架,也使人无法在行业诉求与政府决策之间进行知情比较。

这一核查缺口应当影响对该事件的报道。Google News 的摘要可能会将这次会议呈现为一项已经完成的安全倡议。更准确的解读要更为有限:官员完成了一套保密的程序框架,但其一致性和后果仍有待检验。

首个模型审查将比这项宣布更重要。观察人士应关注评估者是否获得充分访问权、是否识别出有意义的风险,以及是否影响了部署条件。一个没有后果的流程,可能沦为安全咨询而非安全闸门。

三个信号将显示白宫测试是否重要

该框架只有通过可见的参与、一致的审查结果,以及对危险发现作出的具体回应,才能获得可信度。

第一个信号是 Meta 是否会正式让其最强大的模型进入发布前流程。Meta 的参与将表明,该框架能够容纳开放权重发布,而非只服务于托管系统。

如果 Meta 在可比条件下加入,政府就可以主张其能力门槛适用于不同的分发策略。如果 Meta 仍置身事外,自愿机制就会出现重大覆盖缺口。

细节与签署本身同样重要。观察人士应关注有关审查时点、模型访问权和可下载权重处理方式的信息。一份含糊的合作声明无法证明 Meta 接受了有实质意义的审查。

第二个信号是在已完成框架下进行的首个受覆盖模型评估。公众或许看不到机密基准测试,但官员仍可披露审查是否发生,以及防护措施是否发生改变。

发布延期、有限推出、修订权限或强化监控,都将显示测试影响了部署。若发布照常进行,只伴随笼统的安全表述,则提供的证据较弱。

首次审查还将揭示,政府机构能否在命令规定的最长 30 天提前访问期内完成评估。延迟可能让企业不愿参与;仓促审查则可能遗漏重要风险。

第三个信号是公开问责格式。政府无需暴露敏感的网络任务,但可以发布基本流程信息。有用的披露包括参与的开发者、审查频率、风险类别和缓解状态。

统一的报告格式将帮助企业买家比较模型治理声明,也能让独立研究人员追踪自愿承诺是否产生一致行动。

如果白宫不发布此类记录,该框架将仍然难以审计。企业和政府机构可能会以截然不同的方式描述同一场封闭审查。公众将缺乏证据来判断哪一种说法准确。

这些信号将决定谁面临最大压力。开发者需要决定,与政府合作究竟能改善信任,还是会带来不可预测的发布风险。联邦机构则必须证明,它们拥有评估能力日益增强系统所需的专业知识和能力。

企业客户同样利益攸关。经过政府审查的模型,并不自动意味着它对每个工作场所或网络都安全。买家仍需要内部测试、受限权限、活动日志和事件响应计划。

知识工作者应将安全评估视为更广泛证据链的一部分。团队可以利用可搜索的AI 知识库,留存模型评估、部署决策和政策更新。当供应商信息或政府指导发生变化时,这些记录将变得尤为重要。

目前,白宫已建立了准入机制,但尚未设置公开的执行机制。当企业愿意合作时,这一安排可以带来有价值的情报,并推动更安全的发布。但当开发者拒绝采纳政府建议时,它也可能让官员只能置身场外观察。

因此,下一个 Google News 提醒应依据证据而非会议措辞来判断。关注 Meta 是否参与、首个受覆盖模型的审查,以及公开报告标准的出台。这些进展将共同表明,自愿测试究竟能改变产品发布,还是仅仅将闭门进行的讨论正式化。

每当开发者援引政府测试时,都应提出一个实际问题:审查带来了什么改变?如果答案涉及延后发布、限制功能、修复漏洞或加强防护措施,说明该框架正在产生可衡量的作用。若答案仍属机密,且没有任何部署决策因此改变,其保护价值仍将难以确定。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page