Google、Anthropic 和 OpenAI 的安全标准计划考验行业自律
据报道,尽管多年来外界一直呼吁加强公共监管,Google、Anthropic 和 OpenAI 已更接近于建立私有的 OpenAI 安全标准。拟议中的组织将在不作为政府监管机构运作的前提下,为前沿 AI 开发者制定共同规则。其暂定名称为前沿 AI 标准管理局(Standards Authority for Frontier AI,SAFA)。
这项倡议仍是一项提案,而非既有的权威机构。这些公司尚未联合宣布 SAFA、发布其治理文件,或说明其决定将如何执行。大多数细节来自了解讨论情况的人士。
这一核实缺口构成了核心矛盾。正在构建一些最强大 AI 系统的公司,希望参与定义这些系统应如何接受测试。它们的技术知识为其参与提供了充分理由;而它们的商业利益也让其他人有充分理由要求独立性。
据报道,OpenAI 安全标准机构正在成形
眼下的变化体现在组织层面:据报道,有关 AI 安全的私下讨论正逐步成为设立常设标准机构的计划。
The Information 报道称,Google、OpenAI 和 Anthropic 正在筹备一个由行业主导、聚焦前沿 AI 安全的组织。前沿 AI 指的是能力极强的通用模型,其能力接近或超过现有领先系统。
该组织的暂定名称为前沿 AI 标准管理局。由于该团体尚未正式启动,缩写 SAFA 仍可能发生变化。据报道,这些公司希望在 2026 年末或 2027 年初成立该机构。
这一时间表很重要,因为确定启动日期意味着一场宽泛的政策讨论将转变为实际运营项目。一个真正的权威机构需要负责人、资金、会员规则、技术流程,以及可信的决策架构。
据报道,这些公司曾接触 Sriram Krishnan,希望其担任首席执行官。Krishnan 曾担任风险投资人,并在 Trump 政府中担任高级 AI 政策顾问。他被考虑担任该职位,表明该组织希望同时获得政治公信力和技术专长。
据报道,其他潜在负责人和科学顾问也在讨论之列。不过,目前似乎尚无任何任命获得公开确认。这些公司尚未披露候选人是否接受、拒绝,或仍在考虑中。
另一份报道显示,这种协调并非只是猜测。OpenAI 全球政策主管 Chris Lehane 表示,公司已与 Anthropic 和 Google DeepMind 就 AI 安全讨论了数周。他的评论证实了这些会谈,但并未确认有关 SAFA 的每一项报道细节。
据报道,这些安全讨论涵盖灾难性风险、第三方评估,以及竞争开发者之间协作等问题。它们也引发了对直接竞争者协调行为时可能涉及反垄断法的担忧。
这一区别至关重要。安全测试方面的合作可以形成共同保护措施,但协调也可能影响竞争。标准机构需要设定边界,既能降低风险,又不让其成员控制市场或排挤较小的竞争者。
目前尚无公开文件说明 SAFA 将如何解决这一问题。据报道的年末目标也只留下有限时间,用于设计有关资金、投票权、利益冲突和申诉的保障机制。
目前,读者应将 SAFA 视为一项得到可信报道支持、仍在发展的提案。它不应被描述为已投入运营的监管机构、认证审计机构或最终敲定的协议。
三家实验室为何现在希望制定共同规则
Google、OpenAI 和 Anthropic 面临着单个安全政策无法解决的协调难题。
每家公司都可以发布自身的风险框架、委托评估,并限制模型发布。但这些行动无法在整个行业形成统一门槛。若一家公司的部署进度放缓,而竞争者继续推进,它可能失去用户、收入或开发者关注。
若每家参与的开发者都接受可比测试,共同的 OpenAI 安全标准可以减轻这种压力。它们还可帮助客户比较当前依赖不同定义和报告格式的安全声明。
这一时机反映出行业正从抽象原则转向可操作的控制措施。开发者如今需要针对能力评估、安全测试、事件报告、外部访问和部署后监测制定流程。
OpenAI 的治理框架涵盖网络攻击、生物威胁、有害操纵和失控等风险。它还说明了模型报告、事件响应、安全管理和外部专家意见。
Anthropic 维持自身的负责任扩展方法,而 Google DeepMind 则使用内部安全框架和评估计划。这些体系有着广泛的共同主题,但并不会自动得出相同的发布决定。
一个共享机构可以在前沿模型面向用户之前,规定最低评估要求。它可以明确由谁进行测试、开发者必须提供哪些证据,以及严重发现将如何影响部署。
该机构还可能支持保密信息共享。前沿实验室有时会发现竞争者也需要了解的危险能力、安全弱点或滥用模式。公开披露可能暴露敏感细节,因此可信的信息交换机制具有现实价值。
然而,只有当参与公司在压力之下仍遵守共同流程时,这些流程才有帮助。困难的情况包括推迟发布、限制功能、成本高昂的安全变更,或削弱公司公开声明的证据。
自愿标准在验证既定发布计划时最容易遵守。当合规会威胁收入或战略优势时,其可信度才会受到考验。
各司法辖区的政府行动仍然分散。California 和 European Union 已制定影响先进 AI 的义务,而 United States 的联邦政策仍在演变。全球运营的公司必须将重叠的要求转化为技术控制措施。
行业权威机构可以让这一转化更容易。它可以制定监管机构、审计机构、客户和开发者都能理解的评估方法。但它也可能成为另一层缺乏法律问责的私有政策。
这就是为什么据报道的提案所涉及的远不止一个委员会。该组织的真正影响力将取决于其标准是否会影响实际部署决策。
若 SAFA 仅发布建议,它将类似于许多现有政策论坛。若它能要求提供证据、披露失败情况并施加有意义的后果,它将扮演重要得多的角色。
Frontier Model Forum 已覆盖类似领域
当相同公司已建立前沿 AI 论坛时,SAFA 必须说明为何还需要另一个行业组织。
Anthropic、Google、Microsoft 和 OpenAI 于 2023 年成立了 Frontier Model Forum。其既定目标包括推进安全研究、制定最佳实践、支持评估,以及与政府和公民社会共享信息。
Forum 最初的联合公告提及一个公开的技术评估与基准库。它还承诺提供标准化评估,以及关于 AI 风险的安全信息共享。
这些目标与据报道的 SAFA 议程高度重叠。两者都涉及共同标准、前沿模型评估、共享专业知识,以及领先开发者之间的协调。
这种重叠带来了一个基本治理问题:SAFA 将拥有 Forum 所不具备的何种权力?
一种可能的答案是执行力。Frontier Model Forum 主要作为协作性行业团体运作。SAFA 则可能被设计得更像一个自律监管机构,拥有明确规则和合规流程。
这种区别需要体现在具有约束力的文件中。仅凭新名称和管理团队,并不能自行创造有意义的权威。该组织需要明确授权,将标准制定与一般政策协调区分开来。
会员资格是另一个悬而未决的问题。Frontier Model Forum 由四家公司设立,后来扩大了覆盖范围。据报道,SAFA 的讨论以 Google、OpenAI 和 Anthropic 为中心,Microsoft 的角色尚不明确。
较小的模型开发者、开源项目、学术研究人员、企业客户和公民社会团体同样利害攸关。由三家占主导地位的实验室设计的标准,可能会施加只有大型公司才负担得起的要求。
测试复杂模型需要专业研究人员、安全的计算环境,以及对敏感系统的受控访问。即使规则提升了安全性,合规成本也可能成为较小开发者的障碍。
大型实验室拥有满足复杂认证要求的人员和基础设施。它们也拥有影响这些要求如何制定所需的政策团队。
这种组合会产生监管俘获风险。监管俘获是指,规则制定体系日益服务于其本应约束的实体的利益。
这种风险并不能证明 SAFA 必然会被俘获。它意味着,在外部人士能够依赖其判断之前,该组织需要建立制度性保障。
这些保障应包括独立投票权、透明的利益冲突政策、公开的方法论,以及对决定提出质疑的程序。会员标准应与风险相称,而非与公司规模挂钩。
该机构还需要与现有公共机构协调,而不能把私有认证包装成替代方案。政府机构拥有公司资助的团体无法复制的民主授权。
OpenAI 此前也承认了这一局限。其一篇关于前沿 AI 监管的论文称,行业自律是重要的第一步,同时认为政府干预仍然必要。
这一早先立场提供了一个有用的检验标准。SAFA 可以通过制定技术标准和提供证据来补充公共监管;它不应悄然将被承认为第一步的举措变成最终体系。
真正的权衡在于专业能力与独立性
支持 SAFA 的最有力理由是技术能力,反对它的最有力理由则是制度依附性。
前沿模型评估很难设计。测试必须检验危险能力,同时又不能教会模型如何逃避审查。它还必须区分可重复的行为与孤立的输出。
外部评估者往往需要访问模型权重、内部保障措施、系统日志和未发布能力。公司有正当理由保护这些信息,避免其落入竞争者和恶意行为者之手。
专业机构可以建立用于审查机密证据的安全渠道。它可以在不同版本发布之间维持一致的方法,并在事件之间保留机构知识。
这一模式类似于其他高风险行业的审计。独立专家获得查阅机密记录的权限,依据既定标准检验相关主张,并在不公开每一项敏感细节的情况下报告结论。
然而,仅有访问权限并不能带来独立性。评估者可以深入了解一个系统,同时在财务或职业层面仍依赖于其开发者。
一篇关于前沿 AI 审计的 2026 年研究论文指出,外部人士仍缺乏可靠途径来验证领先开发者的安全主张。论文作者提出了从有限审查到持续验证的不同保障等级。
这一框架凸显了一个重要区别。基准测试衡量的是特定条件下的性能;审计则检验开发者更广泛的主张、控制措施和实践是否值得信赖。
SAFA 需要决定自己履行哪一种职能。标准发布机构、测试实验室、审计机构和执法机构是不同类型的组织。若在没有明确边界的情况下将这些职能合并,会使过多的裁量权集中于一处。
资金是眼前的关切。如果成员公司为该组织提供资金,公众需要知道其捐助是否会影响任命、优先事项或对调查结果的获取。
领导层遴选也面临同样的挑战。一位拥有政治人脉的高管或许能帮助该组织与政府合作,但此人仍需独立于提供该职位的公司。
技术顾问同样需要披露利益冲突。前沿 AI 安全社群规模较小,专家经常在实验室、非营利组织、大学和政府机构之间流动。
这些关系并不会自动使任何人失去资格,但确实使透明的回避规则变得不可或缺。
近期报道说明了外部评估者周围的紧张关系。一些官员和行业领袖希望由具备直接实验室经验的专家参与,而批评者则质疑其中密切的个人与职业联系。
一项独立评估指出,许多 AI 评估仍然更强调性能,而非安全行为。同一篇报道援引 SaferAI 的 Henry Papadatos 的观点称,如果没有公共透明度,公司自愿采取行动仍然不足够。
因此,一个可信的机构不应只发布令人安心的结论。它还应说明所采用的标准、评估者的独立性、审查的证据类别,以及影响结果的任何限制。
它还应披露分歧。如果评估者建议推迟发布某个模型,而成员公司仍然发布,用户和监管机构应当知道该流程未能控制部署。
执法选项可以从私下整改要求到公开通知和暂停成员资格。每一种选择都涉及保密性、法律风险和公共安全之间的权衡。
没有后果的机构可能沦为声誉服务机构。拥有实质权力却缺乏问责的机构,则可能成为由市场领导者控制的私人监管者。
这正是 SAFA 面临的核心权衡。实验室掌握外部人士所需的信息,但不应仅因掌握这些信息就获得不受约束的权力。
开发者和企业买家将感受到影响
最先出现的实际影响将体现在采购、模型访问和发布流程上,而不是面向消费者的产品标签。
企业买家已经会询问供应商的安全控制、隐私、事件响应和监管合规情况。前沿 AI 标准可以为这些审查增加模型特定的证据。
部署 AI 编程代理的公司可能希望看到模型已针对漏洞生成、凭证窃取和未经授权操作进行测试的证明。医疗保健客户则可能更重视隐私、操纵风险,以及模型在异常提示下的可靠性。
通用标准可以让这些问题更易于比较。买家将获得围绕共同类别整理的证据,而不是互不兼容的供应商报告。
这种益处取决于访问权限。没有支持性文档的认证徽章,几乎无法为采购团队判断评估质量提供依据。
开发者也可能面临新的限制。当评估发现危险能力时,模型提供商可能要求更严格的身份核验、监控或分阶段访问。
这些控制措施可以减少滥用,但也可能限制实验。研究人员和小型公司可能难以获得与大型客户同等的访问权限。
开源开发者面临不同的问题。围绕封闭实验室实践制定的标准,可能假定由单一组织控制模型权重、部署基础设施和用户访问。
开放模型则将这些责任分散开来。一个有用的框架必须区分训练期间产生的风险,与部署、修改及下游分发造成的风险。
如果 SAFA 忽视这一区别,其标准可能会在设计上偏向集中式服务。这将使安全框架变成一项市场结构决策。
云服务提供商也会感受到压力。Google 同时运营前沿模型实验室和大型计算基础设施。Microsoft 和 Amazon 与领先 AI 开发者之间也有深厚关系。
有关安全训练、模型访问、日志记录和事件响应的标准将影响这些平台。它们的参与或缺席将决定该机构是否覆盖更广泛的 AI 供应链。
知识工作者可能会间接遇到这些规则。模型可能拒绝更多请求、在执行操作前要求确认,或在风险评估后失去某些能力。
即便这些变化源自安全治理,它们看起来也可能像是产品决策。清晰的披露将帮助用户理解访问权限为何发生变化,以及限制是否适用于所有提供商。
跟踪这些决策的组织需要来自模型报告、政策更新和事件通知的证据。一个可搜索的知识库可以帮助团队将不断变化的标准与供应商评估及内部部署记录联系起来。
最有价值的结果将是可比性。客户应能够判断两家供应商是否在等效条件下通过了等效测试。
最没有价值的结果将是象征性认证。如果每个创始成员无论发生何种事件或存在何种争议结论,都能通过每一次审查,那么这一标签传递的信息将十分有限。
因此,开发者和买家应审视未来任何 SAFA 标识背后的方法。他们应询问:谁测试了模型、获得了什么访问权限,以及哪些风险仍不在范围内。
三个信号将显示 SAFA 是否拥有真正的权威
应根据 SAFA 的治理、后果机制及其与公共监管机构的关系来评判它。
第一个信号是正式章程。已报道的名称、启动时间窗口和领导层讨论,并不能说明该组织实际上将如何运作。
可信的章程应明确成员、资金来源、投票结构、利益冲突规则和任命流程。它还应说明独立专家是否拥有决策权。
应关注那些防止创始公司推翻评估者决定的条款。没有这些保护措施,该机构仍将依赖于其所评估的实验室。
第二个信号是已公布的评估和执法流程。该组织应界定哪些模型需要接受审查、何时开始测试,以及评估者会获得哪些证据。
它应说明发现严重问题后会发生什么。可能的结果包括整改、限制部署、延迟发布、公开通知或被移出该组织。
该流程还应包括申诉机制。公司需要有途径对技术错误提出质疑,评估者则需要免受商业报复的保护。
仅仅模糊地承诺推广最佳实践,将削弱成立新组织的理由。Frontier Model Forum 已经承担研究和协调职能。
第三个信号是在不放弃监管权的前提下获得监管机构正式认可。公共机构可能采用 SAFA 的方法、以观察员身份参与,或将技术工作纳入法律标准。
如果政府保留监督和执法权,这种合作将增强该提议的可信度。如果政策制定者只是将判断外包给最大的开发者,提议则会被削弱。
据报道,选择一位具有丰富政治经验的首席执行官,将支持“政府关系是该计划核心”的观点。但这本身并不能建立公共问责。
启动时间表也是一项考验。如果该机构希望一开始就拥有实质性权威,那么在 2026 年末或 2027 年初启动,几乎没有多少时间进行广泛协商。
仓促启动可能会先形成宽泛原则,之后再制定详细控制措施。这样的顺序可以理解,但该组织不应将愿景性规则表述为已完成的保障措施。
读者还应关注哪些公司仍置身事外。Microsoft、Meta、Amazon、xAI、主要开放模型开发者以及国际实验室,都会影响前沿 AI 市场。
即使只有三家公司遵循某项标准,它仍可能具有意义。但如果其他主要开发者拒绝其方法或治理模式,其合法性仍将受到限制。
公民社会和研究人员也是如此。参与不应只是创始公司作出关键决策后才举行咨询会议。
拟议中的 OpenAI 安全标准机构,可能成为测试日益强大模型的有用基础设施。它也可能重复既有组织的工作,同时赋予私人决策以监管外观。
区别将体现在文件中,而不是承诺中。请关注独立投票、可执行的后果、透明的方法,以及政府监督的明确角色。
随着 SAFA 接近其报道中的启动窗口,开发者和企业买家应保存供应商主张,并将其与后续规则进行比较。哪些保障措施变得可衡量,哪些仍停留在自愿性措辞?这一比较将揭示,该倡议究竟改变了部署行为,还是仅仅改变了领先实验室描述自身的方式。



