top of page

OpenAI 前沿 AI 治理让 AI 实验室掌控自身规则

9月26日
讀畢需時 15 分鐘

据报道,三家激烈竞争的公司本周开始设计一个共享的安全标准机构,OpenAI 前沿 AI 治理因此出现重大转向。OpenAI、Google 和 Anthropic 希望为它们正同时竞相改进的先进模型制定共同规则。

该组织暂称为前沿 AI 标准机构(Standards Authority for Frontier AI),即 SAFA。根据 9 月 24 日发布的报道,它可能在 2026 年末或 2027 年初启动。冲突显而易见:开发前沿系统的公司,也希望在界定这些系统应如何评判方面发挥核心作用。

这种安排或许能比政府谈判更快地产生实用的测试标准,但也可能让少数主导供应商塑造“可接受风险”的定义。因此,对企业买家而言,SAFA 与其说是安全承诺,不如说可能成为供应商保障体系的新一层。

OpenAI 前沿 AI 治理从政策走向机构化

据报道,SAFA 项目将把自愿安全承诺转化为前沿模型开发者共同遵循的运营规则。

SAFA 提案仍在讨论中。三家参与公司均未公开宣布最终章程、领导团队、成员结构或执行流程。

据报道,SAFA 将为风险评估、模型测试以及先进系统面向用户前开展的审查制定指南。它还可能规定开发者应如何披露严重的安全与安保事件。

另一项可能的职能是为独立评估者设定资质要求。这一点至关重要,因为如果每个开发者都能选择友好的审查方,或以不同方式定义成功,那么审计的意义就大打折扣。

该组织也在考虑是否应由 SAFA 自行开展模型评估。另一种方案则是让第三方实验室按照该组织制定的标准完成相关工作。

这两种选择将形成截然不同的机构。标准机构可以在不检查任何模型的情况下发布方法;测试机构则需要技术基础设施、受保护的模型访问权限、经验丰富的评估人员,以及处理敏感发现的流程。

报道中的时间表进一步增加了压力。组织者计划在 2026 年末或 2027 年初启动,留给治理与独立性问题的解决时间所剩不多。

OpenAI、Google 和 Anthropic 均已运行内部安全项目。每家公司都会在发布前评估模型,公布部分发现,并维持各自针对已识别风险的升级处置门槛。

然而,内部框架不会自动生成可比较的证据。一个在某开发者流程下被评为可接受的模型,采用另一家公司定义、基准或假设时,可能得到不同结果。

SAFA 似乎旨在弥合其中一部分差距。共同基线可以让 GPT、Gemini 和 Claude 模型家族之间的结果更容易比较。

如果该组织能够标准化证据,这就不只是一次品牌宣传。企业无需解读三套独立体系,而可以向供应商索取相同的评估记录、事件类别和审计文档。

这也将使安全协调超越现有的 Frontier Model Forum。该组织已支持主要开发者之间的研究与信息共享,成员包括 Amazon、Meta、Microsoft、OpenAI、Anthropic 和 Google DeepMind。

SAFA 拟议的范围似乎更偏向运营层面。据报道,该计划重点在于将宽泛承诺转化为审计人员、开发者和企业客户能够审查的实践。

这种区别很重要。分享经验有助于公司识别威胁,而标准规定每家公司必须提供哪些证据;测试则决定某个特定系统是否满足这些要求。

一个可信的机构必须将这三项活动联系起来,同时不能将它们混为一谈。否则,公司可能参与信息共享,却规避有意义的独立审查。

因此,第一个变化是制度性的,而非技术性的。据报道,三家领先开发者正试图在各自竞争的模型项目之上建立一层共同的控制机制。

这层机制尚不存在。在章程和成员条款公布之前,SAFA 仍只是一个被报道的计划,而非已经成立的监管机构。

前沿 AI 标准竞赛为何此刻发生

模型开发者寻求共同规则,是因为能力发展、法律义务和企业风险暴露正按不同节奏推进。

OpenAI 于 2026 年 5 月发布了其治理框架。该框架将公司的内部安全实践与加州要求及欧盟通用 AI 规则联系起来。

该文件涵盖网络攻击、化学和生物风险、有害操纵以及失控问题,也涉及事件响应、安全管理、外部意见和模型报告。

该框架说明了 SAFA 试图解决的问题。OpenAI 可以解释自身的控制措施,但企业客户仍必须将其与 Google 和 Anthropic 使用的不同体系进行比较。

随着模型获得浏览器、代码环境、企业数据和外部工具的访问权限,挑战也在加剧。聊天机器人生成文本,而智能体能够跨已连接系统采取行动。

这一转变改变了相关的安全问题。买家不再只问模型是否会生成不准确的答案,还必须问:在人工介入前,系统可以访问、修改、传输或批准什么。

前沿模型在部署后也会持续变化。供应商会更新模型权重、系统提示词、防护措施、工具集成和路由系统,而无需重建每个客户应用。

在某一版本发布前进行的评估,可能在一次重大更新后失去相关性。因此,有效标准必须覆盖持续监控,而非仅限于一次性的上线审查。

各国政府正在应对,但做法仍然碎片化。加州已对主要前沿开发者施加透明度义务,而欧洲规则则为通用模型设立了不同责任。

各国政府也在讨论国际测试、事件报告以及与先进能力挂钩的阈值。这些谈判的推进速度慢于产品周期。

美国设有名为 AI 标准与创新中心的公共技术机构。该联邦标准中心隶属于美国国家标准与技术研究院,并支持 AI 评估与测量工作。

据报道的 SAFA 讨论引发了一个关于重叠的实际问题:如果该私营机构建立自己的测试项目,企业可能要面对来自行业和政府机构的竞争性定义。

私营路径有一个显而易见的优势:开发者可直接访问模型、内部遥测数据、安全团队和能力研究。他们往往能在外部机构获得同等信息之前,识别出新出现的评估问题。

这种访问权限也构成核心弱点。由开发者主导的机构依赖公司分享可能导致发布延期、暴露安全失败或削弱竞争主张的证据。

商业激励异常强烈。就安全进行合作的同一批实验室,也在争夺企业合同、开发者忠诚度、研究人才和算力资源。

共同测试可以减少重复工作,并建立让所有参与者受益的基线。但它也可能成为一种战略机制,用于界定哪些风险算数,以及哪些竞争者有资格被视为负责任的参与者。

这一时机反映了这种张力。OpenAI、Google 和 Anthropic 需要可信标准,因为它们的系统正进入敏感工作流程;但每家公司也希望保留足够的灵活性,以持续推出新能力。

公众担忧也已从有害内容转向系统控制。政策制定者越来越关注自主研究、网络能力、模型逃逸情景和严重滥用。

OpenAI 表示,完全自主的递归式自我改进目前尚未发生。该术语指的是 AI 系统在缺乏充分人工控制的情况下,独立创造能力不断增强的后继系统。

不过,该公司认为,政府和开发者需要在这种可能性迫在眉睫之前建立衡量方法。共同标准将为判断能力何时跨越约定阈值提供一套共同语言。

这使 SAFA 成为对不确定性的回应,而非风险已获定论的证明。这些公司并不确切知道先进系统何时需要更严格的限制。

但它们知道,独立的内部政策将越来越难以辩护。共同测量方法提供了一种在事故或具有约束力的国际制度迫使问题浮现之前,展示协调行动的途径。

真正的较量是行业控制与独立监督之间的较量

SAFA 的决定性问题不是标准是否有用,而是开发者能否对自己施加实质性后果。

当成员拥有共同激励、接受外部审查,并会因违反共同规则而承担后果时,行业自律可以发挥作用。被报道的计划尚未确立这些条件。

SAFA 可以发布严格的发布前评估要求。但除非成员合同、政府规则或商业压力使合规无法回避,否则这些要求仍将是自愿的。

成员可能拒绝不利结论,延迟披露,缩小评估者的访问范围,或在存在争议的产品发布前退出该组织。

这些可能性区分了专业标准组织与监管机构。监管机构的权力来自法律授权,可以索取记录、执行期限、调查失败并施加处罚。

私营机构仍然可以影响行为。云服务提供商、保险公司、采购部门和大型客户可能要求前沿模型取得 SAFA 认证后才予以接受。

这种市场机制将赋予标准实际约束力,但也会将重大权力交到创始公司和参与评估者手中。

因此,治理必须从 SAFA 自身开始。该组织需要制定涵盖董事会、资金、利益冲突、投票权、透明度、申诉和成员除名的规则。

由三家创始实验室控制的董事会很难声称独立。吸纳学术界、公民社会、企业和政府代表,可以提升其合法性。

仅有代表性并不能解决问题。外部董事必须能够获取与公司代表相同的实质证据,包括不利的评估结果和严重事件报告。

资金带来另一种冲突。开发者费用可以支持昂贵的技术测试,但对这些费用的依赖可能抑制针对主要成员作出强硬结论。

出版政策的重要性不亚于测试设计。企业需要足够细节来理解模型的风险状况,但不应获得可能助长滥用的操作指引。

一个可信的体系可以发布标准化摘要,同时向获授权的审计人员和公共机构提供敏感证据。若开发者对结果提出异议,该体系也应披露相关分歧。

现有的事件信息共享计划提供了有益基础。Frontier Model Forum成员会共享有关漏洞、威胁和令人担忧能力的特定信息。

该计划承认了一项关键矛盾:当披露可能带来不确定的法律责任或竞争损害时,公司会减少信息共享。

信息共享也不同于强制报告。共享有助于集体学习,而报告则要求在明确期限内向主管机构提交已界定的事件。

SAFA需要保持这两类渠道的区分。如果每一次保密交流都会触发公开披露,公司可能停止提供有价值的细节。

相反的设计同样危险。私营论坛不能让保密共享沦为屏障,使严重失误无法进入监管机构或受影响客户的视野。

这正是OpenAI前沿AI治理成为制度设计考验的原因。技术专长并不会自动产生公共问责。

发起实验室可以制定精确的基准,却仍然形成一个薄弱的组织。缺乏验证、披露和后果的标准,只会将现有承诺制度化,而不会改变行为。

竞争又带来另一项复杂因素。围绕最大型实验室基础设施设计的规则,可能会增加小型模型开发者的成本。

广泛评估需要算力资源、安全控制、专业人员以及获得合格审计员服务的渠道。OpenAI、Google和Anthropic比新兴竞争者更容易承担这些要求。

严格框架或许能提升安全性,同时巩固制定该框架的公司的地位。这并不意味着共同标准不可取,但也使公开征询变得至关重要。

标准应随已证实的能力而调整,而非取决于企业身份。小型模型不应仅因采用类似架构,就承担前沿级别的义务。

反过来,开发者也不应因发布模型权重或在发起组织之外运营而逃避审查。风险门槛必须取决于系统能够做什么。

这正是核心权衡。行业主导可以迅速产出可用规则,而独立监督能够赋予这些规则合法性和可执行性。

SAFA需要两者兼具。没有开发者参与,评估者可能缺乏访问权限和技术背景;没有外部权威,该机构则可能沦为由自身客户设计的认证项目。

AI安全标准无法取代企业控制措施

一项有利的模型评估,无法判断某家公司将其部署在特定工作流中是否安全。

前沿评估考察的是底层模型的属性。企业风险还取决于提示词、检索数据、用户权限、连接工具以及部署后作出的决策。

同一模型在两个环境中可能带来截然不同的后果。汇总公开材料的写作助手,其运营风险低于能够修改客户账户的代理。

因此,SAFA认证将只是企业治理的一个输入,而非其替代品。CIO仍需掌握模型、代理、数据源和系统连接的清单。

组织应明确每个应用由哪个模型版本支持。同时还需要保留更新记录,因为供应商可以在不改变企业界面的情况下改变行为。

访问控制仍是核心。代理应只获得完成任务所需的权限;在执行高影响操作前,还应获得额外批准。

这遵循与网络安全相同的原则:一个组件不应仅因处在受信任环境中,就继承广泛权限。

数据暴露需要独立的控制措施。模型可能通过前沿安全评估,但应用仍可能将机密记录发送给错误的服务。

公司应记录哪些数据进入每个系统、供应商在哪里处理这些数据、保留多久,以及是否用于后续训练。

人工监督同样需要精确定义。一个允许员工审查数千项自主操作的仪表盘,并不能形成有意义的监督。

高风险工作流需要在不可逆活动发生前设置干预点。例如拨付资金、更改访问权限、删除记录或传达受监管的建议。

测试必须超出供应商的基准。企业应使用自身的数据边界、工具配置和故障场景来评估现实任务。

红队演练可以探测提示注入、过度自主权、数据泄露和误导性输出。团队应在模型或工作流发生实质性变化后重复这些演练。

事件响应不能等待一项普遍的行业标准。每项部署都需要负责人、升级渠道、停机程序和证据保全规则。

合同应支持这些控制措施。买方可以要求事件通知、审计权、模型变更通知,以及足以更换供应商的可移植性。

在标准尚未稳定时,可移植性尤为重要。被绑定在单一专有API上的公司,可能会在供应商改变条款或风险分类时难以应对。

多模型架构可以降低这种依赖,尽管它也会增加自身的测试和运营成本。目标并非持续切换,而是拥有可信的退出选项。

企业团队还需要一个可用的证据体系。政策、评估结果、批准记录和事件记录应能在法务、安全和产品职能之间保持可检索。

维护良好的AI知识库可以帮助团队将供应商文档与内部决策联系起来。它无法替代技术控制措施,但能让问责链条更易追溯。

最有力的采购问题不是供应商是否属于SAFA。买方应询问成员资格要求是什么,以及模型未通过评估时会发生什么。

他们还应索取每项相关评估对应的日期、范围和版本。如果已部署系统与受测配置不同,一个笼统的安全徽章几乎无法提供保障。

企业领导者必须避免虚假的精确性。标准化分数会让复杂风险看似已有定论,即使评估仍不完整。

基准通常在受控条件下衡量一种狭窄行为。真实部署结合了用户、软件、数据和激励机制,实验室无法完全复现。

这一限制并不意味着测试毫无用处。它意味着买方应将标准化结果视为可比较的证据,而非保证。

如果SAFA成功,它将使供应商的说法更容易接受审查。但它不会将责任从那些决定模型在何处、以何种方式运行的组织身上转移出去。

拟议AI安全机构仍需证明什么

只有当其结构能够经受住与成员发布计划相冲突的发现时,SAFA才能赢得信任。

第一个未解决的问题是独立性。发起公司必须说明由谁任命领导者、谁可以罢免他们,以及非行业参与者如何影响决策。

第二个问题是评估访问权。独立测试人员需要获得足够访问权限来检查令人担忧的能力,而不能完全依赖开发者准备的演示。

这可能涉及对模型接口、安全控制、内部文档和部分遥测数据的安全访问。评估者还可能需要在观察初步结果后,有时间设计自适应测试。

固定基准很快可能成为目标。开发者可能会针对测试优化模型,却不处理测试原本要衡量的更广泛行为。

第三个问题是执行。SAFA必须明确,当模型未达到门槛,或公司拒绝提供所需信息时,将发生什么。

可能的应对措施包括整改计划、暂停认证或公开通知。目前均未得到确认。

第四个问题涉及事件定义。报告每一项轻微异常会淹没重要信号,而过窄的定义则可能掩盖后果严重的失误。

标准应明确严重性等级、报告期限、负责接收方,以及通知受影响客户的条件。还需要针对模型更新后发现的事件制定规则。

第五个问题是与公共主管机构的协调。私营流程应补充政府监督,而不应取代它。

California的前沿AI规则已为适用的开发者设立披露和事件相关义务。任何SAFA流程都必须将其要求与法律相衔接,而不能将成员资格描述为替代方案。

国际协调又增加了一层复杂性。欧盟和其他司法管辖区可能接受不同的测试方法、报告格式或系统性风险定义。

由美国公司主导的标准机构不能假设其框架会成为全球默认标准。它需要美国以外监管机构和专家的正式参与。

OpenAI已公开倡导共同测量指标和兼容的国际方法。Google和Anthropic同样支持各种安全评估倡议。

然而,支持宽泛原则比就操作门槛达成一致更容易。一项测试可能影响公司是否推迟模型发布、修改保障措施,或失去商业机会。

因此,最重要的证据将来自分歧。可信的SAFA必须证明,当成员不喜欢结果时,其流程仍能正常运作。

围绕这些案例的透明度不应暴露危险的技术细节。但它应揭示该组织是否要求采取行动,以及成员是否遵守。

另一个不确定性涉及发起组织之外的公司。Meta、xAI、大型云服务提供商、开放模型开发者和国际实验室都会影响前沿发展。

如果SAFA始终只是一个由三家公司组成的项目,它可能只能为部分市场建立共同标准。如果扩张过快,达成共识可能会更加困难。

成员规则应避免将纳入成员等同于安全。它们应清楚界定义务,并允许符合资格的组织在平等条件下参与。

外部评估者同样需要接受审查。审计公司可能与其评估的同一批公司发展商业关系。

SAFA应发布利益冲突政策、轮换要求、评估者资格标准,以及对薄弱评估提出质疑的程序。否则,独立测试可能只是在名义上独立。

拟议机构还必须界定其与Frontier Model Forum的关系。重复的组织可能造成混乱、重复报告和不一致的分类体系。

一种合理的分工是,让该论坛支持保密威胁共享,而由SAFA制定可衡量的标准和保障流程。公共机构则保留法律监督和执法权。

这一安排尚未得到确认。在组织者发布章程之前,合作、认证与监管之间的边界仍不清晰。

据报道,该项目恰恰因其尚未完成而值得关注。其设计选择将决定它是提高安全基准,还是主要梳理现有的企业实践。

三个信号将表明 SAFA 是否拥有真正的权威

接下来需要验证的关键点包括:公开章程、可执行的评估规则,以及三家据报道的创始方之外的采用情况。

首先,关注其是否会在 2027 年初之前发布章程。章程应明确 SAFA 的法律形式、领导层、董事会构成、资金来源、投票权和利益冲突防范机制。

如果一份文件仅罗列原则,将削弱其具备实质性自律能力的说服力。若章程赋予独立董事信息查阅权和决策权,则会增强这一说服力。

章程还应说明政府观察员或民间社会代表是否担任正式角色。没有信息获取权或投票权的顾问头衔,所能提供的问责机制有限。

其次,审视首个评估标准。关键细节包括模型访问权限、测试选择、证据留存、披露要求,以及未通过时的后果。

严肃的标准会区分模型能力与部署控制措施,也会说明更新后的系统在何种情况下需要再次审查。

评估结果应能在不同提供商之间进行比较,同时不将安全性简化为单一分数。采购方需要了解测试覆盖了哪些风险、排除了哪些风险,以及仍存在哪些限制。

如果 OpenAI 接受它要求竞争对手遵循的同一套外部程序,其前沿 AI 治理将得到实质加强。在不利结果出现后采取补救措施的证据尤其重要。

第三,关注谁会加入,以及谁会认可这些结果。更多开发商、云服务提供商、公共机构、保险公司和大型企业客户,能够赋予这些标准实际影响力。

只有新参与者获得真正的影响力,更广泛的成员构成才会增强该项目。若扩张仍保留创始方的永久控制权,独立性问题便无法得到解决。

政府认可同样重要。与 NIST、加州主管机构或国际机构合作,可能将技术标准与公共问责联系起来。

相反的信号则是监管替代。如果企业主张 SAFA 会员资格应使其免于履行公共义务,质疑之声将会增加。

企业采用还提供了另一项检验。采购团队可能会要求提供 SAFA 评估记录,但不应将会员徽章视为完整保证。

向供应商索取针对具体模型的证据和已记录的事件处理程序。将这些材料与您自身部署中的权限、数据和决策相对应。

构建前沿模型的企业已经发现了一个真实的协调问题。随着系统变得更加自主并得到更广泛部署,彼此独立的内部框架无法支撑一致的比较。

它们提出的答案同样带来了真实的治理问题。拥有最深厚专业知识的实验室,也拥有推动开发持续进行的最强商业利益。

这种冲突并不会使 SAFA 丧失资格。它界定了该组织必须达到的标准。

未来数月,读者应当超越对安全性的公开背书。决定性证据将是:谁掌握权力、评估者可以检查什么,以及测试失败后会发生什么。

您的组织会依赖由其模型供应商制定的标准吗?在回答之前,请索取其背后的章程、评估记录和执行政策。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page