top of page

OpenAI 标准机构讨论让 AI 实验室担任自己的裁判

9月14日
讀畢需時 17 分鐘

据报道,OpenAI、Anthropic 和 Google 自 7 月以来一直在讨论由行业主导的 AI 监管机构,尽管它们已同属一个前沿模型安全组织。有关 OpenAI 标准机构的讨论表明,这不仅是又一项自愿承诺,而是可能带来更深远影响的举措。三家激烈竞争的公司似乎正在考虑建立一个共同机构,可能影响高级模型的测试与发布方式。

The Information 的 Leo Schwartz 报道了这些讨论,Techmeme 于 9 月 13 日转发了相关消息。据报道,这些公司在过去一周还举行了另一场会议。目前没有参与方公开宣布该组织、章程、成员结构、资金协议或启动日期。

这种缺席至关重要。标准机构既可能只是发布自愿指引的平台,也可能是在模型面向客户前进行认证的准入把关者。因此,核心冲突并非 OpenAI 与 Anthropic 或 Google 之间的对立,而是行业协调与独立公众问责之间的较量。

OpenAI 标准机构讨论仍处于初步阶段

据报道,这些会议表明领先的 AI 实验室希望将彼此重叠的安全提案转化为一个机构,但该机构尚未成立。

根据 The Information 的报道,Anthropic、OpenAI 和 Google 自 7 月以来一直举行工作组会议,议题是建立一个由行业主导的人工智能标准机构。据报道,这些讨论最晚持续至文章发表前一周。

该报道称,这些公司尚未达成协议;也未披露最终法律架构、执行机制,或可能监管该机构的政府部门。三家公司均未发布会议纪要或联合声明,以确认这些讨论。

这种区别将传闻中的谈判与已宣布的倡议区分开来。工作组可以在不承诺成立永久性组织的前提下探索技术问题,也可能因治理、责任、成员资格或模型发布阈值方面的分歧而解散。

不过,这一时机令该报道更具分量。Google DeepMind CEO Demis Hassabis 曾于 7 月 14 日公开提出建立 Frontier AI Standards Body。他的方案主张成立一个由行业出资、受联邦监督的机构,部分借鉴金融业监管局的模式。

FINRA 是一家受政府监督、监管证券经纪商的私营非营利组织。这一类比之所以重要,在于它将行业专业知识与被授予的权力结合起来,而不只是让企业承诺自我监管。

Hassabis 提议,前沿实验室最初应在模型发布前最多 30 天提交模型接受审查。前沿模型是能力极强、通用型的系统,能够跨越不断变化的能力阈值。他的框架设想先开展自愿审查,待评估流程被证明可靠后,再引入正式的市场准入要求。

该提案还将网络安全、生物学、欺骗及其他危险能力列为测试重点。模型将通过随技术进步而变化的基准来确定是否需要审查。这种方式试图避免固定的法律定义迅速过时。

OpenAI 和 Anthropic 此前也分别发布了自己的治理提案。OpenAI 在 2026 年 5 月发布的治理框架涵盖网络攻击、化学和生物风险、有害操纵、失控、事件响应及外部专家意见。Anthropic 则主张,当前沿能力带来严重风险时,应采取协调一致的应对措施。

这些立场并不意味着必然达成共识。OpenAI 还曾表示,有约束力的规则与问责机制应由民主政府决定,而非由私营企业单独决定。Anthropic 则主张建立可在风险上升时放缓开发的机制。Google 的公开提案则在实验室与政府之间设置一个由行业资助的技术机构。

工作组的报道之所以重要,是因为它表明这些不同思路已进入直接谈判阶段。这些公司不再只是发表彼此平行的宣言,而是在试探是否存在共同的制度基础。

但读者不应将这些讨论视为已经完成的交易。目前没有公开证据表明,参与者已解决由谁任命评估人员、谁拥有测试结果、如何处理机密模型访问权,或如何执行不利结论等问题。这些细节将决定拟议机构最终成为裁判、研究联盟,还是游说工具。

为什么最大的 AI 实验室现在想要共同规则

这些实验室面临协调难题:单方面保持谨慎可能让一家公司失去发布优势,却几乎无法约束竞争对手。

前沿 AI 安全政策主要由各开发者自行制定和实施。Anthropic 使用其 Responsible Scaling Policy,OpenAI 使用 Preparedness Framework,Google 则维持 Frontier Safety Framework。每套体系对风险、评估和保障措施的定义各不相同。

这些差异在重大模型发布临近时会变得具有商业影响。一家实验室可能因令人担忧的评估结果而延后部署,另一家则可能对类似结果作出不同解读。谨慎的公司承担了时间、收入和市场关注度的损失,却无法保证整个行业的风险同步降低。

共同标准可能减少这种代价。如果主要开发者接受相同的测试与发布条件,一家公司就更少有理由仅因预计竞争对手会继续推进,便无视警告抢先发布。共享阈值还可使政府和企业买家更容易比较结果。

Frontier Model Forum已汇集 Amazon、Anthropic、Google、Meta、Microsoft 和 OpenAI。它支持研究、信息共享与标准制定,其成员资格标准要求具备书面的安全流程,并愿意支持第三方评估。

这一背景引出了一个显而易见的问题:为什么还要成立另一个机构?

答案似乎在于权力。该论坛可以发布研究成果并识别良好实践,但其公开材料并未描述一个在每个前沿模型部署前进行认证的监管机构。一个类似 FINRA 的组织将更接近于评估合规性,并可能控制市场准入。

这种区别类似于编写建筑规范与在建筑投入使用前进行检查之间的差别。两项职能都很重要,但只有后一项能在建筑不合格时阻止其投入使用。相关讨论之所以值得关注,似乎正是因为领先实验室正在考虑 AI 是否需要第二种职能。

政府压力增加了紧迫性。华盛顿日益关注先进系统的发布前测试、安全评估和标准化报告。欧盟针对通用 AI 的规则,也为在国际市场运营的企业增加了另一层合规要求。

NIST 也在推动行业参与技术标准制定。其 2026 年 2 月发布的智能体标准倡议聚焦互操作性、安全性、身份识别和开放协议。NIST 表示,将在保持美国在国际标准组织中领导地位的同时,支持行业主导的发展。

智能体互操作性与前沿模型安全是不同议题,但两者反映出相同的政策方向:政府希望技术规则比传统立法适应得更快,而企业则希望参与设计自己必须执行的要求。

近期围绕先进模型访问权的争议,已暴露出缺乏可预测流程的代价。紧急干预可能来得太晚、采用不明确的标准,并对可比系统产生不同结果。当一个模型可能触发临时性的政府响应时,企业无法有把握地规划发布日程。

一个常设组织可以用明确的流程替代这些干预:机密提交、能力测试、风险分类、缓解措施审查以及发布决定。这样的流程将帮助开发者、监管机构、云服务提供商和企业客户了解部署决策所依据的证据。

但它也可能造成单点故障。不良测试可能为不安全的模型提供看似官方的批准。过于保守的规则可能延迟有用系统的推出。封闭的评估流程可能令外部人士难以发现这两种结果。

对开发者和企业买家而言,实际利害关系不止于灾难性风险的争论。共同标准可能影响 API 可用性、模型文档、安全控制、审计证据和部署时机。维护AI 知识库的团队,最终可能需要记录哪些模型通过了哪些评估。

因此,最大的实验室同时面临来自多个方向的压力。政府希望监管更可预测,客户希望获得可比较的保证,安全团队希望采用共同阈值,商业领导者则希望规则不会奖励最不谨慎的竞争者。

标准机构为应对这四种压力提供了一种可能的答案。它是否是正确答案,取决于谁来控制它。

行业协调与独立问责之间的较量

拟议机构的可信度将取决于 AI 公司能否提供专业知识,而不控制最终裁决。

前沿模型评估需要不同寻常的技术访问权。评估人员可能需要模型权重、内部保障措施、未发布的系统版本、详细的威胁模型,以及能够设计对抗性测试的专家。目前很少有政府机构拥有所需规模下的全部资源。

实验室拥有这些资源。它们雇用了构建这些系统的研究人员,运营计算基础设施,并了解许多失效模式。任何严肃的评估流程,至少在早期都需要它们的合作。

这一现实支持由行业出资的架构。参与企业提供的资金可能比传统机构更快招募专家,也能支持安全测试设施,并随着能力演进更新基准。

然而,专业能力与独立性并不是一回事。当受监管企业能够选择其领导层、限制其管辖范围、压制不利发现,或削弱可能威胁产品发布的测试时,监管机构就会失去合法性。一个组织即使在形式上独立,也可能仍在经济上依赖相关企业。

因此,这一事件中的主要对手并非一家实验室挑战另一家,而是协调安全的承诺与行业影响力的现实之间的冲突。提出共同规则要求的,正是最有动力塑造这些规则的同一批公司。

这种紧张关系体现在与 FINRA 的比较中。FINRA 在美国证券交易委员会的监管下运作。其规则需要获得监管批准,其决定也处于更广泛的法定体系之内。将一个 AI 组织称为“FINRA 式”并不会自动提供同等的保障。

一个可信的 AI 版本需要多层独立机制。政府应界定法律授权范围并审查重大规则。评估人员应享有受保护的任期,并遵守利益冲突政策。外部研究人员和公民社会专家应参与技术与治理决策。

该机构还需要透明的申诉程序。实验室应能对错误认定提出质疑,而不必私下协商以获得不同待遇。竞争对手应在同等条件下接受同等审查。

访问规则带来了另一项权衡。评估人员需要获得足够的信息来识别危险能力,但实验室会抵制暴露知识产权或安全敏感方法。访问不足会导致审查流于表面,而过度披露则可能带来间谍活动和滥用风险。

安全评估设施提供了一种可能的机制。模型可在受控环境中接受测试,独立专家获得临时访问权限,同时不复制受保护资产。该组织可以公开方法和汇总结果,同时隐去可能助长攻击的细节。

即便这一模式也留下了棘手问题。谁来决定哪些证据必须保密?公众能否验证一次未通过的测试是否带来了有意义的缓解措施?一家公司获得批准的对象是某个模型、特定部署配置,还是每一种下游改编版本?

开放权重系统让问题更加复杂。开放权重模型允许外部各方下载参数并修改系统。若发布闸门仅适用于美国 API 提供商,开发活动可能会转向该机构无法触及的参与者。

Hassabis 曾主张,资格认定规则应适用于模型,无论其是开放还是封闭。该原则听起来中立,但执行将取决于政府权力、云基础设施、分发渠道和国际合作。一个自愿性的美国组织无法控制每一次全球发布。

较小的开发者可能面临不同的负担。OpenAI、Google 和 Anthropic 能够维持政策团队、安全项目、评估基础设施和详尽文档。即便其模型风险较低,初创公司也可能难以应对复杂的认证流程。

门槛设计应避免这种结果。规则应聚焦可衡量的能力和部署风险,而非仅看公司规模或训练预算。该机构不应要求每个开发者都复制最大型实验室的合规体系。

公共采购和企业合同可以扩大标准机构的影响范围。客户可能会在购买先进系统访问权限之前要求获得认证。即使正式监管仍有限,云服务商也可能将合规作为提供某些服务的条件。

这种市场机制可以在不立即实施法定禁令的情况下加强安全。它也可能让既有实验室和超大规模云服务商进一步集中权力。认证标识可能成为只有资金充足的公司才能跨越的壁垒。

因此,该机构的设计必须将正当的风险控制与对既有企业的保护区分开来。透明的门槛、相称的义务、独立任命、公共利益代表和政府审查,并非行政细节。它们才是核心产品。

现有 AI 标准同时展现了潜力与缺口

AI 行业已经拥有论坛、框架、基准和政府指导,但仍缺少一个获得普遍信任的发布闸门。

Frontier Model Forum 是最明确的先例。Anthropic、Google、Microsoft 和 OpenAI 于 2023 年 7 月宣布成立该论坛。Amazon 和 Meta 随后加入,使该组织涵盖了众多开发或部署先进系统的公司。

其初始目标包括安全研究、标准化评估、最佳实践和信息共享。创始公告还承诺设立咨询委员会、章程、治理安排、资金、工作组和执行委员会。

此后,该论坛发布了技术研究,比较成员公司如何定义严重风险和门槛。其风险分类法解释称,固定门槛提供一致性,但可能很快过时。动态门槛具有适应性,但也可能允许“风险蠕变”——每个模型只增加一点点风险。

这种分析抓住了标准制定中的一个核心问题。固定的网络安全基准可能在几个月内就变得容易达成。相对基准可以跟上进展,但开发者可能会对基线为何,或一种新能力是否确实带来全新危险产生分歧。

这些公司使用的假设也不相同。OpenAI 的框架会考虑,类似能力是否已在缺乏同等保障的情况下向外界提供。Meta 强调模型是否能实现净新增结果。其他开发者可能聚焦绝对能力水平或合理的滥用情景。

新的 OpenAI 标准机构需要协调这些方法。它可以定义共同的最低标准,同时允许公司采用更严格的内部政策。它还可以要求采用多项衡量指标,避免由单一基准决定模型的命运。

国际标准提供了另一层机制。ISO 和 IEC 委员会制定人工智能技术与管理标准。NIST 的 AI 风险管理框架帮助组织识别、评估和管理 AI 风险。欧盟则将部分治理实践与法律义务相连。

这些机制服务的市场范围比前沿模型评估更广。管理体系标准可以评估一个组织是否维持适当流程,但并不一定决定某个尚未发布的模型是否能够协助实施复杂的网络攻击。

前沿测试同样面临证据问题。危险能力可能仅在特定提示、工具访问、微调或长时间自主运行时出现。一个模型在某项受控测试中表现不佳,部署后可能会呈现不同表现。

评估人员需要审查系统,而不仅是基础模型。这包括保障措施、连接的工具、使用限制、监控机制,以及模型运行的环境。因此,认证可能需要附带条件,而非简单的通过或不通过。

例如,一个模型可能获准用于具备严格控制的消费者界面,但不适用于不受限制的 API 访问。另一个模型可能需要满足监控要求,或限制某些工具连接后才能通过。这种方式更像基于风险的许可,而非产品标签。

标准流程还必须考虑发布后的变化。提供商经常更新系统提示词、路由层、工具和安全过滤器,而无需训练一个全新的模型。忽视这些变化的认证会很快失效。

事件报告可以弥补其中一部分缺口。开发者和部署者可以通过受保护机制披露严重故障,类似网络安全中的协调漏洞披露。新的攻击方法或有害能力出现后,该机构可以更新测试。

然而,自愿事件报告会带来少报的激励。企业可能担心责任、声誉损害或发布限制。对善意披露给予明确的法律保护或许有帮助,但立法者需要界定其边界。

独立审计提供了另一重制衡。研究人员指出,严肃的前沿审计需要深度、安全地访问非公开证据。仅靠公开基准无法验证内部治理声明,也无法判断一家公司是否遵守了自身的发布政策。

英国的 AI 安全机构已经表明,政府可以建立受到尊重的技术评估团队。NIST 和其他国家级机构也在扩大测试与测量工作。这些机构挑战了这样一种假设:只有私人实验室能够评估先进模型。

新的行业机构应补充而非取代这种公共能力。政府评估人员可以审查该机构的方法、开展抽查,并调查争议。学术团队可以识别一个常设组织随着时间推移而习以为常的盲点。

评估机构之间的竞争也可能提高质量。一个中央机构可以带来一致性,但也可能将整个领域锁定在薄弱的方法上。经认可的外部实验室可以运行获批测试,而中央机构则维持要求并审计其表现。

历史教训很直接。现有组织已经产生了有用的研究和协调,但它们的存在并未终结有关发布、门槛或政府权力的分歧。只有在解决这些缺失职能的前提下,相关报道中的谈判才有意义。

监管俘获是该提案必须通过的考验

由 OpenAI、Anthropic 和 Google 设计的标准机构可能提升安全性,同时悄然加强它们对市场的控制。

监管俘获是指一个监管体系开始更多地服务于受监管行业,而非公众。监管俘获不需要腐败。它可能源于共享的职业网络、对公司资金的依赖、外部专业知识有限,或以既有企业实践为基础制定规则。

据报道参与其中的三家公司确实拥有正当的技术知识。但它们在界定哪些模型属于前沿系统、哪些测试重要以及审查应多快完成方面,也拥有巨大的商业利益。仅凭治理措辞无法消除这些激励。

大型实验室会在合规要求奖励其既有资源时受益。详尽文档、安全数据中心、专职评估团队和政府关系人员,都可能成为非正式的准入要求。安全规则于是可能同时构成竞争护城河。

Axios 在分析这些公司趋同的治理提案时指出了这一风险。其监管分析指出,领先实验室已经具备认证所需的法律、安全、技术和政府能力。较小企业和开源开发者面临的挑战更为陡峭。

这并不能证明这些提案具有保护主义性质。严肃的安全工作确实需要专业知识和资源。政策任务在于区分必要的控制措施与只会增加文书负担、却不降低风险的要求。

治理设计可以让这种区分变得可见。该机构应公开征求拟议规则的公众意见,并说明每项要求如何降低已定义的风险。它应披露投票权、资金份额、回避情况,以及在行业咨询后作出的修改。

成员资格应扩展至创始公司之外。Amazon、Meta、Microsoft、初创公司、独立评估人员、学术研究人员、开源代表和公共利益团体都拥有相关知识。任何三家实验室都不应控制任命或规则变更。

政府的角色也必须明确。没有公共授权的机构仍只是自愿协会。拥有被授予市场权力的机构,则需要法定授权、司法审查、正当程序保护以及负责任的政府监督。

执法带来了最棘手的问题。当参与者重视认证、且不合规会付出声誉代价时,自愿标准能够发挥作用。但当商业压力变得强烈,或主要竞争对手拒绝参与时,它们便会失去效力。

强制认证能提供更强的约束力,但也会引发宪法、行政和国际层面的问题。国会需要界定受监管的类别,并授权相应后果。监管机构则需要建立程序,以审查那些演进速度快于传统规则的技术决策。

该组织还必须证明,其评估能够预测现实中的危害。基准测试往往在人工条件下衡量狭窄任务。它们可能成为优化目标、失去相关性,或将模型能力与部署风险混为一谈。

漏报会造成安全问题。危险能力可能在未被察觉的情况下通过认证,并凭借官方认证触达数百万用户。误报则会造成创新和竞争问题,因为它可能阻碍一款风险本可控制的模型。

答案并非一项完美测试,因为这样的测试并不存在。可信的体系应公布不确定性区间,采用多种评估方法,并在新证据出现时更新决策。认证应传达审查的边界,而非暗示完全安全。

透明度仍将受到安全问题的限制。公开诱发模型展现生物威胁能力的确切提示词,可能助长滥用。披露模型的安全架构也可能帮助攻击者。部分证据将需要保密处理。

不过,保密不应掩盖机构表现。公众可以获得关于提交数量、审查时长、有条件批准、拒绝、申诉、事故及基准修订的统计数据,而不必接触危险的技术细节。这些指标能够显示该机构是否真正约束其成员。

据报道,这些会议尚未形成任何此类承诺。在此之前,关于该机构将保持独立或发挥效力的说法仍只是提议。正确的态度既不是自动批准,也不是自动否决。

行业协调能够解决真实的集体行动问题。它可以统一发布测试,降低审慎做法的商业成本,并让监管机构获得集中的专业能力。但它也可能让市场领导者制定保护自身地位的规则。

同样的治理选择决定哪种结果会占主导。独立性必须体现在任命、资金、审查、透明度和执法之中。不能等创始公司私下解决重要问题后,再将独立性补加进去。

三个信号将显示谈判是否会成为真正的监督机制

接下来的证据应来自制度性承诺,而不是又一轮宽泛的安全原则。

第一个信号是公开章程。在未来一至三个月内,读者应关注一份联合公告,明确该组织的法律形式、使命、初始成员以及与政府的关系。

章程将加强这样一种判断:据报道的会议正在催生一个持久的机构。持续沉默则表明谈判仍处于探索阶段,或企业无法解决分歧。一个没有决策权、仅仅改名的工作组将提供更弱的证据。

章程应回答由谁选任董事会和技术领导层。它还应披露创始公司是否拥有永久席位、否决权或特殊投票权。这些条款将揭示独立性是结构性的,还是仅停留在愿景层面。

第二个信号是具体的评估协议。一个严肃的机构应明确哪些模型需要审查、评估人员可以获得何种访问权限、测试哪些风险领域,以及决策将如何影响部署。

尤其应关注拟议的发布前30天窗口。如果企业接受固定的提交期限,它们就作出了可衡量的商业承诺。如果每次审查都仍然是可选的、私下决定时机的安排,那么该机构将更像研究论坛,而非监管者。

该协议应说明阈值如何变化,以及如何处理开放权重模型。它应区分基础模型能力、部署配置和下游修改,还应描述在重大更新或事故后如何重新测试。

发布一份可实际使用的协议,将加强这样一种观点:共同标准能够取代临时拼凑的干预措施。若只是列出原则,却没有测试、证据要求或后果,则会削弱这一观点。

第三个信号是独立权力。政府官员、民间社会组织、外部评估人员和较小开发商,应在该机构开始审查模型之前获得明确角色。

最有力的版本将包括政府对重大规则的批准、独立任命、受保护的评估人员,以及申诉程序。公开报告结果将进一步增强可信度。若该结构完全由前沿实验室资助和治理,监管俘获的担忧将更为强烈。

读者还应关注哪些公司仍置身事外。Microsoft、Amazon 和 Meta 已属于 Frontier Model Forum,而 xAI 和主要开源开发者占据市场的重要部分。若没有更广泛参与或法律支持,仅获三家实验室接受的标准无法成为行业基线。

国际反应将在后续发挥作用,但这不是首项考验。一个由美国主导的机构必须先建立有能力且具合法性的国内运作,才能可信地寻求全球认可。关于全球协调的说法不应替代可行的初始授权。

对于开发者而言,眼下应关注可能影响模型访问和发布时间表的评估要求。企业采购方应询问供应商:其部署的系统覆盖了哪些外部评估。研究人员则应审视拟议基准是否衡量真实的部署风险。

知识工作者和 AI 用户也应关心,因为标准将塑造哪些系统能触达他们、这些系统附带何种保证,以及故障将如何披露。认证制度只有在其证据可理解、其局限始终可见时,才能提升信任。

如果报道准确,OpenAI 标准机构的谈判已跨过一个重要门槛。据称,竞争实验室正在讨论共同机制,而不只是原则上支持安全。但会议本身并不能创造问责。

决定性问题如今已十分具体:OpenAI、Anthropic 和 Google 会建立一位有权挑战它们的裁判,还是建立一个为它们原本就打算作出的选择背书的论坛?关注章程、测试协议以及独立权力的分配。这三个信号将揭示它们实际正在打造何种机构。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page