top of page

Anthropic 独立 AI 评估员计划获 OpenAI 支持,但访问权限才是关键考验

9月15日
讀畢需時 14 分鐘

尽管前沿实验室之间竞争激烈,Anthropic 的独立 AI 评估员计划仍在 2026 年 9 月 12 日从一项政策构想变为公开承诺。CEO Dario Amodei 表示,外部团队应获得持续、类似员工的权限,以接触安全实践、事故、训练流程和先进系统。OpenAI CEO Sam Altman 随即表示,其公司也将作出同样承诺。

这项共识的重要性超过了又一次在模型发布前进行测试的承诺。Anthropic 提议让外部观察者足够贴近实验室,以审视安全决策如何在内部形成。办公桌、门禁证、公司笔记本电脑以及与研究人员的直接联系,将取代通常定义外部评估的短暂测试窗口。

该提议也立即为两家公司带来可信度考验。类似员工的访问权限听起来颇具分量,但两家公司都尚未公布涵盖评估员遴选、保密义务、报告权利或争议性发现的完整规则。独立 AI 评估模式能否产生意义,取决于评估员是否能调查令人不适的证据,并传达有实质意义的结论。

Anthropic 独立 AI 评估员将审查的不只是成品模型

Anthropic 提议持续观察开发过程,而非在发布前再进行一次性的基准测试。

Amodei 在其 2026 年 9 月发表的关于节奏控制的文章中提出了这一承诺。他认为,模型能力的提升速度已超过对齐、监控和安全控制措施的发展。按他的定义,节奏控制并不意味着停止模型开发,而是要在更强能力继续推进前,为防护措施和验证工作留出足够时间。

其三部分提议的第一步涉及嵌入式评估员。每家前沿开发商都将赋予独立团队持续、类似员工的访问权限。该团队将核查安全承诺是否得到遵守、报告事故,并评估已完成的模型及其产出过程。

这一范围体现了关键变化。外部模型评估通常聚焦于特定系统在有限的发布前阶段。评估员获得访问权限,执行商定测试,记录结果,然后将控制权交还开发商。他们的工作能够揭示危险能力,但也只能提供一个快照。

嵌入式访问将扩大审查范围。评估员可以检查内部团队是否遵循测试规则、是否妥善应对预警信号,以及是否记录了例外情况。他们可以观察防护措施如何随训练持续而变化,而不是只评判送交评估的封装成品系统。

Amodei 表示,Anthropic 计划提供办公桌、门禁证、笔记本电脑以及接触相关员工的权限。这项据报道的承诺还包括监控安全实践和报告事故。这些细节表明评估员将获得实体和组织层面的存在,但并不意味着拥有不受限制的技术访问权限。

这种区别很重要,因为前沿模型越来越多地运行在复杂系统之中。它们使用软件工具,能跨多个步骤保留上下文,并在受控环境中执行操作。模型行为可能取决于其系统提示词、权限、支撑框架、监控工具和可用计算资源。

只测试公开界面的评估员看到的是最终一层。嵌入式评估员则能审查开发者如何配置这一层,以及内部测试期间发生了什么。更广泛的视野能够暴露在精心打磨的演示或标准基准测试中消失的问题。

OpenAI 已经承认存在这一评估问题。其 2026 年 5 月发布的评估手册指出,现代评估必须考虑环境、工具和工作流程。将先进智能体当作普通聊天机器人对待,可能产生无法反映其实际运行条件的结果。

因此,OpenAI 的同意与其此前阐述的评估原则保持一致。然而,支持这一概念不等于建立了可运营的项目。两家公司仍须界定独立团队能够审查哪些系统、记录、员工和内部环境。

这一提议也应与放缓前沿进展的更广泛呼吁区分开来。嵌入式评估是一项各公司都可独立落实的具体承诺。行业协调、反垄断保护和国际协议则需要政府与竞争对手共同行动。

这使评估员访问权限成为 Amodei 议程中最早能够被验证的部分。Anthropic 和 OpenAI 无需等待条约,就可以公布遴选标准或访问规则。它们可以先公布评估员名单、建立报告保护机制,并发布项目范围。

为什么 OpenAI 的同意改变了局面

OpenAI 的支持使 Anthropic 的提议成为一项竞争标准,其他前沿实验室如今必须接受、匹配,或公开拒绝。

Altman 表示,他认同 Amodei 对前沿发展节奏的看法。据美联社报道,他还承诺 OpenAI 将向独立评估员提供类似员工的访问权限。这一回应来得足够快,使事件从 Anthropic 的政策声明转变为一项行业挑战。

两家公司在研究人员、企业客户、算力以及先进模型的领导地位上展开竞争。这种竞争关系使其共识尤为值得关注。当某一参与者认为另一方可以通过无视安全承诺来抢占速度时,相关承诺往往会被削弱。

OpenAI 作出对等承诺,减轻了这一直接质疑。Anthropic 不再会被描绘成唯一接受持续审查的大型开发商。与此同时,OpenAI 也面临压力,需将 Altman 的支持转化为至少与 Anthropic 拟议安排同样具体的条款。

其他开发商如今面临更明确的问题。Google DeepMind、Meta、xAI 以及其他前沿实验室必须决定,嵌入式访问是否应成为共同预期。保持沉默意味着它们将置身于两家备受关注的竞争者所支持的标准之外。

这种压力的影响将不止于公共信息传播。企业客户日益需要有关模型治理、事故响应和部署控制的证据。拥有可信外部审查的开发商,可以向买方提供除自身系统卡和安全报告之外的另一层保障。

开发商也面临来自识别出严重风险的研究人员的内部压力。嵌入式评估员能够为证据提供一条不完全依赖管理层控制发布的渠道。只有员工能够不受报复或程序性阻碍地接触评估员时,这条渠道才有意义。

其潜在益处还将延伸至监管机构。政府机构很少拥有足够人员、基础设施或即时访问权限,来复现每一项前沿评估。合格的外部组织可以在内部审查与正式监管执法之间提供技术审视。

尽管如此,评估员不应成为公共权力的替代品。除非法律或合同授予这项权力,私人评估团队无法施加具有约束力的处罚。它们也无法代表社会决定哪些风险水平可以接受这类更广泛的政策选择。

OpenAI 的承诺提高了外界预期,因为该公司此前已支持与独立安全评估相关的政策措施。其 9 月 9 日的AI 政策立场支持加州有关安全评估、审计员标准、未成年人保护和生物风险的提案。该公司还表示,将与其他实验室共同推动自愿性的前沿标准。

这项新承诺将上述公开立场与 OpenAI 自身运营联系起来。支持审计立法比允许外部专家观察内部意见分歧更容易。类似员工的访问权限将检验该公司是否愿意在评估结果可能推迟竞争性发布时接受审视。

Anthropic 面临同样考验。其长期以来一直强调安全性、可解释性和负责任的规模化发展。嵌入式评估员可以强化这一主张,但薄弱的实施将使公司的定位与实际控制措施之间形成更尖锐的矛盾。

因此,眼前承受压力的对象并非政府,而是作出这一承诺的实验室。它们已自愿提高标准,记者、研究人员、客户、员工和政策制定者都可以据此评判其行为。

真正的权衡在于独立性与内部访问权限

评估员需要深度访问权限才能理解前沿系统,但对实验室的依赖可能削弱赋予其发现价值的独立性。

外部评估始终存在访问权限问题。有限访问能够保护知识产权、用户数据、模型权重和安全控制措施,但也可能阻止审查者看到危险或误导性行为背后的确切机制。

类似员工的访问权限则走向另一极端。评估员可以观察内部测试,并与安全团队定期交流。他们或许会获得技术背景,从而使结论更准确;但他们也可能在财务、社会关系或运营层面依赖受审查的公司。

这种张力无法仅靠将团队标注为独立来解决。这种关系需要可执行的保障措施。评估员应拥有受保护的资金、固定的报告权利、安全的通信渠道,以及保存相关证据的明确权限。

遴选程序同样需要审视。公司不应能够只挑选可能接受其假设的审查者。在合格组织之间轮换可以降低熟悉关系带来的风险,而透明的资格规则则能够遏制偏向性任命。

资金问题也构成另一项挑战。前沿评估需要技术人员、安全计算环境和专门测试工具。如果实验室承担全部成本,外界可能质疑评估员是否能够发布会损害双方关系的发现。

政府资金或行业联合资金可以减少直接依赖。然而,联合资金需要控制机制,以防占主导地位的公司塑造评估员市场。公共拨款则可能引入不同压力,包括政治影响和缓慢的采购流程。

发布权同样重要。评估员会接触无法安全出现在公开报告中的机密材料。模型漏洞、危险能力细节、私人用户信息和安全架构都需要谨慎处理。

保密不应成为普遍沉默的理由。可信框架应当区分敏感技术细节与有关合规性、未解决风险和事故响应的高层级发现。评估员需要一条能够将严重关切上报至公司领导层之外的途径。

实验室还需要一套公平的事实错误纠正流程。技术评估可能产生误报、忽视环境假设,或误读不完整的数据。回应流程能够提升准确性,但不能让公司拥有否决发布的权力。

一份 2026 年的安全访问框架描述了其中的安全困境。开发者掌握敏感的模型信息,而评估者需要获得足够的访问权限,才能开展有意义的评估。评估者也必须保护私有方法论,以免实验室针对已知测试优化模型。

嵌入式审查会加剧这两类风险。拥有内部访问权限的评估者可能意外泄露专有信息。能够了解评估方法的开发者则可能直接针对测试进行训练,在缺乏更广泛安全改进的情况下取得高分。

技术隔离或有帮助。安全评估环境可以限制数据流动、记录访问行为,并将测试材料与开发团队隔离开来。这些控制措施应同时保护双方,而不应允许实验室监控每一项调查决定。

最佳安排既不像普通承包商,也不像不受限制的员工。它需要具备与内部人员相当的访问权限,同时配套能够维护外部判断独立性的治理机制。这种组合并不容易实现,但任何更弱的安排都可能沦为仪式化监督。

类员工访问权限仍需一套详尽规则

在 Anthropic 和 OpenAI 以可操作的方式明确访问权限、权责、事件处理和公开披露之前,这项提议仍不完整。

“类员工访问权限”这一表述具有说服力,因为它暗示了近距离参与。但它并未说明具体是哪类员工、哪些系统,或哪些权限。研究模型行为的研究员,与传播部门员工或短期承包商所拥有的访问权限并不相同。

技术访问不应仅覆盖公开的模型端点。视评估情况而定,审查人员可能需要查看系统提示词、工具权限、模型版本、监控结果,以及危险能力测试的记录。训练数据和模型权重则会带来更大的安全与法律顾虑。

流程访问同样重要。评估者需要了解谁能够批准部署、阈值被触发后会发生什么,以及管理层如何解决分歧。否则,他们可能只能观察测试,却无法看到这些测试如何影响决策。

事件访问应有单独规则。实验室必须界定何种情况构成事件、何时通知评估者,以及是否允许开展追溯性审查。延迟通知可能导致审查人员无法保留日志或访谈相关员工。

评估者还需要免受访问权限被撤销的影响。公司不应能够在出现关键发现后立即移除一个团队。合同应明确终止条件、争议解决机制,以及在被移除前已完成工作的持续报告权。

这些项目需要利益冲突标准。评估者可能为多家竞争实验室提供建议、寻求未来就业机会,或依赖开发者资助。公开披露重要关系,可帮助读者判断每份报告背后的独立性。

Anthropic 更广泛的风险框架已经主张,前沿开发者应聘请具备资质的独立评估者。它还呼吁发布对公司评估和风险报告的审查。嵌入式访问将把这一做法从定期审查扩展为持续性的机构监督。

不过,公开报告仍存在不确定性。评估者可能发布详细报告、有限保证声明,或者除非发生严重事件否则不发布任何内容。这些形式提供的问责水平大相径庭。

狭义的保证声明可以确认流程已经进行,却不披露评估者发现了什么。详细审查则可以说明已测试的风险、局限性、分歧和补救措施。后者更有价值,但也会带来更大的安全和责任风险。

分歧处理程序将揭示这一承诺的严肃程度。假设评估者建议推迟部署,而管理层认为控制措施已经足够。读者需要知道由谁决定、异议是否会公开,以及哪些文档会被保留。

任何私人评估者都无法保证模型安全。前沿系统运行在不断变化的环境中,并与会发现新失效模式的用户互动。评估可以降低不确定性、识别危害并测试控制措施,但无法消除风险。

这一局限应出现在项目的每一项公开说明中。公司不得将评估者的存在作为广泛认证。相关表述应严格限定于实际审查过的系统、条件、测试和日期。

评估者能力标准也需要明确界定。团队可能需要具备网络安全、生物风险、自主智能体、可解释性和组织治理等领域的专业知识。任何单一组织未必能够覆盖所有风险领域。

多评估者模式可以提供更强的覆盖范围。一个组织可能测试危险能力,另一个组织则审查治理和事件响应。交叉核验能够降低对单一方法论或机构判断的依赖。

因此,两家公司下一项有价值的公开内容不应是另一份支持声明,而应是一份项目章程,其中列明责任人、定义访问级别、保护报告渠道并给出启动日期。

自愿监督可以提升信任,但无法终结 AI 竞赛

Anthropic 的提议可以揭示安全失效,但无法消除推动实验室加速开发的商业和地缘政治激励。

Amodei 更广泛的论述始于能力加速。他表示,AI 系统日益参与构建后续系统,这种动态被称为递归自我改进。在这一背景下,模型协助研究、编程、测试和优化,而这些工作又反馈到开发之中。

这一说法并不意味着自主机器会在没有人类控制的情况下独立重新设计自身。它描述的是一种 AI 提升研究生产力的开发循环。更快的研究可能压缩留给评估、监控和安全工作的时间。

Amodei 还提到了涉及自主智能体和网络测试的失效案例。他的文章警告,更强大的失准群体可能在整个互联网范围内造成严重损害。这一预测是他的判断,而非经独立确立的时间表。

这一差别很重要,因为极端预测可能将注意力从眼前的治理问题上转移开。评估者无需就精确的灾难预测达成一致,便可审查当前事件、访问控制和部署程序。现有的不确定性已经足以证明需要更充分的证据。

关键反对意见涉及自愿协调。公司可以承诺放缓开发节奏,却以不同方式理解“放缓”。一家实验室可能推迟部署,另一家可能继续内部训练,第三家则可能认为加强监控已经足够。

Amodei 承认竞争问题。他提出的第二步要求全行业开展安全协调,并可能得到反垄断豁免的支持。第三步则取决于民主政府与地缘政治竞争对手之间的合作。

这些步骤面临的障碍远大于嵌入式评估。政府可能拒绝其认为会削弱国家竞争力的限制。竞争实验室可能怀疑,安全标准通过提高小型开发者的成本来保护既有企业。

批评者可以合理地追问,既有公司是否会从小型竞争者无力承担的监管中获益。独立评估需要专业人才、安全基础设施和时间。设计不当的强制要求可能巩固那些已掌握最多资本和计算资源的实验室。

这一担忧并不否定监督的价值。它意味着标准应与风险相匹配,并在适当情况下提供共享评估基础设施。资质认定应取决于技术能力,而非评估者与最大开发者之间的商业关系。

另一个担忧是监管俘获。少数实验室和受青睐的评估者可能在缺乏更广泛公众参与的情况下界定可接受风险。在立法者建立民主问责机制之前,他们的标准就可能产生影响。

透明度可以降低这一风险。政府、学界、公民社会团体和受影响行业应参与界定评估者资质和报告预期。已公开的分歧也会揭示私人共识的边界。

该提议还面临地缘政治上的限制。仅限于部分美国公司的减速,未必能够约束其他地区的开发者。Amodei 主张民主国家必须与威权政府协调,但这种核查将十分困难。

OpenAI 和 Anthropic 即便无法解决国际协调问题,仍可改善自身实践。嵌入式评估者能够发现流程失效,并记录每家公司是否遵循其既定规则。他们无法核查无关实验室中未披露的工作。

结果是一项有用但有限的干预。独立 AI 评估者可以提升参与公司内部的问责性。他们无法解决 AI 竞赛、决定全球政策,也无法保证每一个竞争者都接受相同约束。

因此,读者应避免两种夸大的解读。这项提议并非覆盖全行业的具有约束力的减速措施。但如果承诺的访问权限变得真实且持久,它也比普通的安全宣传更具实质意义。

对于企业客户而言,实际问题在于证据。评估先进系统的采购方应询问:哪些风险经过外部测试、审查人员获得了何种访问权限,以及未解决的担忧是否得到披露。没有评估范围的安全标签几乎无法提供指引。

团队也应在自身部署中保持同样的严谨性。他们需要保留模型版本、提示词、权限、测试结果和批准决定的记录。一个可搜索知识库可以支持这种审计轨迹,但不能替代正式的风险控制措施。

三个信号将表明承诺是否真实

下一项考验在于实施:具名评估者、可执行的报告权利,以及超越 Anthropic 和 OpenAI 的采用。

第一个信号是一份公开的项目章程。Anthropic 和 OpenAI 应识别参与的评估者,定义类员工访问权限,并提供实施日期。章程还应说明哪些模型开发阶段属于覆盖范围。

这份公开文件将强化承诺,因为外部人士可以将实际运营与明确承诺进行对照。模糊的备忘录或未具名的试点项目会削弱承诺。没有日期和范围,员工和公众都无法识别不合规情况。

第二个信号是独立报告的证据。评估者应发布能够安全披露的方法、局限性、主要发现以及任何尚未解决的分歧。报告应说明其覆盖了哪些系统和开发时期。

完全通过公司沟通渠道形成的报告,所能提供的保证将十分有限。审查者能否说明分歧,是独立性的核心。即使经过严格删节的陈述,也应能让人区分真正的审查与被安排好的背书。

最具揭示性的考验,将出现在评估者建议开展额外工作或延期时。如果公司记录其回应,并保留评估者的异议,这一安排的可信度就会提高。如果访问权限消失,或调查结果始终不公开,这项承诺便会失去价值。

第三个信号是,其他前沿开发者是否会采用类似安排。Google DeepMind、Meta、xAI 或其他大型实验室的支持,将推动嵌入式评估成为行业规范。拒绝则会暴露自愿协调在竞争面前的局限。

类似并不意味着治理方式必须完全相同。不同公司使用不同的基础设施和开发方法。但至少需要有足够一致的信息披露,以便比较访问权限、独立性、报告机制和事件处置权限。

若有两家公司之外的开发者加入,将强化 Amodei 关于“竞相提升标准”的论点。持续的碎片化则会表明,安全协调仍然服从于战略激励。届时,各国政府将面临更大压力,需要制定最低要求。

未来三个月应会提供初步证据。两家公司无需等待立法或国际谈判,就可以公布访问原则。评估机构也可以说明,在接受嵌入式角色之前所要求的条件。

开发者和企业采购方应仔细关注相关措辞。“咨询”、“模型访问”和“类似员工的访问权限”并不能相互替代。第一种可能只是提供建议,第二种可能只是临时接口,第三种则应意味着持续的运营可见性。

他们也应留意反向证据。未公布启动日期、未披露评估者身份、宽泛的保密条款,或由公司控制的摘要,都会削弱该提案的价值。独立监督之所以可信,在于其权利能在出现分歧时依然得到保留。

Anthropic 的独立 AI 评估者如今获得了 OpenAI 异常显著的支持。这项协议提高了预期,但并未回答谁能够进入其中,或他们能够披露什么。决定性证据将来自首次存在争议的发现,而非首次合作性的公告。

对于任何正在选择或部署先进 AI 的人来说,现在正是提出更严格治理问题的时候:谁测试了该系统?他们访问了什么?哪些限制仍未解决?如果实验室希望客户信任嵌入式监督,那么这些客户是否也应要求获得足够的信息披露,以评估评估者本身?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page