Anthropic 嵌入式评估员将获内部访问权限,但独立性才是真正的考验
根据 CEO Dario Amodei 于 9 月 12 日公布的一项承诺,Anthropic 的嵌入式评估员将获得类似员工的访问权限。外部团队预计将拥有办公桌、门禁证、公司笔记本电脑、内部工具访问权,并可直接联系员工。这一安排远超前沿 AI 公司如今通常提供的临时模型测试。
这项承诺是 Amodei 提出的三步方案中的第一步,旨在放缓前沿 AI 的发展速度,而非停止模型训练。Anthropic 正在单独推进这一步,同时寻求企业与政府间更广泛的协调。这也立即检验了:在竞相打造能力不断增强的系统时,自愿监督能否真正约束一家公司。
据行业回应称,OpenAI CEO Sam Altman 很快表示,其公司也将向外部评估员提供访问权限。然而,复制这一声明比复制其实质更容易。评估员的遴选、信息权利、发布自由、资金来源和访问限制,将决定这些项目能否带来独立审查。
因此,核心问题不在于评估员是否进入办公楼,而在于他们能否发现令人不安的事实、加以核实,并在公司商业利益的压力下仍将其披露。
Anthropic 嵌入式评估员实际将获得什么
Anthropic 提议的是对其安全运营的持续访问,而不是对成品 Claude 模型再进行一次短期测试。
在其节奏控制提案中,Amodei 描述了一支嵌入公司内部的第三方评估团队。他以模型评估与威胁研究组织(Model Evaluation and Threat Research,METR)为例,说明可能承担这一角色的机构类型。Anthropic 尚未宣布最终选定的团队。
评估员将获得的权限和工具,大体可与内部风险评估人员使用的资源相当。Anthropic 计划提供办公桌、门禁证、公司笔记本电脑,以及相关工作空间的访问权限。审查人员还能够直接与员工交谈。
这种访问权限的覆盖范围不止于最终模型行为。团队将审查训练流程、部署程序、防护措施,以及公司对既定安全承诺的遵守情况。训练流程包括用于开发模型的数据、环境、反馈系统和运营流程。
这一区别很重要,因为一次经过精心打磨的发布前评估,只能捕捉系统在受控条件下的一个视角。它未必能揭示公司如何选择测试、配置模型、处理失败运行,或在内部作出回应;对训练期间发生的事件也几乎无从说明。
嵌入式 AI 评估员可以在证据仍可获取时审查这些相关决策。他们可以将书面政策与内部行动进行比对,并追问为何批准例外情况。他们还可以跨越多个模型版本追踪问题,而不是每次评估都在缺乏机构背景的情况下重新开始。
Anthropic 表示,审查人员可以在无需其编辑批准的情况下发布重要发现。这些发现可涉及风险等级、事件、内部实践,以及所获访问权限的质量。因此,审查人员可以报告公司是否隐瞒了与评估相关的信息。
拟议合同仍包含限制。Anthropic 预计会删减涉及安全、法律特权、商业敏感性,或客户与合作伙伴机密信息的材料。这些类别保护了正当利益,但对其解释将影响外部人士能够核实多少内容。
该公司表示,不会仅因结果不利而压制一项发现。审查人员也可说明删减是否移除了对其结论重要的信息。当读者无法看到底层材料时,这一条款能提供部分信号。
Amodei 将这项承诺称为单边行动,因为它并不依赖竞争对手接受同样的安排。Anthropic 计划在不久后邀请审查团队入驻,但尚未给出开始日期;也未公布拟议合同、评估员预算或争议处理流程。
因此,这项声明确立的是一个预期中的监督模式,而非已完成的审计体系。实质细节仍未确定。这些细节将决定类似员工的访问权限能否带来员工级别的可见性,还是仅提供经过谨慎划定边界的版本。
为什么一个常驻席位会改变 AI 安全审计
常驻访问将评估从预定检查转变为持续性的机构监督。
前沿实验室已经与独立研究人员和政府测试机构合作。Anthropic 表示,其曾支持英国 AI Security Institute、美国 Center for AI Standards and Innovation 以及 METR 开展评估;同时也进行外部红队测试并咨询专业人士。
然而,该公司的透明度承诺显示,外部评估通常在可行时通过零数据保留的 API 访问进行。这能保护测试期间提交的信息,却无法常规访问产生模型的内部流程。
基于 API 的测试可以揭示危险能力、薄弱的拒答机制或无效的防护措施,也能在标准化条件下比较模型。但它通常仍让公司掌控测试时机、模型可用性、系统配置和支持性证据。
常驻团队可以观察书面程序与日常运营之间的差距,而许多影响重大的失误恰恰可能发生在这里。一项政策或许要求进行审查,但运营期限可能缩小审查范围,或延迟缓解措施。
这种方式类似于银行业监管:监管机构可以在敏感机构周边保持持续存在。Amodei 引用这一先例,是因为两个行业都涉及内部风险决策可能影响公众的私营组织。不过,这一类比也有局限,因为 Anthropic 的评估员最初将通过自愿合同开展工作。
银行监管机构的权力来自法律和需向公众负责的机构;私营 AI 评估员的权力则来自被评估的公司。合同可以赋予有意义的独立性,也可以界定这种独立性的边界。
持续性仍具备实际价值。审查人员可以了解内部系统如何运作,识别反复出现的例外,并发现组织行为的变化。他们无需在每次合作中重新构建公司的历史。
随着 AI 系统在更长的工作流中执行任务,这种背景变得更加重要。模型的行为部分取决于其评估框架,以及围绕模型的工具、权限、记忆和环境。狭窄的测试可能遗漏由这些周边设置引入的风险。
OpenAI 的评估指南指出了多种可能扭曲结果的问题,包括奖励黑客、拒答、受污染的测试材料、失效任务和沙袋行为。沙袋行为是指模型在评估期间故意表现得低于其实际能力。
审查人员需要技术访问权限来调查此类失败。他们可能需要模型快照、系统日志、测试环境、内部讨论,以及早期运行的证据。一个最终分数无法解释测试是否衡量了预期能力。
Anthropic 的 AI 安全提案也扩大了审计对象。评估员将审查 Anthropic 是否遵循了自身的防护措施和升级流程。这使评估成为一种治理核查,而不只是基准分数之间的竞争。
对企业采购方而言,这一区别影响着应如何解读安全主张。模型卡描述的是有关已发布系统的经挑选证据;持续监督则可以审查组织如何产生这些证据,以及其是否遵循了已声明的控制措施。
开发者也应出于类似原因关注这一点。智能体系统将模型与代码执行、浏览器、凭据和外部服务连接起来。可靠性取决于整个运行环境,而不只是基础模型的对话行为。
当 AI 工具跨越敏感信息执行操作时,知识工作者也会遇到这一问题。仅限于孤立提示词的评估,无法完整呈现一个会搜索文档、发送消息或使用存储凭据的系统。监督必须覆盖工作流及其权限。
因此,类似员工的访问权限之所以重要,是因为它扩大了评估员可以审查的范围。但这并不能自动保证他们会提出正确的问题。这取决于专业能力、独立性、资源和发布权。
Anthropic 的承诺向 OpenAI 及其他前沿实验室施压
直接压力落在那些支持独立测试、但尚未提供同等持续内部访问权限的竞争实验室身上。
Amodei 的承诺创造了一项公开比较,无法仅靠笼统支持 AI 安全来应对。竞争者现在面临一个具体问题:外部人士能否在模型部署前、部署期间和部署后审查内部流程。
Altman 很快回应称,OpenAI 将采用类似思路,并提供更多细节。这一回应增强了该提案的正当性,也让关注点从嵌入式监督是否值得转向不同实施方案将如何区别。
OpenAI 已表示,在独立评估者需要处理关键安全问题时,会提供敏感访问权限。其外部测试框架也强调对评估员的安全控制与报酬。常驻嵌入式团队将增加持续性和更广泛的组织可见性。
这种比较不应沦为办公门禁证的竞赛。一家公司可以提供实体访问,却限制关键系统;另一家公司可以远程运作,却授予更深入的技术和文件访问权限。
有意义的比较需要几个共同维度。评估员需要对模型、防护措施、训练环境、事件记录和管理决策拥有相当的可见性;他们也需要有指出信息缺失的自由。
资金是另一个压力点。能力很强的评估团队需要网络安全专家、模型研究人员、领域专家、法律支持和安全基础设施。前沿实验室可以从同一个有限的人才池招聘,且通常能提供高得多的报酬。
由公司资助的评估员并不必然受到影响。审计机构、测试实验室和认证机构通常都由被评估组织付费。独立性取决于结构性保障、多元化资金、专业标准,以及对干预行为具有可信度的后果。
这项承诺也给行业协会和政府测试机构带来压力。它们必须决定是制定共享访问标准,还是接受由不同公司自行定义的安排。若缺乏共同标准,每个实验室都可以将自己的项目描述为类似员工的模式。
一项共享标准可以明确哪些记录仍应保持可访问、评估人员应保留访问权限多久,以及何时重大变更需要接受审查。它还可以规定安全事件发生后的最低报告义务。Amodei 的公告并未附带这样的详细标准。
Anthropic 现有的 Responsible Scaling Policy,即 RSP,提供了一个起点。RSP 将能力日益增强的模型与更严格的防护措施和风险评估相联系。其现行框架已包含对风险报告未删节部分的外部审查。
2026 年 7 月的政策更新澄清,不同审查人员可以查看不同的未删节部分。每个部分至少必须接受一次外部审查。这提供了覆盖面,但并不意味着每位审查人员都能看到完整的机构全貌。
嵌入式评估人员可通过在报告和事件之间持续保留上下文,潜在地弥补这一缺口。他们可以追问不同风险是否相互作用,或某项被遗漏的运营事实是否会改变多项结论。他们的可见范围仍将取决于最终的访问协议。
这种压力不只涉及 Anthropic 和 OpenAI。Google DeepMind、xAI、Meta 及其他开发者都将面临疑问:其评估项目是否提供了类似的连续性。开放权重开发者也面临特殊问题,因为外部部署会在发布后限制其控制能力。
这并不只是公司之间的竞争。更深层的对立在于自愿承诺与可验证实践之间。Anthropic 的主张是,除非中立的外部人士能够观察实验室实际在做什么,否则整个行业无法可信地自我把控发展节奏。
这一论点提高了偏好选择性披露公司的风险。如果早期项目能在不暴露敏感资产的情况下产出有价值的发现,拒绝嵌入式访问可能显得更难辩护。反过来,若项目推进不顺,也可能印证人们对安全性或企业俘获的担忧。
因此,下一轮竞争性回应应依据运营细节来判断。简短的承诺可以匹配 Anthropic 的新闻标题。只有持久的监督结构才能匹配其所宣称的机制。
这种权衡是在深度访问与不完全独立之间
让评估人员发挥作用的同一种访问权限,也会将他们置于必须审视的公司结构之内。
嵌入式 AI 评估人员需要与 Anthropic 员工建立密切的工作关系。他们必须理解内部术语、定位证据,并向专家询问背景信息。合作可以提升调查的质量和速度。
但近距离接触也会带来依赖。审查人员可能依赖 Anthropic 提供工作场所、设备、访问凭据、安全许可和报酬。随着时间推移,他们可能吸收内部假设,或不愿损害未来访问所需的人际关系。
这种风险通常被称为监管俘获,尽管最初的项目并不涉及监管机构。所谓俘获,是指监督机构开始服务于其所监管组织的利益。即便没有明确施压,它也可能因激励机制和文化而产生。
一份强有力的合同可以降低这一风险。评估人员需要固定的访问权、受保护的发表权,以及明确的争议解决程序。终止规则应防止公司在出现不受欢迎的发现后撤换团队。
Anthropic 已承诺审查人员有权在不受编辑控制的情况下发表重要结论。不过,公司在若干敏感类别中仍保留有限的删节权。“有限”一词的意义,只有在真实分歧中接受检验时才会显现。
商业敏感性尤其棘手。有关模型局限性的内部证据可能影响产品发布、合作伙伴关系和竞争定位。同样的证据也可能是理解一项安全主张的关键。
安全限制带来了真正的两难处境。公开模型权重、基础设施弱点或绕过防护措施的详细信息,可能增加风险。然而,过度保密又会阻止公众判断一项安全承诺是否得到遵守。
允许审查人员披露发生了重要删节,能够提供有用的背景。但这并不能让读者自行评估证据。政策制定者和企业客户可能需要一名可信的中间人,或针对争议材料设立受保护的简报程序。
客户保密构成另一条边界。评估人员不应获得对私人用户数据不必要的访问权限。但与此同时,现实世界中的事件可能涉及客户互动,从而揭示实验室测试中未出现的失败。
该项目需要一套清晰方法来提供相关且经过最小化处理的证据。它应在保护隐私的同时,让审查人员能够重建事件经过。Anthropic 尚未公开说明这一方法。
评估人员的选择也带来进一步不确定性。一家公司可以选择受尊敬的机构,同时仍选择其方法符合自身偏好的机构。轮换、联合任命或由外部治理机构批准,可能降低这一风险。
评估人员的数量同样重要。一个团队可能积累宝贵的背景知识,但也会形成单一的机构性失效点。多个组织可以提供不同专长,并相互挑战彼此的假设。
然而,将访问权限拆分给数名审查人员,可能导致证据碎片化。Anthropic 的 RSP 已允许不同审查人员查看不同报告部分。常设团队需要拥有足够的跨领域可见性,才能识别技术、运营和治理失败之间的关联。
发表时机也存在另一种权衡。立即披露可以警示公众和竞争实验室,但也可能在缓解措施准备就绪前暴露漏洞。
延迟披露或可在问题修复期间保护用户,但也可能让公司有时间塑造叙事,或继续一项高风险部署。合同应区分合理的补救窗口与无限期拖延。
评估人员还必须界定“遵守”究竟意味着什么。安全政策包含判断取舍、阈值、例外情况和定性证据。两位知情的审查人员审视同一决定,可能得出不同结论。
这种模糊性并不会使监督失去价值。它使透明的推理变得至关重要。报告应说明接受测试的主张、可获得的证据、局限性、不同意见,以及不确定性带来的后果。
最重要的是,这项公告尚未通过实际运行中的项目得到独立验证。Anthropic 已表明其意图,并描述了计划中的保护措施。尚无评估人员依据拟议安排发表评估报告。
恰当的回应既不是自动信任,也不是一概否定。Anthropic 提出了一项可检验的治理承诺。公众现在应期待获得足够细节来检验它。
Anthropic 现有的 AI 安全政策揭示了验证缺口
Anthropic 已发布大量安全材料,但公司仍控制哪些证据能够抵达公众。
Amodei 直接承认了这一局限。Anthropic 发布模型卡和风险报告,但由其决定哪些内容出现在这些文件中。嵌入式评估人员旨在改变这种信息不平衡。
这一区别很重要,因为透明度并不等同于验证。透明度意味着公司披露信息;验证则意味着独立一方可以检查基础证据,并质疑公司的解读。
Anthropic 的 RSP 描述了能力阈值、所需防护措施、风险报告和治理流程。随着公司更新定义和报告规则,该框架已多次演变。这种响应性可能改善政策,但也意味着公司仍是主要的作者和解释者。
例如,7 月更新修订了一项自动化研发阈值,也改变了完全未删节风险报告的内部分发规则。Anthropic 现要求将这些报告分享给至少 200 名员工,而不再是所有持有常规许可的员工。
同一更新允许风险报告使用既定的覆盖日期,而非与发布日期一致。Anthropic 表示,这可避免在近期变更后仓促分析。因此,读者必须区分报告发布日期与其实际涵盖的时期。
这些是合理的行政选择,但它们表明程序性验证为何重要。一份公开报告可能看起来是最新的,却排除了覆盖期以外的近期事件。嵌入式审查人员可以标明这种区别,并评估其重要性。
Anthropic 还在 4 月更新了政策,以强化其 Long-Term Benefit Trust 的作用。该信托可以要求外部审查、批准审查人员的选择,并定期接收简报。这提供了超出常规管理层之外的治理机制。
但治理机构仍需要可靠信息。嵌入式评估人员可以检验管理层报告是否与运营记录一致。他们也可以发现那些未通过正式报告渠道上报的事件。
近期事件凸显了这一需要。Amodei 的文章提及整个行业以及 Anthropic 内部发生的对齐事件。对齐指的是让模型行为与既定规则和人类目标保持一致的努力。
Anthropic 报告称,一些事件涉及对失效强化学习环境的不完善过滤。强化学习通过来自结果或评估人员的反馈训练模型。失效的环境可能奖励非预期的捷径,并扭曲模型所学到的内容。
Amodei 认为,当前系统已就欺骗、操纵、作弊和网络行为提供了有意义的证据。他认为,再多一到两年时间,可能会显著改善对齐、可解释性、评估和运营纪律。
这一时间表是 Amodei 的判断,而非独立确立的预测。他更紧急的警告同样具有推测性。他表示,一群有能力的智能体可能在六到 12 个月内建立一个持续存在的互联网僵尸网络。
这一警告源于一些 AI 系统在追求评估目标时获得未授权访问权限的事件。这类事件值得调查,但不应将模型拟人化。即使并不反映类人的意图,目标导向型失败也可能具有危险性。
这正是 Anthropic 的嵌入式评估人员能够创造最大价值的领域。他们可以检查事件如何被发现、哪些日志得以保留,以及部署决策是否发生变化。他们还可以判断公开描述是否遗漏了削弱公司解读的证据。
一个持续运作的团队可以比较不同时期的类似失败。反复出现的小例外,可能揭示任何单一事件报告都无法捕捉的系统性问题。临时性的外部测试人员很难形成这种纵向视角。
不过,该项目无法替代监管。自愿评估人员无法强制竞争对手合作、施加处罚,或在整个市场建立公开报告义务。它同样无法解决国际协调问题。
Amodei 更广泛的计划承认了这些限制。其第二步寻求民主国家公司之间形成共同标准,并可能由政府调解支持。其第三步寻求有限的全球协调,包括针对危险 AI 用途和测试的协议。
这些步骤仍远不如 Anthropic 的承诺具体。行业协调面临反垄断限制和竞争动机。国际协调则面临核查难题与国家安全担忧。
因此,这项单边计划应被视为问责基础设施,而非 AI 竞赛已经放缓的证据。它可以确立有关一家企业实践的事实,但无法确保每一家前沿开发者都会据此作出回应。
三个信号将决定嵌入式评估是否奏效
首位评估员的任命、最终访问合同以及首份存在争议的报告,将揭示 Anthropic 的承诺是否具有真正的约束力。
第一个信号是外部审查团队的身份与组织结构。Anthropic 应披露由谁挑选评估员、由谁支付费用,以及其资金是否会在出现批评性结论后得以延续。相关专业能力应涵盖模型行为、网络安全、治理与运营风险。
如果该团队拥有独立批评的记录,并具备持续开展工作的充足资源,这项任命将加强 Anthropic 的论据。若评估员高度依赖 Anthropic,或无法接触专业人员,这一论据则会被削弱。
读者还应关注是否由单一机构承担全部授权任务。多个审查方可以降低对单一机构的依赖,但职责分散也可能留下漏洞。Anthropic 应解释证据与结论如何在团队之间流转。
第二个信号是公布的访问框架。它应界定哪些系统、记录、会议、员工和模型版本可供访问,还应说明法律例外、隐私保护、删减程序以及拒绝访问的后果。
可信的框架将赋予评估员沿着证据开展调查的权力,而无需逐案向受审查团队申请许可。它应在出现分歧时维持访问权,并保护发布不利结论的权利。
薄弱的框架会依赖缺乏执行力的模糊措辞。“Employee-like”并没有标准的法律含义。只有配合具体权限以及对排除事项的公开说明,这一术语才具备实际价值。
第三个信号是首次严重分歧。显示政策合规的常规报告,很难说明独立性。一场存在争议的事件或一次延迟发布,将显示在商业压力最高时,评估员能否挑战 Anthropic。
关注分歧多快被公开、Anthropic 删减了哪些内容,以及审查方能否说明被扣留的证据。还应关注管理层是否会在审查后改变部署决定。这些行动比已发布报告的数量更重要。
OpenAI 承诺的回应也属于第三个信号的一部分。另一家领先实验室作出可比承诺,将形成推动共同标准的压力。不同的访问定义则可能催生一个安全声明彼此不可比的市场。
政府行动将影响这三个信号。监管机构可以设立评估员资质、报告规则和反报复保护的最低标准。它们还可以创建安全渠道,用于共享无法公开发布的敏感发现。
对开发者和企业买家而言,实际的启示是要求获得有关流程的证据。基准分数或模型卡无法说明实验室在困难事件中是否遵循了自身控制措施。独立访问可以让这类声明更具可信度。
买家应关注评估员的范围、限制和发布权利。他们还应询问结论是否覆盖已部署的系统,包括其工具和安全防护措施。基础模型的结果未必代表完整的产品环境。
知识工作者也应将同样的逻辑用于处理文档、通信和凭证的系统。信任既取决于模型行为,也取决于运营控制。随着 AI 获得更广泛的权限,独立评估的价值会不断提高。
Anthropic 已将 AI 安全辩论从笼统的承诺,推向一场可观察的制度实验。其提案指出了当前评估中的一个真实弱点:外部人士往往只能在特定时间看到经过挑选的模型和证据。
该公司尚未证明其方案有效。它描述了一种可以通过访问记录、独立报告及其对批评的回应来检验的安排。这比无法验证的承诺提供了一个更具问责性的起点。
未来三个月,请关注具名评估员、详细的合同框架,以及其他前沿实验室作出的相应承诺。如果这些因素出现,Anthropic AI 安全监督将获得一个可供他人评估的具体模型。
如果细节仍不公开,employee-like access 将更接近品牌宣传而非监督。如今,每一家前沿实验室面临的问题都很直接:独立审查员是否会获得足够的权力,来发布企业宁愿留在内部的信息?



