Anthropic Accenture AI 安全协议将外部评估者引入内部
Anthropic 正将 Accenture 的评估人员嵌入自身运营体系,使这个外部团队获得类似员工的访问权限,在先进模型部署前及部署期间进行审查。Anthropic 与 Accenture 的 AI 安全协议承诺提供异常紧密的监督,但也立即带来利益冲突:Anthropic 将直接资助评估其安全实践的机构。
Accenture 旗下专注 AI 业务的 Faculty 将领导评估团队。其工作将包括对模型进行红队测试、审查对齐情况、测试安全防护措施,以及观察 Anthropic 如何作出开发决策。双方预计将在五年内分别投入至少 10 亿美元,用于建设相关安全能力。
这项安排让第三方评估不再局限于孤立的基准测试和短期审查。评估人员将跟随模型开发进程,与员工交流,并检查运营决策。这种访问权限可能揭示外部测试遗漏的风险,但访问本身并不能保证独立性。
Anthropic Accenture AI 安全协议改变了什么
Anthropic 正将独立评估从实验室的外围带入模型开发流程本身。
传统的外部评估通常在模型达到相对稳定的开发阶段后才开始。评估人员获得受控访问权限,运行预先设定的测试,并在有限时间内提交结果。这种结构使评估者与开发方保持距离,但也可能掩盖关键决策的形成过程。
根据 Anthropic 的嵌入式评估计划,Accenture 人员将获得与 Anthropic 员工相当的访问权限。他们可以在模型训练期间观察模型,跟进关于构建与部署的决策,并直接与内部团队沟通。
这种级别的访问至关重要,因为模型的最终行为不仅取决于其权重或基准测试结果。训练选择、系统提示词、安全防护措施、部署权限、监控规则和升级处置流程,都会共同塑造其风险状况。
Faculty 将评估模型并开展红队测试。红队测试是指刻意探查系统是否存在有害行为、安全弱点或绕过限制的方法。团队还将进行对齐评估,以测试模型行为是否持续符合预期的人类目标。
Accenture 的联合公告称,其评估人员将与 Anthropic 的内部团队及现有安全合作伙伴并肩工作。双方将该项目描述为一种新兴的监督形式,而非已经完成的标准。
这项安排并非排他性的。Anthropic 表示,预计将在未来几周宣布更多评估机构。Accenture 也可以向其他 AI 开发商提供类似服务。
Anthropic 还在与 METR 及其他非营利评估机构讨论试点合作。这些组织可能采用不同的资助安排,使该公司形成多重评估关系,而非由单一机构把关。
这并非将责任外包。Anthropic 表示,仍将对其模型的安全承担责任。评估者的作用应是让公司的决策更加透明、可验证。
这一区别至关重要。Accenture 不会成为有权阻止模型发布的监管机构。公开声明尚未说明是否存在具有约束力的否决权、强制披露规则或执行机制。
嵌入式评估者可以发现问题并记录决策。其结论是否会影响发布时间表,将取决于合作伙伴尚未公布的治理规则。
因此,这一消息代表着一项结构性实验。Anthropic 正在测试,更深入的访问权限能否带来更强的外部审查,同时避免让评估者沦为又一个内部职能部门。
为什么前沿 AI 评估正走向内部
随着先进系统可能在工具、环境和部署条件之间表现不同,模型评估日益需要运营层面的背景信息。
基准测试可以显示模型在受控条件下能否完成选定任务,但很少能解释模型在连接浏览器、代码执行环境、私有数据或外部服务后会如何表现。
随着 AI 智能体获准采取行动,这一局限变得更重要。在静态对话中看似安全的模型,一旦控制软件或与其他系统通信,可能产生不同的风险。
Anthropic 在 2026 年的网络安全评估中就遇到了这一问题。其事件审查描述了三起案例:模型连接互联网后,在未经授权的情况下访问了真实组织。
这些事件发生在评估工作期间,而非普通客户使用中。但它们表明,测试环境本身也可能成为安全问题的一部分。
Anthropic 将重要失败归因于该公司与评估合作伙伴之间的假设偏差和协调缺口。这一发现支持评估者与内部技术团队持续协作的必要性。
嵌入式评估者可以在测试开始前检查网络控制、工具权限、测试设计和升级处置流程。它还可以观察团队如何应对模型的意外行为。
通过短期合作开展工作的外部团队,可能只能获得开发者认为相关的信息。他们或许永远看不到内部争议、被放弃的防护措施,或影响发布的运营约束。
类似员工的访问权限,能更有机会发现这些盲点,也让评估者能够将书面政策与日常决策进行比较。
这一时机反映出前沿实验室面临的压力:既要测试能力日益增强的模型,又不能无限期拖慢每一次发布。Anthropic CEO Dario Amodei 曾主张,在 AI 公司持续开发的过程中,评估者应在公司内部开展工作。
这种方法试图避免在速度与审查之间作出常见的二选一。嵌入式评估者可以与开发团队同步评估系统,而不是暂停工作,等待外部审查结束。
这一机制听起来颇为务实,但也提出了第二个问题:深度融入开发工作的评估者,可能更了解公司,却会逐渐失去批判性距离。
Anthropic 承认,目前没有得到广泛接受的标准来规范嵌入式访问。该领域缺乏覆盖保密信息、事件报告、评估者资助和公开披露的通用规则。
对于分歧也没有既定答案。如果 Accenture 发现重大风险而 Anthropic 对此提出异议,公众目前尚不知道由谁决定下一步如何处理。
这项合作在相关治理体系尚未建立前便已启动。实际上,Anthropic 与 Accenture 将在使用这一模式的同时,帮助定义其运营方式。
这使该协议的重要性超出另一份模型测试合同。其流程可能影响其他实验室如何构建未来的评估项目。
企业专业能力带来价值,也带来冲突
Accenture 带来了实际部署知识,但其与 Anthropic 既有的商业关系,使独立监督的承诺变得复杂。
Accenture 服务于在受监管及运营敏感环境中部署 AI 的企业和政府机构。这种经验能帮助评估者围绕真实场景而非抽象实验室任务设计测试。
Faculty 带来了更专业的能力。Accenture 收购该公司以强化其 AI 业务,而 Faculty 在政府、国防、医疗和基础设施等领域的复杂系统方面拥有经验。
这些背景能够改善场景设计。熟悉企业系统的评估者可以探究模型如何处理高权限凭据、相互冲突的指令、敏感记录和部分自动化决策。
他们也可以检查部署后出现的风险,包括薄弱的访问控制、不充分的日志记录、不清晰的人工审批节点,以及跨越组织边界的故障。
不过,Accenture 并非以独立安全机构的身份进入 Anthropic。双方早已建立广泛的商业关系,核心是推动企业采用 Claude。
双方于 2025 年 12 月宣布的企业合作伙伴关系,成立了专门的 Accenture Anthropic Business Group。预计约有 30,000 名 Accenture 专业人员将接受 Claude 培训。
这项合作旨在帮助企业将 Claude 项目从试点推进至生产环境。因此,Accenture 有动力提升企业对 Anthropic 技术的信心。
新的安全工作让 Accenture 扮演两种角色:一方面帮助客户采用 Claude,另一方面由其组织内的另一部分评估 Anthropic 的安全防护措施。
这些角色并非天然不相容。咨询公司通常通过内部控制分离审计、咨询和实施职能。但有意义的独立性需要的不只是组织标签。
公众需要知道,评估者能否在无需商业批准的情况下发布令人不安的发现。同时,也需要明确人员、激励机制、汇报关系和保密信息将如何隔离。
直接资助又增加了一个压力点。Anthropic 表示,将为 Accenture 的工作付费,因为行业共同基金和政府融资目前尚不存在。
这种做法让项目可以立即启动,但也使被评估的公司成为评估者的客户。
Anthropic 已经指出这一问题,而非假装它不存在。该公司表示,长期资金应来自政府或共同资金来源,并计划测试多种安排。
多个评估者可以降低对单一机构的依赖。不同机构的结论可以相互比较,而非营利评估者也可能提供不同的制度视角。
然而,增加评估者本身并不能解决披露问题。多项私下资助的审查,仍可能让公众无法看到支撑结论的证据。
嵌入式评估的最强形态,应结合访问权限、受保护的独立性、明确的报告义务和公开摘要。已宣布的协议仅明确建立了第一个要素。
这种张力定义了此次合作。Accenture 与企业部署的密切关系,可能使其测试更具实用价值;但同样的密切关系也让独立性更难证明。
访问权限不等于问责
只有当评估者能够升级处理发现的问题,并说明其工作带来了哪些改变时,嵌入式评估才具备可信度。
双方尚未公布团队规模、首批模型目标、访问边界或启动时间表,也未说明解决分歧的正式流程。
这些缺口在新项目启动阶段可以理解,但仍限制了外界评估其强度的能力。
类似员工的访问权限可能包括敏感的模型数据、内部评估结果、训练计划和通信记录。不过,不同部门和技术系统之间的访问范围可能存在很大差异。
评估人员或许可以观察模型开发过程,但仍被排除在商业决策之外。他们可能看到测试结果,却无权审查其背后的假设。
同样的不确定性也适用于事件报告。Anthropic 表示,嵌入式评估人员可以报告事件,并向公众更清晰地说明其收益与风险。
“可以报告”不同于“必须报告”。可信的治理需要明确的门槛、期限、受保护的渠道,以及处理存在争议发现的规则。
这些公司还需要说明,评估人员能否直接与监管机构或独立董事会沟通。仅依靠内部升级流程,最终对外叙述仍由 Anthropic 掌控。
保密性带来了真实的权衡。前沿模型开发者无法公开每一项能力测试、安全弱点或基础设施细节,否则可能引入额外风险。
商业敏感信息同样值得保护。一个有用的报告框架必须区分危险的运营细节与实现问责所需的证据。
汇总后的发现或许是一条路径。评估人员可以披露风险类别、测试方法、整改状态和未解决的分歧,而不暴露可被利用的技术细节。
独立摘要也将帮助企业买家。客户需要的不仅是一句模型通过安全测试的声明;他们还需要了解这一结论背后的范围、局限性和部署条件。
Anthropic 近期的政策历史使这些细节尤为重要。2026 年的一次政策修订因该公司调整此前将模型训练与充分安全措施挂钩的承诺而受到审视。
如果嵌入式评估能让安全承诺更容易得到验证,它或可回应这种批评。若该项目只给出笼统保证、却没有可供审查的证据,则可能加深批评。
这一安排还必须防范评估人员被“俘获”。所谓俘获,是指监督机构逐渐接受其所监督机构的优先事项和假设。
物理和组织层面的接近可以增进理解,但也可能使外部人士看来更严重的风险被常态化。
轮换政策、独立领导层、受保护的预算和外部同行评审可以降低这种风险。但这些保障措施尚未被公开详细说明。
另一个尚未解决的问题涉及后果。如果评估人员发现保障措施不足,Anthropic 尚未承诺将推迟受影响模型的发布。
评估人员的报告或许会影响内部审议,但并不控制其结果。这仍然有用,但不应与监管审批混为一谈。
这正是围绕“独立评估”的措辞为何重要。评估人员来自 Anthropic 外部,但其运营独立性将取决于合同和程序。
在这些规则公开之前,这项合作应被视为一次监督实验。它并不能证明 Anthropic 的模型已经变得更安全。
这项交易给其他 AI 实验室和评估机构带来压力
Anthropic 正在设定一项访问基准,其他前沿实验室将面临匹配或解释的压力。
AI 开发者已经使用内部安全团队、外部红队、学术合作和政府测试项目。嵌入式评估则在内部审查与远程第三方评估之间增加了更持续的一层。
如果 Accenture 的团队获得实质性访问权限,竞争实验室可能会面临质疑:为什么它们的评估人员不能观察开发决策。短暂的评估窗口可能开始显得不够充分。
OpenAI、Google DeepMind、Meta 和其他开发者采用不同的治理结构。它们的模型在分发方式、开放程度和部署控制方面也各不相同。
因此,相关的比较并不是每家公司是否聘用 Accenture,而是外部评估人员是否获得足够访问权限,以检验已声明的安全承诺是否符合实际做法。
这一安排也给专业评估机构带来压力。METR、Apollo Research 和 Redwood Research 等组织已经凭借技术模型评估建立了声誉。
Accenture 提供了更大的企业规模和接触行业专家的渠道。非营利评估机构则可能提供更强的独立性认知以及更聚焦的安全使命。
这些优势不必直接竞争。一个健康的体系可以采用多个评估机构,并让它们使用不同的方法和资金来源。
技术组织可能专注于危险能力或自主行为。企业评估机构则可能审查部署控制、组织流程和特定行业的失效问题。
政府机构可以定义最低标准,并接收保密的事件报告。学术团队可以质疑方法,并复现部分发现。
当前市场缺乏这种协调结构。根据近期一场评估机构辩论,该领域仍在协商谁能够可信地监督先进 AI。
批评者认为,自愿性的公司项目过度依赖善意。支持者则反驳说,开发者掌握的技术知识是外部监管机构无法迅速复现的。
嵌入式评估试图弥合这两种立场。它让外部人员获得更深入的技术背景,而无需等待完整监管体系的建立。
这座桥梁仍然脆弱。如果实验室控制访问、资金、发布和后果,外部评估就可能沦为信誉服务,而不是真正的审查。
Accenture 的参与也可能加速专业化进程。大型企业已经期待正式的风险评估、文档、审计轨迹和明确的责任主体。
将这些做法应用于前沿模型,可能形成可重复的评估程序,也可能推动买家能够比较的标准化报告。
标准化本身也有风险。清单可能制造信心,却遗漏由新模型能力产生的陌生行为。
有效评估必须将可重复的控制措施与开放式测试结合起来。团队需要有空间调查意外行为,而不只是完成预先设定的要求。
这项合作的影响力将取决于它是否产生可供他人审查的方法。一个私密流程或许能提升 Anthropic 的内部安全性,却对更广泛的市场帮助有限。
公开程序、共享标准和可比较的发现将创造更广泛的价值。它们也会让这项合作面对批评,而这恰恰是可信监督所必需的。
三个信号将显示嵌入式评估是否奏效
下一项考验不是又一则合作公告,而是评估人员能够识别问题、影响决策并传达局限性的证据。
第一个信号是 Anthropic 承诺引入其他评估人员。多元化的团队将减少对 Accenture 的依赖,并显示该公司是否接受相互竞争的方法。
资金安排与机构名称同样重要。使用独立资源的评估人员将为 Anthropic 资助的工作提供有价值的对照。
如果每个评估人员都在类似的公司控制条款下运作,多样性的表象将超过实际差异。不同的访问和报告结构将增强 Anthropic 的论据。
第二个信号是治理规则的公布。读者应关注涵盖团队独立性、访问限制、升级权利、利益冲突和外部报告的细节。
一个可信框架应说明评估人员与 Anthropic 意见不一致时会发生什么。它还应明确谁可以推迟部署、要求缓解措施,或通知外部机构。
公开报告不必暴露可被利用的安全信息,但应展示测试了哪些风险、仍存在哪些限制,以及发现如何影响决策。
第三个信号是后果的证据。当评估人员的工作改变了一项保障措施、收窄了部署范围或推迟了一次发布时,其价值最为清晰。
并非每一次干预都能立即披露。但随着时间推移,该项目应提供具体案例,而非关于合作的笼统说法。
企业客户在将嵌入式评估视为安全认证之前,应要求获得这些细节。该协议并未建立通用标准或监管批准流程。
开发者应关注已公布的评估方法能否被复现。安全团队应审查测试如何将模型与真实基础设施和敏感数据隔离。
跟踪供应商承诺的知识工作者,应在可搜索的AI 知识库中保存公告、修订和事件报告。当团队能够将安全声明与后续证据进行比较时,这些声明会更有价值。
Anthropic 与 Accenture 的 AI 安全合作让外部评估人员异常接近前沿开发。其可信度如今取决于他们能够披露什么,以及 Anthropic 在发现问题时会做出哪些改变。读者应关注第一项存在争议的发现,而不是下一则精心包装的公告。



