top of page

Anthropic Cyber 验证计划扩大访问范围,但移除了 Claude 的关键安全防护

6小时前
讀畢需時 16 分鐘

Anthropic 已扩大三款先进 Claude 模型的访问范围,尽管在移除常规安全防护后,这些模型能够完成复杂的进攻性网络安全任务。Anthropic Cyber Verification Program 现已覆盖 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 及未来模型。获批组织可将其用于普通 Claude 用户会被拦截的工作。

这一变化为 Anthropic 刻意未向公众开放的 AI 能力开辟了一条受控路径。安全团队可以调查恶意软件、发现漏洞,并开展获授权的渗透测试。规模更小的一类组织则可以测试与电网、飞行运营、电信、银行和政府服务相关的系统。

这不仅是一项产品访问权限公告。Anthropic 正在测试,身份核验、组织管控、监控和政府审查能否替代内置于模型体验中的限制。OpenAI 也在为先进网络安全模型推行分阶段访问机制,而美国官员在决定谁可使用前沿系统方面的参与度正不断提高。

核心问题已不再是 AI 能否协助网络防御人员。Anthropic 表示,其早期合作伙伴借助 Claude 模型及相关扫描工作发现了超过 134,000 个经验证的漏洞。更棘手的问题在于,供应商能否有选择地解除安全防护,而不会创建一条最终被攻击者利用的特权通道。

Anthropic Cyber Verification Program 开放三个访问级别

Anthropic 正以三个权限逐步放宽的访问级别,取代一个广泛的安全边界。

扩展后的验证计划将获批用户分为 Defense Access、Red Team Access 和 Specialized Access。每个级别允许不同范围的行为,并适用不同的资格要求。

Defense Access 支持事件响应、安全运营、恶意软件分析、漏洞验证和防御性研究等工作。符合条件的申请者可包括企业、大学、非营利组织、政府机构、开源维护者,以及拥有可靠披露记录的个人研究人员。

该计划也覆盖不同规模的关键基础设施运营方。Anthropic 特别提到了区域医院和市政公用事业机构等组织。该公司表示,预计许多合法的防御团队都将符合资格,并力争在数日内回复这些申请。

Red Team Access 的权限更进一步。它允许组织针对其拥有或获准测试的系统,开展授权渗透测试和对抗性演练。内部红队、政府团队、安全咨询机构和渗透测试公司均可申请。

这一层级的组织必须满足额外的资格审核和安全控制要求。Anthropic 预计审查将耗时数周。公司在审议申请人更宽松层级的请求期间,可先向其授予 Defense Access。

Red Team Access 仍设有限制。Claude 应拦截与人身伤害或大范围破坏相关的行动。Anthropic 将勒索软件部署、对物理系统造成损害,以及测试高风险安全系统列为受限活动。

Specialized Access 移除了数量最多的网络安全限制。它仅面向获授权测试那些一旦失效便可能危及生命或扰乱主要市场的系统的组织。

这类目标包括飞行运营系统、电网、电信网络、银行间转账基础设施和政府行政系统。Anthropic 表示,会与美国政府一起深入审查每一家 Specialized Access 组织。

现有的 Project Glasswing 成员将直接进入这一层级,无需为当前模型重新申请批准。Project Glasswing 是 Anthropic 的一项受控计划,旨在让选定的基础设施供应商和安全组织获得其最强大的网络安全能力。

因此,该计划所依赖的不只是经验证的电子邮件地址或标准企业合同。它将模型访问权限与申请者的身份、机构角色、测试授权、技术控制措施和预定目标相联系。

组织还必须接受监控条件。Anthropic 通常要求保留数据,以便发现可能的滥用行为。现有 Fable 5.1 或 Mythos 5.1 用户若已采用零数据保留安排,可在加入该计划时暂时保留这些保护措施。

Anthropic 计划推出另一项名为 Enterprise Frontier Safeguards 的选项。该公司称,该系统将把滥用控制与由参与组织管理的云存储结合起来。在该系统上线前,数据治理仍是处理敏感代码或事件证据的团队必须权衡的重要因素。

最重要的区别在于授权。同一项技术行动,可能是防御性验证,也可能是非法入侵,取决于目标以及操作者是否拥有许可。该计划试图在放宽 Claude 限制之前先确定这一背景。

这种设计构成了本文的核心张力。Anthropic 并未声称高风险网络安全行为已对所有人都变得安全。它所主张的是,经验证的机构可在受控访问系统下获得更强的能力。

Claude 的网络安全能力已在产生成果

此次扩展基于这样一种证据:先进 Claude 模型能够将数月的漏洞工作压缩为更短时间内完成的调查。

Anthropic 表示,Project Glasswing 合作伙伴在 2026 年 4 月至 7 月间发现了至少 129,000 个经验证的软件漏洞。其独立的开源扫描工作则在 4 月至 10 月间识别出另外 5,500 个经验证漏洞。

其中超过 33,000 项发现被评为严重或高危。该公司表示,由于统计数据仅涵盖 33 家合作伙伴提交的报告,总数可能低估了该计划的影响。

这些数据也存在重要局限。参与者使用了不同的方法来确认和分类漏洞。不到一半的参与者披露了已修复漏洞的数量,通常是因为补救工作仍在进行中。

发现漏洞并不等同于修复漏洞。安全团队必须复现问题、评估其严重性、识别受影响的软件、通知维护者、创建补丁、测试修复结果,并安全部署。

模型可以加速发现阶段,却也可能使后续阶段更难管理。如果自动化系统产生发现的速度超过人工验证速度,安全团队将面临更大的分类处置队列,以及更长的未解决暴露期。

Anthropic 在此前的 Glasswing 扩展中承认了这一瓶颈。该公司表示,验证、披露和修补已比最初的漏洞发现更具限制性。

这种压力有助于解释更广泛的访问计划。一个规模有限、集中管理的团队无法检查每一个医院网络、开源软件包、支付系统、公用事业平台或政府应用。运营方需要直接访问权限,因为他们了解自身环境,也能授权进行贴近现实的测试。

潜在收益不止于软件扫描。先进模型可以重建攻击路径、分析陌生恶意软件、生成潜在补丁,并在防御方更改系统后重复测试。

与 Pacific Northwest National Laboratory 的合作说明了这一机制。研究人员创建了一个智能体脚手架,即一套允许 Claude 在网络环境中采取受控行动的工具和指令。

团队利用它模拟了针对某水处理设施网络物理模型的攻击。根据 Anthropic 的基础设施研究,该系统在三小时内重建了一次攻击,而非耗时数周。

该测试使用的是较早的 Claude Sonnet 4 模型。在一次运行中,一种预先准备的绕过 Windows User Account Control 的方法失败了。Claude 检测到失败后,选择了另一种已知技术继续进行模拟攻击。

这种适应能力对防御者很有价值,因为真实环境很少会完全按照书面流程运行。这也是访问权限会变得危险的原因。能够从失败步骤中恢复的模型,可能帮助攻击者突破静态指令的限制。

新计划旨在给予合法团队足够的自由度,以复现这种行为。基础代码审查和补丁工作仍可通过普遍可访问的 Claude 模型完成。更具交互性、多阶段的操作则需要验证,因为它们类似真实的入侵活动。

这一边界仍将难以界定。漏洞分析通常始于良性的代码检查,随后发展为一条利用链。事件响应人员可能需要复现攻击者的技术,才能将其阻断。

Anthropic 的答案是评估操作者和目标,而非仅根据每条请求的文本作出判断。这一转变使身份、治理和法律授权与模型层面的过滤一同成为核心安全机制。

移除网络安全防护会改变 Claude 能完成的任务

Anthropic 自己的测试显示,访问层级并非只是降低不便程度;它们决定了 Claude 能否完成进攻性操作。

该公司使用 CyScenarioBench 对 Claude Opus 5.5 进行了评估。CyScenarioBench 是一个用于规划和执行多阶段网络安全操作的基准测试,设定了现实约束条件。它在每个访问级别下,对十项挑战中的每项进行了五次尝试。

在未获得计划访问权限的情况下,Claude 在第一条提示时就拦截了每项任务。因此,无论操作者是否怀有善意,普遍可用的体验都阻止了评估继续进行。

Defense Access 允许开展稍多一些的活动,但安全防护仍在完成前终止了 50 次试验中的 46 次。四项任务成功完成。这种行为符合该层级的设计目标:用于调查、响应和漏洞工作,而非完整攻击模拟。

Red Team Access 产生了不同结果。没有发生安全防护拦截,Claude 完成了 50 次试验中的 34 次。其 68% 的完成率与未设防护时达到的 67.6% 结果几乎完全一致。

这些数字说明了 Anthropic 实际授予的权限。获批红队获得的并非只是请求额度更高的标准 Claude 体验。他们获得的是一种模型行为访问权限,在这项评估中,其表现已非常接近不受限制的性能。

Specialized Access 则更进一步,允许对安全敏感系统进行授权测试。它面向的场景是:即使普通红队访问权限仍会保留限制,因为一次失败的测试可能影响物理运营、公共服务或金融市场。

这种结构是一种经过权衡的取舍。强有力的通用过滤可以防范滥用,但也可能阻止防御者演练他们必须抵御的攻击。广泛移除这些过滤将同时扩大两类群体的访问权限。

Anthropic 正押注于机构验证能够形成区隔。国防用户可广泛获得资格,但仍受持续性限制。红队需接受更深入审查,却面临更少拦截。一小部分组织则通过与政府的联合审查获得专门访问权限。

安全分类器仍是该系统的核心。分类器是一种独立的模型或控制层,用于评估请求和响应是否涉及被禁止的行为。即使底层 Claude 模型具备继续执行的能力,它也可以中断一次交互。

Anthropic 曾介绍这些控制措施如何将网络安全请求划分为不同类别,包括明确禁止的活动、高风险双重用途工作、较低风险双重用途工作,以及常规防御任务。其公开的分类器框架也承认,恶意操作者与防御方有时会采用几乎相同的技术。

这种模糊性限制了自动过滤器能从提示中推断出的内容。若没有关于目标与授权的可靠信息,请求建立持久化、提取凭据或规避检测都会显得危险。

验证计划会在会话开始前补充这些缺失的背景信息。它将用户与获批准的组织、访问级别、合同义务、监控机制,以及获许可系统的明确范围关联起来。

不过,验证并不能消除技术风险。账户可能被攻破;员工可能越权;承包商失去访问资格后,权限未必能及时变更;获授权的基础设施也可能连接到未经批准的系统。

监控能够发现可疑使用行为,但发现时模型可能已经生成了有用的攻击路径。速率限制和目标控制可以缩小风险敞口,但熟练的操作者往往会将工作分散到多个工具和账户中。

该基准测试也只评估了部分结构化场景。68%的完成率并不能说明 Claude 在陌生软件、定制工业设备,或涉及社会工程学的链式攻击中会如何表现。

Anthropic 的证据支持一个更有限的结论:访问控制能够在不同层级产生显著不同的行为,而当限制放宽时,先进的 Claude 模型可以完成许多网络安全任务。

这些控制措施能否在大规模应用中保持可靠,尚未得到证实。随着申请者范围扩大到最初的 Glasswing 队列之外,这一问题将变得更加重要。

政府审查加强安全,同时集中权力

美国政府正成为前沿网络安全模型访问控制系统的一部分,而不只是外部监管者。

Anthropic 表示,在审查每一家 Specialized Access 组织时都会与政府合作。这种安排使政府官员得以参与决定哪些机构可以使用 Claude 针对飞行系统、电网、银行基础设施及其他敏感目标开展工作。

这一合作具有现实逻辑。政府机构了解机密威胁、国家基础设施、出口管制,以及针对受监管系统发动攻击的实际后果。它们还可以确认私营模型提供商无法单独评估的法律授权。

近期事件显示,这种关系已发展到何种程度。据报道,Anthropic 曾与美国情报机构合作,测试一个 Mythos 模型对机密政府系统的能力。

一名官员向美联社表示,该模型在数小时内识别出了一些漏洞。这名官员强调,发现弱点并不意味着 Mythos 在同一时期内已利用这些弱点。

参议员 Mark Warner 在6月的一场听证会上对这一结果作出了更引人注目的描述。他说,该系统在数小时内进入了几乎所有接受测试的机密环境,并将这一说法归因于国家安全局和美国网络司令部的负责人。

国家安全局与 Anthropic 均拒绝确认这项机密测试的细节。公开描述之间的差异,正是应谨慎看待广泛说法的理由。

政府参与也引发了冲突。6月,特朗普政府将前沿模型发布纳入国家安全审查,并限制对部分 Anthropic 系统的访问。

在一项涉及外国国民访问权限的指令出台后,Anthropic 暂时撤回了 Fable 5 和 Mythos 5。政府随后批准 Mythos 面向部分网络防御人员和基础设施提供商进行有限部署。

OpenAI 的 GPT-5.6 Sol 也面临类似审查。两家公司最初都只向小范围群体开放其最新系统,使商业 AI 模型的访问问题成为国家安全政策议题。

支持者可以认为,能力异常强大的网络安全系统需要异常审慎的发布流程。模型提供商无法全面掌握情报威胁,而政府也无法独立开发每一个相关的前沿模型。

批评者则认为,这是一种问责不足的安排。众议员 Lori Trahan 指出,政治任命官员正在逐家公司决定谁能获得访问权限,却缺乏明确的法律、流程或监督架构。

这一批评同样适用于扩展后的 Anthropic Cyber Verification Program。政府参与可以改善针对敏感目标的审查,但也会将权力集中到一个标准未完全公开的流程之中。

美国以外的组织还面临另一项担忧。Anthropic 此前曾将 Glasswing 扩展至15个以上国家的合作伙伴,其中许多机构服务的人群超出了其本国市场。

关键软件具有全球属性。开源维护者、云服务提供商、芯片制造商、电信供应商和金融网络都会经常跨越国界。一套深受某一政府安全优先事项影响的系统,可能造成不平等的访问机会。

因此,最强大的网络安全模型可能成为通过地缘政治关系分配的战略资源。这将迫使组织同时满足私营提供商的规则和政府的国家安全要求。

该计划需要明确的申诉机制、一致的标准、可审计的撤销流程,以及有关排除情形的透明报告。缺少这些要素,验证可能会演变为针对一项日益重要的防御技术的不透明许可制度。

Anthropic 并未将该计划描述为永久性公共政策。它将受控访问称为在更强保障措施形成前的过渡方案。不过,临时系统往往会建立日后难以替代的运营先例。

防御优势取决于修复,而非发现

只有当组织能在攻击者复制同样发现之前修复漏洞时,Claude 才能为防御方带来优势。

Anthropic 宣称的目标是让力量天平向防御方倾斜。这一目标听起来直观,因为基础设施运营商可以检查自己的系统、部署补丁,并在公开技术细节前协调事件响应。

攻击者拥有不同的优势。他们可以选择最薄弱的目标,复用成功技术,跨司法辖区行动,并且比机构审批流程推进得更快。

先进模型可以同时放大双方的能力。防御者可以扫描数百万行代码,并优先处理危险缺陷;攻击者则可利用类似推理,找到暴露服务中被忽视的进入路径。

时间差决定谁会受益。私下发现并快速修复的漏洞能够提升安全性;进入长达数月修复队列的缺陷,即便由防御方率先发现,对攻击者仍然有用。

因此,Anthropic 的漏洞总数衡量的是发现能力,而非完整的防御成果。超过134,000项经验证的发现代表了可观的研究产出,但并未说明有多少受影响系统仍然暴露在风险中。

该公司称,参与伙伴中披露补丁数据的不足一半。这个缺失的分母使外部无法独立评估发现速度是否超过了修复速度。

大量自动化发现也可能带来运营问题。维护者需要足够的证据来复现缺陷、理解其影响,并区分可被利用的问题与理论上的弱点。

优先级划分不佳的报告可能压垮由志愿者维护的开源项目。如果在修复方案出现前,详细的利用信息流经太多组织,也可能增加披露风险。

扩展后的计划将更多责任置于申请者身上。安全团队需要具备漏洞管理流程、隔离测试环境、访问日志、清晰的升级路径,以及部署修复措施的权限。

他们还需要可长期保存的记录。AI 辅助调查可能产生长串假设、工具输出、代码变更和决策。一个可搜索的工程知识库可以帮助团队保留这些背景信息,同时不将模型结论视为已验证的事实。

人工审查仍然必不可少。模型可能误解系统边界、提出不安全的修复方案,或识别出在真实运行条件下无法成立的模式。工业系统还受到普通软件基准测试无法涵盖的物理约束。

Specialized Access 提高了这些风险。一项针对飞行控制环境、电网管理系统或银行间网络的错误操作,可能带来超出数据丢失范围的后果。

Anthropic 表示,对于可能导致人身伤害或大规模中断的活动,较低层级仍会实施实时限制。Specialized 用户之所以面临更少拦截,正是因为其工作有时需要测试这些场景。

因此,该计划必须评估的不只是一个组织表面上是否正当。它还必须判断该组织能否隔离目标、约束模型操作、监督测试、从故障中恢复,并报告异常情况。

政府审查或许能够支持这种评估,但运营纪律仍应落实在本地。模型提供商无法监督公用事业实验室或机密网络中的每一条命令。

竞争会增加压力。OpenAI 也已通过受控计划提供先进网络安全模型。如果提供商竞相比较哪套系统能完成更多进攻性任务,访问限制就可能成为商业劣势。

如果它们只在安全性上竞争,防御者可能会选择拦截更少、攻击模拟能力更强的模型。这会形成放宽控制措施的激励,同时将验证描述为补偿性措施。

Anthropic 的分层结构是管理这种压力的一次可信尝试,但它没有解决根本冲突。使 Claude 能够对抗复杂攻击者的同一套能力,也使验证失效的任何后果都更为严重。

防御优势将体现在修复结果中,而不是模型基准测试中。补丁率、修复时间、复发率和被阻止的事件,比发现漏洞的原始数量更重要。

三个信号将显示受控访问是否有效

下一项考验在于,Anthropic 能否在不削弱验证、也不让未解决发现淹没防御方的前提下扩大参与范围。

第一个信号是入选质量。Anthropic 表示,它可在数日内审查许多 Defense Access 申请,而 Red Team Access 可能需要数周时间。只有在身份、授权和安全检查仍保持一致的情况下,更快的批准才有价值。

公司应披露申请总量、获批率、审核时长、撤销情况以及拒绝申请的主要原因。它无需公开敏感参与者的身份,也能证明该系统是否能够以负责任的方式实现规模化。

如果访问权限大幅增加,但相应的监控能力没有跟上,将削弱 Anthropic 的论点。稳定的审核标准和较低的滥用率则会增强其说服力。

第二个信号是已发现漏洞与已修复漏洞之间的关系。Anthropic 报告的 129,000 项合作伙伴发现和 5,500 项开源发现,为漏洞发现能力提供了基准。

未来的报告应将已确认的发现与重复提交、存在争议的报告,以及影响已淘汰软件的漏洞区分开来。报告还应披露有多少问题获得补丁,以及这些补丁多久后才部署到实际运行的系统中。

更高的补丁修复率将支持这样一种说法:前沿模型能够带来防御优势。严重未解决问题的积压不断增加,则意味着自动化发现暴露的是组织瓶颈,而非解决了问题。

第三个信号是 Anthropic 如何处理首次严重的访问失效事件。任何验证系统都不应只在正常运行期间接受评估。

账户被攻破、未经授权的目标、分类器绕过,或意外与真实在线系统发生交互,都会检验该计划的应对能力。关键指标包括发现时间、遏制措施、通知、权限撤销,以及事后作出的改进。

透明的事件报告将建立信心,即便部分技术细节仍需保密。沉默则会让外部组织难以评估加入该计划的真实风险。

Enterprise Frontier Safeguards 也将影响这一信号。Anthropic 表示,计划中的系统将结合隐私保护与防滥用机制,同时允许符合条件的组织将信息保留在自己的云环境中。

这一安排可能缓解人们对将敏感代码和事件数据发送给模型提供商的担忧。但如果控制措施在客户自行管理的环境中表现不同,也可能使集中式监控更加困难。

竞争对手的做法应作为背景因素看待,但它会影响 Anthropic 的选择。OpenAI 受控的网络部署将为买家和监管机构提供另一种模式,用于比较访问权限、监督机制和事件响应。

竞争对手若扩大访问范围,将迫使 Anthropic 加快审批速度。其他地方若发生重大滥用事件,则可能促使它采取更严格的要求。

读者不应将 Anthropic Cyber Verification Program 视为前沿网络能力如今已安全的证明。这是一场仍在进行的治理实验,建立在一个艰难的前提上:已知机构可以获得更少限制,因为其身份和控制措施能够降低风险。

这一前提可以检验。Anthropic 已公布基准测试结果,显示其访问层级会改变 Claude 的行为。它还报告了受控部署中大量经过验证的发现。

缺失的证据涉及大规模运营。我们尚不清楚合法请求被拦截的频率、多少获批组织违反规则,以及 Anthropic 检测账户被用于超出预期范围活动的效果如何。

开发者和安全负责人应关注该计划,因为类似的访问系统可能扩展到网络安全以外的领域。具备生物、金融或自主研究能力的前沿模型,也可能需要与已验证用户及获批环境绑定的权限。

企业买家应询问某一访问层级在技术上具体改变了什么。他们还应审查数据保留、监控、事件披露、员工授权,以及模型生成行为的责任归属。

对于知识工作者而言,更广泛的启示是:获取先进 AI 的方式并不总会以统一的产品更新形式出现。最强大的能力可能会越来越取决于用户是谁、由什么机构支持,以及获授权测试哪些系统。

Anthropic 让这一未来更近了一步。其计划让更多防御者能够使用 Claude 的先进网络能力,同时继续对其他所有人保留更严格的限制。

结果将更多取决于严谨的修复工作和可追责的监督,而非醒目的漏洞数量。Anthropic 会不会公布足够证据,证明经验证的访问能够打造更安全的基础设施?还是首次重大失败将暴露出验证机制才是最薄弱的保障?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page