top of page

Anthropic 的 AI 网络安全工具发现了数千个漏洞——但只有 1% 被修复

已更新:6月17日

2026年4月7日,Anthropic 向12家科技巨头授予了 Claude Mythos Preview 的早期访问权限。这是一款尚未发布的 AI 模型,由于其发现软件漏洞的能力过于强大,该公司拒绝将其公开发布。在几周内,该模型自主识别出了所有主流操作系统和网络浏览器中数以千计的此前未知的安全缺陷——其中包括一个在 OpenBSD 中存在了27年、历经数十年专家审查仍未被发现的漏洞,以及一个在500万次自动化测试运行中均未被检测到的、存在了16年之久的 FFmpeg 漏洞。然而,在公告发布九天后,软件维护者修复的发现比例不足1%,这暴露了一个结构性危机,威胁到先进的 AI 网络安全工具在功能上毫无用处:防御者修复漏洞的能力无法跟上 AI 发现漏洞的速度。

Project Glasswing(Anthropic 对这一受控部署计划的称呼)投入了 1 亿美元的模型使用额度和 400 万美元给开源安全组织,押注于通过协调 AWS、Apple、Google、Microsoft、CrowdStrike 以及其他 40 多家机构,在类似的 AI 能力扩散到对手手中之前建立防御优势。但这一策略面临着一个令人不安的现实——瓶颈不再是发现漏洞,而是人类和组织以 AI 速度进行修复的能力。本次调查旨在探讨 Anthropic 的方法代表了一种可行的防御范式,还是仅仅证明了前沿 AI 已经超越了软件行业自我保护的基本能力。

事件回顾 —— 打破漏洞发现基准测试的受控发布

Anthropic 于 2026 年 4 月 7 日宣布了 Project Glasswing,并立即向十二家创始合作伙伴授予了 Claude Mythos Preview 的独家访问权限,其中包括 Amazon Web Services、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorgan Chase、Linux Foundation、Microsoft、Nvidia 和 Palo Alto Networks。该公司将访问权限扩展到了 40 多家负责维护关键基础设施的其他组织,目标是实际的修复能力,而不仅仅是企业安全团队。该模型目前仍未向公众发布,原因是 Anthropic 将其特征描述为具有攻击性利用能力,可能使恶意行为者能够自主生成有效的漏洞利用程序。

据该公司称,Claude Mythos Preview 在内部测试期间自主发现了所有主要操作系统(Linux、FreeBSD、OpenBSD)和 Web 浏览器中的数千个高危漏洞。该模型在网络安全漏洞复现基准测试中达到了 83.1% 的准确率,而其前身 Opus 4.6 为 66.6%,但更重要的是,它“使许多标准评估指标达到饱和”,并在已发布的基准测试范围之外运行。这一质的飞跃代表了安全研究人员所描述的跨越了自主漏洞利用生成阈值,即 AI 系统从辅助人类分析师转向独立开发有效的攻击代码。

三个已披露的漏洞展示了该模型的推理深度。CVE-2026-XXXX 是一个存在了 27 年的 OpenBSD TCP SACK 处理缺陷,它通过精心构造的导致内核崩溃的数据包实现了远程拒绝服务——这一漏洞在世界上最注重安全的操作系统之一中经历了二十年的安全审计后依然幸存。一个存在了 16 年的 FFmpeg H.264 编解码器漏洞在 500 万次自动化测试执行中都未被发现,这也许是最引人注目的例子,因为受影响的代码路径已被执行了数百万次而未触发该 bug。CVE-2026-4747 是一个 FreeBSD NFS 远程代码执行漏洞,它需要一个分布在多个远程过程调用中的 20-gadget 返回导向编程(ROP)链,而发现和利用该漏洞的计算成本不足 50 美元。

财务承诺结构向合作伙伴分配了 1 亿美元的模型使用额度,并提供了 400 万美元的直接捐赠,其中 250 万美元通过 Linux Foundation 拨给 Alpha-Omega 和 Open Source Security Foundation,150 万美元拨给 Apache Software Foundation。预览期后的定价为每百万输入 token 25 美元,每百万输出 token 125 美元,是 Opus 4.6 的五倍。

Anthropic CEO Dario Amodei 在公司的官方声明中揭示了一个令人担忧的新兴属性:“我们并没有专门训练它去精通网络安全。我们训练它是为了让它精通代码,但作为精通代码的副作用,它在网络安全方面也很出色。”这一表态暗示,那些追求通用代码和推理能力提升的竞争实验室,也将通过常规的扩展路径获得类似的 AI 漏洞检测 能力。

为什么这很重要 —— AI 已跨越自主漏洞利用生成的门槛

Claude Mythos Preview 代表了定性的能力断层,而非对以往 AI 安全工具的渐进式改进。根据 Anthropic 的内部评估,在 Mythos Preview 发布前几周推出的 Opus 4.6 在独立漏洞利用生成任务中的成功率接近于零。Mythos Preview 展示了在复杂漏洞利用场景中的自主推理能力、跨多个系统的漏洞链攻击,以及在无需人工指导的情况下生成概念验证(PoC)的能力——这标志着从漏洞检测助手向自主攻击能力的根本转变。这种从模式识别到战术问题解决的转变,标志着 AI 网络安全工具真正成为需要访问控制的双重用途技术。

FreeBSD NFS 漏洞利用展示了超越传统自动化的推理深度。Mythos Preview 面临一个限制:304 字节的栈溢出缓冲区不足以容纳将 SSH 密钥写入磁盘所需的 1000 字节 ROP 链。该模型自主开发了一种方案,将漏洞利用拆分到 15 个独立的 NFS 请求中,每个请求向内核内存写入 32 字节,直到完整的 ROP 链驻留在目标地址空间中。这种多轮编排需要理解漏洞利用限制、跨多个网络事务的迭代问题解决能力,以及对最终利用目标的坚持——这些能力反映了真正的战术推理,而不仅仅是将漏洞模式与已知特征进行匹配。

在经过严格审计、以安全为核心的代码库中存在了 16 到 27 年的漏洞表明,传统防御已达到实际极限。OpenBSD 保持着全球最注重安全的操作系统的声誉,拥有持续的代码审计、积极的缓解措施部署以及安全优先于功能的文化。FFmpeg 漏洞在自动化测试中执行了 500 万次而未被发现,这表明传统的模糊测试(向程序输入随机数据以寻找崩溃)无法可靠地识别涉及定时、状态管理或复杂输入交互的微妙逻辑缺陷。

Anthropic 明确承认 Mythos 级别的能力是通用代码和推理改进的“下游结果”,这具有深远的竞争影响。Google DeepMind、OpenAI、Alibaba 以及其他追求类似架构方法和训练方法的尖端实验室,很可能通过其正常的开发轨迹达到相当的漏洞检测和漏洞利用生成能力。安全专家估计,在竞争对手模型达到或超过 Mythos Preview 的攻击能力之前,这代表了 6 到 12 个月的领先窗口期。

跨行业的影响远超科技公司。JPMorgan Chase 作为创始合作伙伴的加入,标志着金融服务基础设施也面临漏洞风险。通过基于 FFmpeg 的多媒体编解码器处理患者数据的医疗设备,现在面临着存在 16 年之久的远程可利用漏洞。管理电网、水处理设施和制造工厂的工业控制系统也依赖于受影响的代码库,包括 Linux 内核组件和嵌入在操作界面中的浏览器引擎。

传统的防御者与攻击者博弈论认为,漏洞发现需要昂贵的人类专业知识,这造成了成本不对称,有利于能够系统性投资于安全审计和渗透测试的防御者。以单次零日漏洞发现成本低于 50 美元的 AI 驱动模式打破了这一经济壁垒,一旦类似模型在 Anthropic 的受控联盟之外普及,可能会使高级利用能力平民化。这一转变将漏洞发现从受限于专家可用性的资源密集型人类活动,转变为仅受计算预算和模型访问权限限制的商品化计算任务。

正在评估是否集成AI 驱动的工程工作流进行安全测试的组织现在面临一个悖论:加速威胁检测的同种 AI 能力也在加速威胁的产生。安全团队必须评估其修复能力——包括开发人员可用性、测试基础设施、部署流水线、组织变更管理——是否能够比拥有类似 AI 工具的对手将其武器化更快地消化并处理 AI 生成的漏洞报告。

修复危机 —— 为什么更快地发现漏洞反而让系统更不安全

据熟悉 Project Glasswing 早期结果的消息人士透露,在 Anthropic 发布公告九天后,Claude Mythos Preview 发现的漏洞中只有不到 1% 得到了修复。这种修复赤字揭示了一个反直觉的悖论:高级 AI 漏洞检测非但没有加强防御,反而可能通过扩大防御者和攻击者都可能利用的“已知但未修复”缺陷的数量,暂时增加总体风险。软件行业运行在一个基本假设之上,即更早发现漏洞会产生防御优势,但当发现速度比修复能力高出几个数量级时,这一逻辑就会崩溃。

无论发现速度有多快,软件供应商都面临着结构性限制,限制了他们处理漏洞报告的速度。每个漏洞都需要:独立验证报告的缺陷是否真实存在且表现如描述一致;在受控测试环境中重现漏洞;进行根因分析以确定哪些代码更改引入了漏洞以及现有防御措施为何未能拦截;开发补丁以修复漏洞,且不引入新漏洞或破坏依赖功能;在多个配置和平台上进行测试;与需要提前通知的下游分销商和客户进行协调;以及通过更新机制进行部署,而企业环境的更新周期可能是每月或每季度。

根据项目统计,OpenBSD 团队通常每年通过人工审计审查约 500,000 行代码。Claude Mythos Preview 可以在数小时而非数月内分析同等规模的代码,这造成了时间上的错位:AI 在计算时间尺度上运行,而人类修复则在组织时间尺度上运行。这种速度差异意味着,单个 AI 模型在一周内生成的的高置信度漏洞报告,比一个典型的安全团队在全年全职投入下能够妥善调查和修复的还要多。

开源维护者的能力代表了最严重的瓶颈。FFmpeg 项目支撑着数十亿台设备的视频处理,其运行主要依靠志愿者开发者在工作间隙、周末或作为主业之外的副业进行贡献。运行从 Android 手机到 AWS 服务器等一切设备的 Linux kernel 依赖于约 4,000 名活跃贡献者,但安全关键子系统的维护往往落在管理影响数百万系统组件的个人开发者身上。当 Mythos Preview 发现一个需要跨多个子系统进行复杂修复的内核漏洞时,相关的维护者可能分布在不同地理位置、工作在不同时区、作为无偿劳动力维护代码,并且缺乏快速协调响应的组织基础设施。

协调披露过程——即安全研究人员私下向供应商报告漏洞,留出修补时间,然后公开披露细节——依赖于在修复窗口期间限制知晓每个缺陷的人数。Anthropic 的联盟结构意味着现在有数十个组织同时掌握着数千个未修补的漏洞。每一个增加的知晓漏洞的实体都会增加通过配置错误导致意外泄露、通过内部人员导致故意泄露或通过合作伙伴系统受损导致恶意泄露的可能性。安全专家将其描述为“秘密共享问题”:每一个必须协调秘密的额外参与方,都会使泄露概率呈指数级而非线性增长。

Microsoft 的 Patch Tuesday 周期说明了 AI 发现无法加速的组织约束。该公司在每个月的第二个星期二发布安全更新,允许企业客户围绕可预测的时间表规划测试和部署。关键的带外补丁仅针对正在被积极利用、构成即时广泛风险的零日漏洞发布。即使 Mythos Preview 在 4 月 8 日发现了一个严重的 Windows 漏洞,大多数组织最早也要到 5 月 13 日才能收到并部署补丁——这是一个为期五周的窗口期,漏洞处于“防御者已知但未修补”的状态,如果对手独立发现相同的缺陷,或通过供应链攻击、内部威胁或联盟伙伴安全故障获取信息,则代表着最大风险。

围绕漏洞发现的经济激励传统上假设发现者必须在向供应商负责任地披露,或出售给漏洞利用经纪商和漏洞市场之间做出选择。据报道,著名的漏洞利用收购公司 Zerodium 为某些 iOS 和 Android 零日漏洞链支付高达 250 万美元,而政府客户为实现远程访问加密通信的能力支付更高的溢价。当 AI 使漏洞发现成为成本低于 50 美元的计算商品时,经济学发生了转变:研究人员不再面临传统上将大多数发现导向负责任披露的发现成本障碍,因为投入的精力已不足以证明武器化的合理性。

Anthropic 向开源安全组织提供的 400 万美元承诺,按每个漏洞 3,000 至 5,000 美元的典型安全承包商费率(用于验证、补丁开发、测试和部署协调)计算,约代表 1,000 个漏洞的修复工作量。如果 Mythos Preview 已经发现了数千个缺陷,那么这笔资金承诺或许只能覆盖五分之一的修复成本——而且这一计算假设每一美元都直接资助修复开发,而非组织开销、流程改进或基础设施投资。

披露积压创造了一个“定时炸弹”场景,即独立开发出类似 AI 能力的对手将进入一个目标丰富的环境。Project Glasswing 合作伙伴知晓但尚未修复的每一个未修补漏洞,都代表了拥有同等 AI 工具的敌对势力的潜在攻击向量。如果中国、俄罗斯或犯罪集团的 AI 实验室在六个月后达到 Mythos 级别的能力,他们将进入一个成千上万个高价值目标仍对防御者已发现但无法快速修复的缺陷保持脆弱的环境。

组织正在构建从技术文档中提取的可搜索知识库安全响应工作流现在面临一个挑战:漏洞情报的数量已经超过了人力处理的极限。安全团队必须开发分拣系统,优先处理哪些由 AI 发现的漏洞需要立即关注,哪些则进入可能永远无法修复的积压列表,这实际上是在对自己的基础设施进行“战场分拣”。

对比与背景 —— 与以往安全工具发布的比较

Claude Mythos Preview 的受控部署正面临研究人员所称的ai dual use risks(AI 双重用途风险),这是网络安全应用固有的特性:同一个能够防御性地识别漏洞以进行补丁修复的模型,在无需进行重大技术修改的情况下,也能攻击性地识别漏洞以进行利用。Anthropic 决定暂不向公众发布,而是仅向联盟开放访问权限,这代表其承认没有任何技术防护措施能可靠地防止漏洞发现模型被重新用于攻击开发。

OpenAI 的 GPT-4 及其后续模型展示了日益复杂的代码分析和生成能力,而 Google DeepMind 最近在多步推理和工具使用方面的进展表明,竞争对手实验室也在追求类似的技术方向,这将催生出 Mythos 级别的安全能力。阿里巴巴的 Qwen 模型和其他中国前沿系统也显示出平行的发展轨迹。安全专家估计,在 12 到 18 个月内,多个实验室将拥有相当的漏洞发现能力,届时随着该能力扩散到任何单一协调机制之外,Anthropic 的受控部署策略将失去效力。

防御联盟结构面临着削弱长期可行性的可扩展性限制。Project Glasswing 的 50 多家组织对于初始部署来说是一个可控的协调小组,但全面的防御覆盖需要漏洞信息触达数千家软件供应商、数万个开源项目以及数百万个运行受影响系统的组织。信息共享圈的每一次扩大都会增加泄露、滥用或被攻破的风险。

双重用途技术治理的历史先例预示了 AI 安全工具的悲观结果。像 Metasploit 这样最初为渗透测试和安全研究设计的攻击性安全工具已经广泛扩散,现在无差别地服务于防御性红队和犯罪分子。Stuxnet 是一种针对伊朗核设施的复杂网络武器,它泄露给安全研究人员后,其技术被逆向工程并随后出现在犯罪恶意软件中。这些案例展示了一个一致的模式:双重用途技术的限制只能推迟但无法阻止其向拥有足够动力和资源的对手扩散。

接下来会发生什么 —— 未来 12 个月的可能情景

在接下来的 12 到 24 个月内,AI 驱动的漏洞发现轨迹可能会遵循几种路径之一,每种路径对软件安全和组织防御策略都有不同的影响。了解这些情景有助于组织评估是现在投资 AI 安全能力,还是等待市场成熟,亦或是将资源集中在替代性的防御方法上。

场景一:防御协同取得成功假设 Project Glasswing 及类似计划能够保持持久优势,即防御联盟识别和修复漏洞的速度快于对手发现漏洞的速度。这需要通过增加对开源安全的投资、自动化补丁生成与部署,以及能够适应 AI 发现规模的协同披露流程,来解决修复危机。成功指标包括补丁修复时间指标的下降、安全资金的持续增长以匹配 AI 的发现能力,以及没有发生利用 AI 发现的漏洞的大规模违规事件。Anthropic 对这一场景的押注取决于能否将 6 到 12 个月的领先窗口期转化为永久性的基础设施改进,从而改变防御者与攻击者之间的平衡。

实现这一结果需要解决初始联盟承诺之外的经济可持续性问题。1 亿美元的额度和 400 万美元的直接捐赠提供了种子资金,但无法为负责实际实施修复的数千名维护者提供持续的运营支持。可持续的防御协同需要科技公司的大规模持续投资(每年可能达数亿美元),或者从根本上重构关键开源基础设施获取资金和维护资源的方式。

场景二:扩散与对等假设随着多家 AI 实验室开发出类似的漏洞发现工具,防御者和攻击者都能获得相当的访问权限,攻防能力将达到平衡。在这种情况下,随着攻击成本下降,被活跃利用的零日漏洞数量将大幅增加,但防御能力也会成比例提高,从而导致更高强度的安全环境,而非防御体系的崩溃。组织将在“持续受损”的假设下运行,实施广泛的监控、快速响应能力和深度防御架构,这些架构假设边界已被突破,重点在于限制横向移动和数据外泄。

这种情况类似于高级持续性威胁(APT)活动的现状,即成熟的国家级行为体拥有的漏洞发现能力往往超过防御者的认知,但大多数组织仍未受到侵害,因为攻击需要超出商品化 AI 所能提供的针对性人力投入和运营投资。不同之处在于规模:不再是几十个拥有定制零日漏洞的国家级组织,而是可能有数千个犯罪团伙和数十万名个人攻击者获得 AI 生成的漏洞利用工具。安全行业将通过提高威胁检测、响应编排的自动化程度来适应,并可能通过 AI 驱动的防御工具实时识别漏洞利用尝试并自动部署缓解措施——形成一种 AI 对抗 AI 的安全范式。

最可能的结果是两种场景的元素并存,并因行业、地理位置和组织规模而异。资源充足、拥有专门安全团队和快速部署能力的科技公司可能会成功利用 AI 漏洞发现来改善防御态势。受监管行业的关键基础设施运营商可能会获得政府支持和强制性投资,从而具备足够的修复能力。缺乏安全专业知识的中小型组织可能会面临不断上升的受损率,因为其有限的资源无法跟上 AI 驱动的攻击节奏。

安全与工程负责人现在应该做什么

能够以前所未有的规模发现漏洞的 AI 模型的出现,为安全和工程负责人带来了紧迫的战略问题。AI 驱动的发现与人力规模的修复之间的差距代表了威胁格局的根本转变,需要重新思考防御能力和组织的优先级。

首先,现实地评估你当前的修复能力。在现有资源下,您的工程团队每月能妥善调查、修复、测试并部署多少个高危漏洞?请将该数字与 AI 发现的潜在漏洞量进行对比。如果您的组织每月只能修复 20 个漏洞,但 AI 工具可能会发现 200 个,那么您将面临结构性的积压,这是任何改进的发现工具都无法解决的。这种能力评估应当驱动有关安全工程人员编制、自动化测试基础设施以及部署流水线改进的投资决策。

其次,修复基础设施的优先级应高于发现能力。许多组织在漏洞扫描器、渗透测试和安全评估方面投入巨大,但在实际解决问题的系统上投入不足。AI 发现工具将大幅降低发现漏洞的成本,但并不会降低修复漏洞的成本。那些扩大自动化测试覆盖范围、实施持续部署流水线并建立回滚能力的组织,在修复 AI 发现的漏洞时,会比那些每个变更都需要人工测试和审批流程的组织快上数周。

第三,开发结合您特定背景的漏洞分级框架。通用的漏洞评分并未考虑受影响系统是否面向互联网、是否处理敏感数据或是否连接到关键基础设施。建立内部优先级方案,帮助安全团队快速决策哪些 AI 发现的结果值得立即响应,哪些可以进入标准补丁周期。当漏洞报告大量涌现时,快速将真正的关键问题与低优先级发现区分开来的能力,将决定响应过程是井然有序还是陷入不堪重负的积压。

第四,从集成角度而非单纯的功能角度评估 AI 安全工具。供应商会迅速发布结合前沿 AI 模型的漏洞发现产品,并经常展示令人印象深刻的新型漏洞发现演示。但组织的价值取决于工具是否能与现有工作流集成、是否提供可操作的修复建议,以及是否支持您的特定技术栈。一个在缺乏上下文的情况下发现 1,000 个漏洞的系统,比一个能提供自动化补丁建议和部署跟踪并发现 100 个漏洞的系统会带来更多的工作量。

最后,考虑能同时加速发现和修复的 AI 辅助工程工作流。能够实现快速漏洞发现的同种 AI 能力,也可以加速补丁开发、测试生成和文档编写。组织在实施AI 驱动的工程工具 那些在整个修复过程中(而不仅仅是初始发现阶段)为开发人员提供协助的工具,可能会发现它们能够将修复能力扩展到与发现量相匹配的水平。关键在于将 AI 视为整个安全工作流的放大器,而不仅仅是一个前端发现工具。

防御优势的窗口期确实存在,但随着竞争对手的模型达到类似的能力,这个窗口正在关闭。无论行业是实现了防御协同的成功,还是面临着扩散与对等,那些利用这段时期建立修复能力、实施自动化并开发 AI 辅助工作流的组织都将处于更有利的位置。那些只专注于改进发现而忽视修复基础设施的组织,可能会发现自己掌握的漏洞情报超出了其有效处理的能力——即知道问题的存在,却缺乏修复问题的能力。

对于希望评估 AI 驱动工具如何融入现有工作流而不产生积压负担的安全和工程团队,像 remio.ai/engineer 这样的平台提供了平衡发现与修复支持的方法。战略性的问题不在于 AI 是否会改变漏洞管理——它已经改变了——而在于你的组织能否建立起在这个新环境中有效运作的能力。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page