Amazon Google 安全攻势遭遇 AI 漏洞现实检验
Amazon Google 的安全合作伙伴加入了一场以严峻警告为核心的 AI 防御竞赛,但研究显示,仅有 1.3% 的漏洞在现实世界中遭到利用。
这一数字来自 VulnCheck 对 1,061 个公开归因于 AI 辅助发现的漏洞所做的分析。研究人员将这些发现与在受控环境之外观察到的攻击证据进行了比对。
这一结果挑战了围绕 Anthropic 的 Project Glasswing 展开的 Amazon Google 安全行动背后的一项核心假设。AI 能够快速发现缺陷,但发现漏洞并不会自动形成有效攻击。
Anthropic 仍提出了一个足以引起紧迫感的严肃案例。其 Claude Mythos Preview 系统在扫描开源项目时识别出 23,019 个漏洞候选项。该公司估计,其中 6,202 个应被评为高危或严重级别。
这些庞大的总量塑造了人们对 AI 生成漏洞利用即将泛滥的预测。然而,目前的公开记录呈现的是另一种转变。
AI 正以前所未有的速度增加潜在安全发现,超过了人工验证、披露、修补和排序优先级的能力。攻击者仍然要面对更困难的工作:将技术弱点转化为可靠的行动。
这一区别改变了防御者应关注的重点。眼下的问题不只是 AI 发现了更多漏洞,而是安全团队必须从不断增长的机器生成证据中区分出真正重要的风险暴露。
利用数据改变了故事走向
AI 辅助发现增加了漏洞数量,却没有提高已观测到的利用率。
VulnCheck 审查了归因于 Project Glasswing 和 Berkeley Vulnerability Research Initiative 的 1,061 个漏洞,随后将其与自身的 Known Exploited Vulnerabilities 数据库进行了比较。
该公司发现,14 个漏洞已确认在现实世界中遭到利用。根据已发布的利用分析,这相当于审查样本的 1.3%。
VulnCheck 表示,这一比例与其更广泛漏洞数据集中的比例几乎一致。因此,由 AI 发现的缺陷似乎并不比传统方式发现的缺陷更容易遭到利用。
这一比较很重要,因为漏洞发现和漏洞利用衡量的是不同能力。扫描器识别的是可能违反预期安全边界的代码行为。
而可用的漏洞利用必须在实际条件下触发这一行为。它通常需要绕过缓解措施、触及有价值的系统,并在不同目标配置下稳定运行。
现实中的攻击者还会评估经济性。他们会考虑访问条件、开发时间、暴露风险、可利用目标,以及可能获得的数据或控制权价值。
许多缺陷无法通过这项检验。有些需要本地访问、特殊配置,或攻击者本就必须拥有的权限。另一些只会导致崩溃,却无法带来有用的控制能力。
一个漏洞即便在技术上成立,也可能几乎没有实际行动价值。仅凭严重性评分无法说明犯罪分子是否会投入资源将其武器化。
Project Glasswing 让这一区别尤为重要。Anthropic 表示,Mythos Preview 在超过 1,000 个开源项目中生成了 23,019 个候选项。
在 VulnCheck 审查的公开数据中,只有 126 项 Project Glasswing 发现已成为公开的 Common Vulnerabilities and Exposures 记录。其中仅一项确认已在野外遭到利用。
这一更窄的比较并不能证明其余候选项无害。协调披露会有意将部分细节保持私密,直到软件维护者能够发布补丁。
但它表明,候选项总数不能替代经验证的漏洞结果。当然,它们更无法衡量有多少发现已经成为可靠的进攻工具。
VulnCheck 研究员 Patrick Garrity 将当前影响描述为真实但有限。他认为,AI 发现的漏洞并不天然比传统发现的漏洞更容易利用。
这些发现还揭示了一个重要的分母问题。Project Glasswing 的候选项总数包含中低严重性问题,也包含最高评级的发现。
公开 CVE 数量代表的是更晚阶段。这些记录通常需要验证、协调,以及足够清晰的技术信息来描述受影响的产品和弱点。
已知漏洞利用则提出了更高标准:需要可信证据证明有人确实使用该漏洞攻击了真实目标。
如果不加限定地比较这些阶段,就会得出误导性结论。庞大的候选池可以与极少的利用数量并存,因为每个阶段筛选的是不同证据。
因此,1.3% 的比例是一项现实检验,而非解除警报的信号。它说明 AI 已经改变了漏洞发现的供给量,但尚未改变其平均实际行动价值。
Amazon Google 安全合作伙伴仍有理由迅速行动
较低的已观测利用率,并未消除 Amazon Google 安全团队和其他 Project Glasswing 合作伙伴面临的风险。
Anthropic 推出 Project Glasswing,旨在让选定的防御者提前获得 Claude Mythos Preview。首批参与者包括 Amazon Web Services、Google、Apple、Microsoft、Cisco、Nvidia 及其他基础设施提供商。
该项目最初约有 50 个合作伙伴。Anthropic 后来表示,正将访问权限扩展至 15 多个国家的约 150 家新增组织。
参与者可利用 Mythos Preview 检查内部和开源代码,早于同类能力被广泛普及。Anthropic 将此称为不对称的防御优势。
该公司的担忧很直接:AI 系统能够检查的代码路径,远多于人工研究团队能够手动审查的数量。
未来的攻击者可以在不遵守协调披露规则的情况下运用同等规模的能力。他们还可以把扫描重点集中在具有明确商业目标的互联网暴露软件上。
当前利用率描述的是公开证据,而非所有私下活动。犯罪团伙并不会可靠地公布成功的零日攻击行动,或公开其技术方法。
因此,已确认的利用数量会低估部分活动。当发现仍在修复期间保持机密时,不确定性会进一步增大。
近期事件显示,AI 辅助的进攻性工作已不再局限于基准测试。Google 报告称,其曾阻止犯罪分子,他们显然在识别一个未知软件漏洞时使用了 AI 模型。
由于防御者及时干预,这一行动没有造成已报告的损失。但该事件证明,犯罪行为者正在真实的漏洞工作流中测试 AI。
实验与可规模化利用之间的差距仍然很大。一次被发现的行动并不能证明攻击者可以自动化整个过程。
但防御者不能等到利用统计数据上升后才开始准备。公开确认通常发生在入侵、取证调查或供应商披露之后。
Amazon 从另一个运营角度处理同一问题。其 RuleForge 系统会将漏洞信息和概念验证代码转换为检测规则。
Amazon 表示,该系统将规则生成效率提升了 336%。另一个评估器在保持真阳性检测的同时,将误报减少了 67%。
这些说法来自 Amazon 自己的 RuleForge results,而非独立基准测试。尽管如此,这一架构展示了防御者如何将 AI 用于发现之外的环节。
RuleForge 将工作分配给专门负责摄取、生成、评估和验证的代理。人工审查人员仍负责在部署前批准规则。
这一工作流瞄准的是公开漏洞与实际防御之间缺失的中间环节。发现漏洞并不会自动产生遥测数据、检测能力、补丁或部署指导。
Google 正通过 CodeMender 和 Gemini 3.5 Flash Cyber 推动更快的发现和修复。该专用模型旨在跨大型代码库发现、验证并修补漏洞。
Google 表示,该模型在其 V8 评估中发现了 55 个独特且经确认的问题。在所报告的设置下,主线 Gemini 发现了 47 个,Claude Opus 4.6 发现了 36 个。
提供商基准测试需要谨慎解读,因为模型配置和安全策略各不相同。Google 还指出,部分竞争对手结果为自行报告。
即便如此,方向已经很明确。大型科技公司正在构建将扫描与验证、修复连接起来的系统。
1.3% 的利用率并未否定这些投入。它将投入理由从计算漏洞数量,转向缩短可信证据出现到防御措施部署之间的时间。
发现成本低廉,但利用仍是一条链条
核心变化在于,AI 削弱了发现瓶颈,却没有消除利用瓶颈。
现代代码库包含数百万行代码、外部依赖、旧接口和未文档化的假设。AI 代理能够拆分这一搜索空间,并并行测试大量假设。
Anthropic 报告称,独立安全公司评估了其开源扫描中 1,752 个高危或严重候选项。其中 1,587 个是有效的真阳性。
这一 90.6% 的验证率表明,在经过审查的子集中,该系统产生的不只是随机噪声。审查人员确认其中 1,094 个属于高危或严重级别。
这些结果支持 Anthropic 关于发现能力的说法。但它们并不能证明每个尚未审查的候选项都会以相同的比例通过专家分析。
它们也无法证明经确认的缺陷对攻击者同样有用。漏洞利用依赖于一条更长、更难预测的链条。
首先,攻击者必须理解存在漏洞的组件,并确定可触及的目标是否使用它。当受影响的代码路径仍处于禁用状态时,库漏洞几乎没有价值。
其次,攻击者必须能够控制所需输入。有些漏洞可通过公开请求触及,另一些则需要身份验证或本地执行。
第三,利用必须产生有价值的效果。使服务崩溃,与执行代码、窃取凭据或跨越信任边界有着根本差异。
第四,漏洞利用必须能够容忍软件版本和部署设置之间的差异。不稳定的技术可能在带来有用访问权限之前就暴露攻击者。
最后,攻击者必须将漏洞利用整合进一次行动。这需要基础设施、目标选择、持久化、权限提升,以及清除证据的方法。
AI 可以协助每个阶段,但协助并不等同于自主。模型可能生成看似合理的代码,却会在环境细节变化时失效。
模型在置信度校准方面也存在困难。Amazon 发现,其规则生成模型几乎对每个候选项都给出正面评价,直到另一个独立裁判评估输出结果。
同样的倾向也会影响漏洞研究。模型可能描述一条令人担忧的路径,却忽略了一个使该路径在生产环境中不可能成立的条件。
Anthropic 试图通过独立验证来解决这一弱点。其报告的真阳性率表明,经过精心设计的工具和专家审查能够控制大量噪声。
然而,这种审查带来了新的能力瓶颈。每一项重大发现都需要复现、影响分析、与维护者沟通、修复以及部署测试。
Anthropic 表示,一个高危或严重级别的 Mythos 发现平均需要两周才能完成修补。一些维护者要求该公司放缓披露节奏,因为他们缺乏足够的审查能力。
安全负担正是在此处发生转移。机器发现增加了待处理队列,但人类组织仍决定着这些问题将以多快速度转化为更安全的软件。
开源项目面临着最尖锐的不匹配。被广泛使用的软件包往往依赖于小型团队,无法处理数百份复杂的私密报告。
企业团队对自己的代码仓库拥有更好的控制力。Anthropic 表示,Claude Security 用户在产品推出的前三周内修补了超过 2,100 个漏洞。
这一说法表明,所有权和部署访问权限可以缩短修复周期。但它并未说明这些发现的严重程度,也未说明有多少拟议补丁需要修改。
因此,这一机制更有利于拥有成熟工程流程的组织。当团队已经了解自身资产、负责人、依赖关系和部署路径时,AI 才能加速工作。
资产清单薄弱的组织会收到更多发现,却不知道哪些系统真正重要。结果可能是积压工作更多,对真实威胁的响应反而更慢。
真正的风险是分诊与修补能力不足
当发现数量的增长速度超过验证和修复能力时,AI 漏洞发现就会变得危险。
安全项目本就需要管理数千条扫描结果、依赖项警报、配置警告和渗透测试发现。AI 又增加了一个规模更大、校准程度不确定的来源。
若团队将每一项机器生成的发现都视为紧急事项,审查人员将不堪重负。若团队因噪声而忽视 AI 输出,则可能错过罕见但影响重大的攻击路径。
这造成了一个精度问题。防御者需要识别出同时具备技术严重性、可达资产、攻击者兴趣和可信利用证据的那一小部分问题。
传统严重性评分只覆盖了这一决策的一部分。隔离测试系统中的严重漏洞,其即时危险性可能低于暴露在外的网关中评级较低的漏洞。
威胁情报可提供有关活跃扫描、公开漏洞利用代码、犯罪讨论和已观测攻击的证据。资产上下文则能显示易受攻击组件是否存在于有价值的服务之中。
最强的工作流会结合这些信号。它会去重重叠发现、验证可达性,并在将任务交给工程师前明确责任归属。
Google 的基于风险的漏洞蓝图建议结合漏洞严重性、资产重要性和当前威胁证据。
这一模型解决了原始发现数量的核心弱点。它关注的是哪项发现最应优先处理,而不是奖励生成最长清单的工具。
VulnCheck 的数据进一步印证了这种方法。2026 年上半年,该公司在更广泛的软件市场中识别出 495 个已知遭利用的漏洞。
内容管理系统约占其中三分之一。网络边缘设备也仍是常见目标。
这些产品吸引攻击者,是因为它们可被访问、部署广泛,并且对获得初始访问权限很有价值。它们的利用收益通常高于冷门的内部组件。
安全负责人不应将 AI 结果理解为可以推迟修补的许可。相反,他们应区分三条独立的处理队列。
第一条队列涵盖已确认正遭活跃利用的问题。这些漏洞需要立即遏制、检测和修复,因为威胁已经存在。
第二条队列涵盖经过验证、可达且具有可信利用路径的漏洞。即使尚未观察到攻击,团队也应迅速修补。
第三条队列涵盖未经验证的候选项,或位于不可达资产上的发现。这些仍需审查,但不应挤占有证据支持的威胁的处理资源。
这一结构可防止发现激增将所有问题压缩到同一个严重性等级中。它也为维护者协商披露时间表提供了可辩护的依据。
低利用比例背后还存在另一种风险。即使百分比保持稳定,绝对数量也可能大幅增加。
如果 AI 产生十倍数量的有效漏洞,即使利用率不变,被利用的案例也会增加十倍。百分比可能掩盖这种规模效应。
所审阅的数据还反映了一个早期阶段。攻击者需要时间采用新工具、构建可靠的测试框架,并将其整合到侦察系统中。
Anthropic 最强大的网络安全模型仍限制公众访问。这一限制降低了当前利用数据对大规模滥用的揭示能力。
Anthropic 承认,它尚未建立足以支持 Mythos 普遍访问的安全措施。该公司正在扩大受控防御项目的同时限制分发。
这种做法降低了即时暴露风险,但也带来了衡量挑战。受限模型无法揭示普通犯罪团伙在拥有同等能力时会如何行动。
因此,怀疑性的结论必须保持克制。现有证据并未显示,AI 发现的漏洞天生更容易遭到利用。
它也无法证明未来系统会维持同样的比例,更无法保证所有现有利用活动都已被发现或公开归因。
最有力的政策应对既不是恐慌,也不是自满,而是在先进网络安全模型的访问范围扩大前,建立能够规模化的验证和修补系统。
Google 的专用模型抬高了能力上限
Google 最新的网络安全模型表明,当前令人安心的利用率不能作为永久预测。
Gemini 3.5 Flash Cyber 是一款经过微调的轻量级模型,专用于漏洞发现、验证和补丁生成。Google 计划通过 CodeMender 向政府和可信合作伙伴提供有限访问。
该模型的设计强调反复进行、成本较低的探索,而不是依赖一次对更大通用模型的调用。多个智能体会检查代码路径,再汇总各自的发现。
Google 表示,这种方法适用于搜索空间超出单次分析能力的复杂代码仓库。它也支持在提交和发布期间进行频繁扫描。
该公司报告了一项更引人注目的内部测试。Gemini 3.5 Flash Cyber 检查了 Google Cloud 系统,并在两小时内发现了公共 API 中的远程代码执行漏洞。
Google 表示,该模型还在一项敏感的生产服务中发现了内存损坏问题。随后,它在测试条件下生成了完全可靠的漏洞利用代码。
根据 Google 的网络安全模型结果,该漏洞利用绕过了地址空间布局随机化和写入异或执行保护。
地址空间布局随机化会改变内存位置,以增加攻击难度。写入异或执行则防止内存同时具备可写和可执行属性。
绕过这两项控制措施,需要的不仅是识别可疑源代码。这使系统更接近困难的验证和漏洞利用开发阶段。
这一结果仍是公司在受控防御项目内部报告的演示。Google 尚未披露受影响系统,也未提供足以供外部复现的细节。
尽管如此,它削弱了“利用能力仍超出现有模型范围”的任何宽慰性说法。更准确的结论是,利用能力以不均衡且受限的方式存在。
Google 还拥有非同寻常的优势。其安全团队可以访问内部代码、生产环境上下文、历史模糊测试结果和详细的漏洞数据库。
这些信息让智能体获得比外部攻击者更扎实的依据,也帮助该公司根据真实系统验证模型输出。
攻击者则拥有不同的优势。他们可以专注于暴露在外的产品、复用泄露的源代码、分析补丁,并接受更高的失败率。
一场进攻行动并不需要理解每一项发现。它只需要找到一条针对足够多高价值目标的可靠路径。
这种不对称性解释了为何 Amazon 和 Google 的安全工作在 VulnCheck 的发现之下仍然具有相关性。业界正在为能力扩散做准备,而不只是衡量当前攻击。
Project Glasswing 为选定组织争取时间,以便在 Mythos 级系统普遍可用前加固关键软件。Google 也采取了类似的有限发布方式。
然而,受控访问不能成为全部战略。开放模型、专用工具和改进的智能体框架将持续缩小能力差距。
因此,防御者需要能够持续降低暴露面的系统。与其在易受攻击的代码进入生产环境后再增加一条警报,不如在发布前扫描更有价值。
自动补丁建议可以缩短修复时间,但对于影响身份验证、内存处理、密码学和信任边界的变更,人类仍必须进行审查。
成功的防御架构会将模型发现与可复现证据连接起来,再将证据与经过测试的补丁、部署责任归属和攻击遥测相连接。
这比计算漏洞数量要求更高,但它也是与可衡量安全结果联系最紧密的标准。
三个信号将显示平衡是否正在改变
下一阶段将通过利用证据、修复吞吐量和专用网络安全模型的访问情况来衡量。
第一个信号是,被归因于 AI 的漏洞进入已知利用目录的比例。VulnCheck 当前 1.3% 的结果提供了一个有用的早期基线。
若该比例持续高于更广泛漏洞的利用率,将强化 AI 会产生异常吸引人的目标这一观点。若比例保持稳定,则支持发现量增加的解释。
归因质量在这里至关重要。研究人员必须区分由 AI 发现的漏洞,与人类或传统扫描器发现弱点后、再由 AI 开发利用代码的情况。
这代表两种不同的能力,并具有不同的政策含义。不佳的标注可能使争论的任一方看起来都比证据所允许的更有说服力。
第二个信号是 Project Glasswing 的公开修复台账。读者应关注有多少候选项最终转化为已验证的公告、补丁、CVE 或被关闭的误报。
Anthropic 的 Glasswing 更新报告称,经审查的子集显示出较强的验证结果。然而,更广泛的候选积压量仍远高于其公开 CVE 数量。
更快的补丁速度将表明,披露和修复系统正在追上发现能力。不断扩大的积压则将证实,人类能力已成为主要的安全约束。
补丁质量与数量同样重要。仓促修复可能引入回归问题、留下替代攻击路径,或披露足够的信息让攻击者重建漏洞利用。
因此,研究人员应追踪部署和验证,而不只是补丁发布。只有维护者发布修复、运营人员完成安装后,补丁才能保护用户。
第三个信号是 Mythos、Gemini Flash Cyber 或类似专业模型的更广泛开放。Anthropic 和 Google 目前仍限制其最敏感能力的使用范围。
更广泛的可用性将首次有意义地检验:先进网络安全智能体在更大规模用户群体中的行为表现。与此同时,这也会加大对安全防护和身份验证机制的压力。
如果访问范围扩大,但已确认的利用事件并未增加,那么当前的现实检验就会更有说服力。若利用事件迅速上升,那么如今较低的发生率就会被视为采用滞后的结果。
Amazon、Google 及其合作伙伴也应公布更多以结果为导向的衡量指标。有用的指标包括已验证的发现、修复所需时间、已部署的修复措施,以及被阻止的攻击数量。
候选发现总量对于评估搜索覆盖面依然有价值,但不足以衡量一项安全计划是否降低了实际风险。
对于开发者而言,关键在于要求 AI 安全工具提供可复现的证据。一项发现应包含受影响的代码、可被触发的条件、影响范围,以及可验证的修复方案。
对于企业买家而言,优先事项是与现有资产和工作流程的集成。一个缺乏归属或上下文、却只会产生更多告警的工具,反而可能增加运营风险。
对于开源维护者而言,漏洞披露节奏和有资金支持的审查能力值得获得更多关注。AI 系统如今生成工作的速度,已经远超志愿者社区的承载能力。
Amazon 与 Google 的安全联盟正在应对一种可信的未来威胁。然而,现有证据表明,眼下的危机是防御流程负荷过重,而非自动化的大规模利用。
这一差异应当影响支出、产品设计和政策制定。团队需要的是更少未经排序的告警,以及更多从发现到修复的已验证路径。
未来几个月,请关注利用率、修复积压情况以及专业模型的访问范围。这些信号结合起来,将揭示 AI 是否改变了攻击经济学,还是主要改变了发现量。
对每个安全团队来说,实际问题很简单:在更庞大的待处理队列将关键问题淹没之前,你的组织能否验证并修复最具影响力的发现?



