Wiz AI 漏洞扫描瞄准关键基础设施,但哪些问题得到修复仍由人工审查决定
Wiz 在报告发现 475 项高危或严重暴露后,已将 AI 漏洞扫描扩展至关键基础设施,尽管对在线公共系统进行测试本身存在风险。其新推出的 Scan for Good 计划涵盖公共服务、医院、交通运营商、非营利组织、开源软件及基础技术供应商。
该计划结合 Wiz Red Agent、内部研究系统、确定性检查,以及 Google DeepMind 的 Gemini 3.8 Flash Cyber 模型。Wiz 表示,在联系受影响组织前,人工研究人员会验证每一项具有实质影响的发现。
这一差别至关重要。该计划并非只是更快的漏洞扫描器,也不是获得无限制访问在线基础设施权限的自主机器人。它是在受控条件下检验 AI 能否发现真实攻击路径,同时由研究人员维护授权边界、证据质量和安全披露流程。
这对周期性安全测试构成压力,因为后者只会在预定时间间隔评估环境。面向互联网的系统可能在两次评估之间发生变化,而 AI 代理则可以持续检查新的端点和漏洞组合。
然而,发现更多漏洞并不必然带来更好的安全性。更棘手的问题在于授权、验证、修复能力,以及 Scan for Good 能否提供 Wiz 自身报告之外的证据。
Wiz AI 漏洞扫描从代码走向真实攻击路径
重要的变化不在于 AI 能识别可疑代码,而在于 Wiz 将其应用于在线、面向互联网环境中相互关联的漏洞。
Wiz 于 2026 年 9 月 24 日宣布推出 Scan for Good。根据该公司的计划公告,该计划会检查公共网站、API、应用程序及相关暴露资产。
其公布的重点领域包括能源、供水、交通、电信、政府服务、医疗保健、非营利组织、教育和开源项目。组织可申请免费评估和修复支持。
Wiz 将评估分为三个层级:确定性检查用于识别已定义的暴露条件;AI 驱动的动态应用安全测试检查运行中的应用程序;更深入的 AI 渗透测试则调查选定目标。
动态应用安全测试,即 DAST,会与正在运行的应用程序交互,以识别可被利用的行为。它不同于静态分析,后者主要在不执行应用程序的情况下检查源代码。
Wiz 表示,该系统监控着与 17,761 个组织关联域名相关的 326,891 个公共端点。其计划页面报告了 475 项高危或严重发现,但另一部分则列出了 17,461 个纳入范围的根域名。
这一差异值得关注。Wiz 并未说明这些数字是否采用了不同的定义、报告周期,或持续更新的数据集。读者应将其视为公司报告的仪表盘数据,而非经过独立审计的测量结果。
比总数更重要的是其底层机制。公共路由、被遗忘的凭证或缺失的权限检查,单独评估时可能看似影响有限。AI 系统可以持续调查这些信号如何与身份、数据库、内部服务和管理功能相连。
这将暴露发现转化为攻击路径分析。攻击路径是一连串漏洞,使入侵者能够从初始访问逐步接近敏感数据或运营控制权。
传统扫描器擅长根据已知特征和配置规则匹配资产。但它们往往难以处理应用逻辑、串联权限,以及只有通过交互才能显现的上下文。
Scan for Good 试图弥补这一缺口。该代理会探索行为、提出假设、测试获准操作,并寻找能够证明漏洞具有实质影响的证据。
Wiz 表示,它不会将模型生成的假设视为已确认漏洞。人工研究人员必须审查每一项潜在发现,并验证足够的影响程度,才能支持披露。
这一保障措施使该计划的公开定位有别于完全自主的渗透测试。AI 扩大了可搜索空间,而研究人员仍负责判断结果是否真实,以及验证应推进到何种程度。
该工作也获得了机构支持。Google DeepMind 提供 Gemini 模型,而 CISA 已与 Wiz 接洽,提供协作与指导。
CISA 代理主任 Nick Andersen 表示,防御性漏洞发现能够增强国家数字基础设施。他的声明也强调了合法、负责任地采用 AI。
因此,该计划连接了三方不同的职责:AI 系统以机器速度进行搜索,安全研究人员控制验证过程,基础设施运营方则决定如何修复其系统。
这种结构形成了核心张力。自动化可以让发现变得大量涌现,但安全测试和持久修复仍是稀缺的人类流程。
首批案例说明了关联暴露为何重要
Wiz 最有力的证据来自这样的案例:一个普通的公共漏洞据称打开了通往运营控制权或敏感记录的路径。
该公司尚未公布大多数受影响组织的名称,这限制了独立验证。它表示,匿名处理旨在保护已完成私下披露和修复的组织。
其案例仍说明了 Scan for Good 所瞄准的风险类型,也表明简单的漏洞数量无法反映潜在后果。
在一家公共铁路运营商中,Wiz 表示,泄露的生产数据库暴露了活跃的管理员会话。据称,这些会话可控制路线、时刻表、服务公告和管理员账户。
该问题并未被描述为针对专用铁路设备的恶意软件,而是运营链条中的一个暴露管理系统。
这一差异对关键基础设施采购方至关重要。若公共应用程序暴露了具有运营权限的凭证,攻击者未必需要罕见的工业漏洞利用手段。
Wiz 还报告了两起医院案例。其中一起涉及缺失的访问控制,导致员工信息以及医院范围移动警报渠道的控制权暴露。
第二起涉及公共预约网站上不安全的文件上传功能。Wiz 表示,该漏洞可实现服务器控制,并暴露患者标识信息、临床资料和同意签名。
另一起案例中,一项市政服务据称暴露了约 5,000 名老年居民的个人、健康和财务记录。Wiz 表示,它在未收集批量数据集的情况下确认了该风险。
该公司还描述了欧洲、中东或非洲某国家档案馆暴露的管理员密钥。据称,该密钥可对 880 万份文件进行读取、写入和删除。
这些案例呈现出共同模式:起点是面向公众的应用程序、凭证、上传路径或授权失败;潜在影响则延伸至用户合理认为应属内部的数据和功能。
科技行业案例遵循相同模式。Wiz 表示,某 AI 训练数据平台的访问控制缺失,暴露了专有客户数据和项目配置。
一家未具名网站与电商平台使用的共享支付服务,据称在多家商店中暴露了客户姓名、卡组织、到期日期和部分卡号。
Wiz 还报告发现了公开的软件交付工作流,其中暴露了内部问题跟踪器和生产营销数据库的凭证。该公司表示,这些凭证使专有信息和客户记录面临风险。
一起云基础设施案例延伸至软件供应链。嵌入公共网站代码的凭证,据称可控制支持某 AI 服务的 534 个生产容器镜像。
Wiz 表示,研究人员在未修改任何镜像的情况下证明了该凭证的权限范围。受影响公司随后控制了该凭证并解决了暴露问题。
这种克制至关重要。研究人员无需更改生产软件,即可证明某个令牌拥有危险的发布权限。
实时计划仪表盘还展示了七条攻击路径样例。Wiz 表示,每个案例均在 10 分钟内实现初始访问。
该公司报告称,权限升级耗时从两分钟到三小时四十七分钟不等。初始访问与完全攻陷是不同事件,因此两项指标都很重要。
这些案例包括远程代码执行、暴露密钥、镜像仓库控制、服务器端请求伪造、企业资源计划访问,以及对海事港口访问系统的控制。
服务器端请求伪造,即 SSRF,会诱使服务器向外部用户无法直接访问的目标发起请求。它可能成为从公共应用程序进入内部网络的桥梁。
这些都是严肃的主张,但公开证据仍具有选择性且经过匿名处理。外部研究人员无法在缺少身份信息、技术细节或受影响版本的情况下复现这些案例。
在披露流程完成前,这可以理解。但这也意味着,目前的证据支持的是一个前景可期的计划,而非 AI 胜过所有既有测试方法的广泛结论。
需要关注的数字不只是 475,而是受影响组织确认、修复并在后续测试后持续保持关闭状态的发现比例。
持续运行的 AI 对周期性安全测试施加压力
Scan for Good 挑战了这样一种假设:偶尔进行测试足以覆盖持续变化的软件。
传统渗透测试能够为组织提供宝贵的时间点评估。熟练的测试人员可以理解业务逻辑、协商模糊行为,并识别技术上有效的操作何时会造成运营风险。
然而,测试环境会在项目结束后立即开始变化。团队会部署新代码、轮换身份、暴露 API、调整云权限,并连接外部服务。
因此,周期性测试必须与持续变化竞争。AI 代理可以更频繁地重新检查公共攻击面,并调查比小型人工团队手动检查更多的组合。
Wiz 表示,Scan for Good 会持续绘制公共资产地图并监控端点。更深入的 AI 渗透测试仍按需进行,这表明该计划将持续的广度与选择性的深度结合起来。
这种混合方式比宣称单个自主代理可以完全取代专家测试人员更可信。确定性工具识别已知条件,AI 探索不确定路径,人类则验证具有实质影响的结果。
更广泛的行业已朝这一方向发展。由 DARPA 联合 ARPA-H 及其他合作伙伴组织、为期两年的AI Cyber Challenge,测试了针对关键基础设施所用开源软件的自主系统。
决赛入围系统必须在竞赛条件下发现漏洞并生成补丁。DARPA 随后将相关组件作为开源软件发布,以支持进一步的防御性开发。
那场竞赛主要聚焦于软件工件。Scan for Good 则将模型推向已部署的应用、身份系统、暴露的凭据和业务逻辑。
两者的差异在于运行环境。源代码或许会暴露一个存在漏洞的函数,但只有在线环境才能决定该函数是否可达,以及其周围具备何种权限。
Wiz 的 Red Agent 正是为调查这种环境而设计。该公司将其描述为一款由 AI 驱动的渗透测试工具,能够跨应用行为和相互关联的弱点进行推理。
这一计划还受益于 Wiz 在 Google 体系内的位置。该公司称,该项目采用了多款 Gemini 模型,尤其是 Gemini 3.8 Flash Cyber。
这种组合带来了明显的战略优势。Google DeepMind 提供专用模型能力,而 Wiz 则贡献安全工具、研究人员以及云安全工作流的接入能力。
但这也提高了外界预期。一家获得 Google 支持的安全公司,应当能够比研究资源有限的小型供应商发布更清晰的性能证据。
有价值的证据,应在相同的授权环境中比较 AI 辅助评估与人工主导测试。它应追踪已确认发现、误报、漏报漏洞、验证耗时、修复时间和复发情况。
单纯的漏洞总数无法回答这些问题。一个系统可能产出更多发现,却也给必须验证它们的人工团队带来更多工作。
Scan for Good 的早期报告强调了具有真实影响的案例。这比罗列理论弱点更有参考价值,但选择偏差仍然可能存在。
成功案例自然会成为公开样本。失败的调查、无效扫描、重复发现和漏报漏洞,很少会在项目发布公告中得到同等关注。
持续性 AI 的存在并不会让定期测试消失。相反,人工测试人员可能会更多转向授权设计、非常规业务逻辑、安全边界,以及对高后果发现的审查。
AI 系统会成为力量倍增器。它覆盖更广的攻击面,并能持续开展更长时间的调查;而人类则处理那些无法被简化为技术利用的问题情境。
对于基础设施运营方而言,这改变了采购时应提出的问题。采购方应询问服务如何验证发现、记录测试授权、限制代理行动、保护收集到的证据,以及验证修复效果。
他们还应询问代理无法测试什么。运营技术通常受到可用性和安全约束,使主动试验并不适宜。
一项对公共 Web 应用表现良好的评估,并不意味着它自动适用于工业控制器。持续发现仍必须尊重运行边界。
人工验证是安全边界,而非脚注
只有当人工审查能够控制测试深度、证据处理和披露流程时,Wiz AI 漏洞扫描才具有可信度。
AI 安全系统面临两种对称风险。误报会浪费稀缺的修复时间,而漏报则会让真实攻击路径未被发现。
在关键基础设施中,错误行动的代价可能更高。激进测试可能会扰乱医院服务、交通平台、公用事业门户或公共通信系统。
Wiz 表示,它只会在组织明确授权,或维护经授权的漏洞赏金计划或漏洞披露政策的情况下进行测试。这一条件应当约束每一次主动测试。
漏洞披露政策邀请研究人员在既定规则下报告安全问题,但不一定授权针对每个关联系统使用任何技术。
因此,范围与授权同样重要。研究人员必须知道允许测试的域名、端点、账户、数据和操作分别有哪些。
Wiz 表示,Scan for Good 会尽量减少与在线系统的交互,避免不必要地访问敏感信息,并设有明确的停止节点。它还承诺进行私下披露,并给予合理的修复时间。
这些原则是合理的。剩下的问题是,当自主代理在敏感环境中发现一条意外路径时,这些原则能否始终得到一致执行。
代理可能从一个已获授权的网站开始,随后遇到与原始范围之外系统相连的凭据。是否仍有必要且合法继续验证,需要由人类作出决定。
该公司表示,只有在获得授权的情况下才会进行更深入的测试。它还称,研究人员只验证足以确认现实风险的影响程度。
这种表述体现了负责任研究的一项核心规则:概念验证应在造成不必要伤害之前停止。很多时候,无需复制记录或修改生产数据,也可以证明访问能力。
人工审查也能限制幻觉。语言模型可能生成看似合理的利用叙述,却无法证明目标确实存在漏洞。
安全团队需要可复现的证据,包括请求、响应、受影响组件、权限,以及对影响的安全说明。模型自信的描述并不足够。
独立从业者也提出了同样的观点。SANS Institute 的一项人工验证分析指出,AI 可以加速发现过程,但专家仍需区分看似合理的理论与可实际利用的漏洞。
Wiz 似乎认识到这一局限。其研究人员会审查每一项潜在发现,并决定披露应如何推进。
不过,该项目的公开表述有时会在“关键暴露”与“漏洞”之间切换。这两个类别可能重叠,但并不完全相同。
漏洞通常描述软件或系统行为中的弱点。暴露则可能包括泄露的凭据、危险配置、过度权限,或可从公网访问的管理功能。
这一更宽泛的定义符合已报告的案例。但它也使透明分类变得重要,因为将多个类别合并后的总数,可能很难与其他研究项目比较。
严重性标签同样需要谨慎。关键级别评级应反映现实影响和可利用性,而不只是某个暴露组件在理论上拥有的权限。
该项目的仪表盘包括一份披露台账,其中列出发现类别、严重性、耗时、Token 使用量和预估模型成本。这是一个有用的起点,因为它让部分运行数据变得可见。
然而,公开视图仅展示了已报告发现中的一部分。它尚未提供独立验证率,也没有说明严重性判断如何经过审查。
Wiz 表示,计划在受影响组织修复系统后发布匿名化研究材料。这些材料应当阐明漏洞模式,以及 AI 对实际可利用性的贡献。
最终报告需要区分自主工作与人工干预。读者应了解代理何时发现路径、研究人员何时改变方向,以及确定性检查何时提供了决定性证据。
如果没有这种区分,“AI 发现了它”可能掩盖范围很广的工作流。这个说法可能意味着独立发现、AI 辅助探索,或由模型生成代码加速的传统研究。
每种工作流都可能具有价值。只是它们展现出不同程度的自主性,并需要不同的安全控制。
免费扫描有帮助,但修复能力仍是瓶颈
发现一项可利用弱点只是起点,尤其是对于本就缺乏安全人员和现代化预算的组织而言。
Scan for Good 将资源有限的组织列为优先对象,因为它们保护着会带来广泛公共影响的服务。这一使命直面网络安全中的真实失衡。
医院、市政机构、非营利组织和交通运营方,可能在安全团队规模很小的情况下成为有吸引力的攻击目标。它们的系统也可能包含遗留应用和第三方依赖项。
免费评估可以移除发现环节的一项障碍。但它不会自动提供安全修复所需的工程时间、采购权限、供应商配合或维护窗口。
据报道,医院上传案例需要保护应用路径、轮换凭据,并增加授权控制。这些行动涉及应用代码、身份管理和运营测试。
铁路案例则需要使现有会话失效,并保护管理访问。一项持久修复还可能要求审查数据库为何会暴露,以及这些会话为何拥有运营权限。
这种差异区分了修复与遏制。轮换凭据可以阻止即时访问,而架构性工作才能防止同类故障再次发生。
Wiz 表示,它会与受影响组织合作并支持修复。这一承诺很重要,因为没有实用指导的 AI 生成报告可能加重既有积压。
免费模式也带来选择问题。Wiz 可以优先处理那些遭利用后会造成重大伤害的申请,但需求可能超过可用研究人员的时间。
随着自动化发现规模扩大,人工验证会成为限制性资源。更多代理能够产生更多假设,但合格研究人员必须安全地确认其中最重要的发现。
披露能力是另一项约束。安全团队需要准确的联系渠道、快速确认、协调的技术审查,以及清晰的修复时间表。
匿名组织还可能依赖其无法直接修补的第三方软件。运营方可能需要供应商更新、补偿性控制措施,或临时服务限制。
关键基础设施会放大这些依赖关系。一个公共门户可能连接身份提供商、云平台、承包商、商业软件和运营数据库。
披露的问题可能位于最初收到报告的团队之外,跨越多层组织边界。确定责任归属所需时间,可能比确认可利用性更长。
因此,安全领导者应通过结果而不是扫描量来评估 Scan for Good。已确认修复、遏制时间、复发率和权限缩减,是更好的衡量指标。
Wiz 的案例称,受影响组织已修复所识别的问题。但该项目尚未公布修复时间或长期闭环的一致性指标。
后续评估将十分重要。访问控制补丁可能保护了一条路径,却让另一条路径仍暴露于相同的根本错误之下。
同样,轮换泄露凭据只有在团队从公开代码中移除该密钥、审查其访问历史,并收紧替代凭据权限时才真正有效。
最有用的 AI 系统应在整个生命周期中保留上下文。它应将原始证据、披露讨论、修复、复测以及针对类似资产的经验教训关联起来。
这一过程还带来了知识管理挑战。安全发现会通过报告、工单、代码变更、会议和供应商沟通而出现。
团队需要一份可检索的记录,说明代理观察到了什么、人类确认了什么,以及为何所选修复能够关闭该路径。结构化的工程知识库可以支持这项工作,但不能取代安全控制。
更广泛的教训很直接。AI 可以降低发现问题的成本,但组织仍需承担后续决策、修复和安全运营的成本。
Wiz 接下来必须证明什么
三个信号将决定 Scan for Good 是成为持久的防御基础设施,还是仅仅停留在一系列令人印象深刻的发布案例。
第一个信号是详细的修复后研究。Wiz 已承诺发布匿名报告,说明漏洞模式、实际可利用性以及 AI 所发挥的作用。
这些报告应提供足够的技术证据,让防御人员能够识别类似弱点。报告还应记录人工研究人员在何处介入,以及测试为何停止。
如果 Wiz 发布具备可复现性的模式,并明确自主性边界,其核心主张将更具说服力。如果披露仍仅限于总量和戏剧性的结果,独立评估仍将十分困难。
第二个信号是一套持续一致的修复台账。该项目已列出发现类别和部分运营指标,但采购方需要结果数据。
有价值的字段包括确认状态、披露所需时间、遏制所需时间、完成验证修复所需时间、复发情况以及受影响资产类别。汇总报告能够在保护身份信息的同时展示成效。
发现数量持续上升而修复缓慢,将削弱该项目的防御价值。更快完成经过验证的闭环,则将支持 Wiz 的观点:AI 能够改善真实的安全结果。
第三个信号是同行和公共机构的反应。其他安全服务商正在构建 AI 辅助测试系统,而公共项目也在支持自动化漏洞发现。
竞争将围绕经验证的攻击路径、安全运营控制措施和修复质量展开。仅靠模型品牌无法决定哪种方法能够赢得信任。
CISA 的参与为 Scan for Good 提供了机构层面的可信度,但公共部门的参与并不等同于对每一项发现或流程的认证。机构和运营方仍应自行开展尽职调查。
该倡议还可能影响人们对漏洞披露政策的预期。组织可能需要提供机器可读的测试范围、明确的代理行为规则、证据保留限制和紧急联系人。
这将产生具有意义的次级影响。现有政策大多是为开展离散调查的人类研究人员制定的,而不是为持续跨越大量资产运行的代理而设计。
双重用途问题仍将存在。帮助防御者串联暴露点的技术,同样也可能帮助攻击者更快地行动。
Wiz 的应对方式是让经过筛选的防御者获得更强模型的访问权限,采用授权机制,要求人工验证,并进行私下披露。这些控制措施能够降低风险,但无法彻底消除风险。
更广泛的政策挑战在于,让防御性采用始终领先于进攻性使用。这需要快速修复、共享模式、审慎披露,以及对自动化行动的明确问责。
Wiz AI 漏洞扫描已经产生了一些具有重大影响的报告案例。铁路管理系统、医院应用、公共档案、支付服务和软件注册表,并非抽象的测试目标。
不过,该倡议的长期价值将取决于发现速度之外的证据。它必须证明发现结果准确、测试始终受控、运营方能够修复问题,并且同样的暴露不会再次出现。
安全负责人应通过梳理公开资产、收紧披露政策,以及明确授权 AI 测试的边界来应对。他们还应演练高影响发现如何从受理流转至经过验证的闭环修复。
在下一位代理到来前,先问一个实际问题:你的组织能否识别责任人、保全证据、授权安全验证,并迅速修复一条串联式暴露路径?如果答案并不明确,当务之急不是购买更多扫描工具,而是建立一套流程,将 AI 生成的信号转化为受控且持久的安全改进。



