靠“隐蔽性”保障 AI 安全的时代已结束,防御者面临更棘手的问题
2026 年,随着智能体发现被忽视的漏洞、加速漏洞利用开发,并触及主要依赖专业复杂性保护的系统,依靠隐蔽性的 AI 安全模式宣告瓦解。
直接证据涵盖被遗忘的 Windows 组件、被广泛审查的开源库,以及运行关键服务的工业控制器。这些系统在技术上各不相同,但它们共享一种隐性防御:攻击者需要罕见的专业知识、极大的耐心,或足够的经济动机,才会投入研究。
AI 漏洞发现改变了这一计算方式。模型能够理解陌生代码、解释专有协议、生成测试工具,并自动执行重复性的侦察工作。结果并非诞生了一项新的安全原则,而是消除了让组织得以拖延遵循旧原则的阻力。
这给防御者带来了艰难的逆转。发现弱点正变得更便宜、更快速,而验证补丁、协调披露、测试运营系统,以及改变存在缺陷的开发实践,仍然顽固地属于人类流程。
问题不再是隐藏的弱点是否会暴露,而是防御者能否在自动化发现将每个被忽视的系统都变成经济可行的目标之前,修复滋生这些弱点的条件。
依靠隐蔽性的 AI 安全失去了经济护城河
AI 并未推翻依靠隐蔽性的安全理念。它消除了让组织能够假装隐蔽性有效的人才短缺。
依靠隐蔽性的安全,是指一种依赖于架构、接口或弱点难以被发现的设计或运营假设。它从未被视为可靠的主要控制措施。然而,当调查陌生系统需要稀缺的专家和数周的集中工作时,隐蔽性仍能提供实际保护。
这种保护如同一道经济护城河。某个存在漏洞的组件可能始终未被触及,因为攻击者通过攻击熟悉的软件能获得更高收益。专有协议可能因文档有限而劝退外部人员。旧的子系统也可能逃过审查,因为几乎没有研究人员还记得它的存在。
9 月 13 日发布的原始安全分析显示,这种平衡已经发生改变。供应商和独立研究人员如今正使用 AI 智能体审查冷门、老旧以及经过深度审查的软件。攻击者则利用相关能力分析修复措施并开发漏洞利用程序。
FBI 网络部门助理主任 Brett Leatherman 表示,模型在社区已审查十年的开源组件中发现了重大漏洞。据称,其中部分库运行在相当大比例的 Web 基础设施中。
这并不意味着 AI 能独立理解每一个系统,或可靠地产出可用的漏洞利用程序。它意味着调查人员无需从零开始,就能进入陌生领域。模型可以总结代码、翻译文档、识别可能的信任边界,并生成用于验证假设的脚本。
智能体式 AI 系统将这种协助延伸至一连串任务。智能体可以检查文件、运行工具、审阅结果、调整方法,并持续推进直至达成既定目标。人类操作人员仍需设定目标并提供基础设施,但机器吸收了大量重复性工作。
这正是 AI 漏洞发现同时对闭源和开源软件施压的原因。公开代码使直接分析更容易,但闭源软件仍会暴露二进制文件、固件、网络行为、文档、补丁和配置工件。模型能够以改变逆向工程经济性的速度关联这些碎片。
领导 Trend Micro Zero Day Initiative 的 Dustin Childs 指出了 Microsoft 创纪录的 9 月补丁发布中涉及的被遗忘技术。受影响组件包括 Telnet 客户端、Windows RNDIS、NFS Portmapper 和链路层拓扑发现。
它们的年代很重要,因为这说明了旧有的交易:当很少有人有兴趣或具备背景去审查它们时,遗留组件可以在缺乏持续专家关注的情况下存续。AI 为好奇的研究人员和攻击者提供了一条低成本路径,进入这些恰恰被忽视的领域。
隐蔽性仍会增加不便。未记录的协议可能拖慢智能体,专有设备可能限制可用证据。然而,不便并不等同于授权、隔离、身份验证或内存安全。它不能被信赖为阻止持续的自动化调查。
因此,护城河已从隐藏的知识转向可验证的控制措施。系统需要强健的身份边界、最小化暴露面、安全默认设置、经过测试的分段机制,以及即使其工作原理被了解后仍保持安全的设计。
这正是 Kerckhoffs 原则这一既有安全原则在密码学之外的应用。除了得到妥善管理的秘密,例如加密密钥之外,即使对手理解系统如何运作,系统也应保持安全。
AI 使这一原则在运营层面变得紧迫。系统行为不再需要通过整齐发布的文档才能被理解。如今,只要存在足够的零散证据,智能体就能获得一张可用的地图。
第一个压力点是被遗忘的软件
承受最大压力的系统并不总是最新或最有价值的系统,而是那些其安全性依赖于无人细查的系统。
传统漏洞研究包含多个成本高昂的阶段。研究人员必须了解代码库、复现其运行环境、理解其假设,并将有意义的弱点与无害异常区分开来。这些步骤所需时间往往超过找到可疑代码本身。
AI 可以压缩其中多个环节。它可以编写测试工具、追踪数据流、比较相关实现,并解释陌生的编程模式。当任务变得重复时,它还能持续扫描,而这很重要,因为人类注意力有限。
这并不保证能产出有价值的结果。模型会产生误报、误解上下文,有时还会编造技术解释。尽管如此,低成本协助使操作人员能够测试更多目标,并在不消耗同等专家时间的情况下放弃没有产出的路径。
更广泛的搜索改变了哪些软件具有吸引力。旧库、小众企业产品、设备固件和文档不足的内部服务的维护者,已不能再假设攻击者会将注意力放在其他地方。它们享有的隐蔽性折价正在缩小。
同样的压力也适用于等待部署的已知漏洞。一旦供应商发布修复,攻击者便可比较已修补和未修补的版本。这个被称为补丁差分的过程,会揭示哪些代码发生变化,并帮助调查人员重建底层弱点。
AI 通过解读变更、提出触发输入并生成测试代码,加快了补丁差分速度。Anthropic 对快速漏洞利用开发的研究考察了模型如何分析近期披露的漏洞,并在每个组织都安装修复之前支持漏洞利用。
这压缩了补丁窗口,即修复可用与用户实际获得修复之间的间隔。这个窗口始终存在风险。自动化分析使其中的每一小时对攻击者都更具价值。
近期一场涉及 Chromium-based exploit kit 的行动展示了运营风险。据报道,间谍组织在上游项目发布补丁之后、下游稳定版本尚未覆盖所有用户之前,利用了相关漏洞。AI 未必对该行动的每个部分都负有责任,但它强化了令这种时机有效的方法。
在这种模式下,开源并非注定走向毁灭。公开审查让防御者能访问相同代码,并支持广泛协作。更深层的问题是执行能力的不对称。攻击者可以测试许多可能性,而维护者必须验证报告、避免回归、协调发布并支持用户。
闭源软件面临类似问题,只是公众可见度较低。AI 辅助的研究人员仍可检查二进制文件、接口、错误行为、更新包、移动应用和设备固件。供应商不能假定不公开源代码就能维持持久的技术神秘性。
这给维护者带来了日益增长的接收问题。更多由 AI 生成的报告,并不自动意味着更多已确认漏洞。一些提交将是重复报告、不完整的声明,或未经充分测试而生成的看似可信的错误。
这些洪流可能消耗修复真实弱点所需的同一批专家。小型开源项目尤其容易受到影响,因为一个被广泛部署的组件可能只有少数几名维护者。自动化发现能够独立于其审查能力扩展。
因此,组织必须衡量的不只是报告数量。有用的指标包括复现时间、确定严重性所需时间、重复发现的占比、补丁验证时间,以及按漏洞类别划分的复发情况。
这些指标能够区分安全改进与单纯活动。一支团队若关闭了数百份低风险报告,但其开发流程中仍存在反复出现的注入漏洞,那么它只是在跑得更快,却没有降低未来的暴露风险。
工业系统失去其专业门槛
运营技术表明,隐蔽性的瓦解为何会带来超出普通软件维护范畴的后果。
运营技术(OT)控制着水处理、生产线、燃料配送和电气设备等物理流程。工业控制系统通常结合了长寿命硬件、专有协议、专业工程软件和严格的可用性要求。
这种环境过去劝退了许多攻击者。理解可编程逻辑控制器(PLC)需要工业流程和设备特定通信方面的知识。验证一种理论还可能中断物理操作。
Google Threat Intelligence Group 首席分析师 John Hultquist 认为,专业知识为工业系统提供了很大一部分实际保护。AI 让这些知识更容易获取、组织和应用。
8 月份,五家美国机构警告称,攻击者正利用 AI 辅助脚本攻击暴露在互联网中的 Siemens S7 Series PLC。受影响环境包括水务、制造业、能源、化工、农业和商业设施。
根据联邦威胁警告,操作人员将公开的工业自动化库与 AI 编程助手结合使用。他们的工具模仿合法监控软件,并与 PLC 内存、配置数据和梯形图逻辑交互。
梯形图逻辑是一种用于定义工业控制行为的图形化编程语言。未经授权的更改可能影响真实设备,而不只是改变屏幕上的信息。
据报道,这类活动降低了操作这些控制器所用 S7comm 协议所需的专业门槛。AI 可以帮助操作者利用公开信息生成或修改脚本。它并未让原本隔离的控制器变得可访问,也未绕过所有经过正确配置的安全控制措施。
暴露状态仍是促成攻击的前提条件。据报道,攻击者会寻找接入互联网、运行过时软件或仍受默认凭据保护的 PLC。薄弱的网络分段随后为生成的脚本提供了通往关键功能的路径。
这一区别至关重要。将这些事件称为“AI 攻击”,可能会让组织忽视它们早已知道如何实施的控制措施。移除直接互联网访问、更改默认凭据、修补仍受支持的设备,以及隔离工程网络,仍然不可或缺。
当组织将不熟悉误认为隔离时,通过默默无闻实现 AI 安全的做法便最容易失效。罕见协议并不能阻止访问。专有工程接口并不会验证用户身份。未公开的命令也无法阻挡一个经过训练、能够比对示例并测试响应的模型。
与此同时,防御者无法像修补消费级笔记本电脑那样修补工业环境。工厂可能提前数月安排维护。供应商可能需要对变更进行认证。老旧控制器可运行数十年,而替换它们可能需要大量现场作业。
可用性也带来了测试难题。一项失误的防御措施可能中断生产或损坏设备。攻击者较少有理由避免造成破坏,而运营方必须依据安全和运营约束验证每一项变更。
这种不对称性解释了为何仅改善检测还不够。资产所有者需要准确的资产清单、受控的远程访问、网络监控和强制执行的通信路径。他们应识别任何来自非工程工作站、指向 PLC 的流量,并调查获批变更窗口之外的写入操作。
数据二极管只允许信息沿一个方向传输,可保护那些遥测数据必须外发、但命令永远无需返回的环境。强有力的网络分段可以限制受损工作站或生成脚本造成的影响。
这些是架构性控制措施,而非试图隐藏系统。它们假设攻击者了解设备,但仍拒绝向其提供可用的攻击路径。
这一教训同样适用于企业软件。系统不应仅仅因为其内部 API 未公开,或管理面板使用了难以预测的地址,就被认为是安全的。AI 正在持续将这些不便转化为短暂的研究任务。
AI 漏洞发现正在超越修复速度
安全领域的核心权衡已不再是发现与无知之间的取舍,而是机器速度的发现能力与受人类约束的修复能力之间的竞争。
Luta Security 创始人兼 CEO Katie Moussouris 指出,分类、优先级排序和修复才是真正的瓶颈。如果组织无法判断哪些弱点真正重要,或无法消除其根源,发现更多弱点的价值就十分有限。
这正是关于 AI 漏洞发现的乐观叙述不完整之处。当审查队列缺乏可信证据、可复现测试和明确责任归属时,一个能产出十倍合理发现的模型,反而可能使安全状况更糟。
防御者必须针对每一份报告回答几个问题:这种行为是否真实存在?攻击者能否触达它?需要哪些权限?利用过程是否跨越了重要的信任边界?拟议修复会不会破坏预期行为?
AI 生成补丁似乎提供了相应的加速能力。模型可以检查存在漏洞的代码、提出修改建议并生成测试。然而,现有证据表明,创建补丁的可靠性仍远低于发现可疑行为。
1Password 的一个研究团队使用两款前沿模型,评估了针对六个近期披露漏洞生成的 6,080 个补丁。仅有 26.0% 在不实质改变应用程序行为的前提下,完整解决了漏洞。
另有 20.1% 修复了漏洞,但改变了应用程序的运行方式。更严重的是,据这项补丁验证研究称,53.9% 的补丁未能解决弱点、引入了另一个漏洞,或同时出现两种问题。
这些结果并未确立适用于每一种模型、语言或漏洞的普遍失败率。研究人员特意选择了近期出现、复杂且需要大量修复工作的缺陷。较简单的缺陷和更完善的测试套件可能会产生不同结果。
但该研究仍揭示了核心的不平衡:生成看似可信的代码变更,比证明它保留了所有重要的安全和功能属性更容易。
一些拟议修复仅狭隘地拦截了已知的概念验证输入,而没有解决根本原因。这种模式可能产生一个能通过基础测试的补丁,却仍然容易受到替代输入的攻击。
AI 生成的补丁也会继承其评估环境中的弱点。不完整的测试套件无法确认它从未检查过的行为。模型可能会针对通过可见测试进行优化,即使这些测试仅代表安全契约的一小部分。
另一项涵盖逾 100 个模型和 80 项编程任务的研究发现,平均安全代码率为 56%。该结果考察的是生成代码而非漏洞修复,但它强化了独立验证的必要性。
组织不应将这些数据解读为 AI 无法协助防御工作。模型可以起草变更、生成回归测试、解释陌生函数并比较不同修复方案。在专家保留最终决策权的情况下,这些用途可以减少工程工作量。
危险始于速度成为首要成功指标。未经充分验证便快速部署的补丁,可能保留原始缺陷、制造新的缺陷,或悄然改变访问规则。
因此,防御自动化必须以执行验证为基础。这意味着编译并运行拟议变更、测试安全属性、比较行为,并拒绝违反既定不变量的补丁。不变量是指在每一种可接受的实现中都必须保持为真的条件。
对于高影响系统,人类审查仍然必要,因为测试永远无法覆盖完整的运行环境。工程师必须了解弱点为何存在、哪些假设失效,以及相关代码是否包含相同模式。
这比生成补丁更慢。但这才是将漏洞报告转化为持久风险降低的工作。
更多发现无法修复失灵的安全流程
若组织只是以更大的补丁队列来应对 AI,仍将陷入困境,因为数量无法纠正产生缺陷的流程。
漏洞管理项目看起来可能很高效,而风险仍在持续增长。团队会统计严重发现数量、关闭时间和补丁总量,因为这些数字易于收集。它们反映了活动,但并不总能反映软件是否正在变得更安全。
Moussouris 警告称,组织无法通过无止境地向单个发现和修复环节投入资源来取胜。可持续的应对方式是识别模式,并改变那些反复产生同类漏洞的系统。
假设一次 AI 辅助审查发现了数十个注入漏洞。修复每一个实例固然重要,但更大的机会存在于开发流程的更早阶段。团队可以引入更安全的模板、集中化输入处理、框架保护机制,以及防止同类缺陷再次出现的测试。
这就是处理发现与改进安全控制之间的区别。前者降低即时暴露,后者改变未来暴露出现的速度。
组织应将漏洞数据与代码归属、架构决策和开发标准关联起来。如果某项服务反复产生授权失败问题,管理层应审视其访问模型,而非庆祝工单关闭得更快。
同样的推理也适用于基础设施。反复出现的暴露管理接口发现,表明存在资产管理或网络治理失败。只修复一台服务器而不纠正部署模式,底层机制依然存在。
针对通过默默无闻实现 AI 安全的成熟应对,始于一份诚实的资产清单。团队需要知道部署了哪些组件、由谁维护、哪些接口可访问,以及支持终止后会发生什么。
软件物料清单可帮助识别依赖关系,但资产清单必须超越软件包名称。组织还需要掌握固件版本、设备型号、云服务、内部 API、继承权限以及运营技术资产。
知识系统会产生另一种形式的默默无闻风险。AI 助手可以呈现员工在技术上获准访问、但通常不会手动发现的文档、消息、转录内容和笔记。
这未必是 AI 绕过授权,而可能是暴露了原本就过于宽泛的权限。AI 降低了在这些权限范围内找到敏感材料所需的工作量。
在广泛部署之前,采用企业搜索或检索系统的团队应审查内容所有权、保留策略、访问继承和索引边界。设计良好的 AI 知识库应保留源权限,而不是将所有已索引信息视为同等可用。
这也要求审慎记录日志。安全团队需要留下记录,说明代理访问了什么、调用了哪些工具、提出了哪些变更,以及由谁批准了具有实质影响的操作。缺少这些证据时,自动化工作流会比它们取代的遗留系统更难调查。
流程改革还应为 AI 生成的漏洞报告设定严格的受理要求。提交内容应明确受影响版本、描述信任边界、提供复现步骤,并将观察到的行为与模型生成的推测区分开来。
维护者随后可以利用自动化来聚类重复项、核实环境细节,并优先处理已证明具有影响的发现。目标并不是拒绝 AI 辅助研究,而是要求与大量声明相匹配的证据。
采购团队同样发挥作用。采购方应询问供应商如何测试代理生成的补丁、如何管理遗留组件、如何处理协调披露,以及如何衡量反复出现的漏洞类别。如果缺乏这些细节,“将 AI 用于安全”的承诺几乎无法提供保障。
怀疑态度仍然重要。当前模型表现并不稳定,而令人印象深刻的演示通常使用经过精心筛选的环境。一些 AI 发现需要大量人工修正,而完全自主的利用仍不如辅助脚本编写和侦察常见。
然而,不一致性并不会恢复过去的护城河。攻击者并不需要每次尝试都奏效。低成本并行试验可使较低的成功率在运营上仍具价值,尤其是在面对大量相似目标时。
防御者必须针对这种经济性进行规划。他们应假定可访问的代码、二进制文件、配置和补丁都会受到自动化审查。他们的优势必须来自更安全的设计和更快、经过验证的响应,而非寄望于审查失败。
三项信号将表明防御者能否迎头赶上
下一阶段将由补丁验证、关键基础设施暴露情况,以及组织是否能防止反复出现的缺陷而非仅仅统计它们来决定。
第一个信号是对 AI 生成补丁可靠性的量化评估。未来的测试应覆盖近期披露的漏洞,保留真实的应用行为,并公开可复现的方法。完整修复率的提升,将缩小当前从漏洞发现到修复之间的差距。
关键不在于补丁能否编译通过。研究人员必须验证它是否消除了根本原因、没有引入新的弱点,并保持预期行为。若改进能够经受独立评估,将更有力地证明在监督下开展防御自动化的价值。
如果失败率仍接近当前水平,则应得出更谨慎的结论。AI 将继续扩大漏洞发现量,而专家验证仍会是限制性资源。
第二个信号是工业控制器及其他遗留系统的暴露程度。监管机构和运营方应追踪可从互联网访问的 PLC 数量是否下降、默认凭据是否被清除,以及组织能否检测到未经授权的工业协议流量。
如果针对暴露控制器的 AI 辅助攻击再度出现,将强化这一核心判断。这表明攻击者正反复将公开知识转化为可用于攻击那些仍受薄弱架构保护系统的有效工具。
如果暴露程度持续下降,最令人担忧的预测就会被削弱。这并不能恢复“隐蔽性”,但会证明基本的隔离和资产管理能够让智能体失去切实可行的攻击路径。
第三个信号是安全组织如何衡量进展。随着自动化报告数量激增,只关注发现数量和中位关闭时间的团队将难以应对。追踪重复出现的缺陷类别、暴露资产、根本原因及已验证修复措施的团队,则能够减少未来的需求。
关注供应商和大型软件项目是否开始公布这些更深入的指标。若有证据显示注入、授权、内存安全或配置缺陷正在减少,将表明流程调整正在奏效。
如果披露总量持续创下纪录,而相同的缺陷类别不断重现,防御者仍将如 Moussouris 所描述的那样,停留在一台“跑步机”上。更快的发现速度会揭示更多风险,却不会改变持续制造这些风险的机制。
实际应对现在就应开始:盘点被遗忘的系统,消除不必要的暴露,测试权限边界,并要求每一项自动化安全声明都提供证据。使用智能体协助研究人员和工程师,但应让具有重大影响的修复接受可复现的测试和可追责的审查。
依靠隐蔽性实现 AI 安全已经是一种注定失败的立场,因为旧有防御依赖于稀缺的好奇心和专业劳动。而这两者都正逐渐以软件服务的形式普及。
更艰巨的任务,是构建即使其细节变得可被理解后仍然安全的系统。如今,贵组织最不希望 AI 智能体检查的是哪一项隐藏依赖、继承权限或暴露控制器?



