Palo Alto Networks Unit 42 AI Defense 转向始终在线,但证据仍需跟上
Palo Alto Networks 已将 Unit 42 AI Defense 升级为一项始终在线的服务,以持续、多模型的攻防测试取代定期评估。9 月 22 日发布的这项服务,瞄准了机器速度的攻击与仍依赖计划扫描、人工审查和延迟修复的安全体系之间不断扩大的鸿沟。
这项服务的正式名称为 Unit 42 Continuous Frontier AI Defense,结合了专用 AI 模型与人工进攻性安全专业知识。随着客户环境变化,它会测试应用程序、API、云基础设施、代码仓库和网络资产。Palo Alto Networks 表示,该系统还能将彼此独立的弱点串联为攻击路径,揭示入侵者可能如何触达高价值系统。
这一承诺使 Palo Alto Networks 加入了与 Microsoft、CrowdStrike、Google 及其他安全厂商的更广泛竞争,后者都在构建基于智能体的防御能力。不过,决定性的较量并非厂商之间的竞争,而是持续发现能力与企业修复流程之间的对抗——而后者往往仍然依赖人工、支离破碎且进展缓慢。
Unit 42 AI Defense 从评估转向持续测试
关键变化并非又一个 AI 助手。Palo Alto Networks 正将进攻性安全测试转变为一项持续的企业服务。
Unit 42 于 2026 年 4 月推出了最初的 Frontier AI Defense 服务。该服务以某一时点的暴露面分析为核心,随后提供用于改进客户防御能力的安全蓝图。
新的持续测试服务将这一方法延伸至计划性评估之外。它会建立基线、监控变化、执行新的测试、验证发现,并随着环境演变触发进一步测试。
Palo Alto Networks 将该产品描述为智能体式进攻性安全服务。在这里,“智能体式”意味着软件能够完成多步骤安全任务,而不只是生成文字建议。
该服务使用 Anthropic 的 Claude Mythos 5、OpenAI 的 GPT-5.6-Cyber,以及开放权重模型。一层专有编排系统会将不同任务路由至 Palo Alto Networks 认为最适合各项工作的模型。
这种分工很重要,因为安全测试涉及多种不同的问题。发现可疑代码、探索应用程序、评估配置,以及将弱点串联为攻击路径,都需要不同的能力。
随后,Unit 42 在这些模型周围配置人工专家。其顾问负责审查发现、测试弱点是否可被利用,并根据形成的攻击路径确定修复优先级。
该产品覆盖第一方和第三方 Web 应用程序、API、云环境、源代码仓库和网络资产。这一范围反映了现代攻击会跨越边界,而非局限于某一种安全工具之内。
一个存在漏洞的 Web 应用程序可能泄露凭据。这些凭据可能解锁一项云服务,进而提供对敏感数据或另一套身份系统的访问权限。
只报告首个漏洞的扫描器,可能会忽略更大的后果。Continuous Frontier AI Defense 旨在建模这条相互连接的路径,然后向防御者展示哪一环最值得优先关注。
该服务还可提供代码级指导和虚拟补丁建议。虚拟补丁是一种补偿性控制措施,可在不修改易受攻击软件本身的情况下阻止利用。
Palo Alto Networks 表示,客户可将该服务与其独立的虚拟补丁技术配合使用。当官方软件修复尚未推出,或无法立即部署时,这一选项尤为重要。
据该公司称,该服务通过年度订阅在全球提供。包含的模型组合因订阅方案而异,但每种配置都会使用多模型编排层。
因此,此次发布从三个方面改变了 Unit 42 的服务内容:测试变为持续进行,模型选择变为动态进行,发现结果进入反复验证和修复的循环。
其结果更接近一支常驻红队,而非传统漏洞扫描。它能否在企业规模下实现这样的效果,仍是核心问题。
多模型设计才是真正的产品押注
Palo Alto Networks 押注于模型多样性能够发现任何单一前沿模型都可能遗漏的安全弱点。
该公司的推理始于其自身测试中发现的一项限制。Palo Alto Networks 向 Axios 表示,在复杂的客户环境中,没有单个模型能够发现超过 40% 的漏洞。
Claude Mythos 5 和 GPT-5.6-Cyber 发现的弱点,重叠比例不足 10%。这些数据来自厂商自身测试,尚未获得同等程度的独立验证。
不过,报告中的差距解释了这一架构。单模型服务会继承该模型的盲点、拒答模式、训练局限及偏好的方法。
多模型框架可依据已观察到的优势分配任务。一个模型可能检查源代码,另一个则探索运行中的应用程序或评估云配置。
开放权重模型提供了另一种选择。与封闭模型相比,它们可以针对更狭窄的任务进行适配,或在不同的运营约束下部署。
这篇独立发布报道描述了一个持续搜索并推荐修复措施的系统。它还尝试将单个弱点组合成可行的攻击路径。
第二步至关重要。安全团队收到的发现往往已经超出其处理能力,而另一款自动化扫描器可能只会增加噪声,却无法降低风险。
攻击路径验证提出了一个更有价值的问题:多个弱点是否能够被组合利用,以触达重要资产、身份或管理功能。
Unit 42 的人工专家仍是这一过程的一部分。他们的工作是验证模型发现、模拟可信的对手行为,并区分合理的攻击路径与纯理论上的组合。
这一人工层也应对了生成式 AI 的一个基本问题。模型可能生成看似可信但并不正确的解释、不完整的证据,或无法复现的步骤。
因此,一项有用的服务必须保留工件。安全团队需要了解受影响资产、测试路径、观察到的行为、证据以及建议的修复措施。
这些记录还必须在评估结束后继续保留。团队需要一个可搜索的知识库,将发现与责任归属、既往决策、代码变更、例外情况和复测结果关联起来。
没有这种连续性,始终在线的测试可能变成不断增长的待办积压。更多发现并不会自动带来更好的安全性。
Palo Alto Networks 表示,它花费了六个月时间在内部以及超过 100 次 Unit 42 客户项目中测试这一方法。该公司还称,已投入 1,700 万美元用于开发和方法论工作。
在内部部署期间,该公司表示,该服务在三周内发现了其所称相当于一年积累的暴露问题。这一比较颇为醒目,但公告并未公布其底层基线或严重性分布。
在客户评估中,该公司表示,其早期的 Frontier AI Exposure Analysis 在每一家接受测试的组织中都发现了暴露问题。其中 37% 被归类为高危或严重。
Palo Alto Networks 还表示,大多数暴露问题源于第一方应用程序。据称,第三方应用程序中超过三分之二的发现没有已知的 Common Vulnerabilities and Exposures 标识符。
CVE 是已记录软件漏洞的公开标识符。缺少 CVE 可能意味着存在未知缺陷、配置问题,或属于标准漏洞数据库覆盖范围之外的弱点。
这些结果支持了在传统扫描器之外进行测试的理由。但它们并未证明有多少发现是独有的、可复现的,或最终得到修复。
因此,多模型架构既是差异化因素,也是首要的衡量难题。买方需要证据证明,额外的模型覆盖能够减少遗漏风险,而不会成倍增加误报。
机器速度的安全能力给所有主要厂商带来压力
Unit 42 AI Defense 向竞争对手施压,要求它们证明自身智能体能够防止暴露,而不只是在发现后总结告警。
此次发布正值安全公司从聊天界面转向能够跨多个系统调查、决策和行动的智能体。Palo Alto Networks 正将这一转变应用于进攻性暴露面管理。
Microsoft 正通过 Project Perception 采取相关路径。该公司推出了面向网络安全的模型和智能体,旨在识别、确定优先级并修复软件漏洞。
Microsoft 表示,其架构结合了较小的专用模型与较大的前沿系统。较小模型负责常见分析,而较大模型处理更困难的任务。
这一方法与 Palo Alto Networks 的路由策略相似,尽管 Microsoft 可以将其智能体整合进开发者、身份、端点和云产品中。其安全模型平台同样强调治理和持续学习。
CrowdStrike 则专注于安全运营中心。其 Charlotte AI 系统可在 Falcon 平台上协调智能体,开展调查、威胁狩猎和受治理的响应。
该公司的智能体式 SOC主张始于端点遥测和运营上下文。Palo Alto Networks 则更接近暴露发现和对手模拟的起点。
Google Cloud 也正将智能体嵌入威胁检测、调查、云安全和修复工作流。其优势来自云环境上下文、威胁情报以及对 Google 模型组合的访问。
这些产品存在重叠,但并不可互换。安全运营智能体负责调查活动,而进攻性测试智能体则主动搜索可被利用的弱点。
这些类别很可能会融合。发现会导向修复,修复需要验证,而活跃事件往往会暴露预防性测试遗漏的问题。
这种融合将加大围绕数据访问的竞争压力。当智能体能够看到代码、身份、配置、网络关系、工单和运行时行为时,其表现会更好。
这也有利于拥有成熟企业平台的厂商。它们无需从头构建每一项集成,便可将 AI 发现关联至既有控制措施、工作流或执行点。
Palo Alto Networks 的产品覆盖网络、云安全、安全运营、身份和事件响应。Unit 42 为这一产品组合增添了人工专业知识和威胁情报。
因此,该服务可以成为咨询与软件之间的桥梁。顾问负责验证攻击路径,而平台产品则可支持检测、修复或补偿性控制措施。
这种设计带来商业优势,但也会引发质疑。发现弱点的供应商可能会将其自身产品组合中的产品作为解决方案的一部分进行推荐。
客户需要在证据、修复优先级与产品推荐之间建立清晰的界限。即使受影响的系统属于其他供应商,发现结果也应保持实用价值。
Palo Alto Networks 表示,其测试涵盖第三方资产,而不仅限于自身产品。买方应验证,在混合环境中,集成、证据质量和修复指导是否仍保持一致。
更广泛的压力并不限于安全供应商。内部红队、渗透测试公司和漏洞管理服务商都必须说明,人类专业能力如何在自动化发现之外创造价值。
人类测试人员仍能带来创造力、业务背景,以及对模糊行为的判断。他们还可以评估联网智能体无法观察到的社会流程和组织假设。
AI 智能体则具备重复执行、规模化和持续性的优势。它们可以在每次重大变更后重新测试,而无需等到下一次季度评估。
胜出的模式将结合两者的优势。持续自动化应负责重复性的技术工作,而人类专家则聚焦于不确定路径、业务影响和高风险决策。
持续发现与缓慢修复相碰撞
只有当客户修复已验证暴露面的速度几乎能跟上智能体发现它们的速度时,这项服务才能成功。
Palo Alto Networks 将该产品定位于不断缩短的防御窗口。其 Unit 42 研究称,从初始访问到数据外泄,观察到的最快路径已缩短至 72 分钟。
该公司的事件响应数据涵盖超过 750 起高风险调查。报告称,攻击速度较前一年提高了四倍。
Unit 42 还表示,87% 的受调查攻击跨越了至少两个攻击面。部分事件涉及多达 10 个阵线的活动。
同一份报告显示,89% 的调查中出现了身份弱点。基于身份的技术占初始访问方式的 65%,被利用的漏洞则占 22%。
这些是来自 Unit 42 项目的供应商统计数据。它们描述了规模可观的事件样本,但并不代表每一家组织或整个威胁态势。
即便有这一限定,它们仍说明了为何周期性测试正承受压力。当基础设施、代码、账户和依赖项每天都在变化时,季度评估提供的保护十分有限。
持续测试能够缩短暴露面产生与被发现之间的间隔。但它无法独立缩短后续每一个审批、开发、部署或采购流程。
已确认的应用程序缺陷可能仍需要工程团队修改代码。云配置错误可能涉及多位所有者,并伴随相互冲突的运营需求。
暴露的身份问题可能需要轮换凭据、重新设计访问权限,并调查此前的活动。第三方弱点则可能没有客户可控的修复方式。
虚拟补丁在某些情况下可提供临时保护。然而,补偿性控制仍需要测试、监控、明确所有权,以及永久修复计划。
这构成了此次发布的核心权衡:改善发现能力的同一套系统,可能会压垮修复能力仍然固定的团队。
因此,安全负责人应评估处理吞吐量,而非原始发现数量。相关指标包括验证时间、分配时间、缓解时间和闭环验证时间。
重新打开率同样重要。在下一次部署中失效的修复,并非持久的安全改进。
另一个有用指标是暴露面存续时间。如果关键发现仍未解决、新发现却不断累积,持续发现的价值就很有限。
该产品的工单集成可帮助将证据导入既有工作流。但集成并不能保证正确团队会接手责任,或获得足够的行动背景。
每张工单都应说明受影响资产、可信的攻击路径、业务后果、验证证据和建议控制措施。它还应区分已确认的可利用性与模型推断。
优先级排序必须足够稳定,团队才能据此规划。如果风险评分在没有可理解证据的情况下变动,开发人员和基础设施负责人就会不信任该队列。
这一信任问题在漏洞管理中并不陌生。安全团队往往衡量扫描器覆盖率,而工程团队对系统的体验则来自误报和相互竞争的截止期限。
始终在线的测试提高了风险,因为它可以持续生成发现结果。买方应要求具备范围、去重、抑制、升级和重新测试方面的控制机制。
他们还应决定自主操作止步于何处。推荐补丁、创建工单、修改代码和阻断生产流量,承担着截然不同的运营风险。
成熟的部署会根据后果设置权限。低风险的重新测试可以自动运行,而生产环境变更则需要明确审批和回滚计划。
结果应形成一个闭环:发现、验证、分配、修复、重新测试,并保留证据。
没有这一闭环,Unit 42 AI Defense 可能只是优化了安全工作中最显眼的部分。它会更快识别问题,却让更棘手的组织瓶颈原封不动。
自主性主张需要独立证据
最大的不确定性不在于前沿模型能否发现漏洞,而在于它们能否持续运行且不引入不可接受的风险或噪声。
Palo Alto Networks 已公布多项有意义的内部结果。不过,该公司尚未发布足够的方法论细节,使外部人士能够复现其核心性能主张。
买方目前尚不清楚 40% 单模型上限背后的漏洞构成。他们也缺乏详细的精确率、召回率、误报率和漏报率数据。
两种模型之间低于 10% 的报告重叠率尤其重要。它意味着多样性,但低重叠率也可能反映测试不一致,或对有效发现存在不同定义。
独立评估应验证哪种解释占主导地位。它还应测试,多模型系统是否比熟练的人类团队或成熟工具发现更多有意义的攻击路径。
对智能体安全系统进行基准测试并不容易,因为静态测试很快会过时。模型可以吸收公开测试数据,而真实企业环境包含不断变化的权限、自定义应用和未记录的依赖项。
测试系统本身也可能成为风险。攻击型智能体获得的工具和访问权限,本意是用于探测系统、执行操作和收集证据。
这些访问权限需要严格边界。智能体应遵循最小权限原则,即仅获得完成指定任务所必需的权限。
每一项操作都应被记录。高风险操作应要求人工授权;如果行为超出批准范围,环境应支持快速遏制。
美国国家标准与技术研究院发现,各方普遍认同 AI 智能体会带来新的安全问题。其智能体安全研究结果还指出,既有网络安全实践需要针对智能体系统进行调整。
这些担忧直接适用于自主攻击性测试。提示注入、受损工具、被投毒的代码仓库或错误目标,都可能使获得授权的智能体偏离方向。
模型还可能将敏感源代码或配置数据暴露给外部服务。买方需要就数据保留、模型访问、区域处理和训练政策获得明确答复。
多模型设计使这些问题更复杂。不同模型可能对应不同的数据处理要求、部署边界和运营限制。
Palo Alto Networks 表示,人类专家会验证发现结果和攻击路径。公开公告对审批关卡、模型隔离、客户审计访问,以及测试系统自身的事件处理流程着墨较少。
这并不意味着相关控制措施不存在。它意味着潜在客户应将治理细节视为产品评估的一部分,而非实施中的脚注。
“每一位受评估客户都发现了暴露面”的说法同样需要背景。任何范围足够广泛的评估,都可能发现配置弱点、不受支持的组件或低概率问题。
严重性标签本身无法体现业务重要性。技术上严重的弱点可能处于强控制措施之后,而中等程度的身份缺陷则可能促成破坏性攻击链。
经验证的路径比孤立的严重性评级提供更好的信号。即便如此,客户仍应要求可复现的证据,以及关于访问权限、攻击者能力和环境状态的明确假设。
他们还应询问系统如何处理破坏性测试。安全模拟必须在不破坏数据、不中断服务或不违反第三方条款的前提下确认可利用性。
第三方应用构成另一道边界。客户可能控制一个账户或集成,但未必有权对提供商基础设施实施激进测试。
因此,范围管理必须在资产、操作和时间层面运行。对“企业”进行测试的广泛授权,对于自主系统而言并不够精确。
对此次发布最稳妥的解读应保持审慎。Palo Alto Networks 提出了可信的架构和显著的内部证据,但尚未形成独立确立的性能标准。
对于一项新推出的服务而言,这种缺口很正常。只有当买方将供应商结果误认为普遍已被证明的成果时,它才会成为问题。
三个信号将显示始终在线防御是否有效
下一阶段应以修复成果、独立验证和竞争对手反应来评判,而非以涉及模型的数量为准。
第一个信号是客户修复表现。Palo Alto Networks 应披露,客户采用持续服务后,是否能更快关闭已验证的攻击路径。
有用的指标包括验证时间中位数、缓解时间、关闭时间,以及重新测试后的复发情况。仅凭严重性数量无法说明安全性是否有所提升。
暴露面存续时间下降将强化该公司的论点。未解决发现不断积压的队列,则表明发现速度正超过客户的处理能力。
第二个信号是独立技术评估。研究人员或客户应在具有代表性的应用、云环境、代码库和身份系统中复现多模型优势。
这项工作应报告误报、漏报、各模型的独特贡献和证据质量。它还应将智能体结果与人类测试人员及成熟安全产品进行比较。
持续一致的提升将支持 Palo Alto Networks 的编排论点。不同环境间的巨大差异则表明,买方需要设定更狭窄的部署预期。
第三个信号是竞争对手如何将自主发现与行动连接起来。Microsoft、CrowdStrike、Google 以及专业安全公司,都在推动智能体更深入地进入运营工作流。
可信的竞争回应应将持续测试、受治理的修复,以及跨混合技术环境的验证结合起来。另一个对话式助手无法解决同一问题。
竞争压力也应推动透明度提升。采购方需要获得关于模型行为、权限、数据处理、人工监督及修复结果的可比证据。
Palo Alto Networks 发现了一项真实的不匹配:攻击者可以自动化执行侦察与漏洞利用,而许多防御方仍在等待定期评估和人工流转的工单。
Unit 42 Continuous Frontier AI Defense 通过持续的多模型测试来应对这一不匹配。其架构承认,没有任何单一模型能够看清全貌,人工验证仍然至关重要。
更严峻的考验始于发现问题之后。企业必须将发现转化为明确归属、获得授权、经过测试且能够长期维持的改进,同时不能让进攻型智能体制造新的风险。
正在评估 Palo Alto Networks Unit 42 AI Defense 的安全负责人,应从一个具有代表性的环境开始,并衡量完整的修复闭环。他们应跟踪已验证的攻击路径、误报、关闭时间、复发情况以及人工审查工作量,还应记录授予测试智能体的每一项权限。
决策不应取决于演示是否发现了令人担忧的漏洞。大多数广泛评估最终都会发现问题。决定性的问题在于,该服务能否持续将有效发现转化为更安全的系统,其速度是否快于组织现有流程。



