Palo Alto Networks 将 OpenAI Daybreak 变为 AI 主导防御的试金石
Palo Alto Networks 正在整合 OpenAI 的 Daybreak 能力,此前前沿模型帮助其在 130 多款产品中发现了 75 个安全问题。这一举措伴随着一个令人不安的矛盾:同一类帮助防御者发现隐藏攻击路径的 AI,也可能让攻击者更容易找到这些路径。
通过 Google News 看到这篇报道的读者,或许会将其视为一家 AI 公司与一家网络安全厂商之间的直接合作。但更重要的发展在于运营层面。Palo Alto Networks 希望将 OpenAI 的先进模型嵌入既有的调查、优先级排序、修复与响应工作流。
这一目标让竞争不再局限于谁拥有安全评分最高的模型。核心问题在于,防御者能否在对手获得相当能力之前,将更快的漏洞发现转化为经过验证的修复措施。
OpenAI 并非独自推进这一目标。Anthropic 已通过自己的项目限制先进网络能力的访问,其他安全厂商也在加入 OpenAI 的合作伙伴网络。因此,Palo Alto Networks 必须证明,其安全数据、平台和人工专业能力所创造的价值,超过仅仅获得模型访问权限本身。
Palo Alto Networks 正在投入生产的内容
Palo Alto Networks 计划将 Daybreak 从一项受限的模型访问计划,转变为其 Frontier AI Defense 产品的一项组成部分。
OpenAI 将 Daybreak cybersecurity 描述为网络安全能力模型、Codex Security、受控访问和行业合作伙伴关系的组合。其预期工作流涵盖漏洞发现、验证、修复和证据收集。
Palo Alto Networks 正在参与 Daybreak Cyber Partner Program。该安排使获批的安全服务提供商能够访问先进的防御能力,并将其整合进产品和服务。
这一整合不只是为分析师提供一个聊天机器人。Palo Alto Networks 表示,该技术将支持调查、分析、优先级排序和响应。这些环节要求安全团队将技术信号转化为决策。
OpenAI 的模型能够检查代码库、构建威胁模型、追踪可达代码,并识别可信的攻击路径。它们还可以收集验证证据,并提出供人工审查的针对性补丁。
这一流程很重要,因为传统安全扫描器产生的发现结果往往多于团队能够处理的数量。一项发现可能描述了可疑代码,却无法证明攻击者能够触及它;也可能缺乏评估业务影响所需的上下文。
Daybreak 试图连接这些环节。模型可以调查某个弱点是否可达,在受控环境中复现它,制定修复方案,并测试拟议的更改。最终决策仍由组织作出。
Palo Alto Networks 可以补充通用模型无法获得的信息。其平台能够观察网络活动、端点行为、云配置、身份信息和安全事件。Unit 42 还带来了威胁情报和事件响应经验。
这些输入有助于区分一个在理论上值得关注的缺陷,与一个关联真实攻击路径的弱点。它们也能帮助团队优先处理影响暴露服务的漏洞,而不是隐藏在多重控制措施之后的类似问题。
Palo Alto Networks 首席产品和技术官 Lee Klarich 表示,公司将通过 Frontier AI Defense 提供这些能力。他在 OpenAI 的 partner program 声明中特别提到了调查、优先级排序、响应、防护措施、监控和滥用预防。
两家公司尚未发布完整的产品路线图,说明哪些 Palo Alto Networks 服务将获得每一项 Daybreak 能力。它们也尚未披露各项工作流面向普通客户的可用时间。
不过,已确认的方向仍然意义重大。Palo Alto Networks 正将自身定位为 OpenAI 模型与企业安全运营之间受治理的交付层。其成败将取决于模型报告缺陷之后发生的事情。
Google News 标题遗漏了什么
真正的竞争不再是 AI 辅助发现与人工发现之间的较量,而是机器速度的发现能力与较慢的修复验证和部署流程之间的较量。
Google News 的标题可能会将这则新闻浓缩为 Palo Alto Networks 利用 OpenAI 应对 AI 攻击。这种表述抓住了参与者,却忽略了瓶颈所在。
OpenAI 表示,Codex Security 在进入研究预览后,已扫描超过 30,000 个代码库中的逾 3,000 万次提交。人工审查人员将超过 70,000 项发现标记为已修复;系统则自动判定另有超过 500,000 项发现已经得到修复。
这些数字来自 OpenAI,应被视为公司自行报告的运营数据。尽管如此,它们仍说明了自动化审查能够达到的规模。
发现更多弱点并不会自动降低风险。每一项可信结果都必须进入一个能够确认问题、评估暴露范围、准备变更、运行测试、取得批准并安全部署的流程。
有缺陷的补丁可能制造新的漏洞、中断生产服务或破坏兼容性。即使补丁本身正确,如果客户延迟安装,其效果也可能十分有限。当弱点影响外部项目时,安全团队还需要协调披露事宜。
OpenAI 在 6 月发布的 Daybreak expansion 明确聚焦于这一缺口。该公司认为,漏洞发现正变得更容易,而修复正在成为限制性环节。
其更新后的 Codex Security 插件可以生成报告、追踪攻击路径、验证发现结果,并提出针对特定代码库的补丁。它也可以通过既有漏洞管理系统所使用的格式导出结果。
Palo Alto Networks 则带来了工作流中的另一部分。该公司已经销售用于检测威胁、管理云暴露面、分析端点活动和自动化安全运营的系统。这一既有布局为其交付模型生成的发现结果提供了落点。
该公司还可以将代码层面的问题与运行时证据关联起来。例如,模型可能识别出应用中的认证弱点;安全遥测数据则可显示受影响服务是否暴露在外、是否出现过可疑请求,以及哪些身份可以访问该服务。
这些额外上下文可能改变优先级。一个技术上严重、却处于多项有效控制措施之后的弱点,可能需要与正遭积极利用的中等缺陷不同的响应方式。
Palo Alto Networks 已经利用前沿模型审查其自身软件。该公司 5 月的安全公告报告称,初步扫描覆盖三大平台上的 130 多款产品。
最终公告涉及 26 个 Common Vulnerabilities and Exposures,即 CVE,共计代表 75 个问题。该公司表示,其通常每月的 CVE 数量不足五个;同时表示,已披露的弱点均未在野外遭到利用。
截至公告发布时,Palo Alto Networks 表示已修复其软件即服务产品中的所有重要漏洞,也已为受影响的客户自营产品提供补丁。
Unit 42 findings 为预期的防御闭环提供了一个早期示例:模型发现问题,人工团队审查结果,公告记录风险,补丁交付给客户。
不过,这项测试是在 Palo Alto Networks 自身环境中进行的。该公司能够控制源代码、工程师、披露流程和发布基础设施。客户环境将带来更分散的数据、更旧的系统以及复杂的审批要求。
因此,这项合作面临两项不同的考验。第一项是模型能否发现有价值的弱点;第二项是 Palo Alto Networks 能否在多样化的客户环境中复制其内部修复流程。
AI 攻击路径令所有安全厂商承压
Daybreak 正迫使 Palo Alto Networks 及其竞争对手证明,它们能够在不降低证据标准的前提下缩短修复时间。
前沿模型能够比早期助手执行更长的安全工作序列。它们不只是建议一项孤立的代码更改,还能检查大型代码库、跟踪依赖关系、测试假设,并对多个弱点进行推理。
攻击者也可以采用类似方法。单个弱点看似影响有限,但多个小缺陷可能形成通向代码执行、权限提升或数据访问的路径。
这正是漏洞链利用的重要性所在。它将彼此独立的弱点串联成一个能够绕过目标控制措施的序列。能够追踪这些链条的模型,可减少复杂研究所需的部分时间和专业知识。
Palo Alto Networks 表示,其测试显示防御窗口十分狭窄。今年 5 月,该公司估计,组织还有三到五个月的准备时间,之后 AI 驱动的利用将更常见地成为威胁态势的一部分。
这一预测是 Palo Alto Networks 的评估,而非经过独立确认的期限。攻击者的采用情况将取决于访问条件、模型可靠性、目标知识、基础设施和运营纪律。
尽管如此,能力趋势可以衡量。OpenAI 报告称,GPT-5.6 Sol 在 ExploitBench 上获得了 73.5%,而 GPT-5.5 为 47.9%。ExploitBench 衡量从触及易受攻击代码到实现任意代码执行的进展。
在 ExploitGym 上,GPT-5.6 在六小时限制下达到 33.7%。在测试复杂软件概念验证生成能力的 SEC-Bench Pro 上,它获得了 71.2%。
基准测试无法重现完整的企业攻击。它们通常提供更干净的条件、明确的目标和可衡量的成功标准。真实系统包含不完整信息、监控控制、访问障碍,以及能够做出响应的防御者。
OpenAI 还表示,GPT-5.6 未达到其 Preparedness Framework 中的 Critical 网络安全阈值。其测试发现,该模型更擅长发现和修复漏洞,而非针对经过加固的目标完成自主攻击。
GPT-5.6 evaluation 仍然说明了厂商如今为何面临压力。能力正在防御性和双用途任务上同步提升,而两者之间的界限往往取决于授权和上下文。
这带来了分发问题。如果 OpenAI 对先进功能限制过严,合法防御者可能会失去攻击者能够通过其他途径获得的工具;如果分发过于广泛,强大的模型则可能降低有害活动的门槛。
Daybreak 通过经过验证的访问、范围限定的权限、监控和账户级执行来应对这一问题。Palo Alto Networks 则通过已受企业政策治理的产品和服务交付这些模型,增加了另一层防护。
竞争对手面临同样的挑战。CrowdStrike、Cisco、Cloudflare、Fortinet、SentinelOne、Check Point 和其他公司也出现在 Daybreak 合作伙伴网络中。OpenAI 模型的访问权限不会由 Palo Alto Networks 独享。
Anthropic 提出了另一条路径。其先进网络安全工作强调受限访问,并与可信赖的防御方紧密合作。Palo Alto Networks 一直在测试 Anthropic 模型与 OpenAI 技术的结合,而非承诺只采用一家模型提供商。
这种多模型方法在战略上合情合理。安全成果不应依赖某一家实验室的发布节奏、安全政策或基准测试优势。不同模型也可能发现不同类别的缺陷。
这也削弱了任何关于仅凭 Daybreak 就能让 Palo Alto Networks 获得持久优势的说法。更具防御力的资产,很可能是围绕模型构建的运营体系。
Palo Alto Networks 必须将模型推理与遥测数据、政策、事件历史和修复工具连接起来。随后,它还必须提供让分析师和开发人员信赖的证据。竞争对手将尝试在各自的平台内建立类似连接。
因此,压力落在每一家主要安全厂商身上。由于模型速度更快,客户将期待更快的结果。他们不会仅仅因为答案由 AI 智能体生成,就接受较弱的验证。
优势取决于上下文,而非模型访问权限
只有当专有上下文将强大的通用模型转化为可靠的企业防御工作流时,Palo Alto Networks 才能获得优势。
前沿模型起点是对软件和安全的广泛知识。它并不会自动理解客户的架构、业务优先级、可接受风险或变更管理流程。
这种缺失的上下文限制了实用性。两家公司可能运行着同一个存在漏洞的库,但面临的暴露程度不同。一家可能将其部署在面向互联网的服务器上,另一家则将其隔离在受限的开发环境中。
Palo Alto Networks 可以将代码分析与来自云、网络、终端、身份和安全运营系统的信息结合起来。这种组合可帮助模型提出更相关的问题。
受影响的组件是否已部署?外部用户能否访问它?组织是否观察到相关技术手法?终端控制措施是否会阻断预期行为?哪项业务服务依赖该组件?
这些答案决定了修复优先级。它们还可以帮助分析师测试模型给出的攻击路径是否反映真实环境。
这正是智能体式 AI 的价值可能超越摘要生成之处:它指的是为实现目标执行一系列操作的软件。智能体可以检索证据、运行获批检查、比较配置,并准备建议的响应方案。
这些操作同样会增加风险。拥有广泛访问权限的智能体可能暴露敏感数据、改变生产系统,或遵循隐藏在内容中的恶意指令。每一次工具连接都会扩大错误的后果。
因此,Palo Alto Networks 需要在 Daybreak 工作流周围设置严格的身份、授权、日志记录和审查控制。模型应只接收当前任务所需的信息。工具应提供范围严格限定的操作,而非通用管理权限。
在人类影响重大的环节,人工审查仍然至关重要。分析师应批准侵入式验证。开发人员应审查补丁。服务负责人应决定何时可以推进生产变更。
该工作流还应保留证据。一项安全发现需要包含受影响的代码位置、可达性信息、复现步骤,以及对建议修正方案的说明。
OpenAI 表示,Codex Security 可以生成验证证据和审阅者说明。Palo Alto Networks 可以将这些材料导入现有的案件管理和修复系统。
这条证据链的重要性不止于合规。它让第二个人能够质疑模型的推理,也使事后调查错误建议成为可能。
这种方法类似于一个可搜索知识库,但其运营风险更高。安全团队必须在不丢失来源可追溯性的前提下,检索代码库上下文、架构记录、过往事件和责任归属信息。
模型可以帮助连接这些记录,但组织仍需要准确的源材料。无论模型质量如何,过时的资产清单和缺失的责任归属数据都会导致糟糕的优先级判断。
因此,Palo Alto Networks 的实际优势可能来自缩短证据与行动之间的距离。其平台已接近客户观察威胁和实施控制措施的场景。
如果 Daybreak 始终是一个独立控制台,分析师可能只会多得到一个发现队列。如果它成为现有调查和工程工单的一部分,就能减少交接并加快决策。
这种集成比基准测试演示更难实现。它需要权限、数据规范化、工作流设计、变更控制,以及多个团队的信任。
模型访问权限之所以引人关注,是因为它容易宣布。运营集成才决定这项技术是否改变结果。
更多发现可能带来新的安全问题
Palo Alto Networks 计划面临的最大挑战在于:更快的发现速度可能压垮修复团队,并在降低风险之前增加风险。
OpenAI 和 Palo Alto Networks 都认为,AI 可以帮助防御者更早发现漏洞。当发现量增长快于验证和补丁能力时,这一好处就变得模糊。
模型可能产生误报、重复报告,或者在技术上正确但实际影响很小的发现。即使是准确的报告,也可能分散团队对正在被积极利用的弱点的注意力。
这并非小小的效率问题。每一次不必要的调查都会占用分析师本可用于处理真实事件的时间。每一个仓促的补丁都可能导致故障或回归。
Palo Alto Networks 的结果提供了令人鼓舞的证据,但尚不足以解决这一问题。该公司报告发现了 75 个问题,并完成了协调修复流程。它尚未公布误报、分析师工时、被拒绝的发现或补丁回归的完整细目。
这些指标将帮助客户判断该系统是否减少了总体工作量。发现的问题数量增加七倍听起来令人印象深刻,但发现量不等于风险降低。
报告中的结果还来自一次初始扫描。成熟的采用需要在新代码、遗留系统、第三方依赖项和客户特定配置中展现可重复的表现。
模型行为可能因运行而异。安全团队需要一致的证据标准,以确保无论由哪个模型或工作流发现,问题都能获得相同的优先级。
围绕更宽松的网络安全模型,还存在治理上的紧张关系。防御者有时需要协助复现漏洞利用、分析恶意软件或测试绕过方法。这些任务与攻击者所做的工作相似。
OpenAI 将最敏感的能力保留给经过验证的用户,并实施监控、范围限定控制和审查。这类措施能降低风险,但无法消除内部滥用、账户被入侵或错误授权。
Palo Alto Networks 将需要自己的控制措施,而不能完全依赖 OpenAI。它必须决定哪些用户可以调用高级分析、哪些目标获得授权,以及哪些操作需要明确批准。
组织还应将模型建议与执行分离。模型可以提出防火墙变更或遏制措施,但应由政策决定系统能否自动执行。
较高的自主性可能适用于低风险操作,例如使用公开信息丰富警报内容。禁用身份、隔离生产终端或修改代码,则需要更严格的检查。
另一个不确定性涉及集中化。如果许多安全产品依赖同一底层模型,系统性的模型失效可能会同时影响多个防御层。
一个共享模型可能会在不同客户环境中忽略同一种漏洞模式。理解这一盲点的攻击者,可能获得异常优势。
多模型验证可以降低这一风险,传统扫描和专家审查也可以。Palo Alto Networks 同时与 OpenAI 和 Anthropic 合作,表明它认识到多元方法的价值。
独立验证仍将重要。OpenAI 的基准结果和 Palo Alto Networks 的内部发现,主要都是公司自行报告的结果。客户需要来自自身环境中受控试点的证据。
有用的衡量指标包括每分析师工时确认的漏洞数、从发现到部署修复的时间、误报率、补丁接受率、重新开启的发现以及生产回归。
如果这些指标同步改善,Daybreak 的论点就会更有说服力。如果发现量上升,而修复积压、分析师工作量或变更失败也随之增加,这一论点就会削弱。
读者不应将 Google News 上每一条有关机器速度防御的提及,都视为自主安全的证据。这些系统仍依赖访问控制、可靠上下文、人类判断和严谨的软件运营。
三项信号将表明 Daybreak 是否改变防御
下一阶段应根据已部署的修复、客户工作流采用情况,以及安全保障措施能否经受更广泛使用来评判。
第一个信号是产品层面的集成。Palo Alto Networks 表示将通过 Frontier AI Defense 提供 Daybreak 能力,但客户需要具体的可用性细节。
应关注 Cortex、云安全、Unit 42 服务或其他工作流中是否出现已命名的集成。关键在于,发现能否从模型分析进入现有的调查和修复系统。
一次可信的发布应明确支持的操作、访问控制、证据输出和人工批准节点。附着在控制台上的模糊 AI 助手,无法验证更广泛的战略。
第二个信号是修复表现。Palo Alto Networks 应报告的内容不应仅限于发现的漏洞数量。
有用的指标包括验证时间、修补时间、分析师投入、误报率,以及开发人员接受的建议修复占比。生产回归和重新开启的发现也应纳入同一评估。
如果这些指标改善,Daybreak 将支持这样一种说法:前沿模型能够缩短完整的修复闭环。如果发现增长快于修复,技术就只是转移了瓶颈,而没有解决它。
第三个信号是随着合作伙伴网络扩展,受控访问的表现。Daybreak 包含许多大型供应商,每家都有各自的客户、产品和运营模式。
更广泛的部署会扩大防御覆盖范围,同时也会带来更多账户、集成、数据流和滥用机会。
OpenAI 及其合作伙伴应披露有关滥用防范、账户执法、授权失败以及受监控部署经验的实质性信息。他们无需披露会帮助攻击者绕过控制措施的内容。
Palo Alto Networks 还应展示其如何验证高级安全工作的目标和范围。能够验证漏洞利用的模型,需要比总结警报的工具更强的治理。
这些信号将比又一项基准纪录更重要。基准测试确立技术潜力;生产运营则揭示这种潜力能否转化为更安全的软件。
故事核心的冲突仍将存在:帮助防御者发现漏洞的模型,与能够帮助攻击者理解这些漏洞的模型存在关联。
Palo Alto Networks 押注于可信访问、专有上下文、安全遥测数据和人工审查,认为这些因素能够将时间优势转向防御方。OpenAI 则押注于受控分发,力求在不让有害访问成为常态的前提下提供强大的工具。
对于通过 Google News 关注此事的安全负责人而言,实际的下一步不是等待完全自主的防御系统。请识别你负责的应用,将漏洞与运行时暴露情况关联起来,并衡量经过验证的修复方案需要多久才能上线至生产环境。
随后以这一基准测试 AI。它是否能在不增加误报、不安全变更或分析师负担的情况下缩短修复时间?最终决定 Daybreak 能否为防御方带来持久领先优势的,将是这一结果,而不是发现项数量或模型评分。



