SecRespond 发现 23 个前沿 AI 模型漏检隐蔽入侵
SecRespond 登上 Google News,结论直截了当:23 个前沿模型中,没有一个在任何受测失陷主机上完成检测与修复。相比隐蔽证据,这些代理更擅长处理显性告警,这暴露出 AI 辅助分诊与自主事件响应之间的差距。
阿里巴巴集团研究人员于 2026 年 7 月 29 日提交了 SecRespond 论文。他们通过 OpenCode 测试了多个主流模型家族;这是一套允许模型检查文件并使用命令行工具的代理测试框架。
测试从攻击者已经得手后开始。这个细节构成了研究的核心矛盾。AI 代理可以跟进一条告警,但安全运营中心需要的调查人员还必须发现那些无人标记的威胁。
因此,SecRespond 对一种常见的自动化承诺提出了挑战。能够总结告警的模型可以减轻分析师的工作负担,但这并不意味着它已成为独立的事件响应者。该基准测试在磁盘痕迹、持久化机制、不完整的清理步骤和未经验证的修复计划中发现了这种差异。
SecRespond 基准测试实际改变了什么
SecRespond 将评估目标从解读告警转向调查一台已经失陷的机器。
许多网络安全测试在失陷前开始。它们要求模型识别漏洞、完成夺旗挑战、分类恶意软件,或对经过筛选的安全日志进行推理。这些任务衡量了有用能力,但降低了真实入侵中最关键的不确定性。
SecRespond 从更晚的阶段开始。每个代理都会获得一份来自失陷云主机的冻结取证磁盘快照,以及模拟主机防护产品所生成告警、漏洞扫描和安全基线检查结果的合成输出。
取证磁盘快照是在特定时刻保留的系统文件及其痕迹副本。它可能包含告警从未提及的证据,包括被修改的启动文件、后门账户、被清除的日志、计划任务或恶意二进制文件。
代理必须检查这些材料并重建事件经过。随后,它需要生成涵盖入侵、漏洞、基线风险和修复措施的报告。任务还要求提交进度文件,从而记录调查过程,而非只接受一份经过润色的最终答案。
该基准包含 10 个网络靶场,即为复现安全事件而构建的隔离环境。这些靶场覆盖四类初始入口、MITRE ATT&CK 目录中的 21 项技术,以及五种操作系统。
研究人员将这些环境转换为 52 项能力条目和 280 个详细检查点。检查点评估代理是否发现具体证据、是否正确归因、是否建议恰当行动,以及是否覆盖必要的验证步骤。
检测和修复规划分别评分。每个适用检查点的检测最高可得三分;规划最高可得两分,而不适用于某一维度的检查点不计入该维度汇总。
这种区分很重要,因为发现恶意文件并不能回答响应人员下一步该做什么。安全响应可能要求隔离主机、保全证据、终止进程、移除持久化机制、轮换凭证、封禁攻击基础设施、恢复服务并验证恢复结果。
公开的 SecRespond 数据集包含任务提示、评估材料、检查清单、合成安全输出和取证归档。其发布使原作者之外的团队也能检验这一核心主张。
SecRespond 还为 AI 事件响应设定了更严格的边界。代理不会因为大概率检查过某项内容就获得满分。其报告必须陈述发现结果,并引用满足相关检查清单的证据。
这条规则将模糊的安全表述转化为可衡量的表现。“调查可疑活动”不等于识别某个具体进程、文件、账户、端点或持久化路径。“给服务器打补丁”也不等于一份完整、有序且经过验证的恢复计划。
Google News 的报道聚焦于 23 个模型整体失利这一标题性结论。更深层的变化在于方法论:SecRespond 询问代理能否追查从未直接交给它的线索,并将这些发现与站得住脚的清理流程联系起来。
为什么 Google News 的关注对 AI 安全采购方很重要
这一基准促使供应商和安全负责人区分告警辅助与自主事件响应。
AI 已经帮助安全运营中心总结告警、丰富指标信息、检索文档、起草查询以及准备案件记录。由于分析师经常面对碎片化证据和重复性行政工作,这些工作流仍然很有价值。
然而,SecRespond 衡量的是更高层次的独立性。自主响应者必须决定从哪里展开调查,识别缺失证据,检验相互竞争的解释,并在最明显的告警得到处理后继续推进。
该基准的核心结果说明了这种区分为何重要。在全部 23 个受评模型中,没有任何代理在哪怕一个网络靶场中实现完整检测和修复。
在报告的实验中,整体最佳模型是 Claude Opus 4.7。它在检测方面的平均靶场级检查点评分达到 79.0%,规划方面达到 65.7%。
论文还报告称,领先模型在合并这两个维度后的平均得分为 72.4%。这一表现仍意味着部分恶意痕迹未被处理、修复工作不完整,尤其是在攻击链更长、范围更广的靶场中。
其他领先结果包括:Claude Opus 4.6 的检测得分为 78.2%、规划得分为 58.0%;GLM-5.1 分别达到 76.3% 和 59.2%;Qwen3.7 Plus 分别达到 75.6% 和 58.8%。
这些数字不应被视为对底层模型的通用排名。它们描述的是一套代理测试框架、一个基准版本、一种任务设计以及特定评估流程下的结果。
这些结果反而揭示出一种共同的失败模式。模型发现与现有告警相关的证据,比发现需要主动搜索磁盘才能找到的证据更可靠。
这一模式给采用“AI 分析师”或“自主 SOC”等宽泛标签的安全供应商带来压力。采购方需要询问:系统在没有人工创建线索的情况下,实际能够完成响应生命周期中的哪些环节。
一款产品可能准确总结某个端点告警,却忽略第二种持久化机制。它可能建议删除恶意二进制文件,却未能终止其进程、移除其加载器、轮换已暴露凭证,或验证服务恢复。
每一个遗漏步骤都会改变实际运营结果。攻击者可以通过未处理的账户、计划任务、Webshell、服务、注册表项或 shell 钩子再次进入。因此,一项技术上正确的初步行动可能造成已经遏制风险的错觉。
安全负责人还需要将调查质量与报告质量区分开来。模型往往能生成流畅的解释,但 SecRespond 评估的是这些解释是否包含所需的证据和修复细节。
这也是知识密集型工作中的常见问题。自信的叙述可能掩盖不完整的检索。构建可搜索知识库的团队面临类似要求:结论必须始终能够追溯至源材料。
该基准将这种可追溯性具体化到事件响应中。代理必须展示哪项痕迹支持每一项结论,以及哪项行动对应每一种已识别状况。
Google News 的曝光可以将这种区分推向基准研究人员之外。采购团队、CISO、托管安全服务提供商和内部审计团队如今都有了一个公开案例,说明“处理告警”和“处理事件”并非等价主张。
真正的盲点是无引导调查
当事件没有明显告警指向下一个痕迹时,模型的表现最弱。
SecRespond 将表现划分为五个能力领域,涵盖入侵实体、持久化机制、基线风险、漏洞风险,以及整体调查与响应质量。
入侵实体是具体的恶意对象,例如进程、文件、网络端点或被篡改的痕迹。模型在这一类别中表现最佳,因为这些对象通常与可见的安全信号相对应。
在所有模型中,针对入侵实体的平均检测率达到 75.4%。多个领先系统表现显著更好,包括 Qwen3.7 Plus 的 88.4% 和 Claude Opus 4.6 的 86.0%。
持久化机制则呈现出不同结果。持久化是指可使攻击者访问权限在重启或初步清理后仍然存在的改动。示例包括计划任务、服务、shell 启动钩子、Webshell、账户后门以及 Windows Management Instrumentation 订阅。
针对持久化的平均检测率降至 58.8%。这一降幅很重要,因为持久化正是响应人员在宣布主机已清理干净前必须找到的内容。
该基准并未表明模型完全缺乏取证推理能力。它们可以将告警与相关进程或文件联系起来,并且常常能够正确描述即时威胁。真正的失败发生在调查必须超出这一出发点继续扩展时。
以一台失陷的 Web 服务器为例。一条告警可能识别出恶意进程或出站连接。跟进这一信号可以发现某个可执行文件,但完整调查还必须追问攻击者如何进入、哪些凭证已暴露,以及什么会在终止后继续存留。
响应人员可能还需要检查启动脚本、服务定义、cron 条目、用户账户、命令历史、应用目录和被篡改的日志。没有任何单条告警必然会指出这些位置。
这构成了一个边界不确定的搜索问题。代理必须决定哪些假设值得检验,以及调查应持续多久。它还必须认识到,找不到某一种痕迹并不排除其他持久化路径。
当前语言模型代理往往围绕上下文中已经存在的证据进行优化。告警会形成高度显著的锚点,因此代理可能将预算花在解释这些锚点上,而不是寻找未被提及的证据。
更长的攻击链会放大这一弱点。每增加一种技术,就会引入另一条分支、另一类痕迹、时间戳、账户或服务,模型必须将它们关联起来。
论文发现,随着攻击变得更长、更广,模型表现会下降。这一结果符合实际运营挑战:事件响应不是一次分类决策,而是在信息不完整条件下作出一连串相互关联的判断。
另一项 2026 年的威胁狩猎基准报告了相关问题。五个前沿模型在来自 26 场攻击活动的原始 Windows 事件日志中进行搜索,最佳模型也只找到了少量恶意事件。
两项研究测试的是不同工作流,因此其得分无法直接比较。不过,两者都表明:无引导搜索仍然比对预先筛选的证据进行推理更困难。
这正是该基准测试的核心反转。传统安全工具已经降低不确定性的领域,智能体看起来最有能力;而在人类调查人员通过追问告警未揭示内容来创造最大价值的领域,智能体则变得更不可靠。
在这一边界内,安全团队仍可高效使用 AI。模型可以总结证据、提出假设、起草查询、比对工件,并维护调查时间线。
不安全的跨越,是把这些能力当作模型已经检索了整个事件的证据。SecRespond 表明,一份表述流畅的回答可以与未被发现的持久化机制以及对攻击者活动的不完整说明同时存在。
检测分数掩盖了更大的修复差距
发现更多证据并未转化为同样完整的清理方案,使修复成为该基准测试的第二大失败点。
每个受评估模型的检测得分都高于规划得分。对于 GPT-5.5,报告中的差距达到 34.7 个百分点。
研究人员将这一模式归因于智能体采用了显而易见的首个修复措施,却遗漏了后续行动。这种行为类似于清单截断:一旦核心恶意对象得到处理,模型就仿佛认为事件已经解决。
现实中的修复很少止于一次删除或配置变更。响应人员必须考虑依赖关系、证据保全、业务影响、服务连续性、凭证暴露,以及攻击者的替代访问路径。
SecRespond 的规划得分考察一项行动是否正确且完整。当相关检查点有此要求时,它还会评估验证和副作用。
验证并非形式主义。移除计划任务的方案应确认该任务已不再存在,并确认其载荷无法通过其他机制启动。
封禁攻击者地址的方案,应在适当情况下同时处理入站和出站流量。它也不应暗示封禁地址就能清除主机上已存在的恶意软件、被盗凭证或持久化机制。
标准化配置问题被证明更容易处理。Claude Opus 4.7 在基线风险的规划中达到 74.8%,在漏洞风险中达到 72.6%。
这类任务通常对应熟悉的操作,例如强化配置或更新受影响的软件。智能体可以检索可识别的修复模式,并将其应用于发现的问题。
调查与响应质量仍然弱得多。该类别的平均规划表现仅达到 31.8%。
这一类别涵盖依赖综合判断、而非单一已知修复措施的工作,包括攻击链重建、证据质量、对不确定性的坦诚、完整性、验证,以及对运营影响的认识。
该类别中最强的检测结果达到 75.5%。论文称,几乎所有模型的规划得分仍低于 50%。
这些结果削弱了一种简单的扩展策略:向模型提供更多告警,并不会自动产生完整的响应计划。更多可见发现反而可能带来更多彼此脱节的建议。
可信的计划需要排序。团队可能会先隔离机器再进行修改,在终止进程前保留易失性证据,并在确定暴露范围后轮换凭证。
它们还需要考虑回滚和服务问题。在不了解依赖关系的情况下移除受损组件,可能会中断生产环境,或破坏归因所需的证据。
SecRespond 评估的是书面计划,而非生产系统上的实时修复。这限制了基准测试能够确立的结论,但也让安全问题保持可见。
如果一个模型无法在受控环境中持续描述完整且经过验证的修复措施,组织就几乎没有理由授予它在实时主机上的不受限权限。
因此,该基准测试支持一种更窄的运行模式。AI 可以建议行动、整理证据并突出缺失字段,而人工响应人员保留对遏制和恢复步骤的批准权。
这种安排并非拒绝 SOC 自动化。它是对数据中特定不对称性的回应:这些系统在识别已知对象方面优于确保每个后果都得到安全处理。
安全团队应在访问控制中反映这种不对称性。只读取证访问与终止进程、删除文件、禁用账户或更改网络策略的权限,风险并不相同。
遗漏隐藏工件的智能体会生成不完整报告。根据这份不完整报告采取行动的智能体,则可能在保留攻击者替代路径的同时扰乱恢复工作。
这些数字无法证明什么
SecRespond 是共享局限性的有力证据,但并非针对每个模型或生产 SOC 配置的最终裁决。
该论文是 arXiv 预印本,尚未完成同行评审。作者包括 Tongyi Lab 和 Alibaba Cloud 的研究人员,且该基准测试通过一个代表性框架评估模型。
选择 OpenCode 有助于在不同系统之间标准化工具使用方式。但这也意味着,结果衡量的是模型与框架的组合,而非脱离提示词、工具、上下文管理和执行策略的抽象模型能力。
不同的脚手架可以改变表现。事件响应智能体可以使用强制调查清单、专用取证工具、对内部流程的检索、多个协作智能体,或确定性验证脚本。
SecRespond 仍然有用,因为这些改进可以在同一批测试范围内得到检验。不过,已发布的数字不应被视为各模型系列的永久上限。
评估还采用了 LLM-as-a-judge 流程,即由语言模型依据详细清单为生成的报告评分。研究独立使用了三位专有模型评审,以降低对单一评分器的依赖。
这些评审分别是 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT-5.4 Pro。多位评审可以减少个体偏差,但无法消除所有校准问题。
评分器对不完整表述的理解可能不同于人类取证专家。它也可能奖励报告中明确写出的语言,而未能充分判断底层调查过程是否可靠。
评分说明试图控制这一风险。评审必须引用证据,并且只能为报告中明确出现的内容给分。
该基准测试的 280 个检查点提供了额外结构。然而,每份清单都隐含了对于哪些工件、响应步骤和质量应当被赋予权重的选择。
这 10 个测试范围具有足够多样性,能够揭示重复出现的行为。但它们并未覆盖每一种操作系统、云架构、身份平台、终端产品或攻击者技术。
这些环境也是受控的。研究人员为基准测试配置并攻陷主机,随后清除了凭证和个人数据。
这种设计实现了可复现性,并避免暴露生产信息。但它无法完全复现真实企业事件中的噪声、不完整遥测、组织约束和业务依赖关系。
一项结果也说明了安全行为如何影响基准测试覆盖度。Claude Opus 4.7 拒绝执行 npm-worm 任务,因此论文将该模型从这一测试范围的详细检查点表中排除。
在合法防御性调查期间,拒绝可能降低运营实用性。它也可能反映了提供商为防止双重用途协助滑向有害指导所做的努力。
SecRespond 并未解决这一政策权衡。它表明,安全部署需要能够区分授权取证工作与进攻性指令的任务定义。
基准测试作者表示,发布的证据来自隔离环境,且不包含可运行的漏洞利用链。公开材料旨在服务于防御性研究。
在解读有关“真实世界”响应的主张时,这一限制很重要。这些测试范围通过真实网络协议重建端到端入侵,但发布的软件包包含的是经过脱敏的取证证据,而不是活跃的攻击工具。
目前也没有独立的实地研究表明,SecRespond 分数如何转化为节省的分析师时间、降低的事件严重性或提升的遏制速度。这些结果需要在运营团队内部进行评估。
因此,对买方而言,正确的解读应当审慎。该基准测试有力挑战了缺乏支撑的自主事件响应主张,但并未表明 AI 辅助在人工主导的 SOC 中没有价值。
它也不能证明某个具名模型会在未来版本中持续领先。报告显示 Claude 系列在多个版本中有所进步,而其他系列的进展并不普遍。
有意义的评估单位是已部署的系统。这包括模型、工具、提示词、权限、检索来源、审查关卡、日志和恢复流程。
SecRespond Google News 周期后值得关注的三个信号
下一项考验,是供应商是否能改善无引导发现、修复验证和可复现的生产评估。
第一个信号是独立复现。研究人员和安全供应商可以使用其他框架、提示词、工具和模型版本运行公开的 benchmark repository。
复现将揭示静默入侵差距是否能在脚手架变化后依然存在。如果专用取证智能体仍会遗漏未告警的持久化机制,论文的核心判断就会更有说服力。
如果确定性搜索流程带来大幅提升,结论则会略有变化。瓶颈将较少存在于模型知识,更多存在于调查设计、工具路由和强制覆盖范围。
这仍会削弱有关通用自主智能体的主张。同时,它也会为更安全系统提供更清晰的工程路径。
第二个信号是供应商是否发布独立的检测与修复结果。单一的“事件响应准确率”数字可能掩盖 SecRespond 揭示的规划差距。
有用的评估应说明系统发现了什么、遗漏了什么、提出了什么行动,以及如何验证完成情况。它们还应报告拒绝、工具故障以及需要人工介入的情况。
尤其要关注针对持久化机制的测试。对与告警关联的恶意软件有所改进固然重要,但这并未解决基准测试的主要盲点。
还要关注计划是否覆盖足够广泛的清理工作。更强的智能体应能在适用时处理进程、文件、账户、计划执行、网络控制、凭证轮换、服务恢复和修复后验证。
第三个信号来自受监督 SOC 部署的证据。供应商需要展示其智能体在真实遥测、内部流程、访问控制和分析师批准关卡下的表现。
最有力的运营证据不会只是一篇润色精美的案例研究。它还将包含遗漏率、升级率、缺乏支持的主张、纠正频率,以及分析师未经修改即批准的建议比例。
可信的部署应保留审计轨迹。审查人员需要能够将结论追溯至工件,并确定智能体停止前完成了哪些搜索。
组织还应测试权限边界。只读调查、建议行动和自主执行代表三种不同的风险级别。
SecRespond 支持在前两个级别采用 AI,同时对第三个级别施加沉重的举证责任。其结果不足以证明,应将广泛的遏制权力交给尚未证明具备全面发现能力的模型。
Google News 的头条终会淡出视野,但这项基准测试给安全团队留下了一个长期的采购问题:当没有任何告警提示它该去哪里查找时,智能体究竟能发现什么?
要求供应商用可复现的证据回答这一问题。接着再问:系统如何验证每一步清理操作,并在存在不确定性时向人工响应人员发出信号。
这些答案将揭示,AI SOC 产品是在成长为调查员,还是仍只是围绕现有检测能力提供快速协助的助手。目前,SecRespond 将全部 23 个受测模型都归于这条界线的助手一侧。



