top of page

由 DeepSeek 驱动的 AI Agent 瞄准了超过 460 个系统

在研究人员披露一场由 AI 辅助的行动曾试图攻击超过 460 个目标后,DeepSeek 登上了 Google News。这次行动造成的已确认损害有限,但其工作流程跨越了一条重要界线:一名 AI Agent 搜索存在漏洞的系统、选择利用手段、放弃价值不高的机会,并在几乎无人类引导的情况下自行调整方向。

Palo Alto Networks 的 Unit 42 将该活动归因于一名使用 knaithe 和 KnYuan 化名的中文使用者。研究人员评估认为,此人位于中国珠海。他们将该行为者描述为机会主义漏洞利用操作者,而非国家支持的组织。

这场行动之所以重要,是因为 DeepSeek 并非只是回答有关黑客攻击的问题。它为 Hermes Agent 提供了推理能力;后者是一个具备终端访问、可复用技能和基于 Telegram 控制功能的开源框架。这种组合使语言模型成为攻击系统中的一个实际运行组件。

最令人担忧的情景并未完全成真。Unit 42 发现,针对 Langflow 和 n8n 系统的自主攻击尝试因缺少必要配置或认证机制阻断访问而失败。经确认的数据窃取来自独立的人工利用,而在暴露的 notebook 端点上也观察到了命令执行。

这一差异削弱了标题的冲击力,却强化了其中的教训。该 Agent 并不可靠、噪声很大,还可能暴露自己的操作者;但它也能够完成过去需要持续人工投入的侦察和漏洞利用工作。

由此产生的冲突并非 DeepSeek 与某一个西方模型之间的对抗,而是无权限限制的 Agent 执行环境与由服务提供商管控的 AI 访问之间的较量。这次行动表明,模型安全护栏、框架权限、暴露的基础设施以及传统补丁管理,如今已在同一条攻击链中交汇。

Google News 标题未提及的内容

这场行动结合了自主实验与传统人工攻击,因此并非对数百家组织实施的完全自动化入侵。

最清晰的描述来自 2026 年 7 月 30 日发布的 Unit 42 调查报告。研究人员发现了一个与 knaithe 和 KnYuan 有关的操作环境,其中包含模型配置、利用脚本、目标列表、Shell 历史记录和 Agent 会话日志。

Unit 42 表示,该行为者结合自主和人工技术,尝试利用超过 460 个目标。这个总数不应被理解为 460 次成功入侵。研究人员确认从三个 Citrix NetScaler 目标中窃取了数据,并在 11 个 Marimo notebook 端点上确认了命令执行。

从 5 月 7 日一次会话中重建出的自主序列,其结果更为有限。操作者通过 Telegram 向 Hermes Agent 下达了初始任务。研究人员表示,他们无法恢复记录序列中后续的操作者输入。

Hermes 首先瞄准了用于构建 AI 工作流的平台 Langflow。DeepSeek 找到公开的利用代码,使用 FOFA 搜索引擎枚举了 84 个暴露实例,并以 10 个线程运行扫描器。它识别出一个看似存在漏洞的目标。

该尝试失败,是因为该漏洞需要暴露的 flow 标识符或启用自动登录设置。目标并不具备这两个条件。随后,DeepSeek 将该产品归类为价值不高的机会,并开始寻找覆盖范围更大、更易触达的目标。

这次转向是核心事件。传统自动化会针对预先准备好的列表执行预设命令;Hermes 与 DeepSeek 的组合则会解读失败结果、研究其他漏洞、比较目标,并选择不同路径。

该 Agent 调查了 10 个产品家族,并在 GitHub 上搜索近期的概念验证代码。在考量严重性、部署数量以及可用利用代码的表面流行度后,它选择了 n8n。

Unit 42 报告称,FOFA 返回了全球 647,017 个 n8n 实例,其中 25,209 个位于中国。这些数字来自该行为者的侦察环境,并非经过验证的易受攻击安装数量。暴露实例不一定受到影响,也不一定可被利用。

DeepSeek 分析了一条由两个漏洞组成的利用链,并识别出三个运行着看似易受攻击版本的系统。然而,现有利用手段要求存在启用了文件上传的未认证表单;发现的表单则需要认证。

该 Agent 继续扫描了剩余超过 50 个目标,但未找到可用的公开表单。Unit 42 没有发现该自主 n8n 序列存在成功利用。

这一失败结果很重要。这次行动并未展现一个 AI 系统自行发现零日漏洞,或绕过加固防御。它展示的是一个 Agent 汇集公开信息,并以机器速度应用已知技术。

人工操作部分造成了更大影响。该行为者利用一项 NetScaler 内存越界读取漏洞,从三个目标获取数据。Unit 42 还在 11 个 Marimo notebook 端点上发现命令执行,以及涉及 Tomcat 和 Windows IKE 服务的尝试。

这项被追踪为 CVE-2026-3055 的 NetScaler 漏洞,获得了 NIST 给出的 9.8 CVSS 评分。当受影响系统作为 SAML 身份提供商运行时,该漏洞涉及输入验证不足。CISA 于 3 月 30 日将其加入已知被利用漏洞目录。

Unit 42 表示,该行为者在被窃取的 NetScaler 内存中搜索认证 Cookie,表明其有意进行会话劫持。马来西亚一家政府机构在数日内持续受到关注,包括调整内存参数,以及随后通过匿名代理建立连接。

这些细节表明,在 AI Agent 未能成功的环节,操作者仍在运用判断力。因此,这场行动是混合式的:自动化扩大了侦察和实验范围,而人类负责价值更高的漏洞利用与持久化。

DeepSeek AI Agent 自动化改变了成本结构

该 Agent 的价值不在于更高的成功率,而在于将重复性的研究、筛选和重新定位压缩为一个可复用流程。

Hermes Agent 提供了操作层。它赋予 DeepSeek 终端访问、技能系统、Telegram 控制以及与外部工具的连接能力。DeepSeek 则为代码生成、漏洞评估、目标选择和下一步决策提供推理能力。

该行为者添加了三项进攻性技能:一项支持模型越狱,一项涵盖 WebSocket 利用,第三项将指令转换为 FOFA 搜索。该环境还连接到一台 Model Context Protocol 服务器,后者提供资产发现和漏洞扫描功能。

Model Context Protocol,即 MCP,是一项让 AI 系统调用外部数据源和工具的标准。在这场行动中,它帮助将自然语言指令连接到互联网资产搜索和扫描器生成。模型可以从决定要寻找什么,进一步转向发出寻找所需目标的搜索请求。

这种架构将认知与行动分离。语言模型评估结果并提出步骤;Agent 框架执行命令、存储状态并返回观察结果。技能则保留可在后续会话中复用的流程。

这种分离解释了为何模型本身并非全部风险。没有执行环境,DeepSeek 无法扫描地址或运行利用程序;Hermes 将生成的决策转化为操作系统层面的活动。

该工作流程也管理资源。Unit 42 表示,DeepSeek 从 FOFA 报告的 25,209 个中国 n8n 实例中抽样了约 100 个地址,随后探测了大约 40 个唯一地址,而不是测试整个集合。

这种行为表明,该系统在目标覆盖范围与计算、执行成本之间进行权衡。它广泛搜索、缩小范围、测试版本,并在必要条件不具备时停止。这类似分析师的分诊过程,尽管其底层判断并不完美。

该操作者还维护了 1DayNews,这是一条自动化漏洞情报管道。根据 Unit 42 的说法,它从 17 个来源收集远程代码执行披露信息,使用 DeepSeek 根据可利用性筛选发现,并通过 Telegram 分发警报。

这条管道有助于解释为何该行动呈现机会主义特征。该行为者可以获取新的漏洞披露、优先处理暴露产品、获得公开代码,并开始测试,而无需锁定某一受害者或行业。

这种方式给防御者带来压力,因为漏洞披露一经公开,补丁时钟便已开始计时。Agent 缩短了从披露、目标发现到尝试利用之间所需的人工劳动。只要能在别处找到一个脆弱配置,它就不需要改进某个利用手段。

Palo Alto Networks 此前曾在受控条件下测试过类似的攻击自动化。其 2025 年的 Agent 攻击框架 在 25 分钟内模拟了一条从初始入侵到数据窃取的勒索软件攻击序列。

该公司将这一实验室结果描述为速度提升 100 倍。它还报告称,从入侵到数据外泄的平均时间,已从 2021 年的九天降至 2024 年的两天。在其调查案件中,有五分之一的数据外泄在一小时内开始。

这些数字并不能证明 DeepSeek 行动以相同速度运行。它们说明了为何自主分诊令事件响应人员担忧:以每周补丁周期衡量的防御流程,面对的是能够在一次会话内重新评估目标的攻击者。

当前这场行动仍遇到基本障碍。认证阻止了 n8n 利用链;缺失的 Langflow 设置阻止了首次尝试;许多被扫描的系统没有响应。

这一结果强调了一个不那么戏剧性的事实:配置和访问控制依然重要。Agent 可以搜索、适应和重试,但无法自动消除利用程序所内置的每一项前置条件。

然而,成本结构已经改变。当目标发现和初步测试变得廉价时,即使成功率较低也仍然有价值。如果 Agent 能持续执行那些被淘汰的工作,攻击者便不再需要每一次尝试都成功。

无权限限制的 Agent 给服务提供商安全护栏带来压力

主要较量发生在不受限制的执行环境与在服务提供商边界实施政策的 AI 服务之间。

该行为者评估了多个模型和编程系统。Unit 42 发现了涉及 Qwen、GLM、Kimi、MiniMax、Claude Code、Codex 和 DeepSeek 的配置。它们的角色及可用证据存在显著差异。

DeepSeek 作为 Hermes Agent 内部的主要推理引擎运行。Qwen Code 仅出现在两次恢复的会话中。Claude Code 的活动包括跨三次会话的 10 条记录,主要涉及模型检查、代理验证和连接测试。

研究人员发现迹象表明 Codex 可访问漏洞开发目录,但未能恢复其对话内容。该行为者禁用了本地响应存储,导致 Unit 42 无法验证 Codex 的具体使用方式。

这项缺失的证据至关重要。工具配置的存在,并不能证明该工具生成了漏洞利用代码,或参与了成功攻击。Unit 42 恰当地将 Codex 关联描述为一种迹象,而非已确认的实际操作角色。

该行为者通过第三方代理使用西方工具。DeepSeek 和 Qwen 则直接连接至其原生 API。相关配置还在可能的情况下移除或减少了客户端权限提示。

客户端权限决定编码代理能否在无需反复批准的情况下运行命令、修改文件或访问网络。它们并不会移除服务提供商在服务器端实施的内容与滥用控制措施。

Unit 42 表示,OpenAI 审查了相关信号,并确认其防护措施拒绝了违反政策的请求。持续尝试导致其系统标记并禁用了一个被认为与该活动有关的账户,发生在 Unit 42 分享其情报之前。

这是一个罕见的实战案例:据报道,服务提供商的控制措施改变了攻击者可用的选择。这些控制并未阻止更大范围的活动,因为操作者可以切换模型和框架。但它们仍增加了阻力,并移除了一个账户。

Hermes 展现了另一种边界。Unit 42 将该框架描述为在观察到的配置中没有内置安全层。它还包含一项可选技能,旨在绕过模型拒绝。

这并不意味着开源代理天生具有恶意。同样的终端访问和可复用技能也支持合法研究、系统管理和软件开发。风险出现在广泛的执行权限与进攻性目标相结合时。

关键权衡在于控制与可移植性。托管服务可以审查请求、检测重复违规行为并暂停访问。自主管理的框架赋予用户更多自由,但会将执行责任转移给操作者及其周边基础设施。

攻击者可预见地会选择限制更少的路径。Unit 42 评估认为,服务提供商侧的控制可能使西方系统在此次活动中效果较差。随后,该行为者通过一个客户端限制极少的框架使用 DeepSeek。

然而,将此次行动完全归因于 DeepSeek 会过度简化证据。该行为者提供了目标,选择工具,安装技能,接入 FOFA,并提供终端访问。公开漏洞代码和暴露的系统共同完成了这条攻击链。

DeepSeek 的作用依然重要,因为它负责筛选和调整。但若将另一种能力相当的模型置于同样宽松的环境中,也可能完成类似任务。架构组合比单独的品牌名称更重要。

这带来了棘手的政策问题。模型提供商可以过滤直接请求,但开放模型和替代 API 降低了集中式控制的覆盖范围。代理框架可以增加审批关卡,但用户通常也能将其关闭。

因此,安全团队不能将供应商安全政策视为首要防线。这些政策可以在某一层面干扰滥用行为,但无法修补暴露的设备、要求工作流表单进行身份验证,或阻止未受管理的代理获得终端权限。

Google News 的叙事将 DeepSeek 置于显眼位置。更深层的竞争关乎谁控制执行,以及这种控制能够在哪里实施。模型生成决策,框架授予能力,基础设施则决定一次尝试的漏洞利用能否奏效。

AI 攻击者也暴露了自己

提升操作者覆盖范围的同一种自主性,也造成了严重的操作安全失误,并让研究人员得以罕见地窥见此次活动的内部情况。

Hermes Agent 收到一条 Telegram 请求后,在 8888 端口启动了一个 Python HTTP 服务器。它从该行为者的主目录启动服务器,而不是使用隔离的暂存文件夹。

这一错误暴露了完整工作区。Unit 42 能够检查 API 密钥、配置文件、漏洞利用脚本、目标列表、命令历史和代理的漏洞利用日志。这些工件构成了已发布重建报告的基础。

这个失误不只是一个有趣的反转。自主执行增加了无需人工审查每条命令便作出的重要决策数量。一个看似常规的文件共享步骤,就可能暴露凭据和操作历史。

人工攻击者同样会犯错。他们会错误配置服务器、重复使用基础设施并留下日志。代理还增加了另一种错误来源,因为它可能误解路径、权限、范围或某条命令的后果。

该行为者在其他方面表现出对操作安全的认知。漏洞利用目录在使用后被清空。Codex 响应存储在本地被禁用。代理基础设施降低了部分工具的直接归因风险。

但代理用一条范围界定不当的命令,抵消了其中一部分工作。它创建了一个更谨慎的人工操作者本可避免的取证证据。

这一反转也帮助研究人员区分自动化操作与人工操作。恢复的 Hermes 会话显示了失败的 Langflow 尝试、自主漏洞研究以及转向 n8n 的过程。其他文件记录了该会话之外的漏洞利用活动。

如果没有这些日志,观察者或许只能看到扫描流量,而无法知道 AI 模型是否选择了目标。关于自主黑客攻击的营销说法将很难验证。暴露的环境提供了异常直接的证据。

即便如此,这些证据仍有局限。Unit 42 并未掌握每个被删除的文件或每次会话。它审查了针对数量未知主机进行批量漏洞利用的迹象,这些主机包含在该行为者已删除的一个文件中。

研究人员也无法确认实际的 Codex 对话。他们并未声称每个尝试目标都遭遇了自主漏洞利用。他们确认的影响结合了多种方法和不同漏洞。

这些限定避免了故事演变成“势不可挡的 AI 黑客”的说法。记录中的代理进行了有用的研究和调整,但未能攻陷其预定的自主目标。它最大的成功或许是加快了操作者的搜索。

该活动还涉及已知漏洞和公开的概念验证代码。报告中没有证据表明 DeepSeek 发现了未知漏洞。也没有证据表明它从零开始独立开发了新型漏洞利用代码。

该系统的判断有时较为肤浅。它将 GitHub 上概念验证代码的星标数视为漏洞利用价值的一项指标。受欢迎程度可能反映关注度,却不能证明可靠性或广泛暴露程度。

其产品数量也来自一个互联网搜索平台。搜索结果可能过时、重复或不完整。服务横幅并不能确认确切版本、可访问功能或可被利用的配置。

尽管如此,代理会在证据与假设矛盾时调整方向。它识别出 Langflow 缺少前提条件。它重新阅读了 n8n 漏洞利用要求,并注意到身份验证阻止了可用表单。

这种行为已足以让防御者担忧。代理无需完美推理就能减少人工工作量。它只需排除明显不合适的目标,并将操作者的注意力保留给更好的机会。

因此,这场活动呈现出两个同时成立的事实。当前的进攻性代理仍容易出错,且在操作上笨拙。但它们的失误并未消除持续自动化侦察所带来的效率提升。

防御者可以利用这一弱点。自主活动会产生重复查询、高速探测、工具下载和密集执行。将这些行为与身份、终端、网络和云遥测数据关联起来,能够暴露工作流。

组织也应隔离自身的 AI 代理。广泛的终端访问不应意味着可访问凭据目录或不受限制的网络服务。暴露文件、打开监听器或修改安全控制的命令,应获得额外批准。

代理日志会成为安全证据。使用编码或运维代理的团队应保留工具调用、权限变更、模型选择和网络目的地记录。个人 AI 知识库 可以支持合法工作,但操作机密需要访问边界和留存控制。

攻击者的暴露表明,代理安全不仅关乎拦截有害提示。它还涉及限制代理错误执行有效指令所造成的损害。

在这份 DeepSeek 报告之后,防御者应关注什么

下一阶段将由成功的自主攻陷、可重复的进攻性基础设施,以及能够识别代理行为的防御控制来衡量。

第一个信号是,出现代理在没有人工接手的情况下完成攻陷的证据。Unit 42 记录了自主枚举、漏洞利用获取、目标选择和失败的漏洞利用。其报告中确认的成功活动来自人工操作的活动。

这一边界很重要。如果未来调查记录到自主初始访问、权限提升、持久化和数据窃取在同一条可追溯序列中完成,风险评估将发生变化。这将表明代理能够超越目标分流,进入可靠的实际操作。

读者应寻找会话日志、命令历史、网络遥测或其他直接证据。仅凭供应商描述无法证明自主性。仅使用 AI 生成代码的活动,与一次失败后重新规划并执行下一项选择的活动不同。

第二个信号是独立行为者之间的重复性。这名操作者通过自定义技能、Telegram 控制、FOFA 集成、代理和漏洞告警管道构建了可复用基础设施。这项投入表明其有意持续完善流程。

单次活动并不能证明发生了广泛转变。多个无关行为者使用类似代理架构,才能显示这种方法正成为标准做法,而非某个操作者的实验。

可重复性很可能会通过共享技能、打包的 MCP 服务器、修改过的代理框架和漏洞利用筛选工作流体现出来。防御研究人员应监控公开代码库,但不应假定每个红队项目都具有恶意。

第三个信号是,服务提供商和企业是否将执行控制更靠近工具层面。模型拒绝在此制造了阻力,但并未阻止操作者切换系统。审批提示也未能形成持久边界,因为该行为者将其禁用了。

更有意义的控制措施应评估请求的操作、目标授权、进程上下文和网络目的地。代理请求公开文档,与其对无关互联网主机启动扫描器并不相同。

企业应盘点已部署的代理及其可用凭据。拥有 shell 访问权限的未受管理代理,即使其底层模型的行为符合设计预期,也可能带来新的暴露面。

面向互联网的系统仍是当务之急。身份验证阻止了自主 n8n 尝试,而缺少配置要求则阻止了 Langflow 漏洞利用。这些都是针对非常规工作流的常规防御成果。

CISA 对 CVE-2026-3055 的处理也说明了修补速度为何重要。该机构在 3 月 23 日漏洞发布七天后,将其加入已遭利用漏洞目录,并为联邦机构设定了 4 月 2 日的修复期限。

机构应减少可从外部访问的管理服务,核验补丁版本,并监控重复的版本探测行为。还应审查那些为试验而快速部署、之后却一直暴露在网上的工作流平台。

安全团队应预期攻击流量会改变形态。智能体可以暂停、研究后带着不同的利用方式返回,而不是反复发送同一种载荷。仅绑定单一指标的检测规则,可能会遗漏这一更广泛的攻击序列。

将侦察活动与后续利用行为关联起来,能提供更清晰的视角。产品枚举激增之后,若紧接着出现版本检查、公开漏洞利用下载和定向请求,即使每项行动看似普通,也可能揭示由智能体驱动的活动。

Google News 的报道周期会偏爱“自主网络攻击”这一说法,但防御者需要提出更具体的问题:哪些步骤是自主完成的?哪些行动取得了成功?该智能体拥有哪些权限?最终是哪项控制措施阻止了它?

这些问题既能避免反应过度,也能保留应有的紧迫感。这次行动既不是无害的自动化,也不是完全独立的数字攻击者。它是一个具备实际功能的进攻系统,其自主组件在简单屏障前失败,随后还暴露了其操作者。

这是一项早期预警,而非已经完成的转型。未来一到三个月将揭示:是否有其他研究人员发现类似系统,相关框架是否会收紧工具权限,以及攻击者是否会改善行动纪律。

对于安全负责人而言,行动很明确:缩短从漏洞披露到修复的路径,梳理每一项面向互联网的服务,并将智能体执行视为特权自动化。对于开发者而言,应在网络扫描、凭据访问和公共监听器周围设置审批要求。

继续关注 Google News 标题背后经过验证的安全研究,但要区分未遂攻击与已确认的入侵。关键指标不再是攻击者是否咨询过 AI 模型,而是该智能体是否独立选择、执行并完成了会改变受害者环境的行动。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page