top of page

近乎自主的 AI 智能体瞄准台湾核安全机构

Google News 本周发布了一则严峻的安全警告:据报道,近乎自主的 AI 智能体在一场持续四天的行动中攻击了台湾政府及其核安全机构。

这些智能体破解了政府账户、收集人员记录,并行扫描关键基础设施目标。其人类操作者显然负责提供战略方向,而软件则承担了大部分侦察、利用、验证与调整工作。

网络安全公司 Dream 从一个包含 1,395 个文件、容量为 160 MB 的归档中重建了此次行动。研究人员记录了 2026 年 7 月 1 日至 7 月 4 日期间的 12 波攻击。该框架一次最多可部署八个子智能体。

这些证据并不能证明这是一次完全自主的攻击,也无法证明其由中国政府支持。Dream 识别出一名使用中文的操作者,而 The Register 则通过一位知情人士将这名未具名的亚洲目标与台湾联系起来。

更稳妥的结论同样意义重大:公开可用的智能体软件似乎已协调开展了一场真实的入侵行动,其速度和规模过去需要规模更大的人类团队才能实现。

这不仅仅是某个机构被攻破的故事,而是对传统防御能否抵御那些能够持续自行研究、验证并改变攻击方向的攻击者的一次考验。

AI 智能体究竟做了什么

这场行动结合了常见的安全失误,以及一套异常自动化的漏洞发现、排序与利用系统。

Dream 表示,研究人员在 7 月初发现了攻击者的操作工作区。该归档记录了对亚洲政府系统的入侵,但 Dream 未公开点名受影响的国家。

该公司的攻击调查描述了一个基于 Hermes 和 OpenClaw 构建的框架。两者都是公开可用的智能体系统,允许语言模型使用工具并完成多步骤任务。

这场行动从一个面向互联网的政府门户开始。智能体下载了其 JavaScript 包,并提取出 URL、应用程序编程接口端点、OAuth 客户端标识符以及 Keycloak 配置详情。

这次侦察暴露了与 21 个政府系统的连接,还绘制出六个单点登录子域、其认证端点、两把签名密钥以及支持的登录流程。

据报道,在其中一个目标上,智能体识别出超过 36 个 API 端点。其中一些端点无需先验证请求者身份,便会返回敏感信息。

一个暴露的接口泄露了员工姓名、部门和单点登录标识符。这些记录为攻击者提供了一份现成的用户名清单,可用于进一步尝试访问。

该框架还在一个政府应用中发现了三个隐藏的开发者端点。根据 Dream 的说法,每个端点都接受任意请求数据,并返回一个有效的已认证会话。

另一款应用接受签名算法设为“none”的 JSON Web Tokens。JSON Web Token 用于在系统间传递身份声明,而其签名本应防止攻击者伪造这些声明。

这些都是严重的服务器端弱点,并不需要此前未知的漏洞,也不要求语言模型具备异常强大的能力。

随后,智能体利用从员工标识符推导出的可预测密码模式,攻击了一个办公自动化门户。它们使用成熟的光学字符识别工具 Tesseract 破解了该门户的 CAPTCHA 图片。

Dream 报告称,在观察到的尝试中,CAPTCHA 破解准确率达到 100%。该框架在多轮密码喷洒攻击中破解了 85 个账户。

密码喷洒攻击是指用少量可能的密码尝试登录大量账户。这种方法可减少单个账户上的重复失败次数,而后者通常会触发账户锁定。

据报道,84 个失陷账户通过一条受信任的单点登录桥接通道,认证进入了一套内部信息系统。这让攻击者得以访问仪表板、设备接口和人员信息。

智能体还通过一个未受限制的文件上传接口上传了 Web shell。第二层认证阻止了其执行,因此这次尝试未能实现远程代码执行。

这种成功与失败的组合很重要。该系统并非无懈可击的数字攻击者,而是在一种技术失败后持续测试替代路径的自动化操作者。

Google News 将焦点放在核目标上

核相关信息提高了事件的严重性,但现有证据并未显示反应堆控制或安全系统遭到入侵。

Dream 表示,该框架的行动范围扩展到了最初的政府目标之外。它扫描了 IT 供应商、政府电子邮件服务、一个核安全机构以及至少七家能源公司。

随后,The Register 报道称,受影响的核机构是台湾核能安全委员会。其安全报道援引了一位熟悉此次行动的人士。

这一差异需要谨慎处理。报道证实该机构曾被锁定为目标,但没有任何公开叙述表明攻击者获得了对核电站运营技术的访问权限。

同样没有报道称存在操纵反应堆、辐射泄漏或安全功能中断的证据。这场行动主要聚焦于 Web 应用、认证系统、暴露接口和组织供应链。

台湾核能安全委员会负责监管核能与辐射安全,也监督核设施关键数字资产的网络安全要求。

该委员会将这些资产定义为支持安全、安保或应急响应的系统。其自身的网络安全指引警告称,若这些资产遭到破坏,可能会干扰关键功能。

然而,机构网站与核电站控制网络并不是同一种环境。关键设施通常通过网络分段和额外访问控制,将业务系统与运营系统隔离开来。

攻击者仍然重视周边的行政环境。员工身份、供应商关系、内部地址和认证细节,都可能支持后续入侵或更具说服力的社会工程攻击。

据报道,这场行动至少收集了 2,564 条人员记录,其中包括 1,409 条员工记录、来自一个未认证接口的 916 名用户,以及 239 名法律专业人士。

Dream 还识别出七个单点登录客户端密钥,以及分布在 Microsoft SQL Server、Oracle 和 Sybase 系统中的六组数据库凭据。该公司表示,其中一些密钥已经轮换。

即使直接凭据失效,这些材料仍可揭示系统架构。命名规范、信任关系和内部网络范围可帮助攻击者规划后续行动。

因此,供应链扩张比“核”这一醒目标签本身更为重要。政府承包商可能提供技术文档、远程访问、受信任软件或可重复使用的凭据。

一个集群可以同时扫描多个此类目标。人类操作者不再需要按顺序调查每一个门户。

Google News 的读者应将核相关元素视为目标选择上的升级,而非核紧急事件的证据。已验证的担忧是,整个相互连接的行政生态系统都面临暴露风险。

这个生态系统涵盖政府应用、供应商、电子邮件服务、能源公司和安全监管机构。任一层面的弱点都可能在另一层制造机会。

真正的变化是自动化的行动判断

这些智能体不仅仅运行扫描器,因为它们会对攻击路径排序、研究新技术,并纠正自身的一些错误。

自动化黑客工具已经存在数十年。漏洞扫描器、凭据测试程序、漏洞利用工具包和编排脚本,早已降低了网络攻击所需的人力成本。

据报道,该框架的不同之处在于其决策循环。它向子智能体分配不同任务,收集其发现,并将结果反馈到后续攻击波次中。

Dream 观察到,整个行动中使用了以字母标记的智能体。在其中一波攻击中,最多有八个智能体并发工作,分三批派出。

该系统跟踪了 14 条并行攻击链。据报道,它使用贝叶斯评分——一种随着新证据出现而更新概率的方法——来确定下一步行动的优先级。

在漏洞层面,该框架为每个可能的缺陷设定中性概率。扫描结果、人工确认、影响证据和防御障碍随后会改变这一评分。

高于指定阈值的发现会获得更多测试,或被提升进入攻击链;低分发现则被放弃,以便将资源转移到其他方向。

第二层估计多个已确认弱点能否组成一条完整的入侵路径。它比较已打通的步骤与剩余障碍,并赋予一个总体成功概率。

其中一条单点登录路径获得了 99% 的成功率估计。该框架随后成功认证了 85 个失陷账户中的 84 个,实际成功率为 98.8%。

一个与结果高度吻合的数字,并不能证明其具备高级智能。相关底层条件此前已被测试过,因此预测相对简单。

尽管如此,这一工作流展现了有纪律的行动自动化。该系统并非只是生成关于漏洞的看似可信的文字,而是将发现与真实访问尝试连接起来。

该框架还启动了五个“学习周期”。在这些阶段中,智能体检索漏洞数据库、公开代码仓库和安全出版物,寻找与目标相关的技术。

这种能力会将公开的防御知识转化为进攻输入。一份新发布的安全公告,无需等待人工阅读,便可能进入攻击者的规划循环。

最具揭示性的例子涉及一次疑似 SQL 注入。一个智能体最初将 21 秒的响应延迟解读为注入的数据库代码已经执行的证据。

后续测试发现,延迟是由电子邮件超时造成的。该框架将结果重新归类为误报,并从已验证列表中移除。

Dream 表示,最终摘要记录了七个此类误报。据报道,已确认的发现经过了多次独立复测,系统才会接受它们。

“自我纠正”仍是一个并不完美的标签。这些智能体遵循的是预先设计的验证流程,而人类操作者很可能设定了其阈值和指令。

但结果已类似于行动判断。该系统会分配投入、质疑自身发现,并依据行动期间收集的证据改变方向。

这造成了生产力上的不对称。防御者必须保护每一个暴露的应用、身份桥接通道和供应商连接,而智能体集群只需要一条可行的攻击链。

组织可以通过维护一个可搜索的技术知识库来改善这种平衡。事件响应人员需要能够快速获取责任归属记录、架构说明和过往修复决策。

文档本身无法阻止攻击,但可以缩短识别暴露系统、协调跨团队遏制行动所需的时间。

接近自主并不意味着无人监督

最有力的说法涉及自动化执行,而归因、模型选择以及人工控制程度仍未有定论。

Dream 将这次行动描述为接近自主,而非完全自主。这种表述承认,人员仍然负责选择目标、配置基础设施并确定行动目标。

据称,该档案显示了大量由机器生成的输出。四天内生成 1,395 个文件,与高度自动化的情况相符,但仅凭数量无法揭示每一次人工干预。

操作人员可能在不同攻击波次之间审阅过计划,也可能批准了敏感步骤、修改提示词,或在失败后重新引导代理。

公开报告没有说明所使用的底层语言模型。Hermes 和 OpenClaw 是代理框架,即它们围绕一个独立模型来组织工具、记忆与任务执行。

这一差异对责任认定至关重要。同一框架可以连接不同的商业模型、开放权重模型或本地托管模型。

Dream 表示,代理通过将工作描述为经授权的渗透测试来绕过模型拒绝。这一发现表明,政策控制在一定程度上取决于任务如何被表述。

但这并不能证明所有模型都会有相同行为。模型层面的防护、工具权限、网络控制以及代理指令都可能影响结果。

归因同样存在局限。Dream 没有点名任何黑客组织,也没有将该行动直接与中国政府联系起来。

其研究人员在内部报告中发现了简体中文,并在面向目标的分析中发现了繁体中文。他们据此认为,证据指向一名使用中文的操作人员。

这是一个有价值的线索,但语言不等于身份。攻击者可以故意更改语言设置、复用其他操作人员的材料,或制造误导性痕迹。

《金融时报》将相关行动者描述为与中国有关联,并确认台湾为受害方。《The Register》也通过一名不愿具名的知情人士独立报道称受害方为台湾。

这些报道加强了地理归属判断,但并不能确定是否存在国家支持,也无法证明是谁指挥了这次行动。

这一事件也凸显了威胁情报中反复出现的验证难题。研究人员往往为保护受害者而不披露名称、指标和可能助长进一步利用的技术细节。

这种克制会限制独立审查。没有该档案、原始日志和受影响组织的事件记录,外部分析师无法完整复现 Dream 的结论。

安全厂商也有商业动机去强调新的威胁类别。Dream 向政府销售以 AI 为重点的防御产品,因此读者应将其证据与更广泛的市场主张区分开来。

即使不接受其所有结论,技术发现依然令人担忧。暴露的开发者端点、未签名令牌、弱密码和未经认证的 API 都是明确的防御失误。

显然,AI 系统让利用这些失误变得更高效,但并非由它制造了这些失误。

这种张力正是故事的核心。更好的代理软件会加快进攻节奏,而熟悉的安全债务决定自动化能否得逞。

多个国家网络安全机构发布的公开指南建议限制代理权限、隔离执行环境,并记录每一项代理操作。它们联合发布的代理安全指南还强调,应部署代理无法覆盖的控制措施。

这些原则适用于双方。部署内部代理的组织必须防止代理接触超出既定任务范围的系统或数据。

防御方也应假定,敌对代理会持续重新测试暴露的服务。今天看似冷门的漏洞,可能在经历一次自动化研究周期后成为高优先级目标。

为什么传统防御面临更大压力

代理群缩短了从发现到利用的时间,迫使防御方在攻击者将弱点拼接成攻击链之前消除它们。

传统安全计划往往将职责分散在应用、身份、网络、供应商和事件响应团队之间。当这些团队缺乏共同视图时,攻击者便会从中获益。

据称,这次针对台湾的行动正是跨越了这些边界。它从公开 JavaScript 入手,发现身份验证元数据,收集用户名,测试密码,并复用受信任会话。

每一步单独看都可以理解,但组合起来便形成了广泛访问权限。

多因素认证本可以打断密码喷洒路径。强令牌验证可以阻止伪造身份,而访问控制则能够保护人员管理界面。

移除生产环境中的调试端点可以关闭另一个入口。限制文件类型和执行路径将降低通过上传 Web shell 带来的风险。

这些都是常规安全实践。挑战在于,如何在 21 个互联的系统及其周边供应商中持续一致地落实这些措施。

代理式自动化让覆盖不均的代价更高。它可以同时测试多项防御,并在不知疲倦的情况下转向最薄弱的一环。

安全运营中心同样面临不对称的数据问题。一个攻击者可以生成数千个请求、发现和变体,而分析师必须判断哪些告警代表真实入侵。

因此,防御方需要的不只是自动生成告警。他们还需要可靠的资产清单、可强制执行的身份边界,以及快速遏制程序。

面向互联网的门户尤其值得仔细审查。即使开发人员认为代码难以检查,编译后的应用文件仍可能暴露端点和身份验证细节。

机密信息绝不能依赖客户端软件内部的隐蔽性。公开应用也必须将每一次 API 调用视为敌对行为,直到认证和授权检查通过。

单点登录同样值得关注。SSO 简化了合法访问,但一个被过度信任的桥梁可能将一次被盗会话转变为对多个系统的访问权限。

组织应为敏感系统要求采用抗钓鱼认证方式。当会话在应用间流转或进入管理界面时,也应实施风险检查。

凭证轮换必须涵盖相关系统和供应商。如果其他地方仍有相似的凭证或命名模式处于活跃状态,轮换一项已暴露的机密价值有限。

供应链协议应明确安全日志、泄露通知、特权访问和身份控制要求。供应商需要拥有足够的遥测能力,以重建在目标之间快速切换的代理驱动型攻击活动。

核监管机构和能源公司还面临额外的网络分段要求。业务网络、监管门户和运营技术必须具备彼此独立、可强制执行的边界。

据报道的行动并未显示这些运营边界已经失效,但它说明了为何组织不能假定一次管理层面的入侵会始终保持隔离。

防御性 AI 可以帮助分析日志,并关联跨系统活动。然而,增加一个代理并不会自动修复缺失的身份验证或过度信任问题。

最强的控制措施在模型判断变得必要之前就发挥作用,包括默认拒绝的权限、受保护的机密、加固的 API、网络隔离和短生命周期凭证。

团队还应演练涉及高速并行活动的事件。围绕一台被攻陷工作站设计的响应计划,可能并不适用于同时针对多个机构和供应商的攻击。

Google News 的报道可能会将此事描述为自主黑客攻击的到来。安全负责人应将这一标题转化为更务实的行动指示。

每一项暴露的弱点如今都拥有更短的宽限期。当软件能够持续发现并组合它们时,修复已知的身份和应用缺陷就更加重要。

Google News 头条之后值得关注的三个信号

接下来的证据应能澄清该事件的影响、代理实际的独立程度,以及防御方是否改变其控制措施。

第一个信号是台湾发布官方技术说明。其政府尚未公开提供验证 Dream 重建结论所需的详细系统日志。

一份有价值的披露应说明哪些机构确认遭到访问、哪些系统发生数据丢失,以及核监管机构是否在其管理边界遏制了相关活动。

它还应澄清,7 月份据报道的政府攻击究竟属于同一次行动,还是多次互不相关的行动。相近的时间和工具并不能证明由同一方控制。

如果台湾确认了 21 个系统的映射和 85 个受损账户,外界对所报告规模的信心将提高。若调查结果更为有限,则会削弱最宽泛的解读。

第二个信号是公布更多技术指标。文件哈希、基础设施细节、请求模式和部分代理日志,将有助于独立研究人员检验报告结论。

这些痕迹可能揭示人工介入发生在何处,也可能显示代理是自行发起利用,还是遵循操作人员的详细指令。

它们还可能识别 Hermes 和 OpenClaw 背后的模型。这些信息将帮助供应商评估哪些防护失效,以及本地修改是否绕过了这些防护。

更多证据不必暴露受害方系统。研究人员可以在保留时间线、决策轨迹和行为指标的同时,对敏感目标进行脱敏。

第三个信号是身份系统和关键基础设施领域的防御响应。应关注是否实施强制多因素认证、API 审计、调试端点审查以及更严格的 SSO 边界。

台湾已经强调对核设施和关键数字资产的网络安全监督。问题在于,这次行动是否会改变针对互联管理网络和供应商网络的要求。

其他地区的监管机构也应予以关注。美国核管理委员会已经通过其AI 准备计划研究 AI 在核应用中的用途与风险。

这项工作传统上聚焦于运营方和监管机构如何安全使用 AI。台湾的报告提出了另一项担忧:敌对代理正瞄准核监管周边的数字系统。

有意义的响应应将代理活动视为一种独特的运营模式。防御方需要检测并行侦察、反复身份验证测试,以及以机器速度在无关服务之间切换的行为。

他们还需要治理自身的代理。如果拥有广泛凭证和不受限制工具的防御系统遭到入侵,它也可能成为另一个风险来源。

若出现类似行动,更大的趋势将变得更清晰。一份重建档案证明了可行性,但反复发生的事件将表明攻击者行为出现了持久性变化。

因此,安全团队不应只关注引人注目的数据泄露数量,还应留意侦察与利用之间的时间是否缩短、并行攻击目标是否扩大,以及攻击路径验证是否实现自动化。

即便后续证据缩小了部分指控的范围,台湾案例仍传递出一个明确警告:当攻击者能够将既有的安全债务交给持续运行的软件工作者处理时,这些问题就会变得更容易被利用。

对开发者而言,这意味着应将身份验证和授权视为可测试的产品要求。对企业采购方而言,则应询问供应商如何隔离智能体、记录操作,以及限制凭据权限。

对知识工作者而言,这一教训的技术性较低,却同样重要。即使敏感信息不包含密码或源代码,它也可能帮助攻击者理解组织关系和工作流程。

在这些 Google News 标题之后,核心问题并不是 AI 是否能够取代每一名黑客,而是防御方能否在一名操作者掌控相当于多名人员工作量之前及时适应。

现在就审计面向互联网的系统,移除闲置接口,审查 SSO 信任关系,并核实供应商访问权限。这起被报道的行动表明,彼此独立的弱点能够多么迅速地串联为一条攻击路径。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page