国家级黑客将 AI 用于攻击链各环节
Google 已记录到国家支持的黑客几乎在攻击的每个阶段使用 Gemini,但目前几乎没有证据表明存在完全自主的攻击活动。
这一发现改变了安全领域的讨论焦点。眼下的危险并非一个无需监督、可独立行动的 AI 黑客,而是能够更快研究目标、编写脚本、排查恶意软件问题并打造可信身份的人类操作员。
这篇 Google 新闻报道聚焦于 Google Threat Intelligence Group(GTIG)的研究。该团队利用事件响应数据、威胁研究以及对 Gemini 滥用尝试的可见性,分析恶意活动。
Google 发现了与中国、朝鲜、伊朗和俄罗斯有关的活动。这些行为者将 AI 用于侦察、漏洞研究、编程、社会工程和信息行动。
不过,Google 并未报告任何国家支持的团体曾通过 Gemini 实现整场入侵的自动化。人类操作员仍负责选择目标、管理访问权限,并作出重要的行动决策。
这一差异构成了本文的核心张力。AI 已经渗透至攻击链各环节,但广泛采用并不等于完全自主。
这一发展仍令防御方承压。安全团队必须识别那些如今能够更快推进、更频繁变化、且更具迷惑性的熟悉攻击手法。
Google 新闻揭示 AI 覆盖入侵周期
最重要的变化是,AI 已从零散试验进入入侵周期中可重复执行的任务。
Google 于 2026 年 2 月发布了详细的 AI 威胁评估。该公司表示,多年来一直观察到对手逐步将 AI 整合进其行动中。
这种整合如今覆盖入侵的多个阶段。攻击者会在发动攻击前利用模型研究组织、员工、技术以及已公开披露的漏洞。
在行动期间,他们可以请求生成代码、调试脚本、翻译信息,或开发新的社会工程方法。获得访问权限后,他们还可寻求有关命令、数据处理或额外工具的帮助。
Google 的 AI 威胁研究结果识别出五大类恶意活动,包括模型提取、AI 辅助行动、智能体试验、AI 集成恶意软件,以及地下越狱服务。
模型提取是指通过反复交互,将强大模型的有用行为转移到另一套系统中。这使模型本身成为情报和知识产权攻击目标。
对企业防御者而言,AI 辅助行动更具直接相关性。Google 观察到政府支持的攻击者利用 Gemini 进行编码、脚本编写、目标研究、漏洞分析和失陷后的支持工作。
智能体 AI 指能够规划步骤、使用工具并为实现目标调整行动的系统。Google 看到攻击者在侦察和软件开发中试验这些能力。
AI 集成恶意软件则更进一步。恶意程序不再仅在部署前使用聊天机器人,而是在运行过程中与模型通信。
Google 提到了 HONESTCUE,这是一种使用 Gemini 应用程序编程接口的实验性恶意软件家族。该恶意软件试图获取用于下载并执行另一恶意组件的生成代码。
这并不意味着 HONESTCUE 是一个能够自主行动的数字特工。它表明攻击者正在探索如何让模型成为恶意软件运行逻辑的一部分。
这一差异很重要,因为离线脚本在部署后的行为可预测。连接模型的恶意软件则能根据环境请求新指令或生成响应。
这种灵活性为攻击者提供了更多选择,但也带来了依赖条件,包括互联网访问、可用账户、可靠提示词,以及不会破坏行动的响应。
Google 表示,会停用与已检测恶意活动相关的项目和账户。这使服务提供商的执法措施成为攻击者使用商业模型时面临的另一项障碍。
地下服务试图绕过这些控制措施。一些服务声称提供不受限制的系统,但据报道依赖越狱后的商业接口或开源组件。
由此形成的生态更像是访问权限市场。攻击者无需训练前沿模型,只要能获得临时、伪装或被盗的访问权限即可。
这正是标题具有意义的原因。AI 已不再局限于优化钓鱼信息或生成实验性恶意软件样本。
它已成为一种通用助手,可在攻击活动的多个环节提供支持。每一次使用都可能节省时间、降低语言障碍,或拓展操作员的技术能力范围。
国家支持团体正将 AI 用于不同问题
国家级攻击者对 AI 的采用并不均衡,因为每个团体都会将 AI 应用于其既有任务、资源和行动习惯。
Google 将 Gemini 的滥用尝试与多个政府相关行为者联系起来。观察到的模式反映了熟悉的国家优先事项,而非一套统一的 AI 攻击手册。
一些朝鲜操作员利用 AI 研究网络安全或国防企业中的职位、薪酬和员工情况。这些信息可为虚假招聘和内部访问计划提供支持。
据报道,另一个朝鲜团体每周多天向 Gemini 咨询。其操作员在工作受阻时寻求技术协助、故障排查支持,以及生成恶意软件代码的帮助。
这些例子表明,AI 正在降低实际操作门槛。操作员无需等待专家或检索大量技术资料,即可快速获得解释。
朝鲜的攻击活动本就兼具经济动机、间谍活动和就业欺诈。AI 生成的人设和修改后的图像可以增强这些行动,但不会改变其基本目的。
Palo Alto Networks 记录了疑似朝鲜账户利用图像工具创建虚假身份的情况。其事件响应研究还描述了由合成或再利用资料支持的虚构公司。
与伊朗有关的行为者则以不同方式使用 AI。Google 表示,其中一个团体显著扩大了针对预定受害者的侦察活动。
侦察是在入侵前收集信息的过程,可能包括梳理一个组织的员工、系统、供应商、技术和暴露服务。
更快的研究有助于攻击者定制诱饵,或识别有希望的访问路径。它也可以关联分散的公开信息,而这些信息原本可能被人类忽略。
Google 观察到与中国有关的 APT31 团体正在试验智能体能力,以自动化侦察并扩大行动规模。该团体并未将整场攻击活动交给模型。
相反,据报告的活动是在一个明确任务周围部署自动化。这种方法更为实际,因为侦察通常比漏洞利用或横向移动承担更低的行动风险。
错误的研究结果只会浪费时间。受害者网络中的错误命令则可能暴露操作员、导致系统崩溃,或毁掉宝贵的访问权限。
俄罗斯、中国、伊朗和朝鲜也曾利用 Gemini 开展信息行动,Google 表示。这些任务包括生成文章、人设以及其他攻击活动素材。
信息行动旨在塑造认知,而非直接入侵计算机。生成式模型非常适合以较低的边际成本制作多种文本和图像变体。
然而,产出量并不保证影响力。一次行动仍需要分发渠道、可信账户、受众定位,以及能与真实社群产生共鸣的叙事。
因此,Google 的发现描述的是能力增强,而非统一的高成熟度。资源充足的间谍团队和欺诈性雇员行动可以为不同目标使用同一个模型。
共同收益在于便利性。模型在一个界面内结合了翻译、研究、编程辅助和内容生成。
这种便利性降低了攻击阶段之间的摩擦,但不会消除选择目标、维持访问权限和规避检测所需的专业能力。
真正的较量是人工指挥与 AI 自动化之间
决定性冲突并非攻击者 AI 对抗防御者 AI,而是人工指挥的行动与日益自主的工作流程之间的较量。
Google 的证据显示,模型正在影响几乎每个入侵阶段。但这并不表明国家级团体已常规性地将完整入侵委托给自主系统。
GTIG 首席分析师 John Hultquist 向网络安全媒体报道表示,各国仍在确定 AI 在哪些环节带来的收益大于摩擦。
这种不确定性解释了为何采用方式呈现任务导向。攻击者偏好重复性强、可检索、语言密集或易于验证的工作。
侦察符合这一特征,代码解释、脚本生成、漏洞摘要、翻译以及社会工程内容制作也是如此。
高风险行动带来了更棘手的问题。漏洞利用、持久化、凭证使用和横向移动,都依赖于不断变化环境中的准确上下文。
模型可能生成一条看似合理、但技术上错误的命令。它可能误解网络、选择噪声过大的技术,或暴露其控制者。
国家支持的间谍团体重视隐蔽性,因为一个持久立足点可能在数月内持续发挥价值。如果自动化立即暴露行动,再快也意义有限。
网络犯罪团体可能更愿意接受这种权衡。他们往往优先考虑面对大量潜在受害者时的规模、速度和短期回报。
这种差异表明,AI 的影响不会均匀到来。较小的犯罪行动可以获得过去需要专业人员才能具备的能力。
精英国家级团体可以利用同样的工具减少例行工作。不过,其经验丰富的操作员可能仍会谨慎对待自主执行。
因此,两条相反路径已十分清晰。人工指挥的能力增强提供控制力和较低的行动风险,而自主化则提供规模和速度。
现有公开证据仍更支持能力增强。人类负责定义目标、核查输出,并决定何时采取行动。
不过,边界正在移动。AI 集成恶意软件和智能体侦察使模型能够承担的不再只是咨询性工作。
HONESTCUE 说明了这一转变。该恶意软件将模型访问纳入其执行链,尽管更广泛的行动仍依赖传统攻击者基础设施。
Google 在 2026 年 5 月的研究提供了更有力的证据。GTIG 识别出其认为首个利用 AI 开发零日漏洞利用程序的威胁行为者。
零日漏洞是指攻击者准备利用时,受影响厂商尚未知晓的漏洞。在那一刻,防御者没有可用补丁。
Google 表示,该犯罪团体计划将这一漏洞用于大规模利用。该公司已通知受影响组织和执法部门,可能阻止了这场计划中的攻击活动。
受影响的产品和威胁行为者均未被公开点名。这限制了对该漏洞利用程序及其开发过程进行独立评估的可能性。
不过,这一案例使 AI 更接近决定性的攻击阶段。漏洞发现和漏洞利用代码开发历来需要专业知识和大量测试。
Google 后来描述了对抗性工作流向工业化规模使用 AI 的更广泛转变。其5 月威胁追踪报告涵盖了漏洞利用生成、规避检测、自主恶意软件、信息行动以及对 AI 依赖项的攻击。
这一演变并不能证明已出现完全自主的攻击链。它表明,彼此独立的 AI 辅助组件正变得更强大,也更具实际作战意义。
核心问题是,攻击者能以多快的速度将它们连接起来。侦察代理、漏洞利用生成器和自适应恶意软件组件在能够可靠协同时,会带来更大危险。
目前,人类判断仍是连接这些环节的纽带。防御者不应假设这一限制会永远不变。
AI 压缩时间,但不会取代既有技术
AI 在近期最可信的优势,是压缩执行时间,而非创造一种全新的网络攻击类别。
已观察到的攻击活动仍依赖于可识别的方法。攻击者使用被盗身份、恶意链接、存在漏洞的软件、远程管理工具和已被攻陷的基础设施。
AI 通过减少各步骤之间所需的人力来辅助这些技术。它可以起草诱饵内容、修改代码、解读错误,或总结目标的技术栈。
这种加速至关重要,因为网络安全本就是一场竞赛。防御者需要时间来发现入侵、调查其影响范围并遏制攻击者。
CrowdStrike 的2026 年威胁报告称,AI 赋能的对手活动同比增长 89%。报告还指出,平均横向突破时间为 29 分钟。
横向突破时间衡量的是从初始访问到横向移动至其他系统之间的时段。时间越短,防御者隔离首个被攻陷账户或设备的余地就越小。
CrowdStrike 在该报告中追踪了 280 多个已命名对手。该公司称,AI 被用于侦察、凭证窃取、规避检测、恶意软件活动和虚假身份构建等环节。
该公司将与俄罗斯有关联的 FANCY BEAR 与 LAMEHUG 联系起来。据报道,这种恶意软件使用大语言模型生成用于侦察和文件收集的命令。
Palo Alto Networks 同样发现,大规模采用 AI 的国家级行动证据仍然有限。该公司将 2025 年描述为运营实验的早期阶段。
这些发现并不矛盾。AI 的使用可以从较低基数迅速增长,同时在整个威胁环境中仍呈现不均衡状态。
现有证据支持一个审慎结论:在能够持续创造熟练操作人员无法获得的能力之前,AI 正先让既有工作变得更快、更易获取。
这一差异应影响安全投入决策。购买一款贴有 AI 标签的防御产品,并不能解决薄弱的身份控制、未修补的系统或过度授权问题。
组织仍需要在端点、云系统、软件流水线和身份服务中部署可靠的遥测能力。AI 辅助攻击仍会通过其执行的行为留下可见痕迹。
生成的钓鱼信息仍需被投递。被盗凭证仍会产生认证事件。恶意软件仍会创建进程、访问文件或通过网络进行通信。
不过,防御者应预期更大的变化性。攻击者可以改写脚本、个性化信息并修改诱饵内容,而无需承担同等的人工成本。
因此,静态指标的价值会更快下降。一个哈希值或精确文本模式或许能识别某个工件,却会漏掉许多生成的变体。
行为检测变得更加重要。它寻找可疑行为和行为序列,而不只依赖工件的外观。
安全团队还需要更快的分诊能力。如果 AI 帮助攻击者缩短研究、访问和横向移动之间的间隔,缓慢的告警审查将成为更大的运营弱点。
Google 也在防御端应用同类技术。该公司介绍了用于漏洞发现的 Big Sleep,以及用于自动化代码修复的 CodeMender。
这形成了一场不对称竞赛。攻击者只需一条可行路径,而防御者必须保护众多系统并处理误报。
防御者也拥有自身优势。在这些系统得到正确管理时,他们掌控着企业身份、配置、日志和执行控制点。
最终结果较少取决于谁拥有 AI,而更多取决于谁能将自动化与更高质量的上下文、权限和验证结合起来。
证据仍存在重要局限
广泛使用 AI 已得到充分支持,但关于国家级组织完全自主入侵的说法仍走在公开证据之前。
Google 对 Gemini 的滥用拥有不同寻常的可见性。它能够观察提示词、关联账户以及企业防御者无法看到的模式。
这种可见性带来了有价值的情报。同时也意味着,公开发现反映的是单一提供商的服务和检测能力。
攻击者可以使用其他商业模型、本地托管系统、被盗账户或定制基础设施。Google 的数据集无法代表所有对抗性 AI 工作流。
反向的限制同样存在。看到恶意提示词并不能证明操作者在真实入侵中成功使用了模型给出的回答。
威胁研究人员会通过将模型活动与已知攻击者、基础设施、恶意软件或事件证据关联起来,以强化评估。公开报告很少披露每一项支撑细节。
提供商必须保护调查、客户和检测方法。这种必要的保密性使外部人士无法复现某些结论。
2 月研究还包含一项明确限制。Google 尚未观察到国家级组织使用 Gemini 自动化网络攻击的大部分环节。
这一发现避免了一种看似容易却具有误导性的解读。覆盖攻击链各个环节,并不等同于一条连续、自动化的攻击链。
某个组织可以在周一使用 AI 开展研究、周二编写代码、周三进行翻译。人类操作人员仍可能连接每一个行动。
自主系统面临可靠性问题,而这些问题在入侵期间的代价会变得高昂。模型可能会幻觉事实、错误处理凭证、重复执行操作,或误解工具输出。
它们也可能形成可识别的模式。过度扫描、重复查询或快速执行命令,可能使攻击活动更容易被发现。
国家级操作人员必须考虑归因风险。行为不可预测的自动化系统可能暴露基础设施、泄露目标,或引发政治后果。
商业模型的控制机制增加了另一项限制。提供商可以识别滥用、停用账户、调整安全防护措施,并与防御者共享指标。
攻击者则通过越狱、轮换账户、中间件和开源模型作出回应。每一种规避方式都会增加防御者可以调查的基础设施。
零日漏洞案例也应谨慎看待。Google 称,代码特征表明 AI 可能参与其中,包括异常详尽的解释性注释以及与生成式 Python 相关的模式。
这些信号支持一种评估,但并非万无一失的检验。人类可以写出类似代码,生成的代码也可以被编辑。
Google 分享的攻击者、目标和受影响软件信息有限。因此,独立研究人员无法全面审查相关证据。
报道中的零日漏洞案例仍具有重要意义,因为 Google 将 AI 辅助与一项计划中的大规模漏洞利用行动联系起来。
但不应将其延伸解读为证据,证明模型可以独立发现、武器化并部署未知漏洞,以攻击任意目标。
供应商指标同样需要谨慎解读。CrowdStrike 所称的 89% 增长反映的是其定义、所观察的客户和追踪到的活动。
这并不意味着所有攻击中有 89% 使用了 AI,也不能证明 AI 导致了速度或规模的每一次增长。
安全负责人应区分三项说法:攻击者广泛使用 AI;一些 AI 辅助技术能够在真实行动中奏效;自主攻击活动可以替代专家团队。
证据强力支持第一项说法,也日益支持第二项。第三项在广泛运营规模上仍未得到证实。
这种层级有助于让防御规划保持务实。组织应应对已经得到验证的加速趋势,同时为更高程度的自主性做好准备,而不假装它已无处不在。
安全团队接下来应关注什么
下一阶段将由经过验证的漏洞利用开发、自适应恶意软件,以及攻击者操作时间的可衡量缩短来界定。
第一个信号是另一个经独立记录的 AI 辅助零日漏洞案例。重复出现将表明,5 月的案例并非孤立事件。
研究人员应寻找将模型交互与漏洞发现、漏洞利用构建、测试和实际部署联系起来的证据。
清晰的技术工件会强化这一评估。可复现的分析比泛泛声称代码看起来像机器生成的更重要。
若出现数个经确认的案例,软件供应商将面临更大压力。他们需要缩短修补周期、改进漏洞利用检测,并对暴露代码进行自动化审查。
缺少更多案例并不能证明风险已经消失。这可能表明,可靠的零日漏洞开发仍然困难,或难以被观察到。
第二个信号是在真实入侵中发生适应行为的恶意软件。PROMPTSPY、HONESTCUE 和 LAMEHUG 指向了与模型连接的执行能力,但自主性存在一个连续谱系。
关键检验在于,恶意软件能否在无需操作人员持续指导的情况下解读系统状态并选择有效行动。
防御者应关注那些能够根据本地条件生成命令、调整收集优先级或选择规避方法的程序。
成功的自适应行为会强化自主性论点。反复出现的运营失败则会支持继续保持人工监督。
这一信号也会影响网络控制。组织可能需要区分合法的模型访问,与遭入侵应用调用外部或本地托管系统的行为。
第三个信号是,与 AI 辅助工作流相关的攻击者潜伏时间和横向突破时间出现可衡量下降。
更快的移动将表明,自动化正在改善攻击活动执行,而不仅仅是内容生产或研究。
安全提供商应说明其测量方法。他们应区分犯罪活动和国家支持的行动,并明确 AI 在时间线中影响了哪些环节。
如果国家级组织在加快行动的同时保持隐蔽性,防御者将面临最困难的情境。他们会失去响应时间,却得不到明显的检测信号。
如果自动化产生嘈杂行为,防御性 AI 或可抵消部分速度优势。自动化关联分析和遏制措施可以在人工分析师完成调查前采取行动。
组织无需等到这些信号出现后才采取行动。他们可以通过加强身份控制、限制服务账户权限,以及监控异常模型访问来降低暴露面。
他们应在敏感的工程和安全工作流中记录 AI 交互。模型凭证应获得与其他高权限应用密钥同等的保护。
软件团队应审查第三方 AI 连接器和依赖项。Google 曾警告,遭入侵的 AI 组件可能暴露 API 凭证,并提供进入更广泛环境的路径。
招聘和承包商流程也需要更严格的验证。合成身份和 AI 辅助面试使非正式核查的可靠性下降。
应对措施仍应保持适度。全面封禁所有 AI 服务,可能会迫使使用行为转入非受管账户,从而失去可见性。
更好的方法是明确批准使用的服务、保护凭证、记录访问情况,并限制自动化工具可触达的范围。
安全团队还应为具有重大影响的操作保留人工审核。不能仅因为某个代理能够很好地执行低风险分析,就授予其广泛的生产环境权限。
最新的 google news 报道是对集成风险的警示,而非科幻小说。攻击者正在将模型接入他们早已熟悉的工作流程。
防御者应提出一个实际问题:如果攻击者明天将入侵过程中哪个缓慢、重复的步骤自动化,它会变得最危险?
这个答案应指导下一项控制措施、检测手段或演练。如今就测试这些假设的组织,将在 AI 从辅助走向可靠自主时做好更充分的准备。



