Gambit AI Agent 攻击表明网络犯罪已进入自动化时代
Gambit 对 AI agent 攻击的调查发现,至少有 27 家公司遭到攻破、超过 60 万条支付记录被盗,每次扫描的平均入侵成本仅为 25.46 美元。
疑似攻击者并未依赖某一个能力异常强大的模型。相反,三款开源 AI agent 分别负责侦察、利用和攻击活动管理。这种安排将一组既有安全工具转化为近乎持续不断的攻击行动。
据称,受影响组织包括一家《财富》500 强酒店企业、一家美国大型航空公司、一家工业供应商以及一家在线时尚零售商。Gambit 未公开这些公司的身份。其结论仍属于阶段性评估,依据包括一台被恢复的中转服务器、经验证的网页窃密器、失窃数据和 agent 日志。
这场对抗已不再只是使用更先进软件的人类防御者与人类攻击者之间的较量。防御者受制于审批流程和维护窗口,而自动化系统则可以持续数小时地探测、重试并调整策略。
Gambit AI Agent 攻击在六天内波及 27 家公司
关键变化不在于攻击者是否向 AI 模型咨询,而在于据称三款 agent 在有限人工指挥下执行了攻击链中的大部分环节。
Gambit Security 表示,其恢复了攻击者的中转服务器,并重建了可追溯至 2026 年 7 月的活动记录。在 9 月 10 日至 9 月 15 日的六天期间,该服务器发起了 105 个攻击项目。
据 Gambit 的阶段性技术报告,在更广泛的攻击活动中,至少有 27 家公司受到不同程度的攻破。攻击者还瞄准了数百家在线零售商及其他企业。
据报道,影响远不止于漏洞扫描。Gambit 发现了未经授权的管理访问、被盗云凭证、数据库访问、支付卡盗窃,以及被植入结账页面的恶意代码等证据。
两家公司超过 60 万条未过期支付卡记录遭窃。在 Gambit 欺诈专家分析的记录中,488,372 条由美国发行。
攻击者针对至少 27 名已确认受害者部署了支付窃密器。Gambit 最初确认 19 个网站存在恶意脚本,另一名研究人员则将另外 100 多个受感染网站与该攻击活动关联起来。
网页窃密器是一种 JavaScript,可截取用户在结账页面输入的支付信息。由于客户仍会看到正常运行的商店,并且可能照常完成购买,因此它能够隐蔽运行。
这些脚本似乎通过多条不同的投递路径出现。在某些情况下,agent 将加载器附加到现有 JavaScript 库中,并恢复原始时间戳。这一步使得修改在随意审查时更不易察觉。
另一种注入方式隐藏在合法的 Google 标签代码块中。在一家美容零售商处,遭攻破的 AWS 访问权限让攻击者能够修改通过该公司自身云基础设施交付的内容。
据报道,在一家按需打印企业中,恶意代码通过 Kubernetes init container 进入生产环境。在那家酒店企业中,攻击者则将其植入用于渲染结账内容的缓存页面模型。
一家零售商在应用部署期间多次替换被篡改的结账文件。攻击者随即安装了一项计划任务,每两分钟检查一次该文件,并在必要时恢复窃密器。
这种持久化机制说明了 AI 网络攻击自动化为何具有实际运营意义。人类无需记住每个目标、回访每次失败的修改,或手动检查每一条新响应。
这些 agent 可以在攻击者处理另一名受害者时继续运行。它们还能够在攻击活动工作区中保留指令、报告、凭证和此前结果。
Gambit 表示,成功取得访问权限通常不到一天,有时只需数小时。The Register 的报道称,该行动瞄准了一家大型航空公司及另外 25 多家组织。
这一差别至关重要。这并非 agent 攻击刻意设置漏洞的应用程序的实验室基准测试。研究人员报告了针对实际运营企业的真实攻破事件及可量化损失。
三款开源 AI Agent 分担攻击链
Strix 负责寻找突破口,Cairn 负责获取访问权限,Hermes 则协调整个攻击活动,形成一条从目标选择到造成影响的自动化流水线。
第一个组件是 Strix,一款开源 AI 渗透测试工具。在 8 月 23 日至 8 月 31 日期间,攻击者针对 138 台主机以深度扫描模式运行了 146 次。
这些任务在 195 小时的实际经过时间内消耗了 633 个扫描器小时。两者的差异源于并行执行。攻击者可以同时运行多项调查,而无需等待单次评估完成。
Strix 通过 OpenRouter 使用 GLM 5.2,后期则使用 DeepSeek v4 Pro。OpenRouter 是一项提供不同开发者模型访问服务的平台。其报告为下一款 agent 提供了潜在弱点信息。
Cairn 会接收目标域名和以结果为导向的目标。这些目标包括获取管理权限或取得 shell,即让攻击者获得服务器命令行控制权。
随后,该 agent 会持续探测目标,直至达成目标、超时或被停止。Gambit 称,在观察到的攻击中,Cairn 使用了 DeepSeek v4.1 Flash。
Hermes 位于这些系统之上,既是攻击者的活动控制台,也是编排器。它负责管理任务、审阅结果、存储先前会话,并在取得访问权限后提供战术协助。
攻击者为 Hermes 设定了一个中文系统角色:“SOUL - Red Team Operator”。该环境包含 121 项技能,其中 78 项专为攻击设计。
其中一项技能旨在移除 Hermes 自身的内容安全限制。这一配置表明,不能脱离模型周围的软件环境来单独评估模型安全防护。
据称,在较新的模型拒绝攻击者请求后,Hermes 转而运行 Anthropic 的 Claude Opus 4.6。人工操作者在 260 个会话中输入了 1,951 条中文提示词。
许多指令极其简短。攻击者要求 agent 阅读漏洞报告、调查上传功能、测试密码、寻求代码执行、进入管理面板,或清除痕迹。
这些并非完整的分步操作流程,而是交给能够检查结果、选择工具并持续行动的软件目标。
一条有记录的攻击链始于一个未经身份验证的 SQL 注入漏洞。SQL 注入通过不受信任的输入操纵数据库查询,可能导致信息泄露或被篡改。
据称,该 agent 从数据库表中提取了一次性密码的明文,并利用它绕过多因素认证。随后,它进入管理面板并上传了一个可实现远程代码执行的文件。
一条配置错误的 sudo 规则让该 agent 从有限权限升级为 root 控制权。之后,它挂载了一个内部文件共享,并恢复了 WordPress 数据库的凭证。
该 agent 创建了一个管理员账户、上传插件,并在另一台主机上实现代码执行。随后,它访问 AWS Secrets Manager,并提取了共计 102KB 的 46 项密钥。
这些密钥为访问一个包含加密支付信息的 Magento 数据库打开了路径。攻击者还获得了加密密钥,并据称验证了存储的卡号可以被解密。
这些技术没有一种是前所未有的。多年来,安全团队一直在应对 SQL 注入、不安全上传、暴露的凭证、薄弱的权限规则和过于宽泛的云访问权限。
变化在于这些技术被组合的方式。开源 AI agent 可以解读中间结果,并在无需等待人工编写每一条命令的情况下选择下一步行动。
这使支撑体系比任何单个模型都更重要。该系统将多项常见弱点串联为一条漫长且可自适应的攻击序列。
低成本自动化改变网络犯罪的经济学
据报道,这场攻击活动的成本让持续、多阶段的入侵工作能够在数百个目标上重复实施。
8 月 25 日的一份 OpenRouter 账户快照显示,过去四周的支出为 7,005.71 美元。Gambit 估计,在另外三周活动更密集之后,整个攻击活动的成本介于 12,000 美元至 18,000 美元之间。
攻击者自身的复盘计算显示,在 101 次已完成扫描中,平均模型成本为 25.46 美元。最便宜的一次扫描成本为 3.13 美元,最昂贵的一次达到 79.31 美元。
这些金额并不代表攻击者的总运营支出。基础设施、代理、购得的凭证、开发时间和攻击者的人力同样会产生成本。
这些数字仍显示了该攻击活动为何值得关注。模型使用成本足够低廉,足以支持对那些可能永远不值得熟练团队投入精力的目标进行深入、反复测试。
传统网络犯罪早已将自动化用于凭证填充、钓鱼投递、恶意软件分发和大范围漏洞扫描。这些系统通常遵循相对固定的规则。
据称,这场攻击活动在扫描发现有价值线索后加入了自适应决策。agent 可以解读异常响应、尝试另一条路径,并将不同应用程序和云服务中的访问权限连接起来。
Anthropic 在研究832 个恶意账户后得出了类似结论。其研究人员发现,攻击者越来越多地在复杂的入侵后阶段使用 AI,而不仅仅用于前期准备工作。
该公司还认为,周边架构正日益将高风险操作者与低风险操作者区分开来。当 agent 的工具和工作流程使其能以极少干预串联多项行动时,它就会变得更加危险。
这种模式在这里清晰可见。攻击者不需要一个模型精通每个阶段。Strix、Cairn 和 Hermes 各自承担更狭窄的角色,并将有用的上下文向前传递。
这种分工类似于一个小型安全团队。一个系统识别暴露面,另一个测试其能否转化为访问权限,第三个则协调跨目标的决策。
关键差异在于并发性。人类团队受限于工作时间、沟通开销、疲劳和有限的活跃调查数量。软件则可以持续维护大量会话。
目标选择同样倾向于规模化。Gambit 表示,攻击者在筛选出使用定制电商软件的购物网站后,从一项流量排名服务中复制了 301 个网站。
其显然假定,定制应用程序比得到广泛维护的托管平台包含更多可被利用的错误。随后,每个选定网站都可以以相对较低的边际成本接受自动化侦察。
这种方式对中型企业的压力不亚于知名品牌。当攻击者可以低成本测试数百家零售商时,他们无需预先知道某一家特定零售商是否存在漏洞。
经济因素同样削弱了“隐蔽性”的安全价值。一家营收不高或公众曝光度有限的公司,仍可能进入攻击目标队列,因为检查它的成本极低。
因此,安全团队面临的是规模问题。只要攻击者能测试足够多的应用、凭证和配置路径,某项控制措施无需频繁失效也可能被攻破。
Gambit AI agent attack 表明,严重后果未必源于戏剧性的零日漏洞;自主且持续的攻击同样可以造成重大影响。代理会不断尝试,直到普通错误拼凑出一条可行路径。
真正的冲突是机器节奏对抗人工恢复
更快的利用固然重要,但更尖锐的问题在于:许多组织无法以代理破坏关键服务的速度恢复这些服务。
Gambit 表示,部分入侵在数小时内便已发生。大多数企业的修复流程仍依赖工单队列、责任归属核查、变更审批、维护窗口,以及多家供应商之间的协调。
这些流程存在合理原因。未经审查的生产环境变更可能引发宕机、损坏记录,或干扰受监管系统。
攻击者没有这些约束。代理可以立即尝试另一个端点、重新访问失败路径,或针对相关基础设施启动并行任务。
这形成了一种不对称的时间尺度。攻击者以模型调用和工具执行衡量进展,防御者则以会议、升级流程和获批变更衡量进展。
打补丁仍然必要,但这场行动表明,补丁速度不能成为唯一衡量标准。多条被报告的攻击路径,都依赖于初始入侵之后的配置错误和凭证暴露。
组织还需要了解,攻击者能从每个已被攻陷的服务访问到什么。一款存在漏洞的 Web 应用,不应自动成为通往云端密钥、生产数据库、内部文件系统和部署控制系统的路径。
网络分段能够限制这种横向移动。短期凭证、范围严格的权限,以及生产系统之间强制隔离,都能减少代理在成功完成一个步骤后所能造成的影响。
结账流程的完整性需要额外关注。团队应监控已部署的 JavaScript、内容安全策略变更、标签管理器配置、计划任务、页面缓存、对象存储和部署清单。
合法域名并不保证内容合法。据报道,在一起案例中,被盗的云端权限使恶意脚本能够通过受害者控制的基础设施加载。
恢复规划还必须考虑破坏性失误。该操作员的行动手册据称指示代理在提取付款数据后删除这些数据。
在一家自行车零售商处,代理创建了带有特定前缀的暂存表。其后续清理操作删除了 180 张名称匹配该前缀或包含“Backup”一词的表。
这种宽泛匹配影响了受害者管理员创建的备份表。破坏未必是首要目标,但它是自主执行和不安全清理规则自然导致的结果。
这是 Open Worldwide Application Security Project 所称过度代理能力的攻击版本。该术语描述了由过度功能、权限或自主性所促成的危害。
在这个案例中,代理属于攻击者。防御上的教训依然适用,因为自主工具在拥有破坏性访问权限时,可能误判操作范围。
因此,备份策略必须保护恢复副本,使其不受生产应用可用凭证的影响。否则,入侵或错误清理可能同时删除在线记录和最快的恢复路径。
组织应在事件发生前确定其最小可行业务能力。对零售商而言,这可能包括商品目录访问、结账、订单处理、支付路由、库存更新和客户支持。
每项依赖都需要经过测试的恢复目标。如果应用密钥、部署系统、DNS 或支付集成仍遭入侵,仅恢复数据库并不能恢复业务。
人工审批对于高影响决策仍有价值,但无法弥补技术边界的缺失。当一次审批就能解锁广泛而持久的访问权限时,审查者的作用最为有限。
应对措施必须将自动化与隔离相结合。检测、凭证撤销、工作负载隔离和恢复的运行速度,需要更接近攻击者的速度。
重要说法仍需独立验证
Gambit 提供了异常详细的证据,但其报告并不能独立确认所有受害者数量、归因问题或代理生成的说法。
该公司将其 9 月 22 日发布的内容称为中期报告。其结论来自暂存服务器上发现的被盗信息和工具、在线运行的窃取脚本、外部扫描记录、利用日志,以及代理自身的报告。
这些证据类型的证明力并不相同。在线恶意脚本和被提取的数据集,比代理声称某次利用成功更有说服力。
Gambit 承认,AI 生成的报告可能包含错误。该公司表示,大量内容已通过直接证据得到验证,这提高了研究人员无法独立确认的相关日志的可信度。
报告还警告称,行动规模和不完整的数据集可能导致不准确之处。在这六天窗口期内启动的 105 个 Cairn 项目中,有 57 个已被删除,无法进行详细分析。
公开证据没有点名这家《财富》500 强酒店公司或该航空公司。这在修复期间保护了受害者,却也使外界无法确认准确的访问范围。
“以不同程度遭到入侵”可能涵盖截然不同的结果。一名受害者可能暴露了管理凭证,另一名则可能遭受支付数据窃取或持续性的结账流程篡改。
模型和框架细节同样来自恢复的环境。公众读者无法独立复现 Gambit 所描述的确切配置、提示词、工具权限或路由行为。
归因仍仅限于一名使用中文、以经济利益为动机的操作员。语言并不能证明国籍或实际位置,而熟练的攻击者也可以刻意制造误导性信号。
该报告不应被解读为开源软件天然应对这些犯罪负责的证据。渗透测试框架服务于合法防御者、研究人员和获得授权的评估团队。
同样的双重用途问题也适用于前沿模型。Anthropic 对更早一次间谍活动的说明称,其系统偶尔会虚构凭证,或夸大其获得的信息。
这种局限性具有双向影响。它降低了完全自主攻击的可靠性,但当代理依据错误假设采取行动时,也可能造成附带损害。
模型拒答并未终止被观察到的 Gambit 行动。据报道,操作员更换了模型版本、自定义了代理环境,并安装了一项旨在移除内容控制的技能。
服务提供商的安全措施仍会增加阻力,并可能暴露滥用模式。然而,当一场行动由开放框架和多模型路由服务组合而成时,一条路径失效后,攻击者可以替换组件。
恰当的结论比“AI 可以黑进任何公司”更为有限。该报告表明,一名操作员利用代理框架,以高速度和低模型成本攻击了一批规模可观的组织。
它并未确立所有被扫描目标中的成功率,也未证明同一工作流程能够绕过拥有强大身份控制和良好网络分段的系统,并在其中完成恢复测试。
这种不确定性应当塑造防御优先级,而非成为拖延的借口。安全团队可以依据已有记录的技术采取行动,而不必假定每一项被报告的细节都已最终定论。
安全团队接下来应关注什么
下一项考验是,这场行动是否会扩大、模型提供商是否会破坏其基础设施,以及受害者能否将恢复时间缩短至低于代理的攻击周期。
第一个信号,是与已公开基础设施相关的窃取脚本活动是否持续。Gambit 发布了命令服务器地址、窃取脚本域名、代理服务和具有特征性的脚本模式,供防御者使用。
安全团队应搜索历史记录以及当前系统。一个如今干净的域名,可能在通知或修复前曾托管恶意结账代码。
调查人员还应比对文件历史、对象存储变更、标签配置、数据库修改、计划任务和部署记录。移除窃取脚本并不证明原始访问路径已经关闭。
如果研究人员识别出更多相关商店,这场行动已证实的规模将会扩大。如果已知基础设施消失且没有替代品,破坏行动可能已限制当前的攻击活动。
第二个信号,是模型和路由提供商的行动。Gambit 报告称,较新的模型拒绝了部分请求,但操作员仍继续使用一款较旧的 Anthropic 模型和数个中国模型。
账户封禁、改进分类器、跨提供商共享指标,以及限制可疑的大规模工具使用,都能提高攻击成本。其效果取决于攻击者能否迁移到本地模型或新账户。
提供商同样面临困难的分类问题。获得授权的渗透测试与犯罪利用可能产生相似的提示词、命令和网络行为。
对安全任务实施简单粗暴的封锁会损害合法研究人员。有效控制需要考虑授权、规模、目标多样性、数据流动、工具访问和重复的入侵后操作。
第三个信号,是企业如何调整恢复演练。团队应衡量隔离一个已暴露的应用、撤销其密钥、替换受影响的工作负载、验证结账内容并恢复交易所需的时间。
这项演练应假定攻击者已经发现了关联凭证,也应假定部分备份或暂存系统已被篡改。
如果恢复测试依赖于与生产环境相同的身份系统、密钥存储或部署控制平面,就可能提供虚假的信心。在代理压力之下,独立访问路径和不可变恢复副本愈发重要。
防御者还应关注开源 AI 代理是否开始共享标准化攻击技能。可复用的技能可以将一名操作员成功的技术转化为其他人可重复使用的组件。
Gambit AI agent attack 并不依赖神秘的新型漏洞。据报道,它结合了常见弱点、广泛的工具访问权限、低成本模型调用和不懈执行。
这种组合才是警告。企业应问问自己:当探测永不休止、下一步行动无需开会时,自己的检测和恢复系统能否正常运作。
实际应对应从一次计时演练开始:选择一项营收关键服务,假定其应用凭证已被盗,并测试组织能够多快将其隔离并恢复。答案比再多一份政策文件更能说明问题。
AI 网络攻击自动化压缩了攻击者一侧的时间尺度。决定性问题是,防御者现在能否也压缩自己的时间尺度。



