top of page

Armadin 和 TENEX.ai 声称创下受控实时 AI 网络攻击纪录

Armadin 和 TENEX.ai 登上 Google News,并提出了一项引人注目的主张:他们完成了有记录以来规模最大的受控、实时 AI 网络攻击。这项声明将此次演练描述为自主进攻系统能够以显著规模对生产基础设施开展行动的证据。然而,仅凭公开标题并无法说明这项纪录如何衡量,或是否经过独立验证。

这一区别很重要,因为“受控”“实时”和“最大”描述的是一次演练的不同方面。受控攻击应具备明确授权、边界、安全控制和恢复程序。实时攻击使用的是运行中的系统,而非隔离的实验室环境。规模可能指代理数量、资产数量、攻击路径、请求量、发现结果、持续时间,或完全不同的衡量指标。

因此,核心较量并非 Armadin 对阵 TENEX.ai,而是一项由公司支持的纪录主张与使该主张具备意义所需证据之间的较量。此次演练值得关注,因为可信的自主测试会给传统渗透测试项目带来压力。但在将其视为基准之前,采购方仍需要方法说明、分母数据、独立观察者和修复结果。

Google News 的这项主张实际改变了什么

这项声明将自主进攻性安全从产品承诺推进为一项声称达到生产环境规模的测试。

这则转载声明将 Armadin 和 TENEX.ai 确认为参与公司。声明将其活动称为受控、实时 AI 网络攻击,并就其规模提出纪录主张。

这一措辞表明,这是一场获得授权的安全演练,而非犯罪入侵。在授权演练中,目标组织根据已记录的规则,允许开展特定的进攻行动。这些规则通常会界定范围内的系统、账户、技术手段和时间段。

Armadin 专注于代理式进攻安全。代理式攻击者是能够选择并串联行动的软件,而不是只按固定扫描器脚本执行操作。该公司表示,其代理可以发现资产、测试漏洞,并将单个弱点连接为攻击路径。

TENEX.ai 则通过以 AI 为重点的安全运营模式开展防御工作。安全运营中心负责监控环境、调查告警并协调遏制措施。这一组合形成了可辨识的红队与蓝队结构,尽管该声明使用了更具戏剧性的措辞。

红队一方尝试在授权范围内暴露可被利用的弱点。蓝队一方则观察活动、区分攻击与常规事件,并在演练超出边界前作出响应。一项有意义的测试会审视双方的这类互动。

这比发布又一个模型得分更具影响力。传统网络安全基准通常测试孤立任务,例如识别漏洞或完成夺旗挑战。实时评估则会引入身份系统、终端控制、云权限、网络分段和运营约束。

生产系统还会带来实验室测试所避免的后果。一次激进请求可能使服务过载。一次凭证测试可能锁定账户。一次漏洞利用可能改变数据、中断工作流,或触发自动化响应。

这些风险解释了为何“受控”一词比“最大”更有分量。规模很大但治理不善的演练几乎无法令人安心。规模较小、但授权清晰、决策可观察且修复经过验证的演练,或许能提供更有用的证据。

Google News 的标题通过为这种测试模式附加公开纪录主张,改变了讨论方向。它并未确定这项纪录,反而提高了两家公司应提供的证据标准。

读者应区分三项命题。第一,两家公司开展了一场获得授权的演练。第二,AI 代理在这场演练中执行了大量进攻行动。第三,这场演练超过了所有可比的受控测试。

第一项命题似乎是该声明的核心。第二项命题与 Armadin 所述的产品设计相符,具有可信性。第三项则需要明确的比较范围,且仍是最难从公开信息中评估的主张。

为什么实时 AI 网络攻击如今值得关注

AI 代理正开始连接过去安全团队预期由人类协调的攻击阶段。

这一时机反映了进攻能力的更广泛转变。语言模型可以编写代码、解读工具输出、总结网络数据,并在失败后调整计划。代理框架则将这些能力连接到扫描器、Shell、浏览器和安全工具。

这种组合比任何单次模型回答都更重要。攻击者很少通过一个出色提示就能得手。真实的入侵链需要侦察、优先级排序、凭证处理、漏洞利用、横向移动,以及在不确定条件下反复作出决策。

在 Armadin 的主张之外,已经存在这一转变的证据。Anthropic 报告称,其破坏了一场AI 间谍活动,其中 AI 据估计处理了该行动 80% 至 90% 的工作。据报道,人类操作人员在数个关键决策点进行了干预。

该事件并非完全自主,Anthropic 还指出模型幻觉构成障碍。然而,这场行动展示了代理如何跨越多个攻击阶段持续开展活动,也说明了为何仅凭模型知识的简单衡量会忽略实际运营风险。

Anthropic 随后研究了 2025 年 3 月至 2026 年 3 月间因恶意网络活动而被封禁的 832 个账户。其威胁映射发现,其中 560 个账户利用 AI 进行与恶意软件相关的准备工作,另有 54 个账户用其协助在已遭入侵的环境中进行横向移动。

这些数字不应被视为所有网络犯罪的普查。它们反映的是一家模型提供商掌握了足够证据可供分析的案例。尽管如此,这些数据支持了从 AI 辅助写作转向更深层运营活动的趋势。

学术评估也指向同一方向。研究人员将六个现有代理和一个名为 ARTEMIS 的多代理系统,与十名专业人士在一所大学网络中进行了比较。该环境覆盖约 8,000 台主机,分布在 12 个子网中。

根据这项实时网络研究,ARTEMIS 发现了九个有效漏洞,并在总体排名中位列第二。按该研究的评分方法,它的表现优于十名人类参与者中的九人。不过,研究人员也发现其误报率较高,并且难以应对图形界面。

这一复杂结果很重要。AI 代理能够系统性地枚举目标,并且可以不知疲倦地并行执行任务。它们同样可能误解上下文、重复无效操作,或将疑似弱点报告为已验证的漏洞利用。

Armadin 更广泛的商业战略直接针对这一转变。其平台旨在部署多个专业代理,对攻击面不同部分开展行动。该公司将这些代理描述为协调一致的集群,而非一个通用聊天机器人。

其理念是扩大红队的推理能力和持续性。一个代理可能盘点面向互联网的服务,另一个可能检查身份关系;其他代理则可能测试云权限、终端、暴露的凭证或应用弱点。

并行化可以缩短从发现到利用的时间,但也可能放大流量、误报和意外交互。因此,安全编排变得与模型能力同等重要。

Armadin 已经将这一模式带入成熟的安全服务渠道。一项 Unit 42 服务使用 Armadin 代理,对获批准的外部资产进行被动发现和主动攻击。这份评估说明称,该服务可通过超过 50,000 个模板测试凭证填充、云基础设施和漏洞。

模板数量并不能证明漏洞利用成功。它确实表明 Armadin 将自适应代理与大量传统安全内容相结合。这种混合设计比假设语言模型从零开始构思每一步行动更为可信。

这为企业安全领导者带来了新的压力点。年度渗透测试只能在明确时间窗口内提供暴露面的快照。AI 代理则承诺随着系统、身份和应用变化而持续进行测试。

而这一承诺出现之际,攻击者也正获得更快的研究和编码工具。一个单独看似无害的漏洞,一旦代理找到通往高价值数据的可达路径,就可能变得严重。因此,防御方需要关于可利用攻击链的证据,而不只是可能弱点的冗长清单。

真正的较量是主张与方法之间的较量

只有当公司定义衡量单位、比较范围和成功标准时,“最大”才有意义。

网络安全中的纪录主张难以评估,因为演练很少采用完全相同的环境。一项测试可能覆盖数千项公开资产,但仅允许有限的漏洞利用。另一项测试可能涵盖较少系统,却允许在身份和云基础设施中进行更深入的移动。

仅凭 Armadin 和 TENEX.ai 的标题无法解决这一问题。它没有揭示“最大”指的是 AI 代理数量、受测资产、攻击行动、发现结果,还是防御观察数量。每一项衡量指标都会支持不同结论。

代理数量可能具有误导性,因为许多代理可能只执行狭窄任务。资产数量也可能夸大规模,因为大部分资产可能处于非活动状态或无法访问。请求量衡量的是活动程度,却很少说明推理是否成功。

漏洞数量同样需要限定。一台扫描器可能识别出数千个过时组件,却无法证明攻击者能够触及它们。经过验证的攻击路径能提供更强的证据,因为它们将弱点与实际影响联系起来。

即便攻击路径数量也需要分母。小型环境中的十条已验证路径可能意味着严重暴露;而同样数量若出现在庞大的跨国资产环境中,或许表明覆盖范围有用,但风险集中度较低。

演练持续时间同样重要。运行一小时的系统,与连续运行数周的系统面临不同约束。更长的测试会揭示代理是否丢失上下文、重复工作、累积错误,或适应防御变化。

成功行动也需要同样清晰的定义。代理只是发送了一次漏洞利用尝试吗?它是否在范围内获得了未经授权的应用行为?它是否取得了受控 Shell、访问了获批准的诱饵,或到达了受保护的身份层级?

一份可信报告应区分尝试与经过验证的结果,也应说明验证如何进行。人类确认仍然很有价值,因为自主工具可能误解横幅信息、错误消息和模拟响应。

防御性能同样需要清晰界定。TENEX.ai 可能检测到恶意行为、生成告警、补充证据、遏制活动,或协调修复工作。这些结果代表不同层级的防御价值。

仅凭告警数量是一个薄弱的衡量标准。有效的防御系统应将相关行动关联为事件,并优先处理风险最高的路径。它还应避免让攻击代理生成的每一次探测都淹没分析师。

时间指标可能有所帮助,但需要明确起始点。检测时间可能从首次恶意请求开始计算。遏制时间则可能在访问被阻断、凭证被轮换或受影响系统被隔离时结束。

最有力的结果应将进攻证据与持久的风险降低联系起来。这意味着识别一条经过验证的路径、明确责任归属、实施修复,并通过复测确认该路径不再有效。

如果缺少这一闭环,实战演练可能沦为一场精心设计的展示。它或许能说明代理会产生行动,却无法证明组织因此变得更安全。买方应关注已被关闭的攻击路径,而非戏剧化的规模。

独立观察将增强纪录声明的可信度。第三方评估机构可以验证授权模型、事件日志、成功标准和报告总量。敏感的基础设施细节可以继续保密,而方法和汇总结果则可公开。

可复现性带来了另一项挑战。任何负责任的公司都不应发布暴露客户环境的操作说明。不过,参与方可以发布经过脱敏的方法论、网络靶场版本或部分回放数据。

一项纪录还应说明可比较的既往工作。研究人员曾在类似企业的靶场和真实网络上测试代理。安全厂商也运行过自主验证服务。这些公司需要说明,它们声称超越的是哪一类工作。

这并不意味着此次演练没有价值。它意味着,标题只是证据链的起点。声明越重大,透明的衡量框架就越重要。

受控测试本身也会带来安全权衡

使自主红队演练具有价值的能力,也会提高防护措施不足的代价。

传统渗透测试本身就存在运营风险。测试人员可能导致脆弱服务崩溃、锁定账户、修改数据,或触发事件响应流程。自主代理则为这一既有问题增加了速度、并发性和自适应决策能力。

因此,授权不仅必须以合同形式明确,也必须可由机器读取。人类测试人员可以在改变策略前查阅工作说明书。代理则需要可强制执行的控制措施,无论其生成何种计划,都能阻止未被允许的行动。

这些控制应从精确的资产清单开始。域名、地址、云账户、应用、身份和时间窗口都必须被明确纳入或排除。所有权模糊可能会使一次获准测试变成针对第三方的活动。

工具权限需要彼此独立的边界。获准扫描的代理不应自动获得利用漏洞的权限。获准使用测试凭证的代理也不应自动获得访问生产环境机密信息的权限。

速率限制是另一项关键控制措施。并行代理产生流量的速度可能远超人工团队。在服务变得不稳定之前,其协调器应按目标、技术和时间间隔限制请求数量。

实战测试还需要即时终止机制。操作人员应能停止单个代理、撤销凭证、阻断出站连接并保留日志。即使编排层出现异常行为,这种能力也必须有效。

数据处理同样值得重视。成功的测试可能暴露客户记录、凭证、源代码、配置文件和内部通信。代理应尽量减少收集,并使用获批的验证证据,而非复制敏感材料。

例如,代理可以通过记录哈希值或受控标记,验证受保护文件是否可访问。它无需提取完整文件。类似限制也可以在不导出真实客户记录的情况下证明数据库访问权限。

模型提供商引入了另一层风险。提示词、工具结果和检索数据可能会经由外部推理服务传输。买方需要了解这些信息流向何处、保存多久,以及是否可能被用于模型训练。

代理的记忆同样需要治理。持久上下文能够避免重复工作,从而提升重复评估的效率;但它也可能在授权任务结束后继续保留凭证或敏感基础设施细节。

如果系统能够观察每一项进攻行动,TENEX.ai 的防御角色可以降低其中部分风险。然而,可见性并不等同于遏制能力。防御平台必须从终端、网络、身份、应用和云服务获得可靠遥测数据。

如果蓝队提前获得真实攻击中不会提供的签名,测试可能产生误导性的成功结果。反之,如果正常安全控制在检测系统观察到有意义的行为前就阻止了攻击者,测试也可能低估防御能力。

因此,参与方应披露协调规则。读者需要知道,TENEX.ai 在演练前获得了哪些细节、哪些指标仍被隐藏,以及防御方能否将代理与其他活动区分开来。

这正是核心权衡。更逼真的攻击能产生更具参考价值的证据,但也会增加运营暴露。更强的控制可以降低风险,但过度限制可能使演练变成脚本化展示。

正确的平衡并非无限制的自主性,而是具备完整可观测性的有限自主性。代理可以在政策范围内选择策略,同时独立控制措施强制执行范围限制,人类则保留对重大行动的决策权。

当前研究支持这种审慎做法。真实网络上的 ARTEMIS 评估展示了有用的性能,同时也暴露出误报和界面限制。Anthropic 对间谍活动的调查同样发现,代理仍需要人类决策,并且有时会伪造结果。

这些局限并未消除威胁。恰恰因为不可靠的代理仍能高速执行命令,治理变得更加重要。当软件拥有凭证、工具和网络触达能力时,一次错误决策就可能变得危险。

如果结果成立,谁将面临压力

可重复的实战测试将对年度评估、漏洞积压,以及无法证明真实影响的安全产品形成压力。

第一类受影响者是传统渗透测试服务提供商。人类专业能力对于创造性推理、业务语境、社会工程和安全判断仍然至关重要。不过,客户会质疑:一次年度测试能否代表每周都在变化的环境。

AI 代理可以反复执行资产盘点、枚举、基础利用和回归测试。这让人类专家能够将更多时间投入到非常规路径和重大决策中。更可能的结果是工作流程发生改变,而不是专家测试人员被取代。

第二类受影响者是漏洞管理厂商。这些系统通常依据严重性评分、资产重要性和威胁情报对发现的问题进行排序。自主攻击验证增加了另一个信号:获准攻击者能否真正将某项弱点与影响关联起来。

这种证据可以改进优先级排序。身份路径上一个可触达、评分较低的缺陷,可能比孤立系统上的一个严重漏洞更值得优先处理。但利用失败并不能证明安全,因为代理可能遗漏有效技术。

第三类是托管检测与响应服务提供商。如果 Armadin 能够发起持续、自适应的攻击,防御服务就需要在不淹没分析师的情况下关联这些活动。它们必须说明观察到了哪些行动,以及哪些控制措施阻止了攻击进一步推进。

TENEX.ai 将自身定位为以 AI 为原生能力、由人类主导的安全运营模式。2026 年 3 月,该公司宣布了一轮旨在扩大该服务的融资。其公司公告还称其同比增长 318%,但这一数据仍由公司自行提供。

Armadin 演练为 TENEX.ai 提供了展示运营表现而非营销话术的机会。最有价值的证据将呈现完整攻击链中的检测覆盖率、调查质量、遏制速度和分析师干预情况。

终端和身份平台同样面临压力。Armadin 已宣布与包括 CrowdStrike 和 Palo Alto Networks 在内的主要安全提供商进行集成。这些合作关系表明,自主测试正在向成熟的企业平台靠拢。

Armadin 的CrowdStrike 合作公告描述了针对内部网络、基础设施、身份系统和终端的持续攻击。随后,CrowdStrike 提供用于优先级排序和修复的控制措施与工作流程。

这种安排将自主进攻定位为验证层,而非完整的安全技术栈。Armadin 发现并测试路径;现有平台则提供遥测、策略执行、响应和运营集成。

安全买方应关注这种模式是减少重复工具,还是增加另一个控制台。一个有用的验证层应帮助团队关闭发现的问题。较不成熟的实现则可能在不改善责任归属或修复能力的情况下,新增一个待办队列。

董事会和高管面临的是另一种压力。他们越来越多地收到基于估算严重性的风险仪表板。经过验证的攻击链提供了更具体的叙事,但也可能过度简化复杂的暴露面。

一条成功路径并不能预测真实数据泄露的概率。它只能说明,在特定条件下该路径有效。领导者应将其视为可采取行动的证据,而非对损失的完整预测。

保险公司和监管机构最终可能也会关注同样的区别。持续验证可以提供控制措施已被测试的证据;但它也可能留下记录,证明某组织在事件发生前已知存在可利用路径。

这种可能性使修复治理至关重要。组织需要截止期限、例外流程、复测和书面责任归属。只有在运营模式能够解决问题时,发现更多问题才会带来帮助。

Google News 读者接下来应关注什么

只有当公开证据将自主活动、防御响应和经过验证的修复联系起来,这项纪录声明才会变得可信。

第一个信号是方法论报告。Armadin 和 TENEX.ai 应定义测试环境、允许的行动、持续时间、规模指标和成功标准。它们还应说明哪些结果经过了人工验证。

报告无需暴露客户信息或发布危险的漏洞利用细节。汇总数据可以展示已测试资产、尝试行动、已确认发现、攻击路径和防御结果。明确的分母将让读者能够解读每个数字。

如果方法论报告明确说明比较集合,它将增强纪录声明的可信度。如果“最大”是指在一次获授权的生产环境演练中协调的代理数量最多,这些公司就应如此说明。如果指的是另一项指标,该指标同样需要明确界定。

模糊的摘要会削弱这一声明。没有定义的数字会制造表面上的精确性,同时阻碍比较。截图和精选的攻击故事无法替代有文档记录的衡量框架。

第二个信号是独立验证。应由具备资质的第三方审查授权记录、事件日志、发现项验证结果和防御遥测数据。审查方可以发布证明,同时不披露敏感的客户细节。

独立验证之所以重要,是因为双方都存在商业动机。Armadin 会从自主进攻能力显得强大且安全中获益;TENEX.ai 则会从其防御运营显得快速有效中获益。

这种利益一致性并不会否定其结果,但意味着需要外部审查来确立记录。体育、科学和性能纪录都依赖于共同认可的规则,因为参与者无法仅凭声明建立普遍可比性。

第三个信号是修复证据。读者应关注已被关闭并成功复测的经验证攻击路径数量,还应考察整个过程耗时多久,以及仍有多少发现项尚未解决。

修复将运营价值与表演性效果区分开来。一段戏剧化的攻击过程很吸引眼球,但一次被成功阻断的复测表明,组织确实改变了自身风险状况。后续的重复测试则可以判定,系统之后的变更是否重新打开了该路径。

防御响应的质量同样值得审视。TENEX.ai 是否将相关事件归并为一个连贯的事故?是否识别出受影响的身份和资产?自动化措施是否在不干扰正常运营的前提下遏制了活动?

人工参与情况应被披露,而非隐藏。值得提出的问题包括:操作人员多久批准一次行动、纠正过多少次代理、驳回过多少误报,或在遏制过程中进行了多少次干预。自主性是一个光谱,而非二元属性。

读者还应关注复现情况。其他供应商和研究人员将会在网络靶场或获批的企业环境中测试类似系统。即使无法复现完全相同的纪录,可比结果也将支持这一更广泛的前提。

未能复现并不必然推翻这次演练。不同网络的难度各不相同。不过,可重复的方法将有助于区分通用能力与围绕单一环境优化的演示。

企业采购方在调整采购计划前应索取证据。要求提供交战规则、审计架构、数据保留政策、模型提供商边界以及紧急停止流程。随后还应询问,发现项将如何进入现有的修复工作流。

采购方也应测试失败时的行为。当代理无法验证结果时会发生什么?什么机制能够阻止重复请求?平台如何处理相互冲突的指令、意外访问和敏感数据?

这些答案比标题中的最高级表述更重要。自主进攻性安全将通过严谨的运营来接受评判,而不是取决于供应商如何激进地描述它。

Google News 放大了 Armadin 和 TENEX.ai 的公告,但聚合意味着分发,而非验证。这场受控的现场演练是一个可信的研究线索,也可能是一项重要的行业事件。在方法和结果能够支持比较之前,其纪录地位仍只是公司声明。

安全负责人应沿着证据链追踪,而不是在热情追捧与全盘否定之间二选一。应问清代理尝试了什么、完成了什么、TENEX.ai 检测到了什么,以及哪些风险被永久消除。

下一次发布应让这些答案可被衡量。在此之前,应将这次演练视为自主红队测试正在进入生产环境的一个重要信号,同时将其所宣称的纪录保留在未经验证的一栏。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page