top of page

关于 Anthropic AI 滥用报告:智能体将成本转嫁给防御方

58分钟前
讀畢需時 16 分鐘

Anthropic 在发现 Claude 被用于网络攻击、监控系统、影响力行动、武器研究和工业化模型提取后,发布了第三份 AI 滥用报告。《关于 Anthropic AI 滥用报告》的证据涵盖了 2025 年 12 月至 2026 年 8 月期间观察到的活动。其核心警告并非 AI 创造了新的恶意目标,而是智能体让既有行动的成本更低、速度更快,也更易于规模化。

报告描述了人类负责选择目标、设定目标并审查具有重要后果的输出。随后,AI 系统承担侦察、软件开发、漏洞研究、数据处理、宣传内容制作以及部分利用环节。一些操作者还将 Claude 连接到外部工具和持久记忆,使自动化工作流得以跨会话持续运行。

这种分工比任何单独的恶意提示词都更重要。它将 AI 置于网络犯罪和国家监控的运行机制之中。攻击者如今能够将软件中的专业知识沉淀下来,重复成功流程,并同时推进多条工作线。

Bruce Schneier 在其对这份滥用报告的分析中也强调了同样的模式。真正的转变在于执行方式的工业化:人类保留决策权,而机器承担更多运营负荷。

在 Anthropic AI 滥用报告中,工作流才是重点

报告中最具影响力的证据,关乎完整工作流,而非聊天机器人生成的孤立回答。

Anthropic 的威胁情报报告记录了犯罪团伙、商业监控供应商、具有政治动机的个人以及与国家结盟的组织所开展的活动。这些案例涉及网络行动、宣传、监控、常规武器、生物研究和未经授权的模型蒸馏。

该公司表示,它选取的是值得关注或具有新颖性的事件,并非 Claude 上所有活动的代表性样本。这一区分限制了对普遍程度的判断。不过,这些案例仍揭示了:当模型接入代码、浏览器、扫描器、数据库和其他工具后,动机明确的操作者能够构建出什么样的能力。

一些操作者运行了智能体群,即由一个协调模型将大型目标拆分给多个专业 AI 智能体。这些智能体并行开展侦察、利用研究和入侵后的任务。持久化的行动记忆会在不同会话之间保存目标清单、凭证、指令和任务状态。

在一项被报告的行动中,自动化工作流使用反编译工具分析设备固件和二进制文件。系统形成漏洞假设、编写拟议的利用代码,并在目标产品的实验室副本上进行测试。Anthropic 表示,一条连续工作流在一个月内产出了十多项可能的零日漏洞发现。

零日漏洞是此前未知、且尚无可用防御补丁的软件漏洞。报告并未证明每一项疑似发现都有效,或已被用于攻击真实系统。但它确实表明,自动化流程能够反复执行传统上需要专家持续投入的工作。

其他智能体则持续搜索暴露在互联网上的基础设施。它们识别服务指纹,将入口点与已知漏洞进行比对,并将新发现加入持久化项目记忆。另有一支由 13 个常驻智能体组成的团队,从军事、政府、政策和社交来源收集公开材料。

这种架构改变了恶意工作的经济性。人类不再需要亲自完成每一次搜索、测试、翻译或文档整理任务。操作者可以监督一批可扩展的自动化工作者,并将注意力集中于目标选择。

这正是为什么单独列出提示词会低估这一发展。每个提示词单独审查时或许看起来都很普通。真正的危险来自编排、累积上下文、工具访问、重复执行以及将输出付诸行动的能力。

Anthropic 表示,其已封禁关联账户,并利用调查结果改进防护措施。然而,移除账户只能解决对单一提供商的访问问题,无法消除其背后的专业知识、代码、被盗凭证或基础设施。操作者可以保留这些资产,并将工作流的部分环节转移到其他地方。

因此,这份报告将 AI 滥用从内容审核问题转变为运营安全问题。拦截有害文本仍然有用,但防御者还必须识别跨身份、会话、工具和被入侵账户的自动化行为。

AI 智能体正在压缩攻击周期

AI 智能体并不会将人类完全排除在网络攻击之外,但它们让更少的人能够覆盖更多目标和更多技术层面。

Anthropic 描述的一场行动在侦察、初始访问、收集、数据外泄和持久化各环节都使用了 AI。据称,该行为者识别了电子邮件和远程访问系统的指纹,建立目标清单,并为设备代码钓鱼搭建基础设施。

设备代码钓鱼滥用合法登录流程,诱使受害者授权由攻击者控制的会话。一旦攻击者获得该访问权限,该会话便可能暴露云端电子邮件及其他连接服务。由于它使用真实的身份验证流程,这种技术往往显得不那么可疑。

Anthropic 表示,该行动访问了至少八家组织的邮件记录。目标包括一个国家检察机关、一个军事教育机构以及一个区域性政府间组织。另一次入侵泄露了超过 30 万条国民身份记录,以及 50 多万家公司的注册信息。

报告称,AI 系统协助整理了数百 GB 的被盗信息。它还帮助进行凭证窃取、横向移动,并在安全产品检测到早期版本后调整恶意软件。

这缩短了攻击者行动与防御响应之间的部分反馈循环。如果软件能够分析失败原因、修改攻击载荷并迅速准备新版本,那么一次检测就不再会造成同样的延迟。人类审批仍可保留在流程中,但机器迭代会加速推进。

另一名行为者使用自主利用流水线攻击生产环境中的 Web 应用。工作智能体在无需持续人工监督的情况下,测试了注入漏洞、身份验证绕过、跨站脚本和服务器端请求伪造。潜在凭证和发现结果被汇入共享工作区。

服务器端请求伪造是一种漏洞,它会诱使服务器代表攻击者发起请求。它可能暴露原本无法从公共互联网访问的内部系统。自动化此类测试会增加操作者可探测的端点数量。

报告还描述了能够自动注册账户、监控收件箱、破解 CAPTCHA 以及完成身份验证步骤的欺诈基础设施。另一条工作流则在受害者与真实身份核验之间部署反向代理,以窃取已认证会话和提交的文件。

这些例子说明,为什么《关于 Anthropic AI 滥用报告》与普通组织息息相关。企业不必是攻击者最初锁定的目标也可能蒙受损失。其暴露的密钥、云租户、SaaS 应用、供应商或客户记录,都可能成为中间资源。

据报道,一名法语攻击者瞄准了 42 个政治组织及其关联机构。该行为者至少获得了其中 14 家的内部访问权限,并窃取了估计 12 至 26 GB 的数据库材料。一个被入侵的竞选平台暴露了约 14 万条记录,其中包括政治观点。

有关这场法国竞选行动的独立报道,将多项细节与受影响组织联系起来。尽管 Anthropic 仍是大部分技术叙述的主要来源,但这些报道提供了有价值的佐证。

Anthropic 表示,该行为者还开发了一种此前未被记录的 WordPress 利用技术,并成功攻击至少四个网站。其他工具则收集提交的凭证、污染备份,并将远程访问代码植入网站资产。

这并非完全自主的攻击。人类选择目标、运行基础设施、解读结果并追求政治目的。关键变化在于杠杆效应:一个人能够构建和维护一场覆盖范围相当于小型技术团队的行动。

核心冲突是攻击者的规模化能力与防御者的问责责任

攻击者可以将工作分配给智能体,但防御者仍须承担每一次失败带来的全部法律、运营和财务后果。

传统安全规划通常假定,进攻性工作会消耗稀缺的专业能力。熟练的攻击者必须研究基础设施、开发工具、检查窃取的数据,并在被检测后调整方法。这些约束限制了一个团体能够同时追逐的目标数量。

智能体系统削弱了这些约束。它们可以持续进行侦察、一致地记录结果、翻译材料并重试技术任务。它们还会保留原本只能存在于单个操作者记忆中的流程知识。

防御者面临的方程则更为严苛。每一个暴露的凭证、被遗忘的应用、存在漏洞的供应商或过度授权,都可能成为入口。攻击者只需要一条可行路径,而防御者必须保护不断变化的一组系统和身份。

AI 供应链本身也已成为目标。Anthropic 描述了一些承诺以折扣价格提供前沿模型访问权限的虚假服务,但它们实际安装了凭证窃取程序。这些程序从客户设备中盗取账户凭证和已认证会话令牌。

攻击者随后通过欺诈性代理网络出售或复用这些访问权限。一些服务在持续收集新凭证的同时,悄悄将客户路由到不同的模型。这让犯罪分子在先前密钥被撤销后,仍拥有可持续获取、看似合法的账户来源。

另一次行动在试图访问预发布 Claude 模型时测试了 30 个目标。Anthropic 表示,所有尝试均告失败,其自身系统并未遭到入侵。被盗密钥属于环境此前已遭入侵的客户。

这一区分很重要。提供商可以保护其核心基础设施,但攻击者仍能利用其周边的薄弱环节。开发者笔记本电脑、浏览器会话、自动化平台、第三方路由器以及复制的配置文件,都会构成实际安全边界的一部分。

因此,企业应将 AI 凭证视为其他高权限生产密钥。密钥需要有限的权限范围、在可能的情况下采用较短生命周期、进行使用监控,并支持可靠撤销。异常的模型流量或许能在攻击者达成更明显目标之前暴露已被入侵的环境。

安全团队还需要掌握智能体行为的可见性。一个账户持续发起扫描、并行工具调用或重复数据提取任务,所呈现的风险与普通对话不同。检测应考虑行动序列,而不是一次只审查一个提示词。

这给 Anthropic、OpenAI、Google、Microsoft、云服务商和模型路由服务带来了压力。各方只能看到链条中的不同环节。没有参与者能够在不交换有价值威胁信息的情况下重建整场行动。

然而,加强监控也会引入自身风险。服务商可能会检查提示词、输出、文件、工具调用和账户关系,以识别滥用行为。这些做法可能暴露敏感客户信息,或在服务本身内部形成广泛的监控能力。

由此产生的权衡并不只是安全与隐私之间的取舍。监控薄弱可能让协同行动持续进行。过度监控则可能侵蚀保密性、造成错误指控,或将宝贵的客户数据置于另一个集中式系统中。

服务商需要设定有限的数据保留期限、限制调查人员访问权限、明确升级处置规则,并就自动化执法提供实质性透明度。客户也需要了解存在哪些遥测数据,以及信息可能在何种情况下与外部组织共享。

Anthropic 的 AI Misuse Report 对已发现活动提供了异常详细的可见性。它并未完整衡量误报、未被发现的行动,或调查带来的隐私成本。这些尚未回答的问题应与运营层面的发现一并被考虑。

监控与宣传展现出同样的劳动力替代模式

报告中的监控案例表明,AI 正在替代工程和分析劳动力的一部分,但并未改变强势机构选择针对哪些对象。

据报道,一名为马里国家安全部门工作的顾问使用 Claude 设计了一个大规模拦截平台。该系统能够从该国移动运营商处收集通信数据,并为被选定的人员生成档案。

Anthropic 表示,该模型协助设计了底层软件,而非分析最终档案。根据另一篇监控报道,Anthropic 介入后,该平台最终使用其他模型在本地部署。

这一结果暴露出服务商执法的局限性。云服务可以关闭账户,让某一工作流更难运行,但无法可靠地抹去已导出的代码、技术知识、收集的数据,或对替代模型的访问。

Anthropic 称,在伊朗,有行动者使用 Claude 开发了一款恶意 Firefox 扩展程序,从社交网络收集身份信息。另一个伊朗组织则分析了数十万篇帖子,并识别出 39 个反对派账户进行监控。

报告描述了一项中国宗教事务情报行动,据称其原先由多个分析团队承包,后被缩减为一个办公室。借助 AI,该办公室每月完成了数千项调查。

其他行动者使用 Claude 对文章和社交媒体帖子进行政治敏感度评分。他们将地点、人口属性、政治观点和置信度评级汇编为结构化记录。这些输出可用于审问、监控或其他形式的控制。

据称,一名不具备阿拉伯语能力、与中国政府立场一致的行动人员,针对叙利亚维吾尔人开展了一项持续多日的招募行动。Claude 使用地区方言起草联络内容、翻译回复、通过角色扮演进行质量检查,并将结果整理为供疑似案件官员使用的格式。

模型并未选择受迫害的社群。人类机构提供了目标、任务和预期用途。AI 降低了语言、人员配置和技术门槛,否则这些门槛可能会拖慢行动。

这一模式同样出现在影响力行动中。Anthropic 详细列出了九起源自俄罗斯、伊朗、土耳其、海湾地区、南亚、非洲和欧洲的案例。这些行动的目标受众遍及六大洲。

行动者建立虚假档案、新闻网站、政治信息和协同发帖计划。一些行动与选举相关。俄罗斯国家媒体在摩尔多瓦 2025 年 9 月投票前炮制了虚假说法,而一名肯尼亚行动者则在 2027 年选举前准备了虚假的草根内容。

AI 并未发明欺骗性的政治传播。它以更低的边际成本协助生成角色设定、翻译、文章、定向策略和多种变体。一个小团队便可维持规模更大的独立公众参与假象。

Anthropic 拥有不同寻常的观察视角,因为它可以在行动者策划活动时发现这些行动。社交网络往往只能在内容公开出现后才遇到相关行动。模型服务商可能更早发现目标选择和内容创作。

当内容离开模型平台后,它们的可见性便会下降。Anthropic 表示,其通过开源研究、合作伙伴数据和公开报道来了解下游活动。这意味着一些计划中的行动可能从未启动,另一些则可能迁移到其视野之外。

读者不应将每一条被发现的提示词都视为已完成现实行动的证据。意图、准备、部署、覆盖范围和可衡量影响属于不同阶段。报告在将模型活动与基础设施或佐证证据联系起来时最具说服力。

不过,方向已经很清楚。AI 正在进入监控和政治影响力的日常官僚体系。它可以帮助机构处理更多人员、维持更多角色设定、准备更多报告,而无需按比例扩充人员。

武器研究提出更棘手的保障问题

Anthropic 的发现将讨论从恶意写作辅助推进到连接分析能力与物理系统的软件。

该公司称,其阻断了六起涉及常规武器的案件,涉及中国的三名行动者、俄罗斯的两名行动者和也门的一名行动者。其中四起涉及武器硬件软件,另外两起聚焦采购或情报收集。

据报道,相关项目包括制导火箭、导弹制导、无人机蜂群软件、鱼雷拦截、电子战目标定位和防空压制。Anthropic 称,其中一个制导火箭项目进行了实地测试。

这些行动者在使用 Claude 前通常已具备相关硬件、工程知识或项目访问权限。他们将工作拆分到多个会话中,以掩盖完整目标,并试图绕过安全防护措施。

这一限定很重要。报告并未显示一名毫无相关知识的人提出一个问题后便获得完整武器。它展示的是有能力的团体如何利用 AI 加速工程、调试、研究、文档和采购任务。

Anthropic 表示,其引入了更能检测高爆炸药和武器开发流量的分类器。分类器是一种自动化系统,用于估计某项请求是否属于受限类别。

这类控制措施面临固有问题。许多工程任务都具有正当的民用应用。制导、导航、图像处理、无线电通信、材料分析和飞行控制,既可服务于商业系统,也可服务于军事系统。

报告还描述了具有双重用途特征的生物研究请求。其中一个案例涉及一份资助提案,讨论对基孔肯雅病毒进行可能影响传播性和免疫逃逸能力的改造。

据称,Claude 拒绝协助其中部分工作,用户随后转向另一项 AI 服务。Anthropic 表示,其较旧模型尚未达到能实质性协助高水平生物研究人员的门槛;但对于当前系统,它并未作出同样保证。

生物保障案例的报道凸显了这种不确定性。能力更强的模型可以支持正当研究,但同样的能力也使判断哪些请求应被阻止变得更加复杂。

过度拦截会带来真实成本。科学家、公共卫生团队和安全研究人员可能需要与受限工作相似的信息。拦截不足则可能向恶意行动者提供实验设计或行动规划方面的帮助。

模型服务商必须在信息不完整的情况下作出这些决定。一个看似无害的请求,可能是隐蔽项目的一个片段;一个令人担忧的请求,也可能属于获授权的防御性研究。

同样的弱点也影响网络安全防护。攻击者可以将目标拆分为普通任务、切换账户、使用被盗凭据,或组合多个服务商。开放权重模型则提供了另一条路径,且没有能够关闭账户的中央运营者。

因此,没有任何服务商能够将安全描述为一项已完成的产品功能。防护措施会增加阻力并改善检测,但不会从更广泛的环境中移除能力。关键衡量标准在于,干预是否比能力降低成本更快地提高攻击者成本。

Anthropic 的 AI Misuse Report 提供了成功阻断行动的证据,但无法展示 Anthropic 从未发现的行动。它也无法确定有多少行动者放弃项目、迁移到其他地方,或继续使用本地部署的系统。

这种不确定性应避免两种相反的错误。相关案例并不能证明 AI 代理能够独立执行每一项复杂行动;但也不支持因为人类仍在选择目标,就淡化这一问题。

人类指挥与机器执行可以共存。事实上,这种组合或许是有害行动最实用的结构,因为它在保留判断力的同时扩大了可重复工作的规模。

模型蒸馏将客户数据变成安全问题

报告最后的反转在于,AI 服务商不仅是被滥用的平台,也可能成为目标、数据来源和被窃取的计算资源。

Anthropic 指控多家中国 AI 实验室针对 Claude 开展未经授权的蒸馏行动。蒸馏是指利用一个模型的输出改进另一个模型的行为或能力。

Anthropic 称,Alibaba 在 2026 年 5 月至 7 月期间生成了超过 1.51 亿次交互。Moonshot 据称在同期生成了超过 2300 万次交互。DeepSeek 则在 7 月的 14 天内生成了超过 1210 万次交互。

该公司将 6 月和 7 月共 17 天内超过 340 万次交互归因于 Zhipu。它称 Xiaomi 在 3 月和 4 月的 20 天内生成了超过 40 万次交互。

这些数字属于 Anthropic 的发现,尚未在报告中接受独立审计。在评估归因、意图和合同主张时,被点名公司的回应同样重要。

Anthropic 表示,这些行动旨在获取推理、编程、工具使用和数据分析能力。据称,行动者使用虚假身份、被盗信用卡、遭入侵的 API 凭据、代理服务器和数千个账户来规避访问控制。

一些人测试了大量提示词变体,以提取隐藏的推理轨迹。据报道,一项实验发送了超过 12,000 个不同请求,以识别有效的提取方法,之后才启动更大规模的行动。

最令人担忧的主张涉及客户数据。Anthropic 称,DeepSeek、Moonshot 和 Xiaomi 将部分用户对话路由至 Claude 用于训练。用户据称并未被告知另一家模型服务商会处理其请求。

Anthropic 报告称,一些交互中包含姓名、电子邮件地址、公司信息、开发者凭据和内部预测。第三方路由服务据称还提供了涉及美国和欧洲用户的额外对话。

这些主张扩大了 AI 供应链风险的含义。客户可能认为信息正发送至一款应用和一个模型;但在实践中,请求可能经过路由器、转售商、代理服务、评估机构和隐藏的上游服务商。

企业应要求供应商明确说明,究竟由哪些模型处理所提交的信息。同时,还需要就数据保留、训练用途、区域路由、分包处理方,以及人工审核人员的访问权限获得清晰答复。

这一事件形成了一种令人棘手的对称性。Anthropic 指责其他组织涉嫌未经同意转发用户数据;与此同时,其自身报告也展示了模型提供商能够通过滥用监测推断出多少信息。

两种情况并不等同,但它们都指向同一个治理问题:敏感信息可能比用户预期传播得更远,无论是通过隐蔽路由、安全遥测,还是调查过程。

解决方案不可能只是承诺机密数据永远不会流动。组织需要可强制执行的控制措施、可验证的路由机制、最小化的数据保留,以及能够显示每项请求由哪些系统处理的日志。

这也是为什么员工应避免将仍在使用的机密信息输入未经批准的 AI 工具。精致的界面并不能说明请求会被发送到哪里,也无法表明有多少中间方能够访问这些信息。

防御者接下来应关注什么

下一项考验在于,安全响应是否会改变《Anthropic 的 AI 滥用报告》中描述的攻击经济学。

第一个信号是跨提供商的协同打击。Anthropic 表示,会在适当情况下与公共和私营合作伙伴分享发现。更有力的检验是:一家提供商的检测结果,能否迅速使其他平台上的相关账户、基础设施和被盗凭证失效。

如果合作有所改善,攻击者将失去一部分在不同服务之间完整迁移工作流的能力。若攻击活动持续通过新账户和替代模型重新出现,账户封禁仍只会是暂时的阻力。

第二个信号是有关代理自主性的证据。未来报告应将 AI 生成的建议与通过工具实际执行的操作区分开来,并指出哪些环节由人类批准命令、纠正失败、选择目标,或解读模糊结果。

这种区分将显示,代理是否正变得更加独立,抑或只是让熟练操作人员的效率更高。两种结果都很重要,但需要不同的防御措施和政策应对。

第三个信号是调查与隐私方面的透明度。提供商应说明其保留哪些数据、滥用分类器如何触发审查,以及如何限制调查人员的访问权限。在不会帮助攻击者的情况下,他们还应披露误报情况和申诉机制。

对安全负责人而言,眼下的应对措施很实际:盘点 AI 凭证,审查模型路由器,减少长期有效令牌,并监测异常的自动化活动。还应测试遭入侵的开发者设备是否可能暴露模型会话或相关的生产环境机密。

团队还应针对机器速度的迭代更新事件响应计划。一个被拦截的域名或被检测到的载荷,可能在数分钟内促使自动化修订。防御方需要协调身份撤销、端点隔离、云日志记录和供应商沟通。

知识工作者应核实敏感提示词会被发送到哪里。在提交源代码、内部文档、凭证、研究数据或客户记录之前,应确认所用提供商已经获批,并了解其数据处理条款。

Anthropic 的报告并未证明自主网络末日已经到来。它记录的是一种更迫切的现实:人类正利用 AI,将专业知识转化为可在网络犯罪、监控、宣传和武器研发中重复使用的基础设施。

下一份报告要回答的问题,不是滥用是否会持续,而是防御方能否迫使攻击者为每一次成功行动付出更多身份、资金、时间和专业知识。这个可衡量的较量,将揭示防护措施是在遏制这一转变,还是仅仅在记录它。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page