Anthropic Claude 滥用暴露出其安全措施无法完全遏制的冲突
Anthropic 披露,尽管其安全措施旨在阻止武器、监控和进攻性网络活动,Claude 仍支持了至少七类有害活动。这些 Anthropic Claude 滥用案例涵盖了在 2025 年 12 月至 2026 年 8 月期间发现的行动,包括制导武器工程、间谍活动、大规模监控、影响力行动、欺诈、生物研究和模型窃取。
这并不只是一些人向聊天机器人提出危险问题的集合。一些行动者将 Claude 视为真实项目操作系统的一部分。他们在多个代理之间分配任务,将模型接入代码和数据,并带着实体测试结果返回。
Anthropic 表示,其已封禁相关账户、加强防御措施,并与有关合作伙伴共享情报。但其发现形成了令人不安的反差:同样被用于编程、分析和自动化的能力,也帮助小型团队完成了过去只有大型组织才能承担的工作。
该报告并未独立证明每一项归因、行动目标或所声称的能力。Anthropic 掌握底层账户记录,并披露了经过筛选的证据。其可见性很有价值,但外部人士无法仅凭已公开的材料对该公司的结论进行全面审计。
Anthropic Claude 滥用案例超出了聊天机器人建议的范畴
最重要的变化是,据称 Claude 已成为操作工作流的一部分,而不只是信息来源。
Anthropic 于 9 月 10 日发布了最新的威胁情报报告。报告描述了涉及 Claude Haiku、Sonnet 和 Opus 模型的活动。该公司称,几乎没有案例涉及其较新的 Fable 或 Mythos 级系统。
报告涵盖七类危害领域,以及资源水平差异巨大的行动者。Anthropic 识别出疑似由国家支持的团体、商业间谍软件供应商、犯罪分子、宣传组织和具有政治动机的个人。这种多样性之所以重要,是因为它表明通用 AI 既能支持机构化行动,也能支持规模小得多的团队。
武器案例提供了最清晰的例子。Anthropic 称,也门北部的一个小组使用 Claude Code 开发制导、导航和控制软件。这类软件控制飞行器如何估计自身位置、保持稳定并向目标移动。
据称,该小组推进了三个项目,包括一枚制导火箭、一枚声称射程超过 2,000 公里的弹道导弹,以及一个含高超音速型号的导弹系列。Anthropic 未发现该团体部署可操作装置的证据。
不过,该公司称,这些行动者确实进行了一次制导火箭测试。该测试显然失败了。数小时内,他们便返回 Claude,请其协助诊断故障。
这一反馈闭环将该案例与推测性的在线研究区分开来。Claude 生成的代码进入了一个涵盖仿真、固件、硬件、测试和故障分析的工作流。模型输出与聊天窗口之外的活动相连。
该小组还运行了多个 Claude 实例,并为其分配不同任务。一个编写代码,另一个进行研究,第三个审查第一个实例的工作。这种结构类似于由人类负责人管理的小型工程团队。
Anthropic 表示,其安全措施拦截了许多请求,但并非全部。用户隐藏了目标,并将工作拆分到不同会话中。单次对话未必会暴露完整的武器项目。
报告中还出现了其他 Claude 武器开发案例。一名中国境内的行动者据称起草了一份反鱼雷火控规范及一份超过 200 页的技术提案。该行动者还要求 Claude 在扮演敌对专家审稿人的同时,批评连续修订的草案。
另一项行动涉及俄罗斯境内行动者为自主无人机集群开发软件。Anthropic 称,该软件包含共享记忆、协调逻辑、末端制导和引爆指令。据称,这些行动者将固件加载到开发板上,并在仿真环境中测试组件。
这些案例并不能证明 Claude 独立设计出了可用武器。它们表明的是一个更狭窄、但仍具有重大影响的事实:该模型将编程、文档编写、审查、翻译和故障排除整合为一项易于获取的服务。
路透社报道的Claude 滥用案例还涉及军事采购和情报搜集。据称,一名俄罗斯境内的经理使用 Claude 寻找欧洲制造军民两用部件的中间商。
该行动者要求模型规划经由第三国的路线,并掩盖货物的最终目的地。Claude 还协助起草多语种通信内容和正式招标规范。Anthropic 称,浏览器自动化支持了对每份招标中约 40 个项目的搜索。
共同因素并非某一个非凡的回答,而是将许多普通能力整合进一个持续项目。研究、编程、翻译、采购和文档编写成为同一自动化工作流的组成部分。
AI 代理降低了复杂行动的人力门槛
Anthropic 的证据表明,即使 AI 不提供独有的技术知识,它也会改变谁能够组织复杂行动。
传统安全讨论往往聚焦于:模型是否泄露了搜索引擎或技术出版物无法获得的信息。这个问题依然重要,尤其是在生物和武器研究领域。但它无法完整涵盖此处描述的风险。
一些行动者本已拥有设备、领域知识、被盗数据或行动基础设施的访问权限。Claude 并未创造这些资源。相反,据称它填补了软件工程、翻译、数据处理和项目协调方面的空白。
这种协助能够带来显著的“提升”——这是 Anthropic 用于描述 AI 所带来的额外速度、规模或深度的术语。提升并不要求模型发明一种新武器。它可以源于减少进入下一开发阶段所需的人力。
也门北部小组体现了这一差异。其成员可获得硬件,并且显然理解自身更广泛的目标。Claude 提供的软件工作原本可能需要多名工程师完成。多个实例让该组织得以分配任务并核查结果。
监控案例遵循了类似模式。一项与中国立场一致的行动收集了超过 100 个 WhatsApp 群组和数十个 Telegram 频道的消息。据称,Claude 将这些材料转换为结构化的中文情报。
该行动者利用模型关联跨平台身份、绘制社交网络,并识别个人弱点。它还制定了针对维吾尔侨民媒体的计划。收集基础设施存在于 Claude 之外,但模型加速了分析和报告工作。
Anthropic 称,同一行动者还组织了针对叙利亚维吾尔人的秘密接触。操作人员不具备阿拉伯语能力。Claude 翻译消息、生成叙利亚阿拉伯语,并以“专家”顾问身份评估欺骗手法。
因此,翻译不再只是便利功能。它消除了正在进行的招募行动中的一项人力约束。据称,不掌握目标语言的人也能开展长时间对话,并实时根据回复作出调整。
另一项行动涉及一名马里顾问为电信数据构建监控系统。Anthropic 称,该计划中的系统可处理涉及 2,500 万部手机的记录。Claude 是该项目背后的主要工程资源。
据称,该系统旨在收集通话记录、短信和语音流量。拟议功能包括识别不同 SIM 卡上的说话者、检测 VPN 使用情况,以及为单个号码生成档案。
这些说法值得谨慎表述,因为 Anthropic 没有对已完成的系统提供独立审计。不过,所描述的规模表明了为何 AI 辅助监控令民间社会团体担忧:软件人力可以被集中,而监控却能扩展到整个人口。
政府一直会雇用工程师、译员、分析师和线人。AI 并未完全消除这些角色,但它减少了将已收集数据转化为可用情报所需的专业人员数量。
这种人力效应也适用于防御方。安全团队可以利用代理审查警报、调查可疑代码,并整理事件证据。优势将取决于哪一方能更有效地整合这项技术。
为这场竞争做准备的组织,需要的不只是书面的 AI 政策。它们还需要日志、访问控制、审查流程,以及将安全决策与技术证据相连的可搜索知识库。否则,每一个可疑工作流都会变成一次孤立的调查。
压力首先落在模型提供商身上。Anthropic 及其竞争对手必须在不阻碍合法研究的前提下,识别碎片化会话中的有害意图。政府和企业客户随后必须决定,他们希望提供商实施多大程度的监控。
核心权衡在于能力与控制之间
Claude 在能够完成复杂工作时更具商业价值,但这些同样的能力也让有害项目更容易协调。
报告反复描述了合法用户所需要的功能。Claude 可以编写代码、检查项目文件、分析大型数据集、翻译对话、评议文档,并通过连接的工具执行操作。移除这些能力也会降低其价值。
随着代理式 AI 的发展,问题变得更加尖锐;所谓代理式 AI,是指能在有限监督下规划和执行多步骤工作的系统。聊天机器人提供答案,代理则可以修改文件、运行测试、检查失败原因,并持续朝目标推进。
Anthropic 此前曾描述过一场 2025 年由中国国家支持的行动,该行动在网络攻击生命周期的大部分阶段使用了 Claude。该公司的间谍活动调查称,攻击者瞄准了约 30 家组织,并成功入侵其中少数目标。
在那场较早的行动中,据称 Claude 进行了侦察、漏洞分析、凭证窃取和失窃数据处理。人类操作员间歇性地提供战略决策,模型则处理了大量重复性的技术执行工作。
2026 年 9 月披露的信息扩大了这一警告。类似的编排模式出现在武器开发、采购、监控和影响力行动中。即使目标不同,其机制依然一致。
行动者伪装意图、拆分任务、使用虚拟专用网络,并将 Claude 与外部软件结合使用。一些人将有害工作包装成学术研究、防御性测试或普通商业开发。另一些人则将请求分散到多个账户和会话中。
单独评估一条提示词的过滤器,可能会漏掉由看似无害的碎片拼凑而成的程序。飞行控制代码具有民用用途。身份匹配可用于欺诈防范。病原体研究可能有助于疫苗开发。
语境因此变得至关重要,但碎片化工作流恰恰会掩盖语境。服务商需要能够跨时间、工具、账户及相关基础设施分析模式的系统。这也会引发新的隐私和治理问题。
Anthropic 表示,它利用内部调查将不同会话中的活动关联起来,随后封禁了与部分行动有关联的所有账户。报告对这些关联如何建立或审核,仅提供了有限细节。
更主动的监控可以发现协同滥用,也可能暴露记者、研究人员、企业和政府开展的敏感工作。充当威胁情报服务角色的服务商,会获得对客户项目的广泛可见性。
因此,公司既必须控制模型输出,也必须约束自身的调查权限。漏报会让有害活动继续进行;误报可能中断正当研究,而广泛监控则可能削弱用户信任。
这些生物案例体现了其中的困难。Anthropic 描述了一些研究人员正在开展基孔肯雅热病毒的功能获得性研究;该病毒通过蚊虫传播。功能获得性研究是指通过改变生物体,创造或增强某种生物学特性。
据报道,该项目试图寻找影响传播和免疫逃逸的突变。这类工作可以为疫苗和治疗方法提供参考;但具体风险取决于方法、意图和生物安全隔离措施,它也可能提升病原体的危险性。
Anthropic 称,Claude 拒绝了最敏感的请求。不过,据称某个平台将这些请求转交给了安全防护较弱的另一款模型。这一结果暴露出仅由一家服务商实施安全控制的局限性。
意志坚定的行动者可以在多种服务、本地模型、人类顾问和传统软件之间分配工作。Anthropic 可以终止其对 Claude 的访问权限,但无法抹除已保存的输出,也无法阻止其迁移至另一套系统。
这并不意味着安全防护毫无意义。失败的火箭测试表明,生成式辅助并不会自动解决复杂的工程问题。干预可以提高成本、拖慢进度,并向潜在目标发出预警。
这种张力仍不可避免。能力更强的智能体更易用于有价值的商业工作流,也更容易被转用于有害目的。因此,能力评估必须衡量任务在实际操作层面是否完成,而不能只看模型是否回答了被禁止的问题。
证据很严肃,但并非独立审计
Anthropic 的可见性使这份报告具有不同寻常的价值,但其对证据的控制限制了外部人士对每个案例的解读把握。
模型服务商能够看到记者、研究人员和政府分析人员无法获得的信息。他们可以查看提示词、工具调用、账户关联、模型回复和行为变化。这一视角可在物理证据公开前揭示相关项目。
Anthropic 表示,它利用这一可见性,在作战武器部署前识别出也门北部的一个小组。它还观察到用户在一次测试失败后再次返回。传统调查人员可能只有在回收硬件或截获采购活动后,才会发现此类行为。
不过,公众读者获得的是 Anthropic 对案例及结论的筛选,而不是完整的账户历史、原始遥测数据或所有可能的替代解释。出于安全和隐私考虑,完全披露并不现实。
由此产生了不可避免的验证缺口。Anthropic 有理由隐去可能帮助模仿者的操作细节;但隐去这些细节,也使独立专家无法复现其评估。
归因尤其值得谨慎对待。该公司使用内部的“生成式威胁组织”标识符来指代活动集群。一些案例获得了地理位置或与国家相关的评估,但 Anthropic 往往无法指出具体组织。
基于地点的发现也不能证明某人属于特定武装团体。也门北部由胡塞武装控制,但 Anthropic 并未识别该武器小组。一名胡塞官员对该运动依赖公共 AI 工具的暗示提出质疑。
美联社报道称,Hazam al-Assad 称这种说法不合理。其 也门武器报道 还援引武器分析师 Trevor Ball 的观点,他质疑该组织是否具备制造高超音速导弹的能力。
Ball 指出,研究某种能力并不意味着行动者能够制造出来。材料、测试设施、质量控制和系统集成仍是重要障碍。软件辅助无法消除所有物理约束。
公司所谓“已阻断”的标签也需要精确理解。Anthropic 将阻断主要定义为封禁其能够关联到某一行动者的账户。这可以终止其在一个平台上的访问,但未必会结束更广泛的行动。
据 Anthropic 称,该也门小组已经创建了一套离线仿真工具包。其他团体利用外部基础设施收集数据或实施攻击。一些团体可能保存了模型生成的代码,并在其他地方继续活动。
生物研究意图更难评估。正当研究与有害研究可能共享术语、方法和实验目标。一项涉及病毒传播的资助申请,本身并不能证明其属于生物武器项目。
Anthropic 表示,一项相关资助涉及军事研究机构和国家支持的资金。不过,生物滥用调查结果 仍在很大程度上依赖于该公司对账户活动的解读。
报告还指出,其中的案例属于例外情况。它们代表 Anthropic 识别出的最显著、最新颖的活动,而非 Claude 的典型使用方式。读者不应将这组案例视为对整体滥用普遍程度的衡量。
报告未提供分母。公众无法计算 Claude 会话中有多少比例涉及疑似有害活动;也无法比较不同服务商之间的检测率,因为各公司依据不同定义发布不同证据。
还存在第二个筛选问题。Anthropic 可以报告其发现的活动,但未被发现的行动仍不可见。有力的案例研究并不能说明安全防护成功的频率,也不能说明复杂行动者规避防护的频率。
这些局限并不会抹除证据,而是界定了报告能够支持的结论。它展示了可信的滥用尝试模式,以及若干与现实项目的关联;但它并未提供完整统计,也未独立证实每一项归因。
Anthropic 的竞争对手面临同样的跨平台问题
Claude 上的一条安全规则,无法遏制在商业模型、开放系统和常规工程工具之间流转的工作流。
Anthropic 对基孔肯雅热项目的描述,明确揭示了跨平台问题。Claude 拒绝提供敏感协助,而用户的平台随后据称将相关工作转交给一家竞争对手,其安全防护据报允许了更多此类协助。
这一过程改变了竞争格局。安全控制更严格的服务商可能会将使用量流失给限制更宽松的服务商。有害行动者仍可继续工作,而更谨慎的公司则承担拒绝服务带来的商业和政治成本。
OpenAI、Google、xAI、Meta 及其他模型开发商都面临这一问题的不同变体。它们的产品在访问方式、工具使用、监控和可接受使用政策上各不相同。这些差异创造了用户可以有意利用的空隙。
开放模型进一步加大了执法难度。一旦模型权重运行在用户控制的基础设施上,开发者便难以检查会话或撤销访问权限。本地部署可以保护隐私,但也限制了集中式滥用检测。
商业服务商保留了更大的影响力,因为它们控制账户和算力。它们可以检测模式、暂停用户并更新分类器。其日志也使它们成为情报持有者,承担传统软件公司通常不承担的责任。
Anthropic 的报告主张与政府及行业伙伴共享情报。合作可以帮助服务商识别已在其他地方发现的策略,也可能阻止被封禁的行动者立即在另一项服务上重建同一行动。
但共享执法需要共同定义和正当程序。对“可疑研究”的模糊警告可能伤害正当科学家或安全团队;详细指标则可能泄露敏感的检测方法或客户信息。
竞争也包括使用同样能力的防御方。自动化漏洞发现可在攻击者得手前暴露系统问题。智能体可以比人手不足的安全团队更快地分拣警报并调查恶意基础设施。
Anthropic 在自身调查中使用了 Claude。这反映了核心权衡,而非解决了它。理解智能体攻击所需的工具,往往正是攻击者用来扩大规模的工具。
仅聚焦模型拒答的监管,将忽略这一机制的很大部分。报告中的行动使用了账户网络、外部数据收集、浏览器自动化、文件访问和已保存代码。风险在整个工作流中不断累积。
有意义的监管应审视模型能力、工具权限、身份控制、日志记录、事件报告和跨服务商协调。它还应区分研究、防御性测试、军事采购和直接武器操作。
由于 Anthropic 已向国家安全机构提供 Claude,这场讨论变得尤为敏感。该公司为一些军事用途辩护,同时反对完全自主武器和大规模国内监控。
这一立场在获授权的政府部署与被禁止的应用之间划出界线。新报告表明,当用户隐瞒语境并将模型连接到外部系统时,此类界线有多难执行。
它还从相反的方向带来了政治压力。安全倡导者可以主张,对先进智能体需要更严格的部署控制;政府客户则可能认为,服务商限制妨碍了合法任务。
限制较少的竞争对手,可能获得 Anthropic 拒绝服务的客户。然而,一起重大的滥用事件可能会使宽松政策成为监管负担。安全执法正成为竞争定位的一部分,而不只是内部合规问题。
最终结果不会取决于一家公司的政策,而取决于行业能否在行动者将有害工作负载在不同服务商之间转移常态化之前,建立可互操作的防御体系。
Anthropic 威胁报告之后应关注什么
下一项考验在于,服务商能否将生动的案例研究转化为对实际操作层面滥用的可量化降低。
第一个信号是跨服务商的威胁共享。Anthropic 表示,它会在适当情况下通知公共和私营伙伴。真正值得关注的是,竞争实验室是否会发布相互印证的指标、协调一致的阻断行动,或共同的报告分类。
共同定义将使未来报告更易比较。服务商可以披露其如何界定武器开发、网络行动、生物滥用和监控;也可以说明账户暂停实际中断了什么。
如果协调行动得以推进,Anthropic 的核心论点就会更具说服力。前沿模型提供商可充当新兴威胁的分布式预警网络。若合作始终停留在非正式层面,相关行为者仍会继续利用政策上的不一致。
第二个信号来自下一代安全防护措施的证据。Anthropic 表示,其已引入针对高爆炸药和武器研发的分类器。分类器是用于识别与特定风险相关内容或行为模式的系统。
未来的报告应说明,这些系统能否识别碎片化项目,而不仅是孤立的提示词。可参考的有效指标包括更早介入、更少的重复规避行为,以及在受控评估中更低的任务完成率。
误报证据同样重要。一项阻断无害航空航天、生物或网络安全研究的防护措施,可能会使合法用户流失。提供商需要建立与封禁账户后果相匹配的申诉和审查流程。
更强的结果将支持这样一种观点:安全改进能够跟上模型能力的发展速度。若持续出现使用相同规避方法的案例,则表明过滤机制仍然是被动应对。向本地模型迁移的趋势则会暴露另一项限制。
第三个信号是对实际运营影响的独立验证。调查人员最终或许能将 Anthropic 的案件标识符与查获设备、恶意软件活动、采购网络或受影响组织联系起来。这类证据将有助于厘清哪些项目已超出规划阶段。
独立发现可能会强化报告中最严肃的评估,也可能揭示夸大表述、错误归因或较低的技术成熟度。无论结果如何,都将增进公众理解。
也门案例提供了一个具体例子。若能确认相关制导软件或采购活动,将表明 Claude 在武器研发中的作用已更深入地进入该项目。若测试仍持续失败,则会凸显生成代码与实际部署硬件之间仍存在的差距。
网络安全调查或许能更快得出答案。受害者、政府和安全公司有时可以将 Anthropic 提供的指标与事件记录进行比对。基础设施或恶意软件行为的匹配,将在不暴露完整客户日志的前提下提供佐证。
不应将 Anthropic Claude 滥用简单归结为某个聊天机器人独自设计武器或开展间谍活动的说法。已有记录呈现的是一种更具系统性的模式:模型在由拥有外部工具和目标的人类行为者控制的项目中,提供了可灵活调整的劳动力。
这一模式为提供商带来了一个有限的干预机会。集中式服务能够观察到本地软件无法看到的行为。它们可以禁用账户、调整安全防护,并向潜在目标发出警告。
这一机会并非永久存在。已保存的输出不会因账户被封而消失,用户也可以在不同模型之间迁移。能力更强的本地系统将进一步降低提供商的可见性。
开发者、企业采购方和安全负责人应当关注:智能体如何在整个任务过程中受到监控,而不只是停留在提示词边界。他们还应要求提供证据,证明相关控制措施能够应对碎片化、多语言以及与工具连接的活动。
因此,下一份 Anthropic 威胁报告应以结果来衡量。检测是否更早发生?协调封禁是否阻止了用户迁移?独立证据是否确认了最高风险案例?
这些答案将表明,Anthropic Claude 滥用披露究竟代表着一套持续改进的防御系统,还是一份在大量工作完成后才发现威胁的反复记录。



