Anthropic 在 Claude 协助也门一个组织后,直面将 AI 用于武器研发的问题
Anthropic 表示,也门北部的一个组织在三个武器项目中使用了 Claude,尽管其安全措施本意是阻止将 AI 用于武器研发。据称,这些项目包括一枚制导火箭、一个标称射程超过 2,000 公里的弹道导弹概念,以及一个名为“R2000”的导弹系列。
这并非某一条被禁止的提示词侥幸绕过了过滤器。Anthropic 称,这些人员将工作拆分到不同的对话中,并隐瞒软件所要控制的对象。他们还为多个 Claude 实例分配了不同的工程角色。
最重要的结果并不是一枚可用的导弹。Anthropic 表示,没有证据显示该组织部署了可运行的设备。更深层的担忧在于,在服务提供商还原出更大范围的模式之前,这一 AI 编程助手据称已支持了一条持续开展的工程工作流。
这使 Anthropic 的披露成为对两种现实的检验:AI 模型可以加速正当工程工作,但同样的通用能力也可能减少武器研究所需的人力投入。
Anthropic 所称也门事件的经过
Anthropic 的说法描述的是一项由 AI 支持的工程项目,而非一次孤立地试图获取危险信息的行为。
该公司在其 2026 年 9 月发布的滥用调查中披露了此案。Anthropic 将该团体识别为位于也门北部的威胁行为者组织,但未公开点名任何组织。
Anthropic 称,该组织正在推进三个项目。其中一个涉及使用商用手机级计算机的制导火箭。另一个则是一种多级弹道导弹,标称射程目标超过 2,000 公里。
第三个项目是一组被称为 R2000 的导弹变体。Anthropic 称,该系列包括一种高超音速滑翔飞行器变体。高超音速滑翔飞行器是一种可机动载荷,旨在以极高速度穿越大气层。
该报告并未证明该组织完成了其中任何一种系统。它描述的是这些人员在使用 Claude 时讨论、开发、模拟或尝试的内容。
最成熟的活动涉及一枚制导火箭。Anthropic 称,这些人员进行了现场测试,但测试似乎失败了。数小时内,他们便回到 Claude 调查故障原因。
这一过程很重要,因为它将模型使用与实体开发周期联系起来。这些人员并非只是就推进或空气动力学提出抽象问题。据称,他们在软件开发、模拟、现场测试和故障分析之间来回切换。
Claude Code 发挥了核心作用。Anthropic 称,这些人员在开发制导、导航和控制软件时,以 Claude Code 替代了人类软件工程师。GNC 软件负责让飞行器估算自身位置、保持稳定,并沿既定路径飞行。
据称,该组织使用 Claude 协助将一个开源自动驾驶仪与手机级计算机集成。这项工作包括控制软件、位置估算、参数调校、固件构建和模拟。
这些细节意义重大,但需要谨慎解读。Anthropic 观察到了对话及相关账户活动。其报告并未提供对已完成武器的独立检查,也没有公开发布现场测试的证据。
安全研究员 Bruce Schneier 在一则简短的安全警告中强调了这一案例。他的结论很直接:AI 系统会传播专业知识和能力,通常用于有益目的,但并不总是如此。
因此,这一事件更有力地证明了曾试图获得协助,而非已取得实战成功。它显示,一名威胁行为者将商业 AI 服务整合进工程工作中。但它并不能证明 Claude 独立设计或部署了一枚可行的导弹。
这一差别应始终处于讨论的核心。耸动的标签可能掩盖实际的开发阶段,而过度怀疑也可能忽视 Anthropic 所记录的持续工作流。
此案之所以严重,在于其过程,而不在于 Anthropic 证明了存在一件成功由 AI 制造的武器。
将 AI 用于武器研发成为一种团队工作流
核心变化在于组织方式:一个小型组织可以将工程劳动分配给多个 AI 智能体,并让其中一部分工作并行进行。
Anthropic 表示,也门的这些人员同时管理了多个 Claude 实例。一个实例编写代码,另一个开展研究,第三个则审查第一个实例的输出。
这一安排类似于一个小型工程团队。人类操作人员仍掌握主导权,但模型实例为专业任务提供了劳动力。这种结构无需 AI 控制整个项目,便可提高速度。
“AI 自主性”这一说法在这里可能具有误导性。Anthropic 并未报告 Claude 选择了武器项目或发起了发射。人类显然选择了目标、提供了背景、审查了输出,并将软件工作与硬件连接起来。
然而,AI 无需实现完全自主,便可以改变一项行动。模型可以缩短编写代码、核查假设、准备测试、记录故障以及比较替代方案所花费的时间。
这种劳动压缩是眼下的安全问题。模型不必开创物理学的新分支;它只需协助现有团队以更少的专业人员完成常见工程任务。
该组织还使用 Claude 进行数字建模。Anthropic 称,这些人员进行了轨迹模拟、控制优化以及针对参考实现的校准。他们最终制作出一套不依赖 Claude 或 MATLAB 的离线模拟工具包。
最后这一步改变了遏制问题。封禁账户可以中断持续访问,但无法收回已从服务中导出的软件、文档或模型。
Anthropic 的报告中还出现了相同模式。该公司描述了六起常规武器案件,其中三起与中国有关,两起与俄罗斯有关,一起与也门有关。
其中四起涉及武器开发或设计。另两起涉及为国防相关工作提供支持的采购和情报收集。
据称,一名位于中国的行为者使用 Claude 起草了一份反鱼雷火控规范和一份超过 200 页的提案。Anthropic 称,该行为者还要求模型以敌对审阅者的身份批评连续的草案版本。
据称,一个俄罗斯组织在开发自主无人机蜂群软件时使用了 Claude Code。Anthropic 评估认为,该项目已进入模拟和开发板测试阶段,但尚未进入实际部署。
另一名位于中国的行为者据称开发了约 16 个与电子战和防空压制有关的软件模块。Anthropic 称,该行为者将这套软件修订至 12 个版本。
这些案例并不能证明每一项输出都准确或具有军事用途。但它们显示,通用编程智能体如何能在同一环境中支持规划、文档编制、模拟、审查和实施。
正因如此,将 AI 用于武器研发不能被简化为聊天机器人回答一个被禁止的问题。当模型能够跨文件、工具、迭代测试和持续项目上下文运行时,其作用会更大。
核心风险在于累积性协助。每项请求都可能看似寻常,但组合后的工作流却可支持被禁止的目标。
调试控制软件的请求可能看起来像正当的机器人技术工作。改进位置估算的请求可适用于消费级无人机、工业系统或制导武器。
模型看到的是一项技术任务。服务提供商必须判断,一连串此类任务是否揭示了有害意图。
这正是智能体系统给安全控制带来更大压力的地方。智能体系统可以规划子任务、使用软件工具、检查文件,并在追求用户定义目标的过程中修订自己的工作。
这些能力能让开发者受益,因为它们减少了上下文切换。它们也让恶意用户获得比问答界面更完整的工程助手。
因此,也门案例标志着从信息获取向工作流执行的转变。公开文件和开源软件已经包含了许多相关知识。据称,Claude 让这些知识更容易被整合、测试和复用。
隐藏意图是安全措施面临的问题
Anthropic 拒绝了许多单独请求,但这些人员据称通过将意图分散到不同会话中,并将危险工作包装成普通工程工作而得手。
该公司表示,其安全措施拒绝了也门组织提出的许多请求。但这些拒绝并未阻止整个项目,因为这些人员隐瞒了软件的用途,并将相关任务拆分开来。
没有任何一段单独对话必然暴露完整目标。一个会话可以讨论估算软件,另一个可以处理模拟,第三个则可以审查代码。
这种碎片化攻击了内容审核的一项基本弱点。分类器通常评估其可见的材料。当有害意图只有在关联许多看似中性的互动后才显现时,作出判断就会更加困难。
工程工作的双重用途属性进一步加剧了这一问题。飞行控制概念与民用航空、教育、太空研究、工业无人机和业余项目都有关。广泛屏蔽这些概念会干扰正当工作。
宽松的过滤机制则会带来相反风险。它可能允许意志坚定的行为者不断积累协助,直至普通组件成为武器工作流的一部分。
Anthropic 的回应是封禁其认定与这些人员有关的所有账户。该公司还表示,已与适当的公共和私营合作伙伴共享威胁信息。
该公司还推出了面向高爆炸药和武器研发的分类器。分类器是一种专门模型,依据预先定义的风险类别对流量进行标记。
这一回应延续了 Anthropic 先前在核安全方面的工作。2025 年,该公司介绍了一款与美国能源部和国家实验室共同开发的核分类器。
Anthropic 报告称,该系统在初步测试中的准确率为 96%。这项评估使用了数百条合成提示词,旨在区分危险的核相关讨论与良性的能源、医疗和政策对话。
较高的测试分数并不能解决当前案例。合成示例无法完全复现一名会改变词汇、使用多个账户或将项目拆分为看似无害部分的耐心对手。
准确率也掩盖了不同错误的后果。误报可能阻断正当研究;漏报则可能提供难以收回的协助。
跨会话分析提供了一种可能的防御手段,但也带来其自身担忧。服务提供商需要随时间关联活动、识别相关账户并审查行为模式,同时不能将每一位技术用户都视为嫌疑人。
这可能与隐私预期发生冲突。如果开发者认为每个项目都会受到安全调查,他们可能会犹豫是否将专有代码放入服务中。
此外还存在竞争层面的限制。如果一家提供商实施严格监控,恶意用户可以转向另一家托管模型服务、入侵账户,或采用本地运行的系统。
开放权重模型带来了额外挑战,因为其运营者可以移除安全护栏。不过,托管平台拥有本地系统所不具备的优势:它们可以观察滥用行为、禁用账户、更新防御措施,并向合作伙伴发出警告。
也门案例展示了这种可见性的两面性。Anthropic 发现了某些活动,而政府部门原本可能只能在检查缴获的硬件后才会发现这些活动。然而,检测显然发生在大量工作已经完成之后。
因此,政策问题并不是安全护栏是否绝对成功或失败。它们阻止了一部分协助,遗漏了另一部分协助,并最终为调查提供了支持。
这种混合结果比简单的失败叙事更具参考价值。它表明,模型安全是一项持续进行的安全运营,而不是在发布时安装的永久屏障。
提供商需要威胁分析师、账户控制措施、行为检测、模型评估以及信息共享关系。仅靠拒答训练,无法应对将模型视为更大开发环境中一个组成部分的对手。
Claude 降低了人力成本,而非违背物理规律
AI 协助可以加速软件开发和分析,但无法消除构建可靠武器所面临的物理、工业和运营障碍。
Anthropic 的报告包含一个关键限制:该公司没有发现证据表明也门相关行动者部署了可运行的装置。
这次制导火箭测试显然失败了。这一失败表明,看似合理的软件输出与能够在真实条件下运作的系统之间仍存在距离。
导弹开发需要的不只是代码。它依赖于制造质量、推进系统、材料、传感器、测试基础设施、可靠组件,以及能够将它们整合起来的团队。
语言模型能够生成令人信服的文本,同时也可能犯下细微错误。在武器工程中,涉及时序、假设、传感器行为或环境条件的错误,都可能使设计失效。
仿真同样存在局限。数字模型反映的是其输入和假设。它无法保证硬件在振动、高温、干扰、制造差异或组件故障条件下也会以相同方式运行。
斯德哥尔摩国际和平研究所的独立分析指出了类似限制。其军事 AI 分析强调了输出不可靠、网络脆弱性、数据薄弱、硬件不足和工业能力有限等问题。
这些障碍意味着,不应将 Claude 描述为一套交钥匙式武器设计工具。但这并不意味着被报道的滥用行为无关紧要。
AI 仍可提升那些已拥有设备和领域知识之人的生产效率。Anthropic 表示,这些行动者将 Claude 与他们能够获取的硬件、固件和开源自动驾驶仪结合使用。
模型的价值在于帮助他们连接这些要素。它支持了从一个想法到可测试系统之间的重复性工作。
这就是创造能力与提供能力增益之间的区别。Anthropic 并未声称 Claude 向未经训练的个人提供了制造导弹所需的一切。它表示,该模型强化了已有的技术工作。
即使最终产品失败,这种能力增益仍可能产生影响。失败分析是工程工作的一部分,而能够加速诊断的系统可以帮助团队更快进入下一次测试。
风险也不仅限于高端武器项目。要求没那么高的系统可以容忍较低可靠性,尤其是在大规模制造或用于攻击软目标时。
对于先进导弹而言仍显不足的模型,或许仍能协助开发更廉价的无人机、监视系统、目标指示界面或采购文件。Anthropic 报告的六起案例涵盖了这条更广泛的运营链条。
其报告中与俄罗斯有关联的采购案例说明了这一点。据称,该行动者使用 Claude 进行供应商研究、多语言通信、招标文件编制和工作流自动化。
这些任务单独来看都不构成武器设计。但结合起来,它们可以支持国防供应网络。
这种更广阔的视角避免了让讨论仅聚焦于引人注目的技术成就。在产生任何新型硬件能力之前,AI 就可能影响物流、情报、文档、软件和组织吞吐能力。
这也使衡量变得更复杂。提供商可以统计被拦截的请求或被关闭的账户,但这些数字无法揭示在检测之前完成了多少有用工作。
同样,一次失败的测试并不能衡量模型的贡献。如果没有 Claude,项目可能更早失败;或者 Claude 也可能引入了导致失败的错误。公开证据无法解决这一反事实问题。
因此,Anthropic 自己的叙述应被视为有价值但不完整的遥测信息。该公司能够访问外部人士无法独立检查的内部数据。
它也有动力证明自己能够发现滥用行为并改进安全护栏。这些动机并不会使报告失效,但支持采取谨慎归因。
负责任的结论应当是有限的。据报道,Claude 向寻求开发武器的行动者提供了有意义的工程协助;但已知的实体测试失败,且尚未证实其取得了实际运行上的成功。
模型提供商正在成为安全观测站
这项披露使 AI 公司进入了一个陌生角色:它们同时是服务提供商、调查者、证据持有者和执法行动者。
传统武器调查通常始于被截获的货物、情报报告、测试影像或缴获的组件。Anthropic 则是通过其自身平台的使用情况发现了也门相关活动。
这种位置赋予前沿模型提供商不同寻常的可见性。它们可以观察用户如何将 AI 应用于编码、研究、采购和分析。
它们还可以看到失败的尝试、被放弃的项目,以及那些从未公开可见的早期实验。
这创造了一种潜在的预警系统。模型使用模式或许能在政府发现完整系统之前揭示新出现的威胁。
然而,私营提供商的发现并不具备经独立验证的武器检查同等的证据分量。公众通常无法查验完整的对话记录、账户元数据或技术工件。
国家安全限制可能进一步限制披露。过多揭示检测方法,可能帮助对手规避检测。发布详细技术内容,也可能放大安全护栏本来要遏制的材料。
结果是出现了问责缺口。Anthropic 可以描述它看到的情况,但外部人士可能难以检验其评估。
政府也面临相关问题。它们需要来自提供商的信息,但广泛的监控要求可能威胁隐私、研究自由和商业机密。
2026 年的AI 安全评估概括了更广泛的不确定性。该评估指出,复杂攻击者往往能够绕过当前防御措施,且许多安全护栏缺乏经验证的现实世界有效性。
也门案例为这一警告提供了现实证据。据称,这些行动者绕过限制的方式是隐藏意图并拆分工作,而不是发现某个神奇的单一提示词。
政策应对必须针对行为,而不是被禁词汇。这包括反复从事违禁系统相关工作、关联账户、可疑工具使用,以及试图隐藏最终用户等模式。
提供商还需要建立机制,在不必要地传播敏感用户数据的前提下共享高置信度指标。这些关系应包括正当程序、访问控制、保留期限和独立监督。
行业协调将至关重要,因为对手可以切换服务。Anthropic 表示,它在发现相关活动后通知了其他平台。
共享防御措施可以减少风险转移,但也会引发竞争和公民自由问题。基于薄弱信号建立的行业黑名单,可能错误地排除合法研究人员或冲突地区的用户。
地理限制是另一种并不完美的控制方式。Anthropic 报告称,一些行动者使用虚拟私有服务器规避区域访问规则。
封锁一个国家并不能可靠识别用户的目的。它还可能让平民无法获得有益工具,而复杂组织则会绕过这一限制。
最有力的方法将结合多个层面。模型行为、账户历史、工具活动、身份信号和人工调查,各自揭示风险的不同部分。
不应将任何一层单独视为决定性证据。安全拒答可以阻止即时协助,而调查则可以识别单次拒答所遗漏的模式。
外部评估同样重要。Anthropic 在其威胁报告发布的同时,针对战术情报和常规武器任务推出了武器评估。
评估可以显示新模型是否正在受控场景中变得更有能力。事件报告则显示这些能力如何出现在实际使用中。
这两种证据形式应相互补充。没有事件数据的基准测试可能错过对抗性行为。没有标准化测试的事件报告则无法显示不同模型之间的风险如何变化。
Anthropic、OpenAI、Google、Meta 和其他开发者如今面临发布可比证据的压力。如果没有共同的报告分类,外部人士无法判断一家公司是滥用更多,还是仅仅检测得更多。
透明度应涵盖失败的攻击以及严重案例。它应说明提供商观察到了什么、哪些方面仍不确定、改变了哪些控制措施,以及这些变化如何得到测试。
三个信号将显示防御措施是否正在追赶
下一项考验是,行业能否更早发现关联行为,同时不阻碍合法工程活动,也不将托管 AI 变成无处不在的监控工具。
第一个信号是,Anthropic 在部署其新的分类器后是否报告了类似的武器活动。只有当该公司同时说明检测覆盖范围发生了怎样的变化时,报告数量下降才值得鼓舞。
报告案例减少可能意味着预防效果更好。也可能意味着对手转向了其他账户、平台或本地模型。
更多案例并不必然意味着安全性恶化。改进检测最初可能让问题看起来更严重,因为此前隐藏的活动变得可见。
有用的指标是干预时机。提供商应报告,它们是否能在用户导出持久化工具、将代码连接到硬件或进行实体测试之前识别出违禁项目。
第二个信号是,多家 AI 公司是否采用兼容的武器风险评估和事件分类。可比的报告将帮助政府和研究人员区分提供商特有的个案与全行业模式。
共享衡量方式应保留重要差异。研究、采购、仿真、组件软件、实体测试和实际部署代表着不同程度的关切。
将它们统称为“AI 武器”或许会制造耸动的标题,却会削弱分析的质量。明确的成熟度分级将使不同报告更易于比较。
第三个信号是关于现实世界能力提升的证据。尚未解决的问题并非模型能否生成技术材料,而是它们是否能让特定行为者以更快、更低成本或更少专家参与的方式完成危险工作。
这需要受控评估、事件复盘以及与领域专家的合作。还需要在 AI 辅助未能提升表现时公布负面结果。
也门实地测试提供了一个数据点,但并非一项严谨的实验。Anthropic 表示,该火箭发射失败,但 Claude 帮助相关行为者分析了这次失败。
未来的报道应区分合理可行的输出、模拟成功、硬件集成、受控测试和实际运行使用。每个阶段都会改变安全判断。
读者应避免得出两个轻率的结论。其一是,某个 AI 模型已经让任何人都能获得先进武器。公开证据并不支持这一说法。
另一个结论是,一次火箭失败证明风险被夸大了。工程项目会从失败中学习,即使 AI 的首批输出无法奏效,它依然可能具有价值。
将 AI 用于武器开发正成为一项安全隐患,因为通用模型能够参与整个工作流程。它们可以进行研究、编写代码、审查、模拟、记录和故障排查。
眼前的挑战并不是机器独立决定制造一枚导弹,而是一个意志坚定的人类团队利用 AI 扩增其可用劳动力,同时掩盖项目的真实目的。
Anthropic 的披露表明,提供商能够侦测到部分此类活动。它也表明,拒绝回应并未阻止每一次有用的互动。
因此,衡量进展的标准应当具体明确:更早的侦测、更少可迁移的输出、更强的跨平台协调,以及更清晰的独立证据。
请关注下一批威胁报告中是否出现这些信号。如果模型提供商能够证明其干预发生在模拟进入硬件测试之前,那么其防护措施正在改善。如果事件仍然只会在持续的工程工作之后才浮出水面,侦测缺口依然存在。



