top of page

Anthropic 关于阿联酋影响力行动的指控暴露了 AI 问责缺口

1天前
讀畢需時 14 分鐘

Anthropic 表示,一项阿联酋影响力行动利用 Claude 协调了约 300 个虚假社交账号,并将目标对准与苏丹相关的批评者。该公司以高度确信将这场行动与阿联酋政府官员联系起来,但并未独立确定每一项行动是谁批准的。

这一差别至关重要。Anthropic 称,一名行为者通过数百次会话使用 Claude,将政治信息传递、个人研究、社交传播和计划中的证词串联起来。这项被指控的行动不只是生成有说服力的帖子,还试图让受委托制作的叙事看起来像独立证据。

Anthropic 关于阿联酋影响力行动的指控发布之际,AI 公司正日益类似私人情报机构。它们能够看到研究人员、政府或社交平台无法获取的提示词和账号行为。然而,外界往往必须在看不到底层数据的情况下评估其归因结论。

Anthropic 所称的阿联酋影响力行动做了什么

Anthropic 描述的是一个协同运作的影响力系统,而非一系列孤立的聊天机器人对话。

该公司在其 2026 年 9 月发布的 AI 滥用报告中披露了这项活动。报告涵盖了 Anthropic 称其在 2025 年 12 月至 2026 年 8 月期间阻断的有害活动。

Anthropic 为该案件分配了内部标识符 GTG-84002。该公司称,一名行为者在一个私密平台上维护了名为“Deadshot”的 AI 人格。一个持续存在的行动纲领文件在数百次会话中指导该人格。

该纲领主要聚焦于瓦解穆斯林兄弟会的国际影响力。在 Claude 介入之前,这名行为者已经提供了政治目标。这一细节限制了将该模型描述为独立选择行动意识形态或目标的说法。

据 Anthropic 称,该行为者将行动划分为五个相互关联的工作流。每个工作流都服务于同一政治目标的不同环节。

第一个工作流管理约 300 个虚假网红账号。Anthropic 表示,该网络拥有集中化的资金和协调机制,尽管这些账号被包装成独立声音。

第二个工作流创建了一个冒充真实瑞士组织的前台组织。据称,行动人员利用这一借用身份,将由国家撰写的人权材料作为独立报道发布。

第三个工作流为两名预计将在联合国人权理事会第 62 届会议期间发言的人准备证词。Anthropic 称,相关内容刻意避免提及阿联酋。

理事会的第 62 届会议于 2026 年 6 月 15 日至 7 月 7 日举行。Anthropic 未确认准备好的声明最终是否被提交。

第四个工作流研究了 18 名欧洲议会议员和知名记者。Anthropic 称,该行为者为这些人建立了详细档案,但未公开其身份。

第五个工作流编制了 Anthropic 所称的针对联合国特别报告员的“反问责档案”。这些专家此前曾批评阿联酋在苏丹的涉嫌行为。

该公司表示已删除相关账号。它还称,该纲领将一些工作成果的预定接收人列为阿联酋高级官员。

不过,公开报告并未提供完整的提示词、账号记录、身份依据或资金链。因此,读者看到的是 Anthropic 的结论和部分示例,而非完整的调查记录。

这一限制并不意味着这些发现不重要。它确立了正确的框架:这是一项由服务提供商作出的详细归因,而非司法认定或独立法证审计。

Anthropic 使用“突破量表”对该行动评为第三类,该框架依据影响力行动可观察到的传播范围和影响进行评估。这一评级表明其活动跨越多个平台。

更高评级则需要证明其获得广泛关注或产生可衡量的政策影响。Anthropic 称,它无法确认这两种结果中的任何一种。

这种不确定性将行动复杂度与已被证明的成功区分开来。一场行动可以搭建令人信服的基础设施、分析决策者并准备政治内容,却未必改变公众意见或政策。

最稳妥的结论更为有限。Anthropic 表示,Claude 帮助一名行为者组织了多项欺骗性活动;这些活动过去需要不同的研究人员、撰稿人、翻译和行动管理者分别完成。

为什么苏丹使这场行动不只是一次信息传播活动

这项行动据称瞄准了本应用于调查战争的机制,使 AI 滥用成为一个问责问题。

自 2023 年 4 月以来,苏丹武装部队与准军事组织快速支援部队之间一直发生武装冲突。战斗造成大规模流离失所、饥饿、平民死亡,以及大量暴行指控。

阿联酋一再否认向快速支援部队提供军事支持。苏丹官员、权利组织和调查人员则指控与阿联酋有关联的网络向该准军事部队提供援助。

联合国于 2026 年 9 月进行的一项调查提供了新的背景信息。苏丹调查结果描述了一个为快速支援部队提供武器、后勤、训练和外国人员的跨国网络。

调查人员确认,多家公司和中间人在包括阿联酋、哥伦比亚和乍得在内的多个国家开展活动。阿联酋配合了调查,但继续否认武装或支持任何一方。

这些相互竞争的说法使独立证据尤为宝贵。联合国专家、记者、立法者和人权组织有助于决定哪些指控会获得国际关注。

Anthropic 的叙述表明,这项被指控的行动瞄准了这一证据形成过程。它并非只是为对阿联酋政策有利的观点进行倡导,而是据称建立了批评者档案,并试图将伪装过的政治材料植入人权渠道。

被克隆的组织说明了这种机制。一份被包装成独立公民社会研究的文件,可能比一份公开承认由政府发布的声明更具可信度。

代笔证词遵循同样的逻辑。看似代表当地或独立观点的发言者,可能影响官员如何解读一场冲突。移除对资助方的提及,会进一步模糊信息的来源。

这正是该案件的重要性超越虚假账号数量的原因。社交帖子是可见的,也可以被删除。一份档案、简报或证词则可能在研究人员、官员和机构之间私下流转。

据称对特别报告员的针对行为又增加了一层担忧。这些专家依赖来自利益相互冲突各方的消息来源、文件、访谈和提交材料。

一场由 AI 辅助的行动可以用精心制作的材料淹没这一流程。它还可以分析评估材料的人,寻找其声誉弱点或施压点。

Anthropic 尚未表示有任何特别报告员依赖这些档案,也未确认这些文件是否送达其预定接收人。这些缺失的环节使人无法得出该行动已破坏联合国流程的结论。

但该行动的设计仍揭示了其塑造问责过程的企图,而非仅仅影响网络舆情。它将独立机构视为目标和分发渠道。

这构成了一个更难防御的问题。平台可以比对账号创建模式、共享基础设施和协同发布行为。国际组织却无法自动拒绝每一份使用 AI、格式专业的提交材料。

它们必须判断来源、佐证情况和隐藏的资助关系。当生成式 AI 能够迅速模仿研究、倡议或证人证词的语言时,这些审查需求将进一步增加。

对于知识工作者而言,来源溯源意味着了解信息从何而来,以及它如何发生变化。一套严谨的知识管理流程可以保留源文件、相互竞争的说法和核查记录。

它无法判断一项政治指控是否真实,但可以让一份未署名归属的文件更难仅凭重复而被接受。

Claude 影响力行动建立在协同之上

Claude 被指控的价值在于跨越多项任务的行动一致性,而不是发明一项新的政治策略。

据称,该行动使用一份既有纲领文件来保持产出的一致性。持续指令使该行为者能够在数百次交互中重复使用目标、偏好的叙事框架和限制条件。

这一架构之所以重要,是因为影响力工作包含许多细小的制作任务。行动人员需要研究摘要、人物简介、帖子、要点、报告、翻译和交付计划。

一个通用模型可以通过同一共享上下文连接这些任务。行为者无需为每种产出配置不同的专家。

Anthropic 表示,这一工作流将现实人物和政治纲领转化为看似官方的情报简报。它还制作了证词、身份克隆报告、档案和目标名单。

“目标锁定”一词需要谨慎理解。在此案中,它包括研究特定立法者、记者和联合国专家。Anthropic 并未声称 Claude 对他们实施了实体攻击。

不过,结构化的个人研究可以支持恐吓、操纵或量身定制的劝说。它也能帮助行动人员决定接触谁,以及使用何种论点。

“Deadshot”人格似乎充当了一个持续性的行动界面。行为者没有在每次会话中重新解释任务,而是将其嵌入系统设置之中。

这降低了不一致性,也让聊天机器人更接近一种可复用的行动工作流。

这项被指控的行动将叙事创作与技术隐蔽和战术选择同步结合。这种组合比任何一条由 AI 生成的帖子都更具影响。

该模型可以重写材料使其听起来自然,为不同场景格式化产出,并保持统一信息。人类行为者仍对行动纲领和目标负责。

这种分工贯穿于 Anthropic 更广泛的报告之中。行为者通常选择目标和期望结论,然后使用 AI 加速研究、起草、翻译或软件开发。

Anthropic 威胁情报负责人 Jacob Klein 将这一更广泛模式描述为政府情报工作内部的自动化。他在谈及自动化监控时强调的是效率,而非完全新的目标类别。

同样的解读也适用于这场行动。政治行为者本就会创建前台组织、培养同情其立场的证人、汇编针对反对者的研究材料,并协调虚假账号。

生成式 AI 将这些活动压缩到更小的团队中。一名行动人员就能跨多种格式制作材料,并在政治条件变化时迅速修订。

这降低了人员配置门槛。当一场行动跨越多个国家、机构和受众时,它也能降低语言门槛。

但自动化会形成可被识别的模式。复用的行动纲领、重复的格式、共用的基础设施和关联账户,都可能暴露协同行动。

工具提供商处于一个尤其有利的位置。Anthropic 能够审查公共研究人员无法看到的交互记录和技术信号。

社交平台看到的是另一个层面。它们能够发现同步发布、虚假身份和异常的放大模式,但未必知道内容是如何生成的。

联合国等机构接触到的是最终文件或证词。它们可能既看不到底层模型活动,也看不到用于强化这些内容的社交网络。

因此,这场行动跨越了多重可见性边界。在 Anthropic 将 Claude 内部行为与该行动更广泛的结构联系起来之前,任何单一防御方都未必掌握全貌。

这种碎片化的可见性是核心安全挑战。模型提供商可以关闭账户,却无法自动删除已被复制到其他地方的内容。

社交平台可以删除虚假网络,却无法撤回私下发送的材料。公共机构可以审查证词,却无法查看商业 AI 提供商的内部日志。

有效防御需要这些层面之间共享信息,也需要在揭露协同滥用的同时,保留合法隐私的保障措施。

Anthropic 的归因结论严肃,但尚未得到独立完整验证

报告中最有力的主张,也是外部人士最难验证的一项。

Anthropic 表示,其以高度置信度将该行动与阿联酋政府官员关联起来。它援引了隐蔽归属、行动纲领中点名的预期接收者,以及该行为方资助内容放大的证据。

“高度置信度”传达的是公司的评估,而非绝对证明。情报术语描述的是现有证据对某项判断的支持力度。

Anthropic 尚未公布足够的原始证据,供独立分析人士复现这一判断。该公司可能出于保护用户、调查方法和未来侦测能力的考虑,保留了部分细节。

这些理由可以理解,但也留下了验证缺口。

公众无法查阅该账户的付款记录、网络元数据、访问地点、完整行动纲领,或与被指称接收者之间的通信记录。阿联酋官员的姓名并未出现在公开案件摘要中。

目前也没有得到确认的证据链,能将该行为方与官方授权命令直接关联。向官员的预期交付并不必然证明每项任务由谁委托。

该账户可能属于雇员、承包商、中间人,或在政治立场上与之相符的私人行为方。Anthropic 的评估或许纳入了能够区分这些可能性的证据,但这些证据并未公开。

因此,对这一指控的报道一直使用审慎措辞。一篇 AFP 报道将该行动描述为与阿联酋有关,并重申阿布扎比否认支持快速支援部队(RSF)。

这种表述保留了两项不同争议。其一是对 AI 辅助行动责任归属的争议;其二是有关阿联酋支持苏丹战争一方的指控。

关于其中一项争议的证据,并不会自动解决另一项争议。为阿联酋辩护的行动,并不能证明针对该国的每一项基础指控都属实。

同样,阿联酋否认提供军事支持,也无法回应 Anthropic 的技术归因。每一项主张都需要自身的证据。

Anthropic 还承认,它无法确认这些证词或目标材料是否真正送达目标受众。它发现的是行动准备,而非经验证的政策影响。

该公司称,一个虚假网络放大了行动内容。但它没有公开衡量真实用户参与度、公众舆论变化或机构回应。

这很重要,因为影响力行动常常是根据其基础设施而非结果来评估的。一个拥有 300 个账户的网络听起来规模可观,但账户数量本身并不能衡量说服效果。

虚假账户可以频繁发帖,却触达不了多少真实用户。精心制作的文件也可能无人阅读。计划中的干预可能在交付前就被阻断。

三级评级正体现了这种区别。该活动跨越多个平台,但广泛的公众关注和政策影响仍未得到确认。

这并不是忽视该事件的理由。在产生可衡量影响前完成阻断,正是理想的防御结果。

但这确实意味着,不应将该行动描述为已被证实的成功案例。现有证据对行动准备、协同、欺骗和被指称归因的支持,强于对实际影响的证明。

Anthropic 的角色也值得审视。该公司调查其自身产品的滥用情况,决定披露内容、选择证据,并说明其缓解措施。

这既带来专业能力,也带来机构性激励。Anthropic 最有条件接触 Claude 的活动,同时也会从展示其侦测滥用能力中受益。

独立研究人员无法简单取代提供商。不过,他们可以将其主张与平台记录、公开帖子、归档文件及受影响机构的声明进行比对。

这种模型提供商透明度正逐渐成为行业惯例。OpenAI 同样发布了对隐蔽影响力行动的调查,这些行动将 AI 与网站和社交账户结合使用。

这些披露揭示了有价值的手法。不过,不同的术语和证据标准会使跨公司比较变得困难。

成熟的报告体系应包含一致的置信度等级、触达衡量、保留样本,以及对未知事项的说明。它还应将账户归因与政治影响结论区分开来。

缺少这些标准时,公众基本只能按照各提供商自身的框架来解读其威胁报告。

真正的权衡在于侦测与转移

移除一个 Claude 账户可以中断一场行动,但无法消除其工作流程或背后的政治需求。

Anthropic 表示已移除参与这场阿联酋关联行动的账户。这一举措限制了其对 Claude 的访问,并为公司未来侦测提供了行为特征。

移除账户是必要的,但行动方的纲领和政治目标存在于模型之外。同一工作流程可以转移到另一家提供商、自托管模型或一组人工承包商。

OpenAI 曾报告称,威胁活动很少只停留在单一 AI 平台内。其研究还显示,行为方会将模型与传统工具、网站和社交账户结合使用。

Anthropic 更广泛的 9 月报告强化了这一点。该公司称,当其他 AI 实验室的模型在某项行动中承担非对话角色时,它会与这些实验室分享调查发现。

跨提供商转移削弱了仅基于单个账户的保障机制。行动方可以将研究、起草、翻译、代码和发布分配给多项服务。

这造成了侦测与转移之间的张力。更严格的执法可以阻止一个平台上被观察到的滥用,却可能将行为方推向可见性更低的基础设施。

自托管模型让这一问题更加棘手。它们移除了能够检查提示词、关联会话并终止访问的中央提供商。

不过,集中式监控本身也带来风险。模型提供商不应将有关公共官员的政治讨论、倡议活动或研究,天然视为恶意行为。

相关信号是协同欺骗、冒充身份、隐瞒资助、未经同意的画像分析,以及试图操纵机构流程。仅凭内容观点并不是可靠的执法标准。

政治行动可以合法使用 AI 起草演讲稿或总结公开报告。人权组织也可以研究官员并倡导某一政策立场。

当行动方复制其他组织的身份、掩盖国家指挥、伪造独立性或协调虚假人设时,界限便发生了变化。

这正是行为证据重要的原因。跨账户重复的主行动纲领、集中资金、克隆身份和共享基础设施,比政治语言提供更有力的指标。

在生成式 AI 广泛普及前,社交平台已经形成了类似原则。Meta 对协同虚假行为的定义,围绕的是谁在控制行动这一问题上的欺骗,而不只是其内容是否令人反感。

生成式 AI 扩展了生产层面,但核心欺骗手法依然熟悉。行动方仍需要分发渠道、受众、可信度以及接触决策者的机会。

这为防御创造了若干机会。提供商可以侦测反复出现的行动纲领文件、协调账户访问、批量人设生成,以及试图移除来源标记的行为。

平台可以识别同步发布和匹配的基础设施。机构可以要求披露资助方、核验组织身份,并保留提交记录。

记者和研究人员可以将可疑材料与公开语言模式和归档版本进行比较。这些控制措施没有任何一项能够单独奏效。

Anthropic 的 AI 滥用报告也显示了拒绝系统的局限。模型可能拒绝明确的操纵请求,但当同一工作被拆分为普通任务时,仍可能予以配合。

撰写传记、翻译声明或编排证词,孤立来看可能无害。风险源于组合后的工作流程及其隐蔽目的。

持续上下文能够提升侦测能力,因为它揭示了这些联系。但这也提高了提供商所持信息的敏感性。

公司需要制定规则,规定威胁证据的保存期限、可访问者范围,以及何时可以共享。政治调查会引发棘手的隐私与公民自由问题。

答案不可能是对每一次对话进行普遍监控。它必须聚焦于高置信度的行为模式,并采用受到严格治理的调查机制。

三项信号将检验 Anthropic 关于阿联酋影响力行动的主张

接下来的证据将显示,Anthropic 揭露的是一个孤立账户,还是一场更广泛行动中的一个组成部分。

第一项信号是来自社交平台的佐证。Anthropic 描述了约 300 个在多项服务上活动的虚假账户。

如果平台披露的信息与时间、内容、基础设施或资金相吻合,将加强这一归因。它也将揭示真实用户是否接触到了这些材料。

没有相应披露并不会自动推翻 Anthropic 的发现。平台可能不具备相同证据,或可能避免讨论正在进行的调查。

不过,独立确认仍然重要。它将使案件超越单一提供商的内部评估。

第二项信号是被指称目标机构和个人的回应。联合国人权理事会、特别报告员、欧洲立法者和记者可以核查他们是否收到相关材料或接触。

确认相关证词已被提交或送达,将改变对影响的评估。这将表明该行动已从准备阶段进入问责机制。

若有证据显示材料从未到达这些机构,则会支持 Anthropic 更为狭义的结论。该行动仍然严重,但其可观察到的影响将受到限制。

第三个信号是更详细的归因证据或阿联酋官方回应。Anthropic 可能会发布经脱敏处理的基础设施指标、文件样本,或对其置信度评级作出更清晰的说明。

阿联酋可能会将针对该疑似影响行动的回应,与其就苏丹问题作出的更广泛否认分开处理。一份具体回应将有助于区分这两场争议。

应按顺序评估这些信号。平台佐证检验的是网络,机构审查检验的是投放,而额外证据检验的是归因。

在这些问题尚未厘清前,读者不应将重复报道视为验证。多篇文章引用同一份 Anthropic 报告,并不构成独立确认。

这一实践教训并不局限于苏丹。AI 系统可以将一种政治主张转化为帖子、报告、档案材料和证词,同时让各个渠道中的语言保持一致。

这种能力提高了来源记录、身份核验和透明资助信息的价值,也赋予模型提供商不同寻常的调查权威。

Anthropic 关于阿联酋影响行动的指控之所以意义重大,是因为它描述了一次针对机构如何建立可信度的未遂攻击。其重要性并不取决于是否能证明每一项计划产出都已成功实现。

未来几个月,请关注是否出现对应的平台下架措施、目标机构的确认,以及支持 Anthropic 归因判断的证据。这些进展将决定此事究竟是一场被阻断的实验,还是一项更广泛行动中已经浮现的片段。

在此之前,应将经过精心包装的政治材料视为带有溯源链条的主张,而非仅凭呈现形式就可视为证据。保留原始来源,识别受益方,对比独立记录,并将技术归因与政治结论区分开来。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page