Anthropic 蒸馏报告指控存在复制 Claude 的新行动
Anthropic 表示,三家中国 AI 公司在彼此独立的行动中生成了超过 1.86 亿次 Claude 交互,目的是提取有价值的模型能力。这份 Anthropic 蒸馏报告点名 Alibaba、Moonshot AI 和 DeepSeek,并称其所描述的手法据称已超出常规模型训练的范围。
核心指控涉及思维链数据,即模型给出最终答案前呈现中间推理过程的生成文本。Anthropic 称,这些公司通过协调账户、代理服务以及重构 Claude 隐藏推理轨迹的技术获取此类材料。
报告还提出了一项更直接的担忧。Anthropic 指控 Moonshot AI 和 DeepSeek 有时会将客户请求转发给 Claude,却将所得回答包装为自己的输出。如果属实,这种做法模糊了竞争性模型开发与未披露的客户数据处理之间的界限。
这些仍是 Anthropic 提出的指控;作为直接竞争对手,Anthropic 在结果上存在商业和政策利益。报告发布时,Alibaba、Moonshot AI 和 DeepSeek 尚未就相关具体指控公开回应。现有证据也尚未接受独立技术审计。
因此,这场争议包含两个层面:其一,竞争对手是否不当获取 Claude 输出用于模型训练;其二,客户是否在不知情的情况下,将源代码、凭据、企业文件或监控信息发送给了第三方模型提供商。
Anthropic 称其发现了什么
Anthropic 指控的并非少数开发者试验 Claude 输出,而是一套协调运作的能力提取系统。
Anthropic 于 2026 年 9 月 10 日在一份更广泛的威胁情报报告中公布了最新发现。该公司称,其发现并阻止了自 2 月以来针对其 Opus 级模型的未经授权行动。
模型蒸馏是一种合法训练方法:一个模型从另一个通常更强大的系统生成的输出中学习。AI 开发者普遍会在自家模型体系内使用这种方法,将能力迁移至更小或更高效的模型。
争议始于竞争对手通过违反服务提供商规则的账户或访问方式获取这些输出。被质疑的行为还可能包括专门设计、用于暴露受保护推理或其他专有行为的提示词。
Anthropic 将这些被指控的行动称为非法,因为它们据称使用了欺诈账户、住宅代理、一次性电子邮箱地址和间接访问网络。该公司表示,这些手段掩盖了请求提交者的身份,并绕过了地区限制。
Anthropic 蒸馏报告中描述的最大规模行动被归因于 Alibaba 及其 Qwen 研究团队。Anthropic 称,Alibaba 在 2026 年 5 月至 7 月期间生成了超过 1.51 亿次交互。
据称在高峰期,Alibaba 的行动通过超过 3,500 个欺诈账户,每天产生接近 300 万次交互。这些请求据称瞄准软件工程、内核开发、智能体任务以及需要长决策序列的工作。
Anthropic 称,Alibaba 使用了两个主要账户池。其中一个据称包含近 5,000 个账户,并由住宅代理、一次性电子邮箱地址和虚拟支付卡提供支持。
Anthropic 封锁该账户池后,流量据称转移至另一条访问路径。这种快速迁移之所以重要,是因为它表明存在一套有组织的流程,能够在执法后替换基础设施。
Anthropic 还指控 Alibaba 强制 Claude 在生成最终答案前将推理轨迹置于文本标签内。据称,所得转录内容被用于监督式微调,即通过期望行为示例训练模型。
Anthropic 表示,这些示例支持了 Qwen 3.5、3.6 和 3.7 的开发。该公司还称,Claude 协助 Alibaba 开展了强化学习环境和模型架构研究。
这些结论来自 Anthropic 自身的遥测数据和归因流程。公开报告提供了描述和汇总测量数据,但未公布底层账户记录或完整请求数据集。
这一限制至关重要。读者可以评估所指控的方法是否看似合理,但仅凭已发布材料,无法复现 Anthropic 对相关组织的归因。
不过,该报告改变了争议的范围。此前的讨论往往聚焦于一个模型的回答是否与另一个模型的风格相似。Anthropic 现在描述的是持续运行的基础设施、针对性的能力类别,以及以数千万次交互计量的流量。
这也是为何最新的 Claude 蒸馏攻击比普通竞争性基准测试更值得审视。Anthropic 将其描述为持续性的提取计划,并称其已融入模型研究和训练运营。
Anthropic 蒸馏报告提出客户数据问题
最具影响力的指控并非中国实验室从 Claude 学习,而是客户据称在不知情的情况下接入了 Claude。
Anthropic 称,Moonshot AI 曾悄然将部分原本面向其 Kimi 模型的请求转发给 Claude。客户据称通过 Moonshot 的服务看到由 Claude 生成的回复。
Anthropic 表示,在某个为期十天的阶段内,Moonshot 转发了近 30 万条客户请求,其中大部分流向 Opus 模型。这些流量据称经由 5,380 个欺诈账户传递,而这些账户似乎主要在新加坡和日本运作。
Anthropic 指控 Moonshot 保留了部分相关交互内容。该公司表示,Moonshot 随后提取了可用于进一步模型训练的推理转录内容。
报告描述了一种称为跨会话重放攻击的技术。Claude 可以返回受保护推理内容的加密引用,而非暴露完整的推理轨迹。
这一被称为推理签名的引用,使获授权系统能够在不接收原始内部文本的情况下继续对话。Anthropic 指控 Moonshot 保存这些签名、开启新会话,并提示 Claude 重构相关推理内容。
DeepSeek 据称采用了类似流程。Anthropic 称,DeepSeek 识别了通过编码工具发出的请求,其中包括 Claude Code、Claude Agent SDK 和 OpenCode。
随后,部分用户据称被路由至 Claude Opus。用户据称以为 DeepSeek 正在处理他们的提示词,而 Anthropic 的系统实际上收到了这些材料。
报告将 2026 年 5 月至 7 月期间超过 2,300 万次交互归因于 Moonshot;另将 7 月 14 天内超过 1,210 万次交互归因于 DeepSeek。
由于观察期不同,这些数字无法直接比较。它们也仍是 Anthropic 报告的测量结果,而非经过独立审计的总数。
隐私影响并不完全取决于每一条交互是否最终成为训练数据。仅仅转发提示词,就可能令信息暴露给另一家处理方、基础设施运营商和司法管辖区。
Anthropic 称,被转发的材料包括企业源代码、凭据、内部计划和个人身份信息。部分案例涉及使用政府或国有系统的用户。
Moonshot 的一个案例据称包含来自成都数百个摄像头的监控信息。Anthropic 评估该用户可能与中国人民解放军有关,并认为 Kimi 正在分析这些材料。
另一个案例涉及一名为中国大型国有企业开发内部系统的工程师。据称,该会话暴露了内部代码及多家公司的有效凭据。
DeepSeek 的案例也具有类似敏感性。Anthropic 表示,一项请求包含某家中国科技公司 AI 项目的规格和战略目标。
另一项据称包含与俄罗斯政府数据库相关的凭据。第三项据称涉及用于将个人活动轨迹与中国警方记录进行比对的软件。
Anthropic 在公开案例中对敏感值进行了删节。这保护了受影响方,但也使外部人士无法确认相关记录,或判断数据如何流转。
报告称,其无法确定客户是否获得了有关路由的通知。这一表述很重要,因为该公司观察到流量抵达 Claude,却无法直接访问每一份客户协议或界面披露内容。
隐藏式路由安排不同于明确告知用户其会在外部模型间进行选择的服务。模型路由器可以发挥作用,但知情使用需要披露提供商、保留政策和数据处理方式。
对开发者而言,实际教训不止涉及任何被点名的公司。提交给编程助手的提示词往往包含代码库细节、配置值、客户信息和内部文档片段。
模型标签本身无法证明这些材料在哪里被处理。团队需要就子处理商、路由逻辑、存储、训练用途和地域处理方式获得合同层面的明确答复。
因此,最新指控将模型竞争与供应链安全联系在一起。开发者可能批准了一家供应商,却在不知情的情况下将敏感工作经由另一家供应商的系统发送出去。
被指控的 Claude 蒸馏攻击如何运作
Anthropic 描述了一套分层提取流程,结合了访问规避、提示词工程、推理恢复和训练数据准备。
用简单的话解释 AI 模型蒸馏:它始于教师模型和学生模型。教师生成有用示例,学生则从这些示例中学习复现教师的行为。
这一过程可以是经过授权的。实验室可能使用自家最强模型的输出,来改进同样由其拥有的较小模型。
当学生模型的开发者隐瞒身份、绕过访问限制,或违反合同规则提取输出时,这一过程便具有对抗性。法律边界可能因地而异,但技术和安全层面的区别具有实际意义。
Anthropic 称,这些行动首先需要稳定地访问 Claude。由于 Anthropic 未在中国商业化提供 Claude,相关运营者据称依赖代理网络和欺诈账户。
代理网络通过中介转发请求,从而掩盖原始组织身份。Anthropic 此前曾描述“hydra cluster”系统:封锁一个账户并不会使整个行动瘫痪。
在其2 月的发现中,Anthropic 表示,DeepSeek、Moonshot AI 和 MiniMax 共通过约 24,000 个欺诈账户生成了超过 1,600 万次交互。
2 月披露将超过 340 万次交互归因于 Moonshot,超过 1,300 万次归因于 MiniMax。报告称,DeepSeek 早期的行动规模较小,且部分聚焦于对审查敏感的回答。
9 月的报告称,后续行动期间的流量远高于此前。仅阿里巴巴据称的 1.51 亿次交互,就大幅超过了 2 月披露的合计数量。
原始规模并不必然造就更强的模型。训练价值取决于问题选择、回答质量、筛选、覆盖范围,以及收集到的示例被有效纳入后续训练阶段的程度。
因此,被指控的运营方并不只是提出泛泛的问题。Anthropic 表示,他们将请求集中在高价值能力上,包括编程、工具使用、长程规划和智能体推理。
智能体推理描述的是模型为实现目标而选择并执行多项行动的能力。这种能力可能难以训练,因为成功示例需要在多个步骤中作出连贯决策。
推理轨迹可以让这些示例更具实用价值。最终答案告诉学生模型应模仿什么结果,而中间轨迹则能提供更详细的训练路径。
不过,展示出来的推理轨迹不应被视为对模型内部计算过程的完美记录。模型可以生成看似合理的解释,但这些解释未必完整反映答案背后的实际过程。
这种不确定性并不意味着数据毫无价值。结构化推理示例仍可为监督微调、评估或强化学习任务提供有用模式。
Anthropic 指称,阿里巴巴使用固定指令,迫使 Claude 在内联标签内输出扩展推理。该公司称,这些输出随后被清洗并转换为微调数据。
据称,Moonshot 和 DeepSeek 则转而寻求受保护的推理特征。其报告中的重放方法试图从旨在维持连续性、但不暴露原始推理的引用中恢复完整文本。
Anthropic 表示,Moonshot 将这种提取方式与从客户流量中收集的请求结合使用。据报道,DeepSeek 选择了部分与第三方编程工具相关的会话,并将其发送给 Claude。
这种组合可为模型开发者带来两项好处。真实客户提示词提供贴近实际的任务,而更强的教师模型则提供详细答案和推理示例。
同样,这种组合也造成了报告中最尖锐的隐私冲突。客户可能在不知情的情况下,成为训练流水线中提示词、代码、文档和反馈的来源。
这些行动似乎还依赖于一个新兴的转售商市场。Anthropic 表示,一些代理服务商提供受限模型的访问权限,同时保留可在之后出售的交互记录。
报告称,共享代理基础设施有时为多个组织提供服务。Anthropic 表示,还观察到与阿里巴巴相关的账户转送了与 DeepSeek 和小米有关的请求。
这并不能证明这些公司之间存在联合行动。它反而表明,共同的中间方可以让访问变得更容易,同时令归因更加复杂。
因此,技术应对必须在多个层面展开。封禁单个账户无法阻止一个持续创建替代账户的网络。
Anthropic 表示,其采用行为分类器、元数据分析、协同账户检测和模型层面的防御措施。它还与云计算公司、其他 AI 实验室及政府部门共享指示信息。
每项措施都伴随权衡。激进的检测可能给流量与自动化收集相似的合法研究人员或客户带来不便。
模型层面的防御也可能影响有用功能。限制推理连续性,或为高流量访问增加阻力,可能会降低 API 对获授权应用的价值。
因此,针对 Claude 的蒸馏攻击在一定程度上是身份问题。服务提供商必须确定谁控制账户、谁最终从其请求中获益,以及多个账户是否属于同一协同行动方。
这也是一个信息安全问题。服务提供商必须限制输出泄露的信息,同时又不能让模型在合法工作中变得不那么有帮助。
这场争议也关乎 AI 竞争
随着中国模型开发者通过能力强大且广泛可用的系统加大竞争压力,Anthropic 的指控随之而来。
阿里巴巴的 Qwen 系列、Moonshot 的 Kimi 模型和 DeepSeek 的系统,正在编程、推理和企业应用等领域与美国前沿模型竞争。它们的进展挑战了这样一种假设:算力限制能够维持持久的能力差距。
蒸馏可以缩短开发周期,因为实验室无需复现教师模型研究的每一个阶段,便能获得高质量示例。Anthropic 认为,未经授权的提取降低了接近 Claude 能力所需的时间和成本。
这一论点支持 Anthropic 更广泛的政策立场。该公司一直倡导出口管制,并将模型能力视为需要保护的战略资产。
美国政府也采取了类似的表述方式。9 月,FBI、国家安全局和网络安全与基础设施安全局指控多家中国公司从美国模型中进行工业规模的提取。
据报道,政府公告点名阿里巴巴、DeepSeek、Moonshot AI、MiniMax、StepFun 和 Z.ai,并称自至少 2024 年末以来,这些活动一直以 Claude、GPT、Gemini 和 Grok 为目标。
中国否认了这些指控。中国商务部称这些说法毫无根据,并表示蒸馏是全球 AI 公司普遍采用的做法。
该部还指控美国谋求 AI 垄断。其回应由一篇 Associated Press 报道 报道;回应称,若中国公司面临进一步限制,中方将采取反制措施。
这一异议凸显出一条尚未解决的边界。行业内的模型开发者都在利用海量人类创作材料训练模型,往往并未与每位作者逐一协商。
因此,批评者质疑,领先实验室在利用互联网规模的数据集构建模型后,是否能够对生成出的知识主张排他性控制。这是对 Anthropic 立场的伦理挑战,但并未回答有关具体访问方式和隐私问题的指控。
常规蒸馏也十分普遍。Anthropic 自身强调,之所以这种方法会引发异议,是因为其中涉及规避、竞争性提取和违反访问规则。
这场辩论不应被简化为:所有从模型输出中学习的行为都等同于盗窃。研究人员会对模型进行基准测试,用户会比较回答,开发者也会构建依赖多家服务商的应用。
关键问题在于授权、规模、隐匿性和目的。欺诈性身份和隐藏式路由,将使被指控的活动远远超出普通比较的范畴。
不过,Anthropic 的商业利益也值得关注。当政策制定者、客户和云服务商接受其对非法蒸馏的定义时,该公司将从中受益。
更严格的身份要求可以保护 Claude,但也可能抬高独立开发者的准入门槛。对合成训练数据的限制,可能有利于那些已经掌握领先模型和大型专有数据集的公司。
公开证据尚无法解决所有归因主张。Anthropic 可以访问内部遥测数据,但外部研究人员缺少检验误报或其他解释所需的原始材料。
阿里巴巴、Moonshot AI 和 DeepSeek 也尚未提供详细的反证。沉默并不能验证 Anthropic 的说法,但它使该公司的技术叙述在很大程度上未获回应。
有说服力的回应需要说明报告中提及的账户基础设施、请求量、与员工有关的元数据和时间线。对模型蒸馏的一般性辩护,无法解释未披露的客户路由。
竞争表现带来另一项复杂因素。强劲的基准测试表现无法揭示模型如何获得其能力。
相似的输出可能源于共享公共数据、共同训练方法、获授权的合成数据,或未经授权的提取。在缺乏支持性遥测数据的情况下,风格相似只能构成薄弱证据。
Anthropic 的指控更为具体,因为其描述了网络行为和内部请求模式。然而,具体性并不等于独立证明。
正确的结论应比双方的政治表述更为审慎。Anthropic 已发布了严肃且技术细节充分的指控,值得接受外部审视,也需要被点名的公司直接回应。
这些主张尚未证实什么
该报告提出了大量内部观察结果,但并未独立证明每一项收集到的交互如何影响已发布模型。
Anthropic 表示,阿里巴巴提取的文本记录为 Qwen 3.5、3.6 和 3.7 提供支持。它还将这些流量与强化学习环境和模型架构方面的工作联系起来。
这些都是影响重大的主张。然而,这份公开文件并未提供模型权重、训练记录、阿里巴巴内部通信,或可复现的取证链条。
同样的限制也适用于 Moonshot 和 DeepSeek。Anthropic 可以观察到请求抵达 Claude,将其元数据与基础设施关联,并分析重复出现的提示词模式。
它无法直接观察竞争对手训练环境中的每一个后续阶段。因此,关于最终训练用途的表述结合了遥测数据,以及 Anthropic 自身的归因和推断。
这一区别应当保持清晰。根据 Anthropic 的系统,该报告支持这样的主张:协同流量抵达了 Claude。
但它无法让公众计算这些流量带来的确切性能提升。它也无法证明任何被点名的模型主要依赖 Claude 的输出。
模型训练使用许多数据来源和方法。合成示例可能提升狭窄技能,而更广泛的能力则取决于基础训练、原创研究、强化学习和人工评估。
报告中的交互总量也可能听起来比实际更具决定性。一次交互可能包含有价值的推理示例、失败尝试、重复内容,或在筛选过程中被拒绝的回答。
在缺乏接受率和训练权重的情况下,外部人士无法将 1.51 亿次交互转换为能力转移的可靠衡量指标。
违反服务条款与违反刑法之间也存在差别。Anthropic 将这些行动描述为攻击,但法律定性取决于司法管辖区、访问方式、合同以及适用的计算机滥用规则。
隐私指控需要单独验证。Anthropic 表示其发现了敏感客户材料,但无法确认这些用户从 Moonshot 或 DeepSeek 获得了何种通知。
服务可能会在用户鲜少阅读的条款中披露第三方处理。这并不能解决该披露是否充分的问题,但可能改变有关同意的事实描述。
报告也未说明有多少个人受到影响。它提供了详细示例,并描述相关路由活动中来自数百名用户的敏感数据,但没有公布完整统计数字。
Anthropic 有充分理由不公开原始记录。公开这些记录可能暴露客户、泄露检测方法,或帮助运营方设计规避手段。
这造成了一个熟悉的安全报告难题:最有助于独立验证的证据,也可能削弱防御措施,或伤害数据被捕获的人。
因此,审慎解读应避免两个极端。不能仅仅因为 Anthropic 是竞争对手,就否定这些主张。
它们也不应在未注明来源的情况下,被反复当作既定事实陈述。原始报道恰当地将这些发现表述为 Anthropic 提出的指控。
独立验证可能来自多个渠道。云服务提供商或许掌握可佐证相关基础设施情况的账单、账户和网络记录。
监管机构可审查客户披露信息与跨境数据处理情况。被点名的公司则可以发布审计结论、路由政策或技术说明,直接回应这些指控。
客户不应等到所有争议得到解决后,才着手改善控制措施。组织可以限制提示词中包含的机密信息,监控 AI 端点,并要求采用获批的路由配置。
开发者应轮换曾提交给不确定服务的所有凭据。同时,也应审查日志,查找包含生产环境令牌、客户数据或未发布代码的提示词。
这些预防措施所应对的问题,比 Anthropic 的蒸馏报告更为广泛。AI 助手正日益嵌入编辑器、终端、浏览器和企业应用之中。
每一次集成都引入了一条数据路径。安全团队需要了解完整路径,而不只是界面上显示的品牌。
接下来需要关注的三个信号
下一阶段将取决于技术佐证、供应商披露以及访问基础设施中可量化的变化。
第一个信号是来自云服务提供商或政府调查人员的独立确认。Anthropic 表示,这些行动依赖大量账户池、代理服务器,以及旨在隐藏组织控制权的支付方式。
如此规模的基础设施理应在 Anthropic 之外留下记录。佐证性证据将强化对相关方的归属判断,以及所报告的流量总量。
缺乏佐证并不能推翻这些说法,因为服务提供商可能避免公开披露。然而,仅基于竞争对手未公开的遥测数据采取政策行动,必然会面临合理审视。
第二个信号是 Alibaba、Moonshot AI 或 DeepSeek 作出的具体回应。每家公司需要回应的,不只是蒸馏行为是否普遍。
核心问题涉及欺诈性访问、客户路由、推理签名重放、数据保留,以及在训练中使用 Claude 输出。若详细否认或独立审计能够直接解释这些观察结果,将削弱 Anthropic 的说法。
持续沉默将延续不确定性。笼统的政治性否认同样无法回应技术层面的主张。
第三个信号是前沿模型提供商控制自动化访问方式出现可见变化。Anthropic 表示,它正在加强身份核验、行为检测,以及防范推理恢复的措施。
如果其他实验室和云平台采取类似措施,这将表明业界将协同提取视为共同的运营威胁。这也可能让不受支持市场中的合法开发者更难获得访问权限。
提供商可能引入更严格的验证机制、用量控制,或对合成训练施加合同限制。当系统检测到与能力提取相关的模式时,它们也可能调整输出。
研究人员应关注,这些控制措施是否能在不降低正常 API 使用体验的情况下,减少所报告的行动流量。若防御措施阻碍真实客户,成本将转嫁给更广泛的开发者社区。
企业采购方应直接向模型供应商提出一个问题:每条提示词究竟由哪家公司处理?答案应涵盖备用模型、第三方路由器、数据保留、训练用途和处理地点。
开发者也可以将低风险试验与包含凭据、客户记录或内部战略的代码库分开。本地脱敏和获批网关可降低意外路由带来的损失。
知识工作者应将机密提示词视为发送给外部处理方的任何其他数据。熟悉的界面并不保证熟悉的基础设施路径。
核心问题已不再是 AI 模型蒸馏是否存在,而是隐藏访问和未披露路由是否已成为前沿模型竞争中的常规手段。
Anthropic 的蒸馏报告是迄今为止对此类指控最详尽的公开版本。其数据和机制值得调查,但其结论仍需要独立检验。
未来三个月,请关注基础设施证据、企业的直接回应以及更严格的提供商控制措施。这些信号将共同表明,这究竟是一起孤立争议,还是 AI 安全领域的持久变化。
在此之前,读者应将两项判断区分开来。Anthropic 已记录了其所称观察到的内容,而被点名的公司尚未公开验证这一说法。
在信任屏幕上的模型名称之前,先询问供应商提示词会流向何处。对于处理敏感工作的组织而言,这个问题如今与模型质量同样重要。



