top of page

阿里巴巴 AI 蒸馏指控将模型争议升级为美国安全议题

7天前
讀畢需時 14 分鐘

阿里巴巴正面临美国多部门协同指控,称其研究人员通过数百万次自动化交互,从美国 AI 模型中提取了受限能力。

最新的 阿里巴巴 AI 蒸馏指控 来自美国国家安全局、联邦调查局和网络安全与基础设施安全局。三家机构在 9 月 8 日发布的公告中,将阿里巴巴与 DeepSeek、Moonshot AI、MiniMax、StepFun 和 Z.AI 一同点名。

这一介入改变了事件的性质。Anthropic 此前对阿里巴巴的投诉涉及涉嫌滥用平台、虚假账户和未经授权的模型训练。美国政府如今则将类似活动界定为国家安全威胁。

这场争议仍主要建立在美国政府机构和 AI 公司的说法之上。阿里巴巴尚未公开提供针对所报道行动的详细回应。中国政府则驳斥了更广泛的指控,称其毫无根据且带有政治动机。

因此,这并非一个已经得到证实的模型权重被盗或数据中心遭入侵事件,而是一场围绕系统性提问在用户意图训练竞争模型时是否构成盗窃的争议。

这一问题的答案将影响的不只是阿里巴巴的 Qwen 模型,还将波及 API 访问、身份核验、模型监控、出口管制,以及全球合法开发者的使用体验。

美国机构指控阿里巴巴做了什么

政府的指控描述的是协同提取能力,而非对 AI 实验室的传统入侵。

联合发布的蒸馏公告称,中国开发者系统性瞄准了多个领先的美国模型家族。据称,这些系统包括 Claude、GPT、Gemini 和 Grok 的不同版本。

知识蒸馏是一种训练方法:较小的学生模型通过能力更强的教师模型所生成的输出进行学习。研究人员通常将其用于模型压缩、专业化,以及迁移有用的行为能力。

这一技术本身并不天然具有恶意。美国机构明确承认,它是 AI 研究中合法且有用的一部分。

它们的异议集中在访问方式、规模、隐蔽性和目的。机构指控,被点名的公司在规避提供商安全措施、违反平台条款的同时,获取了受限输出。

根据该公告,这些行动将请求分散到模型提供商、云平台、API 聚合商和配套基础设施之中。据称,这种分散化使任何单一提供商都无法看清完整行动。

这些机构还描述了大量采购由开发团队共享的高级订阅服务。其他据报采用的方法包括虚假身份、代理服务、协同设计的提示词,以及绕过地域限制的尝试。

部分提示词据称试图暴露隐藏的推理过程。另一些则着重提取软件工程、数学、智能体、写作和问答能力。

AI 智能体是指旨在通过多个行动来实现目标的系统,通常可在无需持续人工指引的情况下使用软件工具。因此,复现智能体行为所迁移的可能不只是写作风格。

该公告称,围绕相似主题的请求有时规模从数千次到数百万次不等。它指控,产生的输出随后成为在中国开发模型的训练材料。

不过,公开证据存在重要局限。该公告提出了结论和防御建议,但外部人士无法独立查验其背后的账户记录或归因方法。

它还将六家公司归入更广泛的行动,同时描述了这些组织之间不同的行为。读者不应假定每一项指控、规模估计或技术手段都同等适用于阿里巴巴。

Anthropic 早先的说法提供了更多针对特定公司的细节。据报道,Anthropic 在 6 月告知美国参议员,与阿里巴巴及其 Qwen 实验室有关联的运营者曾瞄准 Claude。

该公司称,该行动从 2026 年 4 月 22 日持续至 6 月 5 日。据称,行动通过近 25,000 个虚假账户产生了超过 2,880 万次交互。

这些是 Anthropic 提供的数据,并非经过独立审计的结论。Reuters 查阅了该公司 6 月 10 日的信函,但阿里巴巴未就该报道作出回应。

Anthropic 称,这是其已知同类攻击中规模最大的一次。该公司表示,这场行动旨在加速获得其更先进模型所具备的能力。

这一描述解释了为何“数据盗窃”可能误导读者。被指控的运营者不一定获取了客户记录、源代码或完整模型参数。

相反,指控针对的是输出和行为。其据称目标是在不承担独立开发所需全部研发与算力成本的情况下,复现有价值的能力。

这种区别并不能解决相关活动是否合法的问题,但界定了监管机构、法院和技术提供商最终必须面对的未决问题。

为什么阿里巴巴 AI 蒸馏指控如今更具分量

9 月公告将一场私营平台争端转化为涉及经济与国家安全的官方归因。

9 月之前,美国主要 AI 开发商已指控中国实验室进行了不当蒸馏。Anthropic 在披露阿里巴巴事件前,曾公开描述与 DeepSeek、Moonshot AI 和 MiniMax 有关的行动。

OpenAI 和 Google 也警告过,存在通过系统性访问复现模型能力的尝试。这些公司有强烈的商业理由保护由高成本训练项目产生的功能。

一家实验室的指控仍可能被视为合同争议,其后果可能是暂停账户、加强访问控制、提出民事索赔或修订服务条款。

NSA、FBI 和 CISA 的联合认定则会带来不同压力。它可能促成情报共享、协同反制措施、贸易限制和更广泛的政府行动。

这些机构认为,被提取的能力可降低中国竞争者的开发时间和财务成本。它们的担忧并不局限于账户滥用造成的收入损失。

它们将更强大的中国模型与军事、网络、经济及关键基础设施风险联系起来。这一框架将模型访问置于华盛顿与北京之间更大的技术竞争之中。

时机之所以重要,是因为美国出口管制已限制中国获得先进计算硬件。当顶级加速器依然难以取得时,高效训练和能力转移的价值就会提高。

蒸馏可以减少让较小模型掌握特定行为所需的资源,但不能自动复现教师模型的全部内部特性。

学生模型只能观察其访问渠道所提供的输出,无法获得教师模型完整的训练数据集、架构、模型权重或完整内部过程。

不过,数百万条经过精心挑选的输出仍可能十分有用。它们可为监督训练、评估、强化学习和合成数据生成提供样本。

合成数据是用于训练或测试另一系统的机器生成材料。其价值取决于覆盖范围、准确性、多样性,以及研究人员选择提示词的方式。

这些机构声称,系统性提取构成中国 AI 发展战略的核心部分。这一说法远比识别一次针对 Claude 的行动更为宏大。

公开可得的证据并未证明任何特定 Qwen 能力有多少来自被指控的行动,也未披露阿里巴巴内部训练数据的构成。

Qwen 的开发可能借助原创研究、授权材料、开放数据集、合成数据、人工反馈及其他模型的输出。一旦这些输入被结合,归因就会变得困难。

尽管如此,政府介入仍提高了阿里巴巴面临的风险。美国官员如今可将异常 API 活动视为一场协同的外国能力获取行动的一部分。

这一转变也对 Anthropic、OpenAI、Google 和 xAI 施加压力。每家提供商都必须证明,自己能够识别分布式行动,同时不阻断合法研究与商业使用。

云平台和 API 聚合商也面临类似要求。模型提供商或许能看到提示词,而云服务商则能看到计费行为和基础设施模式。

任何一方都不一定单独掌握足以识别行动的信息。因此,检测依赖于原本可能互为竞争者的公司之间共享信号。

这种合作也带来隐私与治理问题。提供商必须决定哪些账户、支付、网络和提示词信号能够安全交换。

这一事件同样影响企业买家。使用前沿 API 的公司需要可预测的访问、稳定的输出质量,并确信反欺诈控制不会干扰生产工作负载。

阿里巴巴的股票代码会吸引投资者关注,但这主要不是一个短期股价故事。更持久的问题在于市场准入以及围绕 Qwen 的运营规则。

正式的限制、制裁或列入黑名单将带来直接后果。9 月公告本身提出的是防御建议,而不是对阿里巴巴作出的最终法律裁决。

这一界限至关重要。在法院裁定某项具体行为是否违反商业秘密、欺诈或计算机访问法律之前,具有情报支持的指控就可能影响政策。

核心冲突在于合法学习与隐蔽提取之间

蒸馏是常见的 AI 工程手段,但规模和隐蔽性可能使同一技术演变为被指控的平台滥用。

几乎每一家具有竞争力的 AI 实验室都会从其他系统中学习。研究人员会比较输出、建立基准、研究失败案例,并在开发过程中使用模型生成的示例。

提供商也可以将自己的大型模型蒸馏为成本更低的产品。这种方法可在保留对客户有用行为的同时,降低推理成本。

争议始于教师模型属于另一家公司之时。其输出或许仍可通过公开界面访问,但相关条款可能禁止自动化提取或用于训练竞争模型。

这使争议部分属于合同问题。客户可能收到有效回复,却被指控虚报身份、所在地、付款信息或预期用途。

规模强化了提供商的论点。一个人测试 Claude,与一个网络产生据报 2,880 万次交互,代表着截然不同的运营模式。

隐蔽性同样重要。虚假账户和代理路由将表明,有人试图获得提供商原本打算拒绝的访问权限。

美国机构还指控,相关行动使用协同提示词,并试图揭示隐藏的思维链推理。思维链是指与生成答案相关的中间推理文本。

现代提供商通常避免暴露完整的内部推理过程,而可能改为返回专为用户设计的简明解释。

试图迫使模型在输出中暴露隐藏推理,可能类似于对抗性测试。它们也可能帮助竞争对手收集更丰富的训练示例。

尽管如此,模仿与盗用之间的界限仍未厘清。模型输出并不等同于从私有服务器复制而来的商业秘密文件。

美国 AI 实验室曾利用海量在线材料训练许多基础模型。出版商、艺术家、作者和软件开发者仍在持续质疑这些做法。

中国凸显了这一矛盾。中国商务部称蒸馏在全球行业内十分普遍,并指责华盛顿采取双重标准。

该部还表示,如果美国以防止蒸馏为借口损害中国企业利益,中国将作出回应。其立场见于中国政府的回应

这一辩护并未直接回应 Anthropic 对相关指控的详细陈述。合法的蒸馏不需要虚假账户或规避访问限制。

反过来,违反服务协议也不会自动证明盗取了受法律保护的知识产权。根据欺骗行为、访问方式、信息性质、司法管辖区和可量化损害的不同,可能适用不同法律。

因此,“盗窃”一词将多项主张捆绑在一起。其中包括未经授权的访问、违约、不正当竞争、侵犯商业秘密以及危害国家安全。

每项主张都需要不同的证据。服务提供商的日志或许能证明存在自动化查询,但单凭这些日志无法证明所得输出被用于训练某个特定模型。

模型对比可以揭示可疑的相似性,但很少能完整记录一家实验室获取每一种能力的全部来源。

独立复现同样是可能的。两个团队可以借助共同的论文、公开数据集、开源工具和相近的强化学习方法,达到类似能力。

Alibaba 的 Qwen 模型参与了广泛的开放模型市场。开发者可以检查部分发布版本、对其进行微调,并将其与 Meta、DeepSeek、Mistral 及美国 API 提供商的产品进行比较。

这种开放性使“能力被复制”的简单叙事变得复杂。即使开发者也曾进行被禁止的提取,已发布的模型仍可能包含大量原创工作。

这也解释了竞争层面的利害关系。一旦文件可用,开放权重系统便能迅速扩散至不同公司和国家。

开放权重是开发者可下载并在自有基础设施上运行的已训练参数。它们未必包含原始训练代码或数据。

如果蒸馏帮助一家实验室创造出能力强大的开放权重,教师模型提供商日后关闭违规账户也无法恢复独占性。竞争影响已经越过 API 的边界。

因此,美国希望更早发现相关活动。该咨询建议监测协同提示词、可疑账户集群、代理基础设施以及异常的输出采集行为。

一些拟议的反制措施更进一步。提供商可以限制能力、改变响应,或向疑似操作者提供实用性较低的模型。

这也带来了自身风险。误报可能会在不说明应用为何突然表现变差的情况下,悄然降低无辜客户的服务质量。

安全团队还必须避免将中文语言、所在地或身份视为充分证据。有效检测需要行为信号,而不是宽泛的国别画像。

这种权衡正是这一事件的核心冲突。提供商希望 API 足够开放,以获得收入和开发者采用;同时又足够封闭,以防止竞争对手大规模学习。

现有证据尚未证明什么

这些指控足够具体,值得严格审查,但公开记录尚未毫无争议地确立 Alibaba 的责任。

据报道,Anthropic 的信函提供了日期、账户数量和交互总量。信中还将相关操作者与 Alibaba 及 Qwen 实验室联系起来。

这场据报道针对 Claude 的行动在相关报道中,仍是目前专门聚焦 Alibaba 的最清晰公开描述。然而,相关的底层取证证据尚未公开,无法接受独立审查。

公众并不知道 Anthropic 如何将近 25,000 个账户关联至同一家机构。支付方式、网络重叠、提示词结构和账户创建模式都可能构成依据。

每种信号也都可能产生误判。代理服务可由多人共享,支付中介服务众多客户,研究人员也经常测试相似的基准提示词。

可信的归因应结合多个彼此独立的指标。理想情况下,它还应将被提取的输出与接收方的训练流程或内部指令联系起来。

目前没有公开的法院文件提供这条完整证据链。政府咨询具有机构层面的分量,但不能替代公开的技术证据。

该咨询还使用了“可能是在中国政府知情的情况下”这一表述。这种措辞表明是一项分析性评估,而非公开证明存在指挥或控制。

读者不应将“知情”理解为“授权”。同样也不应假定,被点名公司中的每位工程师都了解每一种被指控的访问方式。

Alibaba 的沉默留下了一个重要空白。该公司可以否认相关活动、质疑归因、挑战所称规模,或主张其研究人员使用的是获准访问。

它还可以区分员工、承包商、合作伙伴和无关联行为者。在该公司提供细节之前,这些可能性仍未得到解决。

中国政府已作出更广泛的否认。中方称国内 AI 发展成果源于技术自立自强,并称美国的指控毫无根据。

这一回应质疑了政治叙事框架,但没有反驳具体的取证主张。有效的反驳应回应账户所有权、授权、数据处理和训练用途等问题。

美国模型提供商同样值得审视。它们通过用户很少参与协商的私人合同,决定哪些功能属于“受限”功能。

即使不存在阻止访问的技术壁垒,服务条款也可以禁止用于竞争性训练。政府必须决定,执行这些限制何时是在维护公共法律,而非私人市场力量。

当提供商主导关键 AI 基础设施时,问题会更复杂。广泛的反蒸馏规则或许能保护投资,但也可能限制竞争和独立研究。

较小的实验室通常会使用教师模型输出,因为复现一次前沿训练在财务上并不可行。全面禁止可能会将当前领先者锁定在其位置上。

政府的国家安全论点试图区分普通竞争与国家关联的能力转移。但这种区分需要可靠归因和相称的执法。

另一个不确定性涉及实际效果。蒸馏可以转移可观察行为,但并不保证在可靠性、安全性、事实覆盖范围或通用推理方面达到同等水平。

学生模型可以模仿基准答案,却可能在陌生任务上失效。高交互量并不能说明接收方实际获得了多少持久能力。

据称的成本节约同样难以衡量。输出可以减少试验成本,但训练、筛选、评估、计算和部署仍需要大量资源。

联邦行动描述称,被指控的活动瞄准了多项专业能力。它没有提供 Alibaba 因此节省成本的公开估计。

这些空白应当影响围绕此案所使用的措辞。相关机构指称存在系统性提取,而 Anthropic 表示,与 Alibaba 有关联的操作者开展了其所发现的最大规模行动。

两种说法都无法独立证明某个被点名的 Qwen 发布版本,其某项明确能力源自 Claude。它们同样无法确立刑事责任。

负责任的报道必须同时把握两点:所描述的规模和协同性十分严重,而核心归因尚未在公开程序中得到检验。

三项信号将显示争议下一步走向

下一阶段取决于 Alibaba 提供的证据、美国的执法决定,以及前沿模型访问方式可被衡量的变化。

第一个信号是 Alibaba 的详细回应。笼统否认意义不大,而技术性反驳则可能实质削弱当前叙事。

Alibaba 可以解释其员工是否控制了所报道的账户。它还可以披露有关第三方模型输出和竞争性训练的内部政策。

独立审计将比公司声明更具分量。它可以审查 Qwen 组织内部的账户关联、数据管线、训练记录和保障措施。

如果 Alibaba 提供可核实的反证,案件可能会收缩为一场有争议的归因问题。持续沉默则会让美国官方叙述在很大程度上得不到回应。

第二个信号是美国采取具体执法行动。联合咨询建议采取防御措施,但其本身并未施加制裁、罚款或刑事指控。

列入黑名单、实施出口限制、提出起诉或提起民事诉讼,都将升级冲突。此类行动也将迫使政府明确其法律理论。

这种具体性至关重要,因为蒸馏横跨多个领域。当局可能侧重于欺诈、未经授权的访问、商业秘密、出口管制,或向外国军方提供协助。

每条路径都有不同的举证要求和后果。针对欺骗性账户的狭义案件,将不同于禁止与美国模型互动的措施。

针对 Alibaba 的执法也会影响使用 Qwen 服务或开放权重发布版本的客户。企业将需要重新评估云服务可用性、合规义务和供应商风险。

第三个信号是 AI 平台访问方式的可见变化。提供商可能会加强身份验证、支付监控、速率限制以及跨平台威胁信息共享。

影响将体现在开发者工作流程中。团队可能会遇到更严格的账户审核、更少的匿名访问,或对自动化评估施加更多限制。

模型提供商还可能为可疑账户提供不同的输出。这种防御可以污染提取数据集,但会给合法应用带来可靠性担忧。

开发者需要知道 API 是否始终提供他们所选择的模型。静默降级可能使调试变得困难,并削弱对生产系统的信任。

独立研究人员面临的风险尤为突出。大规模评估可能看起来像采集行为,因为两者都会在多项能力上生成重复且结构化的提示词。

因此,明确的研究计划和申诉流程将十分重要。否则,防御系统可能会减少有助于暴露模型弱点的外部审查。

同样的控制措施也会影响企业采购。采购方应询问提供商如何检测滥用、处理误报,以及如何传达模型行为的重大变化。

他们还应记录哪些外部模型为内部数据集贡献了输出。来源记录可以说明训练材料由谁生成、依据何种条款以及用于何种目的。

这种做法的重要性将不止于 Alibaba。竞争性的模型训练越来越多地结合人工撰写内容、公开数据、授权材料以及机器生成的示例。

无法追溯这些输入来源的组织,将在供应商、监管机构或客户质疑其开发流程时面临困难。

因此,Alibaba 事件是合成数据经济的一次早期治理考验。它提出了一个问题:模型行为在通过交互式服务提供后,是否仍能保持专有性。

它也涉及由谁来划定边界。供应商可以制定合同限制,政府可以界定安全利益,而法院则可以裁定哪些主张具有法律效力。

中国拒绝接受美国的叙事框架,并将这场争议描述为试图维护美国市场主导地位的行为。华盛顿则将同一活动视为系统性提取,认为其正在削弱美国的技术领先优势。

这两种立场都无法厘清有关所谓 Alibaba 行动的技术事实。这些事实需要证据将账户、运营者、收集的输出内容以及后续训练联系起来。

目前,Alibaba AI 蒸馏指控之所以影响重大,是因为美国政府已正式采纳这些说法。情报和安全机构发出警告,并不意味着这些指控已被确凿证实。

应关注 Alibaba 是否作出具体回应、美国是否采取可执行行动,以及 API 访问是否出现可量化的变化。这些信号将共同表明,此事会成为法律先例,还是仍将停留在地缘政治指控层面。

开发者和企业采购方应在这一先例出现前,审查自身的模型输出政策。他们的团队能否识别外部训练来源,并证明相关使用已获授权?

这一问题不再仅限于 Alibaba 或 Qwen。对于任何利用其他模型生成输出构建 AI 的组织而言,它正成为一项基本要求。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page