top of page

AI 推理可以被提取,美中蒸馏之争变得更加棘手

Google News 揭示了前沿 AI 公司面临的一项新警示:隐藏模型的内部推理过程,并不一定能阻止外部人员恢复出有价值的痕迹。研究人员发现,精心构造的提示词能够从开放权重模型中诱导出类似推理的信息,无需访问模型权重或隐藏激活值。

这一发现为一场日益政治化的争端增添了技术证据。OpenAI 和 Anthropic 指控中国实验室利用美国模型大规模生成训练数据。中国则否认这类广泛指控,称其意在打压中国科技产业。

关键变化并不在于证明某个商业模型已经泄露了其真实的内部思维。该研究并未测试用于后续蒸馏的专有生产系统。相反,它说明:仅在界面层面隐藏思维链,所提供的保护可能弱于模型开发者此前的预期。

这一结果带来了令人不安的区分。一家公司可以保密模型权重,却仍暴露出足够多的行为特征,让另一名开发者复现部分能力。这使得每个公开聊天机器人和应用程序编程接口都可能成为训练信号的来源。

Google News 的标题低估了这场争议

这已不再是关于一家公司是否抄袭另一家公司回答的狭义争论。

这项研究来自一篇题为 Hidden Thoughts Are Not Secret 的论文。作者研究了“推理暴露提示”(Reasoning Exposure Prompting,简称 REP),一种旨在通过常规提示词诱导模型呈现可见推理痕迹的方法。

REP 以由另一个影子模型生成的示例为起点。这些示例被包装成类似 shell 命令、Python 会话、notebook 单元格或工具调用的格式。随后,目标模型会在同一模式下接收一个新问题。

该方法并不直接检查隐藏的神经活动。它鼓励目标模型外显出一条与提示词所诱导推理相似的轨迹。这一区别很重要,因为可见文本并不自动等同于对内部计算的忠实记录。

不过,忠实度并非唯一的安全隐患。即使是一条不完美的解释轨迹,仍可提供有用的监督信号。更小的学生模型可以从这些材料中学习反复出现的策略、问题拆解、校验方式和回答结构。

研究人员在受控环境中测试了开放权重模型。他们没有攻击商业 API,也未声称重建专有权重。他们还承认,实验仅覆盖了有限数量的模型和推理基准。

这些边界条件避免了过度宽泛的结论。论文并未证明 Claude、Gemini 或 OpenAI 的生产系统可以通过同样的提示词被复制。但它确实表明,单靠界面层面的抑制不能被视为完整防线。

Google News 的表述询问推理能否被“提取”,但这个动词压缩了几种不同过程。攻击者可能恢复出可见的理由说明、模仿行为模式、复现基准测试表现,或利用生成的解答训练更小的模型。

这些结果都不要求恢复教师模型的精确内部状态。模型提取通常瞄准的是有用行为,而不是完美的数字克隆。攻击者想要的是足以减少独立研发和训练工作的能力。

这使争议比哲学讨论更具现实意义。研究人员无需裁定语言模型是否真的像人类一样推理。他们只需确定,泄露的信号是否能帮助另一模型解决更多问题。

一项 2026 年 7 月的 ACL 研究进一步凸显了这一问题的重要性。其作者报告称,使用不到 920 个示例进行蒸馏后,推理能力出现显著提升。其受控案例研究的规模远小于工业化行动。

该研究并未证明提取效率具有普适性。单一基础模型和特定基准的结果,无法预测前沿系统中的表现。尽管如此,它挑战了这样一种假设:能力迁移总是需要海量数据集。

蒸馏本身仍是一种常规机器学习技术。开发者利用更强教师模型的输出训练更小的学生模型。Google、OpenAI、Anthropic 及其他实验室都在各自产品家族内部使用了这一方法的不同变体。

当第三方未经许可收集输出、规避访问控制,或据此构建竞争模型时,冲突便由此开始。此时,服务提供商将这种活动称为对抗性蒸馏或模型提取。

这种词汇本身带有政治分量。“蒸馏”听起来像普通工程实践,而“盗窃”则暗示所有权和非法获取。法律尚未完全厘清,常规学习的边界究竟在哪里终止,而受禁止的能力提取又从何处开始。

这种机制无需恢复模型真正的思维

一条有用的推理轨迹可以迁移解题行为,而无需暴露教师模型字面意义上的内部计算。

语言模型逐 token 生成文本,依赖于并非可读句子的隐藏数值状态。展示出来的思维链也是另一种生成输出。它可能反映了部分计算过程,但也可能是在事后为答案提供合理化解释。

这一局限已在早期的可解释性研究中得到记录。模型有时会给出很有说服力的解释,却无法准确说明自己为何选择某个答案。因此,提取一段理由说明并不等同于读取一个确定性程序。

然而,蒸馏并不要求完美的内省。假设一名教师模型反复将几何问题拆解为正确的子问题,基于这些输出训练的学生模型就可以学习这种结构,即使教师可见的解释遗漏了隐藏处理过程。

同样的原则也适用于编程和工具使用。教师模型可以示范如何检查代码仓库、选择命令、验证假设,以及从失败中恢复。这些步骤序列会成为成功行为的示例。

推理模型让这些输出尤具价值。它们通常会在作答前投入更多计算,并在数学、科学、编程和规划任务上给出更好的解答。与仅有最终答案相比,生成的轨迹可能包含更丰富的监督信息。

REP 正是瞄准了隐藏计算与可见监督之间的差异。其代码式包装似乎会影响模型如何处理示范内容。模型可能将其视为要复现或检查的文本,而非普通的对话式解释。

研究人员测量了轨迹相似度和下游效用。结果表明,在某些实验条件下,提示词能够暴露承载能力的材料。他们并未证明每个暴露的 token 都对应一个被隐藏的内部 token。

这一差别应当塑造任何对该研究负责的叙述。将 REP 称为读心攻击会夸大证据;将其称为无害的提示词格式化,则会忽视该研究所关注的下游训练价值。

最有力的解读介于两种极端之间。已部署的模型即便在界面上隐藏原始思维链文本,也可能泄露有用的推理信号。随后,这些信号可以支持行为模仿或学生模型训练。

商业服务商出于多种原因,已经避免展示原始推理过程。隐藏轨迹可能包含不安全材料、内部指令、私人数据或令人困惑的中间猜测。因此,公司往往只返回浓缩摘要。

推理摘要提升了可用性,但也引入安全权衡。详细摘要有助于合法用户理解答案,同一份摘要也可能成为训练竞争系统者的结构化合成数据。

减少细节同样不是完整解决方案。最终答案依然包含知识和行为。反复查询可以揭示偏好、决策边界、编程风格、工具选择,以及跨越大量任务的修正过程。

提取行动还可以结合多种信号。OpenAI 告诉国会委员会,其观察到的流程已超越基础思维链收集。其2026 年 2 月的信函描述了合成数据生成、筛选和强化学习式偏好优化。

这种更广泛的流程比任何单一提示词都更重要。攻击者可以生成问题、收集解答、对输出评分、移除较弱示例,并训练学生模型。之后还可以利用学生模型的失败来选择下一批查询。

这会形成迭代循环。目标模型在不同阶段充当教师、数据生成器、评估器或奖励模型。每种角色都能转移价值,而无需暴露权重。

当请求看起来与合法使用无异时,检测会变得更困难。开发者通常可能要求模型给答案评分、解决编程问题或解释数学。安全信号则体现在账户关联、时间节奏、请求量以及反复出现的任务结构中。

这就是为何新研究改变了防御问题。服务提供商不能只关注是否展示了原始思维链文本,还必须审视普通输出的组合如何支持系统性的能力迁移。

Anthropic 的指控让这项研究具备了规模背景

实验室发现之所以具有政治重要性,是因为服务提供商称现实行动已在工业规模上展开。

Anthropic 在 2 月表示,已识别出与 DeepSeek、Moonshot AI 和 MiniMax 有关的行动。根据其蒸馏调查,这些行动通过约 24,000 个欺诈账户生成了超过 1,600 万次 Claude 对话。

这些数据来自 Anthropic,尚未得到完整的独立审计。被点名的公司也未公开证实 Anthropic 的归因。因此,这些信息应被视为由服务商内部遥测数据支持的指控。

Anthropic 表示,它通过 IP 关联、请求元数据、基础设施指标以及行业合作伙伴提供的信息得出结论。该公司称,协调账户和代理服务被用于绕过地区限制。

该实验室将超过 150,000 次对话归因于与 DeepSeek 相关的活动。它称,这些请求瞄准推理、评分以及对政治敏感内容的回应行为。据称,部分提示词要求 Claude 重建已完成答案背后的分步推理。

Anthropic 将超过 340 万次对话与 Moonshot AI 联系起来。它称,这些活动瞄准代理式推理、编程、分析、计算机使用和视觉能力。据称,后续阶段曾尝试重建推理轨迹。

据 Anthropic 称,MiniMax 涉及的被指控对话超过 1,300 万次。该公司表示,这些请求重点关注代理式编程和工具编排。它还声称,在 Claude 发布新版本后不久,该行动便转移了流量。

规模改变了安全模型。单个好奇用户不太可能复现一个前沿系统。数以万计经过协调的账户则可以构建一个庞大、多样且持续更新的合成数据集。

账户数量也让运营者具备韧性。服务提供商可以封禁一个账户,而不会中断整个采集系统。代理服务可以将流量分散到不同地区、支付方式和使用模式。

OpenAI 也提出过类似指控。它告诉立法者,其平台上观察到的大多数对抗性蒸馏活动似乎源自中国,另有部分活动来自俄罗斯。它还特别提到与 DeepSeek 有关、试图绕过访问限制的行动。

这些说法仍属于公司的评估,而非最终司法裁定。服务提供商掌握相关日志、检测系统和归因方法。外部研究人员若无法访问同样的遥测数据,便难以复现这些结论。

中国否认了这一更广泛的叙事。今年 4 月,中国外交部称美方指控毫无根据,并指责华盛顿抹黑中国 AI 成就。中国大使馆也强调合作与知识产权保护。

这一分歧构成了文章的核心对立:将能力转移视为常规工程实践,还是将能力提取视为未经授权的攫取。取决于访问权限、同意、规模和目的,同一技术工作流可以支持两种描述。

DeepSeek 自身的工作说明了为何这一界限难以厘清。其 R1 研究公开描述了将推理模式蒸馏到更小模型中的做法。由此产生的模型家族帮助确立了这样一种认识:高级推理行为可以迁移到更易获得的系统中。

经同行评审的 DeepSeek-R1 论文记录了该公司模型开发过程中使用的强化学习和蒸馏方法。这项公开研究并不能证明 DeepSeek 使用了未经授权的美国模型输出。

但它确实展示了推理蒸馏的战略价值。一个能力强大的教师模型可以帮助创建保留特定能力的更小学生模型。这些学生模型可在更低的推理资源需求下运行,并覆盖更多开发者。

美国实验室也在内部采用相关方法。它们反对的并非知识蒸馏本身,而是竞争对手通过受限服务以及据称具有欺骗性的访问方式获取专有能力。

这使服务条款变得至关重要,但仍不足以解决问题。合同可以禁止训练竞争模型、自动化提取或逆向工程。当用户通过中间方运作,或身处服务提供商管辖范围之外时,执行就会变得困难。

技术研究让这一问题更加尖锐。如果普通提示词就能恢复有用的监督信号,服务提供商便无法仅靠不公开模型权重来可靠保护自身优势。它们必须监管一个本为反复查询而设计的服务中的访问模式。

美中竞争正将模型访问变为安全政策

华盛顿如今将未经授权的蒸馏视为国家安全问题,而不只是 AI 公司之间的合同纠纷。

这一转变在 2026 年 4 月变得明确。一份白宫备忘录指控主要位于中国的外国实体,蓄意针对美国前沿模型开展行动。

美国政府承诺与 AI 公司合作开展检测、防御、归因和惩罚。其立场将模型提取与维护美国在先进计算领域领先地位的更广泛努力联系起来。

国会也在推进类似方向。拟议立法将建立程序,用于识别被指控从封闭式美国模型中提取关键技术特征的外国行为者。潜在应对措施包括制裁和贸易限制。

这种做法将模型能力视为战略技术。传统出口管制限制获取先进芯片和制造设备。蒸馏则带来一种可能:受限制方可通过远程服务获得有用的软件能力。

其经济逻辑很直接。训练前沿模型需要芯片、能源、数据、工程人力和反复实验。查询现有模型可以将其中一部分成本转回服务提供商承担。

成功的学生模型仍需要自身的基础模型、训练基础设施、评估和部署体系。蒸馏并非按下按钮就能把答案转化为完全相同的竞争对手。不过,它可以减少昂贵的试错过程。

因此,美国政策倡导者将对抗性蒸馏描述为绕过算力管制的一种方式。中国组织可以利用外国基础设施生成训练数据,同时将国内计算能力留给其他工作。

这一论点存在一个尚未解决的衡量问题。相似的基准测试分数并不能证明一个模型复制了另一个模型。实验室往往在重叠的公开数据上训练,采用共享的研究方法,并针对相同评估进行优化。

归因所需的不只是性能相似。强有力的证据应包括账户元数据、支付关联、共享基础设施、异常查询序列、内部文件,或结果模型中可复现的特征。

服务提供商称自己掌握其中一些证据,但许多内容仍未公开。公共政策推进速度快于独立验证。基于不透明平台遥测数据实施制裁,会引发明显的正当程序担忧。

Google News 的报道之所以重要,是因为技术研究可能被卷入这一证据缺口。证明提取在技术上可行的研究,并不能证明某家被点名的公司实施了这种行为。能力、意图、归因和法律责任仍是不同的问题。

推理模式也不存在简单的所有权规则。版权通常保护表达形式,而非抽象方法。商业秘密保护取决于保密性和不当获取。合同法则取决于协议内容及相关司法管辖区。

模型输出使每个类别都更加复杂。服务提供商向客户提供输出,本就是为了在文档、软件、分析和产品中再利用。限制通常针对自动化采集或训练竞争模型,而非日常下游工作。

执法也可能影响合法研究。安全团队需要测试系统是否泄露推理过程或暴露敏感行为。开发者可能利用合成数据构建专业工具,而无意复制前沿模型。

广泛的检测系统可能将这些活动与提取混淆。生成数千个评估示例的研究人员可能看起来像蒸馏者。为客户内容评分的公司可能看起来像是在收集强化学习数据。

服务提供商在施加严重处罚前将需要分层证据。速率限制和账户审查可以采用较低门槛;公开归因、制裁或刑事指控则需要更高标准。

这一政策争议还延伸至开放权重开发。开放模型允许研究人员检查权重、运行受控实验并复现研究结果。它们也使能力转移更加容易,因为输出和内部轨迹可以在本地收集。

限制开放发布无法解决 API 提取问题。它只会将更多研究推向封闭服务提供商,并减少独立审查。因此,华盛顿试图支持开放权重开发,同时打击从专有系统中进行未经授权的提取。

这种平衡仍将不稳定。更强的开放模型会降低对美国 API 的依赖,进而削弱服务提供商的控制力。然而,开放发布也会扩大国内研究、初创企业竞争和透明的安全测试。

真正的政策选择并非开放还是封闭,而是前沿服务提供商在控制系统性再利用的同时能够提供多少访问权限。当前没有任何合同、监控和界面设计的组合能够完全化解这种张力。

研究仍未证明什么

蒸馏争议中最强烈的主张,走在了独立实验已经确立的证据之前。

首先,REP 论文并未从商业前沿模型中提取推理过程用于训练学生模型。其作者避开了专有系统,因为服务提供商限制自动化提取和竞争模型开发。

这一选择在伦理上是恰当的,但也限制了外部有效性。生产系统包含分类器、隐藏提示词、流量监控、账户控制和特定模型的推理界面。开放权重的实验室设置无法复现所有这些防御措施。

其次,暴露出来的推理不一定是真实推理。模型可以为同一个答案生成不同解释。提示词包装可能改变推理路径,而不是恢复原始隐藏轨迹。

论文自身报告的信号与这种可能性一致。更强的包装器可以改变模型行为。在提示条件下相似度更高,并不能证明恢复了唯一的内部转录内容。

第三,下游收益并不能证明发生了广泛的能力窃取。学生模型可以在特定基准测试上提升,同时在陌生领域仍然较弱。蒸馏往往更容易迁移狭窄模式,而不是通用能力。

基准测试污染带来另一项担忧。如果教师模型和学生模型在训练期间已经接触过相关问题,后续改进就可能难以解读。研究人员需要经过严格隔离的任务和稳健的泛化测试。

第四,没有公开实验能够证明可以避免多少专有研发成本。查询教师模型仍会产生费用。筛选数百万条输出并训练学生模型,同样需要大量基础设施。

OpenAI 总裁 Greg Brockman 在 7 月将这一问题描述为一场技术竞赛。他表示,服务提供商可以检测诸如响应评分、合成数据生成以及试图恢复推理过程等模式。

这种信心不应被解读为检测能够可靠运作的证明。攻击者可以降低请求量、分散任务、将提取流量与正常使用混合,或依赖中间方。防御者面临误报和归因不完整的问题。

Google 报告称,来自全球私营部门实体的模型提取尝试十分频繁。这一细节使故事超越了简单的双边冲突。能力提取是一种普遍的竞争威胁,即使政治关注的焦点集中在中国。

对中国实验室的关注也可能掩盖行业的常见做法。美国公司会授权数据、生成合成示例、蒸馏内部模型,并从公开研究中学习。争议的界线在于许可与访问,而非基本技术本身。

双方都提出了安全论据。服务提供商警告,蒸馏后的系统可能继承能力,却没有相应的安全保障。一个主要为性能训练的学生模型,可能省略拒答机制、监控机制和部署控制。

开放模型倡导者则回应称,透明度有助于独立测试和更广泛的访问。他们也质疑专有实验室是否应单方面界定何为合法再利用。这些分歧不会因更好的分类器而消失。

最负责任的结论比任一政治叙事都更为克制。类推理输出可以包含可迁移的价值。隐藏原始思维链文本并不能消除这种价值,而系统性采集可能威胁服务提供商的技术优势。

一切超出这一范围的判断,都需要针对具体情况提供证据。研究方法并不能证明存在国家级行动。服务商遥测数据也不能自动证明发生了法律意义上的窃取。强劲的基准测试结果同样无法揭示模型究竟从何处习得其能力。

报道中应始终清晰呈现这一验证缺口。《印度快报》提出的问题值得追问,因为答案取决于具体条件。某些推理行为可以被诱导和迁移,但不能将整个模型简化为被盗文本的痕迹。

三个信号将显示蒸馏防御是否奏效

下一阶段的衡量标准将是服务商控制措施、独立复现和政府标准,而非更强硬的言辞。

第一个信号是,独立研究人员能否在更多架构上复现 REP。测试应涵盖不同的推理模型、多语言任务、编程智能体,以及只返回简短摘要的系统。

研究人员还需要更严格地界定何为成功。推理轨迹相似度、答案准确性和学生模型泛化能力衡量的是不同结果。一种能够阻止精确恢复推理轨迹的防御措施,仍可能允许有价值的行为模仿。

如果这种效应能够跨模型和陌生任务持续存在,复现结果将强化该论文的安全警示。若结果较弱或不一致,则表明现有方法高度依赖于选定的架构和基准测试。

第二个信号是服务商将如何调整访问控制。Anthropic 已描述过账户聚类、基础设施分析、流量分类和合作伙伴情报。OpenAI 表示其将机器学习与人工审核相结合。

更严格的防御措施会影响普通开发者。服务商可能降低速率限制、要求更严格的身份验证、延长流量保留时间,或限制详细的推理摘要。每一项调整都会带来隐私、成本或易用性方面的权衡。

最具参考价值的证据将来自运营数据。在不影响安全的前提下,服务商应报告检测精度、申诉结果、误报率以及攻击者反复调整手法的情况。若缺少这些指标,单纯的指控数量几乎没有说明力。

第三个信号是,政府是否会为模型提取指控建立证据标准。白宫的蒸馏备忘录表明了政治意图,但执法仍需要归因程序。

一个可信的框架应将违反服务条款与间谍活动、国家安全威胁区分开来。它应明确哪些证据可支持制裁、受影响企业如何回应,以及独立审查应发挥何种作用。

该框架还必须保护正当的互操作性和研究。若一概禁止从模型输出中学习,其影响将远远超出工业级提取。它可能限制评估、无障碍工具、教育和专用应用开发。

对开发者而言,眼下的教训很实际:不要以为隐藏的思维链就能让已部署系统免受提取。应评估每一种输出界面的训练价值,包括答案、摘要、评分和工具轨迹。

企业采购方则应提出另一组问题。他们需要了解服务商如何保留提示词、检测滥用自动化、调查账户暂停事件,以及如何将客户数据与安全监控区分开来。

知识工作者同样受到影响。更严格的防御可能减少可见解释,并使先进模型更难获取;它们也可能限制依赖共享账户进行大规模处理的集成服务。

更广泛的 Google News 读者应关注,这场争论是否仍以证据为基础。技术风险是真实存在的,但政治措辞可能超出研究所能证明的范围。这两点可以同时成立。

决定性问题并不是 AI 模型是否保留着秘密的内心独白,而是公开交互是否暴露了足够多的结构化行为,从而降低构建竞争对手的成本。

现有研究表明,这种风险不能被轻易忽视。服务商的指控显示,相关激励可能已在工业规模上存在。尚未解决的问题包括:谁越过了界限、转移了多少能力,以及哪些防御措施既有效又不会关闭有益的访问渠道。

读者应将下一次复现、访问政策调整或执法行动,视为这一更狭窄案件中的证据。应关注这些信号,而不要想当然地认为每个强大的中国模型都是复制而来,或认为隐藏推理就一定安全地处于隐藏状态。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page