OpenAI 与 DeepSeek 蒸馏证据令最新科技新闻之争更趋复杂
研究人员测试了模型行为能否揭示隐藏的训练关系后,OpenAI 与 DeepSeek 面临了新的冲突信号。这项研究为此前主要由公司日志、政治指控和难以验证的架构主张主导的科技新闻争议,增添了实证证据。
这篇发表于 6 月 19 日的研究论文并未证明 OpenAI 抄袭了 DeepSeek,或 DeepSeek 抄袭了 OpenAI。相反,它提出了一种行为审计方法,并发现 OpenAI 的 GPT-OSS、DeepSeek-R1、阿里巴巴的 QwQ 与 OpenAI 的 o1 之间可能存在关联。
这一差别至关重要,因为华盛顿已将中国实验室未经授权的蒸馏描述为潜在的技术盗窃。中国否认了这些指控,而美国实验室也鲜少披露为其合成训练数据提供内容的全部模型。
这项新研究对双方都构成挑战。它支持蒸馏可能留下可检测痕迹这一观点,但也表明,现代模型家族形成的是一条相互缠绕的链条,而非简单的“美国教师、中国学生”关系。
一项行为测试为 API 流量之外提供了证据
最直接的变化在于方法论:研究人员如今声称,他们可以从学生模型的行为中寻找教师模型的踪迹。
这项蒸馏检测研究由来自加州大学伯克利分校、南加州大学和 OpenAI 的研究人员完成。研究描述了一种名为“基于参考的成员推断”的技术。
成员推断用于测试某些特定材料是否可能出现在训练过程中。新方法将这一思路应用于判断,一个模型是否从另一个模型的输出中学习。
直接比较两个完成训练的模型,通常会得出模糊的结果。基于相似互联网数据训练的模型,即使没有直接相互复制,也可能共享事实、措辞、推理模式和基准测试策略。
研究人员通过引入来自学生模型自身家族的更早检查点来处理这种模糊性。他们衡量新模型与候选教师模型的一致性,是否比其更早的同系模型更高。
假设审计人员希望检查较新的 QwQ 模型。他们会将该模型对 DeepSeek-R1 输出的偏好,与更早的 QwQ 检查点的偏好进行比较。
若模型对 DeepSeek-R1 的偏好出现更大幅度提升,可能意味着 DeepSeek 的输出影响了较新的 QwQ 模型。参考模型充当基线,有助于剔除 QwQ 家族中原本就存在的相似性。
这种相对比较是论文的主要贡献。包括词汇重叠和原始输出概率在内的常见替代方法,在多项受控实验中表现不佳。
研究人员使用四个基础学生模型、三个教师模型和两组提示词集合的组合,创建了 24 个学生模型。他们保留了其中 19 个蒸馏提升学生模型测量效用的案例。
在这些保留的受控案例中,其基于参考的方法以近乎完美的准确率识别出正确教师模型。对于七个测试的现实世界蒸馏模型,它还在其中六个案例中恢复出 DeepSeek-R1 这一已知教师模型。
这些结果表明,在特定条件下,行为检测可以发挥作用。但它们并未证明该方法对每一种前沿训练流程都具有普遍准确性。
最有利的情形包括:一个教师模型、一个最终监督微调阶段、可获取的推理轨迹,以及合适的更早检查点。商业模型经常不满足其中多项假设。
即便如此,这种方法改变了调查人员可获得的证据类型。此前,领先实验室主要依赖账户记录、支付关联、IP 地址和异常查询模式。
Anthropic 表示,这些信号帮助其识别出涉及 DeepSeek、Moonshot AI 和 MiniMax 的协调行动。其 2 月 23 日披露称,约 24,000 个欺诈账户进行了超过 1,600 万次 Claude 交互。
行为审计从相反的方向切入。它不再关注训练数据如何被收集,而是在最终形成的模型内部寻找残留信号。
这种方法可帮助审计人员在开放权重模型发布后进行检查。当 API 提供商缺乏完整访问日志,或从未观察到原始流量时,它也可能为调查提供支持。
对关注科技新闻的读者而言,这正是核心进展。争议如今不仅包含实验室和政府之间相互竞争的声明,还加入了一项实验性的模型层面测试。
OpenAI 蒸馏证据带来了尴尬的反转
这项研究在政治上最敏感的结果并非关于 DeepSeek 的发现,而是围绕 OpenAI GPT-OSS 模型的不确定信号。
研究人员将 GPT-OSS-20B 和 GPT-OSS-120B 与包括 DeepSeek-R1、QwQ、OpenAI o1、Claude 和 Llama 模型在内的候选教师模型进行比较。在其分析中,DeepSeek-R1 和 QwQ-32B-Preview 排名最高。
这一排名提出了这样一种可能性:GPT-OSS 从与 DeepSeek-R1、QwQ 和 o1 相关的同一推理谱系中学习。它并不能证明 DeepSeek 向 OpenAI 进行了直接传递。
这一证据弱于论文中的受控结果。GPT-OSS 缺乏同一家族中合适的更早检查点,因此研究人员使用 GPT-2 XL 作为参考。
GPT-2 XL 与 GPT-OSS 相隔多年的研究进展和显著的架构变化。论文明确警告称,这种时间和技术上的差距使该参考不可靠。
因此,作者将对 GPT-OSS 的解读标为高度不确定。他们将其作为一个开放问题提出,需要更好的参考模型和进一步分析。
这种谨慎态度应当主导关于 OpenAI 蒸馏证据的每一场讨论。在选定候选模型中排名靠前,并不等同于完整的训练记录;遗漏某个教师模型也可能扭曲归因。
还有另一层复杂因素。DeepSeek-R1 和 QwQ 本身可能包含从 OpenAI 模型、包括 o1 继承而来的信号。
该研究单独的字形测试考察了与 o1 和 o3 相关的异常 Unicode 行为。从 o1 蒸馏而来的受控学生模型,在 Unicode 与 ASCII 表示之间呈现出比多数对照模型更大的差异。
在开放式分析中,DeepSeek-R1 显示出显著的 Unicode 信号。作者表示,这表明可能存在 o1 风格的影响,但并未作出确定性归因。
GPT-OSS 在经过测试的参考模型中也呈现出可统计检测的 Unicode 模式。论文称,这一结果可能将其置于同一个更广泛的 o1、DeepSeek-R1 和 QwQ 谱系之中。
这形成的是一条链,而非一次清晰的反转。GPT-OSS 之所以可能与 DeepSeek 相似,可能是因为两个系统都继承了 o1 的行为,也可能是 GPT-OSS 从 DeepSeek 学习,或是多个阶段共同叠加了这些路径。
改写又增加了一层不确定性。一个模型可以生成答案,而另一个模型可在答案进入学生模型训练集之前对其进行改写。
检测器可能识别出原始生成器、改写器、两个系统,或两个都无法识别。论文尚未解决这一情形。
这一结果仍对政治论点中的美国一方形成压力。美国官员经常将前沿知识描述为主要从美国提供商流向中国竞争对手。
穿过 GPT-OSS 的潜在信号使这种单向叙事变得复杂。它表明,影响力可通过公共数据集、基准测试答案、推理轨迹以及数代合成数据流转。
这并不意味着所有形式的蒸馏都等价。经授权使用开放输出不同于通过协调账户进行欺诈性访问,内部蒸馏也不同于从竞争对手处提取能力。
然而,仅凭技术血缘无法判断某次传递是否获得授权。行为证据必须与许可条款、访问记录、训练披露和适用法律结合。
因此,新的 OpenAI 蒸馏证据带来了一种范围有限但意义重大的反转。寻求归因标准的美国实验室必须接受,这些标准同样可以应用于美国模型。
DeepSeek 模型蒸馏仍是一项严肃指控
GPT-OSS 可能存在的关联,并不能抹去中国实验室曾为获取训练相关输出而查询美国模型的大量证据。
Anthropic 的蒸馏发现描述的是基础设施层面的证据,而非行为相似性。该公司表示,它高度确信地将协调活动关联至 DeepSeek、Moonshot 和 MiniMax。
据 Anthropic 称,这些行动使用欺诈账户和代理服务来规避地区限制与平台防御。反复出现的提示词瞄准了推理、编程、工具使用、计算机控制和其他有价值的能力。
Anthropic 将超过 15 万次交互归因于 DeepSeek。该公司表示,同步流量、共享支付方式和相同模式表明,账户之间存在负载均衡。
该公司将超过 340 万次 Claude 交互归因于 Moonshot。其说明称,数百个欺诈账户瞄准了推理、编程、视觉、数据分析和计算机操作能力。
这些仍属于公司主张,尽管 Anthropic 表示行业合作伙伴佐证了部分基础设施指标。外部研究人员无法独立检查所有相关账户数据。
这项行为研究为 DeepSeek 模型蒸馏疑虑提供了另一类支持。其基于参考的测试在检查 DeepSeek-R1 时,将 o1 和 QwQ-32B-Preview 排在接近顶部的位置。
Unicode 诊断同样在 DeepSeek-R1 中识别出一种 o1 风格的信号。报告的差异在 100 次探测中与零值存在统计学上的可区分性。
不过,作者称这一结果仍属初步结论。他们的受控验证覆盖的是简化的训练过程,而 DeepSeek-R1 很可能反映了多个数据来源、训练阶段和强化方法。
行为指纹同样无法揭示访问是否违反合同。它识别的是一种可能的技术关系,而非该关系所处的法律环境。
这一界限十分重要,因为知识蒸馏本身是标准做法。实验室可以使用自己的大型模型训练较小版本,也可以使用另一模型许可允许的输出。
争议涉及的是对抗性蒸馏,即通过未经授权或具有欺骗性的访问,大规模提取能力。被质疑的行为包括虚假账户、隐藏的代理网络,以及为模型训练而设计的定向收集。
一项 6 月的政策分析认为,这类行动为美国 AI 提供商带来了战略脆弱性。它也承认存在重大的测量难题。
分析人员难以轻易区分模型从蒸馏数据中获得了多少能力。要做到这一点,需要进行含有和不含可疑材料的可比训练运行。
这些运行还需要获得私有基础检查点、专有训练数据和收集到的教师模型输出。外部研究人员很少同时拥有这三者。
基准测试中的模式本身只能提供有限证据。中国模型之所以可能在编程和数学方面接近美国系统,是因为这些技能可通过蒸馏有效迁移。
同样的模式也可能源于中国开发者更优先投入具有商业价值的技术任务。相似的基准结果无法区分这两种解释。
论文中的 QwQ 案例说明了推断的潜力与风险。研究人员将 QwQ-32B 与其参考模型 QwQ-32B-Preview 比较时,DeepSeek-R1 的排名最高。
公开时间线支持这种可能性。QwQ-32B-Preview 于 2024 年 11 月发布,DeepSeek-R1 随后于 2025 年 1 月推出,而 QwQ-32B 于 2025 年 3 月问世。
时间上的先后使这一推测关系成为可能,但时间并非证据。Alibaba 可能使用了重叠数据集、公开的 DeepSeek 输出、内部方法,或多个教师模型。
因此,DeepSeek 模型蒸馏仍应被视为一项需要多类证据支持的具体指控,而不应成为解释中国模型质量的普遍说法。
这种区分能够保护正当调查。夸大薄弱证据,会让被指控公司轻易借此否定更有力的基础设施记录和访问违规证据。
华盛顿的政策论证如今面临技术审计
这场争议中真正的对手并非 OpenAI 对阵 DeepSeek,而是政治确定性对阵不完整的技术归因。
特朗普政府已将正当的蒸馏与隐蔽的工业化提取区分开来。这一界线既支持开放模型开发,也为制裁和贸易限制保留了依据。
7 月 24 日的一篇政策报道称,官员指控 Moonshot 蒸馏了 Anthropic 的 Claude Fable 模型。官员将常规的效率优化描述为正当行为,但认为隐蔽提取不可接受。
中国于 7 月 27 日回应,指责美国推行“AI 霸权主义”。中国商务部威胁称,将针对给中国利益造成实质损害的行动采取反制措施。
这份中方回应发布前,外界已出现有关潜在制裁、调查和实体清单限制的警告。Moonshot 否认 Kimi K3 的性能是通过蒸馏实现的。
Moonshot 将其进展归因于原创性的架构改动。由于无法获取其完整训练流程,这一说法尚未得到独立验证。
美国官员也面临类似的信息披露问题。美国实验室会发布技术报告,但这些文件很少逐一列出所有用于评估、评分、改写或生成合成数据的外部模型。
这种新检测方法可推动所有开发者建立更清晰的记录。审计人员可以将声称的模型谱系与行为证据进行比较,并调查其中的重大差异。
不过,政策制定者不应将检测器评分视为裁决。当真实教师模型不在候选池中,或校准过程遇到陌生教师模型时,论文所述方法的准确率会下降。
在受控交叉验证中,针对未见学生模型进行泛化时,准确率达到 82.9%。针对未见教师模型进行泛化时,这一数字降至 60.5%。
这种差异对现实调查至关重要。审计人员很少能掌握所有可能的教师模型,而最重要的来源可能是私有或未发布的检查点。
该方法对推理教师模型的检测也比对非推理型 Llama 教师模型更可靠。即使确实发生了蒸馏,较弱的指纹也可能产生假阴性。
反过来,纠缠的谱系也可能导致误导性排名。如果教师模型 A 影响了教师模型 B,那么用 B 训练的学生模型可能保留与 A 相似的行为。
目前没有任何模型层面的检测器能单独回答法律问题。它无法确定输出究竟来自付费 API、开放数据集、授权合作关系,还是协同运作的欺诈账户。
一项站得住脚的执法案件需要多层证据。调查人员应结合提供商日志、财务记录、账户基础设施、模型行为、发布时间线和训练披露信息。
政府还需要对被禁止的提取行为作出稳定定义。若将所有基于模型生成文本的训练都称作“盗窃”,将牵连行业内普遍存在的做法。
更狭窄的定义可以聚焦欺骗、规避访问控制、实质性规模和定向能力获取。这些因素比常规评估或获允许的合成数据生成更容易区分。
这一框架也能减少基于国籍的预设。一款中国模型不应仅因表现出色就被推定为抄袭,一款美国模型也不应自动获得豁免。
当证据标准对称适用时,科技新闻中的争论会更具可信度。如果行为审计持续发现双向的跨境影响,这种对称性将尤为重要。
检测方法仍无法证明什么
这项研究提供了有用的审计信号,但其开放世界发现仍过于不确定,无法对任何实验室提出决定性指控。
论文的第一个局限是单一教师模型假设。当代前沿模型可能使用多个系统来生成解答、评估答案、改写文本和创建偏好数据。
通过这一管线训练的学生模型,拥有承担不同角色的多个教师模型。当前方法假设,至多只有一个候选教师模型提供了相关的最终阶段信号。
第二个局限是其聚焦于监督微调。前沿模型开发还包括预训练、强化学习、拒绝采样、工具生成的反馈以及人类偏好优化。
模型可能在这些阶段中的任何一个吸收另一个系统的行为。由此产生的痕迹可能不同于受控微调的特征。
第三个局限涉及参考模型。强归因需要一个更早的检查点,且该检查点须与学生模型的家族和训练状态高度匹配。
QwQ 提供了一个合理的早期预览模型,因此其结果更容易解释。GPT-OSS 缺少等效的公开检查点,迫使研究人员使用 GPT-2 XL。
这种不匹配削弱了关于 GPT-OSS 的核心主张。这也是作者将所提出关联描述为高度不确定的主要原因。
第四个问题是缺失的教师模型。即使真实来源不存在于候选名单中,检测器也只能对其审查的候选项进行排序。
最强候选项可能只是错误最少的选项。开放世界测试尝试通过阈值处理这一问题,但校准过程仍对教师模型类型敏感。
第五个问题是共享公共数据。模型在接受相同的基准答案、代码库、学术论文或合成数据集训练后,可能在行为上变得相似。
一些数据集会公开发布来自具名推理系统的输出。使用这些记录进行训练,即使不存在直接 API 提取,也可能形成技术依赖。
第六个局限是有意混淆。随着审计技术为人所知,开发者可以改写输出、混合教师模型、过滤风格标记,或针对检测器进行训练。
可见的指纹可能反过来促使人们将其移除。这种动态已经出现在研究水印是否能在下游模型训练中存活的研究中。
第七项担忧涉及机构独立性。一位论文作者列出了 OpenAI affiliation,研究还获得了涉及 OpenAI、Ai2 和 Apple 的支持。
这并不会使该方法或结果失效。但当研究结论进入涉及 OpenAI 的地缘政治争端时,独立复现就显得尤为重要。
研究人员应使用新的提示集、替代参考模型、更大的候选池和隐藏的真实标签模型复现测试。他们还应测试混合教师模型和改写后的数据集。
公司可以通过发布中间检查点和更完整的数据溯源声明来提供帮助。溯源记录会说明哪些模型和数据集影响了每个训练阶段。
这些记录可让审计人员将声明的依赖关系与测得的行为进行比较,也能区分常规的内部蒸馏与未披露的竞争对手提取。
企业采购方有切实理由关注这一问题。模型未经记录的谱系可能带来许可、安全、供应链和监管风险。
一家为编程或敏感分析部署模型的公司,需要的不只是基准分数。它还需要了解模型如何训练,以及上游访问是否可能触发限制。
评估相关主张的团队应在可搜索系统中保存源材料、日期和技术报告。结构化的AI 知识库有助于区分一手证据与反复传播的评论。
正确的结论应当保持审慎。行为审计正变得可行,但可行的信号尚未成为法证标准。
三个信号将决定下一步走向
下一阶段取决于复现、执法证据以及自愿披露的模型溯源信息。
第一个信号是对基于参考模型方法的独立复现。研究人员需要复现其受控条件下的准确率,并在不熟悉的模型家族上测试其失效模式。
一次成功复现应包含多教师模型训练、改写输出、隐藏候选项和多个参考检查点。结果若保持一致,将增强行为检测作为实用审计工具的可信度。
若无法复现 GPT-OSS 的排名,将削弱标题所称的逆转,但不会使该方法涉及已知蒸馏学生模型的、更受控的结果失效。
第二个信号是任何由详细证据支持的执法行动。美国官员已讨论针对被指控进行隐蔽提取的中国开发者展开调查、实施制裁和贸易限制。
可信的行动应明确被禁止的行为、规模、访问途径及其与最终模型之间的联系。关于基准质量的笼统断言达不到这一标准。
提供商记录可能提供最有力的证据。协同付款、共享基础设施、反复提出特定能力导向的提示,以及蓄意规避,都将支持对抗性蒸馏的案件。
行为分析随后可以将这种收集行为与已发布模型联系起来。两类证据结合后,将比任何单一证据形式都更有力。
第三个信号是 OpenAI、DeepSeek、Moonshot、Anthropic 和 Alibaba 是否披露更多有关合成训练数据的信息。详细的溯源信息可将如今推测性的谱系图转化为可检验的主张。
开发者无需公开每一份私有数据集。他们仍可识别主要的外部教师模型家族、获得授权的输出来源,以及合成数据进入训练的阶段。
OpenAI 的回应尤其值得关注,因为论文点名了 GPT-OSS。对其参考模型和外部合成数据的技术说明,可能澄清含糊的 DeepSeek 和 QwQ 信号。
DeepSeek 也可以以同样方式回应。进一步说明 R1 的后训练来源,将有助于检验检测到的 o1 风格行为究竟反映直接蒸馏,还是更间接的谱系。
沉默不会证明存在不当行为,但会让政策制定者、采购方和研究人员继续依赖不完整的行为与基础设施线索。
因此,这场科技新闻争议正走向一场证据竞逐。一方掌握提供商日志和安全主张,另一方则指向技术创新以及不足的公开证据。
这项新研究并未宣布谁胜出。它表明,模型的血统可能留下可测量的痕迹,其中也包括会使任何一国偏好的叙事变得复杂的证据。
读者应关注可复现的审计、有据可查的访问违规行为,以及具体的来源披露。这些信号将揭示:在政治主张固化为长期政策之前,模型取证能否走向成熟。



