Kimi K3 的时间线挑战了 Claude Fable 解释其崛起的说法
- Aisha Washington

- 19分钟前
- 讀畢需時 15 分鐘
在美国官员指控 Moonshot AI 复制 Claude Fable 来打造 Kimi K3 后,Anthropic 成为一场政治争端的焦点。然而,Anthropic 与 TechCrunch 相关报道存在时间线问题。据报道,Fable 于 7 月 1 日才公开可用,而 Moonshot 大约两周后便发布了 K3。
接受 TechCrunch 采访的研究人员认为,这段时间过于短暂,不足以通过 Fable 蒸馏解释整个模型。蒸馏是利用一个模型的输出训练另一个模型。它可以迁移模式和行为,但无法立即复现一个前沿模型训练项目。
这一差别很重要,因为 Kimi K3 不只是生成类似 Claude 的文本。独立测试显示,它在复杂知识工作中接近 Fable,并在更聚焦的编程评测中领先于多款领先模型。因此,真正的较量不只是 Moonshot 对阵 Anthropic,而是原创训练能力的证据与更简单的复制叙事之间的较量。
Anthropic 与 TechCrunch 的争议始于政府指控
这项指控将两个不同问题联系在一起:模型提取,以及获取受限计算硬件。
白宫科学顾问 Michael Kratsios 指控 Moonshot 使用 Anthropic 技术进行了大规模、秘密的工业级蒸馏。他还指称,Moonshot 使用了未获授权出口至中国的先进 Nvidia 芯片。
Kratsios 没有公布支持这两项说法的技术证据。Moonshot 也没有向 TechCrunch 提供有关 K3 训练过程的详细说明。这使得政府指控与完整技术解释之间存在显著的验证缺口。
这场蒸馏争议源于 Anthropic 此前的指控。该公司此前表示,已发现数百万次可疑交互,涉及与 Moonshot、DeepSeek 和 MiniMax 有关联的用户。
Anthropic 将这些交互描述为蓄意提取能力,而非普通产品使用。据报道,该公司通过 IP 地址和其他元数据关联了这些活动。这些证据可以支持这样一种说法:关联用户曾系统性地查询 Claude。
但这些证据本身并不能证明 Moonshot 是基于 Fable 输出构建 Kimi K3。关键问题包括:查询了哪些 Claude 版本、这些活动发生在何时,以及产生的数据如何进入 Moonshot 的训练流程。
白宫的指控更具体,因为它将 K3 的实力与 Fable 直接关联。这种表述带来了时间线问题:在 K3 面世前,Fable 仅公开可用约两周。
前沿模型通常无法在一个连续步骤中,从数据收集直接走向公开发布。开发者必须收集并清洗输出、训练或微调模型、运行评估、解决问题,并准备推理服务基础设施。
Moonshot 当时还在推出一个规模异常庞大的系统。该公司将 K3 描述为一个拥有 2.8 万亿参数、开放权重、支持一百万 token 上下文窗口的模型。开放权重允许开发者下载和修改模型参数,但并不一定会公开完整训练数据集。
Reuters 报道称,Moonshot 将 K3 设计用于推理、编程和更长周期的知识工作任务。该公司还表示,模型引入了两项旨在提升计算效率和长程表现的架构改动。
这些说法需要独立测试。不过,它们描述的是一个涉及架构、基础设施和评估决策的模型开发计划,而不只是收集 Fable 的回答。
这并不能证明 Moonshot 没有进行未经授权的蒸馏。它只是缩小了蒸馏能够合理解释的范围。早期 Claude 输出可能为后训练数据、风格或特定行为作出了贡献,却未必构成 K3 的底层能力。
这种区别在政治争论中很容易被忽略。“Moonshot 查询了 Claude”和“Fable 解释了 K3”是两种不同的说法。目前公开证据支持对前者进行审视,但尚未确凿证明后者。
两周不足以仅靠蒸馏完成
蒸馏可以复制有用行为,但发布时间表使其无法完整解释 K3 的整体表现。
Laude Institute 研究员兼 Snorkel AI 联合创始人 Braden Hancock 直接质疑了这一时间线。他告诉 TechCrunch,如此强大的模型不可能在 Fable 发布后这么短时间内,仅通过严格蒸馏就出现。
问题首先在于数据量。试图模仿 Fable 的实验室需要提交大量多样化提示,并收集有价值的回答。随后还需要筛除质量较差的样本、去除重复内容,并将任务组织成训练混合数据。
生成数据只是开始。监督微调,即 SFT,会基于提示与回答样本训练模型,使其学习偏好的回答模式。这个过程可以迁移语气、格式习惯和常见的问题解决流程。
Allen Institute for AI 的 Nathan Lambert 将这种表层迁移描述为一个模型学会另一个模型的“举止”。它可以解释为何一个系统听起来像 Claude,或偶尔将自己识别为 Claude。
这种行为并不是完整模型复制的技术指纹。一个模型可以从少量合成训练数据中吸收这些特征。同一模型还可能接收来自人工示范、代码库、内部模拟器或多个教师系统的其他数据。
现代模型质量也日益依赖强化学习。在这一过程中,模型反复尝试完成任务,并获得塑造后续行为的反馈。反馈可能来自自动化测试、奖励模型、验证器或其他 AI 系统。
实验室可以使用更强的模型来评估这些尝试。然而,大型强化学习项目需要大量推理能力、稳定的训练基础设施、精心设计的环境,以及多轮迭代。
Lambert 告诉 TechCrunch,先进训练运行可能涉及数千万个智能体。若将每一次交互都通过商业前沿 API 发送,将产生严重的吞吐量和延迟问题,也会形成显眼的使用模式。
这两周的窗口期必须容纳 Fable 发布后的所有这些工作。随后,Moonshot 还需要时间进行基准测试、安全评估、部署、文档编写和国际发布。
更合理的解释是,K3 的核心项目早在更早之前就已启动。Moonshot 可能在 Fable 公开可用前,就训练了基础模型及其大部分后训练系统。之后的 Fable 输出或许只影响了有限的收尾工作。
在这一解释下,Anthropic 之前的模型仍然相关。Moonshot 可能在更长时期内从更早的 Claude 输出中学习。Anthropic 早先的发现使这一可能性难以轻易排除。
不过,较早的教师模型无法直接解释与较新模型相关的所有能力。它可以提供示例、偏好或评估信号。Moonshot 仍然需要一个有能力的学生模型、合适的架构、算力、数据管道和有效的训练环境。
这正是为什么 Anthropic 与 TechCrunch 的争论不应被简化为蒸馏是否发生。更有力的问题是:与 Moonshot 自身的技术工作相比,蒸馏对观察到的性能究竟贡献了多少。
答案尚未公开。Moonshot 尚未发布足够详细的训练报告。Anthropic 也没有披露足够的取证证据,来将具体查询对应到具体的 K3 行为。
但时间表限制了各种可能性。严格的 Fable 蒸馏不太可能是完整解释。有限使用 Fable 输出仍有可能,而更早的合成数据和独立强化学习则更符合这一时间线。
Kimi K3 的结果指向更完整的训练体系
K3 最强的表现出现在需要规划和反复使用工具的任务中,而不仅仅是模仿教师模型的写作风格。
Artificial Analysis 在 AA-Briefcase 上测试了 K3。AA-Briefcase 是一项面向智能体知识工作的私有基准测试。智能体工作要求模型进行规划、使用工具、检查文件,并在多个步骤中修改交付成果。
K3 在该评测中获得了 1,543 的 Elo 评分。Claude Fable 5 以 1,574 领先。GPT-5.6 Sol 以 1,501 紧随 K3,其后 Claude Sonnet 5 和 Claude Opus 4.8 得分更低。
这一结果并不能证明 Moonshot 独立训练了 K3。基准测试无法还原训练数据集。然而,这种表现类型很重要,因为成功完成多步骤工作所需的不只是匹配教师回答的语言。
K3 的评分标准通过率为 51%,而 Fable 为 56%。其分析质量评分达到 1,754,略高于 Fable 的 1,744。其呈现效果仍弱于多位竞争对手。
这些混合结果比单一的头条排名更具信息价值。K3 在分析方面似乎能力很强,但在呈现和运行效率上仍存在明显弱点。这种特征不像是一个完美的 Fable 复刻版。
这项智能体基准测试也暴露出显著低效。K3 每项任务平均需要 83 轮和约 120,000 个输出 token。Fable 平均为 67 轮,而 GPT-5.6 Sol 平均为 50 轮。
K3 完成每项任务平均需要 56.4 分钟。这大约是 Fable 平均耗时的 2.5 倍,也是同一分析中 Grok 4.5 记录结果的 3.8 倍。
这些数字削弱了最简单的复制理论。蒸馏出的学生模型通常旨在以更低部署成本或更小运行规模,获得教师模型的有用行为。K3 却采用了极高的参数量,并在许多任务中经历漫长过程。
它的行为表明存在一套独立的优化策略。Moonshot 似乎以运行时效率换取了持续性、上下文和延展推理能力。由此产生的模型能够得到强有力的答案,但需要投入更多轮次和 token。
编程结果又增加了一个维度。Arena.ai 在一项专注于构建网页界面的测试中将 K3 排在第一。其他评测则显示,它在通用能力上接近 Fable,但展现出不同的优劣势。
任何基准测试都不应被视为全面定论。公开排行榜可能对提示设计、模型配置、采样和任务选择较为敏感。实验室也可以针对可见评测优化模型。
私有基准测试减少了一些数据污染担忧,但并不能消除评估偏差。高分证实的是在定义任务集上的表现,而不是普遍的优越性。
即便存在这些限制,K3 的结果仍对 Anthropic 和 OpenAI 构成压力。开发者如今拥有另一款能够处理复杂编程和文档工作流程的模型。其开放权重策略也让组织在部署上拥有更大控制权。
这对处理敏感内部材料的团队很重要。开放权重模型可以托管在受控环境中,而不是将每个提示都发送给外部服务。组织仍需评估许可、安全性、基础设施和输出质量。
模型选择日益取决于完整工作流,而非单一智能评分。团队必须比较完成率、延迟、token 消耗、上下文处理、工具可靠性以及人工审核要求。
对于知识密集型项目,保留可追溯的源材料与选择模型同样重要。可搜索的 AI knowledge base 能帮助用户依据自己的文档和既往决策核验模型输出。
K3 并不会在这种运营层面的比较中自动胜出。其较长的执行时间和较高的 token 用量可能造成瓶颈。Fable 在基准测试完成度、速度和呈现质量方面仍保有优势。
压力来自可信的替代选择。Anthropic 不再只与其他美国闭源系统竞争。随着开放权重替代方案在实际工作中的表现逐渐接近,它必须说明为何客户应接受专有服务。
“抄袭”叙事低估了中国 AI 能力
若只关注能力提取,可能会误判中国发展最快的 AI 实验室背后的技术实力。
Hancock 表示,美国观察者常常低估中国 AI 团队的专业能力。Moonshot 的研究人员并非仅靠抓取聊天机器人回答来拼装产品的匿名操作员。
创始人杨植麟曾在清华大学学习计算机科学,后在卡内基梅隆大学完成博士研究。Moonshot 在建设规模可观的研究组织期间,也获得了中国大型科技公司的支持。
这一背景并不能回答训练数据来源的问题。有经验的研究人员仍可能跨越合同或伦理界限。但这说明,将其完全归因于模仿的说法在分析上站不住脚。
K3 在 Moonshot 数年研究之后推出。该公司于 2023 年发布 Kimi,并围绕长上下文、推理和工具使用开发了后续多代产品。因此,K3 建立在既有的模型与基础设施路线图之上。
Reuters 根据 Moonshot 的说法,将 K3 描述为全球规模最大的可用开放权重模型。其 2.8 万亿参数量按模型总规模计算,超过了此前多个中国系统。
参数数量本身并不决定智能水平。混合专家架构会在每个 token 上仅激活大型模型的一部分。训练质量、路由、数据、后训练和推理设计的重要性,可能高于表面上的总参数量。
更广泛的竞争趋势更难被忽视。Z.ai、DeepSeek、MiniMax 和 Alibaba 都推出了能在不同基准测试中与美国系统竞争的模型,而且发布周期越来越短。
K3 的早期采用表明,开发者的反应不只是出于民族主义营销。Associated Press 报道称,Mozilla 首席技术官 Raffi Krikorian 在 K3 发布后不久,便将日常工作的大部分迁移至 K3。
Krikorian 表示,尽管基准证据显示 K3 在 AA-Briefcase 上完成缓慢,但在他的使用中,该模型感觉更快。这一差异说明,用户体验取决于任务类型、界面和感知响应速度。
Sensor Tower 估计,K3 发布后一周内,Kimi 获得了超过 93 万次下载,较前一周增长 200%。美国下载量约为 8.6 万次,增长 387%。
这些采用数据并不能证明持续使用。下载量可能在新闻周期内上升,并在用户试用产品后回落。留存率、付费转化率和工作负载量将更能证明需求是否持久。
不过,这一采用激增说明了政治反应为何加剧。K3 并未局限于中国开发者,而是正在进入美国专业人士和企业使用的工作流。
Nvidia 首席执行官 Jensen Huang 对限制这些模型的呼声提出质疑。他认为,开放系统会扩大整体 AI 市场,并增加对计算基础设施的需求。
Huang 还表示,可下载模型能够在受控环境内运行。这一立场与“中国来源会自动形成远程访问通道”的观点相冲突。部署安全取决于代码、模型封装、集成方式和运行控制。
开放权重并不能消除安全风险。模型可能包含不安全能力、易受攻击的依赖项,或在对抗性提示下改变行为。组织必须审查完整的部署栈。
因此,anthropic techcrunch 争议将商业竞争与国家安全政策交织在一起。Anthropic 有正当利益保护其服务免遭未经授权的提取。美国官员也肩负执行出口管制的职责。
这些利益可能助长一种过于方便的叙事。如果 K3 的强大源于 Moonshot 抄袭 Fable 并获得受限芯片,政策制定者就可以将该模型视为一次合规失败。
但如果 K3 反映的是有意义的本土研究,加上一些存在争议的合成数据,政策挑战就会更加棘手。限制一条 API 或芯片路径会减缓进展,却无法消除其背后的专业能力。
第二种解释更符合现有证据。它并不为潜在不当行为开脱,而是承认能力提取、原创研究和计算资源获取都可能共同促成同一模型。
更棘手的问题是 Moonshot 从何处获得算力
芯片指控值得单独审查,因为大规模训练需要实体基础设施,而模型输出的相似性无法揭示这一点。
Kratsios 声称,Moonshot 获得了 Nvidia Grace Blackwell 300 芯片,并在泰国访问了采用 GB300 硬件的服务器。TechCrunch 报道称,他没有提供支持这些说法的细节。
这种访问至关重要,因为美国限制向中国出口最先进的 AI 硬件。这些管制旨在限制中国实验室可获得的前沿训练规模和速度。
公司未必需要将每一块受限处理器进口到中国大陆。它可能通过海外数据中心、中间商或关联实体租用算力。
Georgetown University Center for Security and Emerging Technology 的研究员 Sam Bresnick 告诉 TechCrunch,先进芯片的黑市确实存在。他支持对承接大规模训练任务的全球数据中心实施“了解你的客户”要求。
在这一做法下,数据中心将核实使用先进计算集群的组织身份。运营方还将为异常庞大或敏感的工作负载建立报告机制。
这场辩论早于 K3。美国商务部曾在 2024 年提出云基础设施客户识别规则。根据 TechCrunch 的报道,截至 2026 年 7 月,该规则在 Trump 政府下的推进情况仍不明朗。
政策挑战在于全球执法。芯片可以通过分销商和组装后的服务器流转。算力也可以跨境租用,而无需将实体所有权转移给最终客户。
K3 的架构使算力问题尤为相关。训练一个总参数量达 2.8 万亿的模型,需要大量硬件、网络、存储和工程投入,即便推理时只激活其中一部分也是如此。
Moonshot 尚未公开足够信息,以核实其主要训练任务在何处进行。该公司也未提供能够化解 Kratsios 指控的硬件清单。
这种沉默支持继续调查,但不足以得出确定结论。实验室通常出于商业和安全原因不披露基础设施细节。缺乏披露并不证明使用了受限硬件。
因此,这些指控应继续拆分为可检验的组成部分:
与 Moonshot 有关联的用户是否系统性查询了 Anthropic 模型?
任何由此产生的输出是否进入了 K3 的训练或评估数据?
是哪些 Claude 代际提供了这些输出?
Moonshot 是否直接获得了受限芯片?
它是否通过海外设施租用了受限计算能力?
每个问题都需要不同类型的证据。API 日志可以证明查询模式。训练记录可以将输出与数据集关联起来。运输文件、云记录和硬件遥测数据则可澄清算力访问情况。
将这些问题合并起来,会形成一个在情绪上颇具说服力的故事,却得出薄弱的技术结论。即便硬件违规得到证实,也无法证明 Fable 赋予了 K3 智能。
同样,即便蒸馏行为得到证实,也无法揭示 Moonshot 从何处获得足够算力来训练和服务该模型。anthropic techcrunch 的框架最有价值之处,在于揭示这种区分,而不是将其混为一谈。
政策制定者面临权衡。更严格的全球报告机制可以改善出口管制执法,但广泛限制也可能加重合法云客户的负担,并推动基础设施转向美国供应链之外。
模型提供商也有自己的技术应对方式。Anthropic 可以强化账户验证、检测协同查询、限制可疑自动化行为,并采用为取证分析设计的输出标记。
这些防御措施代价不菲。激进限制可能干扰合法开发者、研究人员和企业客户,也可能使闭源服务在可下载模型面前失去吸引力。
结果是一场能力提取控制与开放模型能力之间不断升级的竞争。Anthropic 必须在保护其知识产权投入的同时,避免让 Claude 更难使用。Moonshot 则必须在不完全暴露其竞争性训练配方的前提下赢得信任。
三项信号将检验 Kimi K3 的解释
下一步证据应来自技术披露、持续的真实世界使用,以及可验证的执法发现。
第一个信号是一份详细的 K3 技术报告。Moonshot 需要说明模型架构、预训练计划、后训练方法、评估设计和合成数据政策。
该公司无需公布每一个专有数据集。但它仍可以披露商业模型输出是否进入训练、哪些阶段使用了教师模型,以及对这些来源采取了哪些保障措施。
独立研究人员随后可将 Moonshot 的说法与 K3 的可观察行为进行比较。可复现的消融实验,即每次移除一个训练组件,将显示哪些方法促成了特定能力。
一份可信的报告将强化“K3 反映长期内部项目”的论点。持续沉默则会保留不确定性,并使 Anthropic 的指控更具分量。
第二个信号是发布基准之外的持续表现。早期排名显示 K3 已接近前沿,但其效率问题仍然突出。
开发者应在生产环境中关注任务完成率、延迟、故障恢复、工具准确性和人工修正率。长时间运行的智能体任务比吸引人的一次性演示更重要。
在最初下载高峰之后,采用情况也需要持续。企业和软件平台的持续使用将表明,K3 的优势能够经受真实运营约束的考验。
若使用量迅速下滑,则说明基准实力夸大了其实际价值。高留存率加上效率提升,将增加 Anthropic、OpenAI 和其他闭源提供商面临的压力。
第三个信号是来自美国执法机构或 Anthropic 的文件证据。API 日志、账户网络、云记录或硬件交易将把笼统指控转化为具体发现。
Anthropic 早先关于数百万次交互的说法意义重大,但公开记录中缺少一条能够将这些交互与 K3 最强能力联系起来的证据链。要归因能力,这条证据链至关重要。
有关泰国 GB300 硬件的证据将回答另一个问题:无论 K3 的训练数据如何,它都将揭示出口管制是否在云服务或服务器供应环节失效。
理想的调查应公布足够细节,让外部专家能够区分事实与推断。没有技术证据支撑的政策声明无法平息这场争论。
读者应避免过早得出两个结论。K3 的成功并不能证明蒸馏没有发挥作用;Anthropic 的日志也不能证明 Fable 创造了 K3。
现有证据支持一个更为谨慎的判断:Moonshot 很可能在 Fable 公开可用之前,就已利用自身的架构、数据系统和强化学习基础设施开发了 K3 的基础能力。
来自 Anthropic 或其他前沿模型的部分合成数据,或许已进入这一更广泛的开发过程。其使用是否违反条款、触及法律边界,或对 K3 产生了实质性影响,仍无定论。
这正是 anthropic techcrunch story 中的核心反转。一项原本意在将 K3 描绘为衍生产品的指控,反而凸显了:简单的数据提取对现代前沿模型开发的解释力究竟有多么有限。
对开发者而言,实际应对方式是审慎评估:在完整工作流中比较模型,审查数据流向,并在衡量基准得分的同时计算纠错成本。
对企业采购方而言,溯源如今应与性能和安全性一道纳入采购审查。应询问供应商如何获取合成数据、监控模型行为,以及记录部署基础设施。
对政策制定者而言,下一步应是获取足够具体、能够支持有针对性执法的证据。宽泛的指控可能会使技术调查沦为竞争策略的替代品。
未来三个月的问题,不在于 Moonshot 是否从 Anthropic 学到了什么。大多数先进实验室都会以某种形式从其他模型中学习。决定性的问题是,调查人员能否证明 Fable 实质性地造就了 K3 的前沿能力。
在此类证据出现之前,Kimi K3 应被视为一款存在争议的产品,同时也是一项严肃的技术成就。它的不足显而易见,但其带来的竞争压力同样不容忽视。


