top of page

Kimi K3 与 Qwen 3.8 开放模型回顾:闭源前沿模型正面临压力

7月23日
讀畢需時 14 分鐘

Kimi K3 携 2.8 万亿参数而来,直接挑战了前沿 AI 必须保持闭源这一假设。本篇 Kimi K3 与 Qwen 3.8 开放模型回顾聚焦于这样一周:这一挑战已变得愈发不容忽视。

Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,主攻编程、推理、视觉工作和长时间运行的智能体任务。随后,Alibaba 预览了 Qwen 3.8,并表示将开放权重。中国国家主席习近平也在上海举行的世界人工智能大会(即 WAIC)上倡导普惠可及的 AI。

这些事件让两种 AI 开发模式发生了正面碰撞。开放权重开发者希望提供可下载的系统,让组织能够独立检查、修改和运行。OpenAI 与 Anthropic 则主要通过托管服务、访问政策和闭源权重保留控制权。

这场竞争尚无定论。Kimi K3 仍然难以部署,Qwen 3.8 尚未完成其承诺的权重发布,而基准测试的领先地位也可能迅速易主。然而,举证责任已经转移。闭源实验室如今必须解释,为何其控制模式所带来的附加价值足以证明依赖其平台是合理的。

Kimi K3 将开放模型之争变成了一场前沿能力考验

Kimi K3 的重要性在于,Moonshot 正在检验开放权重模型能否在定义当前前沿模型的任务中展开竞争。

Moonshot 将 Kimi K3 描述为一个拥有 2.8 万亿参数的混合专家模型。混合专家系统不会激活所有参数,而是让每个 token 仅经过少量经过选择的专用神经网络组件。

据报道,K3 包含 896 个专家,但每个 token 只会激活其中 16 个。与激活整个网络相比,这种设计降低了推理计算量,但并不意味着该模型规模小巧或易于运行。

根据 Moonshot 的 K3 技术预览,该模型支持 100 万 token 的上下文窗口。它还接受视觉输入,并面向长周期的编程、推理和知识工作。

长上下文窗口使模型能够在一次会话中接收大型代码库、文档集合或较长的任务历史记录。上下文是否真正有用,仍取决于检索准确性、注意力机制的表现,以及模型定位相关细节的能力。

Moonshot 表示,K3 可以在长时间运行的智能体工作流中持续推进任务。此类工作流要求模型在多个步骤中进行规划、使用工具、检查结果、修正决策并从错误中恢复。

这一重点使 K3 有别于主要围绕问答构建的模型。编程智能体会暴露短期基准测试可能掩盖的弱点。一个错误的假设可能在数十次工具调用中不断放大。

独立证据提供了值得关注的理由,尽管仍不足以为更广泛的比较盖棺定论。据 Associated Press 报道,K3 发布后登上了 Arena 前端编程排行榜首位。

Arena CEO Anastasios Angelopoulos 称其为一次重大发布,并表示更多结果仍在陆续出炉。用户偏好排名反映了人们对输出结果的评价,但无法衡量所有企业级需求。

Moonshot 自己的评估显示,在多项编程和智能体基准测试中,K3 的表现接近领先的闭源系统。在独立评估机构以可比设置复现这些结果之前,它们仍属于企业自身的主张。

这一区别非常重要,因为模型评估对提示词、脚手架、工具访问权限和推理预算格外敏感。同一个模型可能在一种智能体框架中领先,却在另一种框架中落后。

K3 在完整技术资料尚未公布前便已亮相。Moonshot 表示,将于 7 月 27 日发布完整权重,同时披露更多架构、训练和评估细节。

宣布将发布权重,并不等同于已经提供了可用且文档完善的版本。开发者仍然需要模型文件、许可证、tokenizer、推理代码和部署说明,才能评估其实际开放程度。

即便存在这一限制,K3 依然改变了讨论方向。现在的比较已不再是灵活的开放模型与明显更优秀的闭源系统之间的较量,而正在转变为对能力、控制权、基础设施和信任等不同组合方案的比较。

Qwen 3.8 与 WAIC 使开放权重成为一项战略承诺

当 Alibaba 将其下一代旗舰模型与明确的开放权重承诺联系起来时,压力进一步增大。

K3 亮相后不久,Alibaba 便预览了 Qwen 3.8。该公司称这款模型拥有约 2.4 万亿参数,并表示可下载的权重即将发布。

据报道,在完整的模型卡或权重包可用之前,该预览版本已经通过 Alibaba 的服务亮相。这一发布顺序留下了若干尚未解答的重要问题。

开发者目前还不清楚,可下载版本在架构、能力或后训练方面是否会与托管预览版本一致。他们还需要明确的许可条款以及切实可用的推理软件。

这些不确定性意味着 Qwen 3.8 尚不能作为完整的实证依据。但它依然是一个重要的方向性声明,尤其是在社区担忧 Alibaba 是否会将其最大规模模型保留为仅限托管访问之后。

这项声明使 Qwen 与 Kimi 一同加入了这场竞争:谁能让前沿规模的模型在专有服务之外真正可用。仅凭参数总量无法决定这场较量的结果。

一个拥有数万亿参数的模型在技术上可以是开放的,但对大多数开发者而言仍然遥不可及。它的实际受众取决于内存需求、量化支持、分布式推理以及较小的衍生模型。

Qwen 更广泛的模型家族让 Alibaba 在这方面拥有优势。该组织已经发布了多种规模和模态的模型,让开发者能够根据不同的硬件条件和应用需求进行选择。

大型旗舰模型还可以作为较小模型的教师模型。这使其研究价值不再局限于有能力运行原始检查点的少数组织。

政治环境又增添了一个层面。7 月 17 日,习近平在上海举行的 WAIC 开幕式上倡导一种更具普惠性的人工智能发展方式。

这场讲话将 AI 的可及性定位为一个国际发展议题,而不仅仅是一种许可偏好。中国模型的发布正日益与对标准、开发者社区和部署市场的影响力联系在一起。

这一政策信号并不意味着所有中国模型都会完全开放。在 AI 领域,“开源”一词经常被宽泛使用,即使训练数据、源代码和开发方法并未公开。

开放权重描述的是一种范围更窄的安排。用户可以下载训练后的参数,但可能只能获得极少的底层数据集或训练过程信息。

在任何 Kimi K3 与 Qwen 3.8 开放模型回顾中,都应明确体现这一区别。这些发布扩大了对模型行为的访问权限,但未必能够实现完整复现。

尽管如此,权重访问权限依然会改变开发者能够做什么。组织可以微调模型、私下检查其输出、应用自己的安全措施,并避免将每个请求都发送给外部提供商。

他们还可以保留某个已知的模型版本。托管服务可能会改变行为、限制或可用性,却不会给予客户对底层系统的控制权。

对于政府和受监管行业而言,这种自主性可能具有战略价值。它可以支持本地运行、数据驻留,以及减少对单一外国服务依赖的采购政策。

因此,WAIC 传递的信息通过政策协同强化了开放权重路线。Moonshot 与 Alibaba 在商业上相互竞争,但它们发布的模型共同支持了分布式访问这一主张。

这带来的压力超越了基准测试本身。闭源实验室正在捍卫一种服务模式,而中国开发者则将模型访问作为推动国际采用的渠道。

开放与闭源之间的差距正从排名问题转变为取舍问题

核心竞争已不再是开放与能力之间的对立,而是自主控制与托管式前沿服务所提供的便利及安全保障之间的取舍。

闭源模型仍然拥有显著优势。OpenAI 和 Anthropic 可以在不分发底层参数的情况下更新基础设施、部署新能力并管理安全控制措施。

托管访问也消除了一项重大的运维负担。客户无需自行组建集群、优化内存使用、维护推理软件或诊断模型服务故障。

在 K3 这种规模下,这些优势变得更加重要。即使其架构只激活一小部分专家,一个拥有 2.8 万亿参数的模型也无法在普通工作站上运行。

大型混合专家模型需要用内存容纳完整参数集,或采用复杂的方法将其分布到多个设备上。生成过程中,加速器之间的通信可能成为瓶颈。

这意味着,K3 的开放权重最初将主要对云服务提供商、研究实验室、资金充裕的企业和基础设施专家产生价值。规模较小的开发者往往仍会通过托管平台访问它。

这一结果并不会抹去开放权重的价值,而是改变了自主性体现的位置。市场可以支持多个托管方使用同一个模型,而不是由单一模型所有者控制所有端点。

托管方之间的竞争可以改善可用性和区域覆盖范围,还能让客户在不彻底更换应用底层模型的情况下迁移工作负载。

闭源提供商则提供另一种形式的稳定性。它们可以在一个托管产品中整合模型、成熟的工具、身份控制、监控和合同支持。

这种取舍也延伸至安全领域。一旦权重可以下载,原始开发者便会失去部分限制修改或在出现有害使用后撤销访问权限的能力。

闭源实验室认为,受控部署有助于分阶段发布、滥用检测,以及在出现新风险时采取干预措施。当模型副本分散到独立系统中时,这些控制会变得更弱。

开放模型的支持者则回应称,访问权限高度集中也会带来自身风险。少数几家公司可以决定哪些研究人员、企业或国家能够获得先进能力。

在围绕 K3 的争论中,Nvidia CEO Jensen Huang 为中国开放模型辩护,并主张更广泛地开放高能力系统。他的介入反映了开发者采用背后的商业和地缘政治利益。

与此同时,OpenAI 和 Anthropic 已就中国先进开放权重模型相关的风险向政策制定者发出警告。它们立场的一致,使安全争论显现出不容忽视的竞争维度。

闭源模型公司讨论滥用问题有其正当理由。当监管提高竞争对手发布权重的成本时,它们也会从中受益。这两点可以同时成立。

这就是为何基准测试分数无法解决开放与闭源之间的差距问题。真正相关的比较还包括任务质量、部署自由度、总体基础设施需求、安全控制和切换成本。

K3 在前端编程和智能体工作方面显得尤为突出。但这并不能证明它在科学推理、网络安全、可靠性或企业支持方面同样占优。

最强大的封闭系统也能在公开对比之间悄然获得改进。开放检查点则保持固定,因此更易于审计,但如果没有发布新版本,改进速度也会更慢。

开放模型以定制能力作为回应。开发者可以针对特定领域对检查点进行后训练、集成本地工具,或强制采用专门的输出格式,而无需等待原始实验室采取行动。

后训练是指通过监督样本、偏好优化、强化学习或相关方法调整预训练模型。它正日益决定模型在特定工作流中的表现。

因此,通用基准上的差距可能没有最初看起来那么重要。组织可能更青睐基础能力较弱、但在使用自身任务进行训练后表现更好的模型。

这种可能性对于代码审查、文档提取、内部研究和重复性的智能体工作流尤其重要。每种应用所奖励的行为和所容忍的失败模式都不相同。

评估此类系统的团队需要可靠记录提示词、输出、测试和部署决策。可搜索的工程知识库可以在模型更替过程中保存这些证据。

真正的问题不是开放权重能否在每个排行榜上获胜,而是是否有足够多的用户能从控制权和定制能力中获得比便利性损失更多的收益。

知识蒸馏既是技术工具,也是政治分歧线

知识蒸馏让关于开放模型能力源自何处、功劳应归于谁的每一种主张都变得更加复杂。

知识蒸馏训练学生模型复现能力更强的教师模型的有用行为。学生模型从生成的答案、概率分布、推理轨迹或教师产生的其他信号中学习。

这种方法早于当前的语言模型。长期以来,研究人员一直用它将大型神经网络压缩成所需资源更少的小型系统。

近期研究将蒸馏应用于推理、编码、工具使用和指令遵循。合成样本可以让学生模型接触到难以从人类作者那里收集的解题模式。

研究发现,较小的模型可以从较大的教师模型中吸收重要能力。一项关于合成训练数据的研究报告称,较小的 Llama 模型在部分任务上取得了显著提升。

这些结果并不意味着学生模型会成为精确副本。蒸馏质量取决于数据覆盖范围、教师模型的一致性、训练方法以及学生模型的容量。

蒸馏模型可以模仿可见行为,却无法复现教师模型完整的内在能力。当提示词超出合成训练分布时,它可能会失败。

争议始于某个组织大规模查询另一家公司的封闭服务,并将其输出用作竞争模型的训练材料。

封闭模型提供商可能会将这种行为描述为提取、滥用或违反服务条款。开放模型倡导者则指出,学习模型输出如今在整个行业都很常见。

法律和伦理边界仍未明确。服务条款可以禁止自动化提取,但有关生成行为所有权的更广泛问题更难解决。

证据同样重要。输出相似并不能证明一个模型由另一个模型蒸馏而来。开发者可能通过共享的公共数据、相关评估集或独立后训练实现类似行为。

因此,指控所需的证据不能仅仅是基准表现相似。调查人员需要访问模式、重复出现的错误、不寻常的行为特征,或有关训练流程的直接信息。

地缘政治叙事让风险进一步上升。如果政策制定者将中国开放模型等同于未经授权的蒸馏,他们可能会限制对封闭 API 或先进计算系统的访问。

此类措施可能会减缓直接提取,也可能影响获得许可使用教师生成数据的合法研究人员、初创企业和公司。

限制还可能进一步推动美国平台之外的独立发展。试图维护封闭模型优势,反而可能加速形成彼此独立的技术生态系统。

蒸馏还削弱了封闭权重的一项核心承诺。提供商可以保护其参数,但通过 API 暴露的行为可能已经足以让其部分能力受到研究。

关闭 API 可以减少这种泄露,但也会限制收入和普及程度。每一家商业封闭实验室都必须在扩大覆盖范围和被模仿的风险之间取得平衡。

开放发布则从相反方向面临类似问题。一旦 K3 或 Qwen 权重可用,其他开发者便可对其能力进行蒸馏、微调或合并,从而构建新的系统。

这种分发可以让采用规模远远超出原始产品,也可能让模型脱离安全防护、文档和预期使用政策。

因此,怀疑者的立场不只是简单声称开放模型不安全。真正的担忧在于,能力变得可移植后,集中控制会随之丧失。

与之相反的担忧同样具体。集中控制可能限制研究、将客户锁定在单一提供商,并赋予少数公司对信息基础设施异乎寻常的影响力。

任何单一基准都无法为这些风险定价。组织必须决定哪些失败是自己能够管理的,以及哪些依赖是自己无法接受的。

K3 也表明,模型谱系需要更完善的文档。Moonshot 尚未公布所有必要的训练细节,外部人士因此无法全面评估有关数据、蒸馏和独立开发的主张。

同样的透明度问题对封闭模型影响更为严重。其提供商通常只披露有限的训练语料库和后训练流程信息。

开放权重提高了训练后的可检查性,却没有揭示完整的生产过程。封闭部署披露的信息更少,但提供了更强的运营控制。

一篇可信的 Kimi K3 与 Qwen 3.8 开放模型回顾必须保留这种不确定性。蒸馏可以扩大获取范围并提高效率,但也可能引发有关同意和竞争性挪用的争议。

Kimi K3 与 Qwen 3.8 开放模型回顾:三个值得关注的信号

下一阶段将由已完成的发布、可复现的评估和真实的部署证据决定,而不是由公告数量决定。

第一个信号是 Moonshot 承诺发布的 K3 权重。相关文件、许可证、技术报告和推理工具将表明该模型是否真正提供了切实可用的访问方式。

一次完整发布将强化这一观点:前沿规模的开放权重正在成为一种持久的产品战略。延期或限制严格的许可证则会削弱这一判断。

研究人员应检查可下载的检查点是否与托管的 K3 服务一致。他们还应测试量化版本、分布式服务要求,以及与常见推理框架的兼容性。

第二个信号是 Alibaba 的 Qwen 3.8 软件包。“即将推出”必须转化为具有明确条款、可明确识别的检查点,这项公告才能算作一次开放权重发布。

具体发布哪个模型至关重要。Alibaba 可能会发布同一个旗舰预览模型、一个更小的衍生模型,或一个包含多种规模的模型家族。

对于普及而言,一个覆盖广泛的模型家族可能比单个超大型检查点更重要。较小的模型可以触达更多开发者、设备、大学和区域云服务提供商。

模型卡应说明架构、上下文处理、后训练、评估设置和已知局限。缺少这些细节将使热门对比难以复现。

第三个信号是独立的智能体评估。K3 需要在模型与工具交互、保持状态并从错误中恢复的长时任务上接受测试。

短时基准上的胜利可以表明能力,却很少能反映运行可靠性。生产级智能体必须处理模糊需求、不断变化的文件、失败的命令和不完整的信息。

评估者应披露推理设置和工具脚手架。否则,周边系统的差异可能会被误认为底层模型的差异。

企业采用将提供另一项相关检验。组织需要有关延迟、基础设施需求、安全审查、微调结果和维护成本的证据。

这些结果可能因工作负载而截然不同。拥有合适基础设施的编码团队可能看重 K3 的灵活性,而另一家公司可能更青睐托管式 Claude 或 OpenAI 服务。

读者还应关注 WAIC 之后的政策反应。有关芯片出口、API 访问、模型分发和安全评估的规则可能改变每条路线的经济性。

但政策不会消除对选择权的根本需求。开发者需要符合自身隐私要求、预算、硬件条件和供应商依赖容忍度的高能力模型。

近期最可能出现的结果并不是开放模型取得全面胜利,而是形成一个由托管式封闭系统与可独立部署模型相互制衡的混合市场。

封闭实验室将在集成产品、支持和快速更新方面保持优势。开放权重开发者则将通过可移植性、定制能力和广泛的下游实验展开竞争。

只要比较保持诚实,这种竞争压力就能让买家受益。当公司隐藏评估设置,或将已宣布的权重视为已经完成的发布时,它的价值就会降低。

对知识工作者而言,这种变化将通过他们使用的工具显现出来。更多应用可以将私有信息与本地控制的模型结合,而不必把每份文档都传输给同一家提供商。

这种工作流仍然需要严谨的信息管理。个人知识库可以将源材料与生成的结论分开,并保留审计轨迹。

这篇 Kimi K3 与 Qwen 3.8 开放模型回顾最终指出了新的举证责任。开放模型开发者必须证明,其访问能力经得住基础设施、许可和安全要求的现实考验。

封闭模型提供商则必须证明,其剩余的性能和服务优势足以支撑集中控制的合理性。他们不能再把永久性的能力差距作为全部论据。

未来三个月,请忽略参数噱头,关注开发者实际能够下载、复现和部署什么。然后,将这些结果与最优秀的托管系统在真实工作中的表现进行比较。

对你的组织而言,什么更重要:当下最强的托管结果,还是未来能够检查、调整并保留模型的自由?答案应当决定你的团队下一步测试什么。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page