Qwen3.6 开源模型击败 397B 巨头 - 阿里巴巴悄然关闭其旗舰模型的权重
- Aisha Washington

- 6月5日
- 讀畢需時 10 分鐘
已更新:6月17日
Alibaba 的 Qwen 团队于 2026 年 4 月 20 日发布了 Qwen3.6-Max-Preview —— 这是 Qwen 三年历史上,旗舰模型首次不提供公开权重。没有 Hugging Face 下载,没有 ModelScope 发布,也没有私有化部署选项。仅能通过 Alibaba Cloud 的 Model Studio 端点进行 API 访问。这支发布了 100 多个开源权重模型、积累了近 10 亿次社区下载量的团队,刚刚对其最强大的模型关闭了私有化部署的大门。
两天后,同一团队发布了 Qwen3.6-27B:完全开源,采用 Apache 2.0 协议,且根据 Alibaba 的基准测试,它在软件工程师最关心的任务上,性能超越了拥有 3970 亿参数的前代模型。Qwen3.6 开源版是你可以下载并自行运行的模型。而登顶排行榜的模型,则是你无法掌控的那一个。
这就是 Alibaba 2026 年 4 月发布会的核心矛盾:全球下载量最大的开源 AI 模型家族中性能最强的版本,并非作为开源贡献问世,而是作为一款闭源的 API 产品。这位全球 AI 领域的开源冠军,刚刚划出了一道从未有过的界限。而关于为什么 Qwen3.6 开源模型依然值得运行,最强有力的论据就蕴含在 Alibaba 保持开放的那个模型中。
事件回顾
Alibaba 于 2026 年 4 月 20 日发布了 Qwen3.6-Max-Preview,声称在六项智能体编程基准测试中占据榜首:SWE-bench Pro、Terminal-Bench 2.0、SkillsBench、SciCode、QwenClawBench 和 QwenWebBench。该模型通过兼容 OpenAI 和 Anthropic 的 API 运行,支持 260,000 token 的上下文窗口,并包含 preserve_thinking 这一特性可以在多轮对话中保持推理轨迹——这对于需要上下文连续性的长期运行的 agentic 工作流至关重要。
这是 Qwen 旗舰级模型中首次发布的闭源权重版本。 之前的每一个主要版本——Qwen、Qwen2、Qwen3、Qwen3.5——都是在 Apache 2.0 协议下开源权重的。在发布 Max-Preview 的同时,Alibaba 关闭了 Qwen Code 的免费层级。这一信号非常明确:产品线的顶端正在转向按 token 付费的 API 模式,而不是社区下载模式。
团队保留开源的部分同样重要。4 月 22 日发布的 Qwen3.6-27B 是一款完全开源的稠密模型,可在 Hugging Face 上通过 Apache 2.0 协议获取。它拥有 262,144 token 的上下文窗口——通过 YaRN 缩放可扩展至超过 100 万 token——并且在 Q4_K_M 量化下仅需约 16.8 GB 显存。根据 Alibaba 报告的基准测试,它在 SWE-bench Verified 上得分为 77.2%,在 SWE-bench Pro 上为 53.5%,在 Terminal-Bench 2.0 上为 59.3%。
它的前代产品——Qwen3.5-397B-A17B,一个原始参数量大近 15 倍的混合专家(Mixture-of-Experts)模型——在同样任务中的得分分别为 76.2%、50.9% 和 52.5%。27B 的表现超越了 397B。而且,只有 27B 是可以下载的。
同样保持开源的还有:Qwen3.6-35B-A3B(4 月 2 日发布的 MoE 变体)、Qwen3.5-Plus 系列、Qwen3-Coder-Plus 以及 Qwen3-VL 多模态模型。闭源权重的决定仅针对旗舰层级,而非整个 Qwen 品牌。但旗舰模型定义了任何模型家族的发展轨迹——而这一系列刚刚离开了开源公共领域。
为什么这很重要
要理解为什么这一特定决定具有分量,首先要看 Qwen 的开源履历究竟代表了什么。
Alibaba 在 2023 年 4 月以其原名“通义千问”发布了 Qwen。到 2026 年 1 月,Qwen 家族的累计下载量已超过 7 亿次。到 2026 年 3 月,这一数字达到了 9.42 亿——仅 2 月份的下载量就达到 1.536 亿。根据 Interconnects AI 追踪的数据,截至当月,Qwen 的全球开源下载份额超过了 50%——是排在其后的八个模型系列总和的两倍多。
这绝非一个小众的研究项目。以目前可用的任何下载指标衡量,Qwen 都是全球占据主导地位的开源 AI 模型系列。这种规模使得旗舰模型采用闭源权重的决定,与小型实验室尝试混合策略有着本质的区别。当 Qwen 做出改变时,它承载着建立在开放获取预期之上的社区重量。
信任维度对企业买家尤为重要。依赖开源权重模型的组织通常不仅是为了成本,更是为了可预测性:审计部署内容的能力、微调的选项,以及免受非自身控制的供应商 API 弃用计划的影响。将旗舰模型转为仅限 API,提出了一个 Qwen 团队此前从未需要回答的问题:如果 Alibaba 调整价格、限制端点速率,或面临影响 API 可用性的监管压力,你的生产依赖会发生什么?
数据驻留增加了第二个摩擦点。Qwen 的 API 基础设施运行在 Alibaba Cloud 上,受中国监管管辖。对于欧盟和北美的受监管行业(如金融服务、医疗保健、法律)而言,通过 Alibaba 的云基础设施路由敏感工作负载会引发合规性问题,而这些问题在部署 Claude 或 GPT-5 时并不存在。闭源权重的举动取消了自托管的变通方案,而这正是注重合规的团队此前在自身数据边界内使用 Qwen 模型所依赖的方式。
时机与决定本身同样重要。2026 年 4 月,全球最著名的两个开源 AI 贡献者——Alibaba 和 Meta——在同一个三周窗口内相继发布了专有的旗舰模型。Meta 的 Muse Spark 作为该公司的首个闭源模型于 4 月 8 日发布。Alibaba 的 Max-Preview 紧随其后,于 4 月 20 日发布。当 AI 领域最大的两个开源贡献者在几周内朝同一个方向移动时,这不再是一个孤立事件。这已经成为一种趋势。
开源悖论 - 一个不该取胜的 27B 模型
Qwen3.6 发布中最被低估的维度并不是旗舰模型走向闭源,而是 Alibaba 留下的那个权重开放的模型在智能体编程任务上超越了其 397B 的前作——而其中的原因值得深入理解。
Qwen3.5-397B-A17B 采用的是混合专家(MoE)架构。MoE 模型将每个输入 token 路由到专门的子网络子集,在每次推理过程中仅激活总参数的一小部分。在这种情况下:总参数为 3970 亿,但对于任何给定的 token,仅有 170 亿参数处于激活状态。决定每次推理实际计算量的数字是 170 亿,而非 3970 亿。
Qwen3.6-27B 是一个稠密(dense)模型。在每次推理过程中,所有 270 亿个参数都会被激活。当你比较这两个模型在推理时使用的有效计算量时,27B 稠密模型在每个 token 上运行的参数实际上比 397B MoE 模型还要多。当你观察实际运行的部分时,尺寸数字是反过来的。这个 27B 的“较小”模型在每个 token 上的计算负担比它庞大得多的 MoE 前作还要重。
驱动 Qwen3.6-27B 的架构是 Gated DeltaNet 混合架构——结合了线性注意力机制与传统的自注意力机制。根据 Alibaba 的技术文档,与标准的纯 Transformer 架构相比,这种混合方法提高了长文本处理能力和推理效率。该模型在 Q4_K_M 量化下约为 16.8 GB,使其可以在单个高端消费级或工作站 GPU 上运行。拥有一个 RTX 5090 或一个 A100 的团队,就可以运行一个在 Alibaba 数据上超越了曾需要多 GPU 推理集群才能运行的 397B 系统的基准性能模型。
在Alibaba 报告的基准测试,Qwen3.6-27B 在 SWE-bench Verified 上的得分为 77.2%,而其 397B 前代产品的得分为 76.2%。在测试真实终端开发任务的 Terminal-Bench 2.0 中,27B 的得分为 59.3%,而前代产品为 52.5%,差距达 6.8 个百分点。SkillsBench 显示出更大的差距:27B 为 48.2%,而 MoE 版本为 30.0%,单代模型实现了 77% 的相对提升。
如果这些数据准确,那么效率提升的故事就是真实且显著的。其实际意义在于,组织现在可以在自有硬件上本地运行接近旗舰级的编程性能,并拥有完整的数据驻留权,其量化模型大小在一年以前仅属于中端模型。如果开源替代方案能如此迅速地缩小差距,那么为闭源模型支付 API 溢价的理由就会减弱。
然而,在将这些数据视为定论之前,保持一定的怀疑态度是合理的。
这些基准测试使用了 Alibaba 的内部 agent 架构。SWE-bench Verified 测试的是真实的 GitHub 问题解决能力,但模型在该基准测试中的得分是模型本身及其周围架构(agent 如何被提示、如何处理工具故障、如何处理反馈循环)共同作用的结果。Alibaba 的内部架构很可能经过了调优,以最大化 Qwen 的性能。截至本文撰写时,尚未发布使用标准公共架构(如 SWE-agent、OpenHands 或类似架构)的独立评估结果。
基准测试的选择也由 Alibaba 决定。SWE-bench Pro、Terminal-Bench 2.0、SkillsBench、QwenClawBench、QwenWebBench、SciCode:这六个基准测试都侧重于工具使用、代码生成和 Web 交互——这些正是 Qwen 团队集中投入训练的领域。而竞争模型领先的基准测试,如 GPQA Diamond 上的形式推理任务或视觉语言工作,则未出现在 Alibaba 的对比表中。
独立评估者的真实测试呈现出更复杂的情况。一项已发布的测试将 Qwen3.6-Max-Preview 与 Claude Opus 4.7 和 GPT-5.4 在源自开发者工作流的 20 个实际编程任务中进行了对比。据报道,在官方排行榜上名列前茅的模型在需要跨多个工具调用进行迭代调试的任务中表现不佳,有记录显示该模型会重复失败的操作,而不是调整方法。基准测试性能与开发者体验并不总是完全一致。
这些都不能否定 Alibaba 的数据,而是对其进行了背景化。现代稠密模型正在缩小与更庞大的 MoE 系统之间差距的趋势似乎是真实的。具体的百分点将在独立评估框架产生结果后得到确认或修正。Qwen3.6-27B 在其尺寸级别中似乎是一款真正强大的开源权重模型。更广泛的观点是——即使旗舰模型转向仅限 API 访问,Qwen 的开源阵容依然保持着竞争力——这是一个更持久的观察结论。
竞争背景
Alibaba 的闭源决策并非孤立出现。顶尖 AI 实验室之间关于开源权重与闭源权重的争论正在重塑当下,而不同实验室所采取的立场,定义了开发者在选择 AI 技术栈时的竞争格局。
DeepSeek 在 2026 年 4 月 24 日发布了 V4 —— 就在 Qwen3.6-Max-Preview 发布四天后 —— 采用 MIT 许可证开放权重,拥有 100 万 token 的上下文窗口,且 API 定价显著低于 Alibaba 的闭源模型。与 Alibaba 同为中国实验室的 DeepSeek 在同一时刻选择了相反的方向:即使在尖端模型规模上也加倍投入开源权重。这两家最著名的中国 AI 实验室现在在开源问题上各执一端。
Mistral AI 继续在 Apache 2.0 协议下发布核心模型变体,包括 Devstral 2(编程)、Voxtral(音频)和 Leanstral(形式化证明验证)。Mistral 对 API SLA 和企业支持收费,但权重保持开放。其同类模型的 API 定价在单位 token 成本上低于 Qwen Max-Preview,这为那些已经习惯使用较小开源模型的开发者削减了专有定价优势。
Meta 的发展轨迹与 Alibaba 的举动最为相似。Meta 通过发布 Llama 开源权重系列(Llama 3、Llama 3.1、Llama 4)建立了深厚的开发者好感,随后在 4 月 8 日推出了其首个闭源模型 Muse Spark,目标直指创意和重度 Agent 工作负载。Meta 和 Alibaba 遵循的模式如出一辙:通过开源建立生态系统主导地位,一旦社区稳固,便推出专有的顶层模型。Stability AI 在关闭商业变体之前,曾对 Stable Diffusion 运行过这一策略的早期版本;现在的区别在于,这种情况正发生在尖端模型规模上。
对于当今选择模型的开发者来说,市场分化已清晰可见:开源权重模型适用于需要数据驻留、微调控制、可预测访问或本地部署的团队;闭源 API 模型则适用于愿意为基准测试顶尖性能支付溢价,且无需管理推理基础设施的团队。Qwen3.6 现在跨越了这两个阵营 —— Max-Preview 处于闭源侧,而 27B 和 35B-A3B 处于开源侧。这种双轨策略能否持续,取决于开源层级的跟进速度。
下一步计划
目前最直接的悬念是 Max-Preview 性能声明的独立验证。在第三方评估机构使用标准脚手架(而非 Alibaba 的内部技术栈)复现那六项基准测试排名之前,这些数据仍处于临时状态。之前的 Qwen 世代在独立审查下表现尚可;Max-Preview 将面临同样的流程,研究小组和评估实验室可能会在未来两到四个月内发布结果。
对于将 Qwen3.6-Max-Preview 评估为生产依赖项的企业买家而言,无论其基准测试排名如何,都有两个摩擦点会减缓其采用速度。首先是数据驻留问题:Alibaba Cloud 上的 API 基础设施将数据置于中国监管管辖范围内,这为受监管的北美和欧洲行业的组织带来了合规性不确定性。其次是供应商集中风险:闭源权重 API 产品可能会更改定价、弃用端点或面临政策限制,而开源权重自托管部署则不会面临这些问题。以前在 Apache 2.0 协议下自托管 Qwen 的组织完全没有这些顾虑,而 Max-Preview 级别同时引入了这两个问题。
从长远来看,27B 版本所体现的效率提升是更值得关注的重大进展。如果一个 27B 稠密模型如今在智能体编程任务上能与 397B MoE 前代模型相媲美,那么前沿闭源模型与最佳开源权重替代方案之间的差距缩小速度,将远快于闭源权重溢价所预期的速度。大多数工程团队并不需要 SWE-bench 上最后几个百分点的提升。他们需要的是一个能够适配其基础设施、运行可靠且能处理实际任务分布中绝大部分通用任务的模型。Qwen3.6-27B 在量化后仅为 16.8 GB,是中型工程团队可以在自有硬件上运行的模型——而这可能就足够了。
Alibaba 的双轨策略押注于闭源 Max-Preview 与开源 27B 之间的差距足够大,以维持 API 定价,并认为追求极致性能的用户会为此买单。如果开源权重模型继续保持 2024 年至 2026 年间的进步速度——且如果稠密架构在对实际工作负载至关重要的基准测试中继续超越 MoE 对手——那么这一差距可能会在 Alibaba 的定价模型做出调整之前就已消失。
就目前而言,Qwen3.6 开源版本仍然是任何尺寸级别中最强大的开源权重模型系列之一。问题在于,旗舰型号的闭源是否会改变开发者社区对 Qwen 发布的所有其他产品的评价。开源信誉是累积的。Qwen 在三年内通过近十亿次下载建立了这种信誉。Max-Preview 在多大程度上侵蚀这种信誉,取决于 Alibaba 的中端模型能否跟上那些坚持开源的竞争对手的步伐——以及开发者是会认为双层级的 Qwen 已经足够好,还是会开始寻找一个从未划定开源界限的实验室。
2026 年 AI 模型的发布速度——Qwen、DeepSeek、Meta、Anthropic 等每周都有多次重大更新——使得跟踪竞争格局的变化对于任何试图保持前沿的工程团队或研究人员来说都成了巨大的负担。如果你需要监控哪些开源权重模型值得进行基准测试、哪些 API 提供商正在调整价格,以及开源与闭源之争每周如何演变,remio 专为工程师打造 提供了一个本地优先的 AI 知识库,能够自动捕捉你的阅读和研究内容 —— 这样你就无需在每次排行榜变动时都从头开始重建上下文。
Qwen3.6 开源与闭源权重的分化讲述了一个将持续展开的故事。基准测试数据将得到独立验证。企业级应用将面临数据驻留的考验。而 27B 开源权重版本要么稳坐本次发布的焦点地位,要么被 Alibaba 发布的下一代模型悄然超越,且后者可能再次不附带权重。


