top of page

Qwen 3.8 开放权重模型公告承诺拥有 2.4 万亿参数,但证据尚待公布

7月20日
讀畢需時 17 分鐘

Qwen 宣布了一款拥有 2.4 万亿参数的模型,并承诺开放权重,但可下载版本尚未发布。Qwen 3.8 开放权重模型公告目前只是引导用户前往 Alibaba 多款产品中的托管预览版。

Qwen 表示,Qwen3.8-Max-Preview 已可通过 Token Plan、Qoder 和 QoderWork 使用。用户可以测试由 Alibaba 控制的服务,但无法检查或独立部署所承诺的模型。

其宣称的规模让这则公告难以被忽视。根据 Qwen 的发布帖,该模型包含 2.4 万亿个参数,并将很快开放权重。该帖子并未提供发布日期。

参数量描述了训练过程中学习到的可调整数值。然而,参数总量并不能说明处理每个 token 时会使用多少参数,也无法反映推理所需的硬件规模。

这一区别至关重要,因为 Qwen 尚未发布架构、模型卡、许可证、基准测试方法或独立评估结果。它在提供解读其规模所需的证据之前,就宣布了一款规模异常庞大的模型。

因此,这不仅是又一次模型预览。Alibaba 正在要求市场先通过受其控制的产品来评判 Qwen 3.8,之后研究人员才能检查这些产品背后的模型检查点。

这种做法给双方都带来了压力。专有模型提供商将面临另一个承诺开放权重的竞争对手。而 Qwen 现在必须将这则令人印象深刻的公告转化为可验证、可使用的正式版本。

Qwen 3.8 开放权重模型公告目前仍只是承诺

Qwen 3.8 已进入托管预览阶段,但公告中描述的开放权重模型仍未发布。

“预览”“可用”和“开放权重”代表不同程度的访问权限。预览版允许用户向提供商运营的基础设施发送请求。模型文件、运行环境、系统指令和更新计划均由提供商控制。

开放权重版本则会向开发者提供训练所得的模型文件。开发者随后可以在兼容的基础设施上检查、调整、量化和运行这些文件。

开放权重并不一定包括训练数据或完整的训练代码,也不保证拥有广泛的商业使用权限。这些问题取决于随附的文档和许可证。

Qwen 的公告在一则简短消息中合并了这些阶段。公告称 Qwen 3.8 正式推出,承诺很快开放权重,并立即提供 Qwen3.8-Max-Preview 的访问权限。

因此,这次预览是产品首秀,尚非某些社交媒体反应所暗示的完整发布。用户能够使用一项服务,但底层模型检查点仍由 Alibaba 控制。

该公司列出了三个首批访问入口。Qoder 专注于软件开发,而 QoderWork 面向更广泛的工作任务。Token Plan 则提供了另一种使用托管模型的方式。

这种分发方式使 Alibaba 能够提前接触实际提示词。编程会话可以揭示模型是否遵循代码仓库规范、能否编辑多个文件、正确使用工具,以及能否从失败的命令中恢复。

面向工作的会话则可以测试文档综合、结构化提取、规划和指令保持能力。这些任务往往能暴露静态基准测试题无法发现的问题。

然而,该公告遗漏了进行技术评估所必需的细节。它没有提供确切的发布时间、激活参数量、上下文限制、推理要求、训练数据摘要或稳定的模型标识符。

公告也没有解释预览版与未来公开权重是否会使用同一模型检查点。后训练、工具、系统提示词或安全层方面的差异,都可能导致两者表现不同。

2.4 万亿这一数字同样需要谨慎对待。一个总参数量为 2.4 万亿的模型,并不一定会在生成每个 token 时使用所有参数。

混合专家模型通常简称为 MoE,它会将每个 token 路由至选定的专业子网络。这种设计可以在保留庞大参数池的同时减少实际参与计算的参数量。

Qwen 尚未在上述公告中确认 Qwen 3.8 采用这种架构。结合其过往产品,MoE 是一种合理的可能性,但还不能视为既定事实。

官方 Qwen3 代码仓库同时包含稠密模型和 MoE 模型。其中拥有 2350 亿参数的 MoE 版本会在每次前向传播时激活 220 亿个参数。

这些早期规格不能直接套用到 Qwen 3.8 上。新模型需要独立的架构说明和服务配置。

在这些资料发布之前,2.4 万亿这一数字主要传达的是其宣称的总规模,并不能说明速度、内存需求、实际计算量或回答质量。

Qwen 的竞争定位同样存在这一局限。公告将该模型描述为领先系统,却没有提供评估表格或可复现的测试流程。

公告没有披露提示词、采样设置、token 预算、评判模型、数据污染控制措施或具体任务结果。独立评估者无法仅凭公告复现其排名。

目前能够得到的审慎且有依据的结论仍然意义重大:Qwen 已开放一款大型预览模型的访问权限,并公开承诺发布权重,但尚未提供验证其更广泛技术叙事所需的材料。

Alibaba 为何先将预览版置于产品之中

产品优先的预览方式让 Alibaba 能够观察真实工作负载,同时保留对模型及其周边系统的控制权。

托管部署为模型开发者带来了多项实际优势。提供商可以监控总体故障模式、调整基础设施并更新服务,而无需分发替代的模型检查点。

这种灵活性在预览阶段尤为重要。即使基准测试得分很高,模型在工具选择、长指令、结构化输出或陌生代码库方面仍可能表现不佳。

Qwen 将该模型描述为仍在持续演进。这种表述意味着用户应将预览版的表现视为临时状态,而非固定不变。

任何评估该系统的人都应该记录日期、产品名称、模型标签、提示词和设置。否则,之后的比较可能会在不知情的情况下衡量不同的预览版本。

产品集成也会影响人们对模型质量的感知。一款编程助手所包含的远不止语言模型,还可能使用代码仓库索引、检索、执行工具、上下文压缩、专用提示词和错误恢复逻辑。

因此,Qoder 中的出色结果衡量的是 Alibaba 的集成式编程系统,并不能自动证明未来公开的模型检查点在基础第三方智能体中也能实现同样效果。

反之亦然。糟糕的交互可能源于权限缺失、上下文选择不佳、速率限制或界面问题,并不一定代表模型本身存在根本性缺陷。

QoderWork 在办公任务中也引入了类似的复杂因素。文档选择、工作区权限、检索质量和应用级记忆都可能显著改变最终输出。

这使此次发布类似于专有模型提供商所采用的策略。它们经常先推出托管访问,观察工作负载并优化周边服务,之后再扩大可用范围。

关键区别在于 Qwen 对开放权重的承诺。这项承诺既能吸引追求托管便利性的用户,也能吸引希望掌控部署的开发者。

企业团队无需自行运行庞大的模型检查点,就能测试预览版。研究人员则可以等待可下载权重、推理支持、量化版本和微调方案。

当这两类用户评估同一模型系列时,Alibaba 都能从中受益。托管使用可以带来早期采用和反馈,而之后的开放版本则能扩大研究、适配和生态系统支持。

这种发布顺序也带来了营销优势。2.4 万亿的参数量让公告在复杂技术细节进入讨论之前,就拥有了一个易于传播的标题。

然而,这一策略也带来了信誉风险。由于 Qwen 将即时预览访问与未来的开放承诺绑定在一起,每一项缺失的材料都会成为相关讨论的一部分。

用户目前无法将底层模型与 Alibaba 的产品支撑体系区分开来。研究人员无法检查模型检查点、复现所宣称的结果,或衡量独立部署时的服务性能。

如果短暂预览之后紧接着发布详细资料,这种顺序会显得有条不紊。如果延迟时间过长或最终发布不完整,“即将开放”看起来就不再像一项切实的发布计划。

因此,Qwen 3.8 开放权重模型公告开启的是一个验证过程,而非完成了这个过程。Alibaba 提供了用户可以体验的产品,但尚未提供研究人员能够全面审查的模型。

开放权重对受控 API 访问构成压力

这场竞争的核心,是开放部署与完全由提供商控制的模型访问之间的较量。

一个可信的 Qwen 3.8 正式版本将为组织提供闭源模型无法给予的选择。它们可以在选定环境中运行模型、检查服务行为,并应用自定义安全措施。

开发者可以对模型检查点进行微调,或通过参数高效方法加以适配。基础设施团队可以选择自己的服务技术栈,避免依赖单一且不断变化的外部端点。

研究人员无需等待供应商保留旧版模型,就能持续研究其行为。他们还可以测试量化、路由、推理优化和针对特定领域的适配。

这些优势对于处理机密代码、内部文档、受监管记录或专业工作流的组织尤为重要。对部署的控制权可能与原始基准测试性能同等重要。

然而,开放权重也会将更多责任转移给运营方。团队必须管理硬件、安全、访问控制、监控、更新和模型服务故障。

对于一款拥有 2.4 万亿参数的模型,这种取舍尤其明显。获得下载权限并不意味着运行该模型的成本可承受或操作简单。

即使采用低精度表示,在考虑运行时开销之前,也需要大量内存。运营方还必须考虑注意力缓存、并行执行、冗余和响应速度目标。

模型架构将决定这些要求究竟有多严苛。MoE 设计可以在处理每个 token 时只激活模型的一部分,与总参数量相同的稠密模型相比,能够减少计算量。

然而,完整的专家集合可能仍需要跨集群存储并加载到内存中。当 token 在加速器之间移动时,专家路由也会带来通信方面的挑战。

稠密的 2.4 万亿参数模型将带来更棘手的部署难题,因为每个 token 的处理都需要所有参数参与。这样的模型检查点即使在技术上是开放的,对大多数独立开发者而言仍可能难以使用。

这正是为什么在部署规划中,激活参数量可能比总参数量更重要。总参数量会影响存储和内存,而激活参数量则会显著影响计算量、吞吐量和延迟。

Qwen 早期的开放版本让人们对实用的配套材料形成了期待。Qwen3 项目记录了服务引擎、量化路径、本地运行器和微调框架。

相关的 Qwen3 报告描述了参数规模从 6 亿到 2350 亿不等的模型。报告还解释了 Qwen3 如何结合思考与非思考模式。

这段历史提供了背景信息,但无法证明 Qwen 3.8 的具体情况。Alibaba 仍需独立披露新架构、部署要求和模型行为。

许可条款同样需要明确确认。Qwen3 仓库为其开放模型列出了 Apache 2.0 许可证,但不能假定尚未发布的检查点也采用相同条款。

“开放权重”描述的是对模型文件的访问权限。它本身并不能确立商业使用、再分发、微调或创建衍生模型的权利。

闭源提供商仍保有显著优势。他们可以优化专有硬件、组合多个内部模型、集中更新安全控制,并将复杂的路由机制隐藏在单一端点之后。

其客户获得的是一项可直接使用的运营服务,而非一个庞大的基础设施项目。即使可下载的替代方案表现出色,这种便利性依然具有价值。

因此,Qwen 面临的挑战远不止发布一个文件。它必须让模型在 Alibaba 自有环境之外也能发挥作用。

这意味着需要发布配置文件、分词器资源、模型文档、参考服务部署说明以及可复现的评估结果。主流推理框架的支持也将十分重要。

如果这些要素齐备,Qwen 3.8 将在控制力和适应性方面对专有模型提供商形成压力。如果部署仍局限于超大规模集群,其影响将主要集中在云服务公司和资金雄厚的实验室。

2.4T 的说法无法证明模型质量

参数规模能够吸引关注,但实际性能取决于架构、数据、训练、后训练、工具和推理设计。

参数数量曾被用作衡量模型容量的粗略指标。它依然具有参考价值,但随着架构和推理策略日益分化,模型间的比较已变得更加困难。

两个总参数量相同的系统可能具有截然不同的运行特征。一个系统可能通过稀疏路由仅激活一小部分参数,另一个系统则可能为每个 token 使用几乎全部容量。

训练数据的重要性可能不亚于模型规模。使用重复、失衡或低质量材料训练的大模型,可能不如使用优质数据训练的小模型。

后训练也会改变模型的实际行为。它教会基础模型遵循指令、使用工具、格式化输出、遵守安全防护措施,并使回答符合用户偏好。

Qwen 尚未披露 Qwen 3.8 在这些方面的信息。公告中没有提供预训练 token 数量、数据构成、专家结构、强化学习方法或后训练摘要。

读者不应直接套用前几代 Qwen 的数据。新名称和更大的参数量并不能证明其架构或训练方式具有连续性。

Qwen 发布基准测试时,也需要提供相关背景。代码能力得分可能会因执行反馈、仓库访问权限、提示词脚手架、采样设置和重试预算而改变。

当模型获得更多时间或输出 token 时,推理成绩可能有所提升。如果参与比较的系统采用不同的推理预算,结果就可能产生误导。

人类偏好评估也存在自身的不确定性。结果取决于提示词选择、评估者群体、回答长度、参与比较的版本以及展示顺序。

单一的综合得分可能掩盖巨大差异。一个模型可能在编程方面领先,却在事实可靠性、多语言任务或结构化提取方面落后。

智能体评估对应用设计更加敏感。智能体是模型与工具、记忆、检索、编排和恢复流程的组合。

Qwen3.8-Max-Preview 被集成到 Qoder 和 QoderWork 中,因此这种区别尤为重要。用户测试的是完整的 Alibaba 产品体验,而不是一个独立的检查点。

独立评估应从稳定的模型标识符开始。评估者应尽可能统一工具访问权限、token 预算、温度、提示词和重试策略。

他们应公布具体任务层面的失败案例,而不是将性能简化为一个排行榜名次。相比平均分上的微小差异,失败模式往往更加重要。

开发者需要知道 Qwen 3.8 能否在大型仓库中导航、在长时间会话中保持约束、生成安全的修改,并在工具出错后恢复。

知识工作者需要不同类型的证据。他们应测试模型能否比较文档、保留引用、追踪相互冲突的要求,并基于所提供的材料生成输出。

企业买家则需要延迟、吞吐量、结构化输出可靠性、可观测性、微调稳定性和基础设施需求等指标。

这些属性决定了模型能力能否转化为运营价值。一个系统可能能够回答高难度测试问题,却仍不适合时间敏感的生产工作流。

Qwen 现有的模型目录说明了稳定规格的重要性。已发布的模型条目明确列出了团队设计应用时所需的访问方式和上下文信息。

为 Qwen 3.8 提供类似文档,将有助于区分产品事实与公告措辞。文档应说明上下文限制、输出上限、模型版本管理、数据处理方式和弃用政策。

独立测试还应包含上下文丰富的工作,而非孤立的提示词。一个实用的模型必须能够跟踪先前的决策、源文档、会议记录和不断变化的项目要求。

这类任务能够暴露通用基准测试可能忽略的检索错误和指令遗失问题。它们还能揭示规模扩大究竟改善了最终工作成果,还是仅仅生成了更长的回答。

目前,2.4T 的说法只能表明 Alibaba 所宣称的雄心规模。它无法证明 Qwen 3.8 的排名、效率、可靠性或生产适用性。

开放权重并不意味着广泛可用

Qwen 3.8 可以在法律层面允许下载、在技术层面允许检查,却依然不适合大多数本地开发者实际使用。

存储空间和加速器内存构成了第一道障碍。开始推理之前,必须下载模型权重,将其加载并分布到各个设备上。

低精度格式通过减少每个权重所使用的比特数来减轻负担。然而,量化可能降低模型质量,还可能需要针对特定架构进行实现。

互连带宽构成了另一道障碍。大型模型通常会将计算任务拆分到多个加速器上,而这些加速器必须快速交换信息。

缓慢的通信可能抵消稀疏激活带来的收益。一个部署环境即使拥有足够的总内存,仍可能只能提供较差的吞吐量或延迟表现。

MoE 系统还会带来额外挑战。选择性路由可以减少实际激活的计算量,但运营方可能仍需确保完整的专家集合在集群中可用。

当大量 token 选择相同的专家时,不均衡的路由可能造成瓶颈。服务软件必须在保持输出质量的同时平衡工作负载。

键值缓存会进一步增加内存需求。这种缓存存储先前 token 的注意力信息,并随着上下文长度、批量大小和架构选择而增长。

因此,长上下文支持在规格表上可能颇具吸引力,但在并发使用时却会变得成本高昂。企业部署需要基于真实工作负载的测量结果。

发布后,量化将成为最重要的社区信号之一。性能良好的低精度版本可以降低内存需求,并扩大实验范围。

最终效果将取决于 Qwen 3.8 对压缩的耐受程度。某些模型组件在激进的量化设置下可能变得不稳定或损失准确性。

蒸馏提供了另一条路径。小型模型可以学习大型教师模型生成的输出,以更低的资源需求提供其部分行为能力。

蒸馏模型并不等同于教师模型。它可能丢失罕见知识、细致推理能力、多语言覆盖能力或在复杂任务中的可靠性。

开发者还必须区分可下载权重与可复现训练。发布检查点能够支持检查和运行,但不会揭示完整的数据流水线。

这也不意味着重新训练变得可行。其算力和数据需求可能依然超出几乎所有独立组织的承受范围。

法律条款可能进一步限制实际访问。组织需要获得商业部署、修改、再分发和创建衍生检查点的明确许可。

采用自托管时,安全责任也会发生变化。本地控制可以减少对外部 API 的数据暴露,但运营方必须自行管理身份验证、日志、更新和事件响应。

团队还必须应对提示词注入、不安全的工具使用、敏感输出和模型滥用。可下载的检查点并不包含托管服务所提供的完整控制措施。

这将形成一个分化的市场。大型基础设施提供商可能会优化完整模型并提供托管访问,而规模较小的团队可能会使用这些服务,或等待经过压缩的衍生模型。

框架支持情况将显示这一市场的发展速度。与 Transformers、vLLM、SGLang、llama.cpp 及相关系统兼容,将减少部署阻力。

参考配置也有助于团队估算硬件需求。如果没有参考配置,早期运营方必须通过代价高昂的实验来摸索并行策略和内存设置。

社区微调是检验实际开放程度的另一项指标。研究人员可能会针对编程、科学、多语言任务或特定行业调整模型。

如果调整成本高得令人望而却步,公开权重仍可支持研究,但提供给小型产品团队的自由度将更低。

这正是 Qwen 3.8 开放权重模型公告中的核心权衡。开放可以扩大控制权并促进竞争,而超大规模则会使实际部署能力进一步集中。

这种矛盾并不意味着此次发布毫无意义。它意味着开放权重的价值必须通过实际访问、文档、适配和运行证据来判断。

上下文丰富的工作将是更有价值的测试

最有力的评估应检验 Qwen 3.8 能否改善基于真实组织情境的完整工作成果。

许多知识型任务无法简化为单个提示词。一份实用的报告可能依赖会议记录、本地文档、客户消息、先前决策和当前项目要求。

模型必须识别相关材料,并保留不同来源之间的区别。当记录相互冲突或信息缺失时,它还必须说明不确定性。

例如,产品经理可能要求智能体起草每周更新。模型需要整合路线图变化、工程讨论、研究结果和未解决的决策。

编程智能体也面临类似的上下文问题。它必须理解仓库结构、先前的实现选择、测试、文档,以及分散在多个文件中的约束。

这些工作流测试的不只是记忆能力。它们检验模型能否在检索、分析、工具使用和最终撰写之间切换时保持原始意图。

Qoder 和 QoderWork 为 Alibaba 提供了在此类工作流中展示 Qwen 3.8 的方式。然而,独立测试必须将模型能力与产品的检索和编排层区分开来。

团队应使用固定的来源集合和可重复执行的任务。他们可以比较模型能否引用正确的证据、保留要求,并避免加入缺乏依据的说法。

最终成果比对话流畅度更重要。如果遗漏了会议记录中隐藏的某项决策,或与技术规范相矛盾,即便答案经过精心润色,也仍然是不合格的。

这正是知识系统发挥作用的地方。一个可搜索的 AI 知识库 可以跨模型版本保存源材料、提示词、输出和评估记录。

在预览版本不断变化期间,这些记录尤其有用。团队可以在检查点更新后重新运行相同任务,准确识别哪些方面有所改进或出现退步。

团队还应保留负面结果。与经过剪辑的演示相比,一份包含引用遗漏、约束失效和工具操作错误的清单,更能为采购决策提供可靠依据。

富含上下文的测试可以揭示,规模扩大究竟改善了综合能力,还是仅仅扩展了事实覆盖范围。它还可以显示,更长的推理过程究竟带来了更清晰的输出,还是造成了不必要的延迟。

Qwen 3.8 无须在每项基准测试中领先,也能体现其实用价值。它需要在足以证明其部署和集成成本合理的工作负载上,展现出站得住脚的优势。

在这些测试出现之前,Alibaba 的产品预览只能提供初步证据,而非最终结论。用户可以进行探索,但不应把令人印象深刻的演示视为独立验证。

三个信号将决定 Qwen 3.8 是否真正重要

下一阶段取决于完整发布、受控的独立评估,以及组织能够在 Alibaba 产品之外运行该模型的证明。

第一个信号是模型权重的实际发布。Qwen 需要提供带日期的检查点、架构详情、激活参数数量、分词器文件、配置、许可证和模型卡。

技术报告应在足以支持知情分析的详细程度上说明训练和评估过程。它还应明确预览版本与可下载检查点之间的关系。

正式发布会把“即将开放”转化为可验证的访问,从而强化该公告的核心主张。长期延迟则会削弱这种“预览优先”的叙事。

第二个信号是独立性能测试。评估者应在编码、推理、事实准确性、多语言任务、长上下文检索和智能体任务等方面比较稳定版本。

除了回答质量,他们还应报告延迟、token 使用量、工具访问情况和采样设置。这些控制变量有助于区分模型能力与额外推理资源带来的效果。

如果 Qwen 在多项独立评估中普遍展现出竞争力,将支持其市场定位。零星的胜出或未公开的设置,则只能支撑更有限的结论。

每项排名都应附带失败分析。团队需要查看幻觉、指令遗漏、不安全代码、错误引用和工具故障恢复失败等实例。

第三个信号是外部可部署性。该检查点需要获得常见推理框架的有效支持,提供有文档记录的硬件配置,以及可信的量化版本。

独立测量应涵盖内存占用、吞吐量、延迟和稳定性。这些结果将揭示哪些用户能够直接从模型权重中获益。

如果外部团队能够高效运行 Qwen 3.8,它将成为一个对研究和产品开发具有重要价值的平台。如果其集群要求超出大多数组织的承受范围,它的实际影响力就会受到限制。

开发者应避免仅凭社交媒体帖子就作出架构承诺。如果其现有产品与真实工作负载相匹配,测试托管的预览版本是合理的做法。

严谨的评估现在就可以开始。可以使用固定的代码库编辑任务、结构化提取任务、基于来源的问题、长指令,以及有意设计的工具故障。

记录提示词、输出、日期、模型标签和应用设置。在模型权重发布后重复运行这组任务,就能判断公开模型是否与预览体验一致。

Qwen 3.8 开放权重模型的公告值得关注,因为它将前沿规模的雄心与提供可下载访问的承诺结合在了一起。这两个目标往往彼此牵制。

未来几个月应该会揭示 Alibaba 能否让二者保持一致。发布权重将证明可访问性,独立评估将证明能力,而外部部署将证明它是否真正提供了切实可行的选择。

目前,应将 Qwen 3.8 视为一个附带重大承诺的实时预览版本。用你自己的富上下文工作对其进行测试,保存相关证据,并等待检查点发布后再作出最终判断。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page