top of page

Alibaba Qwen3 以 27B 开源,向闭源旗舰模型施压

Alibaba Qwen3 开源了一款 270 亿参数的多模态模型,公司称其在多项编程和智能体基准测试中优于更大的前代产品 Qwen3.7-Plus。这次发布让 Qwen3.8 从托管式旗舰模型,变为开发者可自行检查、修改和部署的模型。

Qwen 团队还发布了 Qwen3.8-2.4T-A95B 的权重,这是其 Max 级服务背后的基础模型。该模型总参数量为 2.4 万亿,但每个 token 仅激活 950 亿参数。这两项发布对一种普遍假设提出了挑战:最强的智能体模型必须留在专有 API 的围墙之后。

真正的竞争并非 Alibaba 与某一家特定竞争对手之间的较量,而是开放部署与封闭访问之间的竞争。Alibaba 主张,一款实用的 27B 模型可以接近、匹敌,甚至在某些方面超越托管式旗舰模型,同时保留对权重、基础设施和数据的控制权。

Alibaba Qwen3 将托管发布转化为可下载权重

关键变化在于访问方式:Qwen3.8 不再只是基准测试图表或托管端点。

Alibaba 通过其官方 Qwen3.8 post 宣布了此次开源发布。公开的产物包括 Qwen3.8-27B,以及规模大得多的 Qwen3.8-2.4T-A95B 检查点。

较小的模型是更能立即投入使用的版本。根据其官方 27B model card,Qwen3.8-27B 是一款配备视觉编码器的稠密模型。稠密意味着推理时每个模型参数都会参与计算,不同于只激活部分组件的混合专家系统。

Qwen3.8-27B 可接收文本、图像和视频输入。其模型卡描述了对文档、科学图表、视觉界面以及小时级视频理解的支持。这使此次发布不只是又一款纯文本本地编程模型。

Alibaba 还为开发者提供了多项推理控制选项。思考模式默认开启,但应用可以将其关闭以获得直接回答。reasoning_effort 设置可调整分析深度,而 preserve_thinking 则会在多轮任务中保留先前的推理上下文。

这些控制项对智能体部署很重要,因为单次响应最快,并不总意味着工作流完成得最快。浅层推理可能带来更多重试、工具错误和纠正性轮次。Alibaba 在其部署指南中明确警告了这一权衡。

该模型原生支持 262,144 个 token。Alibaba 表示,通过长上下文扩展,其上下文可延伸至 100 万个 token。Token 是模型处理的文本单位,而上下文窗口限制了模型能够同时考虑多少材料。

这一容量可容纳大型代码仓库、文档集合、长篇视频或扩展的智能体历史记录。不过,它并不保证能在整个窗口中可靠地回忆内容。上下文大小与有效利用上下文仍是不同的衡量指标。

更大规模的发布改变了战略格局。官方 Max weights 公开了一款拥有 2.4 万亿参数的混合专家模型,其中活跃参数为 950 亿。它包含 512 个路由专家,每次计算时会激活 10 个路由专家和一个共享专家。

Alibaba 列出的该检查点原生上下文长度为 262,144 个 token,可扩展至 1,010,000 个 token。可下载模型主要面向文本,而托管的 Qwen3.8-Max 服务还包含额外的生产级功能。这些差异意味着,不能将开源检查点与托管产品视为完全相同。

两项发布均采用 Apache 2.0。该 license terms 允许商业使用、修改和分发,同时要求保留必要声明。与施加用户数量限制、用途领域条件或特殊商业门槛的许可证相比,这一条款的限制显著更少。

因此,此次发布创造了两类不同机会。Qwen3.8-27B 为规模较小的团队提供了一个可信的部署目标。Qwen3.8-2.4T-A95B 则让研究人员和基础设施公司能够接触 Alibaba 的 Max 级架构,尽管运行它需要大量硬件。

此次公告也解决了此前托管发布带来的可信度问题。Alibaba 曾表示会随后开放权重。如今同时发布两个检查点,将这一承诺转化为可供外部团队测试的可下载产物。

为什么 27B 稠密模型改变了部署方程

Qwen3.8-27B 的意义在于,其规模让无法运行万亿参数系统的组织也能触及先进的多模态智能体。

从常规计算的角度看,27B 稠密模型并不小。运行原始权重仍需大量加速器内存,而长上下文会进一步增加显著的内存压力。量化可通过以更低精度存储模型数值来降低这一需求。

不过,这一规模对本地模型社区而言已较为熟悉。现有推理项目已支持在工作站和多 GPU 服务器上运行这一类别的模型。Qwen 在发布材料中列出了对 Transformers、vLLM、SGLang 和 TokenSpeed 的兼容性。

这种兼容性缩短了从模型发布到可用应用之间的距离。开发者无需等待全新的运行时环境,就可以通过提供常见聊天和多模态接口的服务框架测试该检查点。

社区项目在发布后不久便开始公布量化版本。这些版本以牺牲部分数值精度换取更低的内存占用。早期可用性并不能证明其生产质量,但表明周边部署生态能够快速跟进。

稠密架构还带来了运营上的简洁性。混合专家模型可以在不激活全部参数的情况下提供很高的总容量,但其路由和内存需求会使服务部署更复杂。27B 稠密检查点的计算路径更可预测。

Alibaba 将这种传统部署特征与一种较新的混合架构结合。Qwen3.8 交替使用 Gated DeltaNet 模块和门控注意力层。DeltaNet 是一种线性注意力机制,旨在比每层都采用完整注意力更高效地处理长序列。

该模型使用 64 个语言层,其中重复排列 DeltaNet 和完整注意力组件。这种结构旨在保留精确检索能力,同时控制长序列的成本。多 token 预测训练模型预判多个未来 token,也可能支持更快的推测式生成。

架构本身并不能决定实际性能。服务软件、量化方式、提示格式、上下文长度和硬件拓扑都可能显著改变延迟。部署团队必须针对自身工作负载进行测量,而不能仅将模型规模视作完整的性能代理指标。

多模态设计拓宽了这些工作负载。本地系统可以在编辑代码时检查截图、读取技术文档中的图表,或跟踪录制界面中展示的变更。同一个检查点可将文本推理与视觉证据协同起来。

对于软件团队,这形成了一个具体的智能体场景:模型可接收错误报告、检查截图、搜索代码仓库、修改代码,并将新界面与原始图像进行比较。每一步所需的能力都不只是孤立的代码补全。

文档密集型组织获得了另一种选择。私有部署可以处理内部报告和视觉记录,无需将每一份输入都发送给外部模型提供商。这并不会自动使系统变得安全,但能让运营方直接控制数据路径。

长上下文强化了这一应用场景。团队可以将代码仓库或研究档案中更大部分的内容放入同一会话。可搜索的技术知识库仍可提供有针对性的检索,而非不加区分地填满上下文窗口。

这一差异很重要,因为超长提示本身也会带来成本。它们会增加内存使用、处理时间,以及无关材料分散模型注意力的可能性。即便名义上下文上限达到 100 万个 token,检索仍然有用。

因此,部署的核心问题并非 Qwen3.8-27B 是否适合每一台笔记本电脑——它并不适合。问题在于,它是否将先进多模态智能体从超大规模基础设施推向工作站和普通企业 GPU 服务器。

Alibaba 的答案是肯定的。未来几周的独立部署将决定这一答案在哪些场景中成立。

Alibaba Qwen3 基准测试让开放部署对阵封闭访问

Alibaba 自身的结果将这款 27B 模型定位为更大托管系统的直接替代方案,但最强的主张仍需外部复现。

该公司报告称,Qwen3.8-27B 在列出的所有编程基准测试中都超过了 Qwen3.7-Plus。在 Terminal Bench 2.1 上,Alibaba 报告新模型得分为 73.0,而 Qwen3.7-Plus 为 64.0。Terminal Bench 评估智能体通过命令行完成任务的能力。

在 SWE-bench Pro 上,Qwen3.8-27B 在 Alibaba 的评估中获得 61.7 分,Qwen3.7-Plus 为 57.6 分。新模型在 NL2Repo-Bench 上也达到 42.3,略高于 Qwen3.7-Plus 的 41.1。

报告中最大的差距出现在 DeepSWE 1.1 上。Alibaba 列出的 Qwen3.8-27B 得分为 42.2,Qwen3.7-Plus 为 14.2,Qwen3.6-27B 为 13.3。如此显著的跃升使独立复现尤为重要。

这一趋势不止于编程。Alibaba 报告其在长周期专业工作方面的内部基准 CoWorkBench 上得分为 70.7。Qwen3.7-Plus 得分为 65.1,而对比的 Opus 4.6 Max 成绩为 68.2。

在测试操作系统环境内计算机使用能力的 OSWorld-Verified 上,Qwen3.8-27B 的报告得分达到 84.3。Alibaba 列出的 Qwen3.7-Plus 得分为 73.3,Opus 4.6 Max 为 72.7。

该模型并未在所有对比中领先。在 Alibaba 的表格中,它落后于 Opus 4.6 Max 的项目包括 Terminal Bench、NL2Repo-Bench、GPQA Diamond 和 HLE。它在 GPQA Diamond 以及若干通用视觉评估中,也略低于 Qwen3.7-Plus。

这种参差不齐的成绩比笼统宣称全面领先更具参考价值。这款 27B 模型似乎在工具使用、软件工程和交互式视觉任务上表现最强;在广泛知识和高难度科学推理上,其优势则不那么明确。

Alibaba 的评估方法也并不一致。一些基准使用公开任务集,另一些则为内部基准。多项编程评估通过 Claude Code harness 运行,不同模型有时使用的是官方报告结果,而非完全相同的本地运行结果。

提示选择可能影响结果。例如,模型卡称 Qwen3.8-27B 在 MathVision 上使用了固定的逐步提示。其他模型则从两种提示变体中取得较高结果。修正后的基准标签也带来了与此前公开分数的另一项差异。

这些因素都不意味着结果无效。它们意味着这些表格属于厂商证据,而非最终结论。该公司提供了有价值的方法说明,但独立评估者仍需在一致的脚手架和硬件条件下复现性能。

Max 级发布进一步强化了同样的竞争论点。Alibaba 报告称,Qwen3.8-Max 在编程智能体、通用智能体和专业任务方面均较 Qwen3.7-Max 有显著提升。

据报道,其在 Terminal Bench 2.1 上的成绩从 Qwen3.7-Max 的 74.5 提升至 86.6。在 PaperBench 上,分数从 64.8 升至 93.0。在 JobBench 上,Alibaba 报告称成绩从 31.3 提升到 53.4。

然而,与其他托管旗舰模型相比,Max 模型在若干对比中仍然落后。GPT-5.6 Sol 以 88.8 领跑 Alibaba 的 Terminal Bench 表格。Fable 5 以 80.0 领跑 SWE-bench Pro,而 Qwen3.8-Max 的成绩为 67.7。

这正是核心逆转。开放权重不再意味着必须接受比托管产品落后一整代的模型。Alibaba 的数据将这些开放检查点描绘为具备竞争力的参与者,并在不同工作负载上各有优势与短板。

闭源供应商仍具备显著优势。其托管服务承担了基础设施工作,提供集成工具,并且无需客户迁移庞大的检查点即可更新模型。它们还掌控着完整的服务栈。

开放部署则提供了另一套组合。运营者可以检查文件、修改行为、构建私有端点、选择量化方法,并避免依赖单一托管 API。但同时,他们也要承担安全性、可用性、评估和优化责任。

Qwen3.8 让企业买家的这一选择变得更困难。评估闭源旗舰模型的团队如今必须思考:其性能优势是否足以弥补失去部署控制权的代价。答案将因工作负载而异,而不会遵循某个通用排名。

Qwen3.8 的这些数字仍无法证明什么

宽松的许可证和亮眼的基准测试表,并不能证明可靠性、低成本运行或安全自主性。

第一个不确定性来自独立测试。Alibaba 公布了大量分数,但多数是在模型发布时一并提供的。外部实验室尚未有足够时间,在可比的测试框架中复现完整评估集。

早期社区反馈提供了有价值的线索,但并非受控证据。一些用户报告称,其编程和视觉输出表现出色;另一些人则提到生成速度慢、推理轨迹冗长,或在量化后行为不一致。

这些报告符合该模型的设计权衡。Qwen3.8 默认启用思考,并使用最高推理设置,除非应用程序主动修改。因此,一个困难的提示词可能会在最终答案出现前产生大量隐藏分析。

降低推理强度可以改善响应延迟。Alibaba 警告称,这也可能导致错误,从而触发重试。生产团队必须衡量任务完成时间,而不只是首个生成 token 出现的时间。

内存也是另一项约束。27B 检查点在量化后更易于使用,但多模态输入和长上下文会增加内存消耗。模型能装入设备内存,并不意味着它能以实用速度处理百万 token 的提示词。

对于百万 token 的说法尤其需要谨慎。Alibaba 表示,该模型原生支持 262,144 个 token,并可扩展至一百万。扩展技术会调整位置处理方式,使模型能够接收超出其原生训练长度的序列。

能够接收并不等于能够可靠推理。开发者应测试不同位置的检索准确率、多步综合能力、抗干扰能力和输出一致性。一次成功的“针找回”演示,无法验证每一种长上下文工作流。

基准测试构建也带来了更多不确定性。QwenSWEBench、CoWorkBench、JobBench 和 RecreationBench 包含内部组件或由公司控制的评估选择。这些测试仍可能具有价值,但外部人员需要获得任务访问权限和可重复的流程。

公开基准同样存在局限。智能体结果高度依赖模型周围的脚手架。工具描述、重试逻辑、时间限制、可用命令和上下文管理,都会改变最终得分。

与闭源模型的对比又增加了一层复杂性。托管模型可以在没有可下载版本化权重的情况下发生变化。官方报告的分数所使用的系统配置,可能不同于 Alibaba 的本地评估。

开放的 Max 检查点需要单独审视。其 2.4 万亿总参数使其在原始精度下无法被大多数个人开发者使用。混合专家激活降低了每个 token 的计算量,但完整权重仍需要大量存储和内存。

量化这类模型能够降低硬件要求,不过强压缩会带来质量损失风险。当专家权重在系统内存和加速器之间移动时,也可能形成瓶颈。一个在消费级硬件上技术上能够运行的模型,依然可能慢到不具备实用性。

开放检查点与托管 Qwen3.8-Max 之间的关系,也比其名称暗示的更有限。已发布的 A95B 卡片描述的是因果语言模型。Alibaba 表示,托管 Max 产品增加了视觉输入、非思考支持、内置工具和默认百万 token 上下文。

因此,开发者应避免声称开放检查点复现了整个托管服务。它公开的是核心语言模型权重,而非所有周边能力。产品比较必须将模型行为与平台功能区分开来。

安全性仍未解决。具备终端、浏览器和文件访问能力的强大智能体,可能犯下影响重大的错误。开放权重允许部署本地安全措施,但并不提供完整的权限系统或可靠的监督层。

许可证也只能回答治理问题的一部分。Apache 2.0 允许广泛复用,但部署者仍须对隐私、安全、受监管数据和特定应用的法律义务负责。宽松的模型许可证并不是合规证书。

实际检验应是针对具体工作负载的评估。团队应使用具有代表性的代码库、文档、截图和工具环境,并衡量成功完成率、人工干预频率、延迟、资源消耗和失败严重程度。

在这些结果出现之前,最稳妥的结论应比 Alibaba 的营销措辞更为克制。Qwen3.8-27B 是一款严肃的开放模型,拥有异常雄心勃勃的多模态和智能体能力。其在真实生产工作中的全面优势尚未得到独立证实。

三个信号将决定 Qwen3.8 是否重设开放模型基线

下一阶段关乎可复现的部署,而非又一轮夺人眼球的基准测试宣称。

第一个信号是对 27B 检查点的独立评估。最有价值的测试将通过相同的智能体脚手架运行 Qwen3.8-27B、Qwen3.7-Plus 和领先的托管模型。测试还必须披露提示词、重试策略、工具权限和上下文设置。

若在 SWE-bench Pro、Terminal Bench、OSWorld 和长周期办公任务上取得一致结果,将强化 Alibaba 的论点。若在中立评估下大幅下滑,则表明发布表格高度依赖公司选择的配置。

第二个信号是实际的长上下文表现。开发者在关注百万 token 扩展之前,需要先测试原生 262K 窗口。代码库分析、法律文档综合、视频审阅和多会话智能体,比孤立的检索技巧更能提供有用证据。

成功意味着,当相关信息分散在整个提示词中时仍能保持准确性;也意味着能在可接受的内存和延迟限制内完成任务。如果质量在超过原生窗口后急剧下降,百万 token 的标签将只有有限的运营价值。

第三个信号是基础设施采用情况。vLLM、SGLang、llama.cpp、Transformers 和量化项目的支持,决定了一个检查点能否广泛可用。稳定的多模态服务与基础文本生成同样重要。

应关注优化内核、可靠的多 GPU 配置、低精度版本和一致的聊天模板。碎片化的模板或不受支持的推理控制,可能导致不同部署之间出现令人困惑的差异。

企业采用将提供相关信号。组织需要证据证明,该模型可以私密运行、保持可观测性,并与具备权限控制的工具集成。它们还需要模型在更新和量化格式变化中的可预测行为。

闭源模型供应商面临明确的应对选择。它们可以扩大性能领先优势、提高托管智能体的可靠性、降低部署摩擦,或向客户开放更多控制权。仅仅指出某项通用基准更高,无法解决所有权问题。

其他开放模型开发者同样面临压力。一款具备竞争性智能体分数的 27B 多模态检查点,抬高了人们对许可证、上下文、工具使用和视觉推理的期待。规模相近的纯文本发布,如今面向的是更狭窄的市场。

Alibaba Qwen3 最终将由完成的工作来评判。它能否修复陌生代码库、解读视觉证据,并在无需持续纠正的情况下管理扩展工作流?团队能否在自己掌控的硬件上,以可持续的速度运行它?

对于开发者而言,当前应采取的行动是严格测试。选择真实任务,记录服务配置,并比较总完成成本,而非孤立的单次响应。对于影响重大的工具操作,应保留人工审批。

对于企业买家而言,即便从不自行托管,该发布也能带来议价能力。可信的开放替代方案能在与供应商谈判时,为数据控制、可移植性和模型访问提供参照点。

更大的 Max 权重值得研究关注,但 27B 模型将决定该发布的实际覆盖范围。它与常见基础设施足够接近,使广泛的社区能够检验 Alibaba 的主张。

这个社区如今已拥有得出答案所需的工件。如果独立测试证实所报告的提升,Alibaba Qwen3 将缩小开放部署与闭源旗舰之间的距离。即使不能,该发布仍将准确揭示这一距离究竟仍存在于何处。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page