top of page

阿里巴巴的 Qwen3.8-Max 提出前沿级主张,但仍有待证明

阿里巴巴发布 Qwen3.8-Max 时声称,这款拥有 2.4 万亿参数的模型已接近全球前沿水平。该消息随后登上 Google News,但在独立测试给出定论前,其真实实力仍待验证。该模型面向编程、数据分析、长时运行的智能体以及专业工作场景。然而,与 Anthropic、OpenAI、Google 或快速发展的中国竞争对手相比,其规模比实际排名更容易核实。

这次发布并非一次常规模型更新。Qwen3.8-Max 结合了规模异常庞大的专家混合架构、托管访问服务,以及承诺推出的开放权重版本。专家混合模型会针对每个请求激活特定参数组,而不是每次都使用全部参数。

这种设计能够提升效率,但参数数量本身无法证明模型质量、速度、可靠性或运行成本。因此,核心争议在于阿里巴巴“接近前沿”的主张,与开发者能够获得的证据之间的差距。Moonshot AI 的 Kimi K3、DeepSeek V4 和 Z.ai 的 GLM-5.2 进一步加剧了竞争,因为用户可以比较它们的性能、可用性和部署条款。

Google News 放大了一个吸引眼球的标题:阿里巴巴推出了迄今最强模型。更难讲述的故事则从标题之后开始。买家仍需要基准测试细节、模型文档、稳定访问渠道、安全披露,以及来自阿里巴巴自身评测流程之外的工作负载证据。

Google News 标题没有说明的 Qwen3.8-Max 信息

阿里巴巴已经发布了可用模型,但其证据材料仍不如性能主张完整。

阿里巴巴于 2026 年 7 月推出 Qwen3.8-Max-Preview,随后将 Qwen3.8-Max 定位为面向编程和专业工作的全新旗舰模型。该公司表示,这一系统拥有 2.4 万亿总参数。它还承诺提供可下载权重,使符合条件的团队能够在阿里巴巴托管服务之外检查和运行该模型。

这属于不同的里程碑。预览端点让开发者能够使用托管服务,而开放权重发布则提供可供检查并在其他环境中部署的模型文件。两者都不会自动提供完整开放系统通常所包含的训练数据、全部源代码、评测方法,或不受限制的使用权。

阿里巴巴的 Token Plan 材料将 Qwen3.8-Max-Preview 列为适用于全栈开发和数据分析的模型。该公司的模型访问指南也将其纳入覆盖多类模型的更广泛订阅服务中。这证实了该模型存在商业使用路径,但并未说明最终版本与预览版将有何差异。

该公司称 Qwen3.8-Max 是其最强的 Qwen 模型,并将其定位为接近领先闭源系统的产品。这类比较性表述目前仍属于公司主张。当读者能够查看提示词、评分规则、模型设置、重复运行结果,以及独立评测者的结果时,排名声明才更具参考价值。

现有产品证据确立了若干实际细节。Qwen Code 已新增对预览模型的支持,公开问题报告则指出其配置了百万 token 上下文。上下文窗口是指模型在一次交互中能够处理的输入和生成文本量。

同样的报告表明,该预览版在某些配置中仅以思考模式运行。思考模式允许系统在返回答案前生成内部推理 token。这一行为很重要,因为它可能影响延迟、token 消耗、兼容性以及智能体工作流的可预测性。

一项 Qwen Code issue 记录了内部操作尝试关闭思考模式时出现的不兼容情况。由于预览版要求推理保持开启,API 返回了错误。维护者后来关闭了该问题,但这一事件说明,集成行为与模型宣传的规模同样重要。

它也提供了一个具体用例。开发者可能将 Qwen3.8-Max 接入一个编程智能体,使其读取代码仓库、规划改动、编辑文件并检查自身工作。如果上下文压缩或其他后台步骤使用了不受支持的设置,工作流可能在模型智能真正发挥作用之前就已失败。

Google News 能够推送公告及其中最醒目的数字,却无法在标题中压缩这些部署层面的差异而不丢失买家所需信息。此次发布改变了阿里巴巴的产品阵容,但其市场意义仍取决于可验证的性能和可靠的运行表现。

阿里巴巴正在给中美模型厂商同时施压

Qwen3.8-Max 通过规模、托管访问和承诺提供可下载权重的组合,向竞争对手施压。

眼前受到压力的并非某一家企业,而是整个专有前沿模型业务:供应商要求客户接受闭源系统、不断变化的模型版本和按使用量计费的访问方式,以换取高性能。

阿里巴巴提出的替代方案在战略上更具锋芒。它可以通过云产品提供托管模型,随后通过发布权重来扩大采用范围,以满足需要更大控制权的组织。这种方式一方面在分发能力上挑战美国厂商,另一方面又在开放性和开发者影响力上与中国实验室竞争。

Moonshot AI 提供了最直接的竞争参照。根据一篇美联社报道,其 Kimi K3 发布后需求旺盛,并一度令订阅服务容量承压。该报道将 K3 描述为一款拥有 2.8 万亿参数的开放模型,并指出市场对其编程能力兴趣浓厚。

发布时间很关键。阿里巴巴公布 Qwen3.8-Max 时,Kimi K3 正在吸引开发者和国际媒体关注。因此,阿里巴巴需要的不仅是更大的版本号,更需要一个让用户重新考虑应以哪一中国模型家族作为下一款智能体或编程产品基础的理由。

DeepSeek 形成了第二重压力来源。其模型发布证明,中国实验室能够凭借高能力和易于获取的分发方式吸引全球关注。这一先例改变了市场对阿里巴巴、Moonshot、Z.ai 和 MiniMax 后续每次发布的期待。

一款大型模型不再仅仅因为来自中国或与美国产品竞争而成为新闻。开发者如今期待可用端点、可下载文件、明确许可、可复现评测,以及社区部署支持。行业基准已经从惊讶转向审视。

美国厂商面临的是另一种问题。Anthropic、OpenAI 和 Google 仍可依靠集成产品、企业级控制、研究深度和成熟的开发者平台竞争。然而,每一次可信的开放权重发布,都会给买家增加一种谈判筹码。

构建文档智能体的组织可能最初选择专有 API,因为它提供可靠的工具和支持。之后,该组织可以为敏感工作负载、区域部署或成本控制测试开放权重模型。Qwen3.8-Max 无需赢下每一项基准测试,也能影响采购决策。

当开放模型已足以胜任重复性工作时,这种压力会更强。编程辅助、文档分类、信息提取、摘要和内部搜索并不总是需要最高的综合得分。它们需要可接受的准确性、可控的延迟、可预测的行为,以及适合组织需求的部署安排。

更广泛的趋势已经显现。美联社发现,美国开发者正采用中国模型处理日常专业任务,部分原因是这些系统成本更低且能力不断提升。其采用情况分析还援引 Arena 负责人的说法称,中国模型在整体能力上仍落后于美国领先者。

这一差异避免了故事被简化为单纯的区域竞争。中国模型可以在未夺得每项任务第一的情况下获得使用量。美国厂商也可以在保持综合领先的同时,将部分工作负载让给可用性或部署灵活性更佳的模型。

对阿里巴巴而言,需要作出的回应很明确:必须将发布带来的关注转化为持续的开发者使用。对竞争对手而言,回应则包括更快发布、更清晰的许可、更高效的模型,或与开发者既有工具更好的集成。

这种压力既是短期的,也是结构性的。短期关注会随每次模型发布而转移。结构性变化则是,企业买家如今预期将专有模型和开放权重选项放在一起评估,而非视作两个独立市场。

2.4 万亿参数的机制并非最终结论

Qwen3.8-Max 的意义在于,阿里巴巴正将巨大的模型容量用于智能体工作,但仅凭参数数量无法预测生产环境中的结果。

参数是神经网络内部学习得到的数值。模型利用这些数值将输入转化为预测结果。更多参数可以提升表征能力,但架构、训练数据、后训练、推理设置和工具设计也会塑造最终行为。

据报道,Qwen3.8-Max 使用了专家混合结构。在给定操作中,只有其总参数集的一部分会被激活。这使模型能够容纳远超每个生成 token 所实际使用的总容量。

总参数与激活参数之间的区别至关重要。一款拥有 2.4 万亿参数的模型,并不一定会为每个 token 执行 2.4 万亿参数运算。没有详细模型卡,读者无法仅凭标题数字确定激活参数数量、路由设计、训练配比或计算需求。

这正是该机制与阿里巴巴主张直接相关之处。该公司并非仅在训练一个更大的聊天机器人,而是在尝试构建一个能够跨越长上下文、工具调用和多个执行阶段,持续完成编程及专业任务的模型。

长上下文智能体工作会暴露普通聊天基准测试遗漏的弱点。模型可能在会话开始时理解代码仓库,却在多次编辑后失去对需求的把握;它可能调用正确工具,却处理错误返回的数据;它也可能生成准确代码,却未能验证结果。

百万 token 上下文窗口扩大了工作流一次可呈现的材料量,但不能保证模型会准确利用其中每一部分。独立测试必须衡量其在长输入中的检索能力、指令保持、推理稳定性、延迟,以及处理这些输入的成本。

阿里巴巴自身文档提供了有用的历史背景。其模型定价页面列出了早期 Qwen Max 变体所采用的不同上下文范围和思考模式。这一产品历史表明,该公司一直在迭代托管旗舰模型,而非仅发布一个孤立产品。

新模型也置于一个智能体栈中。Qwen Code 可以将模型连接到文件、shell、搜索和开发任务。阿里巴巴的集成文档列出了兼容 Token Plan 工作流的工具,包括网页搜索、代码执行、网页提取和图像搜索。

这套外围系统能够改善实际效果,但也让比较更加复杂。配备更好工具的模型,可能完成一个名义上更聪明、却使用较弱智能体框架的模型无法完成的任务。反过来,一个能力强大的模型,也可能因其运行框架错误处理上下文或工具结果而显得不可靠。

因此,开发者应当分开考察四个问题:

  • Qwen3.8-Max 能否在受控测试中生成高质量回答?

  • 它能否借助工具完成多步骤任务?

  • 它能否在长时间会话中稳定运行?

  • 团队能否在可接受的技术和法律条款下部署它?

单一排行榜很少能回答这四个问题。编程基准可能衡量代码库修复或孤立的生成任务。聊天竞技场衡量用户偏好。长上下文测试衡量模型在大规模输入中的检索或推理能力。生产试点则衡量失败率、延迟、可观测性和人工审核要求。

在“接近前沿”成为可靠的采购结论之前,阿里巴巴的模型需要在这些类别中获得证据支持。其规模足以使这一说法值得调查,但不足以让人自动接受。

这也是为什么 Qwen3.8-Max 的意义不止于模型排名。大型开放权重系统可以成为专用工具、微调模型和内部智能体的基础。但其规模也带来了小型团队无法忽视的基础设施门槛。

即使权重可供下载,运行万亿级混合专家模型仍需要专用硬件、分布式推理、内存规划和工程专业知识。对许多用户而言,云端访问仍将是更实际的路径。开放权重提升了控制权,但并不意味着部署变得简单。

更小的 Qwen 变体最终可能比旗舰模型触达更多开发者。若紧凑型模型能保留大型系统的大部分编程行为,就可以运行在更广泛的基础设施上。因此,阿里巴巴宣布的 Qwen3.8-27B 发布,也值得与 Max 模型一同关注。

其机制具有可信度:更大的总容量、选择性激活、长上下文和智能体集成。但结论仍未确定,因为每项优势都会带来新的衡量问题。

通过证据缺口解读 Qwen3.8-Max

主要风险并非阿里巴巴的说法是错误的,而是公开证据仍不足以让买家判断这些说法在哪些方面成立。

公司基准测试通常采用有利设置、精选提示词,或反映供应商设计目标的任务组合。这并不意味着它们无效,而是意味着方法论与独立复现必不可少。

早期报道重复了阿里巴巴将其与 Anthropic 旗舰模型进行比较的说法。The Information 报道称,阿里巴巴将 Qwen3.8-Max 描述为仅次于该模型,同时将其定位为可与领先美国系统相媲美。其前沿模型报道也将此次发布与 Kimi K3 及其他中国模型进行对比。

这种表述留下了若干未解问题。是哪些基准产生了这一排序?所有模型是否在相近的推理预算下测试?评估者使用的是公共端点还是内部检查点?进行了多少次试验,失败的工具调用又是如何计分的?

完整的技术报告还应区分预览版与最终模型。预览服务可能在未预警的情况下发生变化,使重复结果更难比较。如果阿里巴巴修改路由、后训练、系统提示词或推理设置,某一周的测试可能无法代表下一版本。

承诺开放的权重只能弥补部分缺口。研究人员可以检查配置文件、进行受控评估,并在自己的基础设施上测试行为。但他们仍需要训练披露、许可条款和足够的算力资源,才能复现更广泛的主张。

许可问题尤其值得关注。“开放权重”意味着训练后的参数文件可用,但并不必然允许所有商业用途、再分发方式、修改行为或部署区域。买家必须阅读最终许可协议,而不能将开放性视为二元标签。

安全团队还会提出额外问题。连接到代码库和 shell 的编程模型可能暴露密钥、执行不安全命令,或遵循隐藏在文件中的恶意指令。更大的上下文窗口可能增加一次会话中呈现的敏感材料数量。

这些风险没有一项是阿里巴巴独有的。同样的审查适用于 Anthropic、OpenAI、Google、Moonshot、DeepSeek,以及任何连接到业务系统的模型。Qwen3.8-Max 只是在模型供应商日益将智能体营销为专业同事的时刻推出。

数据治理同样影响采用。一些组织要求区域化处理、详细的保留控制、审计日志,或在私有基础设施内部部署。阿里巴巴必须说明托管和开放权重选项如何满足不同市场的这些要求。

该产品的预览状态带来了更直接的担忧。公开报道显示,开发者已经遇到与强制思考模式有关的集成异常。这些报道并不能证明存在广泛不稳定性,但它们表明模型访问和智能体兼容性需要持续测试。

开发者应测试真实工作流,而不是依赖少数令人印象深刻的提示词。一个有用的编程试点可以包括漏洞修复、测试生成、代码库导航、依赖项更新,以及从失败命令中恢复。每项任务都应在记录的设置下重复运行。

企业团队应衡量人工干预程度。一个只有在频繁纠正后才能完成任务的智能体,或许仍能帮助专家,但它不是自主工作者。无干预的成功率比吸引人的演示更能说明问题。

处理研究资料或内部文档的用户面临相关问题。模型可以总结一大批资料,却遗漏关键例外,或合并相互冲突的主张。团队需要可追溯的来源处理方式,以及从自身材料中抽取的评估集。

个人知识库可以帮助用户保留围绕生成结论的来源上下文。不过,知识组织无法纠正模型的推理错误。重要结论仍需要审查来源。

因此,怀疑立场是有限且可检验的。阿里巴巴推出了一个重要模型和一条可信的技术路线。但它尚未提供足够的独立证据,以证实其在编程、智能体、多模态工作和长上下文推理方面的每一项比较性主张。

Google News 读者应将“最强大的 Qwen”与“仅次于”视为不同表述。就自身产品家族而言,阿里巴巴对前者具有权威性。后者则需要共同测试和外部确认。

将决定这一主张是否成立的三个信号

下一阶段将由开放权重发布、独立评估和生产采用决定,依次如此。

第一个信号是承诺中的开放权重发布。阿里巴巴表示,Qwen3.8-Max 权重将与较小的 Qwen3.8 模型一同提供。读者应关注实际文件、模型卡、架构细节、许可协议、分词器、推理说明和硬件指导。

完整发布将加强阿里巴巴的地位,因为研究人员可在公司服务之外测试固定检查点。发布延迟、限制性许可或不完整文档,都会削弱 Qwen3.8-Max 为封闭前沿系统提供有意义替代方案的说法。

模型卡应回答基本技术问题。它应说明总参数量和活跃参数量、支持的上下文长度、输入模态、训练范围、安全评估、已知限制和推荐推理设置。它还应区分经验证的规格与 Qwen Code 或 Token Plan 集成中发现的产品默认设置。

第二个信号是跨不同工作负载的独立评估。读者不应依赖单一综合分数。编程、长上下文推理、工具使用、多模态理解、事实准确性和指令遵循,各自揭示不同属性。

独立测试应在可比设置下纳入 Anthropic、OpenAI、Google、Kimi、DeepSeek 和 Z.ai 模型。评估者应披露推理预算、系统提示词、工具访问、采样参数和重复运行程序。

若结果显示 Qwen3.8-Max 在多个互不相关的评估中位居前列附近,将加强阿里巴巴的主张。若模型只在精选编程任务中表现突出,它仍然有价值,但只能支持更狭窄的结论。

真实世界的漏洞报告可以补充正式测试。它们会暴露整洁基准忽视的配置要求、速率限制、工具故障和上下文行为。不过,个别报告不应被视为总体层面的证据。

第三个信号是持续的生产采用。阿里巴巴需要让开发者和企业在发布周期结束后继续使用 Qwen3.8-Max。代码库集成、推理提供商支持、微调项目、企业案例研究和稳定的服务性能,将比社交关注度更重要。

如果用户为明确工作负载替换现有前沿模型,采用将尤其具有意义。切换编程智能体、研究流水线或文档系统,会为质量和运营适配度提供比较性证据。

当采用主要依赖临时促销或好奇心时,这一信号就会减弱。下载量和试用账户衡量的是兴趣,重复的生产使用衡量的是价值。

容量同样重要。Kimi K3 的需求激增表明,一次成功的模型发布可能给基础设施带来压力。阿里巴巴运营着大型云平台,但要在长上下文中服务大型推理模型,仍会消耗大量计算资源。

稳定的响应时间和可预测的限制将支持阿里巴巴的企业论点。反复出现的访问问题会促使用户转向更小的 Qwen 变体或竞争提供商,无论基准结果如何。

监管和采购反应可能影响国际采用。组织将审查数据处理、出口管制、安全要求和区域可用性。即使技术评估很强,这些因素也可能限制部署。

因此,未来数月将检验同一故事的两个版本。Google News 版本聚焦于一个 2.4 万亿参数模型及其雄心勃勃的排名主张。生产版本则追问团队能否检查它、运行它并信任其结果。

开发者现在无需选择永久赢家。他们可以创建一套具有代表性的评估集,记录当前结果,并在权重和最终文档发布后重新运行。相同测试应至少包含一个专有前沿模型和一个易于获取的中国替代方案。

知识工作者也应采取类似方法。应在事实与例外情况已被理解的文档上测试该模型。检查它是否引用正确材料、保留不确定性,并能在长时间会话中遵循指令。

企业买家应当要求 Alibaba 为每个试点项目说明模型版本、数据条款、保留控制措施、服务限制与支持承诺。将智能体接入关键工作之前,他们还应预先建立备用模型方案。

Qwen3.8-Max 之所以受到关注,是因为 Alibaba 正将极大的规模与编程、智能体工作流及开放权重承诺结合起来。但它尚未赢得毫无争议的排名。即使其发布消息淡出 Google News,这一区别仍将十分重要。

关注发布本身,而不只是公告。随后,将独立结果与自身工作负载进行对比,并记录仍需要人工修正的环节。若 Alibaba 能提供承诺的文件、透明的文档、可复现的评估和稳定的服务,Qwen3.8-Max 将对所有前沿模型供应商形成压力。若这些环节仍不完整,该模型将成为又一个令人印象深刻的预览,其标题跑得比证据更快。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page