top of page

阿里巴巴发布其规模最大的 AI 模型,但规模并非真正的考验

8月28日
讀畢需時 13 分鐘

阿里巴巴凭借一个惊人的数字将 Qwen3.8-Max 推上 google news:2.4 万亿参数,是其上一代旗舰模型规模的两倍以上。该公司将这一预览版称为迄今规模最大的模型,并表示其排名仅次于 Anthropic 的 Fable 5。这一比较让一次产品发布演变为对“美国实验室仍处于独立技术层级”这一观点的直接挑战。

参数数量足以吸引目光,但并不能决定胜负。阿里巴巴尚未为其排名主张提供完整的公开基准测试表、详细模型卡或可由独立方复现的评估。因此,Qwen3.8-Max 既是一项技术里程碑,也是一场尚未完成的论证。

更重要的竞争是阿里巴巴与 Anthropic 之间的较量,而非中国与整个美国的对抗。Anthropic 的定位建立在编程、推理和长时间运行的智能体任务中的可靠前沿表现之上。阿里巴巴则主张,中国模型能够进入同一性能区间,同时支持更广泛的部署策略。

即使所有基准测试尚未公布,这一主张对开发者和企业买家也意义重大。一个可信的替代选项会改变供应商谈判、部署规划,以及人们对前沿模型来源的判断。它也提出了一个更棘手的问题:超大模型规模能否转化为受控演示之外可靠的实际工作能力?

阿里巴巴以 2.4 万亿参数迎来其 google news 时刻

Qwen3.8-Max 改变了竞争格局,因为阿里巴巴将其定位为前沿系统,而非区域性替代方案。

阿里巴巴于 2026 年 7 月在上海世界人工智能大会期间预览了 Qwen3.8-Max。该预览版通过包括 Token Plan、Qoder 和 QoderWork 在内的阿里巴巴产品提供,使部分用户能够开始测试。

据阿里巴巴介绍,该系统拥有 2.4 万亿总参数。参数是训练过程中调整的内部数值,但其总量并不能直接衡量智能程度或可靠性。尽管如此,这一庞大数量仍使 Qwen3.8-Max 成为已公布的最大语言模型之一。

该模型采用混合专家架构,即 MoE。这一设计会将每项请求路由至网络中的特定部分,而非激活全部参数。据报道,阿里巴巴在推理时仅激活约 950 亿参数,因此其总规模在计算上并不像初看时那样令人生畏。

这一架构也说明了为何参数比较需要谨慎。稠密模型会在每次请求时激活整个网络,而 MoE 系统则激活选定的专家。仅比较总参数量,可能掩盖训练数据、活跃计算量、推理设计和后训练质量方面的差异。

Qwen3.8-Max 还是一个多模态模型。阿里巴巴称,它可通过同一模型处理文本、图像、视频和文档。这让此次发布不只是一次文本模型扩展,也使其进入了工作场景智能体市场。

新模型紧随 Qwen3-Max 之后,后者由阿里巴巴于 2025 年 9 月推出,参数量超过一万亿。阿里巴巴称,该早期模型使用 36 万亿 token 训练,其 MoE 训练系统较 Qwen2.5-Max 将硬件利用率提高了 30%。

阿里巴巴已发布的 Qwen3-Max 成绩包括 SWE-bench Verified 的 69.6 分和 Tau2-Bench 的 74.8 分。SWE-bench Verified 用于评估模型能否解决真实软件问题,Tau2-Bench 则测试其在模拟交互中的工具使用能力。

这些数据并不会自动适用于 Qwen3.8-Max。但它们表明,阿里巴巴在扩大模型规模之前,已经将目标瞄准了编程和智能体行为。Qwen3.8-Max 将这一战略延伸至多模态专业工作场景。

早期报道将这一新系统描述为预览版,而非拥有完整文档的正式发布。一个 模型预览报道称,阿里巴巴计划在之后发布权重。这一区别很重要,因为通过托管产品获得访问权限,无法像下载权重和完整技术文档那样接受同等程度的审查。

这正是为什么 google news 标题只讲述了故事的一半。阿里巴巴披露的信息足以确立其规模和目标市场,但尚不足以以同等信心确定该模型的实际定位。

此次发布令 Anthropic 的前沿溢价承压

阿里巴巴不必在所有领域击败 Anthropic,也能削弱“前沿性能属于少数美国公司”的既有假设。

Anthropic 是最明确的对手,因为阿里巴巴选择将其作为参照点。该公司表示,在相关比较中,Qwen3.8-Max 仅位于 Anthropic 领先模型 Fable 5 之后。因此,阿里巴巴希望买家将 Qwen 视为接近同级的竞争者,而不只是低成本替代品。

这种表述从三个方面给 Anthropic 带来压力。首先,它缩小了市场感知中两家公司之间的能力差距。其次,它为全球开发者的编程和智能体工作流提供了另一个模型家族。第三,它将部分采购决策从绝对性能转向部署控制权。

Anthropic 仍拥有重要优势。它具备成熟的开发者平台、广泛的生产环境使用基础,以及围绕模型安全建立的声誉。企业客户评估的也不只是基准分数,还包括支持服务、正常运行时间、安全控制和集成质量。

阿里巴巴则拥有另一组资源。它运营着中国最大的云服务商,服务庞大的企业客户群,并可通过云服务、编程、商业和消费产品分发 Qwen。这种分发能力无需等待独立应用生态的形成,就能将模型改进转化为实际使用。

这种战略差异在编程领域尤为明显。当模型能够检查代码仓库、调用工具、执行测试,并在多个步骤中保留决策时,编程模型的价值就会更高。一次出色的回答,并不能说明模型能否完成一项漫长的工程任务。

Qwen3.8-Max 通过阿里巴巴的编程环境 Qoder 瞄准这一工作流。如果模型能在其中稳定运行,阿里巴巴便可以从真实开发会话中收集反馈,并围绕具体失败模式改进系统。产品本身成为训练与分发闭环的一部分。

Anthropic 也通过智能体式编程工具追求类似机会。这让竞争变得比关于国家 AI 领导地位的泛泛讨论更加具体。两家公司都希望自己的模型成为专业软件工作中的推理层。

阿里巴巴同样有动力在可访问性上展开竞争。中国模型开发者因发布开放权重、支持通用接口和降低部署门槛而受到关注。对于需要本地控制权的企业而言,这些选择的重要性可能超过微小的基准领先优势。

Qwen 生态系统已经具有显著覆盖面。Forbes 此前报道称,阿里巴巴的 Qwen 服务拥有超过 9 万家企业用户,并将该公司描述为中国领先的 AI 代表企业。其 开放模型分析还指出,中国开发者正通过开放分发建立全球影响力。

即使买家最终选择 Anthropic,一个接近前沿且部署灵活的模型也能赋予他们议价能力。采购团队可以比较供应商、测试工作负载的可移植性,并避免将所有工作流围绕单一专有端点设计。

这并不意味着会立即出现迁移。更换模型可能改变输出质量、安全行为、工具调用和提示词要求。企业在向新供应商发送敏感数据前,也需要进行法律审查。

因此,眼下的压力主要体现在商业和战略层面。Anthropic 必须证明其性能、可靠性和治理能力为何值得其市场地位。阿里巴巴则必须证明,其规模能够转化为稳定成果,而不只是引人注目的规格参数。

Qwen3.8-Max 以规模挑战前沿层级

核心机制是稀疏扩展:阿里巴巴能够构建一个拥有 2.4 万亿参数的网络,却无需在每次请求中激活整个模型。

混合专家模型包含专门化的子网络,通常称为专家。路由系统会为每个 token 选择有限数量的专家。这使网络能够容纳更多学习能力,同时不必承担稠密模型全部的推理成本。

这一架构并非阿里巴巴独有。它在这里的重要性,来自阿里巴巴对其进行的大规模扩展。据报道,Qwen3.8-Max 结合了 2.4 万亿总参数与推理时约 950 亿活跃参数。

这一比例使阿里巴巴能够宣传非同寻常的总规模,同时将每次响应维持在更可控的计算范围内。这本身并不意味着推理成本低廉。内存、加速器之间的通信、上下文长度和服务需求仍会影响最终成本。

稀疏扩展也可能带来技术复杂性。路由器必须高效地在专家之间分配工作,这些专家也必须学习到有用的专门能力。糟糕的路由可能导致部分组件过载,而其他组件贡献有限。

阿里巴巴已连续数代 Qwen 模型致力于解决这一问题。其 Qwen3-Max 文档描述了一种全局批次负载均衡损失机制,以鼓励训练期间更均衡地使用专家。文档还介绍了一套旨在提升大型硬件集群训练效率的流水线系统。

该公司称,Qwen3.8-Max 聚焦于编程和专业协作任务。在此语境下,协作指的是 AI 系统与人共同完成多步骤工作,而不是只生成一次孤立回答。这类任务可包括检查文件、使用软件工具、修订计划和核查结果。

多模态输入拓展了这些工作流。开发者可以要求模型检查设计图像、阅读规格说明、分析源代码并准备实施计划。商业分析师则可以在一项任务中结合文档、图表和录制材料。

这些例子是合理的应用场景,而非可靠性能的证据。模型必须保持上下文、正确选择工具,并从错误中恢复。它还必须能够区分指令与文档中的不可信内容。

这一规模机制帮助阿里巴巴参与竞争,但并未消除中国的硬件限制。出口管制限制了部分先进 AI 芯片的获取,迫使中国实验室从现有算力中挖掘更多价值。高效架构、优化训练系统和开放分发已成为战略性回应。

一项 中美 AI 评估将算力列为推动模型进展的主要因素,也是美国持续占优的领域。这一限制使阿里巴巴的模型规模值得关注,但仅凭规模几乎无法说明其背后的硬件、训练时长或效率。

中国更广泛的模型市场同样值得关注。DeepSeek 证明,中国实验室能够通过效率和开放访问迫使全球竞争对手作出回应。此后,Moonshot AI 和 Z.ai 也推出了聚焦推理、编程和智能体的强大模型。

据报道,Moonshot 的 Kimi K3 拥有 2.8 万亿参数,总参数量超过 Qwen3.8-Max。强劲需求导致算力紧张后,Moonshot 不得不暂停接受新订阅。这一事件表明,成功开发模型并不意味着具备充足的服务基础设施。

一份 AI 算力报告援引 Omdia 分析师 Lian Jye Su 的说法称,Kimi K3 对计算资源提出了沉重要求。这段经历为 Alibaba 提供了警示:即使模型吸引用户,可用性和持续吞吐能力也可能成为竞争限制。

Google 新闻的叙事称,中国正在缩小差距,因为其模型正变得更大、更强。更有力的解读是,中国开发者如今正通过多种协同机制竞争:稀疏架构、激进的发布节奏、开放分发,以及更低的部署门槛。

因此,Alibaba 的规模声明是其累积工程能力的一个信号。真正的关键在于,该公司能否在庞大的云和产品网络中训练、服务、分发并持续优化该模型。

2.4 万亿参数声明并不能证明什么

Alibaba 已将 Qwen3.8-Max 确立为一个值得认真看待的模型候选者,但尚未证实预览版本宣传中的完整性能排名。

最大的不确定性在于评测透明度。Alibaba 声称该模型仅落后于 Fable 5,但尚未提供包含分数、提示词、竞争对手设置和测试方法的完整公开基准表。缺少这些细节,外部研究人员无法复现这一排名。

模型排名高度依赖评测选择。一个系统可能在科学问题上领先,却在编程上落后;它可能在单轮测试中表现出色,却在长时间智能体运行中丢失上下文。

即使基准名称也可能掩盖实现差异。工具权限、采样设置、上下文限制、重试机制和智能体脚手架都会影响结果。公平比较需要一致的条件与清晰的披露。

“预览”标签也带来另一项限制。供应商往往会在预览版与正式发布之间修改模型。这些调整可能改善行为,但也会使早期评测难以与最终系统比较。

通过 Alibaba 产品提供的访问让测试者获得了有用的使用渠道,但托管访问并不会公开底层权重。研究人员无法完整检查架构、评估本地部署,或仅通过端点验证所声称的激活模式。

Alibaba 计划发布权重,这将弥补部分缺口。开放权重让研究人员和公司能够在独立条件下运行模型。但它们不会揭示训练数据,也无法复现原始训练过程,因此并不等同于完全开放。

部署需求也带来另一个问题。一个激活约 950 亿参数的模型仍然规模庞大。在本地运行它需要专用基础设施、量化或分布式服务,尤其是在工作负载使用长上下文或多模态输入时。

因此,开放权重对云服务商和设备完善的组织更有利,而非普通桌面用户。较小的 Qwen 变体仍更适合本地实验。旗舰模型的更广泛影响,可能来自微调方法、蒸馏模型和托管服务。

安全评测同样需要关注。多模态智能体可能会遇到嵌入文档、图像和网站中的恶意指令。能够操作工具的模型,必须在维持对合法材料有用访问的同时抵御这些指令。

数据治理使国际采用变得更复杂。企业必须考虑提示词在哪里处理、日志如何保留、哪些信息会用于训练未来系统,以及适用哪些国家的规则。技术能力无法回答这些问题。

批评者还质疑,基准测试上的趋同是否反映了等同的生产质量。一个模型可能在公开测试中追平领先者,却在异常请求、长会话或任务描述不清时可靠性较低。这些失败只有通过持续使用才会显现。

围绕 Qwen3.8-Max 的公开讨论已包括早期测试中出现推理循环的报告。这类轶事可以指出潜在问题,但不能证明存在普遍性的失败模式。仍需要跨越大量任务的可复现测试。

反过来,精心打磨的演示同样无法证明普遍可靠性。供应商可以挑选成功任务、剪辑演示内容,或使用私有脚手架。买方应将热情的演示和孤立的失败都视为评估的起点。

Alibaba 早期 Qwen3-Max-Thinking 的结果说明了这种复杂图景。该公司报告称,其模型在知识、推理、搜索、编程和工具使用方面取得了有竞争力的分数;同时也报告称,在某些特定智能体和长上下文测试中,它落后于部分竞争对手。

这种差异是正常的。没有任何模型能主导所有工作负载,而综合排名会压缩有意义的差异。在 Qwen 和 Anthropic 之间做选择的公司,应测试那些决定实际业务价值的任务。

对于软件团队,这些任务可能包括修复内部代码、审查拉取请求、调用私有工具,以及遵循代码库惯例。对于分析师,这些任务可能包括从文档中提取主张、协调相互矛盾的来源,以及生成可审计的摘要。

延迟、错误恢复和一致性应与准确性同等重视。一个模型若只能成功解决一次困难任务、却会不可预测地失败,其监督成本可能高于能力略逊的替代方案。

中国的模型进展也处于更广泛的政治和安全争议之中。一些政府和公司会基于数据访问、审查和供应链依赖等担忧看待中国 AI 服务。无论模型质量如何,这些担忧都可能限制其采用。

与此同时,仅仅因为 Qwen 的来源就否定它,也会掩盖其技术和商业影响。开发者可以研究开放发布内容、比较架构选择,并利用竞争压力向所有供应商争取更好的条件。

恰当的结论应比 Google 新闻的叙事更为谨慎。Alibaba 已推出一款在规模、多模态范围和分发能力上都值得认真评估的模型。它所声称的全球层级位置,仍是等待更充分证据支持的公司主张。

三个信号将显示 Alibaba 是否缩小了差距

下一阶段将由独立测试、开放权重发布,以及 Alibaba 能否满足持续的真实世界需求来决定。

第一个信号是完整的技术发布。Alibaba 需要发布一份模型卡,其中包含架构细节、上下文限制、安全测试、基准设置和已知限制。若能发布承诺的权重,这些披露将更具价值。

如果这一切发生,独立研究人员就可以使用标准化测试框架和工作负载来测试 Qwen3.8-Max。若结果复现 Alibaba 的排名,将强化前沿差距正在缩小的主张;重大差异则会削弱这一主张。

第二个信号是其在长时间运行的编程和智能体任务上的表现。单轮基准仍然有用,但最有价值的企业工作负载涉及规划、工具、文件和反复修正。多步骤过程中的可靠性,将区分有能力的助手与可靠的智能体。

开发者应关注类似 SWE-bench 的评测、工具使用测试和受控代码库试验。他们还应考察完成率、不必要的操作、从工具错误中恢复的能力,以及所需人工监督的程度。

这一信号直接检验 Alibaba 所选择的、与 Anthropic 竞争的领域。如果 Qwen3.8-Max 能在持续性的专业工作中与 Anthropic 匹敌,市场将获得一个可信的第二选择;如果它在更长的会话中失去连贯性,其参数量的重要性将降低。

第三个信号是在不出现算力崩溃的情况下实现生产环境采用。Alibaba 必须证明,随着需求增长,它能够在 Qoder、Model Studio 和其他产品中可靠地提供该模型服务。延迟、可用性、区域访问和速率限制都将至关重要。

Moonshot 在 Kimi K3 上的经历表明,不能把这项测试视为常规问题。发布后不久,需求便压垮了算力,迫使该公司限制新订阅。如果客户无法依赖访问,一个模型就无法对成熟供应商形成压力。

Alibaba 的云资源比初创公司更强,但 Qwen3.8-Max 的需求也很高。多模态输入和智能体工作流可能比简短聊天请求消耗更多算力。真实部署将揭示稀疏激活是否足以抵消这些需求。

更广泛的市场数据支持这样一种观点:价格和部署控制正变得核心。一项近期的模型比较发现,在部分场景中,领先的中国系统与美国领先者的基准差距仅为数个百分点,同时成本差异显著。

这类比较会随工作负载和供应商而变化,因此不应被视为普遍结论。但它们确实说明,为何接近前沿的性能可能产生不成比例的影响。一个模型不必排名第一,也能重塑采购决策。

竞争对手的反应将提供更多背景。Anthropic 可以通过更强的模型、更好的智能体、更清晰的安全控制和更可靠的企业服务来捍卫其位置。OpenAI、Google、DeepSeek、Moonshot 和 Z.ai 也将持续改变参照标准。

Alibaba 面临同样艰巨的任务。它必须将一次引人注目的发布转化为可复现的能力、可访问的部署和持续的模型改进。每一项要求都在考验公司战略的不同部分。

对开发者而言,实际的应对方式是现在就构建一套针对具体工作负载的评测集。应包括困难任务、常规任务、长会话、工具失败以及敏感数据约束。应针对这套评测集测试模型变化,而不是依赖单一公开排行榜。

企业买方应尽可能保留可移植性。通用 API 格式、模块化检索系统和供应商中立的评测日志,可降低比较模型的成本;它们也能防止一次早期选择演变为永久依赖。

知识工作者应关注这些系统如何处理混合证据。多模态模型可以从更多格式中收集信息,但更广泛的输入并不保证更好的判断。当模型输出影响决策时,来源追踪和验证仍然必要。

因此,Alibaba 出现在 Google 新闻中值得关注,但标题不应成为结论。Qwen3.8-Max 扩大了中国前沿模型努力的规模与雄心。用于为其排名的证据仍在陆续出现。

在未来几个月,关注 Alibaba 是否发布承诺的权重、能否经受独立智能体测试,以及能否在没有重大限制的情况下满足增长中的需求。这三项结果比“2.4 万亿参数”的标题更能说明问题。如果它们一致,Anthropic 将面对一个采用不同分发模式的近似同级对手;如果并非如此,Qwen3.8-Max 将仍是一款令人印象深刻的预览模型,其最大主张跑在了公开验证之前。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page