Alibaba发布Qwen2.5-Max,DeepSeek重塑AI竞赛格局
- Sophie Larsen

- 8月4日
- 讀畢需時 12 分鐘
Alibaba宣称其新模型击败DeepSeek-V3及多款知名美国系统后,Qwen2.5-Max迅速成为Google News关注的焦点。这款模型于2025年1月发布,恰逢中国AI领域竞争异常激烈的一周。DeepSeek刚刚迫使整个行业重新思考:一款具备竞争力的模型究竟需要多少算力和资金投入。
这场交锋的重要性远不止Alibaba在排行榜上的位置。Qwen2.5-Max代表一家大型云服务提供商,对一家已经夺取全球叙事主导权的较小竞争对手作出的回应。Alibaba选择在农历新年假期期间发布该模型,这一不寻常的决定凸显了DeepSeek带来的紧迫感。
该模型也检验了一个更广泛的命题。Alibaba能否将庞大的基础设施、企业分发能力和大型开发者社区,与DeepSeek所推广的效率优先方法结合起来?其基准测试结果给出了初步答案,但尚不足以下定论。
Alibaba实际发布了什么
Qwen2.5-Max是Alibaba对一个突然围绕DeepSeek效率叙事重组的AI市场所作出的直接回应。
Alibaba将Qwen2.5-Max定位为一款大规模混合专家模型。混合专家系统会针对每项请求激活网络中的部分模块,而非同时调用所有参数。这种设计能够在保留大型模型能力的同时,降低训练和推理所需的计算资源。
该公司表示,Qwen2.5-Max在超过20万亿个token上完成预训练。Token是模型为处理文本和其他输入而进行切分的基本单位。随后,Alibaba采用了监督微调和基于人类反馈的强化学习,利用经过筛选的示例和人类偏好来调整模型行为。
官方模型公告将Qwen2.5-Max与DeepSeek-V3、OpenAI的GPT-4o、Meta的Llama 3.1 405B以及Anthropic的Claude 3.5 Sonnet进行了比较。Alibaba报告称,Qwen2.5-Max在Arena-Hard、LiveBench、LiveCodeBench、MMLU-Pro和GPQA-Diamond上的表现尤为突出。
这些评测覆盖不同能力。MMLU-Pro衡量广泛的学术知识和推理能力。GPQA-Diamond采用由领域专家编写的高难度科学问题。LiveCodeBench则根据近期发布的问题评估编程能力,从而降低测试题曾出现在训练数据中的可能性。
Arena-Hard使用自动化评判来比较模型对高难度提示的回答。LiveBench同样会持续更新题目,以限制数据污染——即基准测试材料进入模型训练集的情况。没有任何单一测试能够反映模型在实际业务工作流中的可靠性。
Alibaba通过Qwen Chat以及Alibaba Cloud上的应用程序接口提供Qwen2.5-Max。API使开发者能够将模型接入自己的软件。与许多Qwen版本不同,Alibaba在发布时并未公开可下载的Qwen2.5-Max权重。
这一区别很重要。开放权重让组织能够在自有基础设施上检查、修改和运行模型。托管模型则将底层参数置于提供商控制之下,客户必须通过服务访问它。
因此,此次发布将面向效率的架构与传统云分发策略结合起来。开发者可以快速测试模型,但无法独立审查其完整构造,也无法复现Alibaba的训练过程。
首轮Google News报道强调了Alibaba关于Qwen2.5-Max超越主要竞争对手的主张。更具长期意义的发展则在于战略层面:Alibaba正借助其最受瞩目的模型将工作负载引向自家云服务,而不是把所有资产都以不受限制的方式开放给本地部署。
DeepSeek为何迫使Alibaba行动
DeepSeek将竞争问题从谁能打造最大模型,转变为谁能以更少的受限资源提供可信智能能力。
DeepSeek于2024年12月发布V3,并在2025年1月推出专注推理的R1系列。R1因将强劲的报告性能、开放模型权重和宽松许可证结合在一起而受到广泛关注。
该公司的V3技术报告描述了一款拥有6710亿参数的混合专家模型,每个token激活其中370亿参数。DeepSeek称,完整训练过程使用了278.8万小时的Nvidia H800 GPU算力。
这一披露为开发者提供了一个异常详细的参考点。它并未涵盖研发、数据、实验、人员或基础设施相关的全部成本。不过,它仍推动了人们将其与美国前沿实验室相关的、更为庞大的支出计划进行比较。
DeepSeek的时机加剧了压力。其面向消费者的助手攀升至应用排行榜前列,投资者也开始重新评估有关算力需求和美国AI领导地位的假设。这种关注远远超出了模型开发者群体。
Alibaba在数日内作出回应。根据一份1月报道,其云业务部门表示,Qwen2.5-Max在几乎所有列举的比较中都优于GPT-4o、DeepSeek-V3和Llama 3.1 405B。
这样的表述很容易催生简单的胜者与败者式标题。其背后的比较却更为复杂。DeepSeek-V3是聊天和编程场景的通用基础模型,而R1则强调延展性推理。Qwen2.5-Max在多项测试中直接与V3竞争,但它最初并未被定位为Alibaba对R1完整推理路线的回应。
Alibaba的公告对训练成本和模型规模披露得也较少。它介绍了架构和训练规模,却没有发布可与DeepSeek V3论文相媲美的完整技术报告。读者可以比较基准分数,却无法比较其背后的完整效率画像。
这形成了一种不对称。Alibaba希望与DeepSeek进行性能比较,而DeepSeek最具影响力的优势则涉及透明度和经济性。赢得某项精选基准测试,并不能自动终结更重要的争论。
假期发布进一步强化了这一印象。中国大型科技公司很少会在商业活动放缓的时期安排重要产品发布。Reuters将这一时机描述为DeepSeek对既有竞争者施加压力的证据。
Alibaba有充分理由迅速回应。它运营着中国最大的云计算业务之一,并已将Qwen定位为重要的开发者平台。若让DeepSeek定义市场预期,可能削弱Alibaba的模型品牌及其云服务主张。
这一回应也表明,DeepSeek已成为中国AI领域的参照点。Alibaba不再只需要追赶OpenAI、Anthropic、Google或Meta,还必须捍卫自身地位,应对一家分发能力较弱却势头非凡的本土实验室。
Google News标题无法终结基准测试之争
标题中的主张很容易复述,但Alibaba的证据并未证明其对DeepSeek或美国模型具有普遍优势。
当研究人员公开清晰的方法、提示词、模型版本和评测设置时,基准测试结果很有价值。当供应商只挑选有利测试,或为每个竞争对手采用不同配置时,其可靠性就会下降。
Alibaba的发布图表纳入了多项受到认可的评测。然而,它并未涵盖生产环境中重要的所有能力。它也部分依赖自动化评判,而自动化评判可能偏好特定回答风格,或难以识别细微的事实错误。
分数上的微小差异尤其需要谨慎对待。它们可能因提示词措辞、采样设置、系统指令或评测软件而变化。微弱领先不应被视为决定性的技术鸿沟。
模型名称也进一步增加了比较难度。提供商会更新托管系统,而不一定更改其公开品牌名称。针对某一版本GPT-4o或Claude 3.5 Sonnet进行的基准测试,数周后可能已无法描述可用版本。
数据污染带来另一项不确定性。如果模型的训练数据包含基准测试题目或高度相关的问题,其表现可能会更好。实时评测尝试通过添加新材料来降低这种风险,但没有任何流程能完全揭示专有训练数据集。
因此,独立测试至关重要。Alibaba自己的结果为进一步研究Qwen2.5-Max提供了可信理由,但并未证明它对每位开发者、每种语言或每个工作流而言都是最佳模型。
面向用户的比较让这一差异更加清楚。擅长学术问题的模型,仍可能在工具调用、长文档、事实一致性或严格输出格式方面表现不佳。编程基准测试的提升,也未必能转化为在大型软件仓库中进行安全修改的能力。
语言覆盖引入了另一项变量。Qwen模型历来同时面向中文和英文使用场景。其表现可能因语言、方言、技术领域以及以英语为中心的基准测试几乎无法衡量的文化特定问题而有所不同。
安全行为也会影响表面上的质量。一套谨慎的系统可能会拒绝某项请求,而另一模型会尝试回答。即便拒绝体现的是经过审慎设计的安全政策,排行榜仍可能对尝试作答的回答给予更高评价。
独立报道捕捉到了这种不确定性。后续一篇行业评估指出,关于Alibaba模型的信息仍然有限,且由供应商主导的测试只能提供初步证据。
这并不意味着Alibaba的结果毫无意义。该公司表明,Qwen2.5-Max有资格与国际上知名的模型进行严肃比较。它也证明,尽管获取先进芯片受限,中国实验室仍能以快速节奏发布具竞争力的系统。
恰当的结论比许多Google News标题所暗示的更为克制。根据Alibaba披露的证据,Qwen2.5-Max是一名可信的前沿竞争者。它对DeepSeek、OpenAI、Anthropic或Meta具有普遍优势的说法,仍未得到证明。
评估此类主张的开发者需要进行与任务相关的测试。他们应利用具有代表性的内部材料,衡量准确性、延迟、结构化输出、工具使用、故障恢复和语言表现。
一个可搜索的AI知识库可以帮助团队在评估过程中保存提示词、输出、源文件和审核者备注。关键在于建立可重复的记录,而不是依赖发布当天的印象。
Alibaba的优势在于分发,而非单一排行榜
如果Qwen2.5-Max能够强化其云计算、商业和企业软件业务,Alibaba并不需要在每一项基准测试中获胜。
DeepSeek最初最强的优势来自开发者热情。其开放权重发布使工程师能够下载模型、检查其行为、对其进行微调,并通过独立基础设施部署。
Alibaba则以更广泛的商业基础进入市场。它可以将Qwen接入云计算、数据服务、办公软件、在线零售、物流和客户支持系统。这些渠道让它拥有更多机会将模型使用转化为持续性需求。
这张主要竞争对手图谱揭示了此次发布背后的格局。DeepSeek 代表的是一个效率优先的实验室,其透明度吸引了全球关注。Alibaba 则代表了一家能够将模型与部署所需基础设施和服务打包提供的一体化供应商。
两条路径都不能保证成功。开放模型可以迅速扩散,却未必能形成具备可持续竞争力的云业务。一体化平台可以创造收入,但客户可能不愿依赖单一供应商。
Qwen2.5-Max 处于这一分野中的一体化阵营。Alibaba 通过 Model Studio 提供托管访问,并在 Qwen Chat 中提供该系统。客户获得了更便捷的部署方式,而 Alibaba 则保留了对模型权重和运行环境的控制。
Alibaba 同时维持着庞大的开放 Qwen 产品组合。这一双轨策略使公司能够利用较小或较早期的模型吸引开发者,再将部分高端能力保留给托管服务。
随着 Qwen 的扩展,这种平衡变得愈发重要。2025 年 4 月,Alibaba 发布了 Qwen3,包括稠密模型和混合专家模型变体。Qwen3 发布引入了混合推理功能,让用户可以在更快的响应与更审慎的处理之间切换。
此次发布表明,旗舰标签的有效期可能非常短。Qwen2.5-Max 在发布时代表 Alibaba 最先进的通用模型,但后续的 Qwen 系统改变了性能和部署的格局。
模型领导地位的短暂并不会削弱一次发布的价值。每次发布都可以改善周边平台、吸引开发者,并为企业销售团队提供开启云服务对话的新理由。
Alibaba 的规模也使其能够推进面向行业的部署。根据一份 AI 市场概览,Qwen 系列已被汽车、金融、游戏和零售等行业的开发者与组织采用。
企业买家关注的问题,往往是排行榜难以体现的。他们需要服务可用性、访问控制、数据治理、可观测性、支持服务以及可预测的模型行为。当供应商替换或停用模型时,他们还需要迁移选项。
Alibaba 可以围绕 Qwen 打包提供这些能力。DeepSeek 可以凭借开放性、效率和广泛兼容性参与竞争。OpenAI、Anthropic 和 Google 则可以依托自身的云服务关系、智能体平台和开发者工具作出回应。
这意味着压力已经超出中国市场。如果 Alibaba 通过成熟的云技术栈提供有竞争力的模型,跨国供应商就必须同时捍卫性能和部署经济性。他们还必须说明:在存在能力足够的开放替代方案时,客户为何应接受封闭访问。
对开发者而言,选择并不只是 Alibaba 与 DeepSeek 之间的比较,而是关于控制权、集成方式、运营责任,以及未来模型变化速度的决策。
Qwen2.5-Max 让 Alibaba 的偏好变得清晰可见。该公司欢迎直接的模型比较,但其更大的目标是将智能能力转化为基础设施需求。
效率主张仍面临硬件与信任限制
Alibaba 的模型挑战了外界对中国 AI 上限的假设,但缺失的成本细节与外部限制仍限制了观察者能够得出的结论。
美国出口管制限制了中国获取先进 AI 加速器的能力。这些管制旨在放缓那些需要大规模高性能芯片集群的系统开发。
中国实验室通过软件优化、混合专家架构、改进数据筛选和更高效的训练作出回应。DeepSeek 成为最显眼的案例,但 Alibaba、Baidu、Tencent 和其他公司也在追求类似目标。
Qwen2.5-Max 表明 Alibaba 在这些条件下仍具备技术竞争力。然而,该公司没有公布关于其训练硬件、能耗、实验过程或总开发资源的完整说明。
20 万亿 token 的数字描述的是训练规模,而非效率。庞大的 token 数量无法说明数据被重复使用的频率、筛选方式,或有多少计算资源消耗在失败的运行中。
参数数量同样需要结合背景理解。在混合专家模型中,总参数量与激活参数量描述的是系统的不同方面。缺少这两个数字,读者无法仅凭规模估算推理需求。
DeepSeek 为 V3 披露了更多架构和训练细节。这种透明度强化了其效率叙事,尽管外部研究人员仍无法审计每一项底层成本,或复现整个项目。
Alibaba 的主张还面临第二个问题:跨市场的信任。考虑采用中国托管模型的组织必须评估数据存储位置、网络安全规则、监管风险和采购限制。中国买家在评估美国服务时也面临相应顾虑。
这些问题并不决定技术质量,但它们决定了一款技术能力足够的模型能否进入受监管的工作流程。即使某项服务在相关测试中表现良好,银行、医疗服务提供者或政府承包商也可能因合规原因拒绝使用。
内容控制构成了另一项限制。在中国公开提供的生成式 AI 服务须遵守国家法规和服务商政策。对于政治敏感议题的回应,可能与其他地区托管模型的输出不同。
美国供应商同样设有安全限制和可接受使用规则。采购时的关键问题并不是模型是否毫无限制,而是其限制、日志记录实践和升级流程是否符合组织要求。
第三项担忧涉及模型替换。托管系统可以在不向客户提供旧版权重的情况下发生变化。今天运行稳定的应用,可能会在更新后表现不同。
团队可以通过版本化评估、输出监控、备用模型和人工审查降低这一风险。他们不应仅因某个模型在发布时的排行榜上领先就进行部署。
Qwen2.5-Max 的推出也早于广泛独立测试能够成熟开展的阶段。这一时机使不确定性不可避免。Alibaba 的基准测试是证据,但真实工作负载仍需验证模型的可靠性。
风险两面并存。因为 Qwen 最强的早期主张来自 Alibaba 就否定它,会忽视有意义的技术进展;将每项比较照单全收,则会把营销证据与可复现评估混为一谈。
更站得住脚的立场介于两种极端之间。Alibaba 推出了一款严肃的模型,并对全球竞争对手施加了额外压力。其性能和效率优势的确切幅度仍未有定论。
下一个 Google News 周期应衡量什么
下一批有意义的信号将来自独立工作负载结果、持续的开发者采用,以及模型使用能改善 Alibaba 云业务的证据。
第一个信号是覆盖真实任务的独立评估。开发者应超越通用排行榜,转而关注编程智能体、多语言检索、长文档分析以及可靠的工具执行。
如果在多个评估方的测试中取得强劲结果,将强化 Alibaba 关于 Qwen 接近前沿水平的主张。若发布基准与生产测试之间出现巨大差距,则会削弱这一主张。
第二个信号是公告周期淡去后的开发者采用情况。下载量、衍生模型、API 活动、集成情况和活跃社区项目,能够揭示工程师是否看到了持久价值。
Alibaba 在 2025 年初表示,全球开发者已创建超过 90,000 个 Qwen 衍生模型。该数字来自公司自身,但反映出 Alibaba 希望转化为云服务使用量的生态规模。
不断壮大的社区将巩固 Alibaba 对抗 DeepSeek 的地位。停滞则意味着开发者将 Qwen2.5-Max 视为又一个暂时的基准测试领跑者,而非首选基础。
第三个信号是商业转化。Alibaba 已承诺向云和 AI 基础设施投入大量资源,因此营收增长和客户采用将成为其战略的核心检验。
该公司的投资计划描述了对 AI 基础设施、基础模型和 AI 原生应用增加支出的安排。这项承诺提高了赌注:技术进步最终必须支撑持久需求。
与 AI 产品相关的云业务增长,将增强 Alibaba 一体化路径有效的论据。若大量投资没有带来相应的使用量,DeepSeek 更精简的路径就会显得更具吸引力。
读者也应关注竞争对手如何回应。DeepSeek 可以推出另一款开放模型,或提供更详细的效率成果。OpenAI、Anthropic、Google 和 Meta 可以降低推理需求、提升智能体性能,或扩大自身系统的访问范围。
由此形成的竞争不会产生一个永久的赢家。模型领导地位变化太快,而买家评估的是质量、成本、控制权和合规性之间的不同组合。
这正是最初 Google News 叙事需要修正的原因。Alibaba 并未凭借发布 Qwen2.5-Max 就终结 AI 竞赛。它展示了,一家大型中国平台公司能够迅速回应 DeepSeek,并与知名国际系统保持同步。
尚未解决的问题是,Alibaba 的规模会成为优势还是负担。其云服务能力和商业覆盖面可以广泛分发 Qwen,但这些承诺同样要求它维持投资、赢得企业信任,并在反复的模型转换中持续保持开发者参与。
对开发者和知识工作者而言,实际应对方式是有纪律地测试。选择具有代表性的工作流程,保留源材料,盲测比较输出,并记录失败模式。每当供应商更换模型时,都应重新运行同一套评估。
对于企业买家,应询问谁控制权重、数据在哪里处理、更新如何管理,以及应用能否切换供应商。基准分数应当开启对话,而不是终结对话。
Qwen2.5-Max 值得关注,因为它拓宽了竞争格局。DeepSeek 值得关注,因为它改变了竞争条件。下一条模型新闻是否重要,取决于独立使用能否验证其背后的承诺。
Alibaba 会将 Qwen 的关注度转化为可信、可重复的企业部署,还是另一项聚焦效率的发布会再次重置市场?应在公告之后追踪证据,而不只是关注在 Google News 上主导一天的排名。


