阿里巴巴 Qwen3.8 Max 扩大规模,DeepSeek 推出更小的竞争对手
阿里巴巴已将一款拥有 2.4 万亿参数的模型开放预览,为 Google 新闻读者呈现出与 DeepSeek 规模小得多的 V4 Flash 形成鲜明对比的局面。
Qwen3.8 Max 是阿里巴巴迄今为止最大的模型。随后发布的 DeepSeek-V4-Flash-0731 则侧重于通过后训练降低运营成本,并提升智能体性能。
这些发布勾勒出一场无法仅凭原始基准排名定胜负的较量。阿里巴巴押注于规模能够支撑广泛能力,而 DeepSeek 则在检验一款具备竞争力的模型究竟需要多少计算资源。
这种差异对构建编程智能体、研究系统和自动化业务工作流的开发者至关重要。这些应用会反复调用模型、保留长上下文,并经常使用外部工具。
微小的成本差异会在数千次操作中累积放大。但工具使用不佳或任务失败,也可能因重试和人工干预而抵消这些节省。
因此,这并不只是阿里巴巴与 DeepSeek 的对决,而是一项现实检验:下一代领先模型是否必须无比庞大,还是只需高效到足以在任何地方运行。
Qwen3.8 Max 明确展现阿里巴巴对规模的押注
阿里巴巴选择以模型规模作为最清晰的信号,表明 Qwen 跻身全球顶尖 AI 系统之列。
阿里巴巴于 2026 年 7 月预览了 Qwen3.8 Max,其总参数量达 2.4 万亿。参数是决定模型如何处理和生成信息的学习得来的数值。
该模型采用混合专家架构,通常简称为 MoE。这种设计会针对每个请求激活大型网络中的特定部分。
这种方法使模型的总参数量可以远超每个 token 实际使用的参数量。它能够在不对每次响应启用整个网络的情况下扩展容量。
阿里巴巴尚未公布足够的技术细节,因此无法确定 Qwen3.8 Max 在典型推理期间会保持多少参数处于激活状态。这一缺失限制了直接的效率比较。
此次预览紧随 Moonshot AI 推出 Kimi K3 之后,后者拥有 2.8 万亿总参数。时机使阿里巴巴置身于一场重新升温的模型规模竞赛之中。
一篇 Associated Press report 将 Qwen3.8 Max 描述为全球最大的模型之一。阿里巴巴将其定位为最强可用系统之一。
规模本身并不能证明质量。模型的训练数据、架构、后训练方法、工具接口和推理设置,可能比其总参数量更重要。
不过,阿里巴巴的决定仍具有战略意义。Qwen3.8 Max 为其云业务提供了一款旗舰模型,用于高要求的编程、研究和智能体工作负载。
该模型也延续了阿里巴巴快速发布的节奏。仅在数月前,Qwen3.7 Max 才作为该公司的编程和长时间自主工作旗舰模型推出。
阿里巴巴官方的 Qwen model documentation 表示,Qwen3.7 Max 支持函数调用、网页搜索、上下文缓存和扩展自主执行。
Qwen3.8 Max 延续了这一方向,而非推出一个独立的产品类别。其核心承诺是为复杂工作提供更高的能力上限。
当一次请求包含代码、文档、指令和工具结果时,这一上限最为重要。更大的上下文窗口能让更多这类工作材料保持可用。
只有当模型能够找到正确信息时,上下文才有价值。长提示词可能引入干扰、相互冲突的指令和过时的中间结果。
因此,阿里巴巴必须展示的不只是容量。它需要在长会话中持续实现可靠的检索、规划和执行。
公开预览让开发者有机会及早测试这些特性。不过,预览访问并不能提供与大规模生产部署同等的证据。
据报道,阿里巴巴自身的评估将 Qwen3.8 Max 列为接近领先国际模型的水平。这些说法需要在中立环境下得到复现,才能支撑明确结论。
基准测试的设计可能偏向特定的提示方法或智能体框架。配置上的微小变化也可能在编程和工具使用测试中造成巨大差异。
尽管如此,此次发布改变了竞争格局。阿里巴巴如今拥有一款旗舰模型,其规模超过 DeepSeek-V4-Pro,并接近已披露的最大中国系统。
对于通过 Google 新闻接触这一报道的读者而言,最令人印象深刻的数字是 2.4 万亿参数。更重要的问题是阿里巴巴能用这些参数做到什么。
一款能够可靠完成长工作流的模型,足以证明大量基础设施投入的合理性。一款不稳定的模型只会将额外计算转化为更漫长、更昂贵的失败。
这种不确定性构成了核心张力。阿里巴巴让规模变得可见,但开发者仍需要看到规模能够带来可靠工作的证据。
Google 新闻标题掩盖了两种不同的 AI 策略
阿里巴巴和 DeepSeek 的发布看似属于同一场模型竞赛,但它们针对的是不同的开发者问题。
Google 新闻标题自然会将 Qwen3.8 Max 和 DeepSeek V4 Flash 并列。两者都来自争夺全球开发者关注的中国 AI 实验室。
它们的技术路径却相距甚远。Qwen3.8 Max 强调巨大的能力边界,而 DeepSeek V4 Flash 则减少每项任务中被激活的模型部分。
根据其公开的模型资料,DeepSeek V4 Flash 拥有 2840 亿总参数,并且每个 token 激活 130 亿参数。
其同系模型 DeepSeek V4 Pro 拥有 1.6 万亿总参数,并激活 490 亿参数。两者都采用 MoE 设计,并支持百万 token 上下文。
DeepSeek-V4-Flash-0731 保留了早期 Flash 的架构和规模。该公司称,此次更新主要来自额外的后训练,而非更大的基础模型。
后训练会针对推理、指令遵循、安全性和工具使用调整预训练模型。无需重建底层网络,它也能显著改变模型行为。
这一细节使 DeepSeek 的发布格外值得关注。该公司认为,有针对性的训练能够比又一次大幅增加参数量带来更多价值。
DeepSeek 表示,更新后的 Flash 模型改善了包括软件工程工作流在内的智能体任务表现。这些是公司自行报告的结果,仍需独立确认。
DeepSeek model catalog 将 V4 Flash 和 V4 Pro 列为不同的 API 选项。两者分别面向不同的能力与吞吐量平衡。
阿里巴巴的模型服务于另一种目的。Qwen3.8 Max 为开发者提供了一款广泛适用的旗舰模型,用于那些最高可用能力比最小资源消耗更重要的困难任务。
DeepSeek V4 Flash 面向重复性工作负载,在这些工作负载中,延迟、吞吐量和成本决定产品表现。编程智能体是最明显的例子。
编程智能体很少只进行一次模型调用。它会检查文件、提出修改建议、运行工具、读取错误、修订代码,并测试结果。
每一步都会扩展对话历史。系统可能会在每次请求中重新发送仓库的大量内容和先前的工具输出。
在这种模式下,模型效率成为一种产品特性。更低的资源消耗可让团队在达到运营上限前支持更多迭代。
然而,更便宜的调用并不保证完成任务的成本更低。一个需要两倍尝试次数的模型,可能比更强的替代方案消耗更多资源。
因此,完成质量比单纯的 token 效率更重要。团队应衡量成功结果,而不是孤立的提示词表现。
这两种策略也带来不同的部署约束。拥有数万亿参数的模型即使采用选择性专家激活,也需要大量服务基础设施。
规模更小的 MoE 系统可能更容易被托管服务商分发。它也可能更适合区域性或专用基础设施。
这种差异影响可用性。开发者往往会基于稳定容量、可预测延迟和可访问地区,而非排行榜位置来选择模型。
阿里巴巴在这方面具备优势,因为它掌控着一个主要云平台。它可以将 Qwen 与部署、监控、数据和企业服务打包提供。
DeepSeek 则拥有不同的优势。其开放权重方式让外部服务商能够托管、优化和修改兼容版本。
开放权重是指组织可在附带许可证下部署的可下载模型参数。它们并不一定披露完整训练过程。
因此,这场竞争并非简单的规模比较。阿里巴巴销售的是集成能力和更高的能力上限,而 DeepSeek 则通过服务商传播一款高效模型。
这正是标题中的竞争值得深入审视的原因。两家公司都在回应智能体需求,但它们预期开发者看重的东西不同。
DeepSeek V4 Flash 将效率转化为竞争压力
DeepSeek 正迫使每一家旗舰模型提供商解释,为何其额外能力值得承担更高的基础设施和运营复杂度。
V4 Flash 策略建立在 DeepSeek 此前降低先进 AI 运行成本预期的角色之上。
其 V4 系列采用稀疏激活,即只有选定的专家处理每个 token。与激活每个参数相比,这减少了计算量。
V4 model overview 描述了两款围绕长上下文和智能体工作负载设计的检查点,并列出了 Flash 的 2840 亿总参数。
同一概述列出了每个 Flash token 的 130 亿激活参数。该激活数量仅占模型总存储容量的一小部分。
这种结构并不意味着推理免费或简单。服务商仍需要足够的内存来容纳权重、服务并发用户并保留上下文缓存。
上下文缓存会存储已处理的提示信息,从而避免重复内容需要完全重新计算。智能体系统因此受益,因为它们的历史记录往往在多次调用间重叠。
DeepSeek 的设计也引入了路由挑战。系统必须将每个 token 发送给合适的专家,同时避免形成通信瓶颈。
薄弱的路由可能浪费容量,或过度使用某些专家。因此,高效服务既取决于模型架构,也取决于基础设施工程。
DeepSeek-V4-Flash-0731 又增加了一个维度。它表明,在服务占用保持稳定的情况下,模型行为仍可通过后训练显著改善。
这对阿里巴巴形成了直接压力。Qwen3.8 Max 必须带来更小、经过精心训练的模型无法实现的收益。
它也给美国实验室带来压力。OpenAI、Anthropic 和 Google 仍在通过能力、安全性、可靠性和集成工具展开竞争。
DeepSeek 让采购团队不得不提出一个更棘手的问题:特定工作负载实际需要多少前沿性能?
一篇 industry analysis 将这一趋势描述为智能正走向商品化经济。这种表述很有冲击力,但并不完整。
电力是标准化的,模型输出则不是。
面对同一个代码仓库,两个系统可能生成不同的补丁、解释、安全风险和失败模式。这些差异仍保有显著的商业价值。
不过,低成本模型无需赢下每一项基准测试,也能改变采购行为。它只需能够可靠地处理大部分常规工作。
企业可能会将高能力模型留给架构决策和棘手的调试任务,同时把日常代码修改路由到效率更高的模型。
模型路由会根据成本、延迟、风险或预期难度,将每个请求发送给选定的系统。更好的路由可降低对单一供应商的依赖。
这种做法削弱了通用旗舰模型的价值。买方不再需要一个模型完成所有任务。
当组织将模型视为可互换组件时,DeepSeek 会从中受益。当客户围绕其云服务和智能体平台实现标准化时,Alibaba 同样受益。
个人生产力领域也存在同样的分化。用户总结会议或整理研究资料时,通常并不需要在每一步都使用最大的可用模型。
他们需要可靠的上下文处理和证据追踪能力。结构化的 AI knowledge base 可以在任何模型得出结论前保留来源。
这一工作流降低了切换模型的成本。用户的记录与用于生成临时回答的模型保持分离。
因此,效率有两层含义。一层关乎计算,另一层关乎买方更换底层模型的难易程度。
DeepSeek 通过更小的活跃规模和开放分发推进这两种效率。Alibaba 则以广泛的平台和更深入的服务集成应对。
两种定位都不能保证胜出。不过,DeepSeek 的发布迫使每家供应商都要在任务完成度层面证明自身价值。
更大模型仍有存在的理由
如果 Qwen3.8 Max 能够可靠完成较小系统难以完成的高价值任务,它就不必在效率上击败 DeepSeek。
大型模型在非常规问题上仍可保持优势。这些问题包括复杂的软件迁移、科学推理、多语言分析和长周期规划。
这类任务包含的模糊性超出了标准基准测试所能捕捉的范围。它们要求模型在应对不完整信息和不断变化的工具输出时,仍能保持目标一致。
大型 MoE 系统可以在不同领域分配专业化能力。这可能支持更广泛的知识覆盖和更灵活的问题解决能力。
Alibaba 似乎也在聚焦于结合文本、视觉输入和计算机交互的智能体。这类系统能够理解屏幕、操作软件并协调多个工具。
该公司的 release history 显示,早期 Qwen 模型已加入视觉理解、屏幕读取、函数调用和移动导航能力。
Qwen3.8 Max 是既有产品方向的一部分,而非孤立存在。Alibaba 可以将其与云资源、开发环境和业务应用连接起来。
这种集成可以抵消模型成本。如果一次更昂贵的调用无需定制工程即可完成整个工作流,它依然可能更具经济性。
企业买方也关注治理能力。他们需要访问控制、审计日志、区域可用性、事件响应和可预测的服务表现。
这些要求可能比开放权重更重要。可下载的模型并不会自动提供合规部署或可靠的运营支持。
Alibaba 可以借助其云业务来满足这些需求。DeepSeek 则往往依赖合作伙伴或客户来构建周边运营层。
这种取舍在文档处理智能体中尤为明显。系统必须识别文件、提取证据、应用政策,并产出可追溯的结果。
有能力的模型有助于解释内容。周边平台则决定流程能否保持安全、可审查和可重复。
软件智能体也是如此。模型质量会影响代码决策,而执行框架控制权限、测试和回滚。
智能体框架是协调提示词、工具、记忆和执行的软件层。其设计对基准测试结果的影响可能与模型本身一样大。
Alibaba 在此前的 Qwen 发布中强调过长时间自主运行能力。不过,内部演示并不能证明其在真实企业环境中的可靠性。
长时间执行也会扩大风险。早期的误解可能在人工发现前,扩散到数十个操作之中。
更多的工具调用会带来更多权限错误、状态损坏或未经验证假设的机会。因此,持续时间本身并不是质量指标。
Qwen3.8 Max 必须证明自己能够从错误中恢复。它应能识别相互矛盾的证据,并在任务超出授权范围时停止。
DeepSeek 面临同样的挑战。针对智能体基准优化的小型模型,在面对陌生工具或文档记录不佳的代码库时,表现可能有所不同。
独立测试应在同一框架内比较模型。它们应使用相同的权限、上下文、提示词和重试限制。
评估者还需要任务层面的测量。实用指标包括完成率、人工纠正时间、工具错误以及引入的回归问题。
Google News 的报道往往会将这些证据压缩为模型规模和基准排名。这些信号易于发布,却不足以支撑采购决策。
团队的最佳模型取决于失败成本。轻微的摘要错误与有缺陷的基础设施变更相差甚远。
在严重错误成本高昂、且更广泛能力可提升首次尝试质量的场景中,Alibaba 的规模押注具有合理性。
在工作负载频繁、可审查,且失败后容易路由至其他模型的场景中,DeepSeek 的效率押注具有合理性。
市场可以容纳两者。真正承压的是那些既不具备卓越能力、也不具备卓越效率的供应商。
基准测试主张仍需独立验证
Alibaba 和 DeepSeek 都尚未提供足够的中立证据,来最终判定规模与效率之间的较量。
Alibaba 的核心主张在很大程度上依赖于公司自行选择的评估。DeepSeek 也在其自有设置和执行框架中报告了智能体能力提升。
供应商基准测试是有价值的研究线索。它们不能替代独立测试,因为提示词设计和工具配置会改变结果。
编程基准测试尤其存在问题。有些测试衡量补丁是否能通过测试,但未必能反映可维护性或安全性。
模型可能生成一个通过测试的修复,却重复了逻辑、隐藏了错误或削弱了验证。自动评分仍可能奖励这样的补丁。
智能体基准测试加入了更多变量。模型会与框架、工具、权限、时间限制以及有时隐藏的重试逻辑交互。
企业可以通过调优整个技术栈来提升分数。但这种提升未必能迁移到客户的智能体框架中。
参数数量同样存在局限。Qwen3.8 Max 的 2.4 万亿总参数听起来极具决定性,但活跃计算规模仍未披露。
DeepSeek 公布了 V4 Flash 的总参数和活跃参数数量。这种透明度有助于比较,尽管它仍无法揭示所有推理服务要求。
模型的上下文能力主张也需要压力测试。支持一百万 token 并不意味着系统能准确利用所有远距离信息。
长上下文模型可能遗漏提示词中间位置的细节。它们也可能依赖临近但错误的证据。
开发者应在多种上下文长度下测试检索能力。他们应加入相互冲突的文件、重复指令和过时文档。
这些模型还需要安全评估。具备工具使用能力的系统可能遭遇提示词注入,即不受信任的内容试图重新引导智能体。
电子邮件、网页或代码注释都可能包含恶意指令。可靠的智能体必须能区分任务数据和经授权的命令。
模型供应商会发布安全控制措施,但客户仍需要应用层面的防护。这包括最小权限、审批关卡、日志和可逆操作。
开放权重带来另一项取舍。它允许检查和定制,但部署组织需承担更多安全与维护责任。
托管平台可减轻这种运营负担。但客户必须信任供应商的控制措施、可用性和数据处理承诺。
政治与监管问题进一步增加了采用难度。中国和美国的 AI 服务在不同市场和行业面临不同限制。
处理敏感数据的组织必须评估司法管辖权、数据驻留、出口管制和合同保护。基准排名无法回答这些问题。
这种不确定性并不意味着这些发布不重要。它改变的是负责任的结论。
Qwen3.8 Max 显然是 Alibaba 已披露的最大模型。DeepSeek V4 Flash 显然围绕更小的活跃规模和低成本运行而设计。
目前仍不清楚 Alibaba 额外的规模是否会带来更高的现实任务完成率。同样也不清楚 DeepSeek 在困难任务上需要重试的频率。
用户报告提供了有用的预警信号,但差异很大。不同的界面、提示词、工作负载和推理设置使得轶事难以比较。
一些开发者报告称 Qwen 在编程方面表现出色。另一些人则描述其在长时间会话中的行为不一致。
DeepSeek 也收到类似的褒贬不一反馈。用户常常称赞其效率,同时指出其在工具使用或复杂推理方面存在不足。
这些分歧在意料之中。一个模型可以在某个代码库中表现良好,却在语言、测试或文档不同的另一个代码库中失败。
通过 Google News 看到相关内容的读者应谨慎看待“赢家”说法。更站得住脚的结论是,买方如今拥有截然不同的架构选择。
独立评估将缩小不确定性。生产遥测数据将更为重要,因为它能捕捉模型在反复、复杂使用下的表现。
三个信号将决定 Alibaba 与 DeepSeek 的竞争
下一阶段将由独立任务结果、生产环境采用情况,以及 Alibaba 对 Qwen3.8 Max 的最终披露决定。
第一个信号是在相同条件下进行中立的智能体测试。评估者需要使用同一框架比较 Qwen3.8 Max 和 DeepSeek-V4-Flash-0731。
这些测试应衡量已完成的任务,而非孤立回答。它们还应报告重试次数、工具故障、延迟和人工纠正时间。
Qwen 若在困难工作流上占优,将强化 Alibaba 的规模论点。相近的结果则会强化 DeepSeek 的效率主张。
第二个信号是初期关注度消退后,开发者是否持续采用。编程工具、模型路由器和云平台中的使用情况可以揭示实际需求。
采用本身不能证明质量。免费访问、促销活动和默认展示位置可能暂时抬高使用量。
留存率更具参考价值。开发者在测试替代方案后仍将某个模型保留在生产环境中,说明其取舍是可接受的。
如果 Flash 成为高吞吐量智能体任务的常规引擎,DeepSeek 将巩固其地位。如果团队将 Qwen3.8 Max 留给高价值、复杂工作,Alibaba 将获益。
第三个信号是 Alibaba 的生产发布和技术披露。买方需要稳定的可用性、服务条款、基准测试方法和活跃参数细节。
更完整的模型报告将使研究者能够更仔细地检验 Alibaba 的效率主张。它也将澄清预览版本是否反映最终的生产系统。
如果 Alibaba 不披露核心架构细节,比较将继续失衡。即使 DeepSeek 并未在每项任务中领先,也可借此主张透明度优势。
DeepSeek 同样面临透明度考验。其声称的后训练收益,需要在公司自办基准测试之外提供可复现的证据。
一项详细评估应说明测试框架设置、推理强度、工具访问权限以及故障处理方式。缺少这些背景信息,分数可能会误导开发者。
更广泛的市场将关注 OpenAI、Anthropic、Google、Moonshot 和 Z.ai 如何回应。它们的反应将显示各自认为哪种威胁更为严重。
一款新的低成本模型将印证 DeepSeek 对运营经济性的压力。一款更大、聚焦智能体的旗舰模型,则会强化 Alibaba 的能力竞赛。
模型路由器可能成为实际赢家。它们能让应用将常规任务交给高效系统,将困难工作交给更强大的系统。
这种结构减少了选出单一通用冠军的必要性。它会奖励在更广泛工作流中拥有明确角色的模型。
开发者应先定义这一角色。团队可以按复杂度、隐私性、可接受延迟和失败成本对任务进行分类。
随后,可以在具有代表性的工作上测试两种模型。公开排行榜提示词不应取代内部评估集。
测试应将源材料和决策保留在模型会话之外。一个个人知识系统可帮助用户在不断变化的 AI 提供商之间保留证据。
随着发布周期加快,这种分离会变得更有价值。今天的旗舰模型,明天可能就会成为路由选项。
因此,Alibaba 与 DeepSeek 的竞争指向一个多模型市场。规模与效率将并存,因为应用承载着不同的风险特征。
Qwen3.8 Max 代表着更高能力上限的论点。DeepSeek V4 Flash 则代表着以更少的活跃计算完成更多工作的论点。
两种策略都不会凭借一条 Google 新闻标题取胜。真正的赢家将随着开发者持续衡量已完成工作、纠错成本和可靠性能而显现。
对企业采购方而言,眼下的行动很简单:构建一项贴近实际的评估,在相同条件下运行两种模型,并记录每一次人工干预。
对开发者而言,依次关注三个信号:独立任务结果、持续的生产使用,以及 Alibaba 最终的技术披露。
这些结果将揭示,Qwen 的庞大规模能否带来持久价值,还是 DeepSeek 已让效率成为市场的决定性特征。



