阿里巴巴全栈 AI 路线图将芯片、模型与智能体押注整合为一体
阿里巴巴发布了一项全栈 AI 路线图,涵盖新处理器、更大规模的 Qwen 模型、智能体基础设施,以及超过 20 吉瓦的云计算容量。
9 月 22 日的这项发布之所以重要,是因为阿里巴巴不再将这些产品视为彼此独立的技术项目。该公司希望芯片、数据中心、模型、上下文服务和智能体作为一个协调统一的系统运行。
这使阿里巴巴与 Nvidia 的平台战略形成正面竞争,尽管两家公司所处的位置并不相同。Nvidia 向各家云服务商销售计算基础设施。阿里巴巴则计划运营其中很大一部分基础设施,为其自有模型进行优化,并销售由此产生的服务。
该公司推出了 Zhenwu V900 AI 处理器,并确认 Qwen 4 正在训练中。它还概述了 Qwen 4.5 和 Qwen 5 模型,目标参数规模介于 5 万亿至 10 万亿之间。
阿里巴巴还推出了用于管理企业智能体的 AgentCore、用于提供记忆和实时业务数据的 Agent Context,以及面向智能手机制造商的 Qwen Intelligence。
这一发布提出了异常广泛的承诺。阿里巴巴表示,对技术栈更多层面的掌控将提升容量、效率和智能体部署能力。现在,该公司必须证明,这些层面协同运行时的表现优于客户现有的芯片、云和模型组合。
阿里巴巴全栈 AI 路线图连接五个层面
阿里巴巴的核心变化在于架构:芯片、基础设施、模型、上下文和智能体如今共享一份公开路线图。
在杭州举行的 2026 云栖大会上,阿里巴巴描述了一个从半导体设计延伸至可跨业务软件执行操作的应用程序的 AI 系统。
硬件基础始于 Zhenwu V900。阿里巴巴半导体部门平头哥为模型训练和推理设计了这款处理器。
推理是经过训练的模型用于响应请求的计算过程。当一款 AI 产品触达大量用户后,推理往往会成为更大的运营成本。
阿里巴巴表示,V900 的性能是今年 5 月亮相的 Zhenwu M890 的三倍。这一比较对象是阿里巴巴自家的上一代处理器,而非 Nvidia 最新硬件。
根据该公司的 AI 路线图,V900 配备 216 GB 内存和 1,200 GB/s 的芯片间带宽。它支持 FP8 和 FP4,这些低精度格式可降低计算和内存需求。
该公司还展示了升级版超节点,将 V900 与其 ICN 网络交换机、Panmai SmartNIC 和 Zhenyue 存储控制器结合起来。
超节点通过高速网络连接大量处理器,使其能够像一个更大的计算系统一样运行。阿里巴巴表示,基于其设计的集群可扩展至 50 万张加速卡。
这一规模是设计上限,并非已有一套 50 万卡安装系统正在运行的证据。阿里巴巴尚未公布此类集群的部署配置、电力需求或独立性能测量结果。
模型层同样雄心勃勃。Qwen 4 目前正在训练,后续的 Qwen 世代预计将达到 5 万亿至 10 万亿个参数。
参数是训练期间调整的模型内部数值。更大的参数数量可以提升容量,但并不能单独证明准确性、推理质量或经济效率。
据 独立报道,当前的 Qwen3.8-Max 拥有 2.4 万亿个参数。Moonshot AI 于 7 月发布的 Kimi K3 拥有 2.8 万亿个参数,提供了另一个中国市场的参考点。
在模型之上,阿里巴巴将其智能体云划分为三个功能层。AI Native Cloud 负责训练和推理。Agent Native Cloud 支持部署、监控和安全。Context Engine 则将智能体与当前数据及长期记忆相连接。
AI 智能体是利用模型、工具和上下文完成一系列操作的软件。其可靠性不仅取决于模型能否生成优质文本。
智能体必须能够与业务系统进行身份验证、检索正确的信息、保持状态,并从失败的操作中恢复。阿里巴巴的路线图将这些运营要求视为云服务,而不是由每位客户自行组合的功能。
这一决定形成了本文的核心张力。阿里巴巴承诺,横跨五个层面的所有权将带来更优的系统。客户仍需看到证据,证明这种整合带来的收益超过独立选择各个组件的好处。
为什么阿里巴巴希望掌控整个 AI 供应链
全栈战略是阿里巴巴对芯片获取受限、推理需求上升,以及运营大型模型经济性的回应。
先进 AI 系统所需的不只是性能强大的处理器。它们还需要内存、网络、存储、电力、冷却、模型软件,以及让数千台设备协同工作的工具。
任何一个层面的瓶颈都可能限制整个系统。当网络拥塞导致高速加速器等待数据时,其价值就会降低。当服务软件浪费内存时,性能出色的模型也会变得昂贵。
阿里巴巴的答案是端到端协同优化。CEO 吴泳铭表示,该公司正在将芯片、服务器、网络、模型和推理引擎作为一个系统进行调优。
这一战略类似于超大规模云服务商长期拥有的优势。大型运营商可以围绕已知硬件设计软件,并将优化成本分摊给众多客户。
阿里巴巴还面临额外的激励。美国出口管制限制了中国获取某些先进 AI 处理器和制造技术的能力。
这些限制并未消除中国市场中的外国硬件,但使未来的获取渠道更难预测,并提高了国产替代方案的战略价值。
据 Bernstein 的估计,并由一篇 AI 芯片分析引用,Nvidia 在 2025 年占据约 40% 的中国 AI 芯片市场,与 Huawei 大致持平。这一平衡显示了国内市场变化的速度。
因此,阿里巴巴的芯片项目具有双重目的。它既可以降低对受限供应的依赖,也能为 Alibaba Cloud 提供专为其自身工作负载设计的硬件。
商业逻辑已经在阿里巴巴的业绩中显现。3 月季度,云智能集团收入达到 416.26 亿元人民币,外部收入增长 40%。
AI 相关产品占外部云收入的 30%。根据阿里巴巴的 云业务业绩,其年化收入超过 358 亿元人民币。
这些数据来自公司本身,但说明了基础设施容量为何变得紧迫。AI 正从一项研发支出转变为实质性的云业务收入来源。
阿里巴巴表示,在 V900 发布前,已有超过 10 万颗 Zhenwu 处理器部署在其公共云上。该公司还称,超过 60% 的平头哥计算能力服务于外部客户。
该公司如今预计,到 2032 年其全球数据中心容量将超过 20 吉瓦。这是一项以电力容量衡量的运营目标,而非处理器或建筑物数量。
吴泳铭承认,中期需求超过了阿里巴巴供应计算基础设施的能力。他指出,数据中心供应链的短缺限制了扩张。
这一承认让路线图更具背景。阿里巴巴进行垂直整合,并不只是因为其偏好更严格的技术控制,而是试图确保足够的容量,以支持其增长最快的业务。
这一方法也改变了企业的采购选择。客户可以租用阿里巴巴的计算资源、选择 Qwen 模型、通过 Agent Context 连接公司数据,并通过 AgentCore 管理执行过程。
这条整合路径可以减少集成工作量。但它也将运营依赖集中于单一供应商,包括其安全控制、区域可用性、API 和硬件路线图。
阿里巴巴真正的对手是 Nvidia 的平台优势
这场战略竞争并不是简单的 V900 对 GPU 基准测试;而是阿里巴巴的一体化云服务对阵 Nvidia 被广泛采用的计算平台。
Nvidia 的地位不只依赖于加速器性能。其软件库、开发者工具、网络产品和合作伙伴关系,使其平台在整个行业中广为熟悉。
开发者多年来一直围绕这一环境进行构建。云服务商和模型实验室能够招聘具备相关经验的工程师、找到经过验证的软件,并在受支持的系统之间迁移工作负载。
阿里巴巴无法通过一次处理器发布消除这些优势。它必须让整个 Zhenwu 环境具备足够高的生产力,才能使客户接受一个成熟度较低的替代方案。
这解释了为何阿里巴巴 AI 芯片路线图强调系统,而非单一组件。V900 与网络、存储控制器、超节点、云服务以及由同一企业集团优化的模型一同推出。
阿里巴巴还有另一条采用路径。它无需说服每位客户购买实体处理器。它可以在云 API 背后部署 Zhenwu 算力,并销售模型访问服务。
这种抽象降低了切换门槛。应用开发者可能更关心延迟、可用性和 token 成本,而不需要知道是哪种加速器处理了每一项请求。
然而,云抽象并不能消除生态系统问题。阿里巴巴仍需要编译器、内核、调度软件、可观测性工具,以及与广泛使用的 AI 框架的兼容性。
它还必须支持并非由 Qwen 团队创建的客户模型。如果效率收益只适用于阿里巴巴偏好的工作负载,全栈云就会失去部分吸引力。
Huawei 在中国市场内部形成了另一种压力来源。其 Ascend 处理器和配套软件瞄准了许多同样寻求 Nvidia 国产替代方案的客户。
Baidu 和 Tencent 同样结合了模型、云服务和应用。阿里巴巴的差异化之处在于其公开计划的广度,以及将云需求与商业和办公产品连接起来的能力。
不过,Nvidia 仍是主要参照对象,因为它代表着相反的平台结构。Nvidia 提供由竞争性云服务商和模型开发者使用的横向基础。
阿里巴巴正在构建的是一项纵向服务。其自有云运行硬件,其自有团队构建模型,其软件管理智能体。
两种结构都不会自动赢得每一种工作负载。Nvidia 更广泛的生态系统鼓励可移植性和外部创新。阿里巴巴更紧密的整合则可以缩短模型行为与基础设施设计之间的反馈循环。
因此,相关的测试是每单位稀缺基础设施所产生的有效产出。处理器峰值速度只能反映其中一部分。
token 吞吐量、内存利用率、集群可靠性、开发者时间和能源消耗都会影响经济性。阿里巴巴尚未公布足够的可比数据,无法确定 V900 在这些维度上的位置。
一家独立硬件评估指出,缺少标准的浮点性能指标。没有通用基准测试结果,这一“三倍”说法无法支持与 Nvidia 或 Huawei 加速器的直接比较。
这一信息缺口意味着竞争层面的表述应保持克制。V900 无需在全球范围内击败 Nvidia 才具有意义。
它可以通过为 Alibaba 提供可靠供应、改善利润率,并支持 Alibaba Cloud 内的 Qwen 服务而取得成功。即使不广泛向外部销售处理器,这一结果也会强化其垂直整合模式。
垂直整合是机制,而非结果
Alibaba 的核心逻辑在于,每一层都能产生反馈,从而改进其上层与下层。
该公司曾通过递归自我改进(RSI)提供早期示例。这种方法让模型能够评估结果、识别弱点、设计后续实验,并重复这一过程。
Alibaba 表示,在一项持续一个月的实验中,Qwen3.8-Max 完成了 33 个自动化改进周期。据称,其 Artificial Analysis 评分从 40 提升至 45。
同一模型还进行了持续超过 60 小时的芯片设计实验。Alibaba 表示,它调用电子设计自动化工具超过 10,000 次。
电子设计自动化软件可帮助工程师创建并验证半导体设计。据称,该模型生成了芯片总线模块,并在不降低性能的前提下将其面积缩小了 42%。
这些结果仍由公司自行报告。但它们也展示了 Alibaba 希望其完整技术栈实现的能力。
模型可以使用云工具执行长期运行的工程任务。其输出能够影响硬件设计,而由此产生的硬件又可支持后续模型训练和推理。
这一闭环比在一次发布中简单罗列大量产品更重要。芯片、模型和智能体的清单只是产品组合;共享反馈与优化才能使其成为一个系统。
Alibaba 的 Context Engine 提供了该机制的另一部分。Agent Context 将文档、业务应用、对话和多模态信息连接起来。
该公司表示,这项服务可在知识密集型任务中将 token 使用量最多减少 67%。这一说法仍需在不同数据集和智能体设计中接受独立评估。
这一概念解决了真实的运营问题。智能体不应在每次执行任务时,都反复将组织的全部信息历史发送给模型。
上下文服务会选择相关信息、保留任务状态,并检索此前活动。良好的筛选机制能够在提升答案相关性的同时降低计算量。
这也是企业知识架构成为 AI 性能组成部分的地方。当权限、记录和决策仍分散在彼此脱节的系统中时,模型无法可靠地采取行动。
已经在构建知识融合流程的组织会认识到这一挑战。其价值在于检索恰当的上下文,同时保留来源追溯能力和访问控制。
AgentCore 位于这一数据层之上。Alibaba 将其描述为一个用于在智能体完整生命周期中构建、运营、监控和治理智能体的平台。
其重要性将取决于执行细节。企业需要审计日志、身份管理、审批步骤、工具限制、版本控制和可靠的回滚机制。
起草回复的智能体风险有限。获准更新库存、传输信息或修改生产代码的智能体,则需要更严格的控制。
Alibaba 还发布了用于威胁检测和合规管理的 Agent Security Center。当智能体跨多个系统执行多步骤任务时,安全问题会变得更加复杂。
智能手机计划将这一机制延伸至另一种环境。Qwen Intelligence 为制造商提供了一个智能体平台,旨在移动设备上执行跨应用任务。
这创造了分发机会。Alibaba 可通过硬件合作伙伴,将基于 Qwen 的服务部署得更贴近用户,而不只是依赖其自有消费者应用。
这也带来了平台限制。移动操作系统对后台活动、权限、私密数据及应用之间的交互实施严格控制。
可信的手机智能体必须在不要求用户交出广泛访问权限的情况下应对这些控制。可靠性必须保持在较高水平,因为错误操作可能影响消息、支付、出行或个人文件。
Alibaba 的整合机制在这些示例中保持一致:模型负责规划,上下文系统提供信息,智能体平台治理行动,云基础设施处理执行。
剩下的问题是,Alibaba 能否将这种一致性转化为可衡量的客户成果。技术协同是其提出的机制,而非市场成功的证据。
路线图仍缺乏独立性能证据
Alibaba 已披露了广泛的目标,但其若干最重要的说法仍属预测或内部测量结果。
最大的未知数围绕 Zhenwu V900。Alibaba 称其为中国性能最强的 AI 芯片,并表示其性能是前代产品的三倍。
该公司尚未提供完整的基准测试资料,以展示其相较于同类替代方案的训练速度、推理吞吐量、能耗或总体系统成本。
三倍提升会因工作负载和测量方式不同而具有不同含义。它可能指向某一模型、数据格式、批量大小或系统配置。
500,000 张卡的集群规模同样需要谨慎看待。支持理论上的集群拓扑,与在持续训练中可靠地运行该集群并不相同。
在这种规模下,设备故障会成为常态而非例外。调度、检查点恢复、网络、冷却和电力管理决定硬件能否持续发挥价值。
模型路线图带来了第二项不确定性。Alibaba 计划在 Qwen 4 之后训练包含 5 万亿至 10 万亿参数的系统。
更大的模型需要更多内存和计算资源。它们并不保证成比例的性能提升,尤其是在开发者越来越多地采用稀疏架构和更小型专业化系统的情况下。
模型质量还取决于数据、训练方法、推理时推理能力和训练后处理。参数数量能够提供规模背景,但不能取代基于任务的评估。
Alibaba 的 RSI 说法也值得保持类似谨慎。33 个自动化周期中的评分提升令人关注,但并不能证明安全、开放式的自我改进已经实现。
该过程在经过设计的环境中运行,采用了选定的评估方法和工具。其在该测试中的表现未必能迁移到陌生的生产任务中。
芯片设计结果同样需要工程验证。达到生产级标准的模块必须满足制造、时序、可靠性、验证和集成要求。
Alibaba 表示,该模型在不损害性能的情况下缩小了芯片面积。独立复现将有助于澄清初始设计、测试条件以及人工审查的参与程度。
基础设施供应构成了更直接的业务风险。20 吉瓦目标需要土地、电网连接、冷却系统、建筑劳动力、处理器、内存和网络设备。
Wu 表示,行业中期需求已经超过现有供应。这意味着扩张目标部分取决于 Alibaba 无法控制的公用事业机构和供应商。
地缘政治带来了额外不确定性。国产处理器能够降低 Alibaba 对受限进口的敞口,但制造过程仍涉及复杂设备和供应链。
新的贸易规则可能影响组件、制造、软件、客户或海外业务。它们也可能加速对 Alibaba 国产替代方案的需求。
客户锁定是另一项权衡。企业若从处理器到智能体平台都采用 Alibaba,或许能获得更简单的集成体验。
但如果接口、地区规则或产品重点发生变化,它们也将承担更高的迁移风险。买家会希望拥有可导出的数据、兼容的模型和清晰的服务边界。
Morningstar 对中国由国家主导的数据中心投资提出了另一项商业担忧。其云业务预测认为,公共基础设施可能会减少未来对 Alibaba 服务的部分需求。
这一情景并不确定。但它说明,仅有建设能力并不能确保云业务实现盈利增长。
Alibaba 需要足够的利用率来证明投资合理。它还必须在管理电力和硬件成本的同时,将模型使用转化为可持续收入。
该公司具备真实的商业发展势头,但其路线图远超当前已报告的采用情况。最有价值的证据将来自可复制的客户成果,而非又一项内部基准测试。
三项信号将显示 Alibaba 的战略是否奏效
Qwen 4 的表现、V900 的部署以及企业对智能体的采用,将决定这一路线图能否转化为运营优势。
第一项信号是 Qwen 4 的发布与评估。Alibaba 已确认该模型正在训练中,因此其发布将成为对整合战略最近的一次检验。
读者应关注其在推理、编程、多模态任务和智能体可靠性方面的表现。成本和延迟与头部基准测试分数同样重要。
Alibaba 还应披露,Qwen 4 的训练或服务是否主要运行于 Zhenwu 基础设施之上。对 V900 的广泛使用将强化 Alibaba 能够将自有硬件与前沿模型连接起来的说法。
依赖进口加速器并不会让 Qwen 4 失去意义。但这会削弱 Alibaba 已经掌控其关键计算路径的观点。
第二项信号是 V900 可验证的商业部署。Alibaba 表示,现有 Zhenwu 产品已服务超过 650 家客户,覆盖汽车、金融、能源、制造等领域。
下一步证据应包括具名工作负载、部署规模、可用性水平,以及与此前基础设施相比的性能表现。
标准基准测试将帮助客户区分架构进步与选择性说法。稳定的云访问也会比有限的演示更具意义。
应关注外部开发者能否在不进行重大重写的情况下,将成熟模型迁移至 V900 系统。这将检验 Alibaba 软件环境的成熟度。
年度处理器出货量的增长将强化供应安全论点。持续短缺或供应有限将暴露硬件项目扩展的难度。
第三项信号是 AgentCore 和 Agent Context 在生产环境中的持续使用。发布一个智能体平台比支持企业信任其处理重要任务的智能体要容易得多。
相关指标包括活跃企业部署数量、已完成任务、错误率、人工干预、上下文检索质量和安全事件。
Alibaba 应证明其上下文层能够在不遗漏准确决策所需信息的前提下减少 token 使用量。当更低消耗带来更弱结果时,其价值微乎其微。
客户还将检验 AgentCore 是否可与外部模型及现有业务软件协同工作。开放的运营层能够比仅限 Qwen 的环境吸引更广泛的采用。
这些信号应会在未来几个月的产品发布、云业务披露和客户案例研究中出现。它们将共同强化或削弱 Alibaba 的核心主张。
Alibaba 的全栈 AI 路线图作为一项战略是可信的,因为其各层解决了相互关联的技术和供应问题。但作为竞争优势,它仍有待验证。
开发者和企业采购方应比较完整工作负载的实际结果,而非孤立的模型评分或处理器规格。真正有价值的问题是:Alibaba 的技术栈能否可靠、安全且高效地完成真实任务。
首先关注 Qwen 4 的评测。随后留意 V900 的生产数据以及可复现的 AgentCore 部署。如果这三者全部到位,Alibaba 构建的就不只是若干 AI 产品的集合。



