top of page

美团的LongCat AI刚刚在中国芯片上训练了一个万亿参数模型。NVIDIA并未受邀。

已更新:6月17日

中国最大的外卖平台美团于 4 月 24 日开启了 LongCat-2.0-Preview 的测试,这是一款完全基于国产芯片训练、参数量超过万亿的模型。此次训练使用了 5 万至 6 万张国产计算卡,是迄今为止中国在非 NVIDIA 硬件上完成的最大规模大模型训练任务。

该模型专为智能体(agent)工作流打造:工具调用、多步推理、代码生成、企业自动化。它支持 100 万 token 的上下文窗口,单次输出可达 64,000 token。目前处于受邀内测阶段,开发者每两小时可获得 1000 万 token 的配额。

LongCat AI 的发布时机令人瞩目,而且它并不孤单。同一天,DeepSeek 发布了 V4,这是一个拥有 1.6 万亿参数的模型,同样基于国产华为芯片训练。两个万亿级模型,两家公司,同一天,零 NVIDIA。这不是巧合,而是一种趋势。

美团构建了什么,以及它的实际用途

LongCat-2.0-Preview 是美团 LongCat 模型家族的最新一代,该系列始于 2025 年 8 月发布的拥有 5600 亿参数的开源 MoE 模型 LongCat-Flash。2.0 代将参数规模翻倍至一万亿以上,增加了 1M token 上下文窗口,并从开源转向受邀访问。

该模型最深层的优化在于智能体场景:多步任务规划、工具调用和生产级代码生成。美团将其描述为适用于“复杂任务规划和企业自动化”,而非通用聊天。这种区别至关重要:为智能体优化的模型与为问答基准测试优化的模型运行方式不同。

美团 CEO 王兴概述了三层 AI 战略:AI at Work(提升内部运营)、AI in Products(提升面向客户的功能)以及 Building LLMs(基础层)。LongCat-2.0 属于第三层。如果没有一个自主可控的基础模型,前两层将依赖于他人的基础设施,这在美团所处的竞争格局中是不可接受的。

美团 LongCat 模型家族已经投入实际部署。美团的 AI 订餐助手“小美”运行在 LongCat 上,处理语音点餐和餐厅预订。公司的食品安全监控系统“星目”利用 AI 全天候扫描合作餐厅的厨房监控。这些不是研究原型,而是每天在 LongCat 上大规模运行的生产负载。

为什么一家外卖公司要训练万亿参数模型?

显而易见的问题是:为什么一个外卖平台要构建全球最大的语言模型之一?

答案并不是美团想要成为一家 AI 实验室,而是美团正努力不被时代淘汰。

美团平台上的每一次交互——用户订午餐、商家管理菜单、骑手穿梭于城市街区——都是一个可以被 AI 优化或颠覆的决策闭环。美团目前通过自己的系统处理这些闭环。但如果竞争对手的 AI 智能体能够比美团平台更精准地理解用户口味、与餐厅沟通并派发订单,美团将失去其中介地位。

当 AI 智能体成为消费者与服务之间的主要接口时,任何缺乏自有模型的平台都将不得不依赖于他人的模型。

美团的规模让这一点变得具体:公司每天处理数千万个配送订单,管理数十万家餐厅,并实时调度遍布中国数十个城市的骑手。嵌入这些业务中的 AI 决策是其核心资产。如果 LongCat 能够比租用的第三方通用模型更快、更准地做出这些决策,那么这笔投资就是值得的。

美团对 AI 的押注也是对中国超级 App 市场竞争态势的一种防御。阿里巴巴、腾讯和字节跳动都拥有各自的基础模型。对于美团来说,如果没有自己的模型,在 AI 驱动的推荐、定价和物流已成为核心竞争变量的市场中,将处于结构性劣势。

美团此前发布的开源模型 LongCat-Flash 在 2025 年发布时,曾被 VentureBeat 评价为在某些任务上足以媲美 GPT-5。LongCat-2.0 的参数量几乎翻了一番,并转为受邀访问模式,这表明美团正从社区建设转向商业化部署。

真正的重点是芯片,而非模型

LongCat-2.0 的参数量固然重要,但关于这个模型更具深远意义的事实是它所使用的训练资源。

自 2022 年以来,美国逐步限制向中国出口 AI 芯片:先是 A100,接着是 H100 和 H800,然后是 H20。其政策逻辑是一致的:先进的 AI 训练需要先进的 GPU 硬件;限制了硬件,就限制了能力。其隐含的假设是,如果没有 NVIDIA 最强大的芯片,中国就无法开发出前沿水平的 AI。

LongCat-2.0 使用了 5 万到 6 万张国产计算卡训练出了一个万亿参数模型。4 月 24 日,DeepSeek 独立完成了同样的操作,实现了 1.6 万亿参数,同样是基于 Huawei Ascend 芯片。这不是同一个事件:两家独立的公司,两次独立的训练运行,两种独立的架构。这是独立的验证,证明了国产硬件与 NVIDIA 级别训练硬件之间的差距已经缩小到足以训练前沿级模型的程度。

硬件背景在这里至关重要。Huawei 的 Ascend 950PR 在 FP4 精度下每张卡提供 1.56 petaflops 的算力,大约是 NVIDIA H20(目前美国政策允许进入中国的芯片)FP4 性能的 2.8 倍。据报道,ByteDance 已投入 5.6 亿美元订购 Ascend 芯片。Alibaba Cloud 和 Tencent 也已下达了大量订单。行业预测显示,2026 年中国对 Huawei Ascend 芯片的总需求可能达到 120 亿至 150 亿美元。

但警告也是现实存在的:总算力(aggregate flops)和有效算力(efficient flops)是两回事。以 MFU(模型算力利用率)等指标衡量的国产硬件集群训练效率,仍落后于 NVIDIA H100 配置。Meituan 和 DeepSeek 均未公布详细的效率指标,这使得直接比较变得困难。增加芯片数量可以部分补偿单芯片效率较低的问题,但这种补偿不是无限的。

LongCat-2.0 目前也处于受邀测试阶段,尚未公布公开基准测试结果。DeepSeek V4 发布了技术报告,而 LongCat-2.0 还没有。在没有标准基准测试的独立性能评估的情况下,万亿参数的头条新闻只是一个硬件层面的声明,而非能力层面的声明。

即便如此,中国应对技术差距的历史轨迹值得铭记。中国的太阳能电池板行业起步时显著落后于西方制造商;到 2020 年,中国制造商控制了全球约 75% 的太阳能产能。其路径不是追赶西方技术,而是通过规模化突破限制。AI 芯片是否会遵循类似的轨迹,是技术政策中最具影响力的悬而未决的问题之一。

Meituan 是如何走到这一步的:LongCat 模型时间线

LongCat-2.0 并非凭空出现。美团在过去八个月中通过一系列快速发布的公开版本逐步构建了它,每一个版本都比前一个版本更强大,且经过了更充分的公开测试。

该系列始于 2025 年 9 月 1 日发布的 LongCat-Flash-Chat,这是一个拥有 5600 亿参数的开源混合专家模型(Mixture-of-Experts),同时在 GitHub、Hugging Face 和美团自有的模型平台上发布。该模型平均每个 token 仅激活约 270 亿参数,在保持巨大总参数量的同时降低了推理成本。在智能体基准测试中,LongCat-Flash-Chat 在 IFEval(指令遵循评估,得分 89.65)和多工具智能体基准测试 VitaBench 中均排名第一。LMSYS 在当天发布了使用 SGLang 运行该模型的部署指南,标志着该模型在发布时就已具备生产就绪能力。

三周后,即 2025 年 9 月 23 日,美团发布了 LongCat-Flash-Thinking,这是基于同一 5600 亿 MoE 架构的推理增强变体。Flash-Chat 侧重于优化智能体任务的完成,而 Flash-Thinking 则专为处理难题时的扩展思维链(chain-of-thought)推理而构建。VentureBeat 当时的报道称其在某些推理任务上足以媲美 GPT-5,这帮助美团确立了其作为严肃 LLM 开发者而非仅仅将 AI 视为副业公司的公信力。

2026 年 1 月的发布增加了更多深度。LongCat-Flash-Thinking-2601(技术报告:arxiv 2601.16725,发布于 2026 年 1 月 23 日)成为首个具有“重思考模式”(Re-thinking Mode)的全开源模型,在确定答案前可同时激活八条并行推理路径。在智能体基准测试中,它在 BrowseComp 上达到 73.1%,在 RWSearch 上达到 77.7%,在 tau-squared-Bench 上达到 88.2%,在三项测试中均达到了开源模型的领先水平(state-of-the-art)。美团同时发布了配套变体 LongCat-Flash-Thinking-ZigZag,引入了 LongCat ZigZag Attention (LoZA),这是一种稀疏注意力机制,旨在不降低准确性的情况下加快长上下文输入的推理速度。

在此基础上,LongCat-2.0-Preview 代表了架构上的重大飞跃:总参数量从 5600 亿跃升至超过 1 万亿,上下文窗口扩展到 100 万个 token,且该模型不再开源。这种闭源转向表明美团将 2.0 视为一款商业产品,而非社区贡献。

LongCat-2.0 对标 DeepSeek V4:这对中国 AI 意味着什么

LongCat-2.0 与 DeepSeek V4 的对比揭示了中国 AI 生态系统正在如何分层。

DeepSeek V4 是一款旨在走向全球的实验室产品:总参数量 1.6 万亿,完全开源,并配有 已发布的模型技术报告以及正由全球开发者评估的基准测试结果。DeepSeek 的策略是最大程度的透明化,让模型性能向所有人证明其实力。

LongCat-2.0 是一款专为国内部署打造的平台产品:采用受邀访问模式,针对 Agent 进行了优化,基准测试结果尚未公开。美团并非在争夺“中国最强 LLM”的头衔。它正在构建其大规模支撑自身业务所需的模型,并可能将其授权给面临类似基础设施决策的其他中国平台。

这种差异化比任何单一的基准测试都能更清晰地说明中国 AI 生态系统的走向。DeepSeek 是开源前沿的挑战者。美团 LongCat 是平台运营商的基础设施。百度的 ERNIE 是搜索公司的企业支柱。它们并非在争夺同一个奖项。

它们的共同点在于芯片故事。这些模型中的每一个都拥有不依赖 NVIDIA 的训练基础设施。就在 18 个月前,这还被广泛认为是不可能实现的前沿级训练。在 2026 年 4 月的一周内,两次基于国产芯片的独立万亿参数训练运行,让这一假设显得过时了。

随着这类 AI 工具成为日常企业工作流的一部分,各行各业的专业人士正在构建系统,以便从多个 AI 源中捕获、连接和检索知识。西方与中国 AI 生态系统之间日益扩大的分歧意味着,相关信息越来越多地出现在不同的模型家族、语言和平台中,这使得跨源综合比以往任何时候都更加重要。

LongCat 的下一步以及 AI 出口管制辩论

在短期内,最重要的信号将是 LongCat-2.0 是否开放更广泛的测试并发布基准测试对比。美团在 LongCat-Flash 上的表现表明,在受邀访问的帷幕背后确实具备实力。但“受邀访问”意味着目前的验证是按美团的规则进行的。

在业务方面,小美 Agent 的更新如果整合了 LongCat-2.0 增强的推理能力,将成为首个真实世界的性能测试。美团平台上的语音下单和推荐是否有显著提升,是衡量该模型价值比任何学术基准测试都更务实的标准。

对于美国政策制定者来说,4 月 24 日这一周提出了一个更难的问题:如果芯片出口管制的目的是阻止中国训练前沿级 AI 模型,而两家独立公司在同一周使用国产硬件做到了这一点,那么政策的下一阶段会是什么样子?选项缩小到软件层限制、CUDA 替代方案、编译器工具链、模型权重本身,而这些都带有不同的权衡。

对于追踪 AI 基础设施的开发者和公司而言,LongCat-2.0 的发布以及 DeepSeek V4 在华为芯片上的训练成果标志着一个值得关注的节点:前沿 AI 模型训练必须依赖特定供应商硬件的时代可能正在结束。取而代之的是一个更加碎片化但也更具竞争力的全球 AI 基础设施,而这种碎片化所带来的影响仍在不断显现。

这种碎片化的意义超越了地缘政治。当 AI 基础设施分裂为两个截然不同的硬件生态系统时,依赖 AI 进行关键决策的机构面临着一个新的规划问题:两年后,最优秀的模型将在哪个生态系统上运行?美团的做法——在国产硬件上构建自研基座模型——提供了一个答案。这种策略赌的是:基础设施层面的垂直整合比依赖任何单一外部供应商更能提供长期稳定性。

随着 AI 工具在不同生态系统中激增,处理信息密集型工作流的专业人士越来越需要跨平台连接知识的方法。当 AI 领域本身日益多样化时,支持跨不同来源进行AI 知识管理的工具变得愈发实用。

常见问题解答:关于 LongCat AI 和美团模型的常见问题

什么是 LongCat AI?

LongCat AI 是美团的大语言模型系列。当前版本 LongCat-2.0-Preview 是一款针对智能体(agent)工作流优化的万亿参数级模型,于 2026 年 4 月发布并开启邀测。

LongCat-2.0 开源吗?

不开源。与之前作为开源模型发布的 LongCat-Flash 不同,LongCat-2.0-Preview 目前处于受控访问的邀测阶段。开发者可以通过 LongCat API 平台申请测试。

LongCat 与 DeepSeek V4 相比如何?

两者均在同一天(4 月 24 日)发布,且均在国产硬件上训练。DeepSeek V4 规模更大(1.6T 对比 1T+ 参数),且完全开源并公布了基准测试数据。LongCat-2.0 专注于平台和智能体(agent)使用场景,其基准测试尚未公开。

美团为什么要训练这么大的模型?

美团的核心业务(外卖和本地服务)越来越多地由围绕物流、推荐和商家管理的 AI 决策驱动。在阿里巴巴、腾讯和字节跳动等竞争对手都拥有各自基础模型的市场中,构建专有模型让美团能够掌控其 AI 基础设施。

美团使用了哪些国产芯片?

美团确认使用了 50,000-60,000 块国产计算卡(根据 Phemex reporting),但尚未公开指明芯片制造商或型号。行业分析师指出,基于美国出口管制后中国可用于大规模训练的硬件情况,Huawei Ascend 或 Cambricon 是最有可能的硬件。美团在未披露芯片细节的情况下完成了运行,这一事实表明该公司将硬件栈视为竞争资产,而不仅仅是值得公开分享的物流细节。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page