top of page

Meta 在签署其迄今最大 NVIDIA 交易数周后部署 MTIA 芯片

Meta 于 2026 年 3 月将其自有的 MTIA 300 芯片投入生产,就在签署扩大协议购买数百万块 NVIDIA GPU(包括下一代 Vera Rubin 系统)几周后。这一时机看似矛盾。事实并非如此。

MTIA(Meta Training and Inference Accelerator)300 现已负责 Facebook、Instagram 和 WhatsApp 的排序与推荐推理——这些算法决定你在动态消息中看到的内容以及遇到的广告。这些工作负载规模庞大,即使每次查询的微小成本改进也意义重大。Meta 表示,与同等 GPU 部署相比,该芯片将其生产模型的总拥有成本降低了 44%。

使 2026 年 3 月的公告与众不同的是规模。除了 MTIA 300 的部署,Meta 还公布了另外三代产品——400、450 和 500——并计划在 2027 年之前以每六个月一代的节奏发布。随后在 4 月 14 日,Meta 与 Broadcom 正式达成合作开发协议,承诺部署超过 1 吉瓦的定制芯片,并计划到 2027 年扩展至数吉瓦。

一周后,即 4 月 22 日,Google 发布了 TPU 8t 和 TPU 8i——分别为训练芯片和推理芯片,这是该项目十年来首次分开开发。全球三大 AI 支出方中的两家采取了不同方法,却得出了一个共同结论:AI 基础设施的推理层已不再默认属于 NVIDIA。

发生了什么:四款芯片,一个截止日期

2026 年 3 月 11 日,Meta 发布了four-chip MTIA roadmap,承诺到 2027 年每六个月发布一款新的定制 AI 加速器。这一节奏——大约是行业标准(每代 1-2 年)的三到四倍——本身就让此次公告与典型的研究披露截然不同。

MTIA 300 已上线。它正在生产环境中运行 Meta 的排序与推荐工作负载:十多年来,这些系统一直运行在 NVIDIA GPU 上。Meta 已在实验室完成 MTIA 400 的测试,并表示其正走向数据中心部署。MTIA 450 和 MTIA 500 分别计划于 2027 年初和 2027 年底大规模部署。

四代产品的技术进步显著。从 MTIA 300 到 MTIA 500,Meta 报告 HBM 内存带宽提升 4.5 倍,计算 FLOPs 提升 25 倍。MTIA 450 特别宣称其 HBM 带宽“远高于现有领先商用产品”——这一描述指向 NVIDIA 的 H100 和 H200。MTIA 500 在 450 的基础上再增加 50% HBM 带宽,以及高达 80% 的 HBM 容量。

在基础设施方面,一个 Meta 数据中心机架可容纳 72 块 MTIA 400 芯片,符合 OCP(Open Compute Project)标准。这一对齐很重要:它意味着这些芯片可以直接插入 Meta 现有的数据中心建设中,无需新的物理基础设施。模块化机架布局也是实现六个月开发节奏的机制——每一代新产品无需从头重新设计物理结构。

随后在 4 月 14 日发布了 Broadcom 合作公告。该交易正式确定使用 2 纳米工艺共同开发所有四代 MTIA 产品——与 NVIDIA 即将推出的 Blackwell Ultra 采用相同制程。Broadcom CEO Hock Tan 在财报电话会议中回应了分析师对 Meta 执行能力的质疑。“与近期分析师报告相反,Meta 的定制加速器 MTIA 路线图一切正常,”Tan 表示。“我们正在出货,对于下一代 XPU,我们将在 2027 年及以后扩展至数吉瓦。”

来自制造合作伙伴的公开声明不仅仅是一份新闻稿。它是负责交付芯片的公司 CEO 针对具体时间表做出的书面承诺。

这一切并非独立于 Meta 与 NVIDIA 的关系。2026 年 2 月,就在MTIA 300 deployment前几周,Meta 宣布扩大与 NVIDIA 的合作,购买数百万块额外 GPU 和独立 CPU。这两件事同时为真。这正是重点所在。

为什么重要:推理是资金流向之处

Meta 引用的 MTIA 生产环境的 44% TCO 数据并非基准测试结果,而是来自实际部署的工作负载运行其生产模型。在 Facebook、Instagram 和 WhatsApp 的规模——数十亿用户每天产生数千亿次内容排序和广告定向推理请求——这一成本降低相当于每年节省数亿美元的 GPU 支出。

真正重要的不是 Meta 制造了一款芯片,而是 Meta 制造了一款芯片并在这一规模下运行其关键生产系统。

大型科技公司的定制芯片项目是常见愿景。但将定制芯片生产化并处理创收关键工作负载达到超大规模的情况很少见。Apple 的 M 系列芯片取得了成功。Google 自 2016 年起就在生产环境中运行 TPU。Amazon 的 Inferentia 和 Trainium 芯片处理特定的 AWS 推理和训练任务。但大多数企业定制芯片项目都止步于“我们在实验室验证了它”与“它正在运行我们的实际业务”之间的差距。

Meta 的 MTIA 300 跨越了这一界限。它不是在运行实验性工作负载,而是在运行负责资助公司的广告展示的推荐算法。

更广泛的行业影响源于一个具体的架构洞见。训练和推理具有根本不同的成本结构。训练前沿模型需要通过高带宽互连移动海量数据,同步协调数千块芯片,并以峰值计算吞吐量持续运行数周。NVIDIA 的生态系统——H100 和 Blackwell 硬件、NVLink 互连、数十年来优化的 CUDA 内核——对于这种工作负载配置目前没有近期的替代方案。

推理则不同。已部署的模型以固定权重应对传入查询。约束不是峰值计算——而是每次查询将模型权重加载到计算单元的速度。这使得 HBM 内存带宽成为关键变量,因此 Meta 的 MTIA 架构专门针对这一点进行优化,而不是最大化原始 FLOPs。

对于企业基础设施团队和跟踪 AI 部署成本的工程师来说,实际信号很直接:随着顶级市场定制芯片压力的增加,推理成本将继续下降。Meta、Google、Amazon 和 Microsoft 都在构建针对其特定生产工作负载优化的替代方案,这将对 NVIDIA 在推理硬件上的利润率形成结构性压力。AI 推理的云 API 定价将在 18 至 24 个月内反映这一变化。

NVIDIA 不介意的部分:为什么 Meta 仍购买了数百万块他们的芯片

Meta 芯片公告中嵌入的一个令人不安的细节是:就在部署 MTIA 300 的同一个月,Meta 正在敲定一份比以往任何单笔协议都购买更多 NVIDIA GPU 的交易。这两个决定都是有意的。要理解原因,需要拆解每款芯片实际的作用。

Meta 的 AI 基础设施策略不是定制与 NVIDIA 的对立,而是定制用于推理,NVIDIA 用于训练。这种工作负载分离是理解这一从外部看似乎矛盾的策略的关键。

在最前沿规模训练大型语言模型需要通过低延迟互连同步数千块加速器,以持续峰值吞吐量运行浮点运算数周,并使用拥有数十年优化实现的软件生态系统。NVIDIA 的 NVLink 结构、CUDA 库以及 Blackwell 架构的原始 FLOPs 对于这种配置确实难以复制。没有哪家超大规模提供商在最前沿模型训练上真正取代了 NVIDIA——Google 的 TPU、Amazon 的 Trainium 以及 Meta 的 MTIA 均未做到。工作负载要求太高,生态系统依赖太深。

推理则相反。一旦模型训练完成,针对生产查询运行它意味着在可变输入上操作固定模型权重。权重在请求之间不会更新。模型在查询之间不会改变。访问模式是可预测的。关键约束——HBM 带宽——可以由专门为该工作负载设计的芯片直接优化,而不是为通用 GPU 必须保持的最坏情况灵活性而设计。

MTIA 的架构直接反映了这些权衡。与到处使用昂贵的高带宽 HBM 堆栈(训练芯片因其突发、高带宽操作而需要这种方法)不同,MTIA 2 使用大型 SRAM 缓存与 LPDDR 内存的组合。这是一种更便宜的架构,能很好地匹配推理内存访问模式。这种权衡在通用基准测试中不可见,但在生产成本中具有决定性。

Broadcom 合作解决了该项目面临的一个真实问题。2026 年初,分析师报告流传称 Meta 在按计划将新一代 MTIA 推向市场方面遇到困难。Hock Tan 在财报电话会议上的公开声明是对此的直接、书面反驳。一位 CEO 自愿在财报电话会议上点名回应负面分析师猜测,这是不寻常的举动。它反映了该合作对 Broadcom 自身收入故事以及 Meta 的重要性。

话虽如此,执行风险是真实存在的。在 2 纳米工艺节点上实现六个月的芯片开发节奏,即使对于拥有 Broadcom 制造关系的公司来说也是雄心勃勃的。每一代都需要跨 Meta 基础设施进行硅验证、固件工作和软件栈集成。Meta 描述的模块化设计复用策略——新一代产品插入相同的物理机架布局——是关键的支撑假设。如果芯片架构需要在各代之间显著分化,这一假设就会失效,节奏就会放缓。

还有一个范围问题。MTIA 300 运行推荐推理——Meta 十多年来一直大规模运营的工作负载,具有成熟的模型架构和可预测的访问模式。MTIA 400 至 500 代被描述为处理 GenAI 推理:Meta AI 助手响应、图像生成以及最终 Meta 向消费者发布的任何前沿模型背后的系统。

GenAI 推理在结构上不同于推荐推理。请求模式变化更大。有效批次大小波动。模型大小根据任务从小型到超大型不等。适用于固定推荐模型的优化策略可能无法干净地迁移到具有动态批次组成的变长生成。

截至本文撰写时,Meta 尚未在生产环境中部署用于 GenAI 推理的 MTIA 芯片。这一里程碑——预计在 2026 年随 MTIA 400 推出——是检验该架构是否能推广到推荐之外的真正考验。

对 NVIDIA 来说,战略算盘是可控的。Meta 的定制芯片取代了 GPU 推理工作负载,但 Meta 扩大的 NVIDIA 交易涵盖训练。NVIDIA 的 Blackwell 和 Vera Rubin GPU 在正因为最前沿规模的训练任务没有定制替代方案而以溢价利润出售。在超大规模提供商处失去推理份额的同时增加训练收入,是 NVIDIA 可以接受的权衡——至少在未来两到三年内。

NVIDIA 无法接受的情况是定制推理芯片发展成为训练替代方案。当前一代 ASIC 项目均未声称针对最前沿训练。训练 4000 亿参数模型所需的架构与推理优化确实不同。这一界限目前保护了市场的两端。

Meta 的方法与 Google、Amazon 和 Microsoft 的比较

超大规模提供商芯片军备竞赛有四名参与者,它们的策略在理解市场走向方面存在差异。

Google 于 4 月 22 日宣布TPU 8t and TPU 8i,做出了 Meta 尚未做出的结构性选择:为训练和推理分别设计芯片架构。TPU 8t 专为大规模训练集群设计——每个超级 Pod 9600 块芯片,通过 Google 专有的 ICI 互连可扩展至 100 万块芯片,提供 121 FP4 exaflops 峰值性能。TPU 8i 针对推理延迟和吞吐量优化,围绕不同的内存和计算权衡构建。

Google 在架构层面拆分了其芯片产品线。Meta 则有一个单一的 MTIA 家族,跨代演进。这是关于训练和推理工作负载是否会随时间分化到需要从一开始就使用单独硅的程度的不同赌注。

Google 的方法为每种工作负载提供了更多优化空间,但代价是两条独立的开发和制造轨道。Meta 的方法提供了更简单的产品线和跨所有代的共享物理布局,但代价是为两种工作负载提供足够服务但均非最优的架构妥协。

Amazon 介于两者之间。其 Inferentia 芯片自 2018 年起已在 AWS 中处理特定推理工作负载,建立了超大规模提供商定制推理芯片中最长的生产记录。Trainium 处理选定的训练任务。两款芯片均未达到 Meta 为其自有消费者工作负载承诺的 MTIA 部署规模——但 Amazon 在定制推理芯片生产化方面拥有十年的运营经验优势。

Microsoft 仍是四家中对 NVIDIA 依赖最深的。其 Maia 芯片项目存在,早期版本已进行测试,但该公司尚未做出与 Meta 的 1 吉瓦目标或 Amazon 的多年 Inferentia 记录相当的部署承诺。Microsoft 通过 Azure AI 基础设施与 NVIDIA 的深度集成,使得快速采用定制芯片在结构上更难执行。

根据 Benzinga 的分析,Meta 的举措代表“从 NVIDIA 依赖的转变,而非取代”。初始 1 吉瓦承诺的推理密集性质意味着,2026 年至 2028 年 Meta 基础设施中最便宜的可用推理容量将越来越多地位于定制芯片上——但 NVIDIA 保留了训练层,而这是前沿模型开发发生的地方。

接下来:重要的部署里程碑

最近期的考验是 MTIA 400 实现全面生产部署。Meta 表示其已在 2026 年 3 月完成实验室测试。与专注于排序和推荐推理的 MTIA 300 不同,MTIA 400 还计划处理 GenAI 推理工作负载。如果该部署按计划进行,这将是 Meta 的定制芯片首次处理与云环境中 NVIDIA H100 级硬件运行的推理类型直接可比的推理。

该部署中重要的性能声明不是技术规格。而是 MTIA 400 是否能以与 GPU 部署相同的质量阈值服务 Meta AI 查询,同时保持或改进 MTIA 项目在推荐方面已展示的 44% TCO 优势。

对于 2027 年,MTIA 450 和 MTIA 500 代表了更雄心勃勃的声明。如果 450 声称的 HBM 带宽优于 NVIDIA 的 H100 和 H200 在生产 GenAI 推理规模上成立,这将标志着一个有意义的拐点:定制推理芯片在最重要的工作负载中超越了市售最佳 GPU 的内存带宽。MTIA 500 进一步推进——比 450 多 50% HBM 带宽,加上高达 80% 的 HBM 容量。

这些声明是否成立取决于三个复合变量:2 纳米工艺的量产良率、Meta 在没有硅错误或验证延迟的情况下维持六个月开发节奏的能力,以及 2027 年 Meta 的 GenAI 模型架构是否与 MTIA 500 所围绕的内存层次结构兼容。每个变量都引入了执行风险,而六个月的节奏几乎没有吸收空间。

在市场方面,更广泛云生态系统中推理成本影响的时间线是 18 至 24 个月。在 2026 年和 2027 年部署吉瓦级定制推理芯片的超大规模提供商,其每 token 成本在结构上将低于使用商品 GPU 基础设施的提供商。这一优势最终将体现在云 AI API 定价以及提供推理即服务的提供商之间的竞争动态中。

NVIDIA 的训练主导地位似乎在 2020 年代末之前保持稳定。CUDA 的生态系统深度、NVLink 的互连优势以及 Blackwell 和 Vera Rubin 硬件的原始性能为其提供了定制推理 ASIC 目前无法威胁的护城河。

开放的问题是,这一护城河是否会随时间延伸到推理原生软件工具,或者市场是否会逐渐开发 ASIC 优化的推理栈,从而在定制芯片已展示出有意义成本优势的这一工作负载细分中侵蚀 NVIDIA 的软件优势。

Meta MTIA 芯片推出与 NVIDIA 作为训练供应商的并行扩张并非相互竞争的故事。它们是同一个故事:AI 基础设施正在训练与推理的工作负载边界上分裂,而每一半的经济学正由不同的硬件决策决定。

对于building on AI infrastructure的工程师和技术团队来说,跟踪这一分裂是日益重要的背景——不仅是为了跟进行业新闻,也是为了做出在 2027 年看起来与今天不同的架构决策。Meta 的六个月芯片节奏意味着这一格局变化速度快于年度技术评论所能捕捉的。保持领先的团队是那些综合他们已经在阅读的内容的团队,而不是每次新闻变化时都从头开始的团队。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page