top of page

Google TPU 8 来了。它并没有取代 NVIDIA。这才是重点。

6月5日
讀畢需時 9 分鐘

Google 在 Cloud Next 2026 上推出了两款新的 AI 芯片:用于模型训练的 TPU 8t 和用于推理的 TPU 8i。性能数据非常惊人。单个 TPU 8t superpod 将 9,600 个芯片集群在一起,提供 121 ExaFLOPS 的计算能力和两 PB 的共享内存。推理芯片的每美元性能比去年的型号高 80%。而在 Google 张量处理单元八代历史中,该公司首次明确将这些芯片定位为在外部市场与 NVIDIA 竞争的产品。

Google 在 Cloud Next 2026 上还宣布了一件事:NVIDIA 的下一代 Vera Rubin 芯片将于今年晚些时候在 Google Cloud 上提供。

这两项公告并不矛盾。它们就是策略。Google 并非试图将其数据中心中的 NVIDIA 排除在外,而是试图减少自身基础设施对 NVIDIA 的依赖,并将这种降低依赖的基础设施出售给希望以更低成本获得 AI 计算的企业客户。这是否奏效,取决于芯片规格之外的一个软件生态系统问题,而 Google 已经为此努力了十年。

发生了什么:两款芯片,一次战略押注

Google 于 2026 年 4 月 22 日在 Cloud Next 2026 上发布了这两款芯片。正如 Google 的官方公告 所述,这些是“面向代理时代的两款芯片”。这一表述表明,该架构是围绕代理 AI 系统的推理需求设计的,而非此前一代所定义的批量训练工作负载。此次发布与两天后宣布的 Google 400 亿美元 Anthropic 投资同步,将这一周定位为 Google 对 AI 基础设施走向的最广泛单一声明。

TPU 8t 训练芯片专为规模而生。根据 Google 的技术深度解析,每颗芯片配备 216 GB 高带宽内存,运行速度达 6.5 TB/s,128 MB 片上 SRAM,以及 12.6 petaFLOPS 的 FP4 计算能力。superpod 配置可扩展至 9,600 颗芯片和两 PB 共享高带宽内存,总计提供 121 ExaFLOPS。Google 表示,该系统可扩展至超过一百万颗芯片的集群,并实现近线性扩展,目前任何商用 GPU 结构都无法匹敌这一配置。

TPU 8i 推理芯片解决了不同的问题。它配备 288 GB 高带宽内存,速度达 8.6 TB/s,以及 384 MB 片上 SRAM,是上一代的三倍。大容量 SRAM 使大型模型的活跃工作集在推理期间完全保留在片上,消除了每次 token 生成时从 HBM 加载权重的延迟。该芯片采用新的 Collective Acceleration Engine,可卸载分布式推理通信,即在大规模多芯片推理集群中主导同步开销的 all-reduce 和 all-gather 操作。

正如 CNBC 报道,与上一代(Ironwood TPU)相比,两款芯片的训练性能约为 2.8 倍,推理每美元性能提升 80%。两者均将于 2026 年晚些时候在 Google Cloud Platform 上全面开放,可作为独立实例或 Google AI Hypercomputer 全栈平台的一部分进行访问。

为何架构拆分比规格更有趣

构建两款独立芯片而非一款兼顾两者的芯片,是 Google 本周宣布的最具影响力的举措。

多年来,NVIDIA 的 H100 GPU 一直充当 AI 基础设施的瑞士军刀:可用于训练、推理、研究和微调。这种通用性正是其市场力量的来源。如果有一款芯片能做所有事,那么你只需要购买这一款芯片。CUDA 软件生态系统强化了这一点:数千个 AI 框架、训练库和推理引擎都针对 CUDA 进行了优化,这意味着它们在 NVIDIA 硬件上运行最佳。

Google 将 TPU 8 拆分为训练芯片和推理芯片的决定,是对这种通用性的架构反驳。它表明:训练万亿参数模型的最佳芯片,与同时为千万用户提供模型服务的最佳芯片并不相同。训练需要巨大的计算能力、大容量内存,以及跨数千颗芯片进行梯度同步的最大带宽。推理则需要大容量片上 SRAM 以将热模型层保持在计算附近、低延迟的集体通信,以及在持续吞吐而非峰值吞吐下的效率。

NVIDIA 的应对是在产品线层面而非芯片层面进行专业化。H100 和 H200 是通用型产品,而 L40 等推理专用产品则面向更低成本的推理部署。但 L40 并非像 TPU 8i 那样从零开始专为大型模型推理而设计。

市场也在凭借自身动力向 Google 的方向发展。2026 年定制 AI 硅片出货量预计增长 45%,而通用 GPU 出货量增长约 16%。Amazon 的 Trainium、Microsoft 的 Maia、Meta 的 MTIA 以及 Apple 的 Neural Engine 都在向类似的专业化方向发展。Google 在部署规模上领先于大多数,但这一架构方向已成为行业共识。

真正的竞争不是硬件,而是软件。

以下是 Google TPU 雄心面临的现实困境。

NVIDIA 没有硬件护城河。它有软件护城河。

CUDA(NVIDIA 的并行计算平台和编程模型)自 2012 年以来一直是主流 AI 开发接口。在此期间,已有超过 4,000 个主要 AI 和机器学习工具构建在 CUDA 上运行。PyTorch、TensorFlow、JAX、Hugging Face Transformers 以及几乎所有生产推理引擎都默认将 CUDA 作为主要后端。训练和部署大型模型的组织已将其工程工作流构建在兼容 CUDA 的硬件之上。

Google 的 TPU 运行在 JAX 和 XLA(Accelerated Linear Algebra)之上,这两者最初均由 Google 开发。JAX 功能强大且越来越多地用于前沿研究,但其周边生态系统规模仅为 CUDA 生态系统的一小部分。从 NVIDIA 基础设施切换到 TPU 基础设施不仅仅是采购决策。它需要重写或移植软件栈、在新硬件上重新验证模型性能,并重新培训那些在 CUDA 上积累专业知识的工程团队。

正如 TechCrunch 指出,这种迁移成本是 TPU 大规模采用的真正障碍。Google 的 TPU 8 公告中并未包含解决 CUDA 生态系统兼容性的新重大举措。该公司继续投资于改进 JAX 和 XLA,而不是构建一个兼容层,使 CUDA 原生代码无需修改即可在 TPU 上运行。

这就是为什么 Motley Fool 的评估在短期内可能是正确的:这些芯片将通过减少对 NVIDIA 采购的依赖来帮助 Google 自身提高利润率,但它们在 2026 年不会显著削弱 NVIDIA 的数据中心主导地位。最有可能从切换到 TPU 8 中受益的公司是那些已经在 JAX 上从头构建新工作负载的公司,或者那些模型规模大到足以证明迁移成本合理的公司。Anthropic 作为因其新基础设施协议而成为原生 Google TPU 客户的公司,是最清晰的例子。

Google 究竟在竞争什么

如果 TPU 8 并非旨在取代市场上的 NVIDIA,那么它的设计目的是什么?

诚实的答案是,Google 正在为未来十年而非今年竞争。

当今的 AI 训练市场由前沿模型训练主导,规模几乎高于一切。Anthropic、OpenAI、Google、Meta 等少数公司是主要客户。他们需要最强大的芯片,并愿意为此支付任何代价。NVIDIA 通过硬件性能和软件生态系统惯性占据了该市场的大部分份额。

推理市场则不同。推理是 AI 模型成为产品的地方:每一次 API 调用、每一次聊天机器人交互、每一次代码补全、每一次文档摘要都是推理工作负载。随着 AI 采用从训练少数前沿模型扩展到服务数十亿用户,推理将成为比训练大得多的计算市场。2024 年的一项分析估计,到 2026 年,推理将占 AI 计算总支出的 60% 以上。按此衡量,更大的市场正是 Google TPU 8i 专门设计要赢得的市场。

成本优势在此至关重要。在可比服务工作负载下,Google TPU 在标准 9,000 芯片规模下的运行成本约为 NVIDIA GPU 的一半。对于 24/7 运行大型模型推理集群的企业来说,50% 的计算成本降低是运营支出上的显著差异。Meta 协商租用 Google Cloud TPU 并最终在自身数据中心部署,表明至少有一家主要 AI 基础设施买家认为迁移成本值得换取运营节省。

Google 的预测激进:2026 年约出货 430 万颗 TPU 单元,到 2028 年扩展至 3,500 万颗。如果这些预测准确,且即使只有一部分新推理部署转向 TPU 8i 而非 NVIDIA,到 2028 年推理细分市场的动态可能与今天大不相同。

TPU 与 GPU 的动态在规模与成本的特定交汇点上最为重要。对于运行少于数千颗芯片推理的公司,NVIDIA 的生态系统优势超过 Google TPU 的成本优势。对于运行数万颗芯片或更多推理的公司,尤其是那些构建需要极低延迟生成每个 token 的代理 AI 系统的公司,TPU 8i 的架构专为该用例而设计,而通用 GPU 则不然。问题在于第二类客户增长的速度有多快。

这对 NVIDIA 和企业买家意味着什么

NVIDIA 对 TPU 8 公告的公开回应基本上是继续做它已经在做的事。

正如 Motley Fool 指出,Google 同时宣布 NVIDIA 的 Vera Rubin 芯片将于 2026 年晚些时候在 Google Cloud 上提供。这种 AI 竞争对手与 AI 芯片供应商在同一云平台上共存的伙伴关系,反映了当前市场状况:NVIDIA 在企业软件生态系统中根深蒂固,Google 无法放弃它,而需要 CUDA 兼容工作负载的 Google Cloud 客户即使在 Google 扩展自身硅片产能的同时,也将继续在 NVIDIA 硬件上运行。

对于 2026 年评估 AI 基础设施的企业买家而言,TPU 8 公告提供了比一年前更具体的选择。训练芯片的规模和性能足以支持前沿规模的模型开发。推理芯片解决了大规模部署大型语言模型的具体瓶颈。而 Google Cloud 同时提供自有芯片和 NVIDIA 硬件的意愿,为企业客户提供了可选性,而非强迫二选一。

任何考虑这些芯片的企业面临的实际问题是软件组合。如果你的 ML 团队工作流构建在带 CUDA 扩展的 PyTorch 上,迁移到 TPU 8 将是一个为期数月的工程项目。如果你的团队正在从零开始构建新推理容量,或已在使用 JAX,那么 TPU 8 的成本节省和规模优势确实具有吸引力。

Google 自己的时间表表明,转型将是渐进的而非突然的。该公司预计 2026 年约出货 430 万颗 TPU 单元,到 2028 年扩展至 3,500 万颗。如果这些预测成立,TPU 在 AI 芯片市场的份额将显著增长。但 NVIDIA 并未止步:Vera Rubin 预计将比 H200 带来实质性改进,而 CUDA 生态系统也在持续扩展。两家公司很可能在可预见的未来在大多数大型企业中共存,TPU 在全新推理部署中获得份额,而 NVIDIA 则保留其在现有训练工作流中的地位。

FAQ:关于 Google TPU 8 与 NVIDIA 竞争的常见问题

Google TPU 8 究竟是什么,与之前的 TPU 有何不同?

TPU 8 是 Google 定制 AI 芯片的第八代,于 Cloud Next 2026 发布。与前几代的关键区别在于拆分为两款专用芯片:用于模型训练的 TPU 8t 和用于推理的 TPU 8i。此前的 Google TPU 是用于两种工作负载的单一架构芯片。TPU 8 也是首代明确定位为面向企业客户的外部竞争产品,而非仅限 Google 内部基础设施。

Google TPU 8 与 NVIDIA H100 相比如何?

截至发布时,尚未公布 TPU 8 与 NVIDIA H100/H200 的直接基准比较。Google 声称,与上一代(Ironwood TPU)相比,推理每美元性能提升 80%,在可比集群规模下成本约为 NVIDIA GPU 的一半。TPU 8t superpod 在 9,600 芯片配置下达到 121 ExaFLOPS,目前没有同等规模的 NVIDIA 等效产品。硬件级性能的重要性低于包括软件、迁移和支持成本在内的总拥有成本。

Google 是否试图取代 NVIDIA?

不是。Google 宣布 NVIDIA 的 Vera Rubin 芯片也将在 Google Cloud 上提供,两家公司还共同设计了适用于 NVIDIA-TPU 混合部署的网络优化。Google 声明的目标是为云客户提供针对专业 AI 工作负载(尤其是大规模推理)的更好选择,而不是将其平台上的 NVIDIA 排除在外。竞争主要发生在边缘:没有现有 CUDA 依赖的新工作负载是 TPU 8 采用的主要目标。

Google TPU 8 何时可用?

TPU 8t 和 TPU 8i 均计划于 2026 年晚些时候在 Google Cloud Platform 上全面开放。它们既可作为独立计算实例访问,也可作为 AI Hypercomputer 平台的一部分,该平台将硬件与 Google 的网络、存储和软件栈捆绑提供。

随着 AI 推理成为企业计算支出的最大细分领域,管理知识密集型工作流的团队需要考虑其 AI 工具运行在哪种基础设施上,以及这对成本、延迟和数据驻留意味着什么。如果你正在标准化云平台,并希望了解工程团队如何构建 可搜索的技术知识库 以与 AI 工作流集成,那么 AI 提供商使用的芯片基础设施现在已成为该决策的重要组成部分。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page