Google TPU vs Nvidia: AI 芯片战争的新前线
已更新:6月17日

在过去十年的大部分时间里,围绕人工智能硬件的讨论始终绕不开一个名字。如果你想训练大规模模型或运行高吞吐量推理,你就必须支付“绿色税”。你从那家实际上发明了现代 AI 加速器的公司购买硬件。但格局正在发生变化。这一举动将 Google TPU 与 Nvidia 的对决推向了行业霸权争夺战的中心。
Google 第七代芯片(被称为 Ironwood)的推出,表明这家搜索巨头不再满足于仅将其芯片优势用于像 Gemini 这样的内部项目。 或 AlphaFold。通过销售这些芯片的访问权,Google 正在挑战 AI 芯片市场竞争中的垄断地位。对于更广泛的科技行业——甚至可能包括被忽视的 PC 玩家来说,这场竞争早已该到来。
了解硬件:Google TPU 架构

要理解其重要性,必须审视这些芯片的差异。Google TPU 与 Nvidia 之间的竞争不仅仅关乎品牌忠诚度,更关乎底层架构。
Nvidia 占据主导地位,是因为他们成功地将图形处理器 (GPU) 从游戏设备转型为数学引擎。GPU 是大规模并行处理器。它们最初设计用于同时计算视频游戏中数百万像素的光照和纹理,结果证明它们在深度学习所需的数学运算方面表现得异常出色。
然而,GPU 是通用型处理器。它们仍然背负着能够渲染图形的包袱。
Google TPU (Tensor Processing Unit) 则是专家。它在 2016 年从零开始设计,专门用于一项特定任务:矩阵乘法。这是神经网络核心的数学运算。TPU 不关心光线追踪或帧率。它是一种专用集成电路 (ASIC),旨在以极高的效率在系统中移动张量(多维数据数组)。
效率差距
当你剥离 GPU 中的通用组件时,你会得到一个在进行相同数量的 AI 数学运算时,功耗更低、物理空间占用更小的芯片。在数据中心,电力是最高的单项运营成本。Ironwood 芯片旨在利用这一点。对于像 Anthropic 这样在计算成本上耗资数十亿美元的公司来说,TPU 相对于通用 GPU 的理论效率是促使其转向的巨大财务动力。
Nvidia 的优势与 CUDA 生态护城河

如果硬件这么好,为什么 Google 还没有彻底击败竞争对手?答案在于软件。当涉及到 CUDA 生态护城河时,Google TPU 与 Nvidia 的争论往往会戛然而止。
Nvidia 不仅仅制造芯片,他们还构建了一门语言。CUDA (Compute Unified Device Architecture) 是允许开发者与 GPU 对话的软件层。Nvidia 花了近 20 年的时间来完善这个平台。大多数 AI 研究人员都是在 CUDA 上学习编程的。大多数开源库都针对 CUDA 进行了优化。它是 AI 的默认语言。
行业观察者的评论凸显了一个残酷的现实:Nvidia 是一家伪装成硬件供应商的软件公司。如果他们固守作为一家专注于游戏业务的 "GeForce" 公司的根基,其规模将只是现在的冰山一角。他们向计算领域的转型创造了锁定效应。
开发者摩擦
从历史上看,使用 Google TPU 是很痛苦的。它需要使用特定的框架(如 TensorFlow),并且通常需要定制化的代码调整。你不能直接把为 Nvidia H100 编写的模型丢到 TPU 上并指望它能运行。这种缺乏灵活性一直是主要的准入门槛。
然而,Ironwood 世代以及 JAX 和 PyTorch 的更新正在降低这一门槛。TPU 的软件栈正在趋于成熟。对于那些厌倦了为 Nvidia 配额等待数月的工程师来说,它正变得“足够好用”。
Google TPU 能打破 Nvidia 的垄断吗?
该行业目前正面临供应危机。对 AI compute 的需求正超过供应,导致价格飙升和交货周期延长。这种短缺为 Google TPU 与 Nvidia 竞争的升级创造了完美的契机。
超大规模云厂商的反击
科技巨头们是务实的。Google 拥有 TPU。他们都在试图减少对单一供应商的依赖。通过向 Meta 和 Anthropic 出售 TPU 访问权限,Google 实际上是在充当 Nvidia 对手的军火商。
Anthropic 将通过与 Google Cloud 价值数百亿美元的里程碑式合作,获得多达 100 万颗 TPU 芯片的使用权。这给 Nvidia 带来了压力。如果很大比例的矩阵乘法(Matrix Multiplication)工作负载迁移到 TPU,Nvidia 将失去其绝对定价权。竞争通常会带来创新,并最终降低所有人的成本。
游戏玩家的视角
有一个特殊的群体正在屏息注视着这场企业博弈:游戏玩家。近年来的游戏 GPU 短缺让人记忆犹新。起初是加密货币矿工扫货,接着是 AI 初创公司。
技术论坛上的一种普遍观点是,随着 Nvidia 追逐企业级市场的巨大利润,游戏玩家已被“抛在脑后”。其逻辑是,如果企业市场找到了替代方案(如 Google TPU),Nvidia 可能会被迫重新关注其消费级 GeForce 产品线。虽然 Nvidia 不太可能将低利润的游戏显卡置于单价 30,000 美元的 AI 芯片之上,但来自 Google 的竞争压力可能会稳定供应链。
Ironwood 芯片:Google 的第七代豪赌
Ironwood 芯片代表了成熟。早期的 TPU 脆弱且缺乏灵活性,如果模型架构发生变化,芯片就会运行吃力。Ironwood 芯片旨在处理现代 Transformer 和大语言模型 (LLMs) 的动态特性。
Google 声称 Ironwood 提供了更好的互连速度,允许数千颗芯片更无缝地协同工作。在 AI 训练中,单颗芯片的速度远不如芯片间的通信速度重要。Ironwood 集群可扩展至 9,216 个 AI 加速器,为训练和推理提供总计 42.5 FP8 ExaFLOPS 的算力,这远超 Nvidia GB300 NVL72 系统 0.36 ExaFLOPS 的 FP8 性能。
如果 Google 能证明在训练 Gemini 级别的模型时,Ironwood 集群比 Nvidia H100 集群更具性价比,那么 Google TPU 与 Nvidia 的竞争叙事将从“实验”转向“行业标准”。
未来展望:AI 芯片市场竞争
我们可能正走向一个分化的市场。Nvidia 将继续保持通用型领域的霸主地位AI 训练,这是由于其灵活性和 CUDA 的惯性。如果你是一位正在测试某种奇特新架构的研究员,你会选择使用 Nvidia。
然而,Google TPU 正在大规模训练和推理领域开辟出一块巨大的利基市场。一旦模型定义完成,将其转移到 TPU 进行重负载计算在经济上是合理的。AI 芯片市场的竞争不再是垄断,而是寡头竞争。随着 Google TPU 与 Nvidia 之间的战斗升温,再加上 AMD 和 Amazon 的加入,硬件格局正趋于多样化。
对于开发者、股东以及等待价格合理的显卡的游戏玩家来说,这种竞争是唯一的出路。
常见问题解答:Google TPU vs Nvidia 与 AI 硬件

问:Google TPU 和 Nvidia GPU 之间的主要区别是什么?
答:Nvidia GPU 是通用处理器,能够处理图形、游戏和 AI 任务。Google TPU(张量处理单元)是专门设计的 ASIC,专为矩阵乘法和深度学习操作而生,在特定的 AI 工作负载中提供更高的效率。
问:我可以为我的家用电脑购买 Google TPU 吗?
答:不可以,你无法像购买显卡那样购买独立的 Google TPU 组件。它们仅通过 Google Cloud Platform (GCP) 作为云服务提供,而 Nvidia GPU 则可以购买并用于个人工作站和游戏装备。
问:为什么大多数 AI 开发者仍然更倾向于 Nvidia 而非 Google TPU?
答:Nvidia 凭借其 CUDA 软件生态系统拥有巨大优势,该系统提供了强大的库、广泛的支持和易用性。虽然 TPU 的软件支持正在不断改进,但 CUDA 仍然是行业标准,这使得 Nvidia 芯片在实验性和多样化开发方面更具灵活性。
问:Google TPU 的兴起会有助于结束游戏 GPU 短缺吗?
答:有可能。如果大型科技公司将其企业级AI workloads转向 TPU,这将减少对 Nvidia 商业级 GPU 的巨大需求。理论上,这可以为 Nvidia 的消费级 GeForce 系列腾出制造产能和资源,从而使游戏玩家受益。
问:新闻中提到的 "Ironwood" 芯片是什么?
问:使用 Google TPU 需要学习新的编程语言吗?
答:不一定需要新语言,但通常需要使用特定的框架。TPU 在 JAX 或 TensorFlow 上运行效果最好,虽然 PyTorch 支持 (XLA) 已显著改善,但开发人员通常需要采用与 CUDA 平台不同的方式来优化代码。



