top of page

Google TPU 推理借助 Ironwood 挑战 Nvidia 的成本优势

Google TPU 推理已进入新阶段,据称 Ironwood 在部分测试中的每美元性能最高比 Nvidia B200 高出 50%。这一结果来自 SemiAnalysis 运营的第三方基准测试项目 InferenceX 的官方预览。它挑战了这样一种假设:具有竞争力的 TPU 经济性只存在于 Google 内部。

这一限定至关重要。SemiAnalysis 在特定模型、精度、吞吐量和延迟条件下,测试了一个刚刚对外开放的 TPU 推理服务栈与 Nvidia 加速器的表现。Ironwood 并非在所有比较中胜出,其软件也仍缺少成熟 GPU 部署中已有的多项优化。

因此,更深层的竞争并非一个基准测试对阵另一个基准测试,而是 Google 试图让其垂直整合的 TPU 系统可供习惯 Nvidia CUDA 软件环境的客户使用。如果 Google 成功,买家无需仅仅等待硬件差距缩小,便能获得大规模推理的可信替代方案。

Google TPU 推理走出 Google 的围墙

关键变化在于,外部用户如今可以通过更熟悉的开放模型推理工作流评估 Google TPU 推理。

Google 已在生产环境中运行 TPU 超过十年。其内部服务让公司对加速器设计、编译器、网络、模型和部署软件拥有不同寻常的控制力。这种控制使 TPU 在 Google 内部发挥了效用,但并未自动为外部开发者打造一个易于使用的平台。

Ironwood 改变了其中的一部分。Google 于 2025 年 4 月推出第七代 TPU,这是其首款专为推理设计的 TPU。推理是指运行已训练模型,以生成答案、图像、预测或动作的过程。

Google 随后通过 Google Cloud 正式推出 Ironwood。其 Ironwood 发布详情介绍了最高可达 9,216 颗芯片、每个 Pod 具备 42.5 exaflops 性能的配置。Google 还宣称,其能效相比 2018 年的首款 Cloud TPU 提升近 30 倍。

这些规格确立了硬件规模,却没有回答外部团队能否在不依赖 Google 私有生产环境的情况下,高效部署开放权重模型。

新的 InferenceX 结果回应了这个更棘手的问题。SemiAnalysis 表示,该预览采用 TorchTPU——一个旨在将面向 PyTorch 的模型工作流与 Google TPU 连接起来的外部软件栈。它还涉及围绕 SGLang 的工作,后者是一款用于大语言模型推理的开源服务引擎。

这一组合很重要,因为大多数 AI 开发者不会仅凭峰值计算规格选择加速器。他们会评估:从模型检查点到稳定的生产服务,之间还隔着多少工程工作。

第三方基准测试预览称,在测试运行范围的部分区间内,Ironwood 的每美元性能超过 Nvidia B200 和 B300。以每位用户每秒生成 100 个 token 为目标时,SemiAnalysis 计算出其相较 B200 的成本优势约为 19%;相较 B300 的优势约为 34%。

在较慢的每秒 20 个 token 目标下,Ironwood 在报告测试中实现了每芯片每秒 9,364 个总 token。B200 为 8,903 个,B300 为 8,925 个。这意味着在这次特定运行中,Ironwood 的原始吞吐量约高 5%。

更低的建模硬件成本扩大了这一计算优势。SemiAnalysis 报告称,在一个高并发测试点,Ironwood 的每美元 token 数量比 B200 高 50.4%。在同一测试点上,它相对 B300 的领先幅度更大。

这些是基准测试结果,并非普适排名。它们代表在仍处于开发阶段的软件栈上运行的特定模型与配置。即便如此,它们仍将 TPU 的讨论从架构潜力推进到外部可观察的经济性。

这种转变带来了核心矛盾。Google 不再只需证明自己的团队能够从 TPU 中获取价值,还必须证明客户能够以可接受的工作量、延迟、可靠性和模型覆盖范围,复现其中足够多的价值。

成本结果令 Nvidia 的默认地位承压

可信的 TPU 成本优势会给 Nvidia 带来压力,因为推理买家购买的是已完成的工作,而非芯片峰值规格。

大型 AI 服务必须处理数量庞大的输入和输出 token。利用率、延迟和能耗上的微小差异,会在持续性工作负载中不断累积。因此,在比较生产系统时,每美元性能比原始吞吐量更有价值。

这一指标仍需结合背景来看。系统可以通过将更多请求批处理来提高总吞吐量,但更大的批次通常会让单个用户等待更久。如果服务无法达到响应时间目标,更低的每 token 成本意义有限。

SemiAnalysis 在高并发测量中披露了这种权衡。在并发数为 256 时,Ironwood 的平均首 token 时间为 5.41 秒。B200 为 3.75 秒,B300 为 2.40 秒。

首 token 时间衡量用户在模型开始生成回复前的等待时长。它对于聊天界面、编程助手、语音系统和交互式智能体尤为重要。

这一延迟差距使“Ironwood 简单胜过 Blackwell”的说法变得复杂。Ironwood 最强的成本结果出现在 Nvidia 能更快生成首 token 的运行点。不同客户会以不同方式衡量这种取舍。

如果能获得显著吞吐量,离线文档处理服务可以接受更长等待时间。主打响应速度的消费级聊天机器人则可能更偏好更快的首 token,即便每个完成请求的成本更高。

长时间运行的智能体则形成另一种工作负载模式。它们会反复读取上下文、调用工具、更新状态并生成简短回复。其基础设施需求与单次提示后生成长答案不同。

这些差异解释了为什么 InferenceX 展示的是帕累托曲线,而非单一的头条分数。帕累托曲线呈现成本与延迟之间可获得的最佳组合,而不假装某一个运行点适合所有应用。

据称,Ironwood 在这条曲线的大部分区间内仍具竞争力。在端到端响应时间中位数为 20 秒时,SemiAnalysis 估计其相较 B200 有 8% 的成本优势,相较 B300 有 25% 的优势。

不过,B200 在重叠曲线中的较小一段区间内取得领先。Nvidia 在模型使用低精度 FP4 计算时也保有重要优势。

FP4 使用四位浮点表示来存储数值。它可以提高吞吐量并减少内存使用,但激进量化也可能影响模型质量。根据基准分析,Ironwood 不具备原生 FP4 计算能力。

SemiAnalysis 在最接近的匹配测试中,主要使用 FP8 和单 token 预测来比较这些系统。报告指出,当客户接受 FP4 的质量和实现取舍时,Nvidia 的 FP4 路径可能领先。

这使得对 Nvidia 的压力比“直接替代”的故事更为有限。Google 正在挑战 Nvidia 在部分推理工作负载上的经济性默认地位,尤其是在稳定模型形态有利于专用硬件的场景中。

Nvidia 仍提供广泛的工作负载覆盖、广泛部署的库、有经验的运维人员和成熟的调试工具。这些资产能够以 token 吞吐量图表无法体现的方式降低集成风险。

眼下的压力落在 Nvidia 的定价和产品分层上。如果客户能将可预测的推理工作负载迁移至 Ironwood,Nvidia 就必须凭借更高利用率、更低延迟、更广泛的精度选择或更简化的部署来捍卫 Blackwell。

Google 同样面临压力。它必须将一个颇具前景的预览转化为可重复的客户成果。否则,买家会把该基准测试视为优化演示,而非采购替代方案。

为什么 Google 的外部 TPU 软件栈比单项基准测试更重要

真正的关键在于软件外部化,因为当客户难以部署自己的模型时,再具竞争力的硬件也无法降低对 CUDA 的依赖。

CUDA 是 Nvidia 用于 GPU 计算的编程平台和加速库集合。它的重要性超越了编写内核所使用的语言。CUDA 连接了驱动程序、编译器、通信库、性能分析工具、推理引擎、模型优化器以及多年来积累的开发者知识。

这个互连系统降低了运营风险。遇到 GPU 性能问题的团队,可以借助大量文档、熟悉的工具、厂商支持和庞大的工程社区。他们通常还能在不同 Nvidia 世代之间复用部署模式。

Google 历来通过内部工具和团队优化 TPU。JAX 成为最显眼的公共编程路径,而许多外部 AI 项目则围绕 PyTorch 和 CUDA 实现标准化。

TorchTPU 试图缩小这一鸿沟。它为面向 PyTorch 的开发者提供进入 TPU 执行环境的路径,同时支持熟悉的模型与服务层。该体验越接近现有工作流,Google 的迁移成本就越低。

SGLang 提供了另一座桥梁。它负责模型服务任务,包括请求调度、内存使用、批处理和分布式执行。支持一款可识别的推理引擎,使 Google 能够在芯片之上展开竞争。

这并不意味着软件问题已经解决。SemiAnalysis 指出,投机解码、解耦式服务、键值缓存卸载和多轮智能体工作负载等方面仍有未完成的工作。

投机解码使用较小或更快的模型来建议 token,再由更大的模型进行验证。若实现得当,它能在不改变最终模型预期输出分布的情况下提高生成速度。

解耦式服务将提示处理与 token 生成分开。这两个阶段对计算、内存和网络的要求不同,因此专用资源池可以提高利用率。

键值缓存卸载会在合适时将存储的注意力数据移出加速器内存。它能够为长上下文或大量并发会话扩展有效容量,但数据移动可能引入延迟。

这些能力已成为领先 GPU 部署的重要组成部分。据称,Google 的私有基础设施采用了一些类似技术,但其外部 TPU 软件栈尚未开放所有优化路径。

这一差距解释了基准报告中一项颇具启发性的比较。SemiAnalysis 发现,在部分延迟范围内,采用解耦式服务的 Nvidia GB300 NVL72 系统,在每美元性能上仍保有约 30% 的优势。由于 TPU 的外部解耦式路径尚未完全优化,TPU 对比采用了聚合式服务。

这并非一次纯粹的架构比较。但它确实显示,生产软件会在多大程度上影响结果。当一个系统获得更成熟的调度和服务策略时,硬件领先地位就会发生变化。

Nvidia 也在扩展其推理层。该公司于 2026 年 3 月发布了 Dynamo 1.0,这是一款面向分布式生成式及智能体推理的开源软件。Dynamo 可协调请求路由、内存管理和解耦式服务等操作。

Nvidia 还向开源 FlashInfer 项目贡献了 TensorRT-LLM CUDA kernels。这一策略将针对 Nvidia 优化的组件嵌入开发者已在使用的框架中。

因此,Google 无法仅靠匹配一个静态目标来削弱 CUDA 护城河。它必须持续改进,而 Nvidia 也在不断开放其技术栈的部分能力,并优化其机架级系统。

Google 的潜力在于协调硬件与软件开发的能力。TPU 工程师可以围绕相同的架构假设来设计编译器、kernels、互连和服务系统。

制约因素则是模型多样性。专用阵列在模型维度与操作能够匹配其几何结构时效果最佳。围绕 GPU 设计和调优的模型,可能会形成不利于 TPU 高效执行的结构。

SemiAnalysis 通过注意力维度和 mixture-of-experts 路由强调了这一问题。一款热门模型在能够高效利用 Ironwood 之前,可能仍需要大量 kernel 开发工作。

因此,对外推广取决于不断扩展的兼容性矩阵,而非一次成功的移植。买家需要确信,新模型家族能够及时获得优化,而不必直接依赖 Google 的性能工程师。

Ironwood 在特定测试中胜出,但验证缺口依然存在

报告中的优势具有实际意义,但其覆盖范围仍过于狭窄,尚不足以证明 Google TPU 在推理领域拥有普遍领先地位。

InferenceX 将其结果描述为首批针对 Ironwood 的第三方推理测量。这使得该工作比仅由 Google 发布的基准测试更具独立性。不过,SemiAnalysis 也指出,Google 工程师和其他参与团队协助构建并优化了测试技术栈。

在早期硬件基准测试中,协作是常态。相比缺乏支持的部署,它能够更准确地揭示系统可达到的性能。但这也使测试结果更接近经过调优的参考实现,而非普通客户的实际部署。

该预览最初聚焦于 8k1k 工作负载。该表示法通常指处理 8,000 个 token 的输入,并生成 1,000 个 token 的输出。它代表了较长的提示词与具有实质内容的回答,但无法覆盖所有现代推理模式。

编程智能体可以在多轮交互中复用和扩展代码仓库。研究智能体可能在长篇检索输入与简短工具调用之间交替。语音应用优先考虑持续的低延迟,而批量摘要则优先关注整体吞吐量。

单一工作负载无法代表这些差异。买家需要看到覆盖提示词长度、输出长度、并发级别、模型架构、量化格式和服务等级目标的结果。

模型质量也应纳入比较。FP4 可以提升 Nvidia 的吞吐量,但低精度配置应根据任务准确性和输出一致性来评估。如果精度变化导致模型行为不同,速度结果便不完整。

成本方法论带来了另一项不确定性。SemiAnalysis 对外部采购系统采用了建模的总拥有成本,而非仅使用公共云租用价格。这类模型依赖于采购、利用率、电力、网络、融资和使用寿命等方面的假设。

Google 的内部经济模型不同于客户经济模型。该报告在采用 Google 内部成本假设时,估算出更大的 TPU 优势。外部买家不能假定自己能获得相同的成本结构。

可用性还可能进一步改变计算结果。如果客户无法在其所使用的地区获得足够容量,那么技术上高效的加速器价值有限。Nvidia 同样面临供应限制,但其系统仍可通过许多云服务商和服务器合作伙伴获得。

Google 的当前 TPU 产品目录将 Ironwood 列为正式可用,同时还展示了即将推出、专注推理的 TPU 8i 一代。实际容量、采购选项、支持安排和地域可及性仍可能因客户而异。

可移植性是基准测试很少捕捉到的另一项成本。围绕 TPU 专属优化进行标准化的企业或许能获得更好的经济性,但也会更加依赖 Google Cloud 或选定的系统供应商。

CUDA 会造成锁定,但离开 CUDA 并不会自动消除锁定。它可能只是将一个集成技术栈换成另一个。只有在不同后端之间能够可预测地迁移行为和性能时,开放框架才能降低这一风险。

运营证据的重要性将不亚于另一条基准曲线。客户需要故障恢复、可观测性、自动扩缩容、安全控制、版本管理和可预测的升级机制。

他们还需要能够诊断性能回退的工程师。如果专家必须反复重写 kernels 或调查编译器行为,那么一个 token 成本更低的平台也可能变得昂贵。

因此,InferenceX 的结果应被视为 Ironwood 在特定条件下具备竞争力的证据。它并不能证明 Ironwood 已成为适用于每种模型或每个组织的最佳加速器。

这一区别并未削弱这则消息的重要性。早期围绕 TPU 的讨论常常止步于:Google 的私有优势能否走出其自身环境。这份预览表明,至少部分技术栈如今已经能够支持可由外部验证、且在经济性上具有竞争力的推理。

举证责任已经转移。Google 必须扩大经测试的覆盖范围,而 Nvidia 则必须证明,其软件和延迟优势足以在 Ironwood 降低成本的各类工作负载中支撑其地位。

TPU 8i 将挑战延伸至 Ironwood 之外

Ironwood 开辟了一条可信的对外路径,而 TPU 8i 的设计旨在解决当前比较所暴露出的若干限制。

Google 于 2026 年 4 月发布了第八代 TPU,并为训练和推理分别设计了不同方案。TPU 8t 面向大规模训练,而 TPU 8i 则聚焦于后训练、强化学习和推理。

这种划分反映了 AI 基础设施需求的变化。训练需要在超大集群中实现密集计算。推理则必须平衡内存容量、延迟、吞吐量、能耗以及快速变化的请求模式。

Google 表示,TPU 8i 在大型 mixture-of-experts 模型的低延迟推理中,将比 Ironwood 提供 80% 的每美元性能提升。Mixture-of-experts 模型仅为每个 token 激活选定的参数组,从而减少计算量,但也带来路由和通信需求。

该公司还表示,TPU 8i 支持原生 FP4 计算。这直接回应了 Nvidia 在 Ironwood 比较中仍保有优势的一个领域。

Google 的第八代路线图称,TPU 8i 和 TPU 8t 的每瓦性能最高可达 Ironwood 的两倍。两者均被宣布将于 2026 年晚些时候推出。

在独立测试予以确认之前,这些仍是公司层面的主张。关键在于架构方向。Google 不再将推理视为主要围绕训练设计的硬件所附带的次要用途。

TPU 8i 也提升了当前对外软件工作的意义。没有可用服务技术栈的新加速器,会重新启动采用难题。日趋成熟的 TorchTPU 环境则可以将模型支持和运营经验带入下一代产品。

SemiAnalysis 预计 TPU 8i 将与 Nvidia 的 Rubin NVL72 平台展开更直接的竞争。这一比较将取决于的不仅是原生 FP4 支持。

Nvidia 的 Rubin 系统在机架级整合了 GPU、CPU、网络、内存和推理软件。Nvidia 还围绕推理模型和智能体工作负载优化其路线图,在这些场景中,重复推理会增加 token 总需求。

Google 提出了类似的系统级论点。它协同设计 TPU 计算、芯片间通信、光网络、编译器和云编排。

竞争正日益演变为系统对系统。两家供应商都无法仅凭独立加速器规格赢得持久的生产工作负载。

Amazon、AMD 及其他定制芯片项目带来了更多压力。即使大型买家仍在许多工作负载中使用 Nvidia,这些项目的存在也赋予它们更强的议价能力。

不过,Google 的位置依然独特。它拥有多年的 TPU 生产经验、庞大的内部工作负载、公共云、前沿模型开发能力,以及清晰的加速器路线图。

这种组合让 Google 能够先在规模庞大的内部服务上测试优化,再向客户开放。它也可以围绕 TPU 特性塑造 Gemini 模型。

对外采用则需要反向推进。Google 必须优化那些并非由自己设计的热门模型,其中包括维度特征反映多年 GPU 导向研究的架构。

这正是 CUDA 护城河不再那么绝对、但依然十分深厚的地方。高级框架可以在基础执行期间隐藏硬件差异,却无法自动消除每一项 kernel、网络、调度和内存管理差异。

AI 辅助代码生成或许能加快部分移植工作,但无法替代针对准确性、稳定性和生产环境故障模式的验证。

如果 TPU 8i 上市时具备广泛模型支持和成熟的解耦式服务能力,它将增强 Google 的挑战。如果其最佳经济性依赖特权工程支持或狭窄的基准配置,这一叙事则会被削弱。

三项信号将决定 TPU 对外推广是否奏效

接下来的证据必须展示可重复性、工作负载广度和客户采用情况,而非又一个孤立的峰值结果。

第一个信号是匹配的解耦式服务基准测试。SemiAnalysis 表示,尽管 Google 已在内部使用相关技术,当前外部 TPU 路径在这一领域仍需优化。

一项有价值的后续测试,应在双方均启用解耦的情况下比较 Ironwood 和 Nvidia 系统。它应采用相同的模型、精度、质量目标、延迟约束和成本方法论。

如果 Ironwood 能缩小相对于 GB300 NVL72 的报告差距,Google 的系统级论点将更有说服力。如果差距持续存在,Nvidia 成熟的服务软件仍将是决定性优势。

第二个信号是多轮智能体工作负载下的性能。这类系统会反复处理不断增长的上下文、调用工具并生成简短输出。与 8k1k 基准相比,它们会以不同方式考验缓存管理和延迟。

SemiAnalysis 表示,计划在 2026 年晚些时候发布智能体工作负载的结果。这些测试应报告首 token 时间、token 间延迟、吞吐量、内存使用量和完成任务成本。

强劲的结果将表明,Google TPU 推理能够处理推动当前基础设施规划的需求模式。疲弱的结果则可能意味着,Ironwood 的优势集中在更可预测的服务任务中。

第三个信号是外部客户证据。正式可用固然重要,但重复部署才能揭示开发者是否能在不依赖异常密集支持的情况下复现基准测试中的经济性。

最有力的证据将包括具名的生产工作负载、获得支持的开放模型、容量扩张和经过测量的可靠性。买家还应关注新模型获得优化 TPU kernels 的速度。

Google 已列出围绕 Ironwood 的客户案例,包括 Citadel Securities 更快的工作负载表现。更广泛的推理采用将表明,TPU 的外部化已超出专业团队和主要战略合作伙伴的范围。

Nvidia 的回应也应纳入同一观察窗口。Dynamo、TensorRT-LLM、Blackwell 和 Rubin 的改进,可能会在 TPU 软件走向成熟之前改变竞争格局。

当两个平台都在快速更新硬件与推理服务软件时,成本优势并非永久。买方应评估可复现的运行条件,而非将某一项基准测试固化为固定排名。

实际启示是,应将工作负载适配性与厂商身份区分开来。稳定、高吞吐量的推理任务如今可能值得评估 TPU。对延迟高度敏感的服务、快速变化的模型,或深度投入 CUDA 的团队,可能仍会更倾向于 Nvidia。

基础设施团队应将其基准测试假设和部署发现保存为持续更新的记录。一个可搜索的技术知识库可帮助团队在模型、编译器和加速器代际变化时比较结果。

Google 通过让其 TPU 的经济性能够接受外部检验,已跨越一个重要门槛。但这并未抹去 Nvidia 的软件优势,也未确立其普适性的领先地位。

下一个问题很具体:在 Nvidia 的下一代系统缩小差距之前,普通客户能否在真实应用中复现 Google TPU 的推理性能提升?答案将决定 InferenceX 是标志着持久的市场转变,还是仅仅是一个令人印象深刻的早期节点。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page