Google TPU 8 が登場しました。それは NVIDIA を置き換えるものではありません。それがまさにポイントです。
- Aisha Washington

- 6月5日
- 読了時間: 11分
GoogleはCloud Next 2026で2つの新しいAIチップを発表しました:モデルトレーニング用のTPU 8tと推論用のTPU 8iです。性能数値は大きいものです。単一のTPU 8t superpodは9,600チップをクラスター化し、2ペタバイトの共有メモリで121 ExaFLOPSのコンピュートを実現します。推論チップは昨年のモデルより80パーセント高いパフォーマンスを1ドルあたりで提供します。そして、Googleのテンソル処理ユニットの8世代の歴史で初めて、同社はこれらのチップを外部市場でのNVIDIAとの競争として明確に位置づけています。
GoogleがCloud Next 2026で発表したもう一つのことは、NVIDIAの次世代Vera Rubinチップが今年後半にGoogle Cloudで利用可能になるというものです。
これら2つの発表は矛盾ではありません。それが戦略です。GoogleはNVIDIAを自社のデータセンターから排除しようとしているのではありません。自社のインフラがNVIDIAに依存する度合いを減らし、その依存を減らしたインフラを、AIコンピュートに対してより少ない支払いを望むエンタープライズ顧客に販売しようとしているのです。それが成功するかどうかは、チップの仕様よりも、Googleが10年にわたって解決しようとしてきたソフトウェアエコシステムの問題に大きく依存します。
What Happened: Two Chips, One Strategic Bet
Googleは2026年4月22日のCloud Next 2026で両方のチップを発表しました。Google's official announcementが説明するように、これらは「エージェント時代の2つのチップ」です。このフレーミングは、アーキテクチャが前世代を定義したバッチトレーニングワークロードではなく、エージェントAIシステムの推論需要を中心に設計されたことを示しています。2日後に発表されたGoogleのAnthropicへの400億ドルの投資と並んで、このタイミングは、GoogleがAIインフラの方向性について最も広範な単一の声明を発した1週間として位置づけられました。
The TPU 8t, the training chip, is built for scale. According to Google's technical deep dive, each chip carries 216 GB of high-bandwidth memory running at 6.5 TB per second, 128 MB of on-chip SRAM, and 12.6 petaFLOPS of FP4 compute. The superpod configuration scales to 9,600 chips and two petabytes of shared high-bandwidth memory, delivering 121 ExaFLOPS total. Google says the system can grow to clusters of over one million chips with near-linear scaling, a configuration no commercially available GPU fabric can currently match.
The TPU 8i, the inference chip, solves a different problem. It carries 288 GB of high-bandwidth memory at 8.6 TB per second, and 384 MB of on-chip SRAM, three times more than the previous generation. The large SRAM enables the active working set of a large model to remain entirely on-chip during inference, eliminating the latency of loading weights from HBM on every token generation. The chip uses a new Collective Acceleration Engine that offloads distributed inference communications, the all-reduce and all-gather operations that dominate synchronization overhead in large multi-chip inference clusters.
As CNBC reported, both chips represent roughly 2.8x the training performance and 80 percent better inference performance per dollar compared to the previous generation (Ironwood TPU). Both will be generally available on Google Cloud Platform later in 2026, accessible as standalone instances or as part of Google's AI Hypercomputer full-stack platform.
Why the Architecture Split Is More Interesting Than the Specs
1つのチップで両方を行うのではなく、2つの別々のチップを構築するという決定は、今週Googleが発表した中で最も重要なことです。
長年、NVIDIAのH100 GPUはAIインフラのスイスアーミーナイフとして機能してきました:トレーニング、推論、研究、ファインチューニングに使えます。この汎用性が市場力の源泉です。すべてをこなす1つのチップがあれば、購入する必要があるのも1つのチップだけです。CUDAソフトウェアエコシステムがこれを強化しています:数千のAIフレームワーク、トレーニングライブラリ、推論エンジンがCUDA向けに最適化されており、つまりNVIDIAハードウェアで最もよく動作します。
GoogleがTPU 8をトレーニングチップと推論チップに分割するという決定は、その汎用性に対するアーキテクチャ上の反論です。1兆パラメータモデルのトレーニングに最適なチップと、そのモデルを同時に1,000万ユーザーに提供するのに最適なチップは同じではない、と述べています。トレーニングには膨大なコンピュート、大容量メモリ、数千チップにわたる勾配同期のための最大帯域幅が必要です。推論には、ホットモデルレイヤをコンピュートに近づけて保持するための大容量オンチップSRAM、低遅延の集団通信、ピークスループットではなく持続スループットでの効率が必要です。
NVIDIAの対応は、チップレベルではなく製品ラインレベルでの専門化でした。H100とH200は汎用目的で、L40のような推論特化製品は低コスト推論展開向けに存在します。しかしL40は、TPU 8iがそうであるように、大規模モデル推論のために白紙から目的構築されたものではありません。
市場も自らの勢いでGoogleの方向に動いています。カスタムAIシリコンの出荷は2026年に45パーセント成長すると予測されており、一方汎用GPU出荷は約16パーセントの成長です。AmazonのTrainium、MicrosoftのMaia、MetaのMTIA、AppleのNeural Engineはいずれも同様の専門化に向かっています。Googleは展開規模でそれらのほとんどをリードしていますが、アーキテクチャの方向性は今や業界のコンセンサスとなっています。
The Real Competition Is Not Hardware. It Is Software.
ここにGoogleのTPU野心にとっての不都合な現実があります。
NVIDIAにハードウェアの堀はありません。ソフトウェアの堀があります。
CUDA、NVIDIAの並列コンピューティングプラットフォームとプログラミングモデルは、少なくとも2012年以来、支配的なAI開発インターフェースとなっています。その期間に、4,000以上の主要なAIおよび機械学習ツールがCUDA上で動作するように構築されました。PyTorch、TensorFlow、JAX、Hugging Face Transformers、そしてほぼすべての本番推論エンジンがCUDAを主要バックエンドとしてデフォルトにしています。大規模モデルをトレーニングおよび展開する組織は、CUDA互換ハードウェアを中心にエンジニアリングワークフローを構築してきました。
GoogleのTPUはJAXとXLA(Accelerated Linear Algebra)で動作します。どちらも元々Googleが開発したものです。JAXは強力で、最先端研究での使用が増えています。その周囲のエコシステムはCUDAエコシステムの規模のほんの一部です。NVIDIAインフラからTPUインフラへの切り替えは、単なる調達決定ではありません。ソフトウェアスタックの書き換えまたは移植、新しいハードウェア上でのモデル性能の再検証、そしてCUDAで専門性を築いたエンジニアリングチームの再トレーニングが必要です。
As TechCrunch noted, この移行コストが大規模なTPU採用への本当の障壁です。GoogleのTPU 8発表には、CUDAエコシステム互換性に対処する新しい主要イニシアチブは含まれていません。同社はJAXとXLAの改善に引き続き投資しており、CUDAネイティブコードを変更なしでTPU上で動作させる互換性レイヤの構築ではありません。
これが、Motley Foolの評価が短期的に正しい理由です:これらのチップはNVIDIA購入への依存を減らすことでGoogle自身の利益率を助けるでしょうが、2026年にNVIDIAのデータセンター支配を大きく損なうことはないでしょう。TPU 8への切り替えから最も恩恵を受ける企業は、すでにJAXでゼロから新しいワークロードを構築しているか、移行コストを正当化できるほどモデル規模が大きい企業です。新しいインフラ契約によりネイティブGoogle TPU顧客となったAnthropicが、最も明確な例です。
What Google Is Actually Competing For
TPU 8がNVIDIAを市場で置き換えるために設計されていない場合、何のために設計されているのでしょうか?
正直な答えは、Googleは今年ではなく、次の10年を競っているということです。
今日存在するAIトレーニング市場は、フロンティアモデルトレーニングが支配しており、そこでは規模がほぼすべてに優先します。Anthropic、OpenAI、Google、Meta、そして少数の企業が主要顧客です。彼らは利用可能な最も高性能なチップを必要としており、どんなコストでも支払う意思があります。NVIDIAはハードウェア性能とソフトウェアエコシステムの慣性を通じてその市場の大部分を獲得しました。
推論市場は異なります。推論はAIモデルが製品になる場所です:すべてのAPIコール、すべてのチャットボットインタラクション、すべてのコード補完、すべてのドキュメント要約が推論ワークロードです。AI採用が少数のフロンティアモデルのトレーニングから数十億ユーザーのサービス提供へと拡大するにつれ、推論はトレーニングよりもはるかに大きなコンピュート市場になります。2024年の分析では、2026年までに推論がAIコンピュート支出全体の60パーセント以上を占めると推定されました。その尺度で言えば、より大きな市場は、GoogleのTPU 8iが specifically 勝つために設計されたものです。
ここでコスト優位性が重要です。 comparable serving workloads全体で、Google TPUは標準的な9,000チップ規模でNVIDIA GPUの約半分のコストで動作します。大規模モデル推論クラスターを24/7で運用するエンタープライズにとって、50パーセントのコンピュートコスト削減は意味のある運用経費の違いです。Google Cloud TPUをレンタルし、最終的に自社データセンターに展開する交渉を進めるMetaの動きは、少なくとも1つの主要AIインフラバイヤーが、その運用節約に見合う移行コストだと結論づけたことを示唆しています。
Googleの予測は積極的です:2026年に約430万のTPUユニットが出荷され、2028年までに3,500万に向かって拡大するというものです。これらの予測が正確で、新しい推論展開のほんの一部でもNVIDIAではなくTPU 8iに向かう場合、2028年までに推論セグメントの市場ダイナミクスは今日とは大きく異なる可能性があります。
The tpu vs gpu dynamic matters most at the specific intersection of scale and cost. For companies running inference at fewer than a few thousand chips, NVIDIA's ecosystem advantages outweigh Google TPU's cost advantages. For companies running inference at tens of thousands of chips or more, and particularly for those building agentic AI systems that require extremely low latency on every token generated, the TPU 8i's architecture is purpose-built for that use case in ways that general-purpose GPUs are not. The question is how quickly that second category of customer grows.
What This Means for NVIDIA and Enterprise Buyers
NVIDIAのTPU 8発表に対する公式対応は、基本的にすでにやっていたことを続けるというものでした。
As Motley Fool noted, Googleは同時にNVIDIAのVera Rubinチップが2026年後半にGoogle Cloudで利用可能になると発表しました。このパートナーシップ、AI競合他社とAIチップサプライヤーが同じクラウドプラットフォーム上で共存するということは、現在の市場の状態を反映しています:NVIDIAはエンタープライズソフトウェアエコシステムに深く組み込まれており、Googleがそれを手放すことはできず、CUDA互換ワークロードを必要とするGoogle Cloud顧客は、Googleが自社シリコン容量を拡大する中でもNVIDIAハードウェア上で動作し続けるでしょう。
2026年にAIインフラを評価するエンタープライズバイヤーにとって、TPU 8発表は1年前よりも具体的な選択肢を生み出します。トレーニングチップはフロンティア規模のモデル開発に十分な規模と性能を備えています。推論チップは大規模言語モデルの本番展開に重要な特定のボトルネックに対処します。そして、Google Cloudが自社チップとNVIDIAハードウェアの両方を提供する意思があることは、エンタープライズ顧客に二者択一ではなく選択肢を与えます。
これらのチップを検討するエンタープライズにとっての実践的な質問は、ソフトウェアポートフォリオです。MLチームのワークフローがCUDA拡張付きPyTorchで構築されている場合、TPU 8への移行は数ヶ月のエンジニアリングプロジェクトになります。チームがゼロから新しい推論容量を構築している場合、またはすでにJAXを使用している場合、TPU 8のコスト削減と規模優位性は genuinely 魅力的です。
Google自身のタイムラインは、移行が突然ではなく徐々に進むことを示唆しています。同社は2026年に約430万のTPUユニットが出荷され、2028年までに3,500万に向かって拡大すると予測しています。これらの予測が維持されれば、TPUのAIチップ市場シェアは大幅に成長するでしょう。しかしNVIDIAは止まっていません:Vera RubinはH200に対して substantial な改善を提供すると予想され、CUDAエコシステムは拡大を続けています。2社は、TPUが新規推論展開でシェアを獲得する一方でNVIDIAが既存トレーニングワークフローでの地位を維持し、 foresee 可能な将来、大半の大企業で共存する可能性が高いです。
FAQ: Common Questions About Google TPU 8 and NVIDIA Competition
What exactly is Google TPU 8, and how is it different from previous TPUs?
TPU 8はCloud Next 2026で発表されたGoogleのカスタムAIチップの第8世代です。以前の世代との主な違いは、モデルトレーニング用のTPU 8tと推論用のTPU 8iという2つの目的特化チップへの分割です。以前のGoogle TPUは、両方のワークロードに使用される単一アーキテクチャのチップでした。TPU 8はまた、エンタープライズ顧客向けの競合外部製品として明確に位置づけられた初めての世代でもあります。
How does Google TPU 8 compare to NVIDIA H100?
TPU 8とNVIDIA H100/H200の直接的なベンチマーク比較は、発表時点では公開されていません。Googleは、以前の世代(Ironwood TPU)と比較して推論で80パーセント優れたパフォーマンス per dollar を主張しており、 comparable クラスター規模でNVIDIA GPUの約半分のコストであるとしています。TPU 8t superpodの9,600チップ構成での121 ExaFLOPSには、同規模で直接相当するNVIDIA製品はありません。ハードウェアレベルの性能は、ソフトウェア、移行、サポートコストを含む総所有コストよりも重要ではありません。
Is Google trying to replace NVIDIA?
いいえ。GoogleはNVIDIAのVera RubinチップもGoogle Cloudで利用可能になると発表しており、両社はNVIDIA-TPU混在展開向けのネットワーキング最適化を共同でエンジニアリングしています。Googleの表明された目標は、NVIDIAをプラットフォームから排除するのではなく、特に大規模推論などの specialized AIワークロードに対してクラウド顧客により良い選択肢を提供することです。競争は主にマージンで:既存のCUDA依存関係を持たない新しいワークロードがTPU 8採用の主要ターゲットです。
When will Google TPU 8 be available?
TPU 8tとTPU 8iの両方が、2026年後半にGoogle Cloud Platformで一般提供を予定しています。スタンドアロンコンピュートインスタンスとしても、Googleのネットワーキング、ストレージ、ソフトウェアスタックをバンドルしたAI Hypercomputerプラットフォームの一部としてもアクセス可能になります。
As AI inference becomes the largest segment of enterprise compute spending, teams managing knowledge-intensive workflows will need to think about which infrastructure their AI tools run on and what that means for cost, latency, and data residency. If you are standardizing on a cloud platform and want to understand how engineering teams build searchable technical knowledge bases that integrate with AI workflows, the chip infrastructure your AI provider uses is now a material part of that decision.


