top of page

MetaがNVIDIAとの最大の取引に署名したわずか数週間後にMTIAチップを展開

更新日:6月17日

Metaは、NVIDIA GPUの購入契約を拡大し、次世代のVera Rubinシステムを含む数百万個のGPUを追加購入する契約を締結したわずか数週間後の2026年3月に、独自のMTIA 300チップの製造を開始しました。このタイミングは矛盾しているように見えますが、そうではありません。

MTIA(Meta Training and Inference Accelerator)300は現在、Facebook、Instagram、WhatsApp全体でランキングとレコメンデーションの推論を処理しています。これは、フィードに表示されるものや広告の表示を決定するアルゴリズムです。これらのワークロードは、クエリあたりのコストがわずかに改善されるだけでも大きな意味を持つ規模で実行され、Metaによると、このチップは本番モデルの同等のGPU展開と比較して、総所有コストを44%削減します。

2026年3月の発表が特別なのは、その規模です。MTIA 300の展開と並行して、Metaは2027年まで6ヶ月ごとのリリースサイクルで、400、450、500の3つの世代を発表しました。その後4月14日、MetaとBroadcomは、カスタムシリコン1ギガワット以上の展開を約束し、2027年までに数ギガワットにスケールアップすることを柱とした共同開発パートナーシップを正式に締結しました。

その1週間後の4月22日、GoogleはTPU 8tとTPU 8iを発表しました。これは、プログラムの10年間の歴史で初めて別々に開発されたトレーニングチップと推論チップです。地球上で最大のAI支出者のうちの2社からの2つの異なるアプローチ。1つの共通の結論:AIインフラストラクチャの推論レイヤーは、もはやデフォルトでNVIDIAのものではありません。

何が起こったか:4つのチップ、1つの締め切り

2026年3月11日、Metaは、2027年まで6ヶ月ごとに新しいカスタムAIアクセラレータをリリースすることを約束した、4チップのMTIAロードマップを発表しました。このペースだけでも、業界標準の1年から2年に比べて約3〜4倍速いペースであり、この発表は通常の研究発表とは一線を画すものでした。

MTIA 300はすでに稼働していました。Metaのランキングおよびレコメンデーションワークロードは、10年以上にわたりNVIDIA GPUで実行されてきたシステムで、本番環境で稼働していました。MetaはMTIA 400のテストをラボで完了し、データセンターへの展開に向けた準備ができていると説明しました。MTIA 450とMTIA 500は、それぞれ2027年初頭と2027年後半に大量展開される予定でした。

4世代にわたる技術的な進歩は著しいです。MTIA 300からMTIA 500にかけて、MetaはHBMメモリ帯域幅が4.5倍、コンピューティングFLOPsが25倍増加したと報告しています。特にMTIA 450は、NVIDIAのH100およびH200を参照した「既存の主要商用製品よりもはるかに高い」HBM帯域幅を主張しています。MTIA 500は、450に加えてさらに50%のHBM帯域幅と、最大80%のHBM容量を追加します。

インフラストラクチャ側では、Metaのデータセンターラック1基に、OCP(Open Compute Project)規格に準拠したMTIA 400チップ72基が搭載されます。この準拠が重要である理由は、Metaが既存のデータセンター構築に、新たな物理インフラストラクチャを必要とせずにチップを組み込めるようになるからです。モジュラーラックのフットプリントは、6ヶ月の開発サイクルを可能にするメカニズムでもあります。つまり、各世代の開発で物理設計を一からやり直す必要がないのです。

そして4月14日にはBroadcomとのパートナーシップ発表がありました。この契約により、NVIDIAの次期Blackwell Ultraと同じ2ナノメートルプロセスを使用した、MTIA全4世代の共同開発が正式に決定しました。BroadcomのCEOであるHock Tan氏は、決算説明会でMetaの実行能力に対するアナリストの懐疑的な見方について言及しました。「最近のアナリストレポートとは異なり、MetaのカスタムアクセラレータであるMTIAのロードマップは健在です」とTan氏は述べました。「現在出荷しており、次世代XPUについては、2027年以降に数ギガワット規模に拡大する予定です。」

製造パートナーからのこの公の声明は、単なるプレスリリース以上のものです。それは、シリコンの製造を担当する企業のCEOが、具体的なタイムラインに対して記録に残るコミットメントを行ったことを意味します。

これらはすべて、MetaとNVIDIAの関係とは無関係に起こったわけではありません。2026年2月、わずか数週間前にMTIA 300の展開Metaは、NVIDIAとの契約を拡大し、数百万個の追加GPUとスタンドアロンCPUを含めることを発表しました。両方の事柄は同時に真実です。それがポイントです。

なぜ重要か:推論こそがお金がかかる部分

MetaがMTIAのプロダクションで引用した44%のTCO(総所有コスト)は、ベンチマーク結果ではありません。これは、Metaのプロダクションモデルを実行する実際のデプロイ済みワークロードからの測定値です。Facebook、Instagram、WhatsAppの規模では、数十億人のユーザーがコンテンツランキングや広告ターゲティングで毎日何千億もの推論リクエストを生成しており、そのコスト削減は、GPU支出の回避により年間数億ドルに相当します。

真の意義は、Metaがチップを開発したことではありません。Metaがこの規模でクリティカルなプロダクションシステムを実行するチップを開発したことです。

大手テクノロジー企業におけるカスタムシリコンプログラムは、一般的な目標です。ハイパースケールで収益に不可欠なワークロードを処理するプロダクション化されたカスタムシリコンはまれです。AppleはMシリーズチップで成功しました。Googleは2016年からTPUをプロダクションで運用しています。AmazonのInferentiaおよびTrainiumチップは、特定のAWS推論およびトレーニングタスクを処理します。しかし、ほとんどのエンタープライズカスタムチッププロジェクトは、「ラボで検証した」と「実際のビジネスを実行している」というギャップで止まってしまいます。

MetaのMTIA 300は、そのラインを超えました。これは実験的なワークロードを実行しているのではなく、同社に資金を提供する広告インプレッションを担当するレコメンデーションアルゴリズムを実行しています。

より広範な業界への影響は、特定のアーキテクチャ上の洞察から生じます。トレーニングと推論では、根本的に異なるコスト構造があります。最先端モデルのトレーニングには、大量のデータを高帯域幅のインターコネクトを介して移動し、数千個のチップを同期させ、数週間にわたってピークコンピュートスループットを維持する必要があります。NVIDIAのエコシステム(H100およびBlackwellハードウェア、NVLinkインターコネクト、数十年にわたる最適化されたCUDAカーネル)は、このワークロードプロファイルに対して短期的な代替手段がありません。

推論は異なります。デプロイされたモデルは、固定された重みで受信クエリに対して実行されます。制約はピークコンピュートではなく、クエリあたりのモデルの重みをコンピュートユニットにどれだけ速くロードできるかです。そのため、HBMメモリ帯域幅が制約変数となり、MetaのMTIAアーキテクチャが生のFLOPsを最大化するのではなく、それに特化して最適化されている理由です。

AIデプロイメントコストを追跡するエンタープライズインフラストラクチャチームおよびエンジニアにとって、実用的なシグナルは直接的です。カスタムシリコンが市場のトップからプレッシャーをかけるにつれて、推論コストは引き続き低下します。Meta、Google、Amazon、Microsoftが、それぞれの特定のプロダクションワークロードに合わせて調整された代替品を構築するにつれて、推論ハードウェアに対するNVIDIAの利益は構造的なプレッシャーに直面します。AI推論のクラウドAPI価格は、今後18〜24か月でこれを反映するでしょう。

NVIDIAが気にしない部分:なぜMetaが依然として数百万個の同社チップを購入したのか

Metaのチップ発表に盛り込まれた、気まずい詳細があります。MetaがMTIA 300を展開したのと同じ月に、同社は単一の契約でこれまで購入したことのない量のNVIDIA GPUを購入する契約を最終決定していました。どちらの決定も意図的なものでした。その理由を理解するには、各チップが実際に何をするのかを解き明かす必要があります。

MetaのAIインフラストラクチャ戦略は、カスタム対NVIDIAではありません。推論はカスタム、トレーニングはNVIDIAです。そのワークロード分離が、外部から見ると矛盾しているように見える戦略を理解するための鍵となります。

フロンティア規模の巨大言語モデルのトレーニングには、低遅延インターコネクトを介して数千のアクセラレータを同期させ、数週間にわたってピークスループットで浮動小数点演算を実行し、数十年にわたる最適化された実装を持つソフトウェアエコシステムを使用する必要があります。NVIDIAのNVLinkファブリック、CUDAライブラリ、そしてBlackwellアーキテクチャの生のFLOPは、このプロファイルでは複製が困難です。ハイパースケーラーは、フロンティアモデルのトレーニングにおいてNVIDIAを意味のある形で置き換えたことはありません。GoogleはTPUで、AmazonはTrainiumで、MetaはMTIAでさえもそうです。ワークロードが要求過多であり、エコシステムの依存関係が深すぎるためです。

推論はその逆です。モデルがトレーニングされた後、本番クエリに対してそれを実行することは、可変入力に対して固定モデルウェイトを操作することを意味します。ウェイトはリクエスト間で更新されません。モデルはクエリ間で変更されません。アクセスパターンは予測可能です。制約となるHBM帯域幅は、汎用GPUが維持しなければならない最悪ケースの柔軟性のために設計されたチップではなく、このワークロードのために特別に設計されたチップによって直接最適化できます。

MTIAのアーキテクチャは、これらのトレードオフを直接反映しています。トレーニングチップがバースト的で高帯域幅の操作に必要な、高価で高帯域幅のHBMスタックをあらゆる場所に配置するのではなく、MTIA 2は、大容量SRAMキャッシュとLPDDRメモリを組み合わせて使用しています。これは、推論メモリのアクセスパターンによく適合する、より安価なアーキテクチャです。トレードオフは、一般的なベンチマークでは目立ちませんが、本番コストにおいては決定的な違いとなります。

Broadcomとの提携は、このプログラムが直面してきた現実的な問題に対処するものです。2026年初頭には、Metaが新しいMTIA世代の市場投入に苦労していることを示唆するアナリストレポートが流れていました。Hock Tan氏が収益報告会で公に述べた声明は、直接的かつ公式な反論でした。CEOがマイナスのアナリストの憶測について、収益報告会で、しかも名前を挙げて自ら言及するのは異例の動きです。これは、Broadcom自身の収益ストーリーにとって、そしてMetaにとっても、この提携の重要性を反映しています。

とはいえ、実行リスクは現実的です。2ナノメートルプロセスノードでの6ヶ月ごとのチップ開発サイクルは、Broadcomのような製造関係を持つ企業にとっても野心的です。各世代では、シリコン検証、ファームウェア作業、そしてMetaのインフラストラクチャ全体でのソフトウェアスタック統合が必要です。Metaが説明したモジュラー設計再利用戦略(新しい世代が同じ物理ラックフットプリントにスロットインする)は、主要な実現要因となる仮定です。もしチップアーキテクチャが世代間で大きく異なる必要がある場合、その仮定は崩れ、開発サイクルは遅くなります。

スコープの問題もあります。MTIA 300はレコメンデーション推論を実行します。これはMetaが10年以上にわたって大規模に運用してきたワークロードであり、モデルアーキテクチャは十分に理解されており、アクセスパターンも予測可能です。MTIA 400から500世代は、GenAI推論を処理すると説明されています。これは、Meta AIアシスタントの応答、画像生成、そして最終的にはMetaが消費者に提供するあらゆる最先端モデルの背後にあるシステムです。

GenAI推論は、レコメンデーション推論とは構造的に異なります。リクエストパターンはより多様化します。効果的なバッチサイズは変動します。モデルサイズは、タスクに応じて小さいものから非常に大きいものまで様々です。固定されたレコメンダーモデルで機能する最適化戦略は、動的なバッチ構成を伴う可変長生成にはきれいに移行しない可能性があります。

現時点で、MetaはGenAI推論のためにMTIAチップを本番環境に展開していません。このマイルストーンは、MTIA 400の展開とともに2026年に予定されており、このアーキテクチャが当初のレコメンデーションでの成功を超えて汎用性を持つかどうかの真の試金石となります。

NVIDIAにとって、戦略的な計算は管理可能です。MetaのカスタムチップはGPU推論ワークロードを置き換えますが、Metaの拡大されたNVIDIAとの契約はトレーニングをカバーしています。NVIDIAのBlackwellおよびVera Rubin GPUは、フロンティアスケールでカスタムの代替がないトレーニングタスクに対してプレミアムマージンで販売されています。ハイパースケーラーでの推論シェアを失いながらトレーニング収益を伸ばすことは、NVIDIAが受け入れられる取引です - 少なくとも今後2〜3年は。

NVIDIAが受け入れられないシナリオは、カスタム推論チップがトレーニングの代替へと発展することです。現在の世代のASICプログラムのいずれも、フロンティアトレーニングをターゲットとしていると主張していません。4000億パラメータモデルをトレーニングするために必要なアーキテクチャは、推論の最適化とは根本的に異なります。その境界線は、現時点では市場の両側を保護しています。

MetaのアプローチはGoogle、Amazon、Microsoftと比較して

ハイパースケーラーのチップ軍拡競争には4つのプレイヤーがおり、市場の方向性を理解する上で重要な戦略の違いがあります。

Googleの4月22日の発表では、TPU 8tとTPU 8iは、Metaが採用していない構造上の選択をしました。それは、トレーニング用と推論用で別々のチップアーキテクチャを採用することです。TPU 8tは大規模なトレーニングクラスター向けに設計されており、スーパーポッドあたり9,600個のチップを使用し、Google独自のICIインターコネクトを通じて100万個のチップまで拡張可能です。ピーク性能は121 FP4エクサフロップスを発揮します。TPU 8iは、異なるメモリとコンピューティングのトレードオフを中心に構築されており、推論のレイテンシとスループットに最適化されています。

Googleはアーキテクチャレベルでチップラインを分割しました。Metaは世代を超えて進化する単一のMTIAファミリーを持っています。これは、トレーニングと推論のワークロードが、最初から別々のシリコンを必要とするほど十分に時間とともに分岐するかどうかについての異なる賭けです。

Googleのアプローチは、2つの別々の開発および製造トラックを犠牲にして、各ワークロードに対してより多くの最適化ヘッドルームを提供します。Metaのアプローチは、よりシンプルな製品ラインと、すべての世代にわたる共有物理フットプリントを提供しますが、両方のワークロードを適切に処理するものの、どちらも最適ではないアーキテクチャの妥協を犠牲にします。

Amazonは両者の中間に位置します。同社のInferentiaチップは2018年からAWSで特定の推論ワークロードを処理しており、どのハイパースケーラーのカスタム推論シリコンよりも長い稼働実績を持っています。Trainiumは選択的なトレーニングタスクを処理します。どちらのチップも、Metaが自社の消費者向けワークロードでMTIAに対して行ったような、明示的な規模のコミットメントで展開されていませんが、Amazonはカスタム推論シリコンの製造に関する10年間の運用学習の利点を持っています。

Microsoftは4社の中で最もNVIDIAに依存しています。同社のMaiaチッププログラムは存在し、初期バージョンはテストされていますが、Metaの1ギガワットの目標やAmazonのInferentiaの長年の実績に匹敵する展開コミットメントは行っていません。MicrosoftのAzure AIインフラストラクチャを通じたNVIDIAとの深い統合は、カスタムシリコンの迅速な採用を構造的に実行しにくくしています。

Benzingaの分析によると、Metaの動きは「NVIDIA依存からの脱却であり、置き換えではない」ことを表しています。当初の1ギガワットのコミットメントの推論中心の性質は、2026年から2028年にかけてMetaのインフラストラクチャからの最も安価な推論容量がカスタムシリコン上に増加することを意味しますが、NVIDIAは最先端モデル開発が行われるトレーニングレイヤーを維持します。

今後の展望:重要な展開マイルストーン

最も近い将来のテストは、MTIA 400 の完全な本番展開です。Meta は、2026 年 3 月にラボテストを完了したと説明しています。ランキングとレコメンデーション推論に焦点を当てた MTIA 300 とは異なり、MTIA 400 は GenAI 推論ワークロードも処理することを目的としています。その展開が予定通りに行われれば、Meta のカスタムシリコンが NVIDIA H100 クラスのハードウェアがクラウド環境で実行しているものと直接比較可能な種類の推論を処理するのは初めてとなります。

その展開において重要なのは、技術仕様ではなく、パフォーマンスに関する主張です。MTIA 400 が GPU 展開と同じ品質閾値で Meta AI クエリを提供できるかどうか、そして MTIA プログラムがレコメンデーションで実証した 44% の TCO 利益を維持または改善できるかどうかが重要です。

2027 年に向けて、MTIA 450 と MTIA 500 はより野心的な主張を表しています。450 の NVIDIA H100 および H200 に対する HBM 帯域幅の優位性は、本番 GenAI 推論スケールで維持されれば、重要な転換点となるでしょう。カスタム推論シリコンが、最も重要なワークロードにおいて、市販されている最高の GPU のメモリ帯域幅を超えるのです。MTIA 500 はさらに進んでおり、450 よりも 50% 多い HBM 帯域幅と、最大 80% 多い HBM 容量を備えています。

それらの主張が成り立つかどうかは、3 つの累積的な変数にかかっています。ボリュームでの 2 ナノメートルプロセスの歩留まり、Meta がシリコンバグや検証の遅延なしに 6 か月の開発サイクルを維持する能力、そして 2027 年の Meta の GenAI モデルアーキテクチャが MTIA 500 が設計されているメモリ階層と互換性があるかどうかです。各変数には実行リスクがあり、6 か月のサイクルでは吸収する余地がほとんどありません。

市場側では、推論コストが広範なクラウドエコシステムに影響を与えるまでの期間は 18 ~ 24 か月です。2026 年と 2027 年にギガワット規模のカスタム推論シリコンを展開するハイパースケーラーは、コモディティ GPU インフラストラクチャで運用する企業よりも、トークンあたりのコストが構造的に低くなります。その利点は、クラウド AI API の価格設定、および推論アズアサービスを提供するプロバイダー間の競争力学に最終的に現れるでしょう。

NVIDIAのトレーニングにおける優位性は、10年末まで安定しているようです。CUDAのエコシステムの深さ、NVLinkの相互接続の利点、そしてBlackwellおよびVera Rubinハードウェアの生のパフォーマンスは、カスタム推論ASICが現在脅かしていない堀を提供します。

その堀が、時間の経過とともに推論ネイティブのソフトウェアツールにまで及ぶのか、それとも市場が徐々にASIC最適化された推論スタックを開発し、カスタムシリコンがすでに意味のあるコスト優位性を示している唯一のワークロードセグメントにおけるNVIDIAのソフトウェア上の優位性を侵食するのかが、未解決の疑問です。

MetaのMTIAチップの展開と、トレーニングサプライヤーとしてのNVIDIAの並行した拡大は、競合する話ではありません。それらは同じ話です。AIインフラストラクチャは、トレーニングと推論のワークロード境界で分裂しており、それぞれの半分の経済性は、異なるハードウェアの決定によって設定されています。

AIインフラストラクチャ上に構築するエンジニアや技術チーム向け, その分割を追跡することは、業界ニュースをフォローするためだけでなく、今日の2027年とは異なるように見えるアーキテクチャ上の決定を下すためにも、ますます不可欠なコンテキストとなっています。Metaの6ヶ月ごとのチップのサイクルは、この状況が年次のテクノロジーレビューが捉えるよりも速く変化することを意味します。先を行くチームは、ニュースが変わるたびにゼロから始めるのではなく、すでに読んでいるものを統合しているチームです。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page