top of page

AI推論がトレーニングに代わり、データセンター・インフラの主要な試金石に

9月3日
読了時間: 20分

Googleのインフラ責任者であるAnahita Mouro氏は、最新のgoogle newsの背景にある新たな対立を指摘している。AIインフラは、モデルのトレーニングから継続的な推論へと移行しているのだ。この変化は技術的なものに聞こえるが、近年のデータセンター投資を支えてきた多くの前提を覆す。トレーニングでは、スケジュールされたジョブを実行する巨大なクラスターが重視される。一方、推論では、予測不能な規模のリクエストに対し、確実かつ迅速に応答しなければならない。

Mouro氏は、Googleのハイパースケール・インフラにおける現場パフォーマンスとプロセスエクセレンスを専門としている。個人としてW.Mediaに語った同氏は、インフラがAIのペースを決める要因になったと述べた。より高速なチップがあっても、送電網接続の遅れ、冷却能力の不足、脆弱なフェイルオーバーシステム、信頼できない運用は解決できない。

この警告が重要なのは、推論がAIの商業的中心になりつつあるためだ。Gartnerは、AI最適化インフラサービスへの世界の支出が2026年に423億ドルへ達すると予測している。また、推論への支出は233億ドルとなり、トレーニング向けの190億ドルを上回ると見込んでいる。

この移行が、本稿の中心的な緊張関係を生んでいる。AI企業はより迅速な導入と、応答性の高い製品を求める一方、物理インフラは依然として公益事業、建設、許認可の時間軸で進む。オーストラリアには魅力的な土地、エネルギー資源、技術人材、アジア太平洋市場へのアクセスがある。しかし、プロジェクトが電力に接続し、信頼できる本番サービスとして運用できて初めて、こうした強みは意味を持つ。

Googleニュースの背景で何が変わったのか

AIインフラにおける主要なワークロードは、個別のトレーニングプロジェクトの連続から、常時稼働するサービスへと移行している。

トレーニングでは、大規模なデータ集合を用いてモデルを作成または更新する。運用者はこれらのワークロードをスケジュールし、一時停止し、障害後に保存済みチェックポイントから再開できる。このプロセスは相当なコンピューティング能力を消費するが、トレーニングの失敗の大半はエンドユーザーには見えない。

推論は異なる。トレーニング済みモデルが回答を生成し、情報を分類し、画像を生成し、行動を推奨し、あるいはソフトウェアを操作するたびに発生する。推論リクエストの遅延や失敗は、即座に製品上の問題となる。

Mouro氏のinfrastructure interviewは、この移行をトレーニング・キャンパスから実世界への展開への転換として説明している。同氏は、推論には重要な消費者向けサービスに求められる本番運用の規律が必要だと主張する。

市場データもその方向性を裏付けている。Gartnerのinference spending forecastによると、2026年には推論がAI最適化インフラサービス支出の55%を占める見通しだ。その比率は2027年に59%へ達すると予測されている。

これらの数値は、Mouro氏が引用した、2028年までに推論がAIインフラ支出の80%超を占めるとの予測よりも保守的である。予測の定義が異なるため、これらの比率を同一視すべきではない。それでも両者は、本番利用がインフラの優先順位を変えていることを示している。

この移行は需要の振る舞いも変える。トレーニング・クラスターは、計画された実行中に比較的安定した高負荷で稼働できる。消費者向けAIサービスは、日中のピーク、突発的なトラフィック急増、地域差、人気機能による予期せぬ需要に直面する。

同じモデルでも、1回のトレーニングの後に数十億回の推論処理を生成し得る。チャットボットの1つの回答には、検索、推論、安全性チェック、応答生成を含む複数のモデル呼び出しが必要になる場合がある。エージェント型システムでは、1つのユーザーリクエストを完了する間にさらに多くの呼び出しが発生し得る。

エージェント型AIとは、複数の依存関係を持つアクションを計画・実行するシステムを指す。エージェントはデータベースを検索し、アプリケーションを呼び出し、結果を確認し、次のステップを修正することがある。各アクションは、新たなレイテンシーと信頼性の依存関係をもたらす。

このため、総応答時間の制御はさらに難しくなる。最も遅いリクエスト、いわゆるテールレイテンシーがより重要になる。遅延がチェーン全体で蓄積するからだ。個々のステップが許容範囲内でも、最も遅い応答が重なれば、ワークフロー全体が使い物にならないと感じられる可能性がある。

したがって、最新のgoogle newsは単にサーバー容量を増やす話ではない。コンピューティングを供給する段階から、AIを信頼できる対話型サービスとして運用する段階への移行を示している。この違いが、どの施設、ネットワーク、運用モデルが競争力を維持するかを決定する。

推論では、生のクラスター規模より信頼性が優先される

トレーニングは集中的なコンピューティング能力を評価する一方、推論ではシステムのあらゆる層で一貫したサービスが求められる。

近年のインフラ競争では、アクセラレータ、ラック密度、トレーニング・クラスターの規模が焦点となってきた。これらの指標は依然として重要だ。しかし、実際の顧客トラフィックの下でAI製品が予測可能に応答できるかどうかまでは捉えられない。

推論サービスは、アクセラレータだけに依存するわけではない。リクエストはネットワーク機器、ストレージシステム、モデルサーバー、ロードバランサー、安全性サービス、外部アプリケーションを経由する。冷却、配電、監視、フェイルオーバーの各システムは、このチェーン全体を支えなければならない。

Mouro氏は、本番グレードの推論を、ロードバランサーの背後にある冗長サーバー、ヘルスチェック、監視、テスト済みフェイルオーバー、災害復旧によって支えられるものとして説明している。これらはよく知られたWebサービスの実践だが、AIはそこに新たな運用条件をもたらす。

AIアクセラレータは熱を集中して発生させ、電力需要を急激に変動させることがある。液冷は、高ラック密度において多くの従来型空冷システムより効率的に熱を移動できる。同時に、ポンプ、分配設備、制御機器、潜在的な障害点も加わる。

変動する推論トラフィックは、施設計画をさらに複雑にする。運用者は、静かな時間帯に過度なエネルギーを浪費せず、ピーク需要に備える十分な電力・熱容量を確保しなければならない。動的な電力管理は、任意の効率化プロジェクトではなく、運用上の要件となる。

ネットワークも同様に重要になる。トレーニングでは、緊密に接続された1つのクラスター内で極めて高速な通信が求められることが多い。推論では、ユーザー、地域施設、データベース、クラウドサービス、外部ツールの間で応答性の高い接続が必要となる。

顧客向けアシスタントでは、レイテンシーやデータ所在地の要件から、ローカル処理が必要になる場合がある。モデルはある地域で稼働し、業務情報は別の環境に残ることもある。このアーキテクチャは、速度、主権、コスト、運用管理に関するトレードオフを生む。

Uptime Instituteの2025年operator surveyは、現在の戦略がいかに定まっていないかを示している。調査対象の運用者のほぼ3分の1が、AIトレーニングと推論の両方をサポートしていると回答した。95人の回答者のうち、64%は両ワークロードに同じインフラを使用していた。

共有インフラは柔軟性をもたらすが、相反する要件を覆い隠す可能性がある。トレーニングではアクセラレータの利用率とクラスターのスループットが重視される。推論では、可用性、予測可能なレイテンシー、地理的な到達範囲、不規則な需要を処理する能力がより重要となる。

この調査では、レジリエンスの実践にもばらつきが見られた。推論インフラを報告した組織のうち、48%は冗長コンポーネントを備えた同時保守可能なシステムを使用していた。2N+1冗長性を持つ完全耐障害構成を報告したのは23%にとどまった。

これらの結果は、現在の施設が不十分であることを証明するものではない。ワークロードごとにサービス要件は異なり、追加の冗長性にはコストとエネルギーのオーバーヘッドが伴う。ただし、業界が単一の推論アーキテクチャに収束していないことは示している。

運用者は難しいバランスに直面している。冗長性が過剰なら、AIサービスは不必要に高価になる。レジリエンスが不足すれば、ユーザーは停止の影響を受け、インフラ障害が目に見える製品障害へと変わる。

だからこそ、Mouro氏の警告は競争力の測定基準を変える。勝つ施設は、必ずしも最新のアクセラレータや最大の部屋を備えた施設ではない。利用可能なハードウェア、電力、冷却、ネットワークを、信頼できるユーザー向けの出力へと変換できる施設だ。

真の対立は、シリコンの速度とインフラ整備の時間にある

チップ性能は製品サイクルで進化する一方、送電網、変電所、許認可、データセンター建設は物理的な開発スケジュールで進む。

Mouro氏の中心的な主張は、インフラがAIのペースを決める要因になったというものだ。アクセラレータの世代更新は、スループットやワット当たりの性能を向上させることができる。しかし、施設に電力、冷却能力、または適時の送電網接続がなければ、こうした向上の価値は限られる。

電力需要はすでに各国の計画を変えている。米国エネルギー省のelectricity demand outlookによると、データセンターは2023年に176テラワット時を消費した。これは米国の総電力使用量のおよそ4.4%に相当する。

同省は、2028年の消費量を325〜580テラワット時と予測している。この範囲では、データセンターは米国の電力の約6.7〜12%を使用することになる。この幅広いレンジは、導入規模と効率性に大きな不確実性があることも示している。

世界的な予測も同じ方向を示している。国際エネルギー機関のenergy analysisは、AI導入の拡大に伴う電力需要、送電網への影響、エネルギー安全保障、排出量を分析している。その中心的な観察は単純だ。AIサービスには物理的な電力インフラが必要である。

発電は課題の一部にすぎない。ある地域が豊富な再生可能エネルギー資源を持っていても、特定の地点で必要となる送電線、変電所、接続容量が不足している場合がある。利用可能なエネルギーが、そのまま供給可能な電力を意味するわけではない。

大口顧客は、稼働の何年も前から電力会社との調整を迫られることが多い。開発事業者には、土地、許認可、水または代替冷却システム、変圧器、バックアップ設備、大容量ファイバーも必要だ。どれか1つの要素が遅れれば、プロジェクト全体が延期される可能性がある。

AIのハードウェアサイクルの変化は、別のリスクも高める。あるアクセラレータ世代を前提に設計された建物が、顧客要件が変わった後に完成する可能性がある。そのため、冷却・電力システムには、不必要に高価にならない形での適応性が求められる。

この対立は、モジュール式の電気システム、柔軟な冷却設計、異なるアクセラレータタイプをサポートできる施設に有利に働く。また、電力、温度、容量、サービス要件に応じてワークロードを割り当てられるソフトウェアの必要性も強める。

ハードウェアの調達は、すでにワークロード別に分かれ始めている。最先端のアクセラレータは、モデルのトレーニングにとって依然として価値が高い。推論では、新しいGPU、前世代のハードウェア、アプリケーション固有集積回路、すなわちASICを含む、より幅広い組み合わせを利用できる。

ASICは、より限定されたタスク群向けに設計されたチップである。専用の推論ハードウェアは、適したモデルに対して魅力的なワット当たり性能を提供できる。しかし、ソフトウェア要件やモデルアーキテクチャが変化した場合、柔軟性を低下させる可能性もある。

したがって、インフラの課題は単一のチップを選べば解決するものではありません。事業者には、一貫した電力、冷却、ネットワーク、監視、信頼性の基準を維持しながら、ハードウェアの多様性を受け入れられる施設が必要です。

これがこのgoogle newsのより深い意味です。Googleのハードウェアに関する専門性は重要ですが、Mouroの主張は、注目を特定のプロセッサからそらします。より困難な課題は、複数の技術世代にまたがる、相互依存する数百のシステムを協調させることです。

シリコンの進歩は、1回の処理あたりのエネルギーを削減できます。しかし、コスト低下がAI利用の拡大を促せば、利用増加によって総電力需要は依然として高まる可能性があります。インフラ計画では、効率改善とリクエスト量の増加の両方を考慮しなければなりません。

効率向上は容量リスクを解消しない

推論効率の向上はリクエストごとの負荷を軽減し得るものの、総需要の低下や運用の簡素化を保証するものではありません。

Googleは、ソフトウェア、ハードウェア、施設面の改善によって、個々のAIインタラクションが環境に与える負荷を大幅に削減できることを示す証拠を公開しています。同社の2025年のプロンプト単位の調査では、Gemini Appsのテキストプロンプトの中央値あたりのエネルギー消費が、12カ月間で33分の1に減少したと報告されています。

同社は、この改善の大部分をモデル効率とマシン利用率の向上によるものとしています。Googleはまた、全フリートの電力使用効率(PUE)が1.09だったと報告しました。PUEは、施設全体のエネルギー消費と、コンピューティング機器に供給されるエネルギーを比較する指標です。

これらの数値は、効率が固定的なものではないことを示す有用な証拠です。ただし、いずれも企業による報告値であり、すべてのモデル、ワークロード、データセンターを代表するものではありません。プロンプト単位の結果だけでは、利用量が分からないため総需要を明らかにできません。

より効率的なサービスは、追加の顧客を引き付け、より複雑なタスクを支援できるようになります。エージェント型ワークフローでは、従来のチャットボットが1回だけ行っていた場面で、複数回のモデル呼び出しが発生することがあります。より長いコンテキスト、マルチモーダル入力、繰り返しのツール利用も、計算量を増加させる可能性があります。

これによりリバウンド効果が生じます。各処理のコストは下がる一方、処理回数は増加します。各応答の効率が高まっても、総需要は増え続ける可能性があります。

この効果は、インフラ需要予測も複雑にします。開発者は、導入状況、モデル効率、トラフィックパターン、タスクあたりのモデル呼び出し回数を見積もる必要があります。これらの前提の小さな変化でも、必要な容量は大きく異なり得ます。

政府の電力需要予測に幅があるのは、この不確実性を反映しています。積極的な需要を前提に計画した施設は、効率化が予想以上に速く進めば稼働率が低くなる可能性があります。保守的な計画では、エージェントの導入が加速した際に顧客へ十分な容量を提供できないおそれがあります。

運用の複雑さも、もう一つの不確実性です。Mouroは、ライブ施設を変更する前に、デジタルツインを用いて電気、熱、ネットワークの挙動をモデル化できると述べています。デジタルツインとは、物理システムとその稼働条件をソフトウェアで表現したものです。

デジタルツインは、冷却の調整や急激な負荷増加が接続機器へどう影響するかを検証できます。予測監視は、障害につながる前に熱的不均衡やフェイルオーバーのリスクを特定できます。こうした能力は意思決定を改善し得ますが、物理的な制約をなくすものではありません。

モデルは、正確なテレメトリーと検証済みの前提に依存します。異常な機器挙動を見逃すシミュレーションは、誤った安心感を生む可能性があります。事業者には依然として、コミッショニング、保守、インシデント分析、検証済みの復旧手順、経験豊富な人材が必要です。

人材の問題にも同様の慎重さが求められます。高密度AI施設には、電気、熱、土木、ネットワーク、ソフトウェア、安全、運用の専門家が必要です。急速な建設は、システムの複雑さゆえにより慎重な検証が求められるまさにその時期に、試験スケジュールを圧縮しかねません。

Mouroは、導入が加速するなかでも運用規律を維持しなければならないと主張しています。この立場は、自動化が進めば自動的に迅速な提供が可能になるという、業界でよく見られる前提に疑問を投げかけます。自動化が役立つのは、チームがその限界を理解し、人間の説明責任を維持する場合に限られます。

したがって、このgoogle newsを懐疑的に読むことは重要です。推論需要の成長には説得力がありますが、正確なワークロード構成や必要容量には依然として不確実性があります。投資家は、提案されるすべてのギガワットを確実な需要とみなすべきではありません。

オーストラリアには機会があるが、送電網への接続が条件を決める

オーストラリアの戦略的優位性が投資対象となるのは、開発者が適時の電力、接続性、許認可、予測可能な運用条件を確保できる場合に限られます。

Mouroは、オーストラリアにはいくつかの強みがあると指摘しています。同国は安定した統治、技術人材、成長するアジア太平洋市場への近接性、適した土地、そして大規模な再生可能エネルギー開発を備えています。これらの特性は、地域向け推論と大規模インフラプロジェクトの双方を支え得ます。

推論は、ローカル容量の必要性をより強く裏付ける可能性があります。顧客向けアプリケーションは低レイテンシーの恩恵を受ける一方、規制対象の組織ではデータ所在地をより強く管理する必要があることが少なくありません。オーストラリアの施設は、すべてのインタラクションを遠隔地へ迂回させることなく、国内ユーザーにサービスを提供できます。

政府、医療、金融、重要インフラのワークロードでは、主権も重要です。ローカル処理は、一部のデータ所在地要件を簡素化し、国際ネットワークの混乱への露出を減らすことができます。ただし、それだけでセキュリティ、コンプライアンス、運用上の独立性が保証されるわけではありません。

制約は送電網への接続から始まります。Mouroによれば、プロジェクトが複数年にわたる接続待ち行列に直面する場合、発電容量には商業的価値がほとんどありません。開発者には十分な電力だけでなく、それを受け取れる信頼できる時期も必要です。

この違いは、立地選定を変えます。地図上で最適な地点でも、より迅速な系統連系、既存の変電所、適切な光ファイバー、より明確な計画規則を備えた、目立たない別の場所に敗れる可能性があります。電力供給開始までの時間が競争指標になります。

メーター後発電は、その一つの対応策です。この仕組みでは、電力会社のメーターより顧客側に発電設備の一部を配置します。遅延した系統接続への依存を減らせますが、燃料、許認可、排出量、信頼性、資金調達に関する課題は残ります。

柔軟な負荷アーキテクチャも別の選択肢です。一部のワークロードは、送電網の状況が変化した際に、時間帯や場所を移動できます。トレーニングジョブは一般に、顧客が必要なときに応答しなければならないユーザー向け推論よりも、スケジューリングの柔軟性があります。

この違いは、デマンドレスポンスで解決できる範囲を限定します。推論サービスは、ユーザーへの影響なしに送電網の制約時に恒常的に停止することはできません。事業者には、ワークロードの分類、バックアップ容量、柔軟なコンピューティングと重要サービスを区別する契約が必要です。

オーストラリアの計画課題は、個別プロジェクトの範囲を超えます。データセンターの成長が特定地域に集中すると、送電投資、地域の電力市場、土地利用、水政策、地域社会の受容に影響を与える可能性があります。明確なルールは、開発者、電力会社、住民が各コストを誰が負担するのか理解する助けになります。

インフラ資本は長年にわたり投じられ続けるため、安定した政策が重要です。短期的なインセンティブでは、予測不能な許認可や不確実な接続条件を補えません。投資家には、施設が複数のハードウェア世代と政治サイクルを通じて運用できるという確信が必要です。

機会は現実のものですが、オーストラリアだけのものではありません。他のアジア太平洋市場も、クラウドリージョン、主権AI容量、インフラ投資を求めています。各市場は、エネルギー供給力、開発速度、接続性、インセンティブ、規制の確実性で競争しています。

したがって、オーストラリアの優位性は実行力にかかっています。発表された発電計画、利用可能な土地、野心的なキャンパス計画は、稼働容量と同義ではありません。接続済みのメガワット、完了したコミッショニング、持続的なサービス信頼性の方が、より強い証拠となります。

企業の購買担当者にとって、この違いはベンダー評価に影響します。アクセラレータの在庫が豊富でも、提供時期が未解決の電力供給や建設工事に左右されるなら、その重要性は低くなります。購買担当者は、容量がどこで稼働しているか、どのように接続されているか、どのレジリエンス基準が適用されるかを尋ねるべきです。

Google newsは、オーストラリアを世界的な競争の中に位置づける一方で、成功の定義も狭めています。同国が勝つのは、最大数のプロジェクトを承認することではありません。エネルギーとエンジニアリングの資源を、信頼できる本番対応インフラへ転換することです。

推論シフトが実際のものかを示す3つのシグナル

次の段階は、インフラの発表だけでなく、支出、接続済み容量、測定されたサービス性能によって判断されるべきです。

第1のシグナルは、AIインフラ支出のうち推論に割り当てられる割合です。Gartnerは、2026年中にAI最適化インフラサービスにおいて推論がトレーニングを上回ると予測しています。更新された予測とクラウド企業の開示は、この逆転が継続するかを示すでしょう。

推論の割合が上昇すれば、本番ワークロードが現在では投資優先順位を決めるというMouroの主張を強めます。反転すれば、最先端モデルのトレーニングが現在の予測が示す以上に支配的であり続けることを示唆します。

この区別は慎重に測定すべきです。クラウドプロバイダーは混合クラスタを異なる方法で分類する可能性があり、同じハードウェアが両方のワークロードを支えられます。有用な開示では、可能な限りトレーニング、ファインチューニング、バッチ推論、インタラクティブ推論を分けるべきです。

第2のシグナルは、稼働中の送電網接続を受ける新規容量の量です。プロジェクト発表では、将来のメガワットやギガワットがよく示されます。こうした数値は意欲を示しますが、顧客が実際にいつその容量を利用できるかは示しません。

投資家と購買担当者は、電力会社との接続契約、完成した変電所、コミッショニングの日程、通電済みの建物を注視すべきです。遅延が生じれば、物理インフラがAI導入のペースを決めているという主張を強めます。接続の迅速化は、短期的なボトルネック論を弱めるでしょう。

オーストラリアのプロジェクトは、特に有用な検証材料となります。この市場は、大きな開発関心と、送電網、許認可、送電に関する課題を併せ持っています。計画容量から接続済み容量への進展は、その戦略的優位性が実行に結び付いているかを示すでしょう。

第3のシグナルは、エージェント型ワークロードにおける本番環境での信頼性です。プロバイダーは、トークン、アクセラレータ性能、モデルベンチマークについてますます語るようになっています。しかし、これらの指標は複数ステップのエージェント体験全体を捉えられません。

より有用な指標には、エンドツーエンドのレイテンシー、テールレイテンシー、可用性、失敗したツール呼び出し、復旧時間、トラフィック急増時の性能が含まれます。顧客は、プロバイダーが完全なワークフローに対するサービスレベル目標を公開しているかも確認すべきです。

サービスレベル目標は、測定可能な信頼性または性能の目標を定義します。エージェントの場合、その目標は1回のモデル応答ではなく、タスク全体を対象にすべきです。そうしなければ、個々のコンポーネントが目標を満たしても、ユーザーのワークフローは失敗し得ます。

大規模環境で安定したエージェント型サービスが提供されている証拠は、分散型で本番グレードの推論容量への投資を裏付けるでしょう。モデル能力が向上し続けても、遅延や信頼性の低いワークフローが続けば、当面の需要に対する期待は弱まります。

これらのシグナルは、構造的な変化と宣伝的な表現を区別する助けにもなります。支出は顧客が何を購入するかを示します。送電網接続は開発者が何を提供できるかを示します。信頼性は、インフラが利用可能なサービスを生み出しているかを示します。

より大きな教訓は、データセンター事業者の範囲を超えます。開発者は、複数の依存関係にまたがるレイテンシーと障害を前提にアプリケーションを設計する必要があります。企業の購買担当者は、モデル品質と並行して、立地、レジリエンス、ワークロードの経済性を評価する必要があります。

ナレッジワーカーにとって重要なのは、インフラに関する意思決定がAIの可用性、速度、プライバシー、そして環境負荷を左右するためです。デモで機能する機能でも、何千人ものユーザーが一日を通して利用する状況では、異なる振る舞いを見せる可能性があります。

最新のgoogle newsは、業界に根強いハードウェア偏重を見直すうえで有益な視点を提供しています。現世代のモデルを生み出したのはトレーニング能力ですが、それらのモデルが信頼できるサービスとなるかを決めるのは推論です。

今後数カ月にわたり、支出の配分、接続可能な電力、そしてエンドツーエンドの信頼性に注目してください。この3つすべてが本番環境の推論へと向かえば、Mouroの警告は予測というより、運用上の必須事項に見えてくるでしょう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page