top of page

Meta Engineering、広告モデルの拡大とともにGEMの学習効率を2倍にしたと説明

新たな技術解説によると、Meta Engineeringは各学習ジョブにおけるモデル計算量を4倍に増やしながら、GEMのエンドツーエンドの学習効率を2倍に高めた。GEMは現在、数千台規模の現行世代GPU上で20%から25%のModel FLOPs Utilizationを達成しているという。

この結果が重要なのは、アクセラレータを増やすと通常は新たなボトルネックが生じるためだ。通信量は増え、障害の影響は大きくなり、ワークロードの偏りによって高価なハードウェアが待機状態に置かれる。Metaによれば、GEMは学習ワークロードを大幅に拡大しつつ効率を改善した。

したがって、対立構図はMetaと別の広告企業との競争ではない。システムエンジニアリングと、力任せのGPUスケーリングとの競争だ。同社のGEMの学習に関する解説では、この効率向上をモデルアーキテクチャ、データ移動、並列化、カーネル、信頼性にまたがる協調の成果として示している。

GEMはGenerative Ads Recommendation Modelの略で、FacebookとInstagramの広告表示面全体におけるレコメンデーションを支える基盤モデルだ。厳格なレイテンシー制約の下で広告をランキングする際に、小規模な本番モデルが適用できる共通パターンを学習する。

このモデルは規模の面では大規模言語モデルに似ているが、ワークロードは異なる。言語モデルは比較的規則的なトークン列を処理する。一方、広告システムは不規則な行動履歴、巨大な埋め込みテーブル、多様な目的、そして継続的に変化するデータを組み合わせる。

Metaは、外部の研究者がこの新たな結果を再現するのに十分な情報を公開していない。GEMの正確なGPU数、学習期間、エネルギー消費量、絶対コストはいずれも明らかにしていない。したがって、報告された20%から25%のMFUは有用ではあるものの、完全な効率監査ではない。

それでもこの開示は、レコメンデーションエンジニアリングにおける重要な変化を示している。Metaは広告ランキングを基盤モデルの問題として扱い、その判断を中心に学習システムを再構築している。

Meta Engineering、GEMを新たな学習クラスへ移行

中核となる変化は、単にGPUクラスターを大きくしたことではない。Metaによれば、GEMはモデル計算量を4倍にしながら、割り当てられたハードウェアを約2倍効率的に利用している。

Model FLOPs Utilization(MFU)は、モデルによって定義される数理演算に費やされる、アクセラレータの理論上のスループットの割合を測る指標だ。MFUが25%だからといって、GPUが75%の時間アイドル状態にあることを意味するわけではない。通信、メモリ移動、データ準備、同期、その他の必要な処理にも容量の一部が使われる。

この違いはGEMの規模では重要になる。Metaは、数兆個のスパースパラメータと数十億個のデンスパラメータを含むモデルだと説明している。スパースパラメータには大規模な埋め込み構造が含まれ、各サンプルで使われるのは関連する一部だけだ。デンスパラメータはより一貫して処理に参加する。

したがって、パラメータ数だけでは学習コストはほとんど分からない。合計数が近い2つのモデルでも、実際に動作する計算量、メモリトラフィック、通信パターンは大きく異なり得る。GEMの学習FLOPsが4倍になったことは、Metaが1回の学習ジョブで実行する処理を拡大したことを示す、より有用な指標となる。

Metaによると、現行システムは最新世代のGPU数千台で学習を実行する。この規模により、GEMの分散学習は、小規模クラスターで実行される従来型レコメンデーションジョブよりも、最先端の言語モデル向けインフラに近い課題となっている。

同社は数年にわたり、この地点へと進んできた。従来の深層学習レコメンデーションモデルは、手作業で設計した特徴量と圧縮表現に大きく依存していた。Metaの以前のシーケンス学習の取り組みは、完全な行動イベントストリームへと焦点を移した。

このアプローチは、ユーザーがあるインタラクションの前後で何をしたかについて、より多くの情報を保持する。行動を固定的な要約統計の集合として扱うのではなく、イベントの順序、タイミング、文脈を捉えられる。

ただし、より長く多様なシーケンスは計算負荷を高める。ユーザーごとに履歴の長さは異なる。あるサンプルでは他よりはるかに多くの処理が必要になり、バッチ内やGPU間で不均衡が生まれる。

GEMは複数の表示面と目的にまたがって学習も行う。Instagramの動画へのインタラクションは、Facebook Feedでの予測を改善する情報を持ち得る。広告主の目標は認知からクリック、メッセージ、購入、その他のコンバージョンまで幅広い。

この共有学習は、基盤モデル戦略の中心にある。各ランキングシステムを孤立した知能として学習するのではなく、MetaはGEMを用いて再利用可能な表現と予測を開発する。小規模な価値モデルは、その知識を特化した本番タスクに取り込める。

Metaは以前、GEMのアーキテクチャが、同量のデータと計算資源に対して従来のランキングモデルの4倍の広告パフォーマンス向上をもたらしたと報告している。これはモデル品質に関する主張であり、今回の開示における学習計算量4倍とは別のものだ。

これらの数値を分けて扱うことは不可欠だ。一方は学習入力の単位当たりに主張される有効性を示し、もう一方は新しい学習ジョブが実行する数理演算量を示している。

今回の効率向上は、Metaが追加した容量をインフラのオーバーヘッドに消費させずにGEMを拡大したと述べていることを意味する。これこそが、この出来事の本質的な技術的意義だ。

GPUを増やすほど通常は効率が悪化する理由

分散学習は、演算能力が尽きるはるか前に協調の問題になる。GPUを1台追加するごとに、待機、不均衡、障害が生じる機会が増える。

学習ステップでは、アクセラレータがデータを処理し、中間結果を交換し、勾配を集約し、モデル状態を更新する必要がある。1つのワーカーが遅れると、他のワーカーは同期地点に到達して待つことになる。

この問題は、不規則なレコメンデーションデータでより深刻になる。ユーザー履歴の長さは異なり、スパース特徴へのアクセスもサンプルごとに異なる。サンプル数が同じでも、処理量が同じとは限らない。

デンスTransformerでも慎重な並列化が必要になる。レコメンデーションモデルには、デンス層とは異なる通信挙動を持つ巨大なスパースコンポーネントが加わる。単一の戦略では、両者を効率的に分散できない。

MetaはデンスモデルコンポーネントにHybrid Sharded Data Parallelismを使用している。HSDPはGPUグループ内でモデル状態を分割しつつ、選択した状態をグループ間で複製する。狙いは、すべての通信処理をクラスター全体に送ることなく、メモリ消費を制御することだ。

GEMのスパースコンポーネントには別の構成が必要となる。Metaは、同期コストとメモリ局所性を軸として編成した、データ並列化とモデル並列化の2次元的な組み合わせを説明している。

データ並列化では、モデルのコピーまたはシャードを維持しながら、ワーカーに異なるサンプルを与える。モデル並列化では、モデル自体をデバイス間で分割する。両者を組み合わせることで、十分な並列処理を確保しながら、大規模な埋め込み構造を収まる場所に配置できる。

この設計には難しいトレードオフがある。シャーディングを増やせば各アクセラレータのメモリ負荷は減るが、通信は増える。複製を増やせば一部の通信を減らせるが、貴重な高帯域幅メモリを消費する。

ここで力任せのスケーリングは破綻する。クラスターを2倍にしても、有用な計算が自動的に2倍になるわけではない。大規模ジョブでは、データ交換、遅延ワーカーの待機、障害後の失われた状態の再構築により多くの時間を費やす可能性がある。

GoogleはPaLMの研究で、この問題の別の側面を示した。5400億パラメータのPaLMシステムは、デンス言語モデルアーキテクチャと高度に最適化されたソフトウェアスタックを用い、6,144基のTPU v4チップで46.2%のMFUを報告した。

この数値は、PaLMのシステムがGEMより優れていることを示すものではない。アーキテクチャ、ハードウェア、データ、MFUの計算方法が異なるためだ。GEMのスパースなレコメンデーションワークロードには、単純な比較を誤解を招くものにする通信・メモリアクセスのパターンがある。

それでも、この比較は読者に有用な基準点を与える。MFUの結果は、それを生み出すワークロードの文脈でのみ意味を持つ。デンスTransformerのベンチマークを、スパースな広告モデルに対する普遍的な目標として扱うことはできない。

Metaの20%から25%という範囲は、主張されるエンドツーエンド効率の2倍改善と組み合わせることで、より多くを語る。重要なのは、学習計算量を4倍に増やしながら、GEMの従来のベースラインから進展した点だ。

エンドツーエンドの効率は、カーネル速度を超えた範囲にも及ぶ。入力パイプラインが停止したり、チェックポイント処理でクラスターが止まったり、ワーカーが繰り返し再起動したりする状況では、高速な行列乗算は役に立たない。

Metaは以前、GEMには学習レシピの全面的な見直しが必要だったと述べている。その前世代では、GPU数を16倍にしながら実効学習FLOPsを23倍に増やし、MFUも1.43倍に向上させた。

2026年8月の結果は、このスケーリング計画の次の段階を示す。ハードウェアの追加や基本的な並列化による比較的得やすい利点をすでに取り込んだ後も、同社がさらなる改善を見つけたことを示唆している。

これは、あらゆる大規模レコメンデーション事業のインフラチームに圧力をかける。GPUへのアクセスは依然として重要だが、それだけで理論上のスループットをモデルの進歩に変えられるわけではない。

効率向上はモデルとシステムの協調設計から生まれた

Metaは、GEMの効率を2倍にした単一の最適化を特定していない。この向上は、モデルと学習スタックを1つのシステムとして動作させた結果だ。

レコメンデーションモデルは、標準的な言語モデル用カーネルでは常に効率的に処理できるとは限らない作業を生み出す。行動履歴には可変長があり、しばしばジャギッドシーケンスと呼ばれる。すべてのシーケンスを同じ最大長までパディングすると、空の位置に対する計算が無駄になる。

Metaは、こうした不規則な入力向けにカスタムGPUカーネルを開発した。カーネル融合は複数の演算を組み合わせ、データがアクセラレータメモリと別々の処理段階の間を移動する時間を減らす。

このアプローチは、大規模モデル学習から得られた幅広い教訓に沿う。ハードウェアのピーク仕様は理想的な演算スループットを示すが、実際のジョブはメモリ帯域幅、起動オーバーヘッド、通信によって制約されることが多い。

GEMの注意機構も、よく知られたTransformerのレシピとは異なる。Generalized dot-product attentionは、標準的なsoftmax演算を、異なる特徴量相互作用タスクに適した代替活性化関数に置き換える。

公開されているattention kernel designでは、GEM内で使用されるInterFormerおよびKunlunアーキテクチャのサポートが説明されている。これは、なぜレコメンデーションシステムが標準的な言語モデルのattentionカーネルより高い柔軟性を必要とするのかを示している。

InterFormerは、シーケンス学習と特徴量間の相互作用を交互に行う。この構造によりGEMは、詳細な行動シーケンスを保持しながら、広告主、ユーザー、掲載枠、クリエイティブの属性と結び付けられる。

Kunlunは、非シーケンス特徴の相互作用モデリングを拡張する。これらの特徴には、時系列ストリームを自然には形成しないユーザー属性や広告属性が含まれ得る。

これらのアーキテクチャを汎用カーネルでサポートすれば、オーバーヘッドが発生する。各バリアントを無関係なカスタムコードで個別にサポートすれば、保守上の問題が生じる。汎用化されたカーネルは、最適化された実行パターンを活用しつつ柔軟性を維持する、中間的なアプローチを目指している。

Metaは、GPU通信の変更についても説明している。NVIDIAのCollective Communications Libraryを拡張したNCCLXでは、Streaming Multiprocessorのリソースを消費せずに、選択された通信を実行できる。

Streaming Multiprocessor(SM)は、GPU計算の大半を実行する。通信処理が同じリソースを奪い合う場合、計算とネットワークのオーバーラップ効率は低下する。

この競合を取り除くことで、モデルの一部が計算を行う間に、別のデータをデバイス間で転送できる。その効果は、ジョブが数千台のアクセラレータにまたがり、各ステップの多くの地点で情報を交換する場合に大きくなる。

データ読み込みも、別のボトルネックになり得る。GEMは、トレーニングクラスタを稼働させ続けられる速度で、変化し続けるインタラクションデータを継続的に取り込まなければならない。GPUが高速化しても、上流で生じる遅延はむしろ際立つだけだ。

チェックポイント作成も、主要な課題となる。チェックポイントはトレーニング状態を保存し、中断後にジョブを復旧できるようにする。モデルが大きくなるほど状態スナップショットも大きくなり、クラスタが大規模になるほど、ハードウェアやネットワークの障害が集計的に発生する機会も増える。

チェックポイントの頻度を上げれば失われる作業は減るが、より多くの時間とストレージ帯域幅を消費する。頻度を下げれば定常状態でのスループットは改善する一方、障害後にやり直すトレーニング量は増える。

完全な効率化プログラムは、この両方の結果をバランスさせる必要がある。最速の中断なしの区間だけを最適化し、起動、検証、チェックポイント作成、復旧を無視することはできない。

Metaは以前、トレーナー初期化、データリーダー、チェックポイント作成、PyTorchコンパイルを最適化した後、GEMのジョブ起動時間を5分の1に短縮したと報告している。これらの作業は見出しとなるモデルアーキテクチャの外側にあるが、高価な計算資源がどれだけ早く生産的な作業を開始できるかを左右する。

このことは、新たな主張でエンドツーエンド効率という表現が使われている理由を説明する。この言葉遣いは、孤立したカーネルベンチマークよりも、トレーニングプロセスの広い範囲にまたがる測定を示唆している。

この結果は、Metaの基盤モデル戦略とインフラ戦略が切り離せない理由も示している。共有モデルは、その表現が複数の広告面に恩恵をもたらすため、より大きなエンジニアリング投資を正当化できる。

単一の掲載枠向けの小規模なランキングモデルでは、カスタム通信ライブラリや専用カーネルを正当化できないかもしれない。FacebookとInstagramに影響する中心的なモデルは、インフラ改善ごとのリターンをより大きくする。

このフィードバックループは、非常に大規模に運用する企業に有利に働く。より多くのインタラクションが幅広いトレーニングを支え、より幅広いモデルは、より多くの製品で効率化投資を活用可能にする。

同じループはリスクも生む。学習を一元化すると、モデルの誤りやデータのバイアスが複数の面に広がる可能性がある。Metaは、共有表現が製品間の意味ある違いを消してしまわないよう、ドメイン固有の目的を維持しなければならない。

そのアーキテクチャは、マルチドメイン学習と専用の下流モデルによってこの課題に対処している。基盤モデルは知識を共有する一方、プロダクションシステムは面ごとの制約と目的を保持する。

これは、1つのモデルがリアルタイムで全広告を直接選択する仕組みではない。GEMは学習済みの情報を、より広範なランキングおよび配信スタックに供給し、そこでレイテンシに敏感なシステムが本番の意思決定を行う。

GEMは総当たり的スケーリングの定石に圧力をかける

この結果は、競争優位が主にアクセラレータをさらに購入することから得られるという前提を弱める。この規模では、調整の質がハードウェアからどれだけの価値を引き出せるかを決める。

Metaは非常に大規模なGPUクラスタを利用できるが、それを効率的に使う強い理由もある。広告は同社事業の大半を支えており、わずかな改善であっても、膨大な数のランキング判断にわたる成果に影響を及ぼし得る。

GEMの役割は、インフラ支出をその収益エンジンに結び付ける。より優れた共有表現は、エンゲージメント、コンバージョン、その他の広告主向け成果を予測する小規模モデルを改善できる。

基盤モデルのアプローチは、モデルチームの働き方も変える。孤立したモデル群では、学習とインフラが重複し得る。GEMは、下流チームが適応できる表現の中心的な供給源を提供する。

Metaはこれらの専用システムを価値モデルと呼ぶ。これらは、大規模な基盤モデルが直接満たせないプロダクション上の制約の中で動作する。そこには、厳格な応答時間や、面ごとに異なる目的が含まれる。

知識蒸留は、より大きな教師モデルから、より小さな生徒モデルへと振る舞いを移転する。Metaによれば、新しい移転フレームワークは標準的な蒸留の2倍効果的だが、外部の人間は公開された資料からその比較を検証できない。

パラメータ共有は別の移転経路を提供する。下流モデルは、基盤モデル全体を再現するのではなく、選択したコンポーネントを再利用できる。これにより、専用の実行を維持しながら冗長性を減らせる。

このアーキテクチャは、各掲載枠や目的ごとにチームが別々のランカーを改善し続ける、より断片化されたアプローチと競合する。断片化は制御性とデバッグの容易さをもたらし得るが、共有学習を制限する。

中心的なアプローチは、ある面の証拠を別の面の改善に活用できる。また、個々のモデルでは意味ある成果をほとんど観測できない、希少な目的をまたいで学習することも可能だ。

他の主要プラットフォームも、同じ戦略上の問いに直面している。Googleは大規模なレコメンデーション研究と広告システムを組み合わせており、TikTokの製品はシーケンスベースのレコメンデーションに大きく依存している。各社の内部測定は、MetaのGEMに関する開示と公開ベースで比較可能ではない。

したがって、重要な圧力は単一のベンチマークを超えたものだ。Metaは、LLM規模のインフラ手法が収益に直結するレコメンデーションのトレーニングへ移行可能であることを示している。

同社の適応型ランキングシステムは、対応するサービング上の問題に取り組んでいる。本番システムが広告のレイテンシとコストの制約内でその学習を適用できなければ、より大きなモデルをトレーニングしても価値は限られる。

Metaのスタックは、この課題を分割している。GEMはトレーニング中に高コストな共有学習を実行する。専用ランキングモデルと最適化されたランタイムが、その知能をライブ配信へと持ち込む。

Andromedaは、パイプラインの別の部分を担う。後続のランキング段階がより詳しく評価する前に、はるかに大きなプールからより小さな広告候補集合を取得する。

生成ツールによって利用可能な広告バリエーションの数が増えるにつれ、この違いは重要になる。クリエイティブの選択肢が増えると候補空間が拡大し、効果的な検索とランキングの価値が高まる。

GEMは、広告主が関連性の高いオファーや信頼できるメッセージを作成する必要性をなくすものではない。より優れたモデルは利用可能な選択肢から選べるが、需要を保証したり、弱い経済性を修復したりはできない。

システムの解釈も難しくなる可能性がある。中心的なモデルが複数の面にわたるパターンを学習し、それを下流モデルに渡すと、1つの配信結果を1つの要因までたどることは困難になる。

広告主は、対応する説明を受けないままパフォーマンスの変化を経験する可能性がある。Metaは内部で集計的な改善を測定できる一方、個々の購入者が見る結果は、予算、オーディエンス、クリエイティブ、競争、アトリビューションによって左右される。

この情報格差は、キャンペーンへの影響に関する広範な主張を抑制すべきだ。トレーニング効率はインフラ上の成果である。すべての広告主に一様なコンバージョン改善を保証するものではない。

Metaの20%から25%のMFUが示していないこと

Metaの見出しとなる指標は方向性としての進歩を示すが、GEMトレーニングの経済的コストや環境コストの全体像を明らかにするものではない。

MFUは、理論上のピークスループットに対するモデル計算を対象とする。ハードウェアが実行するすべての処理を自動的に含むわけではない。また、ジョブ開始前のクラスタ可用性も考慮しない。

モデルが大幅に大きくなれば、システムはMFUを改善しながら総エネルギー消費を増やすことがある。GEMのトレーニングFLOPsは4倍に増えているため、1回の実行で行われる絶対的な作業量ははるかに大きい。

その拡大は、なお経済的に合理的であり得る。より大きなモデルは予測を改善でき、利用率の向上は一定量の計算に必要なハードウェアを削減できる。

しかし、Metaは1回の実行あたりの絶対的なエネルギー消費を開示していない。トレーニングFLOPあたりのコスト、アクセラレータの総稼働時間、同一ハードウェアを用いた比較も提示していない。

「最新世代GPU」という表現も、重要な詳細を明らかにしていない。アクセラレータのモデル、数値精度、ネットワークトポロジー、電力制限は、理論上のピーク性能と測定されたMFUに大きく影響し得る。

MFUの分母の変化も重要だ。新しいGPUはより多くの理論上のFLOPsを提供するが、アプリケーションが常にそれらの能力を同程度に活用するとは限らない。世代間で百分率を比較するには、慎重な正規化が必要である。

システムが変化する一方で、モデル自体も変化した。トレーニングFLOPsが4倍になると、処理サイズ、バッチの挙動、計算と通信のバランスが変わる可能性がある。

より大きな行列演算は、小規模なものよりGPUを効率的に利用できる場合がある。したがって、MFUの向上の一部は、普遍的に再利用可能なソフトウェア改善ではなく、ワークロード形状に由来する可能性がある。

Metaのエンドツーエンドという枠組みは有用だが、公開された説明は依然としてシステムを運用する企業自身によるものだ。独立した第三者がGEMを再現したり、報告された効率を監査したりしたわけではない。

この制約は、数字に情報価値がないことを意味しない。内部のプロダクションシステムには、しばしば独自のデータやアーキテクチャが含まれる。完全な再現は、プライバシー、セキュリティ、競争上の懸念を引き起こすだろう。

ただし読者は、「2倍」という表現を、Meta自身の以前のGEMスタックとの比較として受け取るべきである。GEMが競合するすべてのレコメンデーションモデルの2倍効率的であることの証拠ではない。

モデル品質に関する主張にも同様の注意が必要だ。Metaは以前、一定量のデータと計算資源から広告パフォーマンスの向上を生み出す効率が、GEMによって4倍になったと述べている。同社は競合プラットフォームを対象とする公開ベンチマークを発表していない。

プロダクションにおける広告成果も時間とともに変化する。オークション条件、クリエイティブの供給、ユーザー行動、プライバシー規則、測定手法は、観測される改善に影響し得る。

一元化は運用上のリスクももたらす。複数の製品で使用される基盤モデルは重要な依存関係となる。トレーニングの遅延や欠陥のある更新は、1つの孤立したモデル内の問題よりも多くのチームに影響を及ぼし得る。

Metaは、チェックポイント、検証、専用の価値モデル、制御された知識移転によってこれを緩和している。それでも新たな規模は、ミスのコストを引き上げる。

プライバシーも別の境界であり続ける。GEMは、Metaのアプリケーション全体にわたる広告およびオーガニックなエンゲージメントシグナルから学習する。より広範なシーケンスモデリングは、システムが内部統制に基づいて設計されている場合でも、行動からより豊かなパターンを抽出できる。

技術的な開示は、新たなプライバシーポリシー分析を提供するものではない。読者は、トレーニング効率の向上が、Metaが収集するデータやその利用を規律する保護措置を変更するものだと推論すべきではない。

エンジニアにとっての教訓は、より限定的かつ具体的だ。MFUは、ジョブ完了率、復旧時間、データスループット、エネルギー使用量、モデル品質の改善と並ぶ、複数の診断指標の1つであるべきだ。

複雑なシステムを文書化するチームは、そうした違いを検索可能なエンジニアリング・ナレッジベースに残すことができる。この取り組みは、魅力的な単一の指標が運用全体の実像に取って代わることを防ぐ助けとなる。

Meta Engineeringの取り組みを試す3つのシグナル

次の焦点は、GEMのインフラ改善が、トレーニングコストや運用リスクを比例して増やすことなく、再現可能なモデル改善につながるかどうかだ。

最初のシグナルは、計算資源単位当たりのモデル品質についてMetaが次に開示する内容である。トレーニングFLOPsの4倍増は規模を示し、より高いMFUは利用効率の改善を示す。ただし、いずれも単独では、大規模な実行によってどれだけの広告価値が追加で生まれたかを示さない。

今後の比較では、追加データ、アーキテクチャ変更、トレーニング期間、ハードウェア改善による効果を分けて評価すべきだ。Metaが管理された計算予算の下でより良い成果を報告すれば、基盤モデルの有効性はより強く裏付けられる。

計算量が増え続ける一方で品質向上が頭打ちになれば、効率化の成果はより防御的なものに見えるだろう。Metaはハードウェアをより有効に使っていることになるが、追加のトレーニング単位ごとに得られる事業価値は小さくなる可能性がある。

2つ目のシグナルは、FacebookとInstagramの各面におけるGEM由来の学習の展開拡大だ。MetaはGEMを、プロダクションシステムを置き換えるのではなく、そこへ知識を移転する中核モデルとして位置付けている。

展開が成功すれば、共有コンポーネントや改善された転移手法を採用する下流モデルの増加として現れるはずだ。同時に、異なる掲載面や広告主の目的に必要な専門的な振る舞いも維持しなければならない。

基盤モデルの規模が拡大しても、展開が安定している証拠に注目したい。チームが結果を十分な速さで検証、蒸留、提供できなければ、トレーニングの高速化は価値を失う。

3つ目のシグナルは、Metaが次に開示するインフラ上のボトルネックだ。2倍の効率改善でスケーリングの問題が終わることはほとんどない。通常は制約要因が別の場所へ移るだけである。

その制約は、ネットワーク通信、チェックポイントのストレージ、データ取り込み、コンパイル、信頼性、あるいは本番推論に現れるかもしれない。Metaのこれまでの取り組みは、すでにそれらの大半のレイヤーに及んでいる。

新たなボトルネックが見つかっても、今回の成果が無効になるわけではない。それは、GEMが完成済みのプラットフォームではなく、現在も積極的に再構築が進むシステムであることを示すだろう。

最も強い裏付けとなるのは、広告品質の向上、安定した下流展開、有用な改善当たりのコスト増加の鈍化という3つの結果がそろうことだ。そのうち1つでも欠ければ、より広範な主張は弱まる。

開発者は、Metaが基盤となる取り組みをPyTorchや関連するオープンソースのインフラにさらに還元するかどうかにも注目すべきだ。汎用化されたattentionカーネルは、内部要件が再利用可能なエンジニアリングへと変わる一例である。

再利用可能なコンポーネントが重要なのは、ほとんどの組織がGEMのクラスターを再現できないためだ。それでも、不規則なシーケンスの処理、通信のオーバーラップ、融合演算、分散チェックポイントの改善から恩恵を受けることはできる。

広告主にとって重要な問いは別にある。特にアカウントが提供する過去データが限られる場合、掲載面や目的をまたいでキャンペーンのパフォーマンスがより一貫するかどうかに注目すべきだ。

インフラ責任者にとって、GEMはより直接的な課題を提示する。割り当てられたアクセラレーター容量のうち、どれだけがモデルを前進させているかを測定し、残るすべての損失をトレーニングライフサイクル全体で追跡することだ。

Meta Engineeringは、エンドツーエンドの効率を2倍にした後でもMFUが20%から25%にとどまるという印象的な数値を示した。より深いメッセージは、アクセラレーター数がAI能力を測る不完全な指標になったということだ。

次の優位性は、購入した計算資源のより多くを信頼できる学習へと変換することから生まれる。GEMは、その変換に今どれほどのエンジニアリングが必要かを示している。自社のトレーニングシステム内で最大の損失を明らかにする指標は何か。そして次のクラスターを購入する前に、チームはそれを測定できるだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page