DeepSeek Engramのオフロード、AIメモリーをHBMの外へ
DeepSeek Engramのオフロードにより、189 GiBのモデルメモリーがGPU HBMの外部へ移され、DRAMを用いたテストでは、全HBM構成を上回る場合もあった。この結果は、大規模モデルのインフラに関する基本的な前提を覆す。最速のメモリーが、すべてのパラメーターにとって自動的に最適な配置先になるとは限らない。
SemiAnalysisは9月18日、DeepSeek-V4.1-Flashとその推論サービングフレームワークInferenceXを用いた新たな実験を公開した。テストではEngramテーブルをホストDRAM、またはローカルNVMeドライブ上のメモリーマップドファイルに配置した。DRAM経路ではテンソル並列性を削減することで、あるB300構成の性能が向上した一方、最初のSSD実装は依然として低速で経済性にも劣った。
この違いは重要である。Engramは、Nvidia GPUや高帯域幅メモリーへの需要をなくすものではない。希少な容量を割くべきモデルパラメーターを変えるのだ。したがって当面の競争は、HBM対SSDではない。全HBMのデプロイメントモデルと、HBM、DRAM、ストレージに異なるワークロードを割り当てる階層型システムとの競争である。
DeepSeek Engramのオフロードがパラメーター配置を変える
中心的な変化はアーキテクチャにある。学習済みメモリーの大きなブロックをHBMの外へ移しても、モデル全体をオフロード型ニューラルネットワークのように振る舞わせる必要はない。
DeepSeekは、言語モデル向けの条件付きメモリーモジュールとしてEngramを導入した。これは、繰り返し現れる複数トークンのパターンに対する学習済みルックアップによって、通常のトークン埋め込みを拡張する。こうしたパターンには、名前、コード断片、定型文、一般的な関係表現などが含まれる。
通常のTransformerは、こうした局所的なパターンをアテンション層とフィードフォワード層を通じて再構築することが多い。Engramはモデルに別個のルックアップ経路を与える。トークン列をハッシュ化し、少数の埋め込み行を取得して、モデルの隠れ状態と結合する。
元の条件付きメモリー論文では、この手法を第2のスパース性の形態として説明している。Mixture-of-Experts、すなわちMoEは、各トークンに対してモデル計算の一部だけを活性化する。Engramは、はるかに大規模なメモリーテーブルのごく一部だけを活性化する。
この違いが、ハードウェアがモデルをどのようにサーブできるかを決める。MoEのエキスパートには、大規模な計算に使用される重み行列が含まれる。ストレージ階層間で移動させれば、最悪のタイミングで大きな転送が必要になる可能性がある。
Engramのアドレスは異なる。中間的な隠れ状態ではなく、トークンIDとその局所的な並びに依存する。ランタイムは、後続のモデル層の計算が完了する前に、必要な行を把握できる。
この予測可能性がプリフェッチの時間枠を生む。GPUが前段の処理を行っている間に、サーバーはホストメモリーから行を取得できる。取得がその時間枠内に完了すれば、モデルは通常オフロードに伴う遅延の多くを回避できる。
DeepSeekが公開した研究では、実験的なEngramテーブルを270億パラメーターまで拡張した。統制された比較では、同等のパラメーター数と計算量を持つMoEベースラインを上回る改善が報告された。報告された改善は、事実知識、推論、コード、数学、長文脈検索に及んだ。
これらの数値は、SemiAnalysisがテストした正確な本番システムではなく、研究モデルに基づくものだ。それでも、Engramを任意のメタデータとして扱えない理由を説明している。Engramは、学習済みモデルの推論経路の一部となる。
SemiAnalysisは、推論時にEngramを除去することでこの点を裏付けた。同社の分析によると、以前の論文におけるアブレーションでは、事実系ベンチマークの性能は元の29〜44%しか維持されなかった。読解は81〜93%を維持した。
この低下は、Engramがあらゆる従来型モデルを上回ることを証明するものではない。ネットワークはメモリーモジュールに依存するよう学習されている。そのモジュールを取り除けば、学習と推論の不一致が生じる。
ただしこの実験は、メモリーが不足した際に運用者が単にテーブルを削除することはできないことを示している。効率的にサーブするか、圧縮するか、別の場所へ配置しなければならない。
DeepSeek-V4.1-Flashは、配置の問題を具体的なものにする。DeepSeekによると、このモデルは5520億パラメーターのMoEバックボーンを持ち、入力処理時に80億パラメーター、出力生成時に160億パラメーターがアクティブになる。Engramは、これにさらに大規模な条件付きメモリーのプールを加える。
V4.1-Flashのリリースでは、KVキャッシュが前世代比でHBM使用量を4分の1、SSDストレージ使用量を8分の1に抑えるとも主張している。KVキャッシュは、以前のトークンから再利用できるアテンション状態を保存する。Engramとは別の機能だが、両者はサーバーメモリーの要件を再構築する。
SemiAnalysisは、モデルのEngramテーブルに約189 GiBを使用した。それでも、各処理トークン位置が要求したのは、2つのEngram層でわずか24行だった。これはモデル全体で約12.4 KiB、4 GPU構成ではGPU当たり3.1 KiBに相当する。
テーブルは巨大だが、アクティブな読み出しは小さい。この非対称性こそが、DeepSeek Engramのオフロードが成立する理由である。
DRAMオフロードが全HBM設計に圧力をかける
GPU帯域幅が依然として不可欠であっても、Engramは総パラメーター数と必要HBM容量の結び付きを弱める。
HBMはAI推論にとって2つの価値ある特性を持つ。高い帯域幅を提供し、GPUコンピュートの近くに配置されることだ。こうした利点により、頻繁にアクセスされる重みや増大するKVキャッシュにとって自然な配置先となる。
しかし、システム全体で見れば容量は高価なままである。運用者は、ワークロードがフルの計算能力を必要としなくても、モデルが収まらないという理由でGPUを追加することが多い。追加されたアクセラレーターは、通信コストと運用上の複雑さをもたらす。
Engramは、容量と計算を分離する手段を提供する。サーバーは密な層、アクティブなエキスパート、遅延に敏感な状態をHBMに保持できる。スパースなメモリーテーブルはホストDRAMに配置できる。
SemiAnalysisは、Unified Virtual Addressing、すなわちUVAを通じてこの構成をテストした。UVAにより、GPUは単一の共有アドレス空間内でピン留めされたホストメモリーをアドレス指定できる。同じGPUカーネルが、HBMまたはDRAMからEngram行を選択し、量子化解除した。
これは通常のCPU管理型オフロードではなかった。GPUがピン留めされたホスト割り当てへ直接アクセスした。非同期実行により、取得を他のモデル処理と重ね合わせることができた。
意外な結果はNvidiaのB300で現れた。SemiAnalysisによると、EngramをDRAMへ移すことで、構成を4ウェイのテンソル並列性から2ウェイへ切り替えられた。
テンソル並列性は、モデル処理を複数GPUに分割する。大規模モデルを収めることはできるが、分割のたびに同期と通信が追加される。そのため、分割を減らすことで、より低速なメモリー階層を相殺できる。
テストによると、その結果としてB300のスループットと対話性のフロンティアは最大1.6倍改善した。テーブルをHBMへ戻しても、この初期段階のソフトウェアスタックでは、実行ごとのばらつきを超える測定可能な改善は得られなかった。
この発見は、もっとも単純なメモリー階層の議論を覆す。HBMは個々のルックアップを高速化したが、そのルックアップは完全なサービング経路の一部にすぎない。Engramは、本来ならKVキャッシュ、バッチ処理、またはより小さなレプリカを支えられる容量を消費した。
DRAMはトポロジーを変えることで、システム全体を改善した。その利点は、DRAMが生のアクセス速度でHBMを上回ったことによるものではない。
これがGPUシステム設計に対する主な圧力である。従来、運用者はチェックポイントサイズ、ランタイム状態、そして余裕分を合計してモデル適合性を評価してきた。Engramは、アクセスパターン別にメモリーを分類することを求める。
高頻度で密度が高く、帯域幅集約的な重みは依然としてHBMに適している。予測可能なスパース行は、計算が転送を隠せる場合、DRAMを許容できる。長期テールの行は、キャッシュとソフトウェアのオーバーヘッドが制御可能であれば、最終的にはNVMeに配置される可能性がある。
この変化はメモリー供給企業にも影響を与える。EngramはHBM需要を終わらせるものではない。SemiAnalysisの実験はむしろ、一部の推論構成では最大HBM容量より帯域幅のほうが重要になり得ることを示唆している。
同時に、サーバーDRAMはモデルサービングの性能範囲の一部となる。容量計画では、ピン留め割り当て、メモリーチャネル、PCIeの挙動、レプリカ間の競合を考慮しなければならない。
NVMeも、チェックポイントやKVキャッシュを保存するだけでなく、新たな役割を担う可能性がある。モデルパラメーターがローカルストレージから能動的にサーブされるようになれば、その市場は拡大する。ただし、その機会はストレージ読み出しを経済的に有用にするソフトウェアにかかっている。
直近の勝者は、必ずしも最大のメモリープールを販売するベンダーではない。高価なアクセラレーターを停止させずに、複数の階層を協調させられるシステムである。
AIインフラの購入者にとって、総モデルサイズは調達判断の指標として弱くなる。アクティブパラメーター、トークン当たりの取得バイト数、プリフェッチ距離、レプリカトポロジーのほうが、より有用な指針を提供する。
7480億パラメーターのシステムは、同規模の密なモデルとは大きく異なるハードウェア要件を課す可能性がある。DeepSeek-V4.1-Flashは、スパースなバックボーン、条件付きメモリー、削減されたKVキャッシュを組み合わせる。それぞれが異なるリソースに負荷をかける。
この複雑さは比較も難しくする。トークン毎秒のみを測定するベンチマークは、個々の同時実行レベルでの遅延を隠す可能性がある。構成がメモリー容量のためだけにGPUを追加する場合、コスト結果は変わり得る。
最も有用な比較は、スループットをユーザーに見える対話性と照らして示すものだ。そのうえで、単一の孤立したカーネルがどれほど高速に動くかではなく、完全なサーバー1台がどれだけ有用な処理を生み出すかを問う。
EngramがGPUメモリーの外部で機能する理由
決定論的なアドレッシングにより、ランタイムはメモリーを取得する時間を確保でき、スパースアクセスによって各転送は計算と重ね合わせられるほど小さく保たれる。
EngramはN-gramから始まる。N-gramは隣接するトークンの短い列である。このアーキテクチャはトークナイザーの語彙を圧縮し、複数のヘッドを通じて局所的な列をハッシュ化し、そのハッシュを学習済みの行にマッピングする。
トークナイザーは視覚的に似たテキストにも異なるIDを割り当てることが多いため、語彙圧縮は重要である。大文字・小文字、空白、Unicode形式は、繰り返しパターンを断片化する可能性がある。論文は、ある128,000トークンの語彙において有効語彙を23%削減したと報告している。
取得された埋め込みは、そのままモデルに入るわけではない。コンテキスト認識型ゲートが、各ルックアップが現在の隠れ状態に与える影響の大きさを制御する。軽量な畳み込みが近傍のコンテキストを追加してから、メモリーの寄与が後続層に渡される。
この設計は、Engramの価値と限界の両方を説明する。テーブルは再利用可能な統計的パターンを保存するが、モデルはそれをどの程度使用するかを依然として判断する。明確な事実レコードを含む従来型データベースではない。
SemiAnalysisは、DeepSeek-V4.1-Flashにおいて高ゲートのパターンを調査した。その結果、名前、コード断片、関係表現、ライセンス、参考文献の断片、Webの定型文が見つかった。珍しい例の一つは、Ace Attorneyゲームシリーズに言及していた。
これらの結果は、テーブルが人間による価値ある知識の判断ではなく、次トークン予測を最適化していることを示唆する。繰り返し使われる書式は、予測の近道を提供するなら有用になり得る。
この発見はキャッシュを複雑にする。強いゲートは、必ずしも頻繁にアクセスされる行を示すわけではない。ある行は取得時の価値が高くても、本番トラフィック全体ではめったに現れない可能性がある。
ランタイムは、ゲートを確認した後にすべての弱いルックアップを回避できるわけでもない。ゲートの計算には対応するキーが必要であり、その時点ですでに取得が発生している。読み出しを省略するには、メモリーアクセスの前に動作する別個の予測器が必要になる。
アクセス頻度も、引き続きロングテール分布に従うはずだ。頻出語、一般的なプログラミングパターン、定型的な構文は、まれなエンティティよりも頻繁に現れる。このため、多層キャッシュは十分に現実的なものとなる。
頻繁に要求される行はHBMに残せる。より大きなワーキングセットはホストDRAMに置ける。まれにしか参照されない行はNVMeに置き、トラフィックによって有用性が高まれば、より高速な階層へ移せる。
CXL memory researchは、この考え方を単一サーバーに直接接続されたDRAMの範囲を超えて拡張している。著者らは、共有メモリデバイスへのきめ細かなアクセスをサポートするCompute Express Linkを介して、Engramメモリをプールすることを提案している。
この提案は依然として研究段階であり、本番環境における経済性の証明ではない。CXLには、独自のレイテンシー、トポロジー、ソフトウェア上の考慮事項が伴う。それでも、条件付きメモリがシステムの境界をどのように変えるかを示している。
運用者は、GPUコンピュートとは独立してルックアッププールをスケールできる。複数のアクセラレータが、各GPUレプリカ内にテーブル全体を複製するのではなく、容量を共有できる可能性がある。
これらの設計に共通する中心的な仕組みはプリフェッチだ。ストレージのレイテンシーを隠す必要があるなら、Engramレイヤーを任意に早い位置へ置くことはできない。先行する計算が多いほど、取得に使える時間枠は長くなる。
モデル品質は反対方向へ作用し得る。早期にメモリを介入させれば、ネットワークは最初のレイヤーで一般的なローカルパターンを再構築するために処理を費やさずに済む。Engramを遅すぎる位置に置くと、この利点が弱まる可能性がある。
これは真の協調設計問題を生む。モデル研究者は挿入レイヤー、テーブル次元、ハッシュ動作、ゲートを選ぶ。ランタイムエンジニアは、それらの選択に合わせてプリフェッチキュー、キャッシュ、カーネル、転送経路を設計する。
その後、ハードウェアチームが各階層にどれだけの帯域幅と容量を提供すべきかを決める。これらの判断はいずれも独立して最適化できない。
DeepSeekの論文は、MoE計算に割り当てるパラメータとEngramメモリに割り当てるパラメータの間にU字型の関係があると報告した。メモリが少なすぎると、繰り返し現れるパターンがニューラルバックボーンに残された。多すぎると、他のタスクに使える計算資源が減少した。
この結果は、Engramを無制限に安価な容量として扱うべきではないことを示している。テーブル行を増やせば検証損失を改善できるが、それはバランスの取れたシステム内に限られる。学習データの品質も、それらの行が何を学ぶかを左右する。
より広いアーキテクチャ上の含意は重要だ。スケーリングはもはや、すべての新規パラメータをGPU演算の隣に置くことを意味しない。モデルは予測可能なスパース検索を通じて容量を追加し、高価な帯域幅は動的な計算のために確保できる。
SSDオフロードはまだ安価な答えではない
最初のNVMe実験では確保済みDRAM容量を削減できたが、最適化されていないデータ経路は速度と効率の両方でピン留めDRAMに劣った。
SemiAnalysisは、189 GiBのEngram割り当てをローカルSSD上のメモリマップドファイルに置き換えた。メモリマップドファイルは、オペレーティングシステムが仮想メモリページを通じてストレージを公開できるようにする。最近アクセスされたページは、ファイルシステムキャッシュに残せる。
このアプローチは運用上の柔軟性をもたらす。他のアプリケーションがメモリを必要とする場合、オペレーティングシステムはキャッシュ済みページを回収できる。運用者はEngramテーブル全体をDRAMに恒久的にピン留めする必要がない。
ただし、ウォームなページキャッシュがあっても、SSD経路がネイティブDRAMオフロードと同等になるわけではない。このプロトタイプでは、依然として行識別子をCPUへ移し、重複を除去し、行をピン留めバッファへ集め、コピーして戻していた。
その後、選択した行をGPU上で逆量子化した。これらの処理は、ピン留めホストメモリで使われる直接UVAカーネルではなく、GPU実行のセグメント間で実行された。
各ステップが協調処理を追加する。CPUスケジューリング、識別子転送、行の収集、バッファ管理、GPUコピーは、物理ストレージからの読み出しより大きなコストとなり得る。したがって、リクエストがNANDフラッシュに到達しない場合でも、キャッシュ済みファイルはピン留めDRAMに遅れを取る可能性がある。
B200の結果はその差を明らかにした。ユーザーごとに毎秒約125トークンの条件で、DRAM構成は支出単位当たり合計1億2,100万トークンを生み出した。SSD経路は5,200万トークンだった。
この測定比較では、DRAMは約2.3倍のトークンを提供した。また、遅いリクエストがテール付近で受ける体験を測るP90インタラクティビティでも、観測されたSSD構成を上回った。
研究者らはテストでGPUDirect Storage、すなわちGDSを有効化できなかった。GDSは、CPUの関与を抑えてNVMeとGPUメモリの間でデータを移動できる。その不在は、この実験が最適化されたストレージ経路について何を示せるかを制限している。
この結果を、NVMeがEngramに使えない証拠として捉えるべきではない。安価なストレージメディアが自動的に安価な推論を実現するわけではないことを示している。
4基のB200 GPUはサーバー内に残っていた。CPU、ネットワーク、電力、そして大半の支援インフラも同様だ。DRAMをSSDに置き換えても、構成の高コスト部分を削減せずに、1つの容量要件を減らしただけだった。
経済的な勝利には第二の効果が必要となる。SSDオフロードは、より安価なサーバーを可能にするか、より多くの生産的なレプリカを収容するか、より大きなモデルを支えるか、あるいは別の価値あるワークロードのためにDRAMを解放しなければならない。
このプロトタイプは、測定したセットアップではそのいずれも達成していない。ファイルシステムキャッシュも、ファイルバックアップによって節約する意図だったDRAMの多くを消費し得る。
ワークロードの局所性も別の不確実性を生む。反復的なプロンプトを持つ安定したサービスなら、有用なウォームキャッシュを維持できるかもしれない。多様なエージェントワークロードでは、より広範なN-gramに触れ、ストレージミスが増える可能性がある。
バッチ処理は再び方程式を変える。複数のリクエストが1バッチ内で行を再利用でき、重複排除によって転送を減らせる。しかし、バッチを大きくすればKVキャッシュ要件も増え、レイテンシーが変化する可能性がある。
SSDのハードウェア仕様だけでは結果を予測できない。ランダム読み出しレイテンシー、キュー深度、ファイルシステムの挙動、ページサイズ、CPUオーバーヘッド、キャッシュポリシーがすべて寄与する。
レコメンデーションシステムは、有用な歴史的先例を提供する。そうしたシステムは長年にわたり、階層化メモリから大規模な埋め込みテーブルを提供してきた。一部のシステムでは、人気の行をDRAMにキャッシュし、ロングテールをSSDに置いている。
言語モデルのEngramトラフィックはアイデアを借りられる程度には似ているが、同一ではない。自己回帰生成には厳しい逐次レイテンシーが課される。あるトークン位置での遅延は、後続の位置を停止させる可能性がある。
AgentXはこの懸念をより明確にする。これは、短い合成プロンプト1件ではなく、長文コンテキストかつ複数ターンのエージェント型コーディングトラフィックを表している。この種のワークロードでは、大量の入力処理とレイテンシーに敏感な生成が交互に発生する。
ソフトウェアがEngramを第一級のサービングプリミティブとして扱うようになって初めて、ストレージの可能性は改善する。汎用的なメモリマップドファイルは実験には有用だが、CPU制御の経路に多くの作業を残してしまう。
将来の設計には、直接I/O、非同期キュー、行を意識したキャッシュ、予測可能なプリフェッチスケジュールが必要だ。Engramの量子化行に整合するストレージレイアウトも求められるかもしれない。
したがってNVMeは、現時点の標準ではなく機会であり続ける。DRAMはすでに、階層化がシステムを改善できることを示している。SSDにはなお、モデルのスパースなアクセスパターンを中心に設計されたサービングスタックが必要だ。
AgentXは新アーキテクチャを取り巻くソフトウェアの堀を示す
Engramはメモリ配置を変えるが、アーキテクチャを実用的なサービスへ転換できるアクセラレータを決めるのは、依然としてリリース初日のソフトウェア対応だ。
SemiAnalysisは、Nvidia H100、H200、B200、B300、GB200、GB300の各システムでDeepSeek-V4.1-Flashを評価した。また、InferenceXフレームワークを通じてAMDのMI355Xもテストした。
InferenceX measurementsは実機ハードウェアを用い、インタラクティビティに対するスループットを追跡している。AgentXは、ツール指向のセッションが繰り返される状況に似せた、長文コンテキストのコーディングワークロードを提供する。
SemiAnalysisによれば、モデル公開時点でNvidiaのvLLM経路は、テストされた6つのNvidiaプラットフォームすべてで動作した。AMDの参照コンテナイメージは、最初の23時間は公開されていなかった。
AMDの対応は後から加わったが、アナリストの測定では初期の性能差は依然として大きかった。リリースから7日後、SemiAnalysisは支出単位当たりのMI355X性能を、B200より2倍から4倍遅れていると位置付けた。
これらは、1つのベンチマーク組織によるベンダー依存の主張である。クラウドの前提、ランタイムのバージョン、量子化、トポロジー、急速なソフトウェア変更に左右される。すべてのモデルやAMDワークロードへ一般化すべきではない。
ただし、重要な制約を明らかにしている。アーキテクチャはオフロード向けに設計できるが、デプロイメントは依然としてカーネル、グラフキャプチャ、メモリアドレッシング、量子化、分散スケジューリングに依存する。
DeepSeek Engramのオフロードには、十分なPCIe帯域幅以上のものが必要だ。ランタイムはデコードグラフを壊さずに転送を重ね合わせなければならない。各プラットフォームで行を効率的に選択し、逆量子化する必要もある。
したがって新しいモデルは、ハードウェアチームが調整に数カ月をかける前に、アクセラレータエコシステムを試すことになる。メンテナーの習熟度と機能するリリースパイプラインも、性能の一部となる。
この動向は、モデルアーキテクチャによってレプリカ当たりの必要HBM容量が減ったとしても、Nvidiaのソフトウェア上の地位を強める。レプリカ当たりのGPU数を減らせば通信量は抑えられるが、残る各GPUには成熟したカーネルとランタイム統合が必要になる。
アクセラレータ需要全体への影響は単純ではない。メモリ利用の改善により、1つのモデルレプリカに必要なGPU数は減る可能性がある。一方で、サービングコストの低下により、より多くのアプリケーションが経済的に実行可能となり、需要が拡大する可能性もある。
Engramは、条件付きメモリがアクティブな計算とは別にスケールするため、より大規模なモデルを促す可能性がある。運用者は、アクセラレータの購入を減らす代わりに、節約したHBMをより多くの同時セッションに使うかもしれない。
DeepSeekはリリース資料によれば、V4.1-FlashでKVキャッシュ要件も削減している。EngramオフロードとKV圧縮は、異なる2つの方向からメモリを解放する。
この組み合わせはエージェント型推論にとって重要だ。エージェントは長い履歴、ツール出力、コード、中間計画を保持する。モデル重みがすでに収まっていても、KVキャッシュはかなりの容量を占め得る。
スパースなルックアップテーブルをDRAMへ移すサーバーは、その分多くのHBMをアクティブなセッションに割り当てられる。実際の利点は、物理モデルの小型化ではなく、より高い同時実行性として現れるかもしれない。
懐疑的な見方も必要だ。SemiAnalysisのEngram再現では、DeepSeekが元論文の学習済み研究モデル2種を公開していないため、公開されたコードと学習設定が使われた。本番環境での挙動は、制御されたスケーリング実験とは異なり得る。
SSD経路は明示的に未最適化だった。NvidiaとAMDの結果は、今後変化する初期段階のソフトウェアスタックを捉えたものだ。最も強いDRAM結果でさえ、特定のB300トポロジーとワークロードのフロンティアに依存していた。
Engramは学習が報酬を与えるものを何でも保存する。容量を増やせば、有用なエンティティやコードとともに、定型文や偶発的なパターンも保持し得る。メモリ割り当ての改善は、より良いデータ選択を保証しない。
証拠が支持する結論は、より限定的だ。条件付きメモリは低位のメモリ階層と技術的に両立可能であり、DRAMはサービング全体の性能を改善できる。しかし、単一の普遍的な構成を確立したわけではない。
DRAMとNVMeへの影響を決める3つのシグナル
次の段階は、最適化されたSSDサービング、再現可能なトポロジー上の利点、そして単一モデルのリリースを超えた幅広いランタイム対応にかかっている。
最初のシグナルは、GPU指向の直接経路を用いる最適化済みNVMe実装だ。重要な比較対象はSSDのピーク帯域幅ではない。ピン留めDRAMに対する、完全なスループットとP90インタラクティビティのフロンティアである。
GPUDirect Storageへの対応により、CPUを経由する往復処理の一部を排除できる。ネイティブな行重複排除、非同期プリフェッチ、Engram対応ストレージレイアウトにより、さらにオーバーヘッドを削減できる。
最適化された経路が、必要なホストメモリを大幅に減らしながらDRAM性能に近づくなら、NVMeの機会は信頼できるものになる。キャッシュ済みSSDが大きく遅れ続けるなら、Engramは代わりにDRAM需要を強めるだろう。
二つ目のシグナルは、小規模なレプリカ構成でもハードウェアやワークロードをまたいで同様の結果が再現されるかどうかです。SemiAnalysisによるB300でのテンソル並列化を4分割から2分割へ変更した検証は、最も重要な結果を生み出しました。
独立したテストでは、B200、H200、MI355X、そして将来のシステムを検証すべきです。コンテキスト長、バッチサイズ、同時実行レベル、キャッシュ状態を多様に含める必要があります。
改善が繰り返し確認されれば、Engramのオフロードが通信量の削減を通じてサーバーの経済性を変えることが裏付けられます。再現できなければ、この知見は初期段階の単一構成に限定されるでしょう。
三つ目のシグナルはエコシステムでの採用です。DeepSeek-V4.1-Flashは目に見える試験例を提供しますが、ハードウェア需要を変えるには、Engramのようなメモリがさらに多くのモデルファミリーやサービングエンジンへ広がる必要があります。
SemiAnalysisのレポートは、LongCatおよびQwenモデルにおける関連するN-gramメカニズムを指摘しています。研究者はCXLを通じたプール型Engram容量も提案しています。こうしたアプローチには、vLLM、SGLang、ベンダーのランタイムで安定したサポートが必要です。
広範な採用は、より多くのDRAM帯域幅、高性能なローカルNVMe、柔軟なインターコネクトを備えたバランスの取れたサーバーへの需要を強めるでしょう。採用が限定的であれば、Engramは重要なDeepSeek固有の最適化にとどまります。
開発者はパラメータの見出しではなく、デプロイ手順に注目すべきです。エンタープライズの購入担当者は、自社のコンテキスト長とレイテンシ目標での性能を求めるべきです。インフラチームは、コールド、ウォーム、混合のキャッシュ状態をそれぞれ分けて測定すべきです。
ナレッジワーカーは、その成果を間接的に体験することになります。より適切なメモリ配置は、より長いセッション、低レイテンシ、そして高性能モデルへのより広いアクセスを支えられます。こうした利点は、完全なアプリケーションがそれらを確実に活用できる場合にのみ意味を持ちます。
AIシステムを評価するチームは、ベンチマークの主張と併せて自らの証拠を保存すべきです。検索可能なエンジニアリング向けナレッジベースは、モデルカード、ランタイムのバージョン、社内テストの結果を結び付けた状態で保持できます。
DeepSeek Engramのオフロードは、HBM主導の推論の終わりではありません。これは、そもそもどのパラメータにHBMを割り当てるべきかをモデルアーキテクチャが決定できることを示す証拠です。次の問いは、最適化されたNVMeと共有メモリが、ボトルネックをソフトウェアへ移すことなくDRAMと同様の結果を再現できるかどうかです。



