DeepSeek Engram Architecture: LLMsのためのスパース性の新しい軸
- Aisha Washington

- 6月6日
- 読了時間: 9分
更新日:6月17日

大規模言語モデル(LLM)の現在の軌跡は、しばしば力任せの競争のように感じられます。レイヤーを増やし、より多くのVRAMを消費し、モデルがすべてを記憶してくれることを願うだけです。DeepSeekは、DeepSeek Engramのリリースで異なるアプローチを採用しました。Engramは、高価な重み内のすべての静的な事実をニューラルネットワークに記憶させるのではなく、「条件付きメモリ」専用のメカニズムを導入しています。
これは単なるマイナーな最適化ではありません。これは、予想されるDeepSeek-V4を含む、次世代モデルを構築する方法における根本的な変化を表しています。静的な知識をスケーラブルなO(1)ルックアップテーブルにオフロードすることで、開発者はトレーニングコストを削減し、モデルが事実データを処理する方法を改善できる可能性があります。
DeepSeek Engramが重要な理由:エンジニアの視点

生のアーキテクチャを見る前に、ユーザーエクスペリエンスと、DeepSeek Engramが対処する技術的なボトルネックを理解する必要があります。
ディープラーニングの研究者やパワーユーザーは、トランスフォーマーの非効率性について長年不満を抱いてきました。「パリ」と「フランス」の関係を、毎回計算するために高価なGPUサイクルを費やす必要があるのはなぜでしょうか?それは静的な知識です。
Engramに対するコミュニティの反応は、明確なコンセンサスを強調しています。私たちは「思考」と「知識」を分離する必要があります。
「脳 vs. 参考資料」パラダイム
初期採用者やアーキテクチャアナリスト間の議論によると、Engramはニューラルネットワークの参考資料のように機能するとのことです。コアモデル(バックボーン)は、ロジック、推論、文法を処理する脳として機能します。 DeepSeek Engramモジュールは百科事典として機能します。
モデルが一般的なパターンや静的な事実に遭遇した場合、「考える」必要はありません。単に検索するだけで十分です。このアーキテクチャの分割により、ニューラルネットワーク(MoEまたはDenseレイヤー)の重い処理は、単純な事実の繰り返しではなく、複雑な推論に集中できます。
技術的推測:融合メカニズム
論文とコードを分析している技術ユーザーは、メモリとモデル状態間の可能性のある相互作用をリバースエンジニアリングしました。融合は、新しい隠れ状態が古い状態とゲート付きメモリベクトルの組み合わせであるというロジックに従っているようです。
現在の理論は、次のような数式です。 h_new = h_old + gate (W memory_vector)
これは、モデルが学習することを示唆しています いつその内部的な推論を信頼するか、そしていつ から取得する DeepSeek Engram ルックアップテーブルから。 これは、ハードコードされたルールではなく、動的に学習された動作です。
DeepSeek Engramテクノロジーの解説
の核心では、DeepSeek EngramはN-gram埋め込みを近代化した応用です。N-gramはかつて言語モデリングの標準であり、単語のシーケンスの確率を単純に数えるものでした。DeepSeekはこの概念を復活させ、ベクトル埋め込みで近代化し、Transformerのバックボーンに直接統合しました。
O(1)ルックアップの力
ドキュメントにおける最も重要な主張は、O(1)複雑性の達成です。コンピュータサイエンスの用語では、これはデータ量が増加しても情報の取得にかかる時間が成長しないことを意味します。
ルックアップテーブルに100万件のエントリがあっても1000億件のエントリがあっても、DeepSeek Engram関連するベクトルを同じ時間で取得します。これはハッシュマッピングによって実現されます。入力シーケンスをハッシュ化することで、システムはデータセット全体をスキャンすることなく、事前に計算された埋め込みを即座に見つけます。
これはRAGですか?
混同しやすい点として、これをRetrieval Augmented Generation(RAG)と比較することが挙げられます。これらは同じものではありません。
RAG: 検索エンジンがテキストを見つけてモデルのコンテキストウィンドウに供給する外部プロセスです。これは遅く、モデルの重みとは異なります。
DeepSeek Engram: 内部のアーキテクチャコンポーネントです。ルックアップは内部でモデルのフォワードパス中に発生します。取得されたベクトルは、モデルの隠れ状態と数学的に融合されます。これは、モデル自体にネイティブな知識ルックアップのためのプリミティブです。
パフォーマンスデータ:U字型スケーリング則

DeepSeekはコードを公開しただけでなく、データを用いて理論を検証しました。パフォーマンス指標は、ニューラル計算とメモリ容量の関係を支配する「U字型スケーリング則」を明らかにしています。
スイートスポットを見つける
従来のニューラルネットワーク(Mixture of Expertsなど)のサイズと、DeepSeek Engram メモリテーブルのサイズの間には最適なバランスがあります。
メモリが多すぎる場合:ルックアップテーブルに完全に依存すると、モデルは推論および一般化する能力を失います。
計算量が多すぎる場合:ニューラルネットワークに完全に依存すると、静的なテキストを記憶するためにパラメータ空間を無駄にし、モデルの効率が悪くなります。
スイートスポットは中間点にあります。テストでは、Engram-27Bモデル(このバランスで最適化された)は、標準ベンチマークにおいて、特に知識保持、コード生成、数学的推論において、ベースラインのMixture of Experts(MoE)モデルを上回りました。これは「アイソパラメータ」制約下で達成されました。つまり、両モデルはほぼ同じリソースフットプリントを持っていましたが、Engramアーキテクチャはそれらのリソースをより良く使用しました。
ホストメモリオフロード
デプロイメントにおいて最も実用的な機能の1つは、巨大な埋め込みテーブルをホストメモリ(RAM)にオフロードする機能です。ルックアップは疎で効率的であるため、GPUはデータベース全体を保持する必要はありません。これにより、高知識モデルを実行するためのVRAM要件が劇的に低下し、「スマート」モデルのローカルデプロイメントがコンシューマーハードウェアでより現実的になります。
将来への影響:ユーザーが本当に望むもの

「DeepSeek Engram」のリリースは、AIコミュニティから多くの機能リクエストと理論的な応用を引き起こしました。以下のトレンドは、将来の開発における高価値な領域を表しています。
プラグ可能なエングラムの需要
開発者からの最も活発な要望は、バックボーンモデルを再トレーニングせずにエングラムテーブルを更新できることです。
現在、LLMが昨日リリースされた新しいコーディングライブラリを知らない場合、再トレーニングする必要があります。これには数週間かかり、膨大な計算コストがかかります。ユーザーは、DeepSeek Engramレイヤーが「プラグ可能」になる未来を思い描いています。毎週「知識パッチ」—ルックアップテーブルへの純粋な静的更新—をダウンロードするだけで、モデルに新しい事実を即座に教えることができます。これは、モデルのカットオフ日付の扱い方を根本的に変えるでしょう。
状態空間モデル(Mamba)との統合
もう一つの魅力的な方向性は、エングラムとMambaのような状態空間モデル(SSM)を組み合わせることです。高度なユーザーは、Nグラムルックアップを「状態キャッシュ」にアップグレードすることを提案しています。
単語埋め込みを取得する代わりに、システムは事前計算されたSSM状態を取得できます。これは、モデルの「セーブゲーム」ファイルのように機能します。モデルが以前に見た長いコンテキストに遭遇した場合、ルックアップテーブルから「状態」を即座にロードでき、トークンを再処理することなく、その特定のコンテキストに対して事実上無限のメモリを持つことができます。
「歴史家」エキスパート
MoEアーキテクチャ内には、専門の「Historian」エキスパートに関する提案もあります。このセットアップでは、標準のエキスパートが短期的な構文と即時的なロジックを処理し、専用の DeepSeek Engram エキスパートが長期的なセマンティックハッシュを処理します。この専門化により、ネットワークの効率がさらに向上します。
DeepSeek Engram の始め方

このアーキテクチャをテストしたいエンジニアのために、DeepSeek は GitHub リポジトリを通じて明確なエントリーポイントを提供しています。
要件
依存関係に関して、この実装は比較的軽量です。PyTorch を備えた標準の Python 環境(3.8 以降)が必要です。
codeBash
pip install torch numpy transformers sympyデモの実行
このリポジトリには、スタンドアロンのスクリプトである engram_demo_v1.py が含まれています。このスクリプトは、実際のAttentionメカニズムやMoEルーティングのようないくつかの重いコンポーネントをモックして、DeepSeek Engram のロジックを分離およびデモンストレーションすることを目的としている点に注意することが重要です。これは学習ツールであり、現時点では本番用の推論エンジンではありません。
このスクリプトを実行すると、テキストがどのようにトークン化され、ハッシュされ、メモリテーブルにマッピングされ、それらのベクトルがどのように取得されるかといったデータフローをトレースできます。
FAQ: DeepSeek Engram に関するよくある質問
DeepSeek Engramは既存のTransformerモデルと互換性がありますか?
アーキテクチャの変更が必要です。Llama 3やGPT-4にそのまま組み込むことはできません。新しいアーキテクチャの基盤コンポーネントとして機能し、おそらくDeepSeek-V4のバックボーンとなるでしょう。
これはVector Databases (Pinecone, Milvus) を置き換えるものですか?
いいえ。Vector Databasesは外部ドキュメント検索(RAG)用です。DeepSeek Engramは、内部モデルのパラメータ効率のためのものです。しかし、幻覚の発生率を低減し、基本的な事実に関する外部ベクトルストアへの重い依存を潜在的に低下させます。
これは単一のGPUで実行できますか?
はい、小規模な実装であれば可能です。重い埋め込みテーブルはシステムRAMにオフロードできるため、GPUは計算レイヤーのみを処理すればよいためです。これにより、VRAMは限られているがシステムRAMが高いコンシューマーハードウェアでの推論に非常に効率的です。
これはスパースアテンションとどう違うのですか?
スパースアテンションは、コンテキストウィンドウ(プロンプト)を参照する計算コストを削減します。DeepSeek Engramは、モデルのトレーニングデータ(長期記憶)にアクセスする計算コストを削減します。これらは異なる問題を解決します。
これを使用したフルモデルはいつ頃見られますか?
コードは現在利用可能ですが、推測によると、このアーキテクチャを大規模に利用する主要なDeepSeekモデル(おそらくV4)は2月にリリースされる可能性があります。
「より薄い」推論への移行
remioDeepSeek Engramのリリースは、LLM設計の成熟を示しています。私たちは単にモデルを大きくする段階を過ぎました。今、私たちはそれらを構造化しています。
"メモリ"と"推論"が異なる機械的プロセスであることを特定することで、DeepSeekは、必ずしも大きくはないが、能力が大幅に高密度なモデルへの扉を開きました。コミュニティの"プラグ可能な知識"に関する理論が実行可能であることが証明されれば、私たちは"静的モデル"時代の終わりと、モジュール式で更新可能なAIの始まりを見ているのかもしれません。


