DeepSeek Engram 卸载将 AI 内存扩展至 HBM 之外
DeepSeek Engram 卸载已将 189 GiB 的模型内存移出 GPU HBM;在某些测试中,DRAM 的表现甚至优于全 HBM 配置。这一结果挑战了大型模型基础设施背后的一项基本假设:最快的内存并不必然是每个参数的最佳存放位置。
SemiAnalysis 于 9 月 18 日发布了这组新实验,使用的是 DeepSeek-V4.1-Flash 及其 InferenceX 服务框架。测试将 Engram 表置于主机 DRAM,或本地 NVMe 驱动器上的内存映射文件中。DRAM 路径通过降低张量并行度改善了一种 B300 配置,而首个 SSD 实现仍然更慢、经济性也更差。
这一差异至关重要。Engram 并不会消除对 Nvidia GPU 或高带宽内存的需求。它改变的是哪些模型参数值得占用这种稀缺容量。因此,短期内的竞争并非 HBM 与 SSD 的对决,而是全 HBM 部署模式与分层系统之间的较量;后者会将不同工作负载分配给 HBM、DRAM 和存储设备。
DeepSeek Engram 卸载改变参数放置方式
核心变化在于架构:大块学习型内存可以离开 HBM,而不必让整个模型表现得像一个被卸载的神经网络。
DeepSeek 将 Engram 引入为语言模型的条件内存模块。它通过针对重复出现的多 token 模式进行学习型查找,扩展了普通 token 嵌入。这些模式可以包括名称、代码片段、样板文本以及常见的关系表达。
普通 Transformer 往往通过注意力层和前馈层重建这类局部模式。Engram 则为模型提供了一条独立的查找路径。它对 token 序列进行哈希,检索少量嵌入行,再将其与模型的隐藏状态结合。
原始的条件内存论文将这种方法描述为第二种稀疏性形式。混合专家模型,即 MoE,会针对每个 token 仅激活模型计算的一部分。Engram 则只激活更大内存表中的极小部分。
这种区别决定了硬件如何为模型提供服务。MoE 专家包含用于大量计算的权重矩阵。在存储层级之间移动它们,可能需要在恰恰最不合适的时刻进行大规模传输。
Engram 地址则不同。它们取决于 token ID 及其局部序列,而不是中间隐藏状态。运行时可以在后续模型层完成计算之前,就知道需要哪些行。
这种可预测性创造了预取窗口。服务器可以在 GPU 处理较早操作的同时,从主机内存获取相应行。如果检索在该窗口内完成,模型便可避免大部分通常与卸载相关的延迟。
DeepSeek 公开的研究将实验性 Engram 表扩展至 270 亿参数。在受控对比中,作者报告称,相较于具有等效参数量和计算量的 MoE 基线,其性能有所提升。报告的改进涵盖事实知识、推理、代码、数学和长上下文检索。
这些数据来自研究模型,而非 SemiAnalysis 测试的确切生产系统。但它们仍解释了为何 Engram 不能被视为可选元数据:它已成为训练模型推理路径的一部分。
SemiAnalysis 通过在推理期间移除 Engram,进一步印证了这一点。根据其分析,在早期论文的消融实验中,事实性基准仅保留了原始性能的 29% 至 44%,阅读理解则保留了 81% 至 93%。
这种性能损失并不能证明 Engram 胜过所有传统模型。该网络经过训练,本就依赖其内存模块;移除这一模块会造成训练与推理之间的不匹配。
但该实验确实表明,运营方无法在内存紧张时简单删除这张表。他们必须高效地提供服务、对其压缩,或将其放置在其他位置。
DeepSeek-V4.1-Flash 让这一放置问题变得具体。DeepSeek 表示,该模型拥有一个 5520 亿参数的 MoE 主干网络,输入处理期间激活 80 亿参数,输出生成期间激活 160 亿参数。Engram 则额外增加了另一大块条件内存。
V4.1-Flash 发布公告还宣称,其 KV cache 所需的 HBM 是前代的四分之一,所需 SSD 存储则是前代的八分之一。KV cache 存储来自先前 token 的可复用注意力状态。它与 Engram 相互独立,但两项功能都会重塑服务器的内存需求。
SemiAnalysis 为模型的 Engram 表使用了约 189 GiB。然而,每个已处理 token 位置在两个 Engram 层中仅请求 24 行。这相当于整个模型约 12.4 KiB,或四 GPU 配置中每块 GPU 约 3.1 KiB。
这张表规模巨大,但实际读取量极小。这种不对称性正是 DeepSeek Engram 卸载得以运作的根本原因。
DRAM 卸载对全 HBM 设计形成压力
即使 GPU 带宽仍不可或缺,Engram 也削弱了总参数量与所需 HBM 容量之间的联系。
HBM 对 AI 推理具有两项宝贵特性:它提供高带宽,并且紧邻 GPU 计算单元。这些优势使其成为频繁访问权重和不断增长的 KV cache 的天然归宿。
然而,从系统角度看,容量依然昂贵。即使工作负载并不需要完整计算能力,运营方也常常因为模型装不下而增加 GPU。额外的加速器随之带来通信成本和运维复杂度。
Engram 提供了一种将容量与计算分离的方式。服务器可以将稠密层、活跃专家和对延迟敏感的状态保留在 HBM 中,同时把稀疏内存表放在主机 DRAM 中。
SemiAnalysis 通过统一虚拟寻址,即 UVA,测试了这种安排。UVA 允许 GPU 在同一共享地址空间内寻址固定的主机内存。相同的 GPU 内核从 HBM 或 DRAM 中选择并反量化 Engram 行。
这并非普通的 CPU 管理型卸载。GPU 直接访问固定的主机内存分配。异步执行使检索能够与其他模型工作重叠。
令人意外的结果出现在 Nvidia B300 上。SemiAnalysis 报告称,将 Engram 移至 DRAM 后,其配置得以从四路张量并行切换为两路张量并行。
张量并行将模型操作拆分至多块 GPU 上。它能让大型模型得以容纳,但每一次拆分都会增加同步和通信。因此,减少拆分可以抵消较慢内存层级带来的影响。
根据测试,最终的 B300 吞吐量和交互性边界最高提升了 1.6 倍。在这套早期软件栈中,将表移回 HBM 并未带来超出运行间波动的可测量改进。
这一发现颠覆了最简单的内存层级论点。HBM 确实让单次查找更快,但这些查找只是完整服务路径的一部分。Engram 占用了原本可用于 KV cache、批处理或更小副本的容量。
DRAM 通过改变系统拓扑改善了整体系统。其收益并非来自 DRAM 在原始访问速度上击败 HBM。
这正是 GPU 系统设计面临的主要压力。运营方过去通常通过叠加检查点大小、运行时状态和安全余量来评估模型是否装得下。Engram 要求他们按访问模式对内存进行分类。
高频、稠密且带宽密集的权重依然适合 HBM。当计算能够隐藏传输时,可预测的稀疏行可以容忍 DRAM。长尾行最终或许可以放在 NVMe 上,前提是缓存和软件开销仍受控制。
这一变化也会影响内存供应商。Engram 并未终结 HBM 需求。相反,SemiAnalysis 实验表明,对于某些推理配置,带宽可能比最大 HBM 容量更重要。
与此同时,服务器 DRAM 成为模型服务性能边界的一部分。容量规划必须考虑固定内存分配、内存通道、PCIe 行为以及副本之间的资源争用。
NVMe 也获得了除存储检查点和 KV cache 之外的潜在角色。如果模型参数开始从本地存储中被主动服务,其可寻址市场将扩大。然而,这一机会取决于软件能否让存储读取在经济上具备价值。
眼下的赢家未必是出售最大内存池的供应商,而是能够在不让昂贵加速器停滞的前提下协调多个层级的系统。
对于 AI 基础设施采购方而言,总模型大小将成为较弱的采购信号。活跃参数、每 token 检索的字节数、预取距离和副本拓扑能提供更有用的指引。
一个 7480 亿参数系统可能会提出与同等规模稠密模型截然不同的硬件要求。DeepSeek-V4.1-Flash 将稀疏主干、条件内存和缩减的 KV cache 结合在一起。每个部分都会给不同资源带来压力。
这种复杂性也令比较更加困难。仅衡量每秒 token 数的基准测试,可能掩盖不同并发级别下的单独延迟。当某个配置仅为内存容量而增加 GPU 时,成本结果也可能发生变化。
最有价值的比较方式,是将吞吐量与用户可感知的交互性对应起来。随后再考察每台完整服务器产出了多少有效工作,而不是某个孤立内核运行得有多快。
为什么 Engram 能在 GPU 内存之外运行
确定性寻址让运行时有时间获取内存,而稀疏访问使每次传输足够小,从而能够与计算重叠。
Engram 从 N-gram 开始,即相邻 token 组成的短序列。该架构压缩分词器词表,通过多个头对局部序列进行哈希,并将这些哈希映射到学习型行。
词表压缩很重要,因为分词器常会为视觉上相似的文本分配不同 ID。大小写、空格和 Unicode 形式都可能使重复模式碎片化。论文报告称,对于一个包含 128,000 个 token 的词表,有效词表缩减了 23%。
检索到的嵌入不会原样进入模型。上下文感知门控会控制每次查找对当前隐藏状态的影响程度。轻量卷积会先加入邻近上下文,再让内存贡献进入后续层。
这一设计同时解释了 Engram 的价值和局限性。该表存储可复用的统计模式,但模型仍会决定使用多少。它并非包含清晰事实记录的传统数据库。
SemiAnalysis 扫描了 DeepSeek-V4.1-Flash 中高门控值的模式。它发现了名称、代码片段、关系措辞、许可证、书目片段和网页样板文本。其中一个不同寻常的例子提及了 Ace Attorney 游戏系列。
这些结果表明,该表优化的是下一个 token 的预测,而不是人类对有价值知识的判断。如果重复格式能够提供预测捷径,它就可能变得有用。
这一发现使缓存策略更加复杂。强门控并不一定意味着某一行会被频繁访问。一行数据在被检索时可能价值很高,但在生产流量中很少出现。
运行时也无法在看到门控值后避开每一次低价值查找。计算门控需要相应的键,而这已经触发了检索。要跳过这次读取,就需要一个在内存访问之前运行的独立预测器。
访问频率仍应遵循长尾分布。常见词、编程模式和常规语法出现频率应高于罕见实体。这使多级缓存成为合理选择。
高频请求的行可保留在 HBM 中。更大的工作集可留在主机 DRAM 中。罕见行可存放在 NVMe 上,并随着流量证明其价值而进入更快的层级。
这项 CXL 内存研究 将同一思路扩展到单台服务器直连 DRAM 之外。其作者提出通过 Compute Express Link 汇聚 Engram 内存,该技术支持对共享内存设备进行细粒度访问。
该提案仍处于研究阶段,并不能证明其具备生产环境的经济性。CXL 也会带来自身的延迟、拓扑和软件考量。不过,它说明了条件记忆如何改变系统边界。
运营方可将查找池与 GPU 计算资源分开扩展。多个加速器可以共享容量,而无需在每个 GPU 副本中复制整张表。
预取是这些设计的核心机制。如果需要隐藏存储延迟,Engram 层就不能任意前置。更多前序计算会为检索创造更长的窗口。
模型质量可能会将设计推向相反方向。较早介入记忆可帮助网络避免在最初几层重建常见的局部模式。将 Engram 放置得过晚,可能会削弱这一优势。
这构成了真正的协同设计问题。模型研究人员选择插入层、表维度、哈希行为和门控机制。运行时工程师则围绕这些选择设计预取队列、缓存、内核和传输路径。
硬件团队随后决定每一层应提供多少带宽和容量。这些决策没有一项能够独立优化。
DeepSeek 的论文报告称,分配给 MoE 计算的参数与分配给 Engram 记忆的参数之间呈 U 型关系。记忆太少,会让神经网络主干仍需处理重复模式;记忆太多,则会减少可用于其他任务的计算资源。
这一结果表明,不能将 Engram 视作无限且廉价的容量。更多表行或许可以改善验证损失,但前提是系统保持平衡。训练数据质量同样决定了这些行能学到什么。
更广泛的架构含义很重要。扩展不再意味着将每一个新增参数都放在 GPU 算术单元旁边。模型可以通过可预测的稀疏检索增加容量,同时将昂贵带宽留给动态计算。
SSD 卸载尚不是廉价答案
首个 NVMe 实验节省了预留的 DRAM 容量,但未经优化的数据路径在速度和效率上均不及固定页 DRAM。
SemiAnalysis 用本地 SSD 上的内存映射文件替换了 189 GiB 的 Engram 分配。内存映射文件可让操作系统通过虚拟内存页暴露存储内容。最近访问的页面可以留在文件系统缓存中。
这种方式提供了运营灵活性。当其他应用需要内存时,操作系统可回收缓存页面。运营方无需将完整 Engram 表永久固定在 DRAM 中。
不过,温热的页面缓存并不会让 SSD 路径等同于原生 DRAM 卸载。该原型仍需将行标识符传至 CPU、去重、把行汇集到固定页缓冲区,再复制回来。
随后,它在 GPU 上对选定行进行反量化。这些步骤运行在 GPU 执行段之间,而非通过用于固定页主机内存的直接 UVA 内核。
每一步都会增加协调成本。CPU 调度、标识符传输、行汇集、缓冲区管理和 GPU 复制的成本,可能高于实际存储读取。因而,即使没有请求到达 NAND 闪存,缓存文件也可能落后于固定页 DRAM。
B200 的结果暴露了这一差距。在每位用户接近每秒 125 个 token 时,DRAM 配置每单位支出可生成 1.21 亿个 token。SSD 路径则为 5200 万个。
因此,在该测量比较中,DRAM 交付的 token 数约为 2.3 倍。它在观测到的 SSD 配置中也主导了 P90 交互性,该指标衡量尾部较慢请求的体验。
研究人员无法为测试启用 GPUDirect Storage,即 GDS。GDS 可以减少 CPU 参与,将数据在 NVMe 和 GPU 内存之间传输。它的缺失限制了该实验对优化存储路径的说明能力。
这一结果不应被表述为 NVMe 无法服务于 Engram 的证据。它表明,廉价存储介质并不会自动带来廉价推理。
四块 B200 GPU 仍留在服务器中,CPU、网络、电源和大部分配套基础设施也是如此。以 SSD 替代 DRAM 只减少了一项容量需求,却没有削减配置中昂贵的部分。
要实现经济收益,还需要第二重效果。SSD 卸载必须能够支持更便宜的服务器、容纳更多高生产力副本、支持更大模型,或释放 DRAM 供其他高价值工作负载使用。
该原型在其测量设置中没有实现上述任何结果。其文件系统缓存也可能占用原本希望通过文件后备节省的大量 DRAM。
工作负载局部性带来了另一项不确定性。具有重复提示的稳定服务或许能维持有效的温热缓存。多样化的智能体工作负载可能触及更广泛的 N-gram 范围,并产生更多存储未命中。
批处理会再次改变方程。多个请求可以在一个批次内复用行,而去重可减少传输。不过,更大的批次也会增加 KV 缓存需求,并可能改变延迟表现。
仅凭 SSD 硬件规格无法预测结果。随机读取延迟、队列深度、文件系统行为、页面大小、CPU 开销和缓存策略都会产生影响。
推荐系统提供了一个有用的历史先例。多年来,它们一直通过分层内存服务大型嵌入表。一些系统会将热门行缓存在 DRAM 中,同时将长尾数据放置在 SSD 上。
语言模型的 Engram 流量与之足够相似,可以借鉴相关思路,但并不完全相同。自回归生成具有严格的顺序延迟要求。在某个 token 位置出现延迟,可能会阻塞后续位置。
AgentX 让这一顾虑更为明显。它代表长上下文、多轮智能体编程流量,而非单个短合成提示。这类工作负载在大量输入处理和对延迟敏感的生成之间交替进行。
只有当软件将 Engram 视为一等服务原语时,存储方案才会改善。通用内存映射文件适合实验,但它在由 CPU 控制的路径中留下了过多工作。
未来设计需要直接 I/O、异步队列、行感知缓存和可预测的预取调度。它们还可能需要与 Engram 量化行对齐的存储布局。
因此,NVMe 仍是一项机会,而非当前默认方案。DRAM 已证明分层能够改善系统。SSD 仍需要围绕模型稀疏访问模式设计的服务栈。
AgentX 展示了新架构周围的软件护城河
Engram 改变了内存放置方式,但发布首日的软件支持仍决定哪种加速器能够将该架构转化为可用服务。
SemiAnalysis 在 Nvidia H100、H200、B200、B300、GB200 和 GB300 系统上评估了 DeepSeek-V4.1-Flash。它还通过 InferenceX 框架测试了 AMD 的 MI355X。
这些 InferenceX 测量 使用真实硬件,并根据交互性追踪吞吐量。AgentX 提供了一种长上下文编程工作负载,旨在模拟重复的工具导向会话。
据 SemiAnalysis 称,在模型发布时,Nvidia 的 vLLM 路径可在全部六个受测 Nvidia 平台上运行。AMD 的参考容器镜像在最初 23 小时内尚未公开提供。
AMD 支持后来上线,但分析师测量中的早期性能差距仍然显著。在发布七天后,SemiAnalysis 将 MI355X 的单位支出性能评估为落后 B200 两到四倍。
这些是来自一家基准测试机构、对供应商敏感的主张。它们取决于云端假设、运行时版本、量化、拓扑以及快速变化的软件。它们不应被泛化至每个模型或 AMD 工作负载。
但它们揭示了一个重要约束。架构可以为卸载而设计,但部署仍取决于内核、图捕获、内存寻址、量化和分布式调度。
DeepSeek Engram 卸载需要的不只是足够的 PCIe 带宽。运行时必须在不破坏解码图的前提下重叠传输。它还必须在每个平台上高效地选择和反量化行。
因此,新模型会在硬件团队尚未有数月时间进行调优前,就检验加速器生态系统。维护者的熟悉程度和可用的发布流水线也成为性能的一部分。
即便模型架构降低了每个副本所需的 HBM 容量,这一动态仍强化了 Nvidia 的软件地位。每个副本所需 GPU 更少可以降低通信成本,但每块剩余 GPU 都需要成熟的内核和运行时集成。
对加速器总需求的影响并不直接。更好的内存利用可减少一个模型副本所需的 GPU 数量。更低的服务成本也可能通过使更多应用在经济上可行而扩大需求。
由于条件记忆可与活跃计算分开扩展,Engram 可能会鼓励更大模型。运营方或许会将节省下来的 HBM 用于更多并发会话,而不是购买更少的加速器。
据其发布材料,DeepSeek 还降低了 V4.1-Flash 的 KV 缓存需求。Engram 卸载与 KV 压缩共同从两个不同方向释放内存。
这一组合对智能体推理至关重要。智能体携带长历史、工具输出、代码和中间计划。即使模型权重已能容纳,其 KV 缓存仍可能占据大量容量。
将稀疏查找表移至 DRAM 的服务器,可以把更多 HBM 分配给这些活跃会话。实际收益可能体现为更高并发,而非更小的物理模型。
怀疑态度仍是必要的。由于 DeepSeek 未发布原论文中的两个训练完成的研究模型,SemiAnalysis 的 Engram 复现采用了已发布的代码和训练设置。生产环境表现可能与受控扩展实验不同。
SSD 路径被明确标注为未经优化。Nvidia 和 AMD 的结果捕捉的是会持续变化的早期软件栈。即使最强的 DRAM 结果,也依赖于特定的 B300 拓扑和工作负载边界。
Engram 也会存储训练所奖励的一切。更多容量可以在保存有用实体或代码的同时,也保留样板内容和偶发模式。更好的内存分配并不保证更好的数据选择。
证据支持一个更狭义的结论:条件记忆在技术上可兼容较低内存层级,而 DRAM 可提升完整服务性能。但它尚未确立一种通用配置。
三个信号将决定 DRAM 和 NVMe 的影响
下一阶段取决于优化的 SSD 服务、可重复的拓扑收益,以及超越单次模型发布的广泛运行时支持。
第一个信号是采用直接面向 GPU 路径的优化 NVMe 实现。重要的比较并非 SSD 峰值带宽,而是相对于固定页 DRAM 的完整吞吐量和 P90 交互性边界。
对 GPUDirect Storage 的支持将消除部分 CPU 往返。原生行去重、异步预取和 Engram 感知的存储布局则可进一步减少开销。
如果优化路径在显著降低所需主机内存的同时接近 DRAM 性能,NVMe 的机会就会变得可信。若缓存 SSD 仍远远落后,Engram 反而会强化 DRAM 需求。
第二个信号是:较小的副本拓扑是否能在不同硬件与工作负载中重复取得效果。SemiAnalysis 将 B300 的张量并行从四路改为两路,得出了最具影响力的结果。
独立测试应覆盖 B200、H200、MI355X 及未来系统,并纳入不同的上下文长度、批次大小、并发水平和缓存状态。
若增益能够重复出现,将证明 Engram 卸载通过减少通信改变了服务器的经济性。若无法复现,则意味着该发现可能仅适用于一种早期配置。
第三个信号是生态系统采用情况。DeepSeek-V4.1-Flash 提供了一个显著的测试案例,但类似 Engram 的内存机制必须扩展至更多模型家族和推理服务引擎,才能重塑硬件需求。
SemiAnalysis 报告指出,LongCat 和 Qwen 模型中存在相关的 N-gram 机制。研究人员还提出可通过 CXL 汇集 Engram 容量。这些方法需要在 vLLM、SGLang 和厂商运行时中获得稳定支持。
广泛采用将强化对均衡型服务器的需求:它们需要更高的 DRAM 带宽、可靠的本地 NVMe 以及灵活的互连能力。若采用范围有限,Engram 仍将是一项重要但面向 DeepSeek 的专用优化。
开发者应关注部署方案,而非参数规模的宣传口径。企业采购方应要求在其自身的上下文长度和延迟目标下进行性能测试。基础设施团队则应分别衡量冷缓存、热缓存和混合缓存状态。
知识工作者将间接受到这一结果的影响。更合理的内存放置可支持更长的会话、更低的延迟,以及更广泛地使用高能力模型。但这些优势只有在完整应用能够可靠利用时才真正有意义。
评估 AI 系统的团队应将自身证据与基准测试结论一并保留。一个可搜索的工程知识库可以将模型卡、运行时版本和内部测试结果关联起来。
DeepSeek Engram 卸载并不意味着由 HBM 主导的推理时代已经结束。它证明模型架构本身能够决定哪些参数首先值得放入 HBM。下一个问题是:经过优化的 NVMe 和共享内存,能否在不把瓶颈转移至软件的前提下,复制 DRAM 的效果。



