top of page

DeepSeek Engram 架构:LLMs 稀疏性的新轴

已更新:6月17日

DeepSeek Engram Architecture: A New Axis of Sparsity for LLMs

大语言模型 (LLMs) 目前的发展轨迹往往给人一种暴力美学竞赛的感觉:增加更多层,消耗更多 VRAM,并寄希望于模型能记住一切。DeepSeek 在发布 DeepSeek Engram 时采取了不同的方法。Engram 并没有强迫神经网络在其昂贵的权重中记住每一个静态事实,而是引入了一种专门的“条件记忆 (Conditional Memory)”机制。

这不仅仅是一个微小的优化。它代表了我们构建下一代模型(包括备受期待的 DeepSeek-V4)方式的根本性转变。通过将静态知识卸载到可扩展的 O(1) 查找表中,开发者可以潜在地降低训练成本,同时改进模型处理事实数据的方式。

为什么 DeepSeek Engram 至关重要:工程师的视角

Why DeepSeek Engram Matters: The Engineer’s Perspective

在研究原始架构之前,我们需要了解 DeepSeek Engram 所解决的用户体验和技术瓶颈。

深度学习研究人员和高级用户长期以来一直抱怨 Transformer 的效率低下。为什么模型每次都要花费昂贵的 GPU 周期来计算“巴黎”和“法国”之间的关系?那是静态知识。

社区对 Engram 的反应凸显了一个明确的共识:我们需要将“思考”与“知识”分开。

“大脑 vs. 参考书”范式

早期采用者和架构分析师的讨论表明,Engram 的功能类似于神经网络的参考书。核心模型(Backbone)充当大脑,处理逻辑、推理和语法。DeepSeek Engram模块充当百科全书。

当模型遇到常见模式或静态事实时,它不应该需要去“思考”。它只需要查阅即可。这种架构分离使得神经网络(MoE 或 Dense 层)的繁重工作能够专注于复杂的推理,而不是简单的事实复述。

技术推测:融合机制

分析论文和代码的技术用户已经逆向工程了内存与模型状态之间可能的交互方式。这种融合似乎遵循一种逻辑,即新的隐藏状态是旧状态与门控内存向量的结合。

流行的理论是一个类似于以下公式:h_new = h_old + gate (W memory_vector)

这意味着模型学会了何时信任其内部推理,以及何时DeepSeek Engram查找表中提取信息。这是一种动态的学习行为,而非硬编码的规则。

解析 DeepSeek Engram 技术

其核心在于,DeepSeek Engram是 N-gram 嵌入的现代化应用。N-grams 在多年前曾是语言建模的标准,仅通过计算词序的概率来工作。DeepSeek 复兴了这一概念,利用向量嵌入(vector embeddings)对其进行了现代化改造,并将其直接集成到 Transformer 骨干网络中。

O(1) 查询的力量

文档中最显著的断言是实现了 O(1) 复杂度 在计算机科学术语中,这意味着检索信息所需的时间不会随着数据量的增加而增长。

无论你的查询表有 100 万条目还是 1000 亿条目,DeepSeek Engram 在相同的时间内检索到相关的向量。这是通过哈希映射实现的。通过对输入序列进行哈希处理,系统可以立即定位预先计算好的 embedding,而无需扫描整个数据集。

这仅仅是 RAG 吗?

一个常见的困惑是将此与检索增强生成 (RAG) 进行比较。它们并不相同。

  • RAG: 一个外部过程,由搜索引擎查找文本并将其输入到模型的上下文窗口中。它速度较慢,且与模型权重是分离的。

  • DeepSeek Engram: 一个内部架构组件。查找过程发生在模型的前向传播内部。检索到的向量在数学上与模型的隐藏状态融合。它是模型原生的一种知识查找原语。

性能数据:U 型缩放定律

Performance Data: The U-Shaped Scaling Law

DeepSeek 不仅仅发布了代码;他们还用数据验证了理论。性能指标揭示了一个支配神经计算与内存容量之间关系的“U型缩放定律 (U-shaped Scaling Law)”。

寻找平衡点

在传统神经网络(如 Mixture of Experts)的大小与 DeepSeek Engram 内存表的大小之间存在一个最佳平衡。

  • 内存过多: 如果完全依赖查找表,模型会失去推理和泛化的能力。

  • 计算过多: 如果完全依赖神经网络,你会浪费参数空间去记忆静态文本,导致模型效率低下。

平衡点位于中间。在测试中,一个 Engram-27B 模型(通过这种平衡进行了优化)在标准基准测试中优于基准 Mixture of Experts (MoE) 模型,特别是在知识保留、代码生成和数学推理方面。这是在“等参数 (iso-parameter)”限制下实现的,这意味着两个模型的资源占用大致相同,但 Engram 架构更好地利用了这些资源。

主机内存卸载

对于部署来说,最实用的功能之一是能够将庞大的嵌入表卸载到主机内存 (RAM)。由于查找过程是稀疏且高效的,GPU 不需要持有整个数据库。这极大地降低了运行高知识模型所需的 VRAM,使得在消费级硬件上本地部署“智能”模型变得更加可行。

未来影响:用户真正想要什么

Future Implications: What Users Actually Want

随着 DeepSeek Engram 的发布,AI 社区涌现出了一波功能需求和理论应用。以下趋势代表了未来发展的高价值领域。

对可插拔 Engram 的需求

开发者们最强烈的诉求是能够在不重新训练主干模型的情况下更新 Engram 表。

目前,如果一个 LLM 不了解昨天发布的新代码库,你必须对其进行重新训练。这需要数周时间并消耗大量的计算资源。用户们设想了一个未来,即 DeepSeek Engram 层是“可插拔的”。你可以下载每周一次的“知识补丁”——一种对查找表的纯静态更新——从而立即教会模型新的事实。这将彻底改变我们处理模型知识截止日期的方式。

与状态空间模型 (Mamba) 的集成

另一个引人注目的方向是将 Engram 与 Mamba 等状态空间模型 (SSMs) 相结合。高级用户建议将 N-gram 查找升级为“状态缓存 (State Cache)”。

系统不再仅仅检索词嵌入,而是可以检索预先计算好的 SSM 状态。这就像是模型的“游戏存档”文件。如果模型遇到以前见过的长上下文,它可以立即从查找表中加载“状态”,从而在不重新处理 Token 的情况下,有效地为该特定上下文提供无限记忆。

“历史学家”专家

在 MoE 架构中,还有一个关于专门的“历史学家 (Historian)”专家的提案。在这种设置下,标准专家将处理短期语法和即时逻辑,而专门的 DeepSeek Engram 专家将处理长期语义哈希。这种专业化分工将进一步提升网络的效率。

DeepSeek Engram 入门指南

Getting Started with DeepSeek Engram

对于想要测试该架构的工程师,DeepSeek 在其 GitHub 仓库中提供了一个清晰的入口。

环境要求

该实现在依赖项方面相对轻量。您需要一个带有 PyTorch 的标准 Python 环境 (3.8+)。

codeBash

pip install torch numpy transformers sympy

运行演示

该仓库包含一个独立脚本 `engram_demo_v1.py`。需要特别注意的是,该脚本模拟了几个重型组件(如实际的 Attention 机制和 MoE 路由),以便隔离并演示 DeepSeek Engram 逻辑。它是一个学习工具,目前还不是生产级推理引擎。

运行此脚本可以让你追踪数据流:文本如何被 token 化、哈希处理、映射到内存表,以及这些向量是如何被检索的。

FAQ:关于 DeepSeek Engram 的常见问题

DeepSeek Engram 是否兼容现有的 Transformer 模型?

它需要架构层面的改动。你不能简单地将其直接应用到 Llama 3 或 GPT-4 中。它是新架构的基础组件,很可能作为 DeepSeek-V4 的骨干网络。

这是否会取代向量数据库(如 Pinecone, Milvus)?

不会。向量数据库用于外部文档检索(RAG)。DeepSeek Engram 是为了提高内部模型参数效率。然而,它降低了幻觉率,从而可能减少对外部向量数据库获取基础事实的过度依赖。

我可以在单张 GPU 上运行它吗?

可以,对于较小规模的实现。由于庞大的 embedding 表可以卸载到系统内存(RAM)中,GPU 只需要处理计算层。这使得它在具有高系统内存但显存(VRAM)有限的消费级硬件上进行推理时非常高效。

这与稀疏注意力(sparse attention)有什么不同?

稀疏注意力降低了查看上下文窗口(提示词)的计算成本。DeepSeek Engram 降低了访问模型训练数据(其长期记忆)的计算成本。它们解决的是不同的问题。

我们什么时候能看到使用该技术的完整模型?

虽然代码现在已经可用,但推测指向 2 月份发布的一个大型 DeepSeek 模型(可能是 V4),该模型将大规模利用这种架构。

向“更轻量”推理的转变


DeepSeek Engram的发布标志着 LLM 设计趋于成熟。我们正在告别单纯追求模型规模的阶段,转而进入结构化设计的时代。

通过识别出“记忆”与“推理”是截然不同的机械过程,DeepSeek 为那些不一定更大、但能力密度显著提升的模型开启了大门。如果社区关于“可插拔知识”的理论被证明可行,我们可能正在见证“静态模型”时代的终结,以及模块化、可更新 AI 时代的开启。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page