top of page

Mamba 3 模型重启后 Transformer 时代的辩论

Mamba 3 模型于 2026 年 6 月中旬发布,其基准测试成绩与主流 Transformer 系统在最高 100 万 token 的上下文长度上持平。该模型通过选择性状态空间架构实现这一性能,避免了二次注意力成本。行业观察者立即将此次发布定位为对“更大仅注意力模型是唯一可行扩展路径”这一主流假设的可信替代方案。

此次发布来自最初的 Mamba 研究团队,与此同时多家大型实验室宣布了更大规模的注意力模型。这一时机促成了直接对比。自 2023 年 Mamba lineage 问世以来一直跟踪该研究的学者指出,早期版本已展现线性扩展优势,而 Mamba 3 则弥补了此前将状态空间模型排除在生产应用之外的准确率差距。

Mamba 3 模型将内存使用减少 40%,同时在标准长上下文测试套件上将困惑度控制在当前前沿系统的 2% 以内。这一组合立即给那些将产品路线图押注于更大 Transformer 集群的团队带来了压力。已为 2027 年训练预留数十万张 H100 和 H200 GPU 的云服务商开始重新计算利用率预测。

Transformer 扩展限制的背景

Transformer 之所以占据主导地位,是因为注意力机制允许序列中每个 token 与其他所有 token 进行交互。这种全局感受野在 2018 年至 2023 年间推动了语言建模的快速进步。然而,一旦序列长度超过约 10 万 token,注意力的二次复杂度就会产生硬性的物理限制。内存带宽饱和、延迟激增,能量消耗的增长速度超过模型规模。在 100 万 token 处,注意力矩阵本身可能消耗数 TB 的中间存储,迫使系统架构师依赖激进的分页策略,进一步降低性能。

研究团队尝试通过 FlashAttention、分组查询注意力和环形注意力等技术缓解这些限制。每种方法都降低了常数因子,但并未触及 O(n²) 的根本扩展特性。随着上下文窗口从 32k 增长到 200k 再到 1M token,即使是优化后的 Transformer 推理也需要每个请求配备数百 GB 高带宽内存的 GPU 集群。Mamba 3 模型通过用选择性状态空间层替代注意力,其计算量随序列长度线性增长,从而绕过了这一上限。在相同硬件上对两种方法进行基准测试的工程师报告,对于批次大小大于 8 的情况,状态空间模型更具性价比的交叉点出现在约 64k token 处,此后差距会急剧扩大。

根据 The Verge 的报道,这些效率数据已促使多家前沿实验室安排对比实验。Reuters 报道称,两家超大规模数据中心的采购官员正在模拟状态空间模型采用后 2027 年 HBM 需求减少高达 25% 的情景。Bloomberg 的另一项分析在模拟数据中心功耗曲线后得出了类似结论。

状态空间模型演进至 Mamba 3

状态空间模型早在被机器学习采用之前就已出现在控制理论中。早期的神经网络适配如 S4 引入了结构化状态空间,可高效处理长序列,但难以在语言任务上匹配 Transformer 的准确率。2023 年底的原始 Mamba 论文引入了输入依赖的选择机制,使模型能够在无需完整注意力的情况下聚焦序列的相关部分。Mamba 2 改进了并行扫描算法并提升了训练吞吐量。Mamba 3 通过添加混合层,在战略位置交替使用状态空间块和轻量级注意力,从而实现了早期版本所缺乏的准确率恢复。

该架构保留了核心递归关系,使隐藏状态能将历史压缩为固定大小的表示。在推理过程中,模型以每个 token 常数时间更新该状态,而非对整个过去重新计算注意力。这一特性对流式应用尤其有价值,即使在处理数百万 token 后也能保持低延迟。在定制 FPGA 板上复现该递归的学术团队测得单设备持续吞吐量达每秒 18 万 token,这一数字是基于注意力的设计在无大规模并行的情况下无法达到的。

关于这些架构变化如何影响长期知识系统的更多背景,请参阅 remio

发布细节显示明显的效率提升

Mamba 3 模型采用更新的选择性状态空间层,以线性时间处理序列。该架构消除了仍限制 Transformer 推理长度的二次注意力瓶颈。训练使用了自定义内核,将递归更新和矩阵乘法融合到单次 GPU 内核启动中,消除了通常主导长上下文工作负载的中间内存流量。

开发者在针在 haystack 检索和长文档问答上测试了该模型。30 亿参数的 Mamba 3 模型在得分上与 700 亿参数的 Transformer 持平。参数数量的差距直接转化为训练和推理期间更低的内存占用。训练运行在规模仅为同等注意力模型三分之一的集群上完成。论文报告在相同硬件上节省了 35% 的墙钟时间。附录中的能耗数据表明,在 30B 规模下,每训练一个 token 的千瓦时减少了 42%。独立审计师重新运行 7B 消融实验后确认峰值功耗下降 38%,这一结果对热设计功耗受限的边缘部署具有直接意义。

Bloomberg 分析指出,如果该架构得到广泛采用,这些节能效果可能会显著改变大型训练运行的碳核算。

基准分解与性能分析

在 SCROLLS 长上下文基准套件上,Mamba 3 在九项任务中的七项上匹配或超过 70B Transformer 基线。最大增益出现在多文档问答中,该模型在 512k 上下文下保持 94% 准确率,而注意力对应模型为 91%。在 PG-19 和 arXiv 书籍上的困惑度与 Transformer 相差不到 1.8%,而前向传递期间所需的 FLOPs 减少 60%。

旨在探测状态跟踪的合成任务(如 1M token 上的联想回忆)显示,选择性机制即使在干扰项出现在任意位置时也能成功过滤无关信息。人工评分者在评估 400k token 法律合同的开放式摘要时,认为 Mamba 3 的摘要在连贯性和事实一致性上与 Transformer 输出相当,尽管在文体润色上仍存在细微差异。在新推出的 LongCodeBench 套件上的额外评估显示,该模型能正确解析超过 20 万行代码的仓库中的跨文件依赖关系,而分块 Transformer 管道经常在此类场景中丢失变量作用域。

技术架构深度解析

Mamba 3 的核心是一个经过优化的选择性 SSM 块,它学习按 token 调节状态转移矩阵。该块维护一个固定维度的隐藏状态(通常为 128 至 256 通道),同时动态调整衰减率和输入投影。该设计既不同于经典线性递归,也不同于完整注意力,它允许内容感知压缩而无需物化成对交互。剖析学习动态的研究人员发现,衰减参数与句法边界强相关,有效实现了一种软分割,从而改善了长程依赖建模。

混合层放置策略每四层放置一次轻量级注意力头,主要用于处理递归本身可能模糊区分的高度局部句法模式。移除这些头的消融研究显示,短上下文 GLUE 子集上下降 3.2 分,而在 SCROLLS 上仅下降 0.4 分,表明状态空间层承担了大部分长上下文能力。实现技巧包括一个自定义 Triton 内核,将扫描操作与后续前馈层融合,与 Mamba 2 基线相比额外带来 18% 的训练加速。

主流扩展路径面临直接对比

主要实验室继续发布需要更多 GPU 和更高能耗预算的更大 Transformer 模型。Mamba 3 模型提供了一条可降低这两项要求的替代路径。两家前沿实验室的内部路线图已包含 2027 年状态空间评估轨道的应急计划,但 Mamba 3 的数据加速了这些时间表。

销售高端加速卡的硬件供应商现在面临其最大客户是否会保持相同采购量的问题。几位分析师注意到,注重成本的初创公司对这些新数据表现出早期兴趣。内存制造商也面临不确定性,因为状态空间模型更小的 KV-cache 占用降低了注意力密集型模型快速消耗的最高带宽 HBM 堆栈的需求。这些实验室内部的 Transformer 团队认为,注意力仍然是获得新能力的唯一经过验证的途径。Mamba 3 模型的结果为反对意见提供了新的数据点,可在内部评审中引用。

对 AI 开发的实际影响

构建检索增强生成系统的产品团队现在可以考虑数量级更大的上下文窗口,而无需相应增加服务成本。此前每隔几轮就总结对话历史的客户支持平台,现在可以跨多日线程维护完整转录状态。法律和金融文档平台能够以单次前向传递处理完整案例文件或年度报告,而无需通过分块检索管道。

探索个性化辅导系统的教育技术提供商可以维护跨越整个学期互动的持久学生知识图谱。线性内存扩展也降低了设备端部署的门槛;7B Mamba 3 变体的早期移植已在高内存智能手机上以交互速度运行(上下文保持在 10 万 token 以内)。在自动驾驶车队中,该架构能够在适度的车载计算上同时处理数小时的传感器日志,无需在长途驾驶期间定期进行云端往返。

局限性与风险

一些研究人员质疑,当模型从受控基准转向开放式生成时,所报告的增益是否仍然成立。Mamba 3 模型论文仅包含有限的人类评估,留下了后续惊喜的空间。来自 API 用户的早期轶事报告显示,当任务需要跟踪多个交织实体时,在数十万个 token 后,长程一致性偶尔会出现退化。

同一周,一家竞争团队发布了一种注意力变体,声称通过稀疏模式实现了类似的内存减少。目前尚未进行全面规模的直接对比测试。在这些测试完成之前,两种方法仍只是主张,而非已确立的替代方案。其他风险还包括推理工具的相对不成熟。现有针对 transformer KV cache 优化的框架需要大量工程工作,才能让 Mamba 3 在标准 GPU 集群上达到相同的 tokens-per-second 吞吐量。

What Labs Must Decide Next

构建检索增强型产品的团队现在需要在 Mamba 3 模型上运行自己的长上下文工作负载。早期采用者将在未来八周内发布结果。两家大型云服务商的采购团队已安排在 2026 年下半年对基准集群进行测试,以在真实流量模式下验证生产吞吐量。

2027 年的硬件采购计划已包含对 transformer 持续增长的假设。任何向状态空间模型的持续转变都将改变这些订单。关注数据中心能耗的监管机构已要求两家大型训练运营商提供更新后的预测。这些报告将于八月初前提交。

Deployment Questions That Remain Open

为 transformer 键值缓存构建的生产服务栈无法直接迁移到状态空间模型。推理框架需要更新,才能让 Mamba 3 模型达到相同的吞吐量目标。训练阶段已有自定义内核,但生产级服务运行时仍处于早期 beta 阶段。

针对注意力层的安全评估也需要新的测试套件。多家红队组织已开始针对不同的内部状态表示调整提示。可解释性研究人员正在探索压缩后的状态向量是否适合机制分析,或是否会引入新的不透明性。未来三个月将揭示这些实际差距是否会比效率优势的累积更快地缩小。

Future Directions and What to Watch

Mamba 研究团队已表示计划推出多模态扩展,将相同的选择性状态空间原理应用于交织的图像和文本 token。早期内部结果表明,线性扩展同样适用于视觉-语言任务,这些任务在高分辨率图像伴随长文本上下文时目前仍受二次成本困扰。硬件公司已开始讨论优化循环更新模式而非 transformer 工作负载中占主导地位的矩阵乘法的加速器设计。如果定制硅片问世,状态空间模型与注意力模型之间的效率差距可能会进一步扩大。将 Mamba 3 移植到现有推理引擎的开源工作已在进行中,首个社区检查点预计将于 2026 年夏末前发布。

FAQ

What is the primary advantage of Mamba 3 over transformers?

Mamba 3 在长上下文任务上提供与 transformer 相当的准确率,同时使用线性而非二次计算,将内存需求减少约 40%。

Will Mamba 3 replace transformers entirely?

大多数专家预计会出现混合设计而非完全替代,状态空间层处理长序列,注意力则保留用于特定局部模式。

How soon can developers access Mamba 3?

早期 API 访问已于 2026 年 6 月开始,开源检查点预计将于夏末发布,生产级推理运行时将在今年晚些时候推出。

Does Mamba 3 reduce training energy consumption?

是的。论文报告在 30B 规模下每训练 token 的千瓦时减少 42%,该数据已在较小消融实验中得到独立验证。

What new tooling is required for inference?

现有针对 transformer 优化的框架需要更新以支持循环状态表示;训练和早期服务运行时已存在自定义 Triton 内核。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page