NVIDIA Nemotron-3 Super: Hybrid Mamba 和 Latent MoE 如何改变 LLM 推理
已更新:6月17日

NVIDIA 最近发布了 Nemotron-3 Super,这是一个拥有 120B 参数的混合专家 (MoE) 模型,它从根本上改变了我们对模型大小与速度之间权衡的看法。通过在推理过程中仅激活 12B 参数并采用 Hybrid Mamba-Transformer 架构,该模型试图解决困扰大语言模型的“内存墙”问题。对于开发者而言,最直接的结果是吞吐量比前几代提升了 5 倍,并配有高达 100 万 token 的上下文窗口。
用户体验:效率提升与严格的安全过滤

LocalLLaMA 社区的早期采用者强调了 NVIDIA Nemotron-3 Super 体验中的一个特定两极分化。在技术层面,其效率是毋庸置疑的。由于该模型采用了 Hybrid Mamba-Transformer 架构(比例约为 75/25),KV cache(记住对话前文所需的内存)显著减少。这使得用户能够在通常无法运行标准 Transformer 模型的硬件上运行海量的上下文窗口。
然而,“开箱即用”的体验在安全微调方面受到了批评。许多用户反映该模型经过了激进的 RLHF(基于人类反馈的强化学习)微调,导致频繁出现“拒绝回答”。即使在良性的创意写作或编程任务中,该模型也经常将提示词标记为潜在的政策违规。对于那些希望将此模型用于无过滤本地推理的用户来说,“去审查”版微调或更宽松的系统提示词几乎是释放其 120B 参数全部潜力的必要条件。
另一个实际观察涉及其知识截止日期。虽然预训练数据包含截至 2025 年初的 token,但用户注意到模型偶尔会将旧数据幻觉为“当前”状态,这可能是由于包含 10T token 的海量数据集存在重叠的时间线信息。为了获得关于近期事件的准确答案,用户发现通过询问软件或 OS 版本的具体版本号,而不是通用的新闻问题,效果会更好。
技术突破:NVIDIA Nemotron-3 Super 中的 Latent MoE 与混合架构

的核心在于 NVIDIA Nemotron-3 Super 性能源于一个名为 Latent MoE(潜在大模型混合专家)的新概念。 在传统的 MoE 模型中,路由将 token 发送到特定的专家组(例如 top-1 或 top-2)。NVIDIA 的方法允许模型以一个专家的计算成本激活四个专家。这种“潜在”激活显著提升了推理准确性,而无需通常所需的计算量线性增加。
混合 Mamba-Transformer 层
标准 Transformers 随着上下文增长而扩展性变差,因为注意力机制需要二次方内存。NVIDIA Nemotron-3 Super 通过在其 75% 的架构中使用 Mamba 层解决了这个问题。Mamba 是一种状态空间模型(SSM),能够以线性扩展处理长序列。通过保留 25% 的层作为传统 Attention 机制,该模型保留了 Transformers “更强”的回溯和逻辑能力,同时将长上下文记忆的重任卸载给 Mamba 层。
多 Token 预测 (MTP)
该模型还实现了 Multi-Token Prediction。它不再仅仅预测下一个词,而是同时预测多个后续 token。这是吞吐量提升 5 倍的主要驱动力。当配合 NVIDIA 的 Blackwell 硬件和 NVFP4(4 位浮点)量化技术时,速度提升将呈指数级增长。NVFP4 允许以 FP8 一半的内存占用进行高精度推理,使 120B 模型在专业工作站上运行成为可能,而不再局限于大型服务器集群。
对 Agentic AI 和长上下文工作流的战略影响
NVIDIA 在设计 NVIDIA Nemotron-3 Super 时充分考虑了 "Agentic AI"。大多数模型在被要求执行 20 步任务时会失去焦点;它们会经历“目标漂移”,即遗忘初始指令。1M 的上下文窗口和混合架构提供的稳定性旨在让智能体保持在正轨上。
此次发布还标志着 NVIDIA’s open-source strategy 的转变。除了模型权重外,他们还提供了完整的训练“配方”,包括 10T token 数据集的分布。这种透明度旨在服务于需要构建“防御性 AI”的企业——即他们完全理解并能针对内部安全进行审计的模型。对于开发者来说,这意味着你可以清楚地看到模型是如何被引导的,从而更容易对特定行为进行逆向工程,或针对专门的代码库或法律文档分析等利基工业应用对模型进行微调。
硬件现实:消费级与专业级需求

虽然 12B 的激活参数量让 NVIDIA Nemotron-3 Super 听起来很轻量,但完整的 120B 参数仍必须驻留在 VRAM 中。这使得该模型超出了 RTX 4090 (24GB) 等单张消费级 GPU 的能力范围。要运行具有实际意义的上下文窗口的模型,你至少需要双 48GB 显卡或专业级的 RTX 6000 Ada。
该模型对 NVFP4 的优化是一个明确信号,表明 NVIDIA 正在推动用户转向其最新的 Blackwell 架构。 在旧款 Hopper 芯片上,你仍然可以获得该架构带来的好处,但无法看到新的 4-bit 精度格式所承诺的 4 倍加速。对于本地社区而言,这意味着虽然权重是“开放”的,但真正的性能上限被阻隔在高端硬件之后。
自适应常见问题
NVIDIA Nemotron-3 Super 中的 Mamba-Transformer 混合架构是如何提高速度的?
Mamba 层以线性缩放处理序列,这比传统 Transformer 的平方缩放更快且内存占用更低。通过在模型中使用 75% 的 Mamba 层,NVIDIA 减轻了计算负担,而剩下的 25% Transformer 层则保持了高水平的推理能力。
我可以在单张 RTX 4090 上运行 NVIDIA Nemotron-3 Super 吗?
并非全精度运行。即使经过量化,120B 模型仍需要巨大的 VRAM。虽然 4-bit 量化 (NVFP4) 降低了内存需求,但它仍然超过了 4090 上可用的 24GB。你可能需要多个 GPU 或一个至少拥有 80GB-100GB VRAM 的系统才能利用 1M 上下文窗口。
什么是 "Latent MoE",它为什么重要?
Latent MoE 是一种允许模型在仅支付一个专家的计算“税”的情况下,获得四个专家同时激活的智能的技术。与之前的版本相比,这有效地将模型相对于其推理速度的准确性提高了一倍。
NVIDIA Nemotron-3 Super 数据集的知识截止日期是什么时候?
预训练数据包含截至 2025 年的信息,部分微调数据延伸至 2026 年。然而,用户应注意,除非专门提示更新的技术数据,否则模型在处理某些通用查询时可能仍会默认使用 2024 年的知识。
为什么模型会拒绝某些创意提示词?
该模型针对安全性和企业对齐进行了深度调整。它具有严格的拒绝机制,在进行创意写作或角色扮演时,有时会触发“误报”。调整系统提示词或使用社区主导的 "unslop" 微调版本是解决此问题的常见方案。
NVIDIA Nemotron-3 Super 在编程方面比 GPT-4 更好吗?
在“智能体 (Agentic)”编程方面——即模型必须分析整个代码库时——1M 上下文窗口赋予了它明显的优势。它可以一次性“阅读”更多代码而不会丢失架构上下文,尽管 GPT-4 在处理小型、孤立代码片段的零样本逻辑方面可能仍具有优势。
NVFP4 量化会导致精度损失吗?
根据 NVIDIA 在 Blackwell 硬件上的测试,NVFP4 格式提供的性能与 FP8 相似,且没有可衡量的精度下降。这使得在实现巨大的内存节省和速度提升的同时,无需承担旧版 4-bit 方法中常见的“量化惩罚”。



