top of page

Kimi Linear 以自己的方式击败了全注意力

Kimi Linear 为 Moonshot AI 带来了线性注意力研究者多年追寻的结果:在三种高难度场景下,报告质量优于全注意力。该公司称,在训练条件一致的情况下,其架构在短上下文测试、长上下文评估和强化学习中均处于领先地位。

效率数据进一步凸显了这一挑战。Moonshot 表示,在一百万 Token 上下文中,其方案可将键值缓存占用最多降低 75%,解码速度提升至 6.3 倍。这些收益来自于以 Kimi Delta Attention 替换大多数全局注意力层,同时保留少量全局层。

这种混合设计令全注意力,特别是 Multi-Head Latent Attention,面临压力。尽管内存和计算成本不断上升,全注意力始终是更稳妥的质量选择。Moonshot 的主张是,模型构建者已不必再接受这种取舍。

证据相当可观,但尚不足以下定论。这些比较来自 Moonshot 自身的实验,使用的是同一模型家族及其内部训练系统。开放权重、内核和服务代码使这些主张格外便于验证,但生产环境中的表现仍取决于软件正确性和硬件条件。

Kimi Linear 改变了注意力机制的取舍

Moonshot 并未将 Kimi Linear 定位为一种更小的折中方案,而是将其作为全注意力更强的替代方案。

这份技术报告描述了一种混合专家模型,总参数量为 480 亿,活跃参数量为 30 亿。活跃参数是每个 Token 实际使用的参数子集,在很大程度上决定了推理期间所需的计算量。

该模型将 Kimi Delta Attention(KDA)与 Multi-Head Latent Attention(MLA)结合。KDA 是一种循环式线性注意力机制,它维护固定大小的状态,而不是存储此前的每一个键和值。

MLA 是一种与 DeepSeek 模型设计相关的压缩型全局注意力。相较于传统多头注意力,它可以降低缓存需求,但其缓存仍会随着序列增长。

Moonshot 每使用一层 MLA,就使用三层 KDA。全局层保留了跨上下文的直接访问能力,而线性层则通过循环状态更新处理大部分 Token。

这一比例之所以重要,是因为纯线性注意力仍面临内存容量问题。固定状态必须将整个序列压缩到有限的表示中。随着输入增长,细节可能相互冲突、逐渐淡化,或变得难以检索。

全注意力通过保留先前 Token 的表示,避免了这一特定瓶颈。每个新 Token 都能直接与已存储的历史进行比较,尽管由此产生的缓存会随上下文长度增长。

Kimi Linear 并不假装这种有限状态约束已经消失。相反,该架构将不同任务分配给两种机制:KDA 提供高效的局部和循环处理,而周期性 MLA 层恢复全局访问能力。

Moonshot 使用相同的训练配方,在 1.4 万亿 Token 上训练了主要对比模型。根据报告,Kimi Linear 在列出的每项短上下文预训练评估中都优于全 MLA 基线。

其 MMLU-Pro 得分达到 51.0,而全 MLA 为 47.2。Kimi Linear 在 MMLU 上也取得了 73.8 分,MLA 则为 71.6 分。

这一趋势还延伸至 HellaSwag、ARC-Challenge、Winogrande 和 Big-Bench Hard。各项差距有所不同,但 Moonshot 报告称,在列出的比较中,短上下文性能没有出现损失。

这一结果颠覆了针对线性注意力的常见论点。过去,团队接受线性方法是因为它能降低推理成本,而不是因为它能稳定提升传统基准测试质量。

诸如线性 Transformer的研究早在多年前就确立了其计算层面的优势。重新排列注意力计算,可使自回归处理对序列长度呈线性复杂度,并维持固定大小的循环状态。

质量始终是更难解决的问题。Softmax 注意力能够在序列中建立精确、依赖内容的连接。早期线性替代方案往往会损失准确性,尤其是在任务需要精确检索或复杂关联时。

因此,Kimi Linear 改变的不只是某个基准排名。它提供了证据,表明经过精心设计的混合架构可以让效率与质量朝着同一方向提升。

这些证据构成了本文的核心张力。如果独立测试支持 Moonshot 的结果,那么全注意力将不再是质量敏感型长上下文模型的自动默认选择。

为什么长上下文解码让全注意力承压

决定性的优势出现在生成阶段:每增加一个 Token,采用全注意力的模型都必须重新处理不断扩张的缓存。

键值缓存存储先前 Token 的注意力表示。它能避免模型在每个解码步骤中重新计算完整历史。

但随着对话、文档或 Agent 轨迹变长,缓存仍会增长。这种增长会消耗加速器内存,并降低服务器可同时处理的请求数量。

MLA 已经大幅压缩了这类缓存。尽管如此,Moonshot 仍称,与其全 MLA 基线相比,Kimi Linear 可将缓存占用进一步降低最多 75%。

原因来自层的组合。只有四分之一的注意力层使用 MLA,因此需要依赖序列长度的缓存。三层 KDA 则维护循环状态,其大小不会随每个 Token 增长。

这种差异对于以解码为主的工作负载尤为重要。长时间运行的编程 Agent、研究系统和工具使用型助手,在接收大规模输入后可能生成很长的轨迹。

传统上下文基准通常强调 prefill,即对输入进行初始处理。Agent 工作负载还增加了另一项负担,因为生成可能会持续经过许多推理步骤和工具响应。

Moonshot 测量了随着解码长度增加,每个输出 Token 所需的时间。在一百万 Token 时,报告列出的 Kimi Linear 为 1.84 毫秒,MLA 为 11.48 毫秒。

这构成了所报告的 6.3 倍优势基础。较短长度下差距较小,随后随着 MLA 缓存对内存和批处理造成更大压力,差距逐渐扩大。

这一比较并不意味着每次部署都能每秒生成六倍更多 Token。Moonshot 的结果反映的是特定硬件设置、模型配置、批处理方式和实现方案。

吞吐量也不同于单请求延迟。更小的缓存使服务器能够容纳更大的批次,即使单次计算的变化没有那么显著,也可能提升总吞吐量。

报告显示,prefill 优势相对更为温和。在一百万 Token 的输入长度下,据称 Kimi Linear 处理提示词的速度是 MLA 的 2.9 倍。

这些测量结果解释了为何该架构瞄准 Agent,而不仅仅是文档摘要。一个只读取一次并简短回答的系统,从固定状态解码中获得的价值较少。

而一个反复推理、调用工具、接收观察结果并继续生成的系统,则面临不同的成本曲线。其历史会在任务过程中增长,恰恰是在缓存压力变得更难管理之时。

这种压力影响模型开发者、推理平台和企业买家。开发者必须决定,是否仍值得在所有位置使用全局注意力并承担其服务成本。

推理平台需要理解循环注意力状态的内核和调度器。企业买家则需要证据证明,较低内存占用能够经受住真实的并发、检索和可靠性要求。

对于知识密集型工作而言,长上下文还需要组织能力,而不仅仅是原始容量。可搜索的知识库可以在模型处理前筛选相关证据。

Kimi Linear 并未消除这种架构需求。它改变的是处理和扩展应用所提供上下文的成本。

因此,近期压力将最主要地落在构建长时间运行 AI Agent 的团队身上。他们现在拥有一个开放实现,其主张是在获得更高质量的同时,实现更平缓的解码成本曲线。

Kimi Linear 如何使用更智能的循环记忆

KDA 通过更细粒度地控制循环记忆擦除和保留的内容,改进了线性注意力。

Kimi Delta Attention 扩展了 Gated DeltaNet,后者是一种将衰减门控与 delta-rule 记忆更新相结合的早期架构。Gated DeltaNet 论文报告称,其在检索和语言任务中的表现优于 Mamba2 和 DeltaNet。

delta rule 会根据预测误差更新记忆。简单来说,模型尝试替换过时的键值关联,而不是不断累加新信息。

这种更新行为有助于防止记忆变成此前所有信息的失控总和。它也为循环状态提供了一种修正早期关联的方法。

Gated DeltaNet 增加了一种决定记忆衰减速度的机制。然而,单一门控仍可能对具有许多不同通道的状态施加过于宽泛的影响。

KDA 让这种控制更为细粒度。其更细致的门控可根据当前 Token 和学习到的投影,让状态的不同部分以不同速度遗忘。

这很重要,因为有用上下文并不会以统一速度失效。临时的格式提示可能很快变得无关紧要,而用户约束或函数定义则应保持可用。

该架构让模型能够更好地控制这种分配。它仍然拥有有限的循环记忆,但可以更有选择性地使用这部分容量。

Moonshot 还为 KDA 设计了一种分块训练算法。分块使模型能够在训练期间并行处理成组 Token,而不必按顺序应用每一次循环更新。

报告采用了一种专门的对角加低秩转移结构。这种数学形式可在保留预期 delta-rule 行为的同时,使分块计算更加高效。

这些实现工作至关重要。即使一种架构的复杂度很有吸引力,如果其内核引入的开销足以抹去理论收益,它仍可能失败。

Moonshot 的 prefill 测量表明,与报告中测试的 Gated DeltaNet 混合架构相比,KDA 增加的延迟可以忽略不计。但它在基准测试中的结果优于该基线。

与 Gated DeltaNet 的比较也揭示了为何设计中仍保留全局注意力。Kimi Linear 与 Gated DeltaNet 混合架构在短上下文评估中较为接近,其中 Kimi 通常领先。

在 128,000 Token 上下文下,Gated DeltaNet 混合架构在 Moonshot 长上下文测试套件中的平均得分为 51.2。全 MLA 平均为 52.2,而 Kimi Linear 达到 54.5。

因此,纯粹追求效率的路径并未在长上下文质量上占据主导。更强的结果来自于将 KDA 与周期性 MLA 配对,并采用 Moonshot 选择的位置处理方式。

在 RULER 这一测试长上下文检索和操作能力的合成测试套件中,Kimi Linear 得分为 84.3。全 MLA 得分为 81.3,而 Gated DeltaNet 混合架构得分为 80.5。

Kimi Linear 在 RepoQA 上也以 68.5 分领先,两项基线均为 63.0 分。RepoQA 测试模型针对软件代码仓库的问答能力,因此与编程和代码搜索系统密切相关。

它并未在所有长上下文任务中领先。MLA 在 LongBench v2 上取得了 36.1 分,Kimi Linear 为 35.0 分。MLA 在 Frames 评测中也以 60.5 比 58.8 领先。

这些例外很重要。它们表明,即使在 Moonshot 自己的评估中,KDA 也尚未消除全注意力的所有优势。

不过,综合结果仍然更倾向于这种混合架构。更重要的是,它最大的效率提升恰恰出现在全注意力基线成本最高的场景。

以下说明 Kimi Linear 如何运作,但不把它写成产品教程。它将循环记忆与全局 token 访问视为互补资源,并逐层分配它们的预算。

这种分配正是逆转背后的机制。Moonshot 并未让线性注意力在所有地方模仿全注意力,而是保留了足够的全局注意力,以弥补循环记忆最薄弱的环节。

强化学习测试的是另一种记忆能力

Moonshot 的强化学习结果表明,该架构能够应对较长的生成轨迹,而不只是从超大提示中检索事实。

强化学习带来了不同于预训练的测试。模型生成答案、获得奖励,并朝着在训练目标下得分更高的行为更新。

对于推理模型而言,这些输出可能会很长。模型可能会探索计算过程、修正中间步骤,或在得出答案前生成较长的工具使用序列。

Moonshot 使用可验证奖励的强化学习,将 Kimi Linear 与完整 MLA 进行了比较。RLVR 使用可自动检查的结果,例如数学答案是否正确。

该公司表示,两种模型使用了相同的算法和超参数。Moonshot 在包括 AIME 2025 和 MATH 500 在内的数学测试中评估了它们的进展。

根据论文,Kimi Linear 在整个训练过程中保持了更好的表现。其优势同时体现在训练准确率和留出评估曲线中。

这一结果很重要,因为线性注意力的固定状态本可能难以应对延展的推理。随着生成序列扩展,较早的重要步骤可能会消失。

Moonshot 的曲线表明,KDA 的记忆控制机制与周期性的全局层相结合,为所测试的推理工作负载保留了足够有用的状态。

该报告没有提供对这一结论的独立复现。它还使用了 Moonshot 的内部数学训练集,外部研究人员无法对其进行完整审查。

匹配的超参数提高了公平性,但并不能解决所有比较问题。针对特定架构的调优工作,可能会改变绝对结果或缩小差距。

还有另一种解读值得考虑。Kimi Linear 架构或许为 Moonshot 的训练系统带来了优化优势,而非普遍的质量优势。

这依然很有价值,但会使这一主张的范围更窄。其他模型规模、数据混合、奖励设计和训练框架,可能会产生不同的排名。

这套 480 亿参数的混合专家配置也使泛化问题更为复杂。拥有 30 亿活跃参数的模型,其行为并不完全等同于具有相同活跃规模的稠密模型。

其专家层拥有的总容量远高于活跃参数数量所暗示的水平。结果可能取决于稀疏专家与混合注意力堆栈之间的相互作用。

因此,开发者应当区分三个问题:KDA 是否改善了 Moonshot 的模型,混合线性注意力是否改善了可比架构,以及它是否改善了某个具体的生产工作负载?

论文为第一个问题提供了令人鼓舞的证据,并为第二个问题提供了可信的研究线索。只有工作负载级别的评估才能回答第三个问题。

对于企业级 agent 而言,基准准确率并不足够。系统必须保留指令、引用正确证据、处理工具故障,并在反复交互中保持稳定。

循环状态架构也可能更难审查。全注意力会暴露一个与先前 token 直接关联的缓存,而 KDA 则将历史压缩为学习得到的状态矩阵。

这种压缩正是其效率来源。但当模型遗忘或覆盖重要信息时,它也会让故障变得不那么直观。

因此,强化学习增强了 Moonshot 的论点,但尚不足以盖棺定论。它表明,该架构在一种直接考验记忆能力的长输出训练机制下仍保持竞争力。

开放代码让主张可验证,但软件栈也带来风险

Kimi Linear 的开放发布降低了验证门槛,但实现正确性如今也成为模型正确性的一部分。

Moonshot 与论文一同发布了预训练和指令微调检查点。它还公开了 KDA kernel 以及面向 vLLM 推理引擎的实现。

官方仓库介绍了一种兼容 OpenAI 的 vLLM 部署方式,最大模型长度为 1,048,576 个 token。它记录了相同的 KDA 与 MLA 三比一层比例。

研究人员可以检查架构、运行受控评估并比较内存消耗。基础设施团队可以分析 kernels,而不必只依赖报告中的图表。

模型权重也支持有针对性的故障测试。评估者可以改变证据的位置、引入相互竞争的事实,或在长预填充后延长生成内容。

这种开放性对于新的注意力机制尤其重要。状态布局、chunk 边界、缓存或批处理中的细小错误,都可能悄然破坏长上下文行为。

后来的 vLLM bug report 说明了这一风险。该报告发现,一个明显的循环状态布局错误影响了多个 vLLM 版本中 KDA 的分块预填充。

报告者发现,短提示仍保持连贯,但长上下文检索失败。针测试返回了附近的填充内容,而不是所请求的短语。

该问题已被标记为完成,但它的存在带来了更广泛的教训。经过基准测试的模型架构与生产服务路径并不是同一个产物。

全注意力服务背后有多年的优化、测试和运营经验。KDA 则需要跨多个硬件后端采用更新的 kernels 和状态管理逻辑。

vLLM 现在提供了一个 Kimi Linear module,提升了可用性。兼容性并不保证在不同版本中具有相同的性能或可靠性。

评估该模型的团队应固定精确的软件版本。他们应测试长预填充检索、批量解码、前缀缓存,以及跨 chunk 边界的状态行为。

他们还应衡量实际并发度。论文中最大的吞吐量收益,部分取决于利用节省下来的内存支持更大的批量。

如果应用只处理一项低流量请求,运营收益可能有所不同。高并发 agent 平台可能会从更小的缓存中获得更多收益。

硬件同样重要。专用 kernels 在不同 NVIDIA 架构或替代加速器上的表现可能不同。kernel 的可用性可能决定理论效率能否进入生产环境。

最有力的验证应结合独立质量测试与端到端服务测量。评估者应报告硬件、精度、批量大小、输入长度、输出长度和软件 commit。

他们还应与经过优化的 MLA 进行比较,而不应只与传统多头注意力比较。Moonshot 选择 MLA 作为基线,使其所宣称的缓存缩减更具挑战性。

这次发布值得肯定,因为它使这些工作成为可能。许多架构主张没有附带权重或高效代码,导致外部人员无法复现核心结果。

不过,开放产物并不会让论文结论自动成立。它们将一家公司的主张转化为一个可证伪的工程命题。

Kimi Linear 发布后值得关注什么

下一步的结论取决于独立复现、稳定的服务支持,以及在更大规模生产模型中的采用。

第一个信号是在匹配训练条件下对基准结果进行复现。独立团队需要在等效参数规模、数据和训练预算下,将混合 KDA 与全注意力进行比较。

仅进行推理比较无法隔离架构本身的贡献。模型可能在数据质量、专家路由、优化或后训练方面存在差异。

最有价值的研究将从头训练多种架构。它们应覆盖短上下文语言建模、长上下文检索、代码任务和强化学习。

一致的提升将增强 Moonshot 的核心主张。结果参差不齐则表明,Kimi Linear 可能最适用于特定规模或训练方案。

第二个信号是 vLLM 各版本和硬件平台上的服务可靠性。长上下文测试应成为 KDA 状态处理的常规回归检查。

稳定的支持将使该架构对生产 agent 更具可信度。无论论文在模型层面的结果如何,反复出现的状态或 kernel 故障都会削弱这一论点。

团队应关注部署工具是否支持前缀复用、量化、推测解码和连续批处理,同时不牺牲 KDA 的正确性。这些功能塑造了实际的服务经济性。

第三个信号是架构采用情况。最有力的认可将是 KDA 出现在更大的 Moonshot 系统或无关的模型家族中。

采用表明 Moonshot 认为该设计可扩展到单一研究检查点之外。外部使用则表明,其他团队能够复现其训练和推理优势。

更大规模的部署也会让该设计面对更困难的工作负载。多 agent 任务、代码仓库规模的编程、研究综合以及长时间的工具使用,可能会以不同于学术套件的方式考验记忆能力。

读者不应将这个故事简化为六倍速度的说法。该数字代表 Moonshot 所报告设置中最有利的长上下文解码点。

更大的进展在于,它对全注意力作为质量优先默认方案的地位提出了可信挑战。Kimi Linear 将循环效率与足够的全局访问结合起来,避免了通常的妥协。

对于开发者而言,实际问题很具体:在长时间生成过程中,该架构是否能持续保留你的应用所需的证据和指令?

对于基础设施团队,问题关乎可用容量。缩小的缓存是否能在代表性流量下转化为更大的安全批量、更低的延迟或更少的加速器?

对于企业买家而言,可靠性应当优先于架构标签。应要求供应商提供长上下文检索测试、软件版本、并发假设和故障分析。

Kimi Linear 现在为行业提供了可以具体测试的对象。用它运行你最长的真实提示,延长输出,并验证哪些内容能够保留下来。如果独立结果与 Moonshot 的报告一致,全注意力将需要比“习惯使然”更有力的辩护。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page