top of page

蚂蚁 Ling Flash 以 51 亿激活参数挑战万亿参数旗舰模型

蚂蚁集团发布了 Ling Flash,模型总参数量为 1240 亿,但处理每个 token 时仅激活 51 亿参数。

这一比例是 Ling-3.0-flash 的核心主张。蚂蚁称,该模型在多项重要任务上可媲美甚至超越规模大得多的推理旗舰模型 Ring-2.6-1T,同时还能在长时间智能体会话中实现更快响应。

这并非又一次围绕更大参数量展开的模型发布。蚂蚁正在挑战这样一种假设:更强的智能体性能必然需要更多激活计算。它选择自家的万亿参数旗舰模型作为对手,为这一主张提供了明确的内部参照。

该模型结合了原生混合线性注意力与高度稀疏的混合专家设计,并可在同一模型内切换直接回答与扩展推理。蚂蚁将其称为原生混合推理,因为这两种能力是共同开发的,而非由不同模型拼装而成。

这一架构之所以重要,是因为 AI 智能体很少能通过一次提示完成工作。它们需要阅读文档、调用工具、检查结果、修订计划,并保留不断增长的交互历史。每一步都会增加延迟和上下文处理成本。

蚂蚁表示,Ling-3.0-flash 已在超过 10,000 个交互环境中训练,覆盖编程、通用智能体工作和深度研究。公司还称,其缓存系统在长输入场景下可将首个 token 的生成时间缩短 60% 至 80% 以上。

这些数据仍为公司自行披露。公告发布后,尚未立即提供完整的公开模型卡、可复现的基准测试包及独立延迟分析。因此,这次发布提出了颇具潜力的效率主张,但也留下了重要的验证缺口。

Ling Flash 改变了蚂蚁对效率的押注规模

Ling-3.0-flash 将蚂蚁的效率战略转变为对其最大推理模型的直接挑战。

蚂蚁于 2026 年 7 月 24 日通过其 Ling 模型团队发布该模型。该公司的中文发布文章将其定位为面向实际智能体工作负载的原生混合推理模型。

Ling-3.0-flash 的总参数量为 1240 亿。不过,其稀疏路由系统每个 token 仅选择约 51 亿参数,约占完整模型的 4.1%。

与 Ring-2.6-1T 的对比更为鲜明。Ling-3.0-flash 的总参数量约为 Ring 的 12.4%,其激活参数量约为 Ring 所披露的 630 亿激活参数的 8.1%。

总参数量描述了分布在模型中的知识容量。激活参数量则描述了处理特定 token 时所使用的较小部分。后一个数字往往与每个 token 的计算量关系更密切。

蚂蚁称,这种更小的激活规模仍能带来具有竞争力的传统推理、指令遵循和长上下文表现。公司还将其定位于编程智能体、广泛工具使用和研究工作流。

这一主张并不等于说,参数量为 51 亿的稠密模型能够完成同样的工作。Ling 仍需存储并服务一个 1240 亿参数的网络。其路由器从更大的容量中调用资源,同时限制每一步所使用的专家数量。

这种设计可以减少计算量,但并不能消除内存、网络或路由需求。服务提供商仍必须分发或加载完整的专家池。因此,高效服务不仅取决于模型算术,也取决于基础设施。

该模型还支持思考与非思考行为。直接模式优先实现更快执行,而思考模式则允许针对困难任务进行更长的内部推理。用户不必在每次工作负载变化时,都在独立的 Ling 与 Ring 模型之间切换。

这种整合瞄准了一个常见的智能体问题:某个时刻的工作流可能只需要快速格式化,下一刻却需要更深入的规划。在专用模型之间路由请求会带来运营复杂性和行为不一致。

蚂蚁认为,单一模型可以覆盖该工作流的两端。如果这一主张成立,团队便可选择性地使用更深度的推理,而无需在每一个常规步骤中承担其延迟成本。

公司通过自有平台和 OpenRouter 开放访问,并计划在北京时间 8 月 3 日前提供临时免费访问。公司表示,模型权重将在该访问期结束后发布。

这一计划中的权重发布至关重要。公开权重将让研究人员检查配置文件、测试部署需求,并复现部分评测。在此之前,大多数用户只能通过托管推理来评估模型行为。

因此,眼下的变化不止于一次参数发布。蚂蚁让一个激活规模小得多的模型对阵其原旗舰,并承诺提供相当的实用能力。下一个问题是,这一架构如何支撑该主张。

Ling-3.0-Flash 如何使用更少的激活计算

该模型的效率来自选择性专家、混合注意力和系统级缓存的结合,而非依赖某一项孤立技术。

Ling-3.0-flash 使用稀疏混合专家架构,通常简称为 MoE。MoE 模型包含多个专门化的神经网络模块,而路由器仅为每个 token 激活其中一小部分。

蚂蚁将此次发布描述为 1/64 稀疏 MoE。这意味着,在一次独立的路由决策中,只有其可用专家容量中的很小一部分会参与。模型保留了广泛的已存储容量,但不会对每个 token 调用所有专家。

稀疏激活可以显著降低算力需求。然而,较低的激活参数量并不会自动带来低延迟。专家部署、互连带宽、请求批处理和路由器均衡都可能成为瓶颈。

第二个组成部分是原生混合线性注意力。注意力机制让模型能够将当前 token 与先前信息联系起来。随着输入增长,标准注意力的成本会越来越高。

线性注意力会压缩或重组历史状态,从而减少处理长序列所需的工作量。它可以提升效率,但纯线性方案有时会损失传统注意力所提供的精确性。

蚂蚁以五比一的交替模式组合 KDA 和 MLA 层。KDA 是一种门控线性注意力设计,而 MLA 会压缩注意力中使用的键和值表示。蚂蚁称,这一组合在内存、精度和计算量之间取得了平衡。

模型从预训练阶段起便采用这一架构。这一细节支持蚂蚁对“原生”的表述,因为混合行为并非仅在最终对齐或推理阶段才加入。

该方法延续了此前为 Ling 和 Ring 模型发表的工作。蚂蚁此前的技术报告描述了一种结合线性注意力与 MLA 的混合设计,用于加快长上下文训练和解码。

更早的一篇架构论文也记录了蚂蚁对混合线性注意力与标准注意力的实验。这些模型在保留关键位置更强注意力层的同时,降低了长上下文开销。

Ling-3.0-flash 通过新的 KDA 设计和更激进的专家稀疏性改变了这一公式。它还将该架构应用于一个从一开始就为混合推理行为训练的模型。

这一区别很重要,因为后训练无法修复所有架构限制。预期同时处理即时回答和扩展推理的模型,需要在两种模式下具备合适的训练样本、路由模式和服务行为。

蚂蚁表示,它通过超过 10,000 个交互式训练环境来实现这一能力范围。这些环境要求模型执行操作、接收结果并调整下一步,而不是仅预测孤立答案。

据称,这些环境覆盖编程、通用智能体任务和深度研究。此类训练可以让模型接触失败命令、不完整的搜索结果、工具错误和不断变化的状态。

这种经验对长时间运行的智能体至关重要。单次响应的基准准确率,几乎无法说明模型能否在第五次工具调用失败后恢复。

不过,环境数量并不能揭示其多样性或难度。10,000 个细微变体的价值,可能低于一组规模更小但经过精心设计的任务。蚂蚁尚未公布足够细节来判断这一差异。

因此,该架构提供了合理的效率机制:稀疏专家减少激活计算,混合注意力瞄准长输入,交互式训练则面向智能体执行。公开证据仍需证明这些部分协同工作的效果。

真正的对手是 Ring-2.6-1T

蚂蚁的主要目标并非让 Ling Flash 与小型本地模型竞争,而是借 Ring-2.6-1T 说明激活规模比总规模更重要。

Ring-2.6-1T 被设计为蚂蚁更深度的推理模型。此前一代产品将 Ling 的快速响应,与 Ring 更审慎的思考和高级智能体工作流分开。

这种划分反映了一种常见的部署模式。服务提供商用更快的模型处理常规请求,再将困难提示路由至规模更大的推理系统。这样的安排可以控制成本,但会产生多种行为特征。

Ling-3.0-flash 挑战了这一划分。蚂蚁称,新模型能够提供直接响应与扩展推理,同时以远少于 Ring 的激活参数量接近其性能。

其公告重点提及传统推理、指令遵循、长上下文、编程、通用智能体工作和深度研究。这些类别将比较置于真实工作流执行中,而不仅是数学难题。

据报道,该公司发布的基准测试图片涵盖软件工程、终端操作、银行工具、网页研究、指令遵循和长上下文检索。展示的竞争对手包括 MiniMax、DeepSeek、Nvidia、OpenAI 和 Anthropic 的模型。

然而,蚂蚁起初并未提供包含完整设置的、清晰且机器可读的表格。这使得精确比较难以审计。评测提示、推理预算、工具配置和重试策略都可能实质性地改变智能体分数。

不过,Ring 的比较在战略上仍具价值,因为两款模型均来自同一组织。蚂蚁在比较自家系统时,应当能够更好地控制模板、基础设施和评测条件。

但内部比较同样会带来以有利方式呈现新模型的动机。Ring 可能使用不同的推理预算,或服务于不同的工作负载。“媲美或超越”可能掩盖各项单独测试之间表现不均的问题。

更早的 Ring 和 Ling 系列提供了更可验证的基线。蚂蚁公开的模型目录包括 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 检查点。

这些发布表明,蚂蚁此前已在极大规模下将快速生成与更深度推理区分开来。一旦新权重发布,它们也将为研究人员比较架构演进提供路径。

压力已经超出 Ant 的内部产品线。开发者越来越倾向于根据单位延迟内的任务完成能力选择模型,而非只看某一项醒目的评分。Agent 应用会放大微小延迟,因为每个工作流都包含许多连续调用。

在独立聊天中,响应快一秒的价值有限。但若同样的缩短重复出现在 40 次相互依赖的工具调用中,就可能决定一个 Agent 是否让人觉得好用。

这一动态给大型推理模型提供商带来压力。他们必须通过更高的可靠性、更难任务的完成能力,或更少的失败步骤,来证明更高活跃计算量的合理性。当工作流变得缓慢或运行成本高昂时,纯粹的推理能力不再那么有说服力。

它也从相反方向给较小的稠密模型带来压力。稠密模型在本地运行可能更容易,因为每个参数都会以可预测的方式被使用。不过,它缺少稀疏模型可调用的更大专家池。

Ling-3.0-flash 位于这两类模型之间。它的活跃计算量类似于更小的模型,但其存储容量依然很大。这种组合看起来尤其适合集中式、高并发服务。

它显然不那么适合个人硬件。本地用户仍须存储完整模型,即使每个 token 仅激活其中一部分。稀疏 MoE 的经济性会在基础设施能够批量处理大量请求、并高效分配专家时得到改善。

因此,核心竞争并不是简单意义上的“大与小”之争,而是在始终激活广泛推理能力与在更大网络中选择狭窄路径之间的较量。

如果 Ling 的表现如其所称,对于许多常规 Agent 而言,Ring 的万亿参数规模就没那么有吸引力了。对于那些更深度的计算能持续带来更好结果的任务,Ring 仍然重要。

Ant 现在必须说明这条边界在哪里。开发者需要的远不止平均基准测试结果。他们需要知道 Ling 会在何时失败、思考模式何时有帮助,以及 Ring 何时仍值得额外的计算成本。

长上下文速度不只取决于模型

Ant 最大的延迟主张依赖于能够保留可复用上下文的服务栈,因此结果不能仅归因于模型架构。

长时间运行的 Agent 会反复访问共享信息。一个研究 Agent 可能会保留用户请求、此前的搜索结果、提取出的文档、工具输出和中间结论。

如果没有缓存,服务系统可能需要在每一轮重新处理其中大量历史内容。重复的预填充工作会增加首个 token 的生成时间,即 TTFT。该指标衡量用户在输出开始前需要等待多久。

Ant 表示,Ling-3.0-flash 集成了 SGLang HiCache 和 Mooncake 分层缓存。据称,该系统采用独立的物理资源池和共享的集群级缓存。

目标是让可复用上下文靠近可用计算资源。当 Agent 使用相同前缀再次发出请求时,系统可以检索已保存的键值状态,而无需重新构建它们。

据 Ant 称,这种方法可将长输入的 TTFT 降低 60% 至 80% 以上。对于深度研究和编程 Agent 而言,这将带来实质性影响,因为它们的上下文往往会在多轮交互中不断增长。

这一百分比并不能证明普遍的延迟表现。实际降幅取决于原始基线、输入长度、缓存命中率、并发量、硬件和网络部署位置。很大的百分比降幅仍可能留下明显的等待时间。

缓存也最适用于请求共享稳定前缀的情况。如果应用重写整个提示词、修改工具 schema,或重新排列检索到的文档,已保存的状态就会变得不那么可复用。

因此,开发者会通过提示词构建影响结果。稳定的系统指令、可预测的工具定义和以追加为导向的历史记录可以提高缓存命中率。持续变动提示词则可能抹去大部分优势。

基础设施要求也改变了买方解读模型性能的方式。Ling-3.0-flash 不只是一个可下载的神经网络。Ant 所称的体验结合了模型、推理引擎、缓存层级和集群设计。

独立托管方或许能复现模型的基准质量,却无法达到公开的延迟表现。另一家提供商则可能通过更好的批处理或硬件进一步改善它。仅凭模型权重无法解决这个问题。

同样的谨慎也适用于其宣称的长上下文能力。处理大型上下文窗口并不能保证模型能准确使用其中每一部分。随着相关证据变得更遥远,或被干扰信息包围,检索质量往往会下降。

Agent 工作流还带来另一项挑战。工具可能返回重复、矛盾或低质量的信息。模型必须识别哪些内容仍然有效,而不只是保留更长的记录。

Ant 的训练环境可能有助于解决这个问题,因为它们让模型接触交互状态。不过,任何环境数量都无法替代对长会话中的恢复能力、记忆一致性和证据使用情况进行衡量的评估。

最有力的测试方式,是在受控失败条件下重放真实工作流。研究人员可以衡量任务完成情况、缓存命中率、首 token 延迟、总运行时间、token 消耗,以及错误操作后的恢复能力。

他们还应比较冷请求与热请求。热缓存演示可能看起来令人印象深刻,却掩盖了首次交互的成本。生产工作负载同时包含这两种情况。

对于企业买家,数据处理还带来另一个问题。共享缓存必须隔离客户,并防止上下文跨越安全边界。该公告侧重性能,而非详尽的运营控制措施。

这并不表明存在已知的安全失败。它意味着,在受监管或敏感的工作负载迁移至该系统之前,这套延迟架构引入了值得关注的问题。

因此,60% 至 80% 的主张作为系统目标是可信的,但作为采购指标并不完整。买家在比较提供商之前,需要了解绝对延迟、工作负载定义和缓存条件。

Ling Flash 基准测试仍未证明什么

此次发布提出了雄心勃勃的主张,但尚未证明其相对于 Ring 或竞争性推理模型具有可复现的优势。

Ant 表示,Ling-3.0-flash 在广泛能力上与 Ring-2.6-1T 持平或更强。这种表述应被理解为公司的评估,而非独立确认的结果。

第一个不确定性涉及基准测试设置。推理模型在作答前可能消耗不同的 token 预算。获准进行更长时间思考的模型,可能获得更高分数,但响应更慢且使用更多计算资源。

Agent 评估还增加了更多变量。工具描述、浏览器状态、命令超时、重试和评估模型都会影响结果。细微的实施选择有时会显著改变排名。

第二个不确定性涉及发布状态。Ant 在发布时提供了托管访问,并表示随后将发布开放权重。在这些权重和配置细节到位之前,独立团队无法复现完整服务栈。

托管的 模型端点 仍可提供有用的行为测试。开发者可以在自己的应用中比较编程编辑、工具调用、长文档回答和指令遵循情况。

然而,API 测试无法揭示每一项路由决策或服务优化。提供商可以更新托管模型,而用户未必会收到新的 checkpoint 标识符。可复现性需要稳定的工件。

第三个不确定性涉及质量分布。平均基准表现可能掩盖特定语言、工具或任务长度上的严重弱点。生产 Agent 会在其最薄弱的重复步骤上失败。

例如,一个编程模型可能生成出色的补丁,却无法妥善处理终端状态。一个研究模型可能找到相关页面,却把缺乏支持的主张附加到错误来源上。

混合推理还带来另一项衡量挑战。团队需要思考模式和非思考模式的单独结果,以及在两者之间进行选择的策略。

如果用户手动选择模式,工作流设计就会变得更复杂。如果由模型或平台自动选择,开发者则需要了解延迟和行为的变化。

51 亿活跃参数这一数字也需要谨慎解读。它描述的是被选中的模型容量,而不是总基础设施成本。完整的 1240 亿参数网络仍必须在服务系统的某处保持可用。

MoE 路由可能遭遇专家失衡。热门专家会承受不成比例的流量,而其他专家则长期未被充分利用。生产系统可能需要额外容量,以避免过载路由拖慢批处理。

量化、推测解码和硬件内核也会进一步塑造性能。Ant 的头条比较并未拆分训练与服务优化各自带来的提升。

因此,独立评估应比较完整结果。有用的指标包括任务成功完成率、耗时、生成 token 数、重试次数、人工介入率,以及重复运行之间的一致性。

开发者可以在正式基准测试套件出现前开始这项工作。他们可以准备具有代表性的内部任务,移除敏感信息,并在相同工具和限制条件下测试每个模型。

编程团队可以使用代码库导航、失败测试、多文件编辑和终端恢复。研究团队则可以使用来源发现、矛盾处理、引用准确性以及对既有报告的更新。

目的不是再制作一个通用排行榜,而是识别 Ling 的低活跃计算量能否转化为更好的工作流经济性,同时不产生隐藏的可靠性成本。

Ant 的开放权重承诺将是第一个重要的可信度检验点。一份完整的模型卡应记录上下文限制、支持模式、架构、许可证、评估模板和推荐推理设置。

技术报告还应解释这 10,000 多个环境。研究人员需要了解其任务分布、筛选机制、奖励设计,以及与评估基准之间的关系。

缺少这些信息,数据污染仍难以评估。与公开评估相似的训练环境,可能会抬高表面上的 Agent 能力,却未改善更广泛的泛化能力。

适当的结论既不是否定,也不是接受。Ling-3.0-flash 提出了一套连贯的技术机制和有意义的内部比较。在可复现证据出现之前,其最强的性能主张仍属暂定结论。

三个信号将决定 Ling Flash 是否重要

该模型的重要性将取决于开放工件、独立工作流结果,以及超越推广性访问的实际采用情况。

第一个信号是承诺在 8 月 3 日后发布的权重。研究人员应寻找稳定的 checkpoint、明确的许可证、tokenizer 文件、推理配置和详尽的模型卡。

该发布将允许直接检查和第三方托管,从而强化 Ant 的效率论点。若出现延迟、限制性许可证或不完整配置,则会削弱开发者能够复现模型收益的主张。

第二个信号是在匹配条件下开展独立 Agent 评估。最具参考价值的测试将使用相同的工具、预算和重试规则,对 Ling-3.0-flash、Ring-2.6-1T 及其他推理模型进行比较。

结果不应只报告准确率。总完成时间、人工介入频率、冷启动延迟、热缓存延迟,以及失败工具调用后的恢复能力,将揭示低活跃计算量是否真正改善实际工作。

在编程、研究和企业工具使用中都能取得稳定结果,将巩固 Ant 的说法。若发布图表与外部测试之间差距显著,这一模型的适用性将受到限制。

第三个信号是临时访问期结束后的持续开发者采用。免费期间的使用主要反映好奇心。若它能持续集成到编程代理、研究产品和托管平台中,才说明其具备实际价值。

开发者应关注服务提供商是否保留该模型、是否开放两种推理模式,以及是否记录稳定的性能表现。他们还应跟踪项目是否会为开放权重发布部署方案。

采用与否将取决于可预测的行为,而不只是速度。团队需要确信,模型更新不会悄然改变工具调用、输出格式或推理深度。

对知识工作者而言,Ling 的即时价值体现在那些漫长、重复的工作流程中。当助手要处理大量文档,并在多个轮次中反复查阅相同证据时,更快的首个 token 响应尤为重要。

当周边信息保持有序时,这一优势会更有价值。可搜索的 AI 知识库 能够在模型和服务提供商变化时保留来源语境。

更广泛的启示很直接:参数总量正逐渐成为衡量实用智能的较弱代理指标。架构、活跃计算量、训练环境和服务系统,正日益决定开发者实际获得的体验。

Ling Flash 将这一论点置于一种格外鲜明的对比中。Ant 表示,51 亿活跃参数可以挑战万亿参数级旗舰模型,同时在长时间代理会话中实现更快响应。

如今,证据必须超越 Ant 的图表。应在完整工作流程中测试该模型,同时记录失败情况与延迟,并比较冷请求与缓存会话。这些结果将揭示,Ling Flash 是否代表代理效率的一次真正转变,还是仅仅是一项精心打造的发布主张。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page