top of page

Xiaomi MiMo Agent Arena 结果将 V2.6 Pro 推入开放模型前五

6天前
讀畢需時 14 分鐘

在超过 8,100 次真实智能体会话后,Xiaomi MiMo Agent Arena 的结果让 V2.6 Pro 跻身开放模型第五名。据 Arena 10 月 1 日公告称,这一排名较 MiMo-V2.5-Pro 上升了九位。这个结果比又一项厂商基准测试更具意义,但还不足以成为最终定论。

Arena 报告称,MiMo-V2.6-Pro 的净改进得分为 3.17%。MiMo-V2.6-Flash 也在开放模型中排名第九。这一成绩直接对 DeepSeek、阿里巴巴 Qwen、Z.ai 的 GLM 系列及其他争夺智能体工作负载的开放替代方案构成压力。

重要的反转发生在 Xiaomi 自身的模型产品线中。据称,MiMo-V2.5-Pro 在开放模型中排名第十三,净改进得分为负 7.23%。V2.6 Pro 不仅进入正值区间,还上升了九个名次。这让此次发布看起来不只是常规模型迭代,更像是对 Xiaomi 智能体战略的一次修正。

不过,早期样本仍远小于若干成熟模型所积累的样本。置信区间较宽,排名可能变化,公开的漏洞报告也描述了汇总分数可能掩盖的失败情况。Xiaomi 现在拥有的是进步的证据,而非可靠部署的证明。

Xiaomi MiMo Agent Arena 结果显示出明显的代际反转

核心结果不只是第五名本身,而是 Xiaomi 自 MiMo-V2.5-Pro 以来似乎跨越的差距。

Arena 的 10 月公告称,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 已进入其智能体排行榜。该帖将 Pro 排在开放模型第五位、Flash 排在第九位。这些名次指的是开放模型子集,而非在所有闭源和开放模型中的总体排名。

MiMo-V2.6-Pro 在 8,158 次会话中获得了 3.17% 的净改进估计值。该估计的误差区间为正负 1.64 个百分点。MiMo-V2.6-Flash 在 13,035 次会话中获得了 0.57% 的估计值,区间为正负 1.44 个百分点。

净改进并不等于任务完成率。它估计的是:相对于 Arena 的统计基线,选择某一模型会如何改变智能体的结果。Arena 会随机组合组件,并分析它们在多组件智能体系统中的影响。

这一差别很重要,因为模型即使获得温和的净得分,也可能完成许多任务;它也可能在并未赢下每项底层指标的情况下排名高于另一模型。这个数字试图在扣除其他组件影响后,分离出编排模型本身的贡献。

Pro 的结果看起来强于 Flash。在考虑其给定区间后,Pro 的估计改进仍高于零。Flash 的区间则跨越零点,其观察到的优势能否持续仍存在更多不确定性。

Arena 报告中与 MiMo-V2.5-Pro 的比较,让这种代际变化显得相当显著。旧模型的估计值为负 7.23%,在开放模型中位列第十三。因此,Pro 的中心估计值提高了 10.4 个百分点,同时排名上升九位。

这一比较需要谨慎解读。这些模型未必面对相同的任务、用户、评测框架版本或竞争模型范围。随着新会话涌入、新模型加入,实时排行榜会不断变化。这种差异是方向性的证据,而非两个固定系统之间受控的一对一实验。

实时智能体排行榜提供了更多背景。它报告了已确认成功、表扬与投诉、可引导性、命令恢复和工具幻觉等方面的结果。它还公布会话总数和不确定性范围,而非只展示排名。

MiMo-V2.6-Pro 最突出的次要结果是 7.35% 的已确认成功估计值。Arena 的公告将这一分数列为开放模型第二。在更广泛的实时榜单中,闭源系统占据了多个更高的位置,显示出开放类别之外仍有多么激烈的竞争。

Flash 在实时智能体排行榜上的已确认成功估计值为 5.44%。其总体净改进较小,是因为头条分数综合了多项行为信号。一个经常获得最终认可的模型,仍可能因引导能力不足、工具错误或其他轨迹层面的行为而失分。

因此,Xiaomi 的两款模型讲述了不同的故事。Pro 看起来是更显著的能力修正;Flash 则像是一种以效率为导向的选择,但其总体排名在统计上仍较不稳定。

两种情况都不足以支持宣布某个开放模型获胜。相反,这一结果让 Xiaomi 进入了一个更值得进行真实智能体测试的候选模型群体。

为什么 Agent Arena 比静态基准更有分量

Agent Arena 的重要性在于,它衡量的是模型在长时间工具调用会话中的表现,而微小的推理错误可能演变为代价高昂的行动链。

静态基准通常给出固定问题并为最终答案打分。智能体则必须决定检查什么、调用哪个工具、如何理解错误,以及何时停止。它还必须在用户改变方向时作出响应。

Arena 的 评测方法论将智能体视为一个由多个组件构成的系统,包括主编排模型、工具、子智能体和周边框架的其他部分。Arena 随机选择组件,并通过因果分析估计各组件的影响。

Arena 将这一过程称为因果追踪。该方法旨在将模型的贡献与系统其余部分分离开来。这个目标很重要,因为令人印象深刻的智能体演示可能高度依赖隐藏的脚手架。

该基准来自实时活动,而非固定的实验室任务集。Arena 表示,用户会让智能体编写代码、调试项目、研究网络信息、分析文件和创建文档。这些工作负载包含静态测试经常剔除的模糊性和不断变化的需求。

在一个为期七天的方法论样本中,Arena 观察到 128,244 次会话中的 160,480 个任务。代码编写占任务的 17.5%,研究与查询占 10.8%,规划与头脑风暴则占另外 10.6%。

超过四分之三的会话至少使用了一种工具。Arena 还报告称,每次会话平均约有 16.5 次结构化工具调用。较长的操作序列会增加一次错误污染后续每一步的风险。

这一环境赋予了 Xiaomi 结果实际意义。MiMo-V2.6-Pro 并非仅依据它是否知道答案来评判,而是在需要决策、修订、工具使用和用户认可的工作流中接受评判。

已确认成功尤其直观。Arena 会询问用户智能体是否完成任务,再将该明确回答作为结果。其信号定义说明了任务级反馈如何转化为模型级分数。

不过,明确确认本身也有局限。用户的耐心、专业知识、任务难度和预期各不相同。有些人可能没有核查每个细节就认可产物;另一些人则可能因呈现方式不理想而拒绝技术上正确的结果。

表扬与投诉提供了另一种行为视角。可引导性衡量模型在收到纠正后是否能有效响应。命令恢复考察工具操作失败后会发生什么。工具幻觉则追踪模型试图调用不可用能力的情况。

这些指标共同奖励的不只是润色得体的语言。它们测试模型在第一个计划碰上现实后是否仍然有用。这往往才是生产环境智能体的决定性问题。

该方法论也造就了一个不断变化的目标。Arena 的模型池、框架、用户群体和任务分布都在演变。即使模型权重没有更新,它也可能因为评测环境变化而提升或失去名次。

因此,排名应被理解为模型在 Arena 平台上的当前估计,而非所有编程助手、研究智能体或企业工作流之间的普遍排序。

这一限制并不意味着 Xiaomi 的结果不重要。它解释了为何该结果值得关注,但不应被视为全面的性能宣称。

MiMo-V2.6-Pro 给开放智能体领域带来压力

Xiaomi 已将 MiMo 从一个边缘的开放模型选项,变成竞争对手必须以同等真实会话证据回应的候选者。

直接压力落在其他定位于工具使用的开放模型上。DeepSeek、Qwen、GLM、MiniMax 和 Mistral 都在争夺希望获得更大部署控制权的开发者。各项目还在速度、内存需求、许可和基础设施支持方面竞争。

MiMo-V2.6-Pro 的开放模型第五名并不意味着它超过了所有闭源模型。Arena 更广泛的排行榜包含来自 Anthropic、Google、OpenAI 和其他厂商的闭源系统,其中一些已积累了大得多的会话样本。

对于无法将敏感上下文发送至闭源端点的团队而言,开放模型之间的比较仍然重要。开放权重支持私有部署、专用推理和对模型行为进行更深入的检查。它们也为定制安全控制和领域调优提供了更多空间。

Xiaomi 以 MIT 许可证发布了 V2.6 权重。其官方模型文档将 Pro 描述为稀疏混合专家模型。这种架构每个 token 只激活网络的一部分,而非使用全部参数。

据 Xiaomi 称,Pro 总参数量为 1.02 万亿,激活参数量为 420 亿。Flash 总参数量为 3090 亿,激活 150 亿参数。两者均支持文本、图像、视频和音频,并宣称拥有 100 万 token 的上下文长度。

这些规格有助于解释 Xiaomi 的双模型策略。Pro 面向该系列中最强的智能体性能,Flash 则旨在以更小的激活规模保留其中的大部分能力。

Arena 的结果在一定程度上支持了这种定位。Pro 在总体净改进和已确认成功上领先 Flash。Flash 积累了更多会话,但其总体效果仍更接近零。

效率仍决定着现实中的采用。智能体在读取文件、修订计划和从失败命令中恢复时,可能会调用模型数十次。每次调用的微小差异会在长任务中不断累积。

Arena 会报告每项任务的输出量中位数和成本,但这些数字取决于观察到的工作负载,因此不应被视为固定的产品价格。模型行为会影响一项任务所消耗的轮次和 token 数量。

这种行为成本常被忽视。更便宜的模型若反复执行操作、输出过多内容,或需要额外纠正,可能反而变得昂贵。能力更强的模型即使每次调用消耗更多资源,也可能降低整体工作量。

因此,对竞争对手的压力并不只是“击败 3.17%”。它们必须展示自身模型在完整任务中的表现,也需要公布足够数据,让买家能够区分可靠的改进与小样本结果。

小米这一代的成果提高了外界对其未来主张的标准。该公司报告称,相较于 V2.5,其在多项内部和公开基准测试中取得了显著提升。Agent Arena 则提供了外部证据,表明这种改进已超出小米自身测试套件的范围。

但 Arena 仍只是一个平台,采用一套测试框架,并面对一种用户分布。竞争对手完全可以合理地指出,其自家智能体使用不同的提示词、工具、记忆系统和恢复逻辑。这些差异可能实质性地改变结果。

因此,最有力的竞争回应应当是复现。独立评估机构应在受控工具权限和重复试验条件下,通过共享工作流测试可比模型。企业团队也应测试具有代表性的内部任务。

对开发者而言,实际结果是候选范围扩大了。MiMo-V2.6-Pro 现在值得与更知名的开放替代方案一同评估,但尚不足以获得默认选用资格。

已确认成功是最有力的结果,也最容易被误读

MiMo-V2.6-Pro 的 7.35% 已确认成功评分增强了其确有进步的论据,但这并不意味着用户批准了全部任务中的 7.35%。

该评分代表在 Arena 因果分析框架下,相对于其基准线的估计提升,并非原始任务完成率。混淆这两个数值,会夸大排行榜实际能够证明的内容。

已确认成功仍然很有价值,因为它将模型行为与明确的用户判断联系起来。用户会回答任务是否已完成。与由合成评测器判断单条孤立回答相比,这一信号更接近实际价值。

Pro 在开放模型子集中的排名接近前列,表明用户注意到了这一代际改进。这也支持了小米的说法:V2.6 的训练目标是智能体行为,而不仅仅是对话润色。

小米表示,其在编程、通用智能体、视觉任务和网络安全领域采用了混合强化学习。强化学习通过模型行动及其结果所产生的奖励信号来训练行为。小米还称,来自多个测试框架的任务被混合进同一训练过程。

这种设计旨在让策略能够跨环境迁移。智能体可能学会在行动前检查证据、在命令失败后恢复,或在收到矛盾反馈后修订计划。这些行为可惠及多个任务类别。

Arena 的结果无法识别究竟是哪项训练选择带来了改进。架构、训练数据、强化学习、提示词和服务配置都可能有所贡献。因果追踪隔离的是已部署模型的选择,而不是小米的内部开发决策。

不确定性区间同样值得关注。Pro 的 3.17% 总体估计带有正负 1.64 个百分点的区间;其 7.35% 的已确认成功估计则带有更宽的正负 3.53 个百分点区间。

这意味着中心值并非精确常数。更多会话可能使其发生显著变化。当相邻置信区间重叠时,开放模型排名也可能变化。

Flash 更清楚地说明了这个问题。其 0.57% 的总体估计带有正负 1.44 个百分点的区间。现有数据尚不足以有把握地区分微小正向效果与无效果。

会话总量也是不平衡的另一来源。MiMo-V2.6-Pro 仅有略高于 8,100 次会话,而一些成熟条目拥有数万次会话。较旧模型有更多时间接触多样化用户和困难的边缘情况。

新模型也可能受到选择效应影响。早期用户可能因为好奇、技术水平较高,或本就对小米感兴趣而选择它。Arena 的随机化应能降低部分偏差,但没有任何实时平台能消除用户行为中的所有差异。

任务构成同样重要。擅长代码仓库分析的模型,在任务组合转向电子表格、视觉媒体或长篇研究时,表现可能不同。一个总体排名压缩了这些差异。

更恰当的解读应当更为收敛。MiMo-V2.6-Pro 在数千次真实会话中产生了积极、令人鼓舞的信号。其已确认成功结果表明,提升对用户而言是可见的,而不只是自动评测器所见。

错误的解读则会宣称,Pro 在所有环境中都确定是第五好的开放智能体模型。Arena 并未测试每一种测试框架、部署设置或企业约束。

MiMo-V2.6 排名未能显示的内容

排行榜无法揭示每一种灾难性的边缘情况,而早期现场报告说明了为何总体成功率必须与针对性的可靠性测试相结合。

较高的平均表现可以与罕见故障并存,而这些故障可能使系统不适合敏感工作。智能体工作流会放大这一风险,因为模型可以修改文件、调用外部服务或执行命令。一次未受控制的循环就可能耗尽整个上下文窗口。

9 月 22 日,小米公开代码仓库中的一份报告描述了两款 V2.6 模型的重复工具调用。提交的工具调用问题称,其中一代模型在相似调用间循环,直至接近输出限制。

该报告将这一行为与同一环境中的 MiMo-V2.5-Pro 进行了比较。据报告者称,旧模型完成了一次文档审计,而 V2.6 陷入了工具调用洪泛。该问题仍是一份现场报告,而非受控的独立研究。

但它仍提供了一种值得测试的具体故障模式。智能体在常规任务中可能看似胜任,却在长时间代码仓库审查期间变得不稳定。总体排行榜可能记录到这次糟糕会话,却不会揭示其运营严重性。

另一项报告涉及多模态对话历史。一名用户称,V2.6 有时会在同一对话中出现多张图片后描述较早的一张图片。报告者通过不止一种服务路由复现了该行为。

这些报告并不否定 Arena 的发现。它们回答的是不同的问题。Arena 估计的是多样化会话中的平均行为效应,而可复现的 bug 测试的是一个狭窄的边界条件。

两种形式的证据都必不可少。平均性能有助于买家建立候选名单,故障分析则有助于他们决定某个模型能否获得特定工具和权限。

长上下文尤其值得严格审查。小米宣称两款模型均支持一百万 token 的上下文窗口。较大的窗口让智能体能够保留大量代码仓库、工具轨迹和文档,但也增加了模型必须处理的过时或冲突材料数量。

上下文容量并不等同于上下文可靠性。模型可以在技术上接受很长的提示词,却丢失对最新指令的追踪。它也可能检索错误图片、重复此前计划,或忽略更新后的文件。

多模态智能体带来了另一层风险。文本、截图、视频帧、音频和工具输出都可能进入同一条轨迹。模型必须识别哪些证据是当前的,哪些属于更早的步骤。

企业买家应直接测试这些条件。一项有用的评估应包括重复的工具错误、用户修正、不断变化的文件、多张图片、中断的任务和权限边界。它还应追踪模型是否会在完成所请求工作后停止。

团队应将模型故障与测试框架故障区分开来。重试逻辑可能将一次错误调用变成循环。不佳的状态管理可能使旧观察结果看起来仍是当前信息。过于宽泛的权限则可能将无害的规划错误转化为不必要的操作。

Arena 的因果方法试图在统计上分离组件效应。生产团队仍需要进行轨迹级检查。工程师必须了解所选模型如何与其特定的编排代码交互。

安全敏感型工作负载需要额外控制。模型不应仅因其总体评分提高,就获得不受限制的终端或网络访问权限。沙箱、审批关卡、审计日志和操作限制仍然不可或缺。

因此,小米 MiMo 在 Agent Arena 上的表现支持实验,而非盲目信任。这些模型已值得在真实工作负载下接受更深入测试,但尚未消除对隔离控制的需求。

三项信号将决定小米的提升能否站稳

下一步的判断取决于样本增长、跨测试框架复现,以及小米对可观察可靠性故障的回应。

第一项信号是,MiMo-V2.6-Pro 的正向估计能否在规模大得多的 Arena 样本中持续存在。更多会话应缩小其不确定性区间,并让模型接触更广泛的任务分布。

若中心估计稳定在接近 3.17%,将强化其确有代际提升的论据。若估计下降或排名波动加大,则可能表明早期用户和任务对该模型更有利。

Flash 值得更密切地监测,因为其当前区间跨越零点。它在开放模型中排名第九,作为早期位置具有参考价值,但其统计差异仍然较弱。更大的样本应揭示 Flash 是否能持续创造价值。

第二项信号是其在其他智能体测试框架中的独立表现。Arena 在自身平台内评估编排器。开发者需要来自编程工具、研究工作流、多模态助手,以及采用不同记忆设计的企业系统的证据。

复现将支持小米关于混合训练可在不同环境间迁移的主张。不同测试框架之间的大幅波动,则表明 V2.6 更依赖于提示词和编排细节。

比较应使用完整任务,而不是孤立回答。评估者应记录完成情况、修正、失败命令、重复操作、总输出量和人工审查时间。这些指标能揭示单一准确率评分所遗漏的成本。

第三项信号是,小米是否解决已报告的工具和上下文故障。公开的问题追踪为开发者提供了一种观察报告是否得到修复、可复现测试或服务指导的方式。

提示词变通方案只能提供有限的保证。能够防止问题在不同提供商间复发的模型或运行时变更,将提供更强证据。沉默则会削弱正在考虑授予广泛工具权限的团队的信心。

这些信号比又一次厂商基准发布更重要。小米已报告其在代码智能体、自动化、终端使用、网络安全和视觉任务方面的强劲内部结果。剩下的问题是,这种表现能否在那些测试套件之外保持一致。

同样的标准也应适用于每一个竞争者。专有模型通常较少披露权重和训练信息。开放模型展现更多基础设施选择,但开放性并不能保证行为可靠。

对知识工作者而言,其影响很实际。更好的开放编排器可以支持分析本地文档、代码仓库、会议和内部研究的私有系统,也能降低对单一托管提供商的依赖。

模型只是该工作流的一部分。团队仍需要可靠的采集、检索、溯源和人工审查。可搜索的 AI 知识库可以组织证据,但无法让不稳定的智能体变得安全。

当开放权重、多模态输入和长上下文符合自身需求时,开发者应测试 MiMo-V2.6-Pro。他们应使用自己的轨迹,将其与至少一个成熟开放模型进行比较。

当较低的活跃计算量至关重要时,MiMo-V2.6-Flash 值得评估,前提是团队衡量整体任务行为,而非单次响应速度。重复和修正成本可能抵消表面上的效率优势。

小米 MiMo Agent Arena 的结果改变了讨论方向,因为它们将小米的基准测试声明与真实用户活动联系了起来。V2.6 Pro 现在看起来是一个值得认真看待的开源智能体竞争者。Flash 仍然是一个有趣但尚未完全站稳脚跟的替代选择。

未来一到三个月将显示这些定位是否能够延续。关注会话数量、不确定性区间和问题解决情况,然后直接问一个问题:MiMo 是否能以更少的人工干预完成你的实际工作?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page