Xiaomi MiMo 登顶 OpenRouter,中国模型包揽周榜前五
- Olivia Johnson
- 1天前
- 讀畢需時 13 分鐘
据报道,Xiaomi 的 MiMo-V2.5 在一周内处理了 10.5 万亿个 token,领跑 OpenRouter 榜单,而前五名全部由中国模型占据。
这一包揽格外重要,因为 OpenRouter 衡量的是路由使用量,而非基准测试胜负或聊天机器人下载量。开发者通过该平台的统一接口,可将请求发送至不同模型和基础设施提供商。
因此,这一结果反映的是一个切换成本低、使用量可衡量的特定市场。它也对 OpenAI、Anthropic 和 Google 的高端模型构成了压力。
根据一份周榜报告,MiMo-V2.5 较前一周增长了 12%。两款 DeepSeek 模型分列第二和第五。
Tencent 新近发布的 Hunyuan 模型位居第三,Zhipu AI 的 GLM 系列据报道排名第四。Tencent 的模型在近期发布后录得最快的增长。
这一结果并不能证明中国模型领先整个全球 AI 市场。OpenRouter 只是一个大型聚合平台,并不涵盖所有直连 API、企业合同或面向消费者的助手。
但它确实说明了一个更具体、同样重要的事实:对于按工作负载、性能和运营效率选型的开发者而言,中国开放权重模型已成为默认候选项。
OpenRouter 前五名的变化速度快于市场叙事
本周最大的变化并不只是 MiMo 登顶,而是所有领先位置都集中在由中国开发的模型之中。
据报道,该排名统计周期为 2026 年 7 月 20 日至 7 月 26 日。MiMo-V2.5 以约 10.5 万亿个路由 token 和 12% 的周增长率领跑。
DeepSeek V4 Flash 紧随其后,处理量约为 6.37 万亿个 token。Tencent 的 Hunyuan Hy3 据报道以约 3.94 万亿个 token 排名第三。
Zhipu AI 的 GLM 5.2 以约 3.29 万亿个 token 位居第四。DeepSeek V4 Pro 则完成前五,使 DeepSeek 有两款不同模型入榜。
这些名次不只是热门品牌的名单。它们代表了在同一开放模型市场中相互竞争的多种产品策略。
MiMo-V2.5 面向多模态和基于智能体的工作负载,结合了文本、图像、工具和扩展任务状态。其模型页面称其拥有 100 万 token 的上下文窗口。
OpenRouter 将该模型列为原生全模态系统,这意味着它可在同一架构中处理多种输入格式。平台记录的发布日期为 2026 年 4 月 22 日。
MiMo 模型页面还强调了智能体性能和长上下文处理能力。这些特性与会产生大量 token 的工作负载相契合。
自动化编程智能体可以阅读代码仓库、修改文件、调用工具并审查自身输出。单个任务消耗的 token 可能远高于一次聊天机器人回答。
DeepSeek 的两个席位展现了另一种策略。Flash 模型服务于高频、重视效率的请求,而 Pro 模型则面向更困难的编程和智能体任务。
这种搭配让开发者能够将常规工作和高要求推理分别路由到同一模型家族中的不同模型。它更像一条产品线,而不是单一通用端点。
Tencent 的崛起又增添了一层变化。据报道,Hunyuan Hy3 于 7 月 6 日开放后,其周增长超过了 999%。
如此高的百分比通常反映了从较小起点开始的增长。不过,即便存在初始基数效应,要跻身前三,仍需要相当可观的绝对流量。
实时模型排名会随着新的请求进入统计窗口而变化。因此,任何公开快照都应注明日期和平台范围。
这一差别可避免产生误导性的结论。这些数字描述的是经由 OpenRouter 路由的 token,而不是各公司在全球范围内处理的全部 token。
直接流向厂商 API 的流量不在这份特定排名之内。私有部署及运行在客户基础设施上的模型也大多不可见。
即便有这些限制,这次包揽仍然分量十足。使用中立路由层的开发者,将五款中国模型列为其总体使用量最高的模型。
这比短暂的社交趋势更具信号意义。每一个被路由的 token,都代表某个应用、实验、智能体或用户会话选择了一款模型来完成实际工作。
为什么开发者正将更多工作路由到中国模型
快速采用反映出一种运营优势:开发者可以迅速测试这些模型,并保留那些能够以规模化方式交付可接受结果的模型。
OpenRouter 降低了更换模型所需的工作量。应用可以维持一套集成,同时将请求发送至多个模型家族或托管服务提供商。
这种结构削弱了大型 AI 厂商所拥有的一项传统优势。当另一款模型具备竞争力时,开发者无需重构整个产品。
在最新包揽之前,平台的历史数据已经显示了这种行为。中国开放模型在 2024 年末时所占份额还非常小。
OpenRouter 的使用研究发现,中国开源模型在 2025 年的某些周内占据了平台近 30% 的 token 用量。
在研究期内,它们的平均周份额约为 13%。DeepSeek 仍是最大的开放模型贡献者,而 Qwen 和较新的模型家族则扩大了竞争范围。
该报告还发现,有能力的开放模型能够在数周内获得显著流量。这一规律有助于解释 Hunyuan Hy3 发布后 Tencent 据报道的增长。
频繁发布为开发者重新评估路由决策提供了更多理由。每次发布都可能提升某项能力、降低延迟,或支持更长的上下文。
开放权重进一步扩大了分发范围。它们允许独立服务商托管同一模型,尽管许可条款和技术要求仍各不相同。
这在两个层面形成竞争。模型开发者围绕架构和训练竞争,而基础设施提供商则围绕可用性和服务质量竞争。
用户无需运营自己的集群,也可以受益于这种结构。他们可以选择托管版本,同时保有比单一厂商应用更高的可移植性。
最强劲的需求似乎与编程和智能体工作流相关。OpenRouter 的研究发现,编程请求占 token 的比例从约 11% 增长到一半以上。
这一统计覆盖的是研究中较近几周,而非 2026 年 7 月的排行榜。不过,它解释了为什么面向代码的模型能够积累巨大的 token 总量。
编程智能体会反复检查文件、比较输出并修订计划。长提示词还会包含代码仓库上下文、错误日志、文档和先前尝试。
一次人工请求可能触发数十次模型调用。因此,token 用量的增长速度会快于使用应用的人数增长。
中国模型一直围绕这种不断变化的工作负载进行设计。DeepSeek 强调编程和推理,而 MiMo 将长上下文与多模态处理结合起来。
Tencent 也将 Hunyuan 定位为涵盖文本、图像、视频和三维内容的模型家族。这种广度支持内部产品和外部开发者使用。
由此形成了由多家资金雄厚的公司推动的密集发布周期。Xiaomi、Tencent、DeepSeek 和 Zhipu AI 并不依赖同一个组织或商业模式。
它们同时上榜,降低了该排名仅反映某家公司孤立营销活动的可能性。开发者正在将流量分散到多个中国模型家族。
不过,低切换摩擦是一把双刃剑。那些迅速采用 MiMo 或 Hy3 的用户,也可以在另一款模型表现更好时离开。
OpenRouter 早先的分析称,开放模型市场正变得愈发碎片化。没有任何单一开放模型能持续控制超过约四分之一的开放模型流量。
这使得周榜领先很有价值,但也很脆弱。持续使用比发布时的激增更重要,尤其是在免费访问或初始路由激励结束之后。
真正的竞争是开放路由对抗封闭模型锁定
核心冲突并非中国对美国,而是可移植的模型路由对单一专有模型技术栈的依赖。
模型的国别来源让这次前五包揽在政治上格外引人注目。然而,开发者通常会通过更务实的比较作出路由决策。
他们会问:模型能否可靠地完成任务、适配所需上下文、正确调用工具,以及在应用的资源限制内运行。
OpenRouter 让这种比较可以立即进行。一个团队可以将一种模型用于规划、另一种用于实现、第三种用于最终审查。
这种多模型设计直接挑战了这样的观念:每个 AI 应用都应继承单一厂商的完整技术栈。它将应用与底层模型分离开来。
OpenAI、Anthropic 和 Google 仍拥有重大优势。它们的专有系统通常在高难度评测中领先,并提供成熟的企业控制、集成和支持。
根据 OpenRouter 的历史研究,Anthropic 在编程相关支出方面也保持了强势地位。Claude 仍是高要求编程工作的参照标准。
Google 将 Gemini 模型与云基础设施、生产力软件和消费者分发结合起来。OpenAI 则将其模型连接到庞大的开发者基础和 ChatGPT。
中国开放权重模型在另一个层面施加压力。它们通过更多托管方提供可接受的性能,并鼓励在应用层进行实验。
这种压力在高用量、可重复评估的工作负载上最为明显。编程流水线可以运行测试、比较补丁,并自动拒绝错误输出。
企业仍可能为关键的最终决策选择高端专有模型。它可以通过另一款模型处理文档准备或重复性分析。
DeepSeek 的 Flash 与 Pro 组合符合这一模式。Flash 可以处理高频任务,而 Pro 则可应对需要更深层推理的请求。
MiMo 的长上下文提供了另一条路径。开发者可以向一个模型提供更多源材料,而不必为每个请求都构建复杂的检索链。
长上下文窗口并不保证准确回忆。它只是提高了应用能够在一次请求中提供的材料量。
这一差别对构建知识密集型智能体的团队很重要。更多上下文可以减少集成工作,但无关材料仍可能让模型困惑。
因此,良好的系统仍需要评估、可追溯性和有组织的源材料。一个可搜索的工程知识库可以支持这些检查,而无需决定必须由哪种模型处理内容。
更广泛的转变有利于模型无关型软件。这类应用将模型视为可替换组件,同时保留数据管道、权限和用户体验。
这种设计限制了厂商锁定,但也带来了新的工程责任。团队必须比较输出质量,并监控多个提供商之间的变化。
它们还必须应对工具模式、安全行为、上下文处理和结构化输出方面的差异。共享接口并不意味着每个模型都完全相同。
OpenRouter 的横扫结果表明,许多开发者愿意接受这些成本。他们已将足够多的工作路由至中国模型,使五款中国模型同时登上周榜前列。
对专有模型厂商而言,被迫做出的回应很明确:它们必须通过更高的可靠性、更强的集成能力,或在高价值任务上可衡量的优势,来证明限制访问的合理性。
当开发者几分钟内就能测试另一款模型时,品牌认知本身的保护作用会减弱。闭源厂商需要拿出经得起直接工作负载对比的结果。
Token 使用量不等于营收、质量或信任
该排行榜衡量的是单一平台上的使用量,因此无法独立证明技术领先地位、商业成功或企业认可度。
Token 总量会奖励那些产生长提示词和长回复的工作负载。Agent 循环、角色扮演会话、代码库分析和合成数据生成,都可能主导原始使用量。
来自自动化任务的一万亿 Token,并不等同于来自受监管商业决策的一万亿 Token。这些请求所承载的价值与风险并不相同。
免费访问也可能扭曲排名。一款新发布的模型可能吸引大量试用,因为尝试它几乎不需要付出承诺成本。
Hunyuan Hy3 报告中超过 999% 的增长便说明了这个问题。这一增长值得关注,但其起点必然要小得多。
要证明这是持久转变,模型必须在发布热度消退后仍能留住流量。周度总量应在多个滚动时间窗口中持续保持高位。
另一项限制在于集中度。一个大型客户或应用就可能对全平台图表产生实质影响。
OpenRouter 在其历史分析中承认了这一效应。2025 年 5 月,一个规模较大的账户在与工具相关的使用量中造成了明显峰值。
这个例子并不会否定当前排名,但它说明观察者不应直接将 Token 排行榜等同于全球市场份额。
最准确的说法更为有限:在 OpenRouter 报告的一次周度快照中,中国开发的模型占据了前五个位置。
质量同样难以从中推断。开发者选择某个模型,可能是因为它足以完成任务,而非因为它能提供当前最优的输出。
一个能够处理常规分类任务的模型,可能生成比用于高难度科学分析的专业模型更多的 Token。使用量和能力回答的是不同问题。
对于公司的基准测试主张,也应保持类似谨慎。据报道,DeepSeek 将其旗舰模型定位为可在代码和复杂 Agent 任务上与领先闭源系统竞争。
这些说法需要在真实代码库、工具故障和长时间运行的工作流中接受独立评估。单一基准分数无法涵盖所有生产环境限制。
MiMo 所列的上下文长度也需要进行实际测试。模型可以接受很长的输入,却仍可能无法检索到埋藏其中的关键细节。
延迟、速率限制和服务商可靠性同样会影响采用。一款应用在需求高峰期间需要的是可预测的性能,而不只是强大的模型架构。
安全性仍是独立的决策因素。一些组织会限制特定模型供应商或托管地区,因为提示词可能包含机密材料。
当客户在受控基础设施内部部署模型时,开放权重可以缓解这一担忧。不过,通过第三方 API 使用开放模型,仍会形成数据关系。
开发者必须审查实际服务商、数据保留政策、日志行为以及地理处理路径。模型的原产国本身并不能单独回答这些问题。
许可问题同样值得关注。“开源”常被宽泛地用于描述那些在特定限制下提供权重的模型。
OpenRouter 为简化表述,也将开放权重模型简称为 OSS。买方在分发或修改模型前,仍应审查许可证。
受监管企业可能仍会偏向拥有成熟合规文档的专有系统。即使开放模型在 Token 使用量上领先,这一选择也可能持续存在。
面向消费者的覆盖范围同样未被纳入。ChatGPT、Gemini 及其他第一方产品在 OpenRouter 之外也产生了大量活动。
直接企业协议构成了另一处盲区。大型公司通常通过云服务合同访问模型,而不是公共聚合平台。
因此,该排名描述的是市场中可竞争的一层。它展示了在开发者能够以相对低的转换成本比较模型时会发生什么。
这一层很重要,因为它可能影响未来采购决策。一个最初通过聚合平台测试的模型,之后可能转入直接托管或私有部署。
不过,7 月的横扫应被视为采用信号,而不是最终结论。它传递出的最强信息,是开发者愿意切换模型。
Xiaomi、DeepSeek 和 Tencent 接下来必须证明什么
三项信号将决定这次前五名横扫究竟标志着持久变化,还是又一个快速变化的排行榜周期。
第一项信号是留存。MiMo-V2.5、DeepSeek V4 Flash、Hunyuan Hy3、GLM 5.2 和 DeepSeek V4 Pro 必须在发布窗口之外保持可观流量。
滚动四周和季度总量将比单周快照提供更清晰的视角。稳定的流量将表明它们已被整合进持续运行的应用。
如果流量大幅下降,则可能指向试验性使用、暂时性的访问条件,或迁移至更新的模型。开放路由使采用和流失都异常迅速。
MiMo 值得特别关注,因为据报道它以较大优势领先。如果开发者持续使用其多模态和长上下文功能,它的地位将得到巩固。
第二项信号是工作负载质量。独立评估应在完整的编码和 Agent 系统中测试这些模型,而不只是使用孤立的基准提示词。
有价值的测试应衡量成功的工具调用、完成的代码库、错误恢复能力以及长任务表现,同时披露基础设施和评估方法。
DeepSeek V4 Pro 在这里面临最明确的检验。其报告中的定位取决于它能否以接近领先闭源模型的水平处理复杂 Agent 工作。
如果这些结果能在独立团队中复现,专有厂商将在高价值工作负载上面临直接压力。如果不能,使用量仍将只是效率层面的故事。
Tencent 的 Hy3 在迅速发布后也需要接受同样审视。只有当开发者发布可重复的生产结果时,发布驱动的上涨才更具意义。
第三项信号是 OpenAI、Anthropic 和 Google 的反应。它们的应对将显示,它们是否将开放模型路由视为战略威胁。
应对可以采取多种形式,而无需聚焦于公开价格数字。厂商可以改进小型模型、扩展上下文、增强工具使用能力,或放宽部署选项。
它们也可以深化企业集成,而合规性和支持仍是更强的防线。即使原始 Token 份额发生转移,更高的可靠性也可能保住高端需求。
OpenRouter 自身的数据支持这种分化的市场格局。其研究发现,开放模型集中于低成本、高使用量场景,而闭源系统仍保留着高价值工作负载。
最新的横扫结果表明,中国开发者正在高使用量市场的一侧向上移动。尚未解决的问题是,有多少高端工作会随之转移。
因此,开发者不应仅凭一张图表选出赢家。他们应根据自身任务测试模型,并保留重新路由的能力。
一项务实的评估应从具有代表性的提示词、预期输出和失败条件开始,并纳入延迟、工具完成情况、上下文检索和人工审核。
团队还应记录每项输出由哪个模型生成。当服务商更新模型或路由配置时,这一追踪记录将变得至关重要。
知识工作者面临着相关问题。随着应用混合使用多种模型,他们需要一个稳定的地方存放源文件和经过验证的决策。
个人知识系统可以在应用底层模型不断变化时保留这种连续性。
据报道,OpenRouter 的这次横扫之所以重要,是因为它展示了开发者正在根据选择采取行动。中国模型并非只是进入了比较范围。
据报道,它们在一个主要多模型市场中连续一周占据了所有领先位置。Xiaomi、DeepSeek、Tencent 和 Zhipu AI 都对此结果作出了贡献。
然而,下一阶段将比攀登实时图表更难。这些公司必须将试验性使用转化为留存的工作负载、值得信赖的部署和可重复的性能。
OpenAI、Anthropic 和 Google 仍拥有分发能力、企业关系和强大的专有模型。它们承受着压力,但并未从全球 AI 使用中消失。
持久的变化在于,自动化的模型忠诚度正在削弱。开发者越来越将 AI 模型视为一个必须持续赢得路由资格的组件。
关注接下来数个周度窗口、独立 Agent 评估以及闭源厂商的回应。这些信号将共同揭示,这次横扫是否会演变为持久的市场转变。