top of page

中国 AI 模型包揽 OpenRouter 按 token 用量计算的前五名

8月4日
讀畢需時 14 分鐘

中国 AI 模型包揽了 OpenRouter 月度 token 用量排名的前五个席位,为一则 Google News 标题提供了异常鲜明的竞争信号。据报道,这一包揽局面让 Moonshot AI、DeepSeek、Z.ai 及其国内同行在这个备受开发者关注的平台上领先。

这一结果挑战了一种假设:只要 OpenAI、Anthropic 和 Google 在重大能力评估中领先,它们就必然主导模型采用。开发者越来越多地根据成本、可用性、部署自由度,以及特定工作负载上的表现来选择模型。中国实验室正在这四个维度全面竞争。

不过,这一排名并非全球人工智能使用情况的普查。OpenRouter 衡量的是经由其自身服务转发的活动,而非直接流向 ChatGPT、Claude、Gemini 或私有部署模型的流量。因此,真正的故事范围更窄,却更具影响:在一个开发者可以以相对较低摩擦切换供应商的竞争市场中,中国模型正在胜出。

Google News 标题实际反映了什么

前五名的结果记录了 OpenRouter 使用量的真实变化,但“全球 API 调用”描述的是该平台的观察窗口,而非整个市场。

最初的 Google News 条目指向了一则 8 月 3 日的商业简报,该简报将中国模型称为全球 API 调用量的前五名。其他报道也支持这一核心观察。美联社引用的月度使用量排名同样将中国模型列入 OpenRouter 前五名。

OpenRouter 是一项统一推理服务。它让开发者能够通过一个 API 访问多家公司的模型;API 是软件用于发送请求的标准接口。其排名追踪 token 用量,即作为输入和输出处理的文本单位。

这一指标很有价值,因为 token 消耗反映了实际运行应用中的活动。它超越了基准测试、产品发布和聊天机器人热度调查。一个持续处理大量 token 的模型,很可能已接入应用、实验、智能体或自动化工作流。

OpenRouter 还提供了一个竞争异常充分的环境。开发者无需围绕不同供应商的接口重建每一项集成,便可比较模型。他们可以更改模型标识符、调整提示词、测试结果,并在经济性改善时重新导流。

这种结构使该排名成为衡量开发者选择的宝贵指标,但并不意味着 OpenRouter 等同于全球 API 市场。直接调用模型供应商的请求不在其数据集之内,许多云服务合约和自托管部署也是如此。

这一差异对美国供应商尤为重要。OpenAI、Anthropic 和 Google 通过直接 API、消费者订阅、企业协议和大型云平台分发模型。它们的客户无需通过 OpenRouter 发送请求。

中国开放权重模型则呈现相反的统计问题。开放权重是组织可以下载并在自有基础设施上运行的模型参数。这些私有部署同样不会出现在 OpenRouter 的数据中,因此该平台可能低估双方的采用情况。

因此,这一标题应被理解为一次平台特定的包揽,其影响却更为广泛。它表明,当开发者在同一个市场中面对众多供应商时,中国模型可以占据主导地位。但这并不能证明它们在每一项模型业务、企业部署或消费级产品中都处于领先。

这种解读保留了新闻最重要的部分。一个围绕模型选择设计的市场,正将更多流量导向中国系统。正因为在这里切换比在封闭产品套件中更容易,这一结果才会带来压力。

中国 AI API 用量正成为成本信号

随着智能体软件将推理经济性中的细微差异转化为持续性的运营决策,中国 AI API 用量正在上升。

AI 智能体执行多步骤任务,而非只生成一次孤立回答。一个编程智能体可能检查文件、提出修改建议、运行测试、审查失败结果,然后再次尝试。每一步都可能产生一次新的模型请求和另一批 token。

这种重复改变了采购逻辑。一款在短暂对话中看似价格合理的模型,当软件为单个任务调用数十次时,可能变得昂贵。因此,开发者有充分理由将高端系统留给最困难的步骤。

美联社报道称,分析师认为智能体需求正在提升高性价比模型的重要性。报道还引用了一位商业用户的话称,中国模型在编程、研究、潜在客户开发和销售相关工作中已具备足够能力。

“足够好”在软件运营中并非贬义。它通常意味着产品达到可靠性门槛,同时减少完成重复性工作所需的资源。大多数应用请求并不需要最强的推理模型。

一个客服工作流可能会对请求进行分类、检索文档、总结账户历史并起草回复。只有模糊案例可能需要前沿模型。要求较低的环节因会在每次客户互动中运行,能够产生极其庞大的累计用量。

软件开发中也存在同样的模式。团队可以使用成本较低的模型进行代码搜索、文档编写、测试生成和常规修改。能力更强的封闭模型则可用于架构决策或棘手的调试问题。

中国实验室将这一工作负载机会与开放或开放权重分发结合起来。这种方式使托管公司、云服务和开发者能够通过多个基础设施供应商提供同一模型。竞争随之发生在模型层和托管层。

OpenRouter 与行业合作伙伴开展的研究分析了来自真实模型交互的逾 100 万亿 token。该研究将开放权重采用率上升和智能体推理列为平台活动中可见的主要变化。

研究人员也强调,其数据集属于观察性数据。模型可用性、价格、发布活动和用户偏好都会影响日志中呈现的内容。高 token 用量可能既反映有利的经济性,也反映更强的通用智能。

这一限定有助于解释中国模型的包揽。该排名不必意味着每个领先模型都是适用于每项任务的最聪明选择。它也可能意味着,开发者认为这些模型在可接受质量下适合高用量工作负载。

这仍然构成了对高端供应商的商业威胁。如果应用将常规步骤导向其他地方,最赚钱的模型可能处理更少的 token。供应商或许能够保留困难工作负载,却会失去广泛的常规推理基础。

这种压力也延伸至将模型选择隐藏在客户视野之外的软件公司。它们的工程团队可以在多个供应商之间路由任务,以控制开支。最终用户可能永远不会知道,是哪一个模型总结了文档、生成了元数据或分类了工单。

组织需要了解这些决策。一个可搜索的 AI 知识库可以保存评估、提示词、部署规则和模型选择依据。当供应商、政策或性能水平发生变化时,这份记录就会变得重要。

因此,核心机制并非国家声望,而是自动化推理不断累积的成本。当开发者能够获得足够好的结果,同时让反复的模型调用在经济上可持续时,中国 AI API 用量便会增长。

开放模型正在向封闭的美国平台施压

主要竞争是中国开放权重分发与美国封闭平台控制之间的较量,而不是一个实验室与一个竞争对手之间的对决。

OpenAI、Anthropic 和 Google 围绕托管访问建立了强劲业务。它们最具能力的模型通常仍由公司控制,客户则通过应用、API 或获批准的云合作伙伴与之交互。

中国开发者已将开放权重发布作为核心分发途径。DeepSeek 帮助这一战略在国际上站稳脚跟,而 Moonshot AI、Z.ai、Alibaba、MiniMax、Xiaomi 和 Tencent 则扩大了竞争版图。它们的模型可以通过聚合器和独立基础设施供应商传播。

开放方式减少了多种摩擦。公司可以选择推理运行的位置,查看更多部署栈,并修改周边软件。它们也可以更换托管方,而不一定需要放弃模型。

封闭系统则提供不同的价值主张。其开发者负责管理基础设施、安全控制、更新和集成工具。客户可能获得更强的支持、更清晰的责任界定,以及对表现最优专有能力的优先访问。

OpenRouter 排名揭示了这两种方式之间的张力。在聚合器内部,封闭供应商对展示方式和客户关系失去部分控制。模型与替代方案并列出现,开发者可以在相似条件下比较其输出。

这种环境奖励分发灵活性。一款被广泛托管的开放权重模型可以在不同地区和供应商间持续可用。如果一个端点变得拥堵,软件可以将请求路由至其他位置,同时维持应用的基本行为。

Axios 报道称,美国企业已经在考虑中国模型的安全部署。其成本与安全分析指出,将模型托管在美国基础设施上,是将模型来源与数据位置分离的一种方式。

这种分离并不能消除所有担忧。但它说明,简单的“禁止或购买”框架忽略了模型分发的实际运作方式。权重、托管公司、应用运营商和底层云服务可能分别属于不同组织。

这种灵活性从两个方向向美国实验室施压。它们必须证明其最强模型所附加溢价的合理性,也必须为围绕前沿任务的大量常规请求提供经济型选择。

这些实验室拥有可用工具。它们可以发布更小的模型、改进缓存、提供批处理、优化智能体工作流,或推出更多开放产品。它们也可以深化集成,使其平台更难被替代。

然而,更强的集成可能会强化封闭平台的取舍。开发者获得便利,同时也接受对单一供应商工具、政策和模型路线图的更大依赖。当这种依赖变得令人不安时,开放权重采用提供了一条退出路径。

竞争历史同样重要。DeepSeek 的国际崛起表明,一次中国模型发布就能立即引发关于模型经济性的讨论。美国公司随之推出了价格更低的产品和更强的推理模型。

当前的包揽局面表明,这种回应并未终结挑战。中国实验室持续发布模型,开发者持续测试它们,而聚合器让替换变得更容易。由此产生的压力如今已跨越多个模型系列,而非仅来自一次意外发布。

这正是排名背后的逆转。美国公司仍在很大程度上主导前沿讨论,但在一个围绕可选性构建的市场中,中国系统领跑了可见的使用榜单。

OpenRouter 排名无法证明什么

OpenRouter 排名证明的是模型在 OpenRouter 上的受欢迎程度,而非普遍的技术领先地位、企业信任度,或在整个 AI 经济中的主导地位。

这一限制应当影响对 Google News 相关说法的所有解读。根据其研究,OpenRouter 服务着数百万开发者和用户,但其用户群体仍具有自我选择性。偏好直接 API 的客户不会进入这项比较。

面向消费者的订阅服务也形成了另一处盲区。用户通过官方应用使用 ChatGPT、Claude 或 Gemini 时,可能产生大量活动,却不会形成 OpenRouter 流量。大型组织也可能通过协商达成的云服务安排购买访问权限。

Token 量本身并不等同于收入、用户数或已完成任务数。某个模型可能生成更长的输出、经过更多内部推理步骤,或服务于上下文特别庞大的应用。这些特征会提高其 token 数量,却不一定意味着更广泛的采用。

免费访问和限时促销同样可能改变排名。开发者往往会大规模测试新上线的模型,尤其是在聚合平台降低实验成本时更是如此。上线初期的激增并不会自动转化为持久的生产需求。

不同模型家族可能具有不同的使用特征。角色扮演、编程、翻译、搜索和自动化代理消耗 token 的方式各不相同。将它们合并的排行榜能够展示总体活动,却会掩盖究竟是哪些工作负载促成了这些数据。

OpenRouter 的研究明确将其记录描述为观察性数据。作者指出,可用性、价格和用户偏好都会影响结果。这对于研究市场行为是一项优势,但在提出普遍性结论时则构成约束。

技术领导地位同样尚无定论。美联社报道称,Arena CEO Anastasios Angelopoulos 认为中国模型已是严肃的竞争对手,但在整体能力上仍落后于美国领先者。

一个模型可以在使用量上位居第一,却在高难度评测中落败。反过来,基准测试领先者也可能因为价格过高或限制过多,不适合常规生产工作。市场正在将极限能力与大规模实用能力区分开来。

可靠性又增加了一层考量。代理必须遵循指令、正确调用工具、从错误中恢复,并在长任务序列中保持一致。一次令人信服的演示,并不能证明它能在数千次生产运行中保持这种表现。

成功发布后,容量可能成为问题。美联社报道称,Moonshot AI 的 Kimi K3 需求推动该公司暂时暂停新增订阅。受欢迎既能验证需求,也能迅速暴露基础设施限制。

Kimi 采用数据还显示,其在 7 月发布后下载量显著增长。下载量反映兴趣,但无法说明留存率、付费转化或持续的企业使用情况。

安全和治理仍是严肃障碍。企业需要知道提示词会流向何处、哪家供应商会保留数据、会产生何种日志记录,以及模型是否能满足合同要求。答案取决于部署方式,而不只是模型的原产国。

监管风险同样取决于具体部署。在受控环境中运行下载的权重,与将专有数据发送至外部端点并不相同。采购团队必须评估完整链路,而不能将所有访问方式视为相同。

模型在政治敏感议题上的行为也值得测试。组织应依据自身要求评估拒答模式、事实一致性和潜在偏见。美国、中国和欧洲系统都应接受同样的审查。

这些限制都不会让前五名的结果失去意义。它们界定了证据能够支持什么结论。OpenRouter 显示,中国模型已在一个庞大、易于切换的开发者活动细分市场中变得极具竞争力。

审慎的结论比笼统的说法更有力。中国模型提供商已不再依赖基准测试宣传来获得关注。在一个替代方案始终唾手可得的平台上,它们正在处理大量真实工作负载。

为什么“足够好”会重塑 AI 采购

这一排名之所以重要,是因为当有能力的模型成为可互换组件、而非永久的平台承诺时,采购方式就会发生改变。

企业 AI 决策过去围绕选择战略供应商展开。团队期望一家提供商同时提供聊天机器人、API、安全控制与未来的模型改进。模型的快速迭代削弱了这一假设。

模型路由器让应用能够为不同任务分配不同系统。简单的信息提取可以交给一个模型,代码生成交给另一个模型,敏感推理则交给内部托管的选项。应用成为稳定层,而底层模型可以轮换。

这种架构有利于易于测试和替换的供应商。开放权重模型符合这一要求,因为组织可在兼容的托管环境之间迁移它们。更广泛的分发也降低了对单一 API 运营商的依赖。

这种方法也有成本。团队必须维护评估体系、观察故障、管理提示词,并调查行为变化。切换模型比重建应用更容易,但很少毫不费力。

Axios 的一个案例描述了一家公司迁移至中国模型的过程:耗时数月,所需工程工作也超出预期。这一经历提醒人们,不应将排行榜变动视为企业即时转换。

运营工作包括建立基准。团队需要具有代表性的任务、预期输出、可接受的错误率、延迟限制和安全要求。通用基准测试无法取代这些针对工作负载的测试。

开发者还必须评估工具调用能力。一个能够写出流畅文字的代理,在格式化结构化数据或调用外部服务时仍可能失败。微小的错误差异会在长自动化流程中被放大。

知识密集型任务则将检索质量纳入考量。模型必须先获得正确的源材料,才能给出可靠答案。与追逐每一次排行榜变化相比,组织往往能从改善上下文与评估中获得更多收益。

严谨的知识工作流可以帮助团队将内部证据与 AI 生成的分析连接起来。它也让模型比较更容易,因为每个候选模型都能获得更一致的信息基础。

采购负责人应区分四个常被混淆的问题。

能力

  • 模型是否满足该工作负载的准确性与推理要求?

  • 它在多步骤任务和工具调用中是否仍然可靠?

经济性

  • 该工作流会消耗多少持续性的推理资源?

  • 路由、缓存或更小的模型能否降低这一负担?

控制权

  • 组织能否选择托管地点和基础设施提供商?

  • 如果可用性发生变化,组织能多快替换模型?

风险

  • 哪些数据会离开组织?

  • 链路中的每一家提供商需要满足哪些法律、安全和政策要求?

中国模型可以在前三个类别中胜出,却未必能满足每位买家的第四项要求。闭源美国模型则可能在治理、支持或极限能力比运营效率更重要时获得溢价。

这会形成一个细分市场,而非一个永久冠军。初创公司和独立开发者可能更看重成本与灵活性。受监管企业则可能将敏感工作保留在获批平台内,同时在其他场景采用替代模型。

《大西洋月刊》将 GLM-5.2 描述为对昂贵美国 AI 代理发起更广泛挑战的一部分。其代理经济性分析还指出,美国提供商拥有回应所需的时间和资源。

这种回应很可能聚焦于当前正在流向更廉价替代方案的工作负载。闭源实验室可以缩小经济性差距,将模型与软件捆绑,或提高其最强系统的效率。它们也可以强调安全与治理作为差异化因素。

中国实验室也面临自身考验。它们必须将关注度转化为可靠容量、开发者支持和持久的国际分发能力。在需求高峰期间不可用的热门模型,无法支撑关键生产系统。

因此,OpenRouter 的横扫标志着采购竞争的开始,而非终结。它为买家提供了议价能力,并迫使每家提供商说明为何特定工作负载应继续留在其平台上。

Google News 读者接下来应关注什么

三个信号将表明,这次前五名横扫代表的是持久采用,还是 OpenRouter 流量的暂时集中。

第一个信号是上线热度消退后的排名留存。如果相同的中国模型家族能在多个发布周期中持续位居前列,月度 token 领先就更具意义。若排名迅速逆转,则可能表明促销、试验或某个热门应用抬高了结果。

读者应同时关注 token 份额与工作负载构成。编程、代理和业务自动化中的稳定使用,会增强结构性采用的论据。若高度集中于单一娱乐或实验类别,则会削弱更广泛的商业主张。

第二个信号是 OpenAI、Anthropic 和 Google 的回应。仅仅推出更便宜的模型,就足以证明中国竞争正在影响经济性。更开放的分发方式或更大的托管灵活性,则表明压力已触及闭源平台战略本身。

性能提升同样重要,但应以实际任务为衡量标准。如果美国提供商在复杂代理方面保有明显优势,买家就可以合理地选择性使用它们。如果质量差距进一步缩小,将更多工作路由至其他地方就会更容易。

第三个信号是在正式治理框架下的企业部署。云服务商、软件公司和受监管企业的公告,将揭示中国模型能否超越开发者试验阶段。

在美国或欧洲基础设施上的安全部署尤其具有意义。这将表明买家能够将模型权重的来源与数据处理地点分离开来。基于合规原因的拒绝则会指向相反方向。

容量将影响所有三个信号。Moonshot AI 及其他提供商必须在没有长期限制的情况下满足需求。可靠的托管合作伙伴可以提供帮助,但组织仍需要可预测的模型版本和明确的运营支持。

政策同样可以迅速改变市场。对模型访问、托管或采购的限制,可能会尽管经济性有利仍放缓采用。聚焦数据所在地的规则,反而可能有利于对可下载权重进行受控部署。

在整场讨论中,排名方法论应保持可见。OpenRouter 发布基于使用量的数据,其排名数据集按每日 token 总量追踪领先的公开模型。这种透明度使分析人士能够跟踪变化,而不把单一快照视为永久结论。

对开发者而言,实际行动很直接:至少选择一款中国开放权重模型和一款领先的闭源模型,对具有代表性的工作负载进行测试。记录质量、延迟、故障表现、托管地点和运维投入。

对企业采购方而言,应询问哪些模型已部署在组织所用软件的底层。供应商可能会动态路由请求,而不会向每位用户展示底层提供商。治理不能止步于采购订单上的产品名称。

对知识工作者而言,模型多样性带来了评估难题。只有当人们能够将结论追溯至可靠的内部资料时,更快或更便宜的输出才有价值。无论最终响应由哪种模型生成,都应让源记录保持独立。

Google News 呈现了一个引人注目的竞争结果,但其意义仍将由未来三个月决定。应关注 OpenRouter 使用量是否持续、美国厂商的回应,以及受治理约束的企业部署情况。这些信号共同将揭示:中国 AI 模型究竟是在赢得一个平台时刻,还是正在改变模型市场本身。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page