中国开放权重 AI 模型领跑使用量,美国战略承压
尽管美国曾率先领先,中国的开放权重 AI 模型如今已占据某个大型开放模型平台逾 80% 的模型使用量。研究员 Nathan Lambert 最近向一批国会议员及其工作人员指出了这一逆转。他传递的信息令人不安:中国实验室并非只是靠复制美国系统来追赶。它们已经建立起更快的发布周期、更强的分发能力,以及相对美国开放模型不断扩大的领先优势。
这些数字并不意味着中国模型主导了全球人工智能使用的所有形式。OpenAI、Anthropic 和 Google 仍在运营领先的专有系统,而大量企业流量依然处于私有环境。现有数据反映的是在日益重要的开放权重市场中的主导地位;开发者可以下载或调整模型的已训练参数。
这一差别很重要,但并不会让这一逆转显得无足轻重。Meta 的 Llama 曾定义了这个市场。如今,Alibaba 的 Qwen、Moonshot AI 的 Kimi、Z.ai 的 GLM 和 DeepSeek 支撑了其中大量使用与研究。国会必须判断,这一转变究竟反映了不公平的能力攫取、更强的执行力,还是美国开放模型战略的结构性失败。
在开发者可自由切换的领域,中国开放权重 AI 模型已取得领先
最明确的变化并非某一项基准测试的胜利,而是开放模型活动日益集中于中国实验室构建的系统。
知名开放模型研究员、American Truly Open Models 项目联合作者 Lambert,于 9 月 21 日发布了其为国会准备的发言稿扩展版。他的开放模型评估称,自大约 2025 年 4 月以来,中国企业一直引领开放权重类别。
开放权重模型会提供其训练参数,供下载或下游使用。这使开发者能够检查、修改、微调模型,并在自己控制的基础设施上运行模型。但它未必属于开源模型,因为开发者可能不会公开训练数据、训练代码或复现模型所需的其他要素。
闭源模型的运作方式不同。OpenAI 和 Anthropic 等公司的领先系统通常通过托管应用或应用程序编程接口提供访问。客户可以使用其能力,但无法下载底层模型或独立运行它。
美国曾通过 Meta 的 Llama 系列建立起开放权重的早期商业范式。Google 随后推出了 Gemma,Nvidia 和数家较小实验室也发布了各自的替代方案。随着中国实验室更频繁地推出更强模型,这一地位已被削弱。
Lambert 截至 9 月 14 日的基准快照显示,Z.ai 的 GLM-5.3、GLM-5.3-Flash 以及 Moonshot AI 的 Kimi K3,在 Artificial Analysis Intelligence Index 上分别获得 45、42 和 44 分。他比较中的领先美国开放模型得分则介于 23 至 26 分之间。
这些分数并不是衡量模型质量的通用标准。它们综合了模型在选定评测中的表现,也可能更有利于针对热门、可量化任务优化的模型。不过,差距的规模和持续性,使其很难被简单视为测试伪象。
分发数据也指向同一方向。Lambert 估计,中国开发的模型在 Hugging Face 上累计下载量达到 32 亿次,约为美国总量的两倍。他表示,自 2025 年 7 月中国首次超过美国以来,其下载量领先优势已扩大至约 16 亿次。
OpenRouter 提供了另一种视角。该服务在众多托管模型之间路由请求,因此对希望比较或切换系统的开发者颇具参考价值。Lambert 表示,该平台每周的开放模型流量已从 2025 年 9 月约 1 万亿 token 增长至约 80 万亿 token。
中国模型在这部分开放模型流量中的份额,已从约 70% 升至超过 80%。Mozilla 另行发现,按 8 月 token 量计算,OpenRouter 使用量最高的十个模型中有七个为中国构建的开放权重模型。其开源 AI 报告还发现,当月一款开放模型首次在该平台的每周请求量中位居第一。
OpenRouter 并非整个 AI 经济体。其用户更愿意测试替代方案,许多客户则通过 OpenRouter 无法观察到的直接合同使用美国闭源模型。私有部署也依然大多不可见。
若不加这一限定便将这些数字称为“全球使用量”,会夸大证据所能支持的结论。但一个更审慎的结论依然意义重大:中国开放权重 AI 模型主导了开放模型实验和路由推理最显眼的市场。
而这恰恰是开发者能够以更少合同障碍比较模型的领域。当品牌忠诚度、捆绑软件和直接企业协议的影响较小时,由此产生的选择揭示了市场会发生什么。
美国的开放模型劣势如今已成为商业问题
中国模型的采用正在给美国开放模型开发者施压,但也为已经基于这些系统进行开发的美国企业带来了政策冲突。
竞争问题不止于模型排行榜。Lambert 列举 Harvey、Cursor、DoorDash、Airbnb 和 Perplexity 等公司,称它们正在使用或基于中国模型系列进行开发。其应用覆盖法律工作、软件开发、客户服务和研究等领域。
这些公司的架构和风险状况各不相同。通过托管接口使用模型,与将模型下载至受控环境中并不是一回事。这两种方式都不必然意味着敏感客户信息会传给中国提供商。
但更广泛的模式依然值得关注。开发者之所以选择 Qwen、Kimi、DeepSeek 和 GLM,是因为这些模型系列在能力、灵活性、速度和较低运营成本之间提供了实用组合。这些优势在需要反复调用模型以完成多步骤任务的 AI 智能体中尤为重要。
当一个智能体要进行规划、编写代码、检查结果并重试失败步骤时,推理成本的微小差异会不断累积。开放权重模型还可以针对特定工作流进行微调,或部署在客户选定的基础设施上。
这种控制力吸引了担忧供应商依赖的公司。闭源模型供应商可以改变使用政策、撤回模型、调整访问权限,或限制某些请求。已下载的权重无法被远程从已经存有它们的机器中撤回。
Mozilla 的开发者调查反映了这一取舍。在其样本中,开放模型覆盖的开发者多于闭源模型,但进入生产环境的频率较低。受访者反复提到基础设施开支、安全性、合规、维护、部署复杂性和有限支持等障碍。
闭源提供商打包了更多这类运营要求。它们通常提供合规文档、托管安全服务、服务保障,以及客户可以追责的对手方。运行开放模型则将更多责任转移给采用者。
因此,中国开放权重 AI 模型并不会赢得每一项采购决策。当可移植性、定制化、吞吐量或供应商独立性比打包式治理更重要时,它们便更具吸引力。
它们的研究影响力可能更难逆转。Lambert 扫描了 arXiv 上五个高频使用的机器学习类别中的论文。他的分析发现,Qwen 出现在约 30% 的近期论文中,而 Llama 约为 21%。
超过 40% 的论文提及至少一个中国开放权重模型,而约 30% 提及一个美国模型系列。具体比例可能随模型定义和抽样选择而变化。但这一趋势仍表明,Qwen 已成为核心研究基础设施。
研究采用会形成强化循环。学生和实验室围绕可访问的模型开发工具。这些工具降低了未来实验的成本,从而促成更多论文、集成方案和受过训练的从业者。
企业随后会聘用这些从业者。产品则继承熟悉的库和评测方法。即使不掌控能力最强的专有聊天机器人,一个模型系列也可能成为行业默认选择。
这正是国会面临的不只是传统市场份额争端的原因。限制中国模型可能扰乱美国企业和研究人员;放任市场不受干预,则可能加深对在另一国家法律和战略环境下开发的技术的依赖。
压力最直接地落在那些声称美国能够在保持其最佳系统闭源的同时引领 AI 的美国企业身上。即便开放层迁移到其他地方,专有实验室仍可保持商业成功。但从国家层面看,结果会有所不同,因为开放层会将技能、标准和影响力传播到少数供应商之外。
中国凭借持续发布击败美国开放模型,而非依靠某一种简单手段
核心逆转在于,美国在前沿领域的领先,已不再自动转化为美国在可供所有人检查和部署的模型上的领先。
华盛顿长期高度关注模型蒸馏。蒸馏是利用另一套系统——通常是更强的模型——的输出训练一套系统。这项技术在整个行业中很常见,尽管通过虚假账户或规避访问控制来获取这些输出,会引发另行的法律和安全问题。
众议院国土安全委员会和众议院中国问题特别委员会于 4 月启动了一项联合 AI 调查。调查在审查模型来源、网络安全、数据安全和供应链风险时,点名了 DeepSeek、Alibaba、Moonshot AI 和 MiniMax。
这些委员会还就与中国模型的关联质询 Anysphere 和 Airbnb。其中一封信聚焦于 Cursor 的 Composer 2 依赖 Moonshot 模型的报道,另一封则对 Airbnb 选择 Qwen 用于客户服务工作表示担忧。
议员们认为,未经授权的能力提取可能让外国实验室无需匹配美国在研究或安全保障方面的投入,便可复现有价值的能力。他们还警告,对外国模型的依赖可能使美国用户面临审查、监控或安全风险。
这些担忧值得调查。但它们尚不足以解释整个市场转变。
Lambert 估计,即使能够完全阻止蒸馏,中国与美国闭源前沿之间的距离也只会扩大一到两个月。他的估计尚未得到独立证实,而且大型实验室的训练记录仍不公开。但这一估计挑战了“被窃取的输出足以完整解释现状”的观点。
中国实验室的发布也更频繁。模型评测只能捕捉某一时刻的表现,因此更快的发布节奏让实验室有更多机会吸收新方法并回应用户需求。美国开放模型往往长期不变,而其闭源对应产品则持续进步。
任务选择同样重要。中国开发者集中于智能体编程等商业可见领域,在这些领域,强劲需求能够带来大量反馈和可量化结果。Lambert 表示,在结构化程度较低的科学任务中,他们的优势会缩小。
这并不证明中国系统在整体上优于所有美国模型。领先的美国闭源系统在重要的专业、科学和长时程任务中仍然领先。问题在于,这些系统是租赁服务,并非可供独立部署的普遍可用基础。
硬件限制可能强化了效率意识。美国出口管制旨在限制中国获取最先进的计算设备。中国实验室则通过强调训练技术、推理效率以及能够以受限资源实现更多能力的架构作出回应。
将出口管制简单归为中国开源模型领先的原因,未免过于片面。这些实验室同样受益于可观的国内投资、深厚的工程人才储备,以及推动中国 AI 标准扩散的明确政策偏好。限制与支持可以同时发挥作用。
许可机制带来了另一项优势。开发者可以下载许多中国模型的权重、进行修改,并将其集成到产品中,而无需等待获得专有前沿服务提供商的访问权限。具体条件各不相同,开放权重也并不总意味着使用不受限制。但与仅提供 API 相比,它仍给予构建者更大的空间。
由此形成了一种不对称格局。美国实验室承担了大量最昂贵的前沿研究,而中国企业则越来越多地将接近前沿的能力封装为其他组织能够拥有并适配的系统。
这既是一种分发战略,也是一种科学战略。一个稍弱的模型,如果价格可负担、可定制且广泛可得,也能产生更大的影响力。Linux、Android 和开放网络软件都提醒我们:传播最广的一层并不总是源自最先进的专有产品。
美国公司仍有可能的应对措施。OpenAI 已重返开放权重市场,Google 持续开发 Gemma,Nvidia 则发布了配套资源异常详尽的 Nemotron 模型。Lambert 指出,当能力具有竞争力时,可比的美国模型可能获得不成比例的采用率。
然而,零星发布无法消除通过持续更新和社区投入建立起来的领先优势。开发者需要可预测的模型家族、文档、宽松的条款,以及对下一版本会如期到来的信心。
因此,这场竞争是中国的开放执行力对阵美国的开放收缩。蒸馏是故事的一部分,但若将其视为全部故事,就会让美国模型战略逃避审视。
使用数据并不能证明全球 AI 霸主地位
最有力的证据支持中国在开放模型渠道中的主导地位,而非在全球所有聊天机器人、企业合同或私有部署中的全面领先。
OpenRouter 的数据之所以有价值,是因为它记录了跨众多模型的真实请求。一项 2026 年的token 使用量研究分析了该服务超过 100 万亿个 token,提供了对开发者行为异常细致的观察。
但覆盖面广并不意味着 OpenRouter 是一次普查。选择多模型网关的用户,与直接签订 OpenAI、Anthropic、Google 或 Microsoft 合同的公司不同。该平台可能天然会更集中于寻求开放替代方案的人群。
Token 数量同样需要结合背景理解。推理模型可能消耗大量隐藏或中间 token,才能生成一个答案。编程智能体在单项任务中可能生成重复调用。一个模型可以在 token 量上领先,却不一定在用户数量、营收或已完成的业务工作流上领先。
下载量带来了不同的衡量问题。一个人可能下载多个版本,而一次云端部署可通过一份副本服务数千人。自动化系统也可能抬高统计数字,却未对应实际生产使用。
学术提及表明影响力,但未必意味着认可。一篇论文可能评估某个模型的弱点、将其作为基线,或提及多个模型家族。该数字仍能反映研究者的关注度,但不应被表述为经济采用程度的直接衡量。
基准测试结果本身也有局限。实验室可以围绕可见测试优化发布,而评估套件可能低估可靠性、领域专业能力、长上下文表现或运营稳定性。一些厂商自行报告的结果采用了难以比较的定制配置。
Mozilla 的九月分析说明了这种复杂局面。在特定能力和编程指标上,开放模型已几乎追上领先的闭源系统。闭源模型在专业知识工作、长上下文检索、企业合规与责任承担方面仍保有优势。
这一差距对于高风险部署至关重要。处理法律文件、财务记录或健康信息的公司,需要的不只是高分的编程能力。它还需要访问控制、审计追踪、可预测的更新,以及发生故障时明确的责任归属。
安全性同样有两面性。可下载的权重让防御者能够检查和修改系统,但也使原始开发者无法在发布后强制执行安全措施。闭源提供商仍保有控制权,但研究人员有时发现,其安全过滤会阻碍正当的防御工作。
一个例子出现在 Hugging Face 调查一起与 AI 相关的网络安全事件时。据 Lambert 和 Scientific American报道,商业美国系统拒绝分析中的部分内容后,研究人员使用了一款中国开放权重模型。
这一事件并不证明较少的安全措施会带来更好的整体安全性。它表明模型层面的限制可能阻碍正当工作,也表明安全性取决于周边系统。权限、隔离、日志记录和人工审查的重要性,可能不亚于模型的来源。
政治风险依然真实存在。由中国托管的 API 可能引发数据管辖权问题,模型行为也可能反映政府强制要求的内容控制。在本地运行权重能够降低部分传输风险,但并不会自动揭示训练过程,也无法消除隐藏漏洞。
因此,国会至少应区分三个问题。某实验室是否非法获取了美国提供商的输出?某项特定部署是否暴露了敏感数据或关键系统?美国是否应更积极地投资自身的开放模型?
将这些问题合并为一项关于“中国 AI”的论述,会导致粗糙的政策。处理敏感信息的托管服务,应与在美国公司受控环境中运行的公开可得权重区别对待。
广泛限制还可能保护占主导地位的美国闭源提供商免受竞争。如果较小公司失去获取强大开放模型的渠道,它们可能更加依赖那些正游说实施更严格控制的实验室。
证据支持担忧,而非恐慌。中国开放权重 AI 模型已在能力、分发和研究者关注度上取得了可量化的领先。数据集的局限并不会抹去这一领先优势,但应限制关于全面全球霸主地位的说法。
三个信号将显示美国能否扭转这一变化
下一阶段将由美国的发布、企业政策,以及中国模型能否在开放模型市场之外保持领先来决定。
第一个信号是下一批美国重大开放权重发布的性能和采用情况。Meta、Google、Nvidia、OpenAI 以及新兴美国实验室需要推出接近专有前沿的模型,而不是在数月之后才跟进。
仅有基准持平还不够。开发者会关注许可、模型规模、部署要求、文档、微调支持和发布节奏。一次强劲的发布后长期沉默,无法重建一个生态系统。
如果美国开放模型开始匹配中国发布,并迅速获得下载量和研究引用,Lambert 的诊断将被削弱。若它们继续以较低能力姗姗来迟,结构性缺口将更难否认。
第二个信号是国会和行政部门审查的结果。立法者正在审查蒸馏、数据安全、供应链,以及美国公司对中国系统的使用。最终回应的范围可能从针对欺骗性访问的定向执法,到对模型或提供商实施广泛限制。
针对欺诈账户、规避访问限制或受制裁实体的狭义规则,可以在不将每个开放模型都视为威胁的情况下应对所指控的不当行为。它也将保留全行业使用的正当蒸馏和合成数据工作流。
广泛限制则会带来另一种考验。开发者可能迁移至美国替代方案,继续使用已下载的权重,或将工作负载转移到美国管辖范围之外。每一种回应都将揭示华盛顿对可移植软件实际还保有多少影响力。
第三个信号是 OpenRouter、Hugging Face 和其他开放优先平台之外的使用情况。来自云服务提供商、企业部署、软件智能体和直接企业协议的证据,将澄清当今的领先是广泛存在还是集中于特定领域。
这种衡量必须区分托管 API 与本地部署。它还应区分 token 量、活跃用户、营收和已完成工作负载。每项指标回答的都是不同问题。
随着模型进入更长、更具后果性的任务,独立评估将变得重要。编程基准帮助中国实验室赢得关注,但企业买家将测试可靠性、安全性、专业知识和持续自主工作能力。
如果中国模型家族在这些场景中保持优势,“全球使用量”这一说法将更容易成立。如果其领先地位仍集中于模型切换者和研究用户,市场将显得更加碎片化。
政策辩论还将与 AI 安全相交织。OpenAI 和 Anthropic 一直主张围绕高能力系统实施更严格的控制。中国的开放权重分发使任何建立在少数提供商保有技术控制权基础上的安全框架变得复杂。
一旦权重流通,监管便不能依赖厂商禁用访问。政府和公司需要在部署层面设置防护措施,包括受限权限、受监控工具、隔离环境和明确的人类授权。
这种转变会影响日常知识工作。团队越来越多地将多个模型与内部文档、会议记录和项目历史相结合。治理良好的AI 知识库必须控制任何模型能够检索的内容及其可采取的行动,无论该模型在哪里开发。
对于开发者和企业买家而言,眼下的教训不是仅按国籍或排行榜位置选择系统。应将模型、托管路径、数据路径、许可、运营控制和替换选项作为一个整体进行评估。
中国开放权重 AI 模型已经改变了谈判地位。它们为开发者提供了美国闭源前沿之外的替代方案,同时也暴露出美国开放模型阵容的薄弱。
未来数月,一个具体的问题将浮现:美国实验室会不会发布开发者真正能够拥有并自行适配的、有竞争力的模型,还是华盛顿会试图通过监管来抹去自己未能建立的分发优势?



