top of page

中国的 AI 效率攻势令美国的投入模式承压

8月13日
讀畢需時 14 分鐘

尽管投入远低于美国,中国正在缩小部分 AI 性能差距;这一矛盾如今正通过 Google News 传播。

这一对比并不意味着中国已经超越美国。美国实验室仍然产出更多重要模型,并掌控全球大量最先进的计算能力。它们吸引的私人投资也多得多。

紧张之处在于另一面。中国开发者正借助受限芯片、更小预算、开放权重以及激烈的国内竞争,取得具有竞争力的成果。美国则对前沿系统、超大规模数据中心和持续扩展投入了更大的赌注。

这种差异令 AI 竞赛不再只是比拼谁能打造最强模型。它同样在追问:哪个国家能将资金、能源、工程人才和已部署的软件转化为最有用的经济产出。

《经济学人》的表述抓住了这一挑战,但其核心论断仍需谨慎对待。训练披露仍不完整,基准测试很少衡量全部开发成本,而低使用价格也可能反映补贴,而非更优的经济性。

不过,效率压力确实存在。斯坦福大学 2026 年 AI Index 指出,2025 年美国在 AI 领域的私人资本投入是中国的 23 倍。然而,中国实验室产出了 35 个重要模型,美国则为 59 个。

这并非势均力敌。但这样的产出已足以挑战一种假设:投入领先必然自动带来成比例的技术领先。

中国 AI 效率之争发生了什么变化

关键变化在于,中国 AI 效率如今体现在多个模型和机构之中,而不再只是一次令人意外的发布。

DeepSeek 在 2025 年初首次迫使全球关注这一问题。其 R1 推理模型采用开放权重发布策略,并在受限的计算栈上取得了具有竞争力的结果。

开放权重意味着开发者可以下载并运行模型的训练参数。但这并不必然意味着训练代码、数据和完整开发流程均已公开。

该公司此前的 V3 技术论文介绍了一种混合专家架构。这种设计仅为每个 token 激活模型的一部分,从而降低训练和推理所需的计算量。

DeepSeek 还采用了低精度算术、负载均衡方法以及专门的通信技术。这些选择帮助其绕开了获取顶级加速器受限的问题。

该公司在一份详细的技术报告中披露了这些方法。其披露内容为外部研究人员提供的信息,多于许多封闭式美国实验室所提供的内容。

不过,被广泛传播的训练成本说法只涵盖了开发的一部分。它并不代表研究、失败实验、员工、数据准备或配套基础设施的全部成本。

这一区别至关重要。中国 AI 模型可以更高效,但这并不意味着每一项媒体报道中的成本比较都能直接对照。

DeepSeek 也并非孤立的国家级冠军。Alibaba、Tencent、Baidu、ByteDance、Moonshot AI、Z.ai 以及多个与大学相关联的团队,持续发布具备能力的模型。

许多团队采用稀疏架构、知识蒸馏、更小型的专用模型,以及激进的推理优化。蒸馏是指训练较小系统,以复现较大系统的特定行为。

斯坦福 DigiChina 的一份评述描述了一个广泛的开放权重生态系统,多个实验室正在推进不同的模型家族。

这种广度改变了论点。单一廉价模型可能反映特殊的会计口径、借鉴的理念,或某一个卓越工程团队的表现。持续发布则表明存在更深层的发展模式。

这一模式也出现在独立测试中。2026 年 4 月,美国人工智能标准与创新中心将 DeepSeek V4 Pro 与美国参考模型进行了评估。

该机构报告称,在七项基准测试中的五项上,DeepSeek 的成本效率高于最经济的美国参考模型。它也警告称,基准聚合方法可能改变表面结果。

这项联邦评估强化了效率论据,但并未为更广泛的竞赛盖棺定论。基准测试衡量的是特定任务,而非每一种商业工作流中的可靠性。

由此产生的问题,比最初 DeepSeek 冲击所引发的问题更可信。中国并非仅仅造出了一款更便宜的模型。其实验室正反复将计算资源稀缺视为一项工程约束。

这种转变构成了文章的核心张力。美国仍在资本、芯片和前沿能力方面领先,而中国正通过严谨优化逐步逼近。

为什么 Google News 正在放大一场投资逻辑的逆转

Google News 正在呈现一种被原始投资总额掩盖的逆转:美国压倒性的投入领先,并未带来同等巨大的模型领先。

斯坦福大学 2026 年 AI Index 提供了最清晰的起点。美国在 2025 年产出了 59 个重要 AI 模型,而中国为 35 个。

同一份报告称,美国私人 AI 投资是中国的 23 倍。这些指标不能直接互换,但这一反差难以忽视。

投资还包括模型开发以外的活动。企业会在数据中心、云容量、网络设备、收购、薪酬、应用和长期基础设施上投入资金。

模型数量也有其局限。“重要”系统在规模、原创性、实用性和商业采用程度上差异极大。一个前沿模型可能比多个较小规模的发布需要更多资源。

即使存在这些保留意见,这些比率仍指向不同方向。美国的投入优势远大于其在重要模型产出上的领先优势。

AI Index 数据还显示,中国在 AI 论文数量、引用量和专利授权数量上领先。美国在影响力更高的专利方面仍具优势。

报告指出,2024 年被引用次数最高的 100 篇 AI 论文中,中国占据 41 篇。2021 年时则占 33 篇。

这些指标并不能证明商业价值。专利总量可能反映申请激励,而引用次数可能偏向大型研究网络和热门议题。

但它们确实表明,中国的 AI 体系正以较少的私人资本产出大量技术活动。大学、国家实验室、科技公司和工业企业都在为这一产出作出贡献。

美国的投入遵循另一种逻辑。OpenAI、Anthropic、Google、Meta、Microsoft、Amazon 及其他公司,都在为需要越来越多训练和推理能力的模型建设基础设施。

这一战略瞄准前沿。如果能力会随着更多计算资源而持续显著提升,那么大规模基础设施承诺就可能形成持久优势。

中国的战略部分具有防御性。美国出口管制限制了获得最先进芯片的渠道,从而带来更高效利用现有硬件的压力。

然而,稀缺也可能成为一种组织纪律。团队必须在开发更早阶段优先考虑模型架构、内存使用、数据质量、软件优化和推理成本。

中国国内竞争又增加了一股力量。企业频繁下调服务费用、发布开放模型,并将 AI 整合进现有消费平台。

这一环境奖励采用和利用率。它可能惩罚那些投入巨大、却无法迅速找到用户或分发渠道的实验室。

因此,这一比较并不只是中国与美国的 AI 投入之争。它是两种将资源转化为能力的方法之间的较量。

美国强调前沿规模和私人融资的基础设施。中国强调受限条件下的工程能力、开放分发、应用规模,以及与既有数字服务的整合。

看到《经济学人》标题的 Google News 读者,应将其视为效率论点,而非中国技术领先的宣言。

美国仍拥有更多顶级计算能力,以及更多在全球具有影响力的封闭式实验室。中国带来的挑战在于,它正产出足够多的能力,使美国的投入溢价显得不那么令人安心。

中国与美国的 AI 之争,本质是规模对约束

核心竞争并不是一家企业对另一家企业,而是美国的扩展模式对中国由约束驱动的工程模式。

美国路径假定,更多计算资源、更优芯片、更大集群和更深厚的资本池,将解锁较小系统无法匹敌的能力。

这一假设有证据支持。训练计算量仍在持续增长,而领先的美国实验室依然推动了许多前沿突破。

美国还拥有由芯片设计商、云平台、投资者、研究人员和企业客户构成的密集网络。这些群体帮助将研究转化为面向全球分发的产品。

中国获得先进加速器和制造工具的渠道较弱。其开发者往往必须使用较旧芯片、国产替代方案,或混合计算集群。

这些约束会影响训练速度和模型规模,也使硬件可靠性、网络连接和软件支持更加复杂。

中国实验室已采用多种反复出现的技术。混合专家系统避免为每个请求激活所有参数。量化以更少的比特表示模型数值,从而降低内存和计算需求。

稀疏注意力限制处理过程中可相互作用的 token。数据筛选则在训练消耗昂贵计算时间之前,去除重复和低质量样本。

强化学习可在预训练后增强推理能力。蒸馏可将特定行为迁移至运行成本更低的小型模型。

这些方法并非中国独有。美国研究人员提出或协助提出了许多底层理念。

区别在于侧重点。稀缺为中国团队提供了更强的动力,促使其组合既有技术、积极测试,并围绕效率设计发布的系统。

美国实验室同样会优化模型。不过,更容易获得资本和加速器,使其能够在软件改进之外追求更偏向蛮力的扩展。

这带来一种风险:将绝对性能与经济性能混为一谈。一个模型可以在基准测试中领先,却在每单位计算资源或资本的回报上表现较弱。

对开发者而言,相关问题通常更为具体。他们需要的是一款在可接受的延迟、运行成本和部署风险下,达到可靠性门槛的模型。

如果更容易托管、定制或整合,性能稍弱的模型也可能胜出。开放权重还可以进一步降低对单一提供商的依赖。

对国家经济体而言,同样的逻辑会以更大规模适用。最有价值的系统不一定是在实验室评分中最高的那个。

价值的产生,取决于企业是否重新设计工作流程、员工是否真正使用这些工具,以及应用是否带来可衡量的改进。采用速度可能比又一次小幅基准提升更重要。

中国庞大的制造业基础,在物流、质量检测、机器人、设计和流程控制等领域创造了机会。这些场景更适合与实体运营相连接的专业模型。

美国则拥有不同的优势。其云计算公司、软件供应商、金融机构和专业服务企业,能够迅速将 AI 分发到知识型工作中。

结果将取决于前沿能力是否依然稀缺,并具有决定性的经济价值。如果是这样,美国的规模优势就更有价值。

如果高能力模型成为广泛可得的商品,中国的部署纪律就会变得更加重要。更廉价的智能将把竞争重心转向集成、硬件、分发和运营执行。

这正是中国 AI 效率背后的真正逆转。出口限制的部分设计目的,是通过限制算力获取来放缓中国的进展。

这些限制确实带来了实际成本。但它们也提高了从每一枚可用芯片中榨取更多性能的研究价值。

“更高性价比”说法可能失效的地方

效率主张依然脆弱,因为模型成本、基准结果、补贴和现实世界可靠性都难以直接比较。

第一个问题是核算。实验室很少披露完整的研发预算,而披露的训练运行通常不包括此前的实验。

一家公司在基础设施和专业能力上投入多年后,最终一次训练运行看起来可能很便宜。复用早期模型或合成数据,也可能将成本转移到某一次发布之外。

硬件核算造成了另一道缺口。实验室可能报告加速器使用时长,却不计入网络、存储、电力系统、折旧或闲置产能。

劳动力成本因地区而异。能源成本、融资条件、采购安排和政府支持也会影响报告中的经济性。

第二个问题是基准选择。模型可能在数学、编程或问答上表现出色,却在工具使用和长工作流中表现不佳。

基准测试可能包含已出现在训练集中的受污染数据。供应商也可能专门针对受广泛关注的测试进行优化。

独立评估可以降低这种风险,但无法彻底消除。即便是 NIST 对 DeepSeek 的评估,也指出其分数汇总方式与官方基准方法存在差异。

第三个问题是可靠性。企业买家关心输出一致性、安全控制、服务可用性、法律风险和技术支持。

如果一个低成本模型在多步骤工作中频繁失效,其创造的价值就微乎其微。当员工必须核验或重做每一项结果时,廉价推理可能变得昂贵。

开放权重也伴随取舍。企业获得了部署控制权,但也要承担更多托管、监控、更新和保护系统的责任。

中国 AI 模型在一些市场还面临额外的信任担忧。数据治理规则、审查行为、网络安全审查和地缘政治限制都可能限制采用。

NIST 的 2026 年评估在肯定成本效率的同时,也提出了安全和政策方面的担忧。良好的性能比并不能解决模型行为或部署风险方面的问题。

第四个问题是财务可持续性。激烈竞争可能将使用收费压低到低于完整运营成本的水平。

这种策略会加速采用,但也削弱了“低价证明技术优越性”的说法。供应商可以补贴推理服务以获取用户或挤压竞争对手。

中国企业同样面临效率无法完全解决的资本约束。前沿研发仍需要芯片、数据中心、电力、研究人员和漫长的实验周期。

美国更大的投资基础,使其实验室拥有更大的失败承受空间。它还支持那些可能无法立即带来商业回报的昂贵研究。

截至 2025 年,美国在涵盖 500 个 AI 超级计算机系统的数据集中,约占所代表性能的四分之三。中国约占 15%。

当实验室需要训练最大的模型,或服务庞大的全球需求时,这一基础设施差距就很重要。

Google News 报道中也存在选择偏差。中国令人意外的成功会受到关注,因为它们挑战了既有预期。

失败的项目、表现不佳的模型和无利可图的供应商,较少登上国际新闻头条。因此,可见样本可能夸大中国效率的一致性。

同样的偏差也存在于美国。大型融资轮次和数据中心公告会在投资者尚未知道相关系统能否带来足够回报前就获得报道。

平衡的结论应避免两个极端。中国的进步并非核算幻象,美国的支出也并非天然浪费。

证据支持一个更有限的判断:中国开发者已在约束条件下变得极具竞争力,但其优势并不具有普遍性,也尚未得到完整衡量。

采用可能比下一次基准测试更重要

中国最有力的效率论据,来自广泛分发有能力的 AI,而不是在每一项美国前沿成果上实现对等。

截至 2025 年 6 月,中国报告称生成式 AI 用户达到 5.15 亿。根据一份具有政府背景的行业报告,这一数字在六个月内翻了一倍。

这一用户采用指标覆盖范围很广。它并未显示人们使用 AI 的频率,也未说明这些活动是否创造了经济价值。

尽管如此,这一规模仍表明扩散速度很快。中国主要互联网平台可以通过已覆盖消息、购物、视频、支付、搜索和办公沟通的应用引入 AI。

分发降低了实验所需的投入。用户不必总是发现一家新供应商、注册另一个账户或更改支付方式。

开放权重发布支持了第二条分发路径。开发者可以针对区域语言、行业术语、私有基础设施或专用设备修改模型。

这种方法可以扩大采用范围,尤其是在高端闭源服务仍然过于昂贵的地方。它也让大学和小型企业无需完全依赖外国供应商便可进行试验。

中国的产业结构提供了实用的测试场景。制造商可以将 AI 应用于视觉检测、设备维护、排程、供应链规划和机器人。

这些案例很少需要全球最强的通用模型。它们需要的是在既定流程内可预测的表现。

当较小模型能够在机器附近运行、快速响应并保护敏感运营数据时,它可能带来更好的经济性。

美国最强的采用路径则有所不同。其软件供应商已服务全球企业,使美国模型能够接入办公套件、云平台、编程工具和客户数据库。

美国企业还主导着许多企业客户关系。它们可以将模型与大型买家所期待的安全、合规和支持服务打包提供。

由此形成的竞争,不仅是谁拥有更多用户,而是谁能将模型访问能力转化为持续的生产率、收入或更低的运营成本。

这种衡量方式仍不成熟。调查可以识别采用情况,但往往无法区分随意试用和重新设计后的工作。

这种区别至关重要。偶尔向聊天机器人提问,并不等同于围绕 AI 重建理赔流程、软件工作流或生产线。

中国对实际部署的重视,可能让当前一代模型带来更高回报。它也可能揭示,许多集成除了演示项目外几乎没有增加价值。

美国的前沿战略面临相反的不确定性。其实验室可能创造出足以证明巨额基础设施投入合理性的能力。

它们也可能发现,客户在大多数日常工作中更偏好价格更低的模型。在这种情况下,过剩能力并不总能获得相应溢价。

对于知识工作者而言,这场竞争应当拓宽采购标准。模型质量固然重要,但数据控制、工作流适配度、延迟、切换成本和核验要求同样重要。

团队还需要一种持久的方式来评估各种主张。新闻报道、发布说明、基准测试和内部测试应被放在一起,而非视作彼此分离的信息流。

因此,下一位赢家可能在头条之下见分晓。数百万个小型部署决策的影响,可能大于一次轰动的模型发布。

Google News 头条之后应关注什么

三个信号将显示中国的效率优势是否可持续:独立模型测试、可衡量的采用,以及美国对廉价竞争的回应。

第一个信号是对新中国 AI 模型的重复独立评估。一次强劲结果可能反映基准选择、临时定价或特殊核算方式。

如果在编程、推理、工具使用、安全和长时任务等方面出现多项结果,将强化效率论点。在选定基准之外可靠性较弱,则会削弱这一论点。

评估者应报告总任务成本,而不仅是每个 token 的收费。需要反复重试或大量核验的模型,可能失去其表面优势。

他们还应披露延迟、失败率、硬件配置和评分方法。这些细节能让比较对买家更有参考价值。

第二个信号是能够带来可衡量运营收益的采用。用户总数反映覆盖范围,而生产率、收入和流程改进则反映价值。

关注制造商在部署中国 AI 模型后,是否报告更低的缺陷率、更快的设计周期、更少的停机时间或改善的物流表现。

还应关注,一旦初期激励措施消退,中国供应商能否留住开发者。可持续的使用将表明模型解决了真实问题,而不只是吸引短期试验。

中国以外的企业采用同样重要。国际使用将检验开放权重中国模型能否克服安全、合规和地缘政治方面的担忧。

更广泛的部署将强化这样一种说法:中国能够将有限资源转化为全球有用的技术。受限的国内采用则会使这种优势更具区域性。

第三个信号是美国实验室如何回应。它们可以降低运营成本、发布更小的模型、公开更多权重,或更积极地将 AI 捆绑到现有软件中。

多家美国公司已经提供专为本地或低成本运行而设计的紧凑模型。若更重视这一细分领域,将印证中国对市场施加的压力。

美国也可能加倍押注前沿规模。如果即将推出的系统能创造高效小模型无法复制的能力,这种回应就具有合理性。

决定性证据将是客户是否愿意为这些能力付费。仅靠资本支出无法证明回报。

芯片政策将塑造这三个信号。更严格的限制会加重中国的算力负担,而获得更先进的国产加速器则可减轻这一负担。

政策影响不会只体现在模型排名上。它们还会显现在研发周期、服务能力、能源使用以及支持大量客户的能力上。

因此,读者应将 Economist 的标题视为一个可检验的命题。它指出了一种重要的不平衡,但并未为此案画上句号。

Google News 可以呈现这场竞争,但新闻标题无法统一彼此不兼容的成本披露,也无法衡量长期生产力。

下一个模型周期的问题很明确:中国是否能继续以远小于竞争对手的资本投入,交付具有竞争力的系统?

美国面临的对应问题则更为尖锐。它更大规模的投资,能否带来那些注重效率的竞争对手无法低成本复制的能力和经济回报?

关注独立评测、部署成果和服务提供商的行为。这些信号将表明,中国更高的性价比究竟源于可持续的工程实力,还是 AI 竞赛中的暂时阶段。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page