中国廉价 AI 模型可强化硅谷的算力业务
DeepSeek 让高能力人工智能变得更便宜,但由此带来的价格压力并未阻止硅谷继续建设更多计算基础设施。
这一看似矛盾的现象,正是如今 Google News 上热议的杰文斯悖论核心所在。当一种资源的使用成本降低时,人们往往会更多地消耗它。即便每项任务所需资源更少,总需求仍可能上升。
将这一逻辑应用于 AI,对 Nvidia、云平台和数据中心运营商而言听上去颇令人安心。高效的中国 AI 模型降低了生成一个答案所需的计算量,但也让更多应用在财务上变得可行。
但对销售专有模型访问权限的公司来说,同一发展趋势就不那么令人舒适了。DeepSeek、阿里巴巴、Moonshot AI 及其他中国开发者正在把高能力模型变成廉价、可互换的组件。这削弱了溢价定价能力,也让客户更容易切换。
因此,核心竞争并不是中国与美国在 AI 市场每个环节的对抗,而是廉价、充足的模型输出,与领先美国实验室偏好的高溢价模型经济模式之间的竞争。
硅谷可以从这场竞争中获益,但并非每一家硅谷公司都会成为赢家。基础设施供应商能够处理更大规模的工作量,而模型开发商则面临更低利润率、更激烈竞争和更弱客户忠诚度。
廉价中国 AI 已从警示变为市场力量
中国 AI 模型不再只是技术挑战。它们正在改变将智能能力嵌入普通软件的预期成本。
DeepSeek 在 2025 年 1 月通过其 R1 推理模型展示了这一方向。该模型的发布挑战了这样一种假设:具有竞争力的推理系统必须采用与领先美国模型相同的投入模式。
市场最初的反应聚焦于稀缺性。投资者认为,如果模型需要的先进芯片更少,科技公司可能会减少基础设施支出。随着市场质疑高效软件是否会削弱硬件需求,Nvidia 股价大幅下跌。
这种解读将每一份节省下来的计算量都视为流失的收入。它没有考虑到那些此前因模型使用成本过高、速度过慢或难以扩展而被企业放弃的应用。
DeepSeek 在 2026 年继续推进效率论述。根据公司的 V4 release notes,其 V4 系列包括 Pro 和 Flash 模型,并提供一百万 token 的上下文窗口。上下文窗口是指模型在一次请求中能够考虑的信息量。
DeepSeek 表示,V4 使用了稀疏注意力,这种方法限制了哪些上下文片段会得到密集处理。该公司将这一设计定位为降低长请求期间内存和计算需求的方式。
这些说法仍需在真实工作负载中进行独立评估。模型开发商提供的基准测试结果很少能够反映可靠性、延迟、安全控制或运营生产服务的成本。
不过,商业信号依然明确。DeepSeek 将 V4-Flash 定位于高吞吐量场景,并设定账户并发限制,最高可达 2,500 个同时连接。这不只是一次研究演示,而是在邀请开发者基于廉价模型输出构建面向客户的服务。
其他中国开发者也在强化同一方向。阿里巴巴的 Qwen 系列凭借开放发布、广泛语言支持以及多种不同规模的模型吸引了开发者。Moonshot AI 则围绕长上下文和智能体任务推广 Kimi 模型。
智能体系统是指让模型能够规划步骤、调用软件工具,并持续朝目标工作的应用。由于一次用户请求可能触发多轮内部交互,它们消耗的模型输出可能远多于传统聊天机器人。
近期 Google News 的报道将这些发布视为一场不断扩大的价格战。这种描述捕捉到了事件的一部分,但忽略了更大的变化:更低的成本正在扩大能够全天候以经济方式运行 AI 的软件范围。
过去,客服机器人可能只会在客户提交工单后生成一条回复。成本更低的智能体则可以对工单分类、检索文档、起草回复、检查账户历史,并监控问题是否再次出现。
每个步骤都可以使用更高效的模型。完整工作流消耗的总计算量仍可能高于过去更简单的交互。
这一区别使中国 AI 的效率问题成为需求问题,而非对硬件构成直接威胁的问题。
Google News 正在追踪 AI 成本的崩塌
有用模型输出的成本下降速度已经足以改变开发者能够构建什么,而不只是改变他们为现有应用支付多少。
这一趋势早在 DeepSeek 成为全球知名品牌之前就已开始。斯坦福大学 2025 年 AI Index 发现,具备 GPT-3.5 级别基准性能的模型查询成本,在 2022 年 11 月至 2024 年 10 月间下降了超过 280 倍。
斯坦福还发现,跨越常用语言理解门槛的最小模型,已从 2022 年的 5,400 亿参数缩小至 2024 年的 38 亿参数。参数是帮助模型将输入转换为输出的学习所得数值。
这些数据在 AI Index findings 中得到总结,表明模型效率并非一家公司的孤立成就。硬件改进、软件优化、模型压缩和更强的训练方法正在共同发挥作用。
中国 AI 实验室加剧了这一趋势,因为它们面临不同的限制。美国出口管制限制了它们获得某些先进处理器的渠道。这种压力使其有强烈动机从现有硬件中榨取更多性能。
混合专家架构就是一种回应。这类模型包含许多专门组件,但每个 token 只激活其中一部分。token 是模型处理的一小段文本单位。
稀疏注意力提供了另一条路径。它减少了需要全面细查的早期上下文数量,从而降低可能拖慢长请求的内存传输。
模型蒸馏也可以将更大系统的行为迁移到更小的系统中。较小模型通常会牺牲部分能力,但运行成本可能低得多。
这些方法都不会消除对计算的需求。它们改变的是每项任务所需计算的数量和类型。
这一区别至关重要,因为 AI 需求正日益从训练转向推理。训练用于创建或更新模型。每当完成训练的模型撰写文本、分析图像、生成代码或选择行动时,推理便会发生。
训练成本集中在大型且显眼的项目中。推理则通过反复使用不断累积。成功的消费级产品、编程智能体或企业助手,可以在数百万用户中持续产生请求。
因此,Google News 关于模型成本下降的报道,与数据中心扩张的新闻标题并列出现。只有在假设 AI 使用量保持不变时,这些发展才会显得矛盾。
使用量并不固定。更低的成本会鼓励开发者增加模型调用、保留更长上下文、生成多个候选答案,并利用验证模型检查首次响应。
推理模型又增加了一层乘数效应。它们通常会在解决问题时生成内部 token,之后才返回可见答案。用户可能看到一条简短回复,但系统已完成了长得多的计算。
智能体再次延长了这一循环。编程智能体可以检查代码仓库、规划修改、编辑文件、运行测试、读取失败信息,并修订其工作。一条指令可能变成数十次推理操作。
这就是为什么更便宜的 token 不会自动带来更小的计算账单。开发者往往会将节省下来的成本投入到更强大的行为中。
经济问题在于,需求增长是否快于每项任务成本的下降。只有当使用量增加超过效率提升所带来的抵消幅度时,杰文斯悖论才会成立。
目前证据指向这一方向,但它并不能为每种模型、每位客户或每家芯片供应商确定结论。
杰文斯悖论更利好算力而非模型厂商
更便宜的智能能力可以扩大基础设施市场,同时侵蚀制造模型本身的公司的经济效益。
威廉·斯坦利·杰文斯最初围绕 19 世纪英国的煤炭使用提出了这一论点。更高效的蒸汽机降低了完成一个单位工作所需的煤炭量,但也让蒸汽动力在更多行业中变得有用。
结果是煤炭总消耗增加,而非减少。现代反弹效应并不要求 AI 完全复刻那段历史。它只需要对低成本作出足够强烈的需求响应。
对云平台而言,这一机制很容易理解。此前只能发出一次昂贵请求的客户,可以发出多次更便宜的请求、服务更多用户,或持续运行模型。
当这些额外活动仍在其数据中心内进行时,Amazon Web Services、Microsoft Azure、Google Cloud 和 Oracle 都可以受益。它们从模型周边的计算、存储、网络和托管服务中获得收入。
当总体推理需求增长足够快、需要更多加速器时,Nvidia 也能受益。该公司 2026 财年业绩支持这样一种观点:效率提升尚未阻止基础设施增长。
Nvidia 报告称,全年数据中心收入为 1,937 亿美元,同比增长 68%。根据其 fiscal 2026 results,第四季度数据中心收入达到 623 亿美元,较上年同期增长 75%。
该公司还表示,与 Blackwell 相比,其 Rubin 平台可将推理 token 成本最多降低十倍。Nvidia 并未将单 token 成本降低视为少卖系统的理由,而是将效率作为购买下一代产品的理由之一。
这一战略假设客户会将节省下来的成本重新投入到更高的使用量中。它也假设 Nvidia 能够保留由此产生的工作负载中的重要份额。
第一个假设看起来日益可信。AI 产品正从可选的聊天窗口进入编程、广告、客户支持、安全分析、文档处理和科学研究领域。
第二个假设则不那么确定。高效模型可以运行在更广泛的硬件上,包括 AMD 的加速器、专门设计的推理芯片,以及云服务商设计的系统。
中国 AI 开发者也可能针对 Huawei 硬件或其他国产处理器进行优化。全球 AI 推理量的增长,并不能保证每一项新增任务都会落到 Nvidia 芯片上。
杰文斯论点最直接适用于整个计算市场。当它被用作对某一家供应商市场份额的承诺时,其说服力就会减弱。
模型实验室面临的是不同的问题。OpenAI、Anthropic、Google DeepMind 及其他前沿开发者在训练、研究人员、数据、安全工作和基础设施上投入巨大。
它们历来期待以先进能力来支撑高端定价。廉价的中国 AI 模型通过为开发者提供足以应对常规工作负载的替代方案,压缩了这一溢价。
企业可能会将领先的专有模型留给最棘手的请求,同时将摘要、分类、提取和简单的代码修改任务转交给成本更低的系统。
这种做法被称为模型路由。软件会评估每项请求,并将其发送给被认为足以胜任该任务的模型。
路由让模型在单次请求的层面展开竞争。当用户甚至不知道某一步由哪个模型处理时,品牌忠诚度的重要性就会下降。
Axios 将这一转变描述为一场迈向“商品化智能”的竞赛,而路由有可能成为模型之上的一个高价值层。其 AI 价格战分析也将 Anthropic 列为高端定价的重要捍卫者。
这就形成了核心反转。廉价的中国 AI 既可能印证硅谷的基础设施投入,也可能削弱原本用于证明这部分投入合理性的高端模型收入。
胜者与败者位于不同层级
杰文斯悖论并不会拯救整个 AI 行业。它会将价值重新分配给掌控需求、分发渠道和稀缺基础设施的层级。
在模型之间做选择的开发者关心输出质量、可靠性、延迟、隐私和成本。当多个系统都能满足最低要求时,模型本身就更容易被替代。
开放权重加速了这一过程。开放权重模型会提供训练后的参数,供他人下载和运行,尽管其训练数据和完整开发过程仍可能保持封闭。
企业可以在自己的基础设施上部署这些模型,修改其行为,并避免依赖单一 API 提供商。它们也能以更强势的地位与商业供应商谈判。
这威胁到那些将模型访问作为核心产品的实验室。前沿模型即便仍具技术优势,也可能只能在常规推理中获取有限份额。
当需求分散到众多模型时,基础设施提供商处于更有利的位置。无论选择哪一种方案,最终都需要某处的处理器、内存、存储、网络和电力。
云服务商还可以通过一个托管平台提供相互竞争的模型。即使客户更换底层模型,这也使它们能够获取工作负载收入。
应用公司可以获得另一项优势。如果模型成本下降,它们就能把投入重点放在客户关系、专有数据、工作流设计和分发上。
例如,一名会计助手并不会仅仅因为其模型具备推理能力就变得有用。它必须连接记录、遵守权限、保留审计轨迹,并识别何时需要人工审核。
一名编程助手必须理解代码仓库,安全地执行工具,遵循项目约定,并向开发者展示发生了哪些变更。这些周边能力创造的价值,是基准分数无法衡量的。
因此,廉价的中国 AI 模型可能会将议价能力从模型实验室转向应用。模型成为更大系统中的一个组成部分。
这一结果类似于早期的云计算市场。开源数据库和通用服务器并未消除科技支出,而是将价值转向托管服务、开发者体验,以及能够降低运营复杂度的平台。
这种类比也有局限。模型可能给出不一致的答案,继承数据偏见,并暴露敏感信息。组织不能把它们当成完全可互换的电力来对待。
安全与治理要求能够为高端提供商保留空间。与最低运营成本相比,银行可能更看重合同保障、区域托管、监控和可预测的模型行为。
企业还面临切换成本。当底层模型变化时,提示词、评估系统、检索管线和安全规则往往都需要调整。
不过,切换已变得更加容易。许多提供商支持兼容接口,而独立平台可以在多个模型之间路由请求。
DeepSeek 的文档明确支持 OpenAI 风格和 Anthropic 风格的接口。即使行为差异依然存在,接口兼容性也降低了测试替代方案所需的工程工作量。
这种压力以不同方式触及美国实验室。
Google 可以通过搜索、Android、Workspace 和 Google Cloud 分发 Gemini。Microsoft 可以将模型与 Azure、Microsoft 365、GitHub 和企业身份系统结合。Amazon 可以销售基础设施和托管访问服务,而无需让某一个模型占据主导地位。
OpenAI 和 Anthropic 拥有强大的产品与开发者认知,但它们对操作系统、办公软件或公共云基础设施的控制较少。它们的模型必须承担更多商业压力。
Nvidia 的风险敞口恰好相反。它不需要某个特定模型获胜。它需要的是整体加速计算需求增长,并让其平台继续成为运行这些工作负载的首选之地。
彼得森国际经济研究所的 DeepSeek 后评估认为,整个计算供应链收入的增长支持了杰文斯悖论的解释。
这一结论不应演变为“效率保证利润”的笼统论断。需求可以增长,利润率却可能下降。收入可以上升,但资本需求的增长速度可能更快。
市场也可能过度建设。如果数据中心在应用产生足够多的付费使用之前就已落地,运营商即便面对长期需求增长,仍可能获得疲弱回报。
杰文斯悖论解释的是消费,而不是决定哪家公司能从服务这些消费的资产中获得最佳回报。
杰文斯论点并未证明什么
看多基础设施的逻辑取决于实际使用量,而不仅仅是基准测试的提升或更低的标价。
第一项不确定性是质量。当错误迫使人们重复工作、检查每一个答案,或修复受损数据时,廉价模型的价值微乎其微。
开发者越来越多地根据具体任务而非广泛排行榜评估模型。一款在编程基准测试中表现良好的模型,可能难以应对一家公司的私有代码库或不常见的编程语言。
长上下文是另一个例子。支持更大的上下文窗口,并不意味着模型能准确利用其中的每一部分内容。当关键信息夹杂在大量无关文档中时,检索质量可能会下降。
第二项不确定性是需求弹性,即消费对价格变化的响应强度。杰文斯悖论要求使用量增长到足以超过效率节省所带来的影响。
这可能发生在编程代理、研究工具和内容系统中,因为软件可以生成重复请求。但在人类注意力受限的应用中,未必会发生。
人们不会仅仅因为摘要变得更便宜,就阅读无限数量的报告。法务团队无法批准无限数量的合同。企业可能因隐私、治理或运营风险而限制使用量。
第三项不确定性是收入质量。提供商可以处理更多 token,却从每个 token 获得更少收入。基础设施利用率可以提高,却未必带来有吸引力的利润率。
竞争使这一风险更加突出。Nvidia、AMD、云服务商自研芯片、推理初创公司和中国加速器都希望分得不断扩大的需求份额。
工作负载还可能向更小型的本地系统迁移。运行高效模型的笔记本电脑或智能手机,无需每次请求都调用大型数据中心即可处理任务。
端侧推理扩大了 AI 的使用,但改变了谁能获取由此产生的价值。它可能有利于设备制造商和边缘芯片供应商,而非公共云平台。
第四项不确定性是能源。更高效的计算会降低每项任务的用电量,但杰文斯式的需求增长可能提高总耗电量。
Stanford 的 2026 AI Index 估计,AI 数据中心容量已达到 29.6 吉瓦。如此规模使电力供应、电网接入、冷却和用水成为战略性约束。
效率可以帮助数据中心在固定的电力额度内处理更多请求,也可能鼓励运营商用尽每一兆瓦的可用容量。
环境结果取决于能源来源以及反弹效应的规模。单次请求的碳足迹下降,并不保证总排放量下降。
第五项不确定性涉及芯片获取。美国出口管制塑造了中国模型的发展,并限制了 Nvidia 向中国客户提供服务的能力。
Nvidia 在其 2027 财年第一季度展望中排除了来自中国的数据中心计算收入。廉价的中国模型可以创造全球推理需求,但地缘政治规则可能阻止美国供应商获取其中一部分。
此外还存在验证问题。模型开发者会在不同条件下公布基准分数,而完整训练或运营成本很少被披露。
DeepSeek 的效率主张为技术方向提供了有价值的证据,但并未提供与每一款美国模型进行完整、独立审计比较的结果。
因此,Google News 读者应区分三种经常被放在一起的说法。
第一,中国实验室已经发布了能力日益增强且价格低廉的模型。现有产品和文档支持这一说法。
第二,更低的成本正在推动更广泛的 AI 采用。推理成本下降和代理使用扩展支持这一方向,尽管具体的反弹程度因应用而异。
第三,硅谷每一项重大投资都将获得有吸引力的回报。杰文斯悖论和当前的收入增长都无法证明这一说法。
这种区分很重要,因为一场技术繁荣可以创造巨大的消费量,同时摧毁部分供应商的价值。
三项信号将检验廉价 AI 论点
下一阶段将由可衡量的推理增长、模型路由和基础设施回报决定,而不是又一轮登上新闻头条的基准测试。
第一项信号是云服务商和芯片公司披露的推理量。投资者应关注已部署工作负载、加速器利用率和 token 处理量的持续增长。
基础设施收入上升且单位成本下降,将强化杰文斯论点。这将表明新需求正在吸收效率提升,而不只是降低客户账单。
使用量持平而价格下降,则会削弱这一论点。这种结果表明,企业主要是在利用效率为现有任务节省成本。
第二项信号是模型路由的采用。开发者如今有强烈动机将简单任务交给成本较低的系统,并将前沿模型留给困难工作。
更多路由将证实,模型输出正在低端市场成为商品。它也将显示价值流向何处:云平台、应用开发者,以及在模型之间进行选择的软件。
关注主要企业平台是否提供路由控制、自动评估和备用模型。这些功能会让切换成为常态,而非例外。
其结果将迫使高端提供商证明,更高的可靠性、安全性或推理能力足以支撑其定位。仅凭基准测试领先将不再具有同等程度的商业意义。
第三项信号是新数据中心产生的回报。资本支出告诉读者,科技公司对未来需求有多大信心。利用率和收入则揭示这种信心是否正确。
Nvidia 最近的增长表明,在最初的 DeepSeek 冲击之后,基础设施周期依然强劲。其承诺降低推理成本也说明,美国硬件公司同样在参与这场效率竞赛。
关键在于,应用增长是否足够快,能够让新系统保持繁忙。数据中心项目延期、利用率下降或云业务利润率下滑,都会削弱最乐观的解读。
持续的收入增长、更高的推理能力以及更多智能体部署,则会强化这一判断。这些结果将表明,低成本 AI 正在以快于压缩单位支出的速度扩大市场。
对于开发者和企业采购方而言,眼下的启示很实际:模型选择应成为一项基于工作负载的决策,而非永久性的阵营归属。
团队应根据自身数据评估准确性、延迟、隐私和整体工作流成本,也应保留随着市场变化而更换供应商的能力。
知识工作者也面临类似转变。更低的模型成本将使应用能够分析更多会议、文档和项目历史记录。困难之处在于如何维持有用的上下文和可信赖的源材料。
当智能体能够负担大量搜索、比较和验证步骤时,一个结构化的 AI 知识库会变得更有价值。
因此,Google News 上提出的问题并不是中国低成本 AI 模型究竟会伤害还是帮助硅谷。它们会同时带来两种影响,具体取决于所处的层面。
它们威胁高端模型的利润率,增强买方力量,并降低应用公司的技术门槛。与此同时,它们也可能为芯片、云服务、网络和数据中心带来更多工作负载。
关注下一十亿次模型调用将在何处运行、由哪个系统路由,以及客户是否愿意支付足以支撑底层基础设施的费用。这些答案将揭示,AI 版的杰文斯悖论究竟是在创造持久价值,还是仅仅带来更多消耗。



