top of page

“足够好”的 AI 模型令高端芯片需求承压

Google News 揭示了芯片投资者面临的一项尖锐矛盾:能力日益增强的 AI 模型可以运行在更便宜、专用或较旧的硬件上。这挑战了市场的一项核心假设。投资者一直以这样一种前提评估领先芯片公司:每一次模型提升都需要更多高端计算能力。

问题不在于人工智能已经停止进步,而在于许多客户并不需要为每一次请求都使用最先进的模型。能够可靠回答常规问题的较小模型,可能以单位计算成本带来更高的商业价值。

这种差异使 Nvidia 的高端加速器战略面临日益扩大的替代方案竞争。其中包括云服务商的定制芯片、面向推理的处理器、优化软件以及压缩后的开放权重模型。竞争正在从追求最高基准性能,转向以尽可能低的实际成本提供可接受的答案。

这一观点需要谨慎看待。更低成本的推理可能扩大使用规模,而非减少芯片总需求。更高效的模型还可能支持生成远多于简单聊天机器人 token 的 AI 智能体。真正的问题在于,扩大的消费是否仍将集中于高端 GPU。

Google News 的报道聚焦需求质量,而非 AI 需求本身

眼下的问题不是企业是否会购买 AI 硬件,而是其生产工作负载实际需要哪种硬件。

通过 Google News 分发的 InvestorPlace 标题反映了投资者日益增长的担忧。“足够好”的模型无需使用最大模型或最新加速器,便可完成许多日常任务。这改变了总体支出数字之下的需求质量。

训练和推理对硬件提出不同要求。训练是利用大型数据集调整模型参数的过程。推理则发生在训练完成的模型处理请求并生成答案时。

训练前沿模型仍需要密集部署的先进加速器集群。这类项目需要芯片间高速通信、大容量内存、专用网络和成熟的软件。只有数量有限的组织具备为此提供资金并运营这类系统的能力。

生产推理的覆盖面更广,需求也更多样。客户支持分类器与编程智能体的要求不同。文档提取、搜索排序、图像生成、语音转录和科学推理对硬件也提出不同需求。

这种多样性让买方拥有更多优化空间。企业可以将简单提示路由至较小模型,同时将较大模型留给复杂请求。它还可以量化模型权重,即用更少的位来表示模型数值,从而降低内存和计算需求。

开发者也可以采用蒸馏技术。这一过程训练较小模型复现较大系统的有用行为。较小模型通常会牺牲部分通用能力,但运行成本更低、速度更快。

混合专家模型提供了另一条效率路径。它们包含许多参数组,但每个 token 只激活其中一部分。这种设计能够提高模型总容量,而无需在每次请求中调用全部参数。

这些技术都不会让硬件变得无关紧要。它们改变的是哪类硬件在经济上更具吸引力。它们也让每个有效答案的成本比单一基准测试上的性能更重要。

这一衡量问题对芯片股至关重要。营收可以持续增长,但采购结构可能向成本更低的系统转移。随着软件从现有设备中榨取更多产出,高端加速器面临无竞争需求的时间也可能缩短。

因此,Google News 所呈现的不只是一则看空半导体的标题。它强调的是一场关于应如何衡量 AI 需求的争论。单靠资本支出无法揭示,买方是否需要利润率最高的芯片来支持其经常性工作负载。

同样的差异也体现在数据中心内部。一个平台可能使用高端系统进行模型开发,随后将稳定工作负载转移到专用推理硬件上。它也可能在新系统到来后,继续让较旧的加速器发挥价值。

这种再利用削弱了简单的更新周期叙事。新一代产品出现时,客户并不总会淘汰仍能正常工作的硬件。他们可以将旧系统用于较小模型、批处理、嵌入向量或对时效性要求较低的请求。

当模型通过软件改进时,压力会进一步增强。更好的内核、缓存、调度和内存管理可以在不更换底层处理器的情况下提升吞吐量。每一次改进都会延长现有基础设施的经济寿命。

对投资者而言,“足够好”描述的是一个采购门槛。一旦系统跨过这一门槛,买方就会关注延迟、可靠性、能耗、部署复杂性和总拥有成本。额外的基准性能可能不如可预测的运营经济性有价值。

高端芯片制造商面临推理经济性考验

Nvidia 及其他加速器供应商必须证明,更高性能能够在真实生产工作负载中带来更低的运营成本。

Nvidia 的地位并不只建立在原始处理器速度之上。其 CUDA 软件平台、网络产品、优化库和开发者生态系统,降低了部署大型计算集群所需的工作量。这种整合仍是一项重要防御优势。

该公司正直接回应经济性争论。Nvidia 表示,其 Blackwell Ultra 系统在选定的智能体工作负载上,可为每个 token 提供远低于 Hopper 系统的成本。其公布的推理基准测试将这些收益归因于硬件和软件的协同工作。

每 token 成本衡量的是生成模型输出所对应的基础设施费用。这个指标很有用,但并不能决定每一项采购决策。结果取决于模型、精度、批量大小、响应速度、利用率和功耗假设。

一个平台可以实现高吞吐量,却为个体用户带来较差的响应速度。另一个平台可能只有在请求以大量、可预测的批次到达时,才能生成低成本 token。企业买方必须评估与自身流量模式相近的情况。

Nvidia 的 Rubin 平台延续了同样的全系统战略。该公司表示,Rubin 整合了六款芯片,目标是推理、智能体 AI 和混合专家推理。Nvidia 在其Rubin 平台公告中宣称,相较于 Blackwell,该平台可将特定工作负载的 token 成本最多降低十倍。

这些是公司主张,并非普遍适用的结果。独立测试必须检验多个模型和服务框架。买方还需要来自持续生产使用的证据,而不只是经过优化的基准测试配置。

更大的战略要点依然明确。Nvidia 并非通过宣称每个工作负载都需要最高精度来维护高端定价。它的论点是,集成式高端系统可以提供成本最低的有效输出。

这比单独销售原始算力更有力。如果新一代机架能够以更低能耗和更高利用率完成更多工作,即使采购成本更高,在财务上仍可能合理。软件支持也能减少工程时间和部署风险。

不过,这种防御也提出了严苛标准。Nvidia 必须以快于客户优化旧 GPU 或采用替代方案的速度,持续改进整个平台。每一个高效开放模型,都会为竞争对手提供另一类可挑战这一标准的工作负载。

AMD 凭借其 Instinct 产品面临类似考验。它可以通过加速器性能、内存容量、开放软件支持以及与成熟服务器系统的整合展开竞争。当客户希望引入第二供应商时,它的机会将增加。

定制芯片带来另一种压力。Google 的张量处理单元、Amazon 的 Trainium 和 Inferentia 系列,以及其他专用集成电路,均针对特定 AI 操作。ASIC 以较窄工作负载上的效率,换取通用灵活性的降低。

这些芯片无需在所有场景中取代 GPU。它们只需在专业化具有回报的稳定高容量任务中取得份额。即便只是部分工作负载迁移,也可能影响定价、利用率和未来加速器订单。

OpenAI 也宣布与 Broadcom 合作开发一款定制推理加速器。两家公司表示,其第一代系统计划于 2026 年底前开始初步部署。这款定制加速器旨在降低大规模模型服务的成本、加快响应并提升可靠性。

该项目说明了商用芯片供应商面临的集中度风险。最大的 AI 客户拥有足够的规模,足以证明自行开发芯片是合理的。它们也掌握模型行为、流量模式和未来需求的详细信息。

定制芯片并不会自动胜过通用 GPU。设计延误、软件限制、制造问题和不断变化的模型架构,都可能抹去预期优势。当工作负载快速演变时,灵活性仍然很有价值。

不过,超大规模云服务商并不需要每个定制项目都成功。成功部署可以承接原本会使用商用加速器的工作负载。它们也能在采购谈判期间赋予买方更多筹码。

这正是为什么推理经济性而非模型热情才是核心考验。芯片公司可以从 AI 使用量增长中受益,同时又面临围绕每个生成 token 的更激烈竞争。增长与利润率压力可以同时存在。

“足够好”的 AI 改变硬件采购决策

核心逆转在于,更高的模型效率可以推动 AI 应用普及,同时削弱每次部署采用最昂贵硬件的理由。

半导体投资逻辑通常将模型能力和计算需求视为直接关系。模型越强,所需处理器越多,从而带来更多芯片销售。这种关系在前沿训练中依然存在,但生产推理使其变得更复杂。

企业通常购买的是结果。零售商需要准确的产品描述。法律团队需要可靠的文档检索。软件公司需要能通过其测试的代码建议。每个组织都存在一个性能门槛,超过这一门槛后,额外智能带来的价值有限。

能够在适度硬件上达到这一门槛的模型,可能在经济性上胜过能力更强的替代方案。更低延迟可能比更广泛的知识更重要。数据驻留、隐私控制和可预测的可用性,也可能比基准领先地位更重要。

这正是模型压缩改变采购决策的地方。量化系统使用更少内存,因此模型可以运行在更少的加速器上。较低的内存需求也能扩大可选处理器的范围。

缓存带来另一种降耗方式。缓存会存储可复用的计算结果或响应组件,从而避免系统重复执行相同工作。高缓存命中率可以显著降低处理重复提示和共享上下文所需的计算量。

推测解码同样能提升服务效率。较小的模型先提出多个可能的 token,再由较大的模型一并验证。这种方法无需接受小模型的每个预测,也能缩短等待时间。

路由提供了最直观的例子。生产服务可在选择模型前估算每个请求的难度。简单问题交给紧凑型系统,复杂推理则交由前沿模型处理。

这种架构让最大模型成为升级路径,而非默认引擎。高端系统仍然重要,但只处理总请求量中较小的一部分。对于既定用户规模,这能减少所需的顶级加速器数量。

与此同时,新应用可能抵消这些节省。AI 智能体会执行一系列操作、调用工具、检查结果并修订计划。因此,一个用户请求可能产生许多推理步骤。

推理模型产生的中间 token 也多于传统聊天系统。成本下降会鼓励开发者让模型工作更久。模型层面的效率提升,可能会在应用层面转化为更高的消耗。

经济学家将这一模式称为反弹效应。当一种资源变得更便宜时,用户往往会消费更多。在 AI 领域,更低的 token 成本可使自动化研究、持续监测和个性化软件在经济上变得可行。

Nvidia 强调了这种需求扩张的逻辑。其战略假设是,更低成本的推理会创造足够的新需求,以填满更大规模的系统。当 AI 应用从偶发性提问转向持续的后台工作时,这一观点会获得更多支持。

看空观点则聚焦于供应商结构。新增需求并不保证某一种硬件架构能占据相同份额。更便宜的模型可以在更广泛的处理器上运行,从而赋予客户更强的议价能力。

一篇关于解码经济学的学术论文指出,主流 GPU 在某些语言模型解码任务上可能存在失衡。作者提出采用算力更少、通用内存更多的系统。其分析针对的是 token 生成过程中出现的内存瓶颈。

这项提议不应被视为 GPU 的通用替代方案。学术模型依赖的假设,在生产系统中可能并不成立。工作负载各不相同,软件持续变化,买方也重视成熟的支持体系。

不过,这篇论文指出了“够用即可”的 AI 所带来的硬件机会。如果输出生成受限于内存搬运而非原始算力,那么计算密集型高端处理器就可能承载了工作负载无法充分利用的能力。

专注推理的初创公司正瞄准同一机会。它们围绕生产服务、可预测的延迟和能耗设计系统。一些公司采用非常规内存布局或大尺寸硅芯片设计,使模型数据更接近计算单元。

推理芯片市场吸引竞争者,正是因为模型的日常运行与训练截然不同。这些公司认为,专用硬件能够降低提供 AI 服务的持续成本。

它们的挑战在于软件。开发者需要编译器、库、监控工具、模型支持和可靠的升级机制。如果部署一款理论上高效的处理器需要大量定制工程,其价值就会受限。

这种张力目前有利于 Nvidia,同时也为变化留下空间。对 CUDA 的熟悉降低了在 Nvidia 生态内部的切换成本。不过,标准化模型格式和服务框架可以逐步降低替换硬件的难度。

云平台可以将这些差异隐藏在应用开发者之外。客户可能基于延迟和质量选择 API,却不知道每个请求由哪种加速器提供服务。平台可在 GPU、定制硅芯片和其他处理器之间调度工作负载。

这种抽象将采购权转向大型云运营商,也让底层芯片对终端客户不那么可见。硬件供应商随后需要基于经济性争夺平台订单,而不只是依靠开发者认知度。

Google News 的报道可能会让这一发展看似是对所有芯片股的简单威胁。但现实更具选择性。内存供应商、网络设备厂商、定制芯片设计商、晶圆代工厂和加速器公司面临的结果各不相同。

高效模型仍然需要内存和数据传输,也可能增加推理端点的数量。定制硅芯片同样需要制造产能、封装、网络和配套组件。

压力最大的是那些假设高端加速器稀缺性将原封不动延续下去的估值。“够用即可”的 AI 不会终结半导体需求,但它会挑战谁能从这类需求中获得最大的利润。

更便宜的模型并不自动意味着更少的芯片

看空逻辑很直接:效率往往会扩大消费,而前沿开发仍持续需要领先硬件。

看空论点可能高估了优化模型降低资本支出的速度。公司通常会运行多个模型,为流量高峰保留冗余容量,并为开发和生产维护独立系统。硬件需求不会与模型规模成正比下降。

利用率是另一项障碍。处理器在满负载下看起来可能很高效,但在流量波动时仍然成本高昂。客户需要备用容量,以便在高峰期满足延迟目标。

可靠的 AI 服务还需要冗余。运营商可能在多个区域或可用区复制容量。合规要求可能使它们无法将所有工作负载集中到一个系统上。

模型在不同任务中的质量仍不均衡。紧凑型模型可能在标准基准测试中表现良好,却在特殊文档、专业术语或长流程任务上失效。一个容易出错的系统可能带来的成本,会超过其节省的基础设施开支。

基准测试也会鼓励选择性比较。供应商会挑选适合其系统的模型、精度级别、批处理规模和延迟目标。一种配置下的百分比改进,很少能描述所有部署场景。

随着用户的目标更加雄心勃勃,“够用”的定义也会改变。一旦模型能够可靠地处理摘要,客户就会要求它操作软件或作出决策。这些风险更高的任务需要更强的推理和验证能力。

安全性又增加了一项要求。高效模型仍需防范提示注入、数据泄露和未经授权的工具使用。监控和验证可能带来额外的推理调用,从而提高总消耗。

智能体会放大这种效应。单个任务可能涉及规划、检索数据、执行代码和检查结果。每个阶段都可能调用一个或多个模型。

Nvidia 认为,推理与智能体系统会带来推理拐点。这一立场具有现实支持,因为更长的工作流程会产生更多 token。该公司的机会取决于这些 token 是否仍能在其平台上以最具经济效益的方式运行。

前沿训练也仍在继续。模型开发商依然在推理能力、多模态能力、科学任务和智能体可靠性方面竞争。每一次新的训练运行都可能消耗大量先进基础设施。

训练需求可以与多元化的推理需求并存。Nvidia 可能在前沿系统中保持强势地位,同时失去部分常规服务工作负载。其结果并不要求彻底胜出或崩溃。

替代芯片也面临自身的集中风险。针对当今模型架构优化的 ASIC,可能在重大设计变更后变得不那么有用。通用加速器则为这种不确定性提供了保障。

定制硅芯片项目也需要较长的规划周期。模型公司必须在芯片投入生产前预测未来工作负载。预测失误可能导致最终的处理器与当前需求匹配不佳。

软件迁移会带来额外摩擦。团队必须验证数值行为、重建部署流水线并培训运营人员。为了规避这些风险,它们可能愿意接受更高的 token 成本。

供应可靠性同样重要。成熟平台拥有制造关系、部署经验和支持能力。初创公司必须证明,它们能够持续交付系统并在多年内维护这些系统。

这些约束削弱了“够用即可”的 AI 将迅速打破高端芯片需求的说法,但并未消除定价压力。相反,它们表明竞争将是逐项工作负载、渐进展开的。

投资者还应区分单位需求与收入和利润。更多芯片可以出货,同时平均售价发生变化。收入可以增长,而毛利率可能收窄。

反过来也可能如此。一个能替代许多旧服务器的高端系统,即使实体设备更少,也能支撑高收入。仅凭芯片数量无法描述经济结果。

能源供应进一步增加了预测的复杂性。数据中心面临电力和冷却限制。即使有更便宜的处理器,买方也可能为每兆瓦能产出更多有效工作的系统支付更高价格。

Nvidia 的新一代平台通过机架级设计来应对这一限制。该公司称,其系统通过协调处理器、网络和软件,提高了每兆瓦吞吐量。独立的生产证据将决定这些收益的适用范围有多广。

最合理的结论是有条件的。当高效模型在替代方案上满足质量要求且总成本更低时,它们会威胁高端硬件。当前沿系统提供更高利用率、更低延迟、更好的软件支持或更高能源效率时,它们仍将保持优势。

这比统计模型发布数量更难回答的投资问题。它需要有关工作负载部署的证据,而不仅仅是 AI 采用情况的公告。

芯片投资者接下来应关注什么

三个信号将显示,“够用即可”的 AI 是在重新分配半导体需求,还是仅仅创造了新一轮计算消费。

第一个信号是定制加速器的生产部署。OpenAI 和 Broadcom 表示,其推理系统计划在 2026 年底前完成初步部署。投资者应关注它是否承载了有意义的客户流量,以及是否从内部测试扩展出去。

成功部署将强化需求重新分配的论点。这将表明,一家大型模型提供商可以将持续性工作负载从商用 GPU 转移出去。延迟、使用范围狭窄或经济性疲弱,则会凸显灵活加速器平台的价值。

第二个信号是在可比条件下的每 token 成本。Nvidia、AMD、云服务商和推理初创公司采用不同假设发布性能声明。有价值的比较必须控制模型质量、响应速度、利用率、精度、功耗和软件开销。

多个热门模型的独立结果将澄清专用芯片是否具有可重复的优势。如果 Nvidia 在广泛场景中领先,“够用即可”的威胁将被削弱。结果若参差不齐,则会支持一个碎片化市场:硬件选择取决于每项工作负载。

第三个信号是推理增长与加速器收入之间的关系。芯片公司和云服务商应披露,更多 token 使用是否需要相应更多的资本支出。投资者应审视数据中心增长、基础设施折旧、利用率,以及管理层对工作负载部署的评论。

若 token 数量上升而高端加速器采购放缓,将强化看空解读。若尽管软件效率提升,高端系统仍持续增长,则会支持反弹效应的论点。这将表明,智能体和推理应用正在消耗这些节省。

Google News 的头条将继续把这场竞争塑造成对芯片股的一次评判。读者不应将某个高效模型视为行业逆转的证据,也应避免假设 AI 使用量增长必然意味着供应商的经济效益保持不变。

真正持久的问题在于:在计入质量、延迟、能耗和工程成本后,各类工作负载最终会落在哪里。前沿训练、交互式推理、批量推理和嵌入式应用不会汇聚到同一种处理器上。

这种碎片化可能让半导体供应链的多个环节受益,包括定制芯片设计商、存储器生产商、网络设备供应商、晶圆代工厂和封装服务商。但它也可能加剧对高端加速器利润率的竞争。

知识工作者面临类似的评估难题。供应商的主张通过新闻稿、基准测试、财报电话会议和新闻聚合渠道传来。将原始文档保存在一个可搜索的知识库中,可以更方便地长期比较各项假设。

对投资者而言,下一步并不是预测芯片会消失,而是要将 AI 整体增长与每家供应商的经济效益区分开来。关注生产环境中的推理运行在哪里、哪些系统赢得了重复订单,以及更低的 token 成本能否足够快地扩大使用量,从而支撑高端需求。

下一波 Google News 报道会显示定制加速器正在承接持续性工作负载,还是 Agentic AI 会吸收所有效率提升?这些证据将决定“足够好”的 AI 会成为芯片股的长期难题,还是成为数据中心继续扩张的又一个理由。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page