top of page

Microsoft 和 SK Hynix 凸显 AI 热潮的物理极限

Microsoft 报告季度营收达到 900 亿美元,但其业绩仍让 Google News 上的一个顽固矛盾位居显著位置:AI 需求依然超过产能。SK Hynix 从半导体供应链传递了类似信息。其创纪录的业绩并未消除人们对内存供应、制造投资或新增产能投产时点的担忧。

两份报告共同挑战了有关 AI 热潮的一项乐观假设。投入更多资金并不会立即带来更多可用算力。数据中心需要处理器、内存、存储、网络、电力、建筑和经过培训的运营人员按正确顺序到位。

这一协调问题如今与需求本身同样重要。Microsoft 必须决定,如何让每台可用服务器产生最高回报。SK Hynix 则必须在高带宽内存、服务器 DRAM、移动端组件和传统产品之间分配有限的产能。

主要矛盾已不再是 AI 需求与采用前景的不确定性,而是承诺中的 AI 增长与实现它所需的物理系统之间的矛盾。受益于稀缺性的公司,也面临着最严峻的执行考验。

财报确认了物理瓶颈

Microsoft 和 SK Hynix 描述的是同一套受限生产系统的不同层面。

Microsoft 于 7 月 29 日发布的第四财季业绩显示,客户兴趣并非眼前的问题。根据其季度业绩,公司季度营收达到 900 亿美元。Microsoft Cloud 营收达到 593 亿美元,而 Azure 及其他云服务营收增长 43%。

在整个财年中,Azure 营收首次超过 1,000 亿美元。Microsoft 365 Copilot 的付费席位也超过 3,000 万。这些数字表明,AI 需求正从实验阶段走向签约云服务使用和办公场景部署。

然而,营收增长并不代表 Microsoft 拥有满足所有所需工作负载的基础设施。该公司多次表示,客户需求超过可用供应。这一缺口迫使 Microsoft 在 Azure 客户、Copilot 产品、GitHub 服务、安全工具和内部研究之间分配计算能力。

受限资源并非某一种特定芯片。一台 AI 服务器需要用于模型计算的加速器、用于协调的 CPU,以及能够足够快地供给数据的内存。它还需要网络、存储、冷却系统和已通电的数据中心机位。

一个缺失的组件就可能延误整套系统。如果内存出货延迟,数千颗加速器的价值也十分有限。在电网接入和服务器安装就绪之前,一栋完工的建筑也无法产生收入。

SK Hynix 在这套系统中占据了最关键的上游位置之一。该公司生产高带宽内存,即 HBM;它将多个内存层堆叠在一起,为 AI 处理器提供数据。HBM 有助于避免昂贵的加速器等待数据。

该公司第二季度更新显示,营收为 79.3187 万亿韩元,营业利润为 60.5426 万亿韩元。根据公司的业绩结果,其营业利润率达到 76%。SK Hynix 还表示,HBM4 已在该季度进入量产。

这些数据反映出异常强劲的需求和有利的内存市场环境,也说明了稀缺产能的价值有多高。高利润率并不能在一夜之间创造额外的晶圆厂产能。

半导体扩产需要专用设备、洁净室建设、工艺认证、封装产线和客户测试。每个环节都会带来时间与良率风险。良率衡量的是制造芯片中符合规定规格的比例。

这正是两份报告属于同一个故事的原因。Microsoft 在尝试提供云容量时看到这一约束;SK Hynix 则在决定工厂能够生产哪些内存产品时感受到它。

Google News 的新闻周期将两份报告视作独立的财报事件。从运营角度看,它们描述的是一条几乎没有延误余地的单一供应链。

Google News 显示需求正超越 AI 产能

关键迹象不只是 AI 基础设施支出仍然很高,而是可用产能几乎能立即转化为收入。

根据其财报电话会议,Microsoft 预计将在 2026 日历年投入约 1,900 亿美元资本支出,其中约 250 亿美元与更高的组件成本有关。

资本支出涵盖的内容远不止 AI 加速器。Microsoft 将支出分为使用寿命较短的设备和长期资产。GPU、CPU、网络设备和存储主要属于前一类;建筑、土地及配套基础设施的运营周期则可能长得多。

这一区别很重要,因为设备能够比新园区更快开始产生云收入。一个数据中心园区可能需要数年时间来规划、获批、建设、通电和部署完成。组件交付也可能错过设施准备就绪的时点。

因此,Microsoft 面临两项相互关联的短缺:它需要足够的长期数据中心容量,也必须迅速为现有设施配齐设备。一方面的支出无法完全弥补另一方面的延误。

公司正通过规模异常庞大的项目作出回应。Microsoft 宣布计划在得克萨斯州 Pecos 建设园区,预计将增加约两吉瓦容量。根据Pecos 项目,其建设和开发预计将持续五至七年。

这一时间表揭示了市场核心的不匹配。AI 开发者可以在一年内多次发布模型,而支撑这些模型的电力和建筑则遵循以年为单位的基础设施时间线。

一座两吉瓦园区所需的也不只是资本。Microsoft 还必须获得土地、电网接入、许可、建筑劳动力、冷却系统和可靠的设备供应。即使融资仍然到位,当地阻力或输电延误也可能放缓可用产能的形成。

内存则带来另一项时间问题。HBM 比传统 DRAM 消耗更多制造资源,因为它涉及先进堆叠和封装。扩大 HBM 产量可能会限制其他内存产品可获得的产能。

这种分配效应会扩散稀缺性。AI 加速器需求可能收紧服务器内存、个人电脑、智能手机和存储产品的供应。最大云计算公司以外的买家将不得不争夺更小份额的产出。

Microsoft 的采购能力强于大多数基础设施买家。它能够签订长期协议,并以可靠的需求预测支持供应商。不过,即便是 Microsoft,也无法瞬间创造晶圆厂产出或电力容量。

规模较小的云服务提供商和企业买家的处境更为艰难。他们往往缺乏相当的采购规模、地域灵活性或定制硬件获取能力。Microsoft 可以通过资源分配来管理的延误,可能会令较小项目完全停摆。

这进一步赋予最大的云平台结构性优势。它们能够在不同地区和产品之间调配稀缺资源,也可以优先安排利用率更高或客户承诺更强的工作负载。

这种优势并不能消除风险,而是将资源分配决策集中在平台内部。Microsoft 必须判断,一台服务器应当用于支持外部 Azure 需求、Copilot 服务、GitHub,还是模型开发。

每项选择都伴随着机会成本。将 GPU 分配给内部产品,就意味着可供云客户使用的 GPU 更少;服务外部客户则可能延缓 Microsoft 希望借此建立持续使用的产品改进。

因此,供应约束已成为一种战略筛选机制。它决定哪些 AI 工作负载能够投入生产,而不只是决定企业采购硬件的速度。

Microsoft 必须将稀缺硬件转化为持久收入

Microsoft 面临的真正考验,是能否将每个新增容量单位转化为有价值、可重复的客户活动。

该公司拥有大量需求证据。Azure 年营收超过 1,000 亿美元,Microsoft 365 Copilot 的付费席位超过 3,000 万。Microsoft 还报告称,开发者、安全、数据和业务应用的使用正在扩大。

然而,付费使用权和高效使用是不同的信号。一家公司可能在员工形成可重复的工作流程之前就购买席位。云客户也可能在其应用产生可持续的经济回报之前预留容量。

这带来了硬件之外的第二项约束。在 AI 工具成为日常运营中可靠的一部分之前,客户需要数据、治理机制、评估系统和重新设计的流程。

一家企业可能部署助手来总结内部文件。这项任务听起来简单,但准确结果需要权限控制和最新的源材料。系统还必须向用户展示答案的来源。

编码智能体则有不同要求。它需要访问代码库、测试环境、文档和部署控制机制。它的价值取决于完成的工作,而不是生成 token 的数量。

Microsoft 的基础设施支出假定这些场景中的使用将不断深化。该公司还必须提高效率,因为每一次不必要的计算都会消耗受限产能。

软件优化无需新建建筑,就能释放有效供给。更好的调度能够将工作负载部署到合适的硬件上。更小的模型可处理常规请求,从而为更复杂的任务保留能力更强的系统。

模型路由在应用层采用了这种方法。一项服务会评估请求,并将其导向在成本和能力上适当的模型。当大模型并无必要时,这一过程可以减少浪费。

定制芯片提供了另一条路径。Microsoft 可以针对特定功能设计处理器,而非完全依赖通用加速器。然而,定制硬件仍需要内存、制造产能、网络和可靠的软件支持。

Microsoft 也在扩展其处理器选择。其扩大的 AMD 基础设施包括面向 AI 推理、数据处理和工程工作负载的系统。推理是运行训练完成的模型以生成输出的过程。

采用多家供应商可以降低对单一加速器路线图的依赖,也能够让不同工作负载匹配更高效的硬件。但异构设备集群会带来软件和运营复杂性。

开发者需要能够在不同处理器类型上稳定运行的工具。运营人员则需要适用于不同配置的监控、调度和维护系统。当工作负载在地区之间迁移时,客户也可能需要可预测的性能。

因此,仅靠产能无法保证具吸引力的经济效益。Microsoft 必须在保持可靠性的同时提高利用率,还必须说服客户,AI 使用能够带来可衡量的业务成果。

该公司向按使用量计费模式转型,使这一要求更加明确。收入越来越取决于客户使用 AI 系统的频率,而不只是他们是否拥有许可证。

这种安排可以让付费与价值保持一致,但也会让采用不足的问题显现出来。无法连接自身数据或重新设计流程的客户,消耗的产能会更少。未使用的承诺最终会成为续约风险。

Microsoft 的优势在于拥有技术栈中的多个层级。Azure 提供基础设施,而 Microsoft 365、GitHub、Dynamics 和安全产品则提供应用。随着客户行为的发展,公司可以在这些层级之间转移价值。

不过,所有权也会让内部围绕稀缺资源展开竞争。Microsoft 必须决定哪个产品优先获得产能。它还必须避免过度偏向内部应用,以至于 Azure 客户持续面临短缺。

短缺如今或许支撑着定价和利用率。长期回报将取决于供应扩张后客户取得的成果。稀缺性可能掩盖低效产品,因为几乎每个可用系统都能找到买家。

当客户可以比较更多供应商和硬件选项时,更严峻的考验便会开始。届时,Microsoft 需要依靠使用量、可靠性和集成能力来捍卫其投资,而不能仅靠供应有限。

SK Hynix 受益于稀缺性,但承担制造风险

SK Hynix 处于有利的市场地位,但其客户正要求它在异常不确定的技术转型期间扩大产能。

HBM 已变得不可或缺,因为现代 AI 处理器的计算速度快于传统内存供给数据的速度。其堆叠式设计在让组件与处理器保持物理距离更近的同时,提高了带宽。

每一代新的 HBM 都提高了性能目标和生产难度。HBM4 在接口、封装和定制化方面引入了变化。SK Hynix 表示,其 HBM4 产品满足客户在速度、效率和成本竞争力方面的要求。

在客户大规模部署这些产品之前,这些说法仍属于公司主张。量产是一个重要里程碑,但产量、良率、认证和交付进度决定商业成功。

客户可能批准初始样品,但后续生产仍可能遭遇瓶颈。封装产能可能落后于内存晶圆产出。随着制造商扩大产量或引入定制化设计,良率也可能发生变化。

SK Hynix 也无法将每条生产线都投入 HBM。它还服务于服务器 DRAM、移动内存、个人电脑和存储市场。这些客户同样需要可靠的供应。

该公司的产能分配决策可能加剧其他领域的价格压力。转向利润率更高的 AI 内存的工厂,会生产更少的传统组件。即使总体内存投资增加,这也会造成短缺。

内存展望报道,CEO Kwak Noh-jung 警告称,该行业正走向 2027 年最严重的供应短缺。他还预测,到 2030 年以后,需求将超过 SK Hynix 的生产能力。

这一预测支持持续投资的理由。但它也值得审视,因为当客户相信未来产能将持续稀缺时,供应商会从中受益。长期承诺能提高可见性,并降低扩张风险。

内存市场历来经历剧烈周期。短缺会促使增加产能,客户囤积库存,定价最终吸引更多供应。随后,在新工厂达到满产之前,需求可能转弱。

AI 可能改变这一周期,但不会废除它。最大的云计算公司正以惊人的速度扩张基础设施。它们的计划假定,模型训练、推理和智能体将持续消耗更多计算资源。

效率提升使这一假设变得更复杂。更好的模型能够以更少的计算产生有用结果。压缩、缓存、专用处理器和改进的软件可以降低每项任务的内存需求。

更低的计算成本也可能刺激更多使用。这种反弹效应意味着,效率并不会自动降低总需求。更便宜的推理可能促使开发者为更多产品和工作流程添加 AI 功能。

SK Hynix 必须在不了解哪种力量将占主导的情况下投资。扩张不足会使收入机会流失并令客户受挫。过度扩张则可能在新工厂开始运营时带来低利用率风险。

该公司还面临实力强劲的竞争对手。Samsung 在内存和先进制造领域展开竞争,而 Micron 正在扩大其 HBM 地位。客户有强烈动机认证多家供应商。

多供应商采购可降低单一生产问题导致加速器发布受阻的风险。它也让买方在合同谈判中拥有筹码。对供应商而言,赢得认证并不保证永久的市场份额。

SK Hynix 当前的盈利为扩张提供了资源。强劲的盈利能力也提高了预期。即使基础市场仍然紧张,投资者也可能惩罚延误,尤其是在新一代 HBM 推出期间。

这种紧张关系出现在第二季度业绩前后。创纪录的营收和利润并未消除市场对出货时点和资本需求的担忧。市场既希望获得由稀缺性支撑的收益,也希望看到无瑕疵的扩张。

制造业很少能在没有挫折的情况下同时实现这两点。新产品会遇到良率爬坡、设备延误和认证变化。问题不在于每个季度是否都会完美。

更有意义的问题是,SK Hynix 能否在提高产量的同时保持客户信心。它必须做到这一点,同时避免在供应条件变化时造成损害回报的失衡。

供应约束超出芯片范围

AI 瓶颈是一项系统性约束,因此仅增加内存或加速器无法单独解决问题。

Microsoft 的数据中心需要能够支持高密度计算部署的电力连接。这些连接依赖于发电、输电、变电站、设备、许可,以及与公用事业公司的协调。

电力项目的周期通常长于服务器采购周期。云计算公司可以在公用事业公司保证供电之前订购硬件。这种错配可能导致设备闲置等待,或迫使部署转向其他地区。

散热带来另一项限制。AI 系统在每个机架中集中消耗大量电力,产生的热量可能令传统设计难以排除。运营商可能需要液冷、重新设计设施,或降低部署密度。

网络同样影响可用产能。加速器必须在模型训练和推理期间快速交换数据。网络能力不足的集群无法提供其理论计算性能。

存储也很重要,因为模型和应用会移动海量信息。训练系统需要数据集和检查点,而推理服务需要模型权重和缓存上下文。缓慢的存储可能导致加速器未被充分利用。

HBM 提高了处理器附近的带宽,但不能取代内存层级的其余部分。服务器仍需要传统 DRAM 和存储。这些类别的短缺可能限制完整系统的出货。

这种相互依赖性解释了为何资本支出不会立即转化为收入。设备来自不同供应商,抵达时间表各不相同。运营商必须在客户能够使用前进行集成、测试和连接。

地理位置带来另一项约束。由于延迟、数据驻留或监管要求,客户可能需要特定地区的产能。其他地方的可用服务器并不总能满足这种需求。

Microsoft 可以在不同地区之间转移部分工作负载,但受监管的数据和实时应用提供的灵活性较低。该公司可能在一个地点拥有过剩产能,同时拒绝另一个地点的需求。

云服务提供商越来越多地利用外部合作伙伴补充自有设施。合作关系可以加快部署并分散建设风险,但也可能引入涉及合同、网络、运营和服务质量的依赖关系。

因此,供应问题有利于协调能力强的公司。采购规模很重要,但整个系统的执行更重要。当电网接入延误时,大额订单并无帮助。

这也迫使企业买家以不同方式规划。团队不能假定每种所需的加速器配置都会按需提供。他们可能需要测试更小的模型、替代芯片或灵活的部署地区。

软件架构成为供应管理的一部分。为单一模型和单一加速器类型设计的应用,可能在产能收紧时陷入困境。可移植系统为买家提供更多选择。

开发者还应在预留稀缺资源之前衡量工作负载价值。一个只节省几分钟的应用,未必值得持续使用昂贵模型。路由和缓存可以为更困难的任务保留产能。

知识工作者会间接感受到这一约束。缓慢的产品发布、使用限制和区域可用性可能反映基础设施分配,而非软件需求疲弱。随着供应商优先安排客户和产品,功能访问可能有所不同。

同一问题也影响 AI 可靠性。接近满负荷运营的供应商,对突发需求高峰的余地更小。当备用基础设施仍然有限时,高效调度和冗余变得至关重要。

这些都不意味着立即发生服务危机已成定局。Microsoft 仍在增加产能,供应商也在继续扩大生产。令人担忧的是,这条长链中的容错空间很小。

一个层面的延误可能放大另一个层面的问题。内存延迟可能推迟服务器安装,而电力延迟可能拖延整个集群。尽管需求强劲、支出已承诺,客户仍需等待。

这就是为何供应故事远不止半导体可用性。它是一项连接工厂、公用事业、建设、云软件和客户采用的工业协调挑战。

这些数字仍未证明什么

强劲的盈利证实了稀缺性和需求,但并不能证明当前投资的长期回报。

Microsoft 的收入增长表明客户正在购买云服务和 AI 产品,但并未揭示每项 AI 工作负载的盈利能力,或每台新部署服务器的利用率。

该公司报告的是广泛的业务部门业绩,而不是每个 AI 产品的完整利润表。投资者可以观察资本支出、云业务增长和公司利润率,却无法独立计算每个加速器集群的回报。

Copilot 席位增长是另一个令人鼓舞的信号。然而,付费席位并不能显示每日参与度、完成的工作量或续约意愿。随着早期企业协议进入续约日期,这些指标变得更加重要。

已签约的云服务承诺也需要谨慎解读。积压订单显示客户已根据明确协议承诺未来支出,但不能保证每项工作负载都会带来有吸引力的利润率。

Microsoft 必须在确认大部分相关收入之前先行支出。在此期间,建设、硬件和折旧可能对现金流和利润率造成压力。效率提升可以抵消这种压力,但无法消除执行风险。

SK Hynix 面临着类似的衡量缺口。创纪录的营业利润展现了异常强劲的市场环境,但并不能证明当前利润率将在下一轮产能周期中持续。

该公司的短缺预测延伸至 2030 年以后。如此遥远的估计取决于 AI 需求、模型效率、客户投资、竞争对手产出和制造良率。每个变量都可能发生重大变化。

长期供应协议可以减少不确定性,但也可能带来新的疑问。合同条款可能包括供货量灵活性、定价公式或面向特定客户的产品。公开摘要很少披露所有这些细节。

因此,Google News 的叙事可能变得过于简单。“需求超过供应”听起来对卖方毫无疑问是利好,但这句话忽略了资本密集度、客户集中度,以及在市场接近高点时扩张的风险。

云计算公司和内存供应商依赖于相对较少的一批主要 AI 支出方。他们目前的承诺看起来具有持续性,但一家大型客户的战略变化仍可能改变预期需求。

竞争带来了另一层不确定性。Microsoft 正在实现硬件多元化,并开发定制处理器。Google 拥有 tensor processing units,而 Amazon 则拥有 Trainium 和 Inferentia 产品线。这些系统可能改变对供应商的需求。

定制加速器并不会消除对先进内存的需求,但可能改变内存规格、系统架构或采购关系。供应商必须根据持续变化的客户路线图调整生产。

模型架构同样可能改变需求。稀疏系统会针对每次请求只激活模型的一部分。量化则以更少的比特存储模型数值,从而减少内存使用和计算需求。

这些方法可以降低单项任务所需的资源,也能让更大规模的部署在经济上可行,从而增加总体使用量。当前盈利无法判断在数年时间内哪种效应会占主导。

监管仍是另一个变量。数据中心项目面临环境审查、电网要求和地方政治阻力。出口管制可能限制先进芯片的销售地区。

核心不确定性不在于 AI 需求是否存在。Microsoft 的业绩提供了有力证据证明需求确实存在。不确定的是,在完整的基础设施成本到来后,这些需求能创造多少可持续利润。

读者应避免走向两个极端。产能短缺并不能证明存在不可持续的泡沫,创纪录的支出也不能保证每个项目都会产生可接受的回报。

更有力的判断应基于运营证据。关注产能投入使用的速度、客户使用 AI 产品的深度,以及供应商能否在不持续出现生产问题的情况下提高产出。

三个信号将检验 AI 供应论点

下一阶段的胜负将取决于产能交付、HBM4 执行和客户使用情况,而不是新一轮泛泛的 AI 公告。

第一个信号是 Microsoft 将支出转化为可产生收入的产能的能力。未来财报应显示,在报告中的限制逐步缓解之际,Azure 能否保持强劲增长。更快的部署将支持 Microsoft 关于需求能够吸收新增基础设施的说法。

投资者应将产能评论与云业务增长和利润率进行比较。如果供应扩大而 Azure 增长依然强劲,短缺论点就会更具可信度。稳定的利润率还将进一步表明,效率提升正在抵消基础设施成本。

如果资本支出增加却没有带来相应的产能或收入,这一论点就会被削弱。持续的建设延误、设备部署缓慢或较弱的云业务指引,都将表明协调问题正在侵蚀预期回报。

第二个信号是 SK Hynix 的 HBM4 量产爬坡。客户认证、出货增长、封装产能可用性和制造良率,将显示大规模生产能否成为可靠的高产量供应。

成功执行将强化内存需求仍具持续性的观点,也将表明 SK Hynix 能够在不牺牲交付可靠性的前提下完成艰难的产品转换。

反复出现的出货延迟将改变这一解读。它们将表明,报告中的稀缺性部分反映了生产复杂性,而不只是需求。竞争对手可能在这些延迟期间获得认证机会。

第三个信号是可量化的企业使用情况。Microsoft 已披露大量席位数量和不断扩大的云需求。下一个问题是,客户是否正在建立可重复的工作流程,以支撑续约和消费增长。

使用情况之所以重要,是因为它将基础设施建设与经济价值联系起来。已部署的助手必须节省时间、提升产出或增加收入,否则客户最终将减少承诺。

关注按消费计费收入、客户扩张和披露的参与度增长。同时也要关注早期 AI 合同到期后的续约表现。强劲的续约将表明,采用正在从宣传层面转变为运营层面。

疲弱的参与度将削弱最激进的基础设施假设。客户进行试验时,云需求可以在一段时间内保持高位。可持续增长要求这些试验转化为生产系统。

对于开发者和企业采购方而言,务实的应对方式不是精确预测稀缺何时结束,而是构建能够适应硬件、模型和区域可用性变化的应用。

测试更小的模型是否能够处理日常工作。在重复上下文适用时使用缓存。跟踪每项工作负载带来的业务结果,而不只是基准测试性能。

团队还应保留基础设施选择背后的决策依据。需求、评估和部署证据在快速推进的项目中很难重建。可搜索的技术知识库能够在约束条件迫使重新设计时,持续保留这些背景信息。

Google News 将继续发布有关创纪录支出、创纪录盈利和新一代半导体的自信标题。更有价值的问题是,每一层物理基础设施是否会在客户需要时到位。

Microsoft 必须证明自己能够将服务器转化为可持续的使用量。SK Hynix 必须证明自己能够在不失去制造纪律的前提下扩张先进内存产能。客户必须证明,AI 工作负载创造的价值足以支撑这两类投资。

未来一个季度,请关注这三个信号,而不是下一则公告的规模。产能是否正在变得可用?HBM4 是否在可靠出货?客户是否正在扩大真实工作负载?这些答案将显示,稀缺性是在支撑一个可持续的市场,还是暂时掩盖其最脆弱的经济基础。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page