芯片供应链危机2.0:NVIDIA的$1T积压订单对AI发展的意义
- Aisha Washington

- 6月5日
- 讀畢需時 2 分鐘
NVIDIA 持有超过一万亿美元的订单,持续超过一年。超大规模数据中心现在正在争夺每一台可用的 H100、H200 和 Blackwell 单元。较小的 AI 团队面临更长的等待时间,这将产品发布推迟到 2027 年。
积压订单源于云服务提供商和企业客户的持续需求。TSMC 的先进封装生产线无法快速扩张以匹配订单。这一差距现在决定了谁能率先出货模型,谁必须推迟训练运行。
NVIDIA 订单分配偏向最大的买家。 Microsoft、Google 和 Amazon 获得首批生产名额。中型云运营商仅获得部分分配,覆盖其请求的一小部分。初创公司排在队列末尾,或转向旧款 H100 库存。
TSMC CoWoS 产能构成物理限制。NVIDIA 表示,CoWoS 产量将在 2026 年增长 60%,但仍低于预期需求。每增加一块晶圆都需要新设备,安装和验证需耗时九个月。
Capacity source: TSMC 台湾现有 CoWoS 生产线
Expansion limit: 新设施仅在 2027 年年中后才能达到满产
Allocation result: 客户通话中公布的优先级列表保持不变
无法等待的团队现在重新关注 AMD 和 Intel。AMD MI300X 在某些工作负载中提供相当的训练吞吐量,但在软件成熟度上落后。Intel Gaudi 3 功耗更低,但峰值性能有所降低。
AMD MI300X
- 软件栈仍需针对常见框架进行额外调优
- 内存带宽在已发布基准测试中比 Blackwell 低 15%
Intel Gaudi 3
- 可通过部分云服务提供商立即获得量产供应
- 编译器支持范围仍窄于 CUDA
AI 初创公司报告时间表延长六至九个月。一个原计划 2026 年发布的团队已将模型训练转移到租用的旧款 GPU 上,效率降低 40%。另一个团队暂停招聘,直至 2027 年初硬件到货。
短缺迫使团队在模型规模上做出艰难选择。团队减少上下文长度或限制微调轮次以适应可用硬件。研究议程从新的预训练运行转向推理优化。
观察者质疑,如果替代方案缩小软件差距,NVIDIA 是否能维持领先。AMD 已发布更新驱动程序,在近期测试中将训练时间缩短 12%。Intel 报告有企业合同完全绕过 NVIDIA 队列。这些进展相对于总需求而言仍较小。
NVIDIA 每季度报告积压数据,但未细分客户群体。分析师指出,实际出货量的可见度仍然有限。来自 TSMC 的 CoWoS 利用率独立核查将明确真正的瓶颈点。
三个信号将显示供应压力是否缓解。首先,TSMC 10 月 CoWoS 生产线利用率报告。其次,AMD 下一次财报中关于 MI350 量产承诺的更新。第三,任何新的企业 GPU 租赁列表,表明超大规模数据中心有剩余产能。
今天获得分配的团队将拥有持续至 2026 年底的日程优势。那些没有确认名额的团队必须围绕可用替代方案重新设计路线图,或接受进一步延误。


