top of page

OpenAI 的 Samsung 芯片计划预示与 TSMC 分拆代工合作

9月11日
讀畢需時 15 分鐘

OpenAI 表示,尽管其首款定制 AI 加速器依赖 TSMC 制造,公司仍在与 Samsung 合作开发下一代处理器。OpenAI 披露的 Samsung 芯片计划,为一个已瞄准超大规模部署的项目引入了潜在的第二条代工路径。

OpenAI Korea 总经理 Harrison Kim 在 9 月 9 日于首尔举行的新闻发布会上介绍了联合生产及处理器研发的进展。据下一代芯片报道称,他的发言并未明确产品、制造工艺、生产日期或订单规模。

这些缺失的细节正是故事的核心。OpenAI 和 Broadcom 已公布 Jalapeño——一款预计将在 2026 年年底前进入 OpenAI 数据中心的推理加速器。该第一代处理器由 TSMC 制造。

Samsung 可能制造后续一代 Jalapeño、另一款 OpenAI 处理器,或双方联合开发的设计。每种可能性都将带来不同的技术和商业影响。

因此,最重要的信号并不是已确认的 Samsung 量产订单,而是 OpenAI 在扩展其定制芯片项目的同时,愿意建立不止一条制造路径。

这一策略给 TSMC、Samsung、Nvidia 和 OpenAI 自身都带来压力。TSMC 必须守住这家高价值先进制程客户,而 Samsung 则必须证明其能够提供稳定的良率和先进封装产能。

Nvidia 面对的是一家希望更深入掌控推理经济性的客户。OpenAI 则必须在不割裂其软件和部署体系的前提下,将雄心勃勃的供应商网络转化为可靠的硬件。

OpenAI 已将与 Samsung 的合作从存储器扩展至处理器

双方关系如今已超出存储器采购范围,但 OpenAI 尚未界定 Samsung 的确切制造角色。

Kim 表示,OpenAI 与 Samsung 在开发中处理器的联合生产和研究方面已取得实质性进展。他在首尔的简报中没有提供技术规格或商业条款。

这种表述很重要,因为半导体领域的“生产”可以涵盖多种活动。Samsung 可能制造处理器裸片、提供设计服务、负责封装、供应存储器,或承担其中多种角色。

OpenAI 也没有说明相关讨论是否涉及 Jalapeño。该系列的首款处理器由 Broadcom 参与开发,并由 TSMC 制造。

最初的芯片报道指出了几种尚未解决的可能性。Samsung 可能成为第二供应来源、制造另一款 OpenAI 设计,或参与一款尚未披露的未来处理器。

这些选项不应被视为可以互换。将一款先进芯片移植至不同晶圆代工厂,远不只是把同一套设计文件发送到另一家工厂。

每家代工厂都有自己的工艺设计套件、晶体管库、物理规则和制造优化方案。工程师往往必须为另一套生产工艺修改设计中的重要部分。

因此,真正的第二供应来源版本需要大量工程工作,还需进行独立验证、封装认证、性能调优和软件测试。

从一开始就面向 Samsung 设计的未来一代产品,则是另一条路径。OpenAI 可以在不同代工厂之间分配其路线图,而非在两家供应商处复刻同一款处理器。

例如,一家代工厂可能负责高产量推理处理器,另一家则制造在性能、功耗或封装需求上不同的专用部件。

OpenAI 尚未确认这种分工。尽管如此,其措辞表明 Samsung 的参与已超出此前公布的存储器合作。

此前的合作已涵盖多家 Samsung 旗下公司。Samsung Electronics 同意供应先进存储器,其他关联公司则探索数据中心、海事和基础设施项目。

OpenAI 预计 Stargate 对 DRAM 的需求最高可达到每月 90 万片晶圆投片。晶圆投片是指硅晶圆进入制造流程、尚未成为单颗存储芯片之前的阶段。

Samsung 基础设施协议还包括另一家领先存储器制造商 SK hynix。相关公司描述的是加快产能扩张,而非固定的近期采购计划。

加入处理器合作改变了这一伙伴关系的战略属性。存储器让 Samsung 成为重要的组件供应商,而处理器制造则可能使其进入 OpenAI 的核心计算路线图。

这种区别仍然重要。OpenAI 披露的是合作,而不是最终敲定的大规模晶圆代工合同。

读者应将这一公告视为方向性信号。它揭示了 OpenAI 如何组织未来供应,即使眼下的生产细节仍未公开。

OpenAI Samsung 芯片战略背后的规模

当预期需求、供应风险或路线图广度超过支持两条制造路径的成本时,第二家代工厂就变得合理。

OpenAI 的定制加速器项目并非被定位为一项有限的实验。该公司此前与 Broadcom 宣布,计划部署 10 吉瓦由 OpenAI 设计的加速器和网络系统。

部署计划于 2026 年下半年开始。两家公司表示,这一推进将持续至 2029 年年底。

10 吉瓦描述的是电力容量,而非芯片数量。实际部署的处理器数量将取决于机架设计、利用率、配套设备以及每颗加速器的功耗范围。

即使考虑这些限定条件,该目标仍显示出工业级基础设施规模,也解释了为何 OpenAI 可能在后续处理器进入量产前重视制造冗余。

公司的定制加速器项目将处理器设计、网络、机架和模型服务连接起来。这种整合旨在优化完整推理系统,而非单独的一颗芯片。

推理是已部署模型回答提示词、生成媒体内容或执行智能体任务时所进行的计算。其经济性取决于吞吐量、延迟、能耗、存储器、网络和利用率。

围绕 OpenAI 自身工作负载优化的处理器可以改善这些变量。然而,专用硬件只有在足够多的工作负载能够持续使用时,才能真正产生节省。

这项要求有利于规模化。OpenAI 运营着面向消费者的产品、企业服务、开发者 API、编程系统和研究工作负载,它们的需求模式各不相同。

一款定制处理器必须支持足够多的这些工作负载,才能证明其开发和部署成本合理。它还必须随着 OpenAI 模型和服务方法的变化持续保持适用性。

该公司的基础设施雄心并不止于其处理器项目。OpenAI 推出 Stargate 时表示,计划在四年内向美国 AI 基础设施投资 5,000 亿美元。

Stargate 基础设施计划最初由 OpenAI、SoftBank、Oracle 和 MGX 参与。Microsoft、Nvidia、Arm 和 Oracle 被列为技术合作伙伴。

OpenAI 随后将这一计划扩展至国际范围。其与韩国达成的协议涵盖存储器生产、数据中心规划及相关基础设施工作。

每月 90 万片 DRAM 晶圆投片的预测提供了另一项规模指标。这并非对处理器晶圆的预测,两项数字不应合并计算。

不过,AI 系统中的存储器需求和加速器需求会同步增长。先进加速器需要高带宽存储器,而存储器堆叠通常紧邻计算裸片。

对这些组件进行封装会形成另一项潜在瓶颈。如果存储器或先进封装仍无法获得,制造处理器并不能解决产能限制。

Samsung 的代工路径可以为 OpenAI 在这一链条上提供更多选择。Samsung 在同一企业集团内制造逻辑芯片、存储器并提供封装技术。

垂直覆盖广度并不会自动带来更好的结果。协调能力、良率、热设计、成本和生产进度,仍决定整合是否能形成优势。

更可能的目标是灵活性,而不是彻底取代 TSMC。如果多家供应商能够支持其路线图的不同部分,OpenAI 就能以更强的地位进行谈判。

它也能降低单一生产地区或工艺受到扰动的风险。当基础设施承诺延续数年时,这一好处会更加显著。

双重供应也有代价。OpenAI 和 Broadcom 需要为每条制造路径配备工程师、验证系统、软件支持和运营流程。

该公司似乎愿意探索这一取舍,因为处理器可得性已成为战略约束。对于前沿 AI 开发者而言,计算能力不再只是采购职能。

它如今影响模型发布时间、服务容量、产品利润率,以及平台能够支持的客户数量。这使晶圆代工规划成为 OpenAI 产品战略的一部分。

Samsung 必须证明自己不只是备选方案

核心竞争是 Samsung 与 TSMC 争夺 OpenAI 处理器路线图中的长期位置,而不是一家公司立即取代另一家。

TSMC 为众多最大型半导体公司制造芯片。其先进制造和封装产能处于当前 AI 硬件市场的核心。

OpenAI 的首款处理器遵循了这条成熟路线。Broadcom 帮助将 OpenAI 的架构转化为可制造的硅芯片,而 TSMC 则负责制造该设计。

据 OpenAI 称,Jalapeño 从初始设计到流片仅用了九个月。流片是指完整芯片设计被送往制造准备阶段的节点。

OpenAI 将 Jalapeño 描述为针对大语言模型推理优化的智能处理器。该公司已开始测试早期芯片,计划于 2026 年晚些时候部署。

Jalapeño 规格将 Broadcom 列为实现、网络和连接合作伙伴。Celestica 则提供电路板、机架和系统专业能力。

这一安排使 TSMC 拥有既有且经过验证设计的优势。Samsung 若想赢得持久角色,就必须提供的不只是名义产能。

制造良率将是一项考验。良率衡量的是生产后符合性能和质量要求的裸片占制造裸片的比例。

即使工厂加工大量晶圆,低良率仍可能推高成本并限制可用芯片数量。对于大型、复杂的加速器而言,稳定良率尤其重要。

功耗特性则是另一项考验。推理数据中心除了原始计算性能之外,还必须管理供电、散热、网络和存储器。

芯片层面的微小差异,在数千个机架规模下可能变得举足轻重。因此,OpenAI 将评估可用系统输出,而不只是晶体管密度。

封装同样至关重要。现代 AI 加速器通常通过先进互连,将逻辑芯片与多组高带宽内存堆叠结合在一起。

即使逻辑晶圆供应充足,这种集成也可能限制产量。Samsung 协调内存与封装的能力,可能增强其提案的竞争力。

TSMC 仍受益于广泛的供应商网络,以及生产领先 AI 处理器的丰富经验。其制造工艺还支持 Nvidia、AMD 以及许多定制芯片项目。

这些重叠的客户既带来优势,也造成紧张关系。庞大的客户基础验证了 TSMC 的工艺,但也会加剧对稀缺产能时段的竞争。

OpenAI 可能将 Samsung 视为应对这种集中的制衡力量。合格的替代选择可以提升排产灵活性,并降低对单一制造组织的依赖。

Samsung 也有自身的激励因素。一个公开的 OpenAI 生产项目,将有助于其吸引先进代工客户,并增强市场对其制造执行能力的信心。

这一机会不止于一笔订单。成功实现生产,可能使 Samsung 获得后续 OpenAI 加速器、网络芯片及相关基础设施组件的机会。

不过,Samsung 无法仅凭产能承诺取胜。OpenAI 需要可预测的交付,因为数据中心的规划围绕设备、电力、施工和网络的同步进度展开。

一颗延迟交付的处理器,可能导致昂贵的基础设施未被充分利用。特性不一致的处理器,则可能令冷却、软件调优和服务可靠性变得复杂。

这正是为何代工竞争并不只是关于制程节点的头条新闻。OpenAI 将评判从设计规则到已部署模型性能的完整路径。

由于 Jalapeño 已采用其制造服务,TSMC 仍占据最强位置。Samsung 的机会在于后续几代产品,当时设计和生产计划尚未完全确定。

如果 Samsung 获得一款专属的未来设计,双方关系可能形成互补。TSMC 和 Samsung 可能为不同的 OpenAI 工作负载制造不同处理器。

如果 Samsung 与 TSMC 共同验证同一款处理器,双方关系则更接近直接的双源供应。这一结果将更有力地证明其对产量的需求极为庞大。

OpenAI 尚未说明其正在推进哪一种模式。在此之前,应将 Samsung 视为潜在的第二制造支柱,而非已确认的同等供应商。

代工分流并未消除 OpenAI 的瓶颈

制造多元化可以降低一种集中风险,但也可能增加工程复杂度,同时内存、封装、电力和软件方面的限制依然存在。

乐观的解读很直接。OpenAI 预计处理器需求将如此庞大,以至于单一代工路径无法提供足够的产能或韧性。

更谨慎的解读同样合理。OpenAI 可能正在探索选择,但尚未承诺将生产交给 Samsung。

企业常常会在选定工艺或签署批量合同前开展联合研究。并非每一项技术合作都会转化为正式出货的产品。

Kim 的声明没有提及工厂、制程节点、处理器架构、流片或生产时间表。这些缺失的信息使外界无法独立验证 Samsung 的预期贡献。

“下一代芯片”这一表述也依然宽泛。它可能指 Jalapeño 的后继产品、训练加速器、网络芯片,或另一种专用处理器。

训练和推理对硬件提出不同要求。训练通过处理大型数据集来创建模型,而推理则利用训练完成的模型生成输出。

Jalapeño 面向推理。OpenAI 尚未公开承诺推出由 Samsung 制造的训练处理器。

这种区别会影响竞争分析。未来的推理设计将延续公司当前项目,而训练加速器则将在另一类工作负载上挑战 Nvidia。

软件兼容性带来了另一项不确定性。OpenAI 必须让应用程序能够在其定制处理器,以及已在其基础设施中运行的 GPU 上实现可预测的运行表现。

模型、内核、编译器、调度器和监控系统都会影响实际性能。当软件无法高效利用硬件时,硬件优势可能消失。

支持来自不同代工厂的处理器,可能造成额外差异。即使是相似设计,也可能在频率、电压、散热或封装特性上存在不同。

OpenAI 可以通过抽象层和工作负载调度来管理这些差异。不过,这需要成熟的内部基础设施和广泛验证。

公司还必须保留模型开发的灵活性。当新的架构需要不同的内存访问方式或数值格式时,高度专用化的芯片可能变得不那么实用。

Nvidia 的通用 GPU 平台仍具吸引力,部分原因在于它支持不断变化的工作负载。开发者可以使用广泛的软件生态系统,而不必适配某一家客户的专用加速器。

因此,在取代 Nvidia 硬件的任何实质性份额之前,OpenAI 的处理器战略首先是对 Nvidia 的补充。定制推理芯片可以承接稳定、高吞吐量的工作负载。

GPU 则可以继续处理研究、训练、非常规模型,以及需要更强可编程性的任务。两者的平衡将取决于 OpenAI 的软件和部署成果。

供应集中问题也不仅存在于处理器代工环节。TSMC 和 Samsung 都依赖专用设备、材料、知识产权和全球物流。

即使拥有两家逻辑芯片供应商,内存供应仍可能构成限制。OpenAI 与 Samsung 和 SK hynix 的协议,正体现了这一独立需求的规模。

先进封装反而可能成为决定性瓶颈。一颗完成制造的逻辑芯片,只有在内存、基板、网络和冷却系统集成后,才能为模型提供服务。

电力是另一项硬性边界。OpenAI 下单处理器的速度,可能快于公用事业公司和建设方交付电网连接、变电站、发电机和冷却系统的速度。

Stargate 应对这些相互关联的需求,但随着项目扩张,协调会变得更加困难。每个组件都必须在接近正确的时间抵达正确的地点。

商业纪律构成最后一项风险。定制芯片可以降低运营成本,但前提是将开发、制造、部署和软件开支全部纳入计算。

在受控测试中表现良好的加速器,在混合生产流量下可能呈现不同表现。利用率和可靠性将决定实际的经济结果。

OpenAI 已发布 Jalapeño 的性能主张,但这些主张仍来自该公司本身。独立的、生产规模的证据仍然有限。

同样的标准也应适用于未来的 Samsung 芯片。代工公告能够表明意图,但无法证明竞争性性能或可靠的大规模量产能力。

只有当具名产品进入通过验证的制造阶段,OpenAI Samsung 芯片计划才具有重要意义。在此之前,验证缺口本身就是故事的一部分。

Nvidia 面临的是所有权压力,而非立即被取代

OpenAI 更深层的变化,是试图拥有更多推理技术栈,而 Nvidia 仍是其更广泛计算能力不可或缺的一部分。

历史上,OpenAI 的大部分 AI 算力来自 Microsoft 和其他基础设施合作伙伴部署的 Nvidia 加速器。这种安排使其无需拥有每一层硬件,也能实现快速增长。

但这也让重要的经济因素处于 OpenAI 控制范围之外。加速器可用性、网络架构、软件依赖和供应商利润率,都会影响模型服务成本。

定制芯片为 OpenAI 提供了另一种杠杆。公司可以围绕自身模型、服务系统、内核和预期生产工作负载来设计功能。

Broadcom 在定制专用集成电路,即 ASIC,方面拥有经验。ASIC 用于执行特定类别的工作,而非充当通用处理器。

Google 提供了最清晰的行业先例。其张量处理单元为内部 AI 服务和云客户提供支持,并与第三方加速器并存。

Amazon 和 Microsoft 也为各自的云平台开发了定制 AI 处理器。这些项目表明,定制芯片可以与大规模采购 Nvidia 产品并存。

OpenAI 走的是相近路径,但起点不同。它运营着重要的 AI 产品,却并不拥有与这些公司相当的超大规模云平台。

这使合作关系更为重要。Broadcom、TSMC、Samsung、内存供应商、机架制造商、云运营商和数据中心开发商必须作为一个系统运作。

Samsung 增加了一条潜在的生产路径,但也扩大了协调负担。OpenAI 必须跨越企业边界协调设计与部署。

Nvidia 仍拥有多重防线。其软件工具、开发者熟悉度、产品迭代节奏、网络产品组合和已部署基础,都使其难以被取代。

一款定制芯片并不需要在所有领域替代 Nvidia 才具有意义。它只需能够高效处理 OpenAI 推理需求中庞大且可重复的一部分。

将稳定工作负载迁移至 Jalapeño,可能让 Nvidia 系统专注于训练和灵活型任务。这也可能让 OpenAI 在与硬件供应商谈判时拥有更强的议价能力。

战略压力来自对工作负载知识的掌控。OpenAI 了解自身模型行为、流量模式、延迟目标和服务瓶颈。

它可以将这些知识编码进硬件和系统中。Nvidia 必须服务众多客户,因此其处理器必须在更广泛的工作负载类别中保持实用性。

这形成了专用化与灵活性之间的取舍。OpenAI 可以进行紧密优化,而 Nvidia 则能将开发成本分摊到规模大得多的市场中。

Samsung 和 TSMC 在这一竞争的下一层展开角逐。它们制造的处理器,使 OpenAI 的专用化战略能够落地至实体数据中心。

双代工厂路线图可能让 OpenAI 更不易受生产短缺影响。如果每家代工厂支持不同产品世代,也可能加快迭代。

不过,拆分设计可能稀释工程资源。维护一个具竞争力的定制加速器产品家族,本身已是一项艰巨任务。

维护独立的变体、工具链和验证项目,会进一步提高门槛。OpenAI 必须证明预期规模足以合理化这些额外成本。

开发者和企业买家应当关注,因为基础设施选择最终会塑造产品行为。服务能力会影响响应时间、可用性、模型访问和发布节奏。

处理器经济性也可能影响 OpenAI 优先处理哪些任务。高效推理使持续运行的智能体工作流和高吞吐量应用更容易得到支持。

评估 AI 服务的团队仍应关注可衡量的产品结果。代工合作伙伴关系并不保证模型更快、客户成本更低或可靠性更高。

但它们确实表明,OpenAI 预计基础设施所有权将成为竞争优势。这一转变将影响竞争对手、云服务商和半导体供应商。

三个信号将表明 Samsung 是否拥有真正的量产角色

下一项决定性证据将来自具名芯片、通过验证的制造里程碑,以及可见的生产部署。

第一个信号是产品识别。OpenAI 或 Samsung 必须将这项合作与某个具体处理器家族关联起来,并明确其预期工作负载。

一款被命名为 Jalapeño 继任者的产品将确认其推理路线图的延续性。一款训练处理器则会表明,OpenAI 正在更广泛地尝试掌控自身的计算技术栈。

独立的网络芯片或专用芯片将缩小其竞争影响范围。这将显示双方合作更深入,但并不能证明 Samsung 已成为替代性的加速器代工厂。

只有当同一处理器家族仍与 TSMC 有关联时,明确产品身份才能强化双重供应的论点。否则,OpenAI 可能只是在分配不同的设计方案。

第二个信号是制造里程碑。投资者和客户应关注制程选择、流片、样品交付、认证或量产时间表。

流片将表明工程团队已将设计提交至 Samsung 的制造规范。可运行的样品则意味着该项目已超越设计阶段的合作。

认证的意义更大。它意味着处理器、内存、封装和系统组件符合既定的生产要求。

量产将提供最明确的验证。届时,Samsung 将成为 OpenAI 计算供应链的实际组成部分,而不再只是研究合作伙伴。

第三个信号是部署证据。OpenAI 应说明由 Samsung 制造的处理器何时进入数据中心,以及它们承担哪些工作负载。

有价值的证据包括系统可用性、持续吞吐量、延迟、功耗、故障率,以及部署在该硬件上的合格流量占比。

公司基准测试可提供初步观察,但独立测量将提升可信度。生产环境中的表现比孤立的实验室结果更重要。

在多个地点部署将进一步支持规模化的论点。这将表明 OpenAI 已将芯片整合进可重复部署的机架、网络、冷却和软件配置中。

若无法产生这些信号,相关叙事将被削弱。若持续提及广泛合作,却没有产品或里程碑,则意味着这可能仍是一种探索性关系。

明确的里程碑会强化这一判断。它们将表明 OpenAI 正围绕长期基础设施需求,构建多代工厂的处理器路线图。

OpenAI 披露 Samsung 芯片合作一事,已经向市场传递了重要信息:OpenAI 不希望其定制芯片雄心受限于单一制造合作关系。

目前仍不清楚的是,Samsung 会成为真正的第二供应来源,还是会获得一项独立的处理器任务。这一区别将决定谁面临最大压力。

第二供应来源将更直接地挑战 TSMC,并确认其预期出货量异常庞大。独立设计则表明 OpenAI 拥有更广泛的硬件产品组合,以及更专业化的供应链。

无论哪种结果,都会加深 OpenAI 对掌控推理基础设施的投入。但两种结果都不能保证最终处理器会优于广泛可得的替代方案。

开发者、企业采购方和 AI 产品团队应关注部署结果,而非合作措辞。关键问题在于,定制芯片是否能在真实需求下改善服务表现。

未来几个月,请追踪具名产品、制造里程碑和生产工作负载。这些信号将揭示 Samsung 究竟是谈判筹码,还是 OpenAI 的第二根代工支柱。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page