OpenAI Jalapeño ASIC 将保持内部使用,但其对 Nvidia 的挑战指向更远
尽管 OpenAI 将 OpenAI Jalapeño ASIC 描述为能够运行其自身产品组合之外的模型,但该公司已将其首款定制推理芯片限定用于内部部署。
这一差异如今界定了该芯片在市场中的位置。OpenAI 需要借助 Jalapeño 缓解 ChatGPT、Codex、其 API 以及日益苛刻的智能体产品带来的功耗和容量压力。然而,其公开基准测试有意将该芯片与 Nvidia 的 GB200 和 GB300 系统并列比较。
OpenAI 硬件负责人 Richard Ho 告诉 Tom’s Hardware,在“相当长一段时间内”,支持 OpenAI 自身仍将是优先事项。他还表示,这款处理器可以服务其他组织,且并非针对 OpenAI 模型硬编码。
这让 OpenAI 处于一个不同寻常的位置。它并未向云服务买家、开发者或竞争性 AI 实验室提供 Nvidia 的替代方案。不过,它正在打造并公开测试一种日益接近这一定位的产品。
因此,真正的竞争并非 OpenAI 与 Nvidia 在商用芯片市场上的对决,而是 OpenAI 的内部优先战略,与其所打造的可编程推理平台更广泛潜力之间的较量。
OpenAI Jalapeño ASIC 有明确的首位客户
OpenAI 打造 Jalapeño 是为了满足自身的推理需求,而这一需求规模足以消化初始供应。
Jalapeño 是一种专用集成电路,即 ASIC,围绕大语言模型推理设计。推理是指训练完成的模型接收请求后生成答案的过程。
OpenAI 于 2026 年 6 月 24 日与 Broadcom 一同发布了这款处理器。两家公司将其称为 OpenAI 首款“Intelligence Processor”,也是多代计算平台的开端。
Jalapeño 公告将该芯片直接与 OpenAI 的实际运营负载联系起来,其中包括 ChatGPT、Codex、OpenAI API,以及未来围绕 AI 智能体构建的产品。
OpenAI 负责架构设计,Broadcom 则提供芯片实现和网络技术。Celestica 支持将芯片转变为可部署计算平台所需的电路板、机架和系统集成工作。
这种分工很重要。OpenAI 并非只是购买一款处理器,再在后续适配软件;它正围绕相同的推理目标,协调芯片架构、内存数据流动、网络、内核、调度和产品负载。
眼下的目标是效率。Ho 告诉 Tom’s Hardware,这正是核心设计优先级,尤其是在受功率限制的数据中心中。
现代 AI 基础设施无法仅靠增加处理器来扩张。运营商还必须获得电力、冷却、网络、内存、封装产能以及实体数据中心空间。
一款能在固定功耗范围内完成更多有效推理工作的处理器,可以在无需等待新设施落成的情况下创造容量。对 OpenAI 而言,这意味着能利用其实际可部署的基础设施处理更多请求。
这也解释了为什么对外发布并非当前优先事项。OpenAI 已拥有一位需求持续、可直接接入其软件栈、并且有强烈动机提升资源利用率的内部客户。
Ho 表示,公司要满足自身需求就已“应接不暇”。他的评论确立的是行动顺序,而非永久性限制。
Jalapeño 将首先部署在 OpenAI 控制模型、服务软件和基础设施决策的环境中。该环境也为工程师识别瓶颈、改进后续代际产品提供了最短的反馈闭环。
首批部署计划于 2026 年底进行。该公司尚未宣布面向外部客户的公共云实例、加速器卡、授权计划或销售渠道。
这使 Jalapeño 在今天成为一个内部平台,但并不意味着其架构天生只能内部使用。
OpenAI 表示,工程样品已在目标生产频率和功耗下运行机器学习负载。该公司还展示了来自 OpenAI 之外开发模型的结果,这使得对该处理器的狭义解读变得复杂。
该芯片的首位客户已经确定。其未来市场的边界尚未确定。
效率将内部芯片转化为战略资产
Jalapeño 为 OpenAI 提供了另一种扩展推理能力的方式,而无需完全依赖通用加速器的发展路线图。
OpenAI 和 Broadcom 最早于 2025 年 10 月披露了更广泛的基础设施合作关系。双方协议涵盖 10 吉瓦由 OpenAI 设计的加速器及配套网络系统。
根据这项 10 吉瓦合作,机架部署目标是在 2026 年下半年开始,并计划于 2029 年底前完成。
这一规模使 Jalapeño 不只是一次孤立的芯片实验。其目标是成为涵盖多代处理器和数据中心合作伙伴的大型基础设施项目的一部分。
OpenAI 表示,首款处理器从设计到制造流片仅用了九个月。流片是指完成的芯片设计被交付制造的阶段。
这一时间表是 OpenAI 和 Broadcom 的说法,而非经独立验证的行业纪录。即便如此,该时间线仍表明,软件与半导体路线图为何正开始趋于融合。
OpenAI 了解其已部署产品中哪些操作消耗时间和能源。这些观察结果可以在制造之前影响硬件设计,而不必完全通过后续的软件优化来处理。
该架构旨在减少数据移动,并使计算、内存和网络资源更紧密协同。模型数据的移动通常消耗大量能源,因此减少不必要的数据移动可以提升系统级效率。
这一重点也反映了推理与训练的不同。训练会创建或更新模型参数,而推理则反复使用这些参数来回答实时请求。
Jalapeño 并不替代 Nvidia 在两类工作负载中的硬件。OpenAI 将其定位于推理,训练并不属于其声明的职责范围。
不过,随着使用量增长,推理的重要性也会提高。每一次 ChatGPT 回复、API 调用或多步骤 Codex 任务,都会在模型训练完成后增加持续性的服务工作。
智能体产品可能进一步加剧这种压力。一条用户指令在返回完成结果之前,可能触发多次模型调用、工具操作、检查和修订。
对开发者和企业买家而言,影响比芯片标签更重要。当需求激增时,更高的推理效率可能支持更低的延迟、更稳定的可用性或更优的经济性。
OpenAI 尚未承诺将任何节省直接让利给客户。它也尚未公布足够的运营数据,以计算每次请求经验证的成本降低幅度。
战略收益依然清晰。拥有推理架构,使 OpenAI 在容量、电力或供应商排期制约产品增长时多了一项调节手段。
这也会给 Nvidia 带来压力,而无需 OpenAI 成为直接的芯片供应商。每一项转移至 Jalapeño 的工作负载,都是一项不再需要 Nvidia 推理加速器的工作负载。
这种压力存在明确边界。Nvidia 提供成熟的软件环境、训练系统、网络以及可通过多家云服务商获得的加速器。
OpenAI 无法仅凭制造一款高效 ASIC 复制这一生态系统。Jalapeño 要在内部体现价值,也不需要做到这一点。
一款内部芯片只需在 OpenAI 足够频繁运行的工作负载上,优于现有替代方案,以证明工程和部署成本的合理性。
这正是效率成为关键指标的原因。Jalapeño 的价值较少取决于赢得每一项基准测试,更多取决于能否在 OpenAI 的功耗、延迟和供应约束下交付有效 token。
OpenAI Jalapeño 与 Nvidia 并非一场清晰的较量
OpenAI 的基准测试表明 Jalapeño 是可信的推理设计,但并未证明它能全面替代 Nvidia 的平台。
在 Hot Chips 2026 上,OpenAI 使用 SemiAnalysis 的公开 InferenceX 基准测试套件,将 Jalapeño 与 Nvidia GB200 和 GB300 机架系统进行了比较。
测试涵盖 OpenAI 的 GPT-OSS 120B 模型、DeepSeek R1 670B,以及 Moonshot AI 的 Kimi K2.5。纳入外部模型支持了 OpenAI 关于 Jalapeño 具有可编程性的说法。
根据公布结果,Jalapeño 每千瓦吞吐量高出 1.5 至 1.9 倍。OpenAI 还报告称,端到端延迟降低了 1.7 至 3.6 倍。
已公布的基准测试将一套 700 瓦的 Jalapeño 封装,与额定功耗为 1,200 瓦和 1,400 瓦的 Nvidia 加速器进行了比较。
OpenAI 表示,在测试期间,Jalapeño 的持续功耗保持在 550 瓦或以下。不过,其主要计算仍使用每款处理器公布的热设计功耗对结果进行了归一化。
该芯片结合了一枚计算芯粒与六组 HBM4 堆叠。它提供 216 GiB 高带宽内存和每秒 15.4 太字节的内存带宽。
高带宽内存将内存置于处理器附近,供给数据的速度远高于普通服务器内存。当大型模型参数必须在推理期间持续可用时,这种带宽至关重要。
据报道,OpenAI 的设计重点在于让运行中的工作负载能利用更多可用带宽。它并非只是增加内存带宽,再假定应用程序会高效使用。
这些规格有助于解释 Jalapeño 的效率主张,但无法消除几个重要的限定条件。
首先,OpenAI 选择了模型、配置、延迟点和比较框架。SemiAnalysis 参与了测试执行,但结果仍来自 OpenAI 的实验室和硬件。
其次,主要比较使用的是封装功耗额定值。一项补充的设施功耗比较得出了更小的差异,因为它计入了各系统更多的实际能耗。
第三,Jalapeño 和 Nvidia 系统并不总是采用相同的解码技术。Nvidia 部署可以使用多 token 预测,即在一次大型模型推理中生成多个候选 token。
在重点比较中,Jalapeño 使用的是单 token 预测。这使结果具有参考价值,但也意味着读者不能将整场较量简化为单一性能比率。
第四,Nvidia 更新的 Vera Rubin 平台未被纳入其中。与 GB200 和 GB300 的比较表明,它对重要 Blackwell 系统具备竞争力,但并不意味着在所有可用 Nvidia 世代中居于领先地位。
最重要的是,Jalapeño 不训练模型。Nvidia 的系统同时支持训练和推理,在工作负载变化时为客户提供更大的灵活性。
OpenAI 也仍然需要 Nvidia 设备。Jalapeño 是一项多元化战略,而非双方关系已经结束的证据。
因此,OpenAI Jalapeño 与 Nvidia 的比较需要保持精确。Jalapeño 在 OpenAI 公布的条件下,对选定推理工作负载上的 Nvidia 效率构成挑战。
它并不匹配 Nvidia 整体的市场角色、软件覆盖范围、部署可得性或训练能力。
基准测试仍然重要,因为定制 ASIC 的对比很少如此直接。专用芯片往往隐藏在内部云服务之后,公开可见的竞争性能证据有限。
OpenAI 则点名了当前 Nvidia 系统,提供了按功耗归一化的结果,并测试了三款大型模型。这一决定让市场得以将 Jalapeño 视为不只是封闭内部基础设施。
该公司表示,工程师大约在两个月内便将 DeepSeek 和 Kimi 移植到 A0 硅样品上。A0 指的是首个制造完成并返还用于测试的修订版本。
Ho 表示,这次演示旨在打破“该芯片只支持 OpenAI 模型”的假设。他更具分量的说法是,Jalapeño 在其预定的推理领域内具备可编程性和通用性。
这一差异让其外部市场前景仍存悬念。若一款处理器仅绑定于某个私有模型栈,那么在其所有者之外几乎没有意义。
能够运行主流外部模型的处理器则拥有更广泛的适用场景,即便 OpenAI 尚未决定出售访问权限。
可编程性敞开了大门,但供应限制了范围
Jalapeño 的软件灵活性支持更广泛的部署,但制造产能与 OpenAI 自身需求表明,这不会很快发生。
支持更广泛使用的最强证据并非 Ho 的推测性表述,而是其对外部模型的支持、多代产品路线图,以及计划中的吉瓦级部署规模。
OpenAI 最终可能通过多种方式开放该硬件。它可能提供由 Jalapeño 支持的 API 容量,而不让客户直接管理芯片。
它也可能与基础设施合作伙伴合作,提供专用实例。它还可能通过选定的数据中心运营商提供后续代际产品。
这些路径均未公布。将其视为既定计划,会夸大 OpenAI 已经表达的内容。
这篇关于内部使用的采访给出了更克制的立场。OpenAI 认为其他组织能够使用该处理器,但其自身的产能需求优先。
供应是最直接的限制。先进加速器需要争夺晶圆制造产能、高带宽内存、封装、网络组件、电力以及已建成的数据中心空间。
Jalapeño 不会因为由 OpenAI 设计就避开这些瓶颈。它会与竞争性 AI 处理器进入许多相同的生产队列。
其六组 HBM4 堆叠尤其值得关注。若在大规模部署中扩展这一配置,OpenAI 将成为稀缺高带宽内存的重要采购方。
该系统所需的不只是封装完成的处理器。Broadcom 提供网络技术,Celestica 则贡献电路板、机架和系统集成。
每一层都必须按正确顺序到位。即使加速器本身已准备就绪,某一个组件的短缺也可能延误可用产能。
OpenAI 表示,其内部供应状况良好。但这一说法并不能证明其拥有足以向外部客户提供可预测服务保障的容量。
对外销售会带来额外义务。买家需要文档、软件支持、工作负载认证、维护、调度,以及对未来代际产品的稳定访问。
一个成功的商业平台还需要超越基准测试表现的信任。客户必须相信供应商能够提供可预测的容量,并在软件更新期间保持兼容性。
OpenAI 目前在自身基础设施内控制着这段关系的两端。它可以随芯片一同调整模型、内核和调度软件。
外部客户不一定拥有与 OpenAI 相同的工作负载组合。不同的模型架构、量化格式、上下文长度和延迟目标,可能会暴露出已发布测试中未出现的局限。
这正是核心的怀疑视角。运行三款外部模型证明了灵活性,但并未证明其在生产级推理环境中具备普遍效率。
Hot Chips 演讲提供了有意义的架构细节。独立部署仍将比 OpenAI 实验室产出的结果提供更有力的证据。
更广泛的推广也可能分散对内部目标的注意力。在 OpenAI 尝试部署第一代产品并准备后续产品之际,支持第三方将占用工程时间。
该公司并不需要商业收入来证明这一项目的合理性。更低的内部推理成本、更高的容量或更好的响应延迟,都可能带来足够回报。
即便芯片表现良好,这也降低了短期商业发布的可能性。OpenAI 通过保留选择权而不承诺供应,获得了战略灵活性。
这种张力可能会跨越数代产品而持续存在。OpenAI 可以持续在内部改进 Jalapeño,同时让其软件接口更具可移植性。
如果最终出现外部访问,它很可能会跟随已验证的内部部署,而不是先于它们出现。
更直接的影响将落在基础设施供应商身上。Broadcom 在 OpenAI 的计算栈中获得了核心角色,而 Nvidia 则面对另一家正在开发专用芯片的客户。
Google 的 TPU 项目提供了最清晰的历史参照。Google 最初在内部使用 Tensor Processing Units,随后通过 Google Cloud 对外提供,而非销售传统加速卡。
Amazon 则通过 Inferentia 和 Trainium 走了相近路径。这些处理器增强了 AWS 服务,并让客户通过 Amazon 的云环境获得访问。
OpenAI 缺乏同等规模的通用云业务。这一差异使其通往外部可用性的路径不那么明确。
Microsoft 及其他数据中心合作伙伴可能提供渠道。不过,各方尚未说明客户是否能够选择由 Jalapeño 支持的容量。
在此之前,该处理器仍是 OpenAI 产品的基础设施,而非可购买的 Nvidia 替代品。
三个信号将表明 Jalapeño 是否走出 OpenAI
部署证据、更广泛的工作负载验证,以及外部访问模式,将决定 Jalapeño 是成为平台还是继续作为私有基础设施。
第一个信号是在 2026 年底前得到验证的生产部署。OpenAI 表示,初始平台将在年底前开始部署。
读者应关注 Jalapeño 是否确认在承载真实的 ChatGPT、Codex 或 API 流量。生产使用将检验受控基准测试之外的可靠性、利用率、延迟和集成情况。
最有价值的披露将区分已安装硬件与活跃服务容量。放置在实验室或部分完成机架中的处理器,无法提供与客户流量相同的证据。
生产运行将强化 OpenAI 关于其全栈方法有效的论点。若出现延迟,则会削弱其九个月开发周期所暗示的激进时间表。
第二个信号是针对更多模型和解码配置的独立性能测试。OpenAI 的 Hot Chips 结果提供了可信的起点,而非最终结论。
更有力的测试应比较系统总功耗、等效精度、相匹配的延迟目标,以及当前的软件栈。当可比系统问世时,测试还应纳入 Nvidia Vera Rubin。
评测者应考察长上下文、不同批处理规模、混合专家模型和智能体工作负载下的性能。平均效率可能掩盖在对交互式产品至关重要的运行点上的薄弱表现。
这篇Hot Chips 分析说明了为何系统细节至关重要。Jalapeño 被呈现为一个完整的推理平台,而不只是独立处理器。
对整个这一平台进行独立验证,将强化其通用用途的主张。更狭窄的结果则会支持这样一种观点:Jalapeño 仍主要针对 OpenAI 的工作负载特征进行优化。
第三个信号是具体的外部访问机制。这不仅意味着一句“其他组织可以使用该芯片”的表态。
真正的动作将包括已命名的云合作伙伴、实例类型、容量承诺、开发者计划或受支持的软件环境。它还将明确谁运营硬件、谁支持客户。
如果 OpenAI 宣布这样的路径,Jalapeño 将开始作为可访问的替代方案对 Nvidia 形成压力。若没有这种路径,其竞争影响仍将是间接的。
这种间接影响依然可能很大。内部定制芯片会减少未来推理需求自动流向既有供应商的份额。
它还让 OpenAI 在采购谈判中拥有筹码。即使 Nvidia 仍不可或缺,一个可信的替代方案也会改变围绕交付时间表、系统设计和长期产能的讨论。
开发者目前不应围绕 Jalapeño 重新设计应用。尚未有面向他们的公开实例、直接编程环境或部署承诺。
他们应转而关注 OpenAI 服务行为的变化。更低的延迟、更高的速率限制、更稳定的可用性,以及新的智能体功能,可能会率先揭示其运营效果。
企业买家则应提出不同的问题。他们需要了解 OpenAI 的基础设施多元化是提升服务可靠性,还是引入了另一项尚不成熟的依赖。
OpenAI 对更多技术栈环节的控制可以加快优化速度。但它也可能将技术决策集中于单一供应商,并使其性能更难与标准云硬件比较。
知识工作者将通过产品而非处理器规格感受到结果。更快的响应很重要,但当 AI 系统处理更长的任务时,可靠的多步骤工作可能更重要。
从这一视角理解 OpenAI Jalapeño,它与其说是进入半导体业务,不如说是控制每次模型交互背后的成本与容量。
目前,该公司划定了明确的运营边界。Jalapeño 将首先服务于 OpenAI,因为 OpenAI 预计会消耗其所能部署的一切容量。
其公开定位则指向这一边界之外。该处理器能够运行外部模型,遵循多代产品路线图,并已与 Nvidia 的旗舰 Blackwell 系统进行基准测试。
这些选择保留了更大的雄心,而无需立即进行商业发布。
未来三个月应会让这种区别更加清晰。请关注生产流量、独立基准复现,以及一条已命名的外部访问路径。
如果三者都出现,Jalapeño 将从内部基础设施迈向更广泛的推理平台。如果只有部署落地,OpenAI 仍将实现一项具有重要战略意义的成果。
它将为增长最快的工作负载建立专用计算来源,同时在 Nvidia 最具优势的领域继续将 Nvidia 保留在技术栈中。
这种混合战略就是当前现实。OpenAI 并未取代 Nvidia,也没有向市场销售 Jalapeño。
它正在建立足够的技术与运营可信度,以让两种可能性都保持开放。



