top of page

OpenAI Jalapeño 推理芯片挑战 Nvidia 的通用 AI 硬件

6小时前
讀畢需時 14 分鐘

OpenAI 在九个月内设计出首款定制加速器,直接挑战了为大多数大型 AI 服务提供动力的通用硬件。与 Broadcom 共同开发的 OpenAI Jalapeño 推理芯片,专为训练完成后运行语言模型而打造。

这种专用化正是冲突的核心。OpenAI 表示,对芯片、软件和模型服务进行更紧密的控制,可以在固定的功耗限制内提供更多有用输出。Nvidia 的加速器仍不可或缺,但必须支持更广泛的工作负载和客户需求。

OpenAI 硬件副总裁 Richard Ho 在芯片于 Hot Chips 亮相后发布的采访中,还描述了第二项变化。OpenAI 在整个工程流程中使用内部模型,包括设计、验证、软件开发和内核优化。

这项成果不只是又一家超大规模云服务商开发了专用集成电路,即 ASIC。Jalapeño 检验的是,AI 实验室能否利用自身模型和工作负载数据,缩短芯片开发周期本身。

OpenAI 仍有许多需要证明之处。其性能数据来自公司测试,生产部署仍较有限,而且该芯片并不能取代用于训练前沿模型的加速器。核心问题在于,专用化能否在不牺牲灵活性的前提下改善推理经济性。

OpenAI 与 Broadcom 实际打造了什么

Jalapeño 为 OpenAI 提供了一款围绕自身推理工作负载设计的处理器,而不是一款再被改造来适应这些工作负载的通用加速器。

OpenAI 和 Broadcom 于 2026 年 6 月发布 Jalapeño,作为规划中多代计算平台的首款处理器。Broadcom 负责芯片实现,并贡献了网络技术,包括其 Tomahawk 网络芯片。

OpenAI 提供了架构方向,以及对自身工作负载的详细了解。这些工作负载包括 OpenAI 大规模运营的模型、内核、内存访问模式、服务系统和产品。

该公司的 Jalapeño 公告称,工程样品已达到目标运行频率和功耗指标。OpenAI 还表示,这些样品已在其实验室中运行机器学习工作负载。

推理是指使用训练完成的模型生成答案、图像、预测或软件操作的过程。它不同于训练,后者通过规模大得多的计算任务来创建或更新模型。

这一区别很重要,因为 Jalapeño 并未被定位为 Nvidia 硬件的通用替代品。OpenAI 针对大语言模型服务过程中涉及的重复执行模式对其进行了优化。

该架构旨在减少不必要的数据移动,同时平衡计算、内存和网络。处理器与内存之间的数据传输会消耗时间和能量,因此减少这种移动可以提升效率。

OpenAI 表示,这种平衡使处理器能够更接近其理论峰值能力运行。在获得更广泛的生产测量和独立测试结果之前,这仍属于公司的说法。

在 Hot Chips 2026 上,Ho 披露了更多规划中的系统细节。Jalapeño 的额定功耗为 700 瓦,但据报道,在测试工作负载下测得的持续功耗保持在 550 瓦或以下。

根据演示文稿,一个机架包含 128 个加速器。一个完整的 pod 可扩展至 2,048 个 ASIC。该机架配置提供 27.5 TB 的 HBM4 内存,以及每个封装 15.4 TB/s 的带宽。

高带宽内存,即 HBM,将高速内存置于处理器附近,以便向计算单元输送数据。这种配置在推理过程中尤其重要,因为大型模型会不断移动参数和中间结果。

OpenAI 使用 GPT-OSS-120B、DeepSeek R1 和 Moonshot AI 的 Kimi K2.5 对 Jalapeño 进行了测试。使用外部模型意在表明,该架构并不局限于 OpenAI 的专有系统。

据报道的 机架规格,这套 128 芯片系统可提供 1.7 exaflops 的四位计算性能。当模型能够保持可接受的输出质量时,低精度算术可更高效地处理模型运算。

OpenAI 表示,其系统在选定测试中以峰值吞吐量计算,比竞争平台多完成 1.5 至 1.9 倍的工作量。该公司还报告称,在三种评估模型上均实现了更低延迟。

这些结果是在 OpenAI 选定的软件、配置和工作负载定义下得出的。它们提供了有用的技术证据,但尚不能证明其在全部生产条件下的性能表现。

因此,Jalapeño 是一项正在推进的工程项目,而不只是一张路线图幻灯片。不过,它仍是一个较早期的平台,其更广泛的运行记录尚未得到独立验证。

为什么 OpenAI Jalapeño 推理芯片此刻很重要

OpenAI 正试图在电力供应成为更严峻限制之前,将推理效率转化为战略优势。

Ho 将效率视为开发该处理器的主要原因。OpenAI 预计计算能力仍将受限,部分原因是数据中心无法获得无限的电力供应。

这一限制改变了 AI 公司衡量进展的方式。采购更多加速器仍然重要,但每个加速器也必须为每消耗一瓦电力产出更多有用的模型输出。

推理需求会随着产品使用量增长。每一次 ChatGPT 回复、API 请求、编程会话或智能体任务,都会在底层模型完成训练后消耗计算资源。

更长的推理过程会加剧这一需求。一个模型若要评估多条路径、调用工具并修改答案,所消耗的推理算力可能远高于一次简短的文本回复。

OpenAI 可以在 ChatGPT、Codex、其 API 和新兴智能体产品中观察这些工作负载。随后,它可以围绕最频繁发生的操作设计硬件。

这创造了传统芯片供应商无法获得的反馈循环。产品活动为服务软件提供信息,服务行为为硬件设计提供信息,而新硬件又会改变哪些产品体验具备经济可行性。

OpenAI Jalapeño 推理芯片将这一循环转化为实体基础设施。它的价值取决于 OpenAI 能否比购买广泛可编程硬件的公司更有效地协调各个层面。

Nvidia 面临这一模式带来的压力,但并不意味着 OpenAI 能突然放弃其产品。Nvidia 在训练和推理领域提供加速器、网络设备、软件库和成熟的开发工具。

OpenAI 的首款定制芯片只覆盖了这一技术栈的一部分。由于其总体需求超过单一内部项目所能满足的规模,该公司仍需要 Nvidia、AMD、Cerebras 及其他供应商。

Ho 将 Jalapeño 描述为多元化计算战略中的一个组成部分。这一定位比将该芯片视为 Nvidia 的即时替代品更可信。

压力在于长期。如果 OpenAI 将有意义的一部分持续推理工作负载转移到定制芯片上,它将获得对成本、供给和产品延迟更大的控制权。

Google 通过其 Tensor Processing Unit 确立了这一历史模式。Google 的首款 TPU 是为内部机器学习工作负载开发的,当预测需求暴露出仅依赖传统处理器的局限性后,该公司便启动了这一项目。

一项已发表的 TPU 性能研究展示了面向特定工作负载的设计如何在推理方面超越当时的通用替代方案。Google 后来将 TPU 产品线扩展至多个世代。

Amazon 随后推出 Inferentia 和 Trainium,而 Microsoft 为其云基础设施开发了 Maia 加速器。Meta 也一直在推进内部推理处理器。

这些公司拥有共同的动机。规模庞大且可预测的工作负载能够证明定制硬件的合理性,因为效率提升可以应用于极大规模的设备集群。

OpenAI 在一个重要方面有所不同。它并不运营拥有数十年内部芯片开发积累的广泛公共云平台。它的优势来自模型研究、产品需求,以及对前沿模型行为异常细致的可见性。

Broadcom 有助于弥合产业化差距。该公司拥有将定制设计转化为可制造芯片的经验,也擅长构建在数据中心规模下连接这些芯片所需的网络。

因此,Jalapeño 对两项既有假设构成压力。其一认为前沿实验室应依赖商用加速器;其二认为只有成熟的超大规模云服务商才能维持严肃的定制芯片项目。

成功部署将削弱这两项假设。令人失望的部署则会说明,为何通用平台尽管存在更高的理论开销,仍能保有其价值。

OpenAI 内部模型改变了设计进度

Jalapeño 最具影响力的说法,关乎 OpenAI 构建它的速度,而不只是成品处理器的运行速度。

OpenAI 表示,该项目从初始寄存器传输级设计到流片仅用了九个月。寄存器传输级,即 RTL,是对数据如何移动以及逻辑如何在芯片内部运行的硬件描述。

流片是指完成设计被送往制造的阶段。之后发现的错误可能需要代价高昂的修订,因此速度本身并不能定义成功。

传统高性能 ASIC 项目通常需要更长时间。Ho 告诉 Tom’s Hardware,即使团队复用现有知识产权,过去的基准周期也大约为 18 个月至两年。

OpenAI 在没有继承内部加速器架构的情况下起步。Ho 将九个月的周期描述为新的基准,而这得益于经验丰富的工程师与 AI 系统协同工作。

该公司在整个流程中使用了内部模型。Ho 特别指出,Codex 和后续的内部模型世代是重要的工程工具。

这些系统协助完成代码生成、调试、设计探索、验证工作和内核优化。内核是一种专门的软件例程,用于在加速器上执行重复出现的操作。

OpenAI 的工程师也使用了成熟的电子设计自动化工具。EDA 软件支持芯片布局、时序分析、验证、功耗分析及半导体开发的其他阶段。

关键机制在于两者的结合。AI 系统加速了传统工程学科中的工作,而经验丰富的工程师负责指导流程并审核结果。

OpenAI 并未让语言模型独立设计芯片。Ho 明确强调的是一支规模更小、技能更高的团队所获得的生产率,而不是移除人类工程师。

他详细的 设计访谈将效率描述为该项目的首要目标。它也展示了工作负载知识如何塑造工程决策。

AI 辅助芯片设计本身并不新鲜。Cadence、Synopsys、Google 和学术团队多年来一直将机器学习应用于布局、优化、验证及其他设计问题。

这里发生变化的是工作流的广度,以及它与一款在用前沿模型产品之间的联系。OpenAI 一边使用其模型,一边为这些模型产生的工作负载设计硬件。

这形成了一种递归式开发模式。更好的模型帮助工程师设计硬件,而更好的硬件又让公司能够更高效地服务未来的模型。

OpenAI 表示,其模型在项目期间取得了显著进步。项目初期使用的工具,能力不及后期用于内核优化的工具。

快速进步的工程助手可能改变项目规划。在架构探索阶段因过慢或成本过高而不可行的任务,可能在同一芯片投产前变得切实可行。

不过,九个月这一数字需要谨慎解读。它衡量的是开发中的特定部分,而非构建和部署生产平台所需的全部活动。

OpenAI 也做出了有意的架构权衡。第一代产品避开了一些新兴技术,包括 3D 堆叠和共封装光学,从而降低了集成风险。

这一选择有助于保障进度,但也限制了这一进度本身所能证明的内容。更激进的设计可能需要额外的验证、封装工作和制造协调。

该项目在流片前仍采用了标准的签核流程。时序、信号完整性及其他物理检查依然必不可少,因为制造环节不能依赖看似合理的模型输出。

对工程团队而言,可信的启示比“自主造芯片”更为有限。当专家将 AI 与经过验证的工具、清晰的规格和可重复的测试结合起来时,AI 能够压缩迭代周期。

这种模式也适用于半导体以外的领域。将设计决策、测试结果和模型输出保存在可搜索的工程知识库中,团队便能更可靠地审查 AI 辅助完成的工作。

Jalapeño 提供了一项异常具体的检验,因为制造会暴露错误。软件可以频繁修补,而硅片错误会带来更长的进度延误和更严重的运营后果。

真正的对手是通用灵活性

Jalapeño 牺牲了一部分通用灵活性,以换取在 OpenAI 认为自己格外了解的工作负载上的效率。

Nvidia 的优势部分来自其广泛适用性。其加速器支持众多模型、科学计算工作负载、训练方法、推理系统和客户环境。

CUDA 及其周边软件生态系统也降低了采用阻力。开发者可以在连续几代 Nvidia 产品之间复用工具、库和运营经验。

OpenAI 可以缩小目标范围。它了解哪些内核主导其服务系统,了解请求如何被批处理、内存带宽在何处成为限制,以及哪些延迟水平会影响产品。

这些知识可以剔除对 OpenAI 部署价值有限的硬件功能。它也可以将更多硅片资源分配给在语言模型推理中反复出现的操作。

由此产生的比较并不只是 OpenAI 对阵 Nvidia,而是专业化与通用平台所提供保障之间的较量。

当工作负载保持足够稳定、使设计假设得以成立时,专业化的表现最佳。前沿 AI 带来了不确定性,因为模型架构、数据格式、内存需求和服务方式都在快速变化。

OpenAI 表示 Jalapeño 支持其自有模型以外的模型,并援引其与 DeepSeek 和 Moonshot 模型合作的成果。这些演示回应了外界对其仅适用于单一专有架构的担忧。

但这并未解决长期问题。围绕当今 Transformer 工作负载设计的处理器,必须在其部署生命周期内随着推理方法演变而保持实用性。

Nvidia 可以通过新一代加速器、更低精度格式、专用推理组件、网络改进和优化软件作出回应。其规模还可以将开发成本分摊到众多客户之间。

定制芯片不必在所有方面击败 Nvidia。OpenAI 只需要让它在可预测的内部需求中占据较大份额时表现足够出色。

这一区别解释了为何该公司可以一边称赞 Nvidia,一边打造替代方案。这两种方法可以在同一基础设施组合中共存。

OpenAI 还将 AMD EPYC Turin 处理器用作早期 Jalapeño 系统的主机 CPU。Ho 将这一选择描述为务实之举,因为该平台已经成熟,合作伙伴也具备相关经验。

这一决定体现了该项目的风险管理方式。OpenAI 在追求激进加速器目标的同时,在创新带来较少战略价值的环节选择了成熟组件。

据报道,Nvidia 较新的 Vera CPU 在当时作为独立主机选项尚不够成熟。这并不能证明 AMD 拥有永久优势,但它表明部署进度如何塑造组件选择。

更广泛的竞争阵营包括 Google、Amazon、Microsoft、Meta,以及正在考虑自行设计芯片的 AI 实验室。每家公司都必须决定哪些工作负载值得配备内部处理器。

Anthropic 据报有意建立硬件组织,这又提供了一个信号。如果多个前沿实验室开发芯片,对推理基础设施的控制将成为模型竞争的一部分。

Broadcom 受益于这一转变,因为它能够提供实现、网络和制造专业知识,同时不拥有客户的架构。其角色让缺乏传统芯片部门的公司也更容易获得定制芯片。

Nvidia 仍占据最强的通用计算地位。然而,每一款成功的内部加速器,都可能将一项持续性工作负载移出商用 GPU 市场。

OpenAI 的 Jalapeño 推理芯片之所以重要,是因为推理并非次要工作负载。每当客户使用 AI 产品时,它都会持续产生成本。

训练会周期性地产出一个模型。推理则每天将该模型转化为服务。在足够大的规模下,即使效率只是小幅提升,也可能影响容量规划和产品设计。

基准测试仍需接受生产环境的现实检验

OpenAI 已展示可工作的芯片和详细系统,但其最强的效率主张仍需独立且持续的生产证据加以验证。

该公司报告称,在与 Nvidia GB200 NVL72 和 GB300 NVL72 系统的对比中,获得了有利的吞吐量和延迟结果。这些比较使用了选定模型和 SemiAnalysis InferenceX 方法论。

基准结果取决于模型选择、数值精度、批量大小、延迟目标、软件成熟度和系统配置。在一种设定下领先,并不保证在另一种设定下也领先。

OpenAI 还同时控制着加速器和被评估的大部分软件。这种集成可能带来真正的优势,但也使透明测试尤为重要。

该公司表示,最终测量工作仍在进行。它还承诺将在最初公告后发布更详细的技术性能报告。

生产部署会暴露实验室测量无法完全捕捉的因素,包括正常运行时间、制造差异、网络拥塞、软件缺陷、维修流程,以及需求变化下的利用率。

首个芯片修订版也需要改进。关于AI 辅助工作流的报道指出,B0 步进版本的每瓦性能较 A0 最多提升了 25%。

步进版本是芯片设计的修订版本。这类修订很常见,但如此大的提升引发了对第一版遗漏了什么的疑问。

这并不否定加速后的进度,但确实表明快速流片与经过优化的量产设备是不同的里程碑。

九个月的开发主张也不意味着未来每款芯片都会遵循同样的进度。Ho 表示,后续项目将取决于技术成熟度以及每次升级的价值。

OpenAI 不希望为了微小改进就替换已安装的设备群。新的内存、封装或光学技术也可能带来模型辅助工程无法消除的进度限制。

制造产能带来了另一项不确定性。设计出一款有竞争力的处理器,只是供应数千套可靠系统的一部分。

Broadcom 及其他合作伙伴必须协调晶圆制造、封装、板卡、网络、机架、固件和部署。任何一层的瓶颈都可能限制最终的算力容量。

软件兼容性同样重要。当模型能够无需漫长的优化项目、也不会带来不可接受的输出变化地迁移至其上时,定制加速器才能成功。

OpenAI 对外部模型的使用提供了一个令人鼓舞的数据点。独立开发者仍需要更清晰的证据,了解支持的操作、编译器行为、调试能力和工作负载可移植性。

该芯片目前计划供内部使用。Ho 没有排除更广泛可用的可能性,但 OpenAI 表示,其自身需求将消化可预见的供应量。

这限制了独立访问。当硬件无法通过公共云或商业产品获得时,外部研究人员和客户难以复现相关主张。

一项行业评估还强调了训练方面的局限性。OpenAI 仍依赖外部供应商提供用于创建前沿模型的大规模计算系统。

Jalapeño 即使无法解决训练问题,仍可能改变推理经济性。读者不应将对一种工作负载的控制视为对整个 AI 基础设施栈的控制。

谨慎的结论很直接。OpenAI 在异常短的进度内生产出了真实硬件,但量产份额将决定 Jalapeño 是否具备战略重要性。

三个信号将表明 Jalapeño 是否改变 AI 基础设施

部署规模、独立性能证据以及下一代芯片,将决定 Jalapeño 是否代表一个可持续的平台。

第一个信号是转移到 Jalapeño 系统上的 OpenAI 推理占比。OpenAI 预计 2026 年部署规模有限,随后在 2027 年扩大产能。

仅看已安装芯片数量还不够。重要的衡量指标是有效工作负载量、设备群利用率、可靠性和所服务模型的范围。

真实请求占比不断增长,将支持 OpenAI 的专业化战略。若部署范围狭窄且仅限于选定模型,则表明通用加速器保留的灵活性超出了该公司的预期。

第二个信号是一份包含可复现比较的详细技术报告。读者应关注不同模型、精度、批量大小和系统配置下是否存在一致的延迟和效率结果。

独立访问将加强这一证据。如果研究人员或云客户可以测试硬件,OpenAI 所报告的优势就更容易与工作负载特定优化区分开来。

第三个信号是多代产品路线图的执行情况。OpenAI 表示,其第二代加速器已处于深度开发阶段,同时第三代产品的规划已经开始。

及时推出第二款芯片,将表明这项九个月计划创造了可复用的工程方法、软件和组织知识。延期或增益有限,则会削弱“新基准”的论点。

下一代设计还将揭示 OpenAI 愿意承担多大的技术风险。引入先进封装或光互连,将检验其 AI 辅助工作流能否应对更复杂的集成。

Nvidia 的应对体现在这三项信号之中。更快的推理产品、改进的软件,或更有利的部署经济性,都可能在 OpenAI 实现大规模部署之前缩小定制芯片的优势。

Broadcom 将该平台实现工业化的能力同样重要。OpenAI 需要可靠的供应和完整的系统,而不是只有亮眼基准测试成绩的孤立处理器。

对于开发者和企业采购方而言,Jalapeño 并不要求立即作出平台选择。它的影响最先会体现在响应时间、服务容量、模型可用性以及 API 的经济性上。

更重要的启示在于 AI 优势的来源。模型质量仍是核心,但基础设施决策正日益决定这些模型能够以多高的频率、以多低的成本运行。

OpenAI Jalapeño 推理芯片将这场竞争带入了创造模型的实验室。它也利用这些模型,加速其未来硬件的工程研发。

关注 OpenAI 实际部署了什么,而不只是它宣布了什么。如果 Jalapeño 承担了生产环境推理的显著份额,公布可信的效率结果,并持续实现跨代演进,那么定制芯片将成为核心竞争层。如果这些信号仍然有限,Nvidia 的灵活平台将继续证明其核心地位的合理性。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page