OpenAI Jalapeño ASIC 部署选择 AMD Turin,而非 Nvidia Vera
尽管 OpenAI 与 Nvidia 在基础设施领域关系深厚,其 Jalapeño ASIC 部署仍选择搭配 AMD EPYC Turin 主机。每台主机配备两颗 Turin 级处理器和 1.5TB DRAM。Nvidia 新推出的 Vera CPU 未被纳入首个量产设计。
这一选择不只是更换组件。OpenAI 将 Jalapeño 设计为面向语言模型推理优化的专用集成电路,即 ASIC;但其外围主机层采用了成熟的 x86 服务器平台,而非 Nvidia 专为此打造的 Arm CPU。
OpenAI 硬件副总裁兼负责人 Richard Ho 将选择 Turin 形容为“务实”。他向 Tom’s Hardware 表示,独立部署的 Vera 在所需成熟度上仍“稍显落后”。这一表态说明,部署确定性优先于对整套计算栈更紧密的掌控。
OpenAI 在其他领域仍高度依赖 Nvidia 加速器。Jalapeño 也仍是一个内部平台,其早期性能宣称仍需更广泛的验证。即便如此,主机选择表明,超大规模云服务商可以有选择地挑战 Nvidia,而不必完全放弃其硬件。
OpenAI Jalapeño ASIC 部署从双机架系统起步
OpenAI 已将 Jalapeño 从芯片发布推进为一套机架设计,其中 AMD 主机层与定制加速器层彼此分离。
该架构采用一个 CPU 主机机架和一个 Jalapeño ASIC 机架并排部署。SemiAnalysis 表示,主机机架内设有 16 个“Katsu”CPU 托盘,与相邻机架中的 16 个“Vindaloo”加速器托盘相对应。
每个 Katsu 托盘包含两颗 AMD EPYC Turin 级 CPU 和 1.5TB DRAM,还配备本地存储及 400Gbps 前端网络。每个 CPU 托盘通过八根外部 PCIe 线缆连接到对应的加速器托盘。
相邻机架的 16 个加速器托盘共搭载 128 颗 Jalapeño 芯片。八个“Chana”交换托盘负责连接机架内部以及更大规模部署中的这些加速器。
已公布的机架架构可将其纵向扩展网络延伸至 16 个机架。该配置可通过铜缆和光链路连接多达 2,048 个 Jalapeño 加速器。
主机处理器并不替代推理 ASIC。它们负责为加速器工作负载提供数据、协调、调度和管理所需的辅助 CPU 工作。定制芯片仍承担 Jalapeño 所面向的语言模型计算任务。
这种分工之所以重要,是因为加速器很少作为孤立设备运行。生产级推理需要分词、请求处理、存储访问、网络、模型编排、安全服务以及其他受 CPU 限制的操作。
智能体应用进一步提高了这些需求。一个智能体可能在模型推理、Python 执行、检索、数据库访问和外部工具之间交替运行。若主机性能不足,昂贵的加速器可能需要等待这些阶段完成。
因此,OpenAI 所需的不只是一颗高速推理芯片,还需要一个具备充足内存容量、网络支持、软件兼容性和运营历史的主机平台。Turin 提供了这些条件,同时避免为该项目引入另一个尚不成熟的组件。
功耗同样说明了系统层面的挑战。SemiAnalysis 估计,主机机架在生产环境中的功耗约为 31 千瓦,而加速器机架的功耗约为 130 千瓦。两者组成的配套系统总功耗约为 160 千瓦。
这些数字表明,不能仅凭芯片规格评估 Jalapeño。机架网络、主机利用率、散热、软件和工作负载部署方式,都会影响该系统实际交付的有效算力。
同样的原则也适用于 OpenAI 的基准测试宣称。只有完整系统能够在生产流量下稳定复现有利的加速器结果时,该结果才有意义。选择成熟的主机平台,可在这一过渡阶段减少一个不确定性来源。
OpenAI 表示,Jalapeño 将在 2026 年底前启动初始部署。披露的机架配置为外界提供了迄今最清晰的部署方式视图。
这也构成了本文的核心张力:OpenAI 为获得更多控制权打造了定制推理芯片,却没有将这一尝试延伸至 CPU 层。
Turin 在九个月芯片项目中降低风险
在 OpenAI 尝试异常压缩的加速器开发周期时,AMD EPYC Turin 主机为其提供了一个成熟可靠的平台。
OpenAI 和 Broadcom 表示,Jalapeño 从初始设计到制造流片仅用了九个月。流片是指完成的芯片设计被送交制造的阶段。
这一周期是公司自身的说法,并非独立确认的行业纪录。不过,它仍描述了一个几乎没有空间容纳可避免集成问题的项目。
OpenAI 负责设计加速器架构,Broadcom 提供了芯片实现、网络和连接技术专长。Celestica 则参与了电路板、机架和完整系统设计。
官方的Jalapeño 公告将其定位为更长期计算路线图的第一代产品。初始部署计划于 2026 年末进行,随后将在后续世代中扩展。
Ho 表示,团队希望实现积极的性能和成本目标,同时不接受不必要的风险。Turin 满足项目要求,而 OpenAI 的合作伙伴已拥有与该平台相关的经验。
这些经验在系统上电调试阶段很有价值。在机架进入常规服务前,工程师必须验证固件、内存行为、PCIe 连接性、操作系统、驱动程序、遥测、故障处理和工作负载调度。
采用新的 CPU 架构会扩大验证范围。即使底层处理器性能出色,指令集、编译器行为、管理工具和应用兼容性的差异也可能造成延误。
Turin 属于 AMD 第五代 EPYC 服务器产品家族,采用成熟的 x86 指令集,并支持每颗插槽十二个内存通道,为系统设计人员提供了可观的内存带宽和容量。
AMD 自身的Turin 架构文档描述了采用 DDR5 内存的生产配置。OpenAI 的机架设计在每对处理器旁配置了 1.5TB DRAM。
这一内存池与直接连接 Jalapeño 的高带宽内存承担不同角色。主机 DRAM 可保存应用状态、准备请求、管理数据,并支持推理周边的 CPU 端服务。
OpenAI 还必须为一个缺乏现有开发者生态的加速器准备软件。Nvidia 受益于多年来 CUDA 的普及、优化库、部署工具和运维人员的熟悉程度。
Jalapeño 并不具备这样的既有基础。OpenAI 可以控制内部软件环境,但其工程师仍须为新平台构建编译器、内核、监控系统和调度逻辑。
使用熟悉的主机硬件可让相关工作聚焦于定制加速器,也让团队能够区分 Jalapeño 特定缺陷与额外 CPU 转换所带来的问题。
因此,这一决定反映的是进度纪律,而非对 x86 与 Arm 作出的全面判断。OpenAI 为这一代产品选择了能够降低集成风险的组件。
这一区别很重要。Ho 并未表示 Turin 会一直是未来所有 OpenAI 系统的最佳主机。他只是表示,它满足了当前项目的即时需求和成熟度要求。
因此,第一代 Jalapeño 是一种混合策略。OpenAI 在专用化有望带来显著推理收益的环节承担架构风险,同时在成熟度更有价值的领域保留通用服务器技术。
AMD EPYC Turin 主机对 Nvidia 的全栈叙事施压
眼前的压力落在 Nvidia 试图将 Vera 打造为下一代 AI 基础设施默认 CPU 的战略上。
Nvidia 将 Vera 定位为面向智能体周边 CPU 工作而设计的处理器。其目标工作负载包括 Python 运行时、沙箱代码、编排、分析,以及加速器调用之间发生的其他任务。
该处理器采用 88 个定制 Olympus 核心和 LPDDR5X 内存子系统。Nvidia 表示,该子系统可提供高达每秒 1.2TB 的带宽。
Vera 还通过 NVLink-C2C 与 Rubin GPU 相连。Nvidia 表示,该链路可在 CPU 与 GPU 之间提供高达每秒 1.8TB 的一致性带宽。
这种紧密耦合支撑着 Nvidia 更大的销售主张:客户可以将 CPU、GPU、网络、互连、软件库和机架系统作为一个协调统一的平台购买。
Nvidia 表示,Vera 系统将于 2026 年秋季通过系统制造商和云合作伙伴推出。其列出的支持者包括主要服务器制造商和云基础设施提供商。
OpenAI 的选择暴露了这一战略中的时机问题。Vera 可能具备吸引人的规格,但 Jalapeño 需要一个合作伙伴能够在加速开发周期内完成集成的主机平台。
一颗处理器在技术上完成开发后,其更广泛的运行环境未必已经成熟。服务器主板、固件、管理软件、验证流程、部署经验和供应准备度各自遵循不同的进度安排。
Ho 的批评正聚焦于这种差异。他并未表示 Vera 缺乏 AI 主机所需的性能,而是质疑 Vera 作为 Jalapeño 项目独立 CPU 的成熟度。
这一限定很重要,因为 Vera 同时也是 Nvidia 集成式 Vera Rubin 系统中的主机处理器。相较于受到严密控制的 CPU-GPU 配置,独立角色会带来额外要求。
OpenAI 使用自家的加速器和纵向扩展网络,而非 Rubin GPU 与 Nvidia 原生互连方案。独立的 Vera 主机必须能融入这一外部架构,而不能依赖完整的 Nvidia 平台。
Turin 提供了更传统的关系。OpenAI 可通过 PCIe 将成熟的服务器 CPU 接入其定制加速器,并保留对机架其余部分的控制权。
这一结果削弱了 Nvidia 在一位战略客户面前的全栈叙事,但并不能证明其在广泛市场中失利。OpenAI 仍在使用 Nvidia 硬件,而 Vera 也已获得众多基础设施提供商的承诺。
OpenAI 自身也强调,Nvidia 仍是重要合作伙伴。其定制 ASIC 项目似乎旨在补充庞大且多元化的计算集群,而非取代每一项 Nvidia 部署。
AMD 的收获也比直接赢得加速器竞争更有限。Turin 提供主机层,而 OpenAI 自研芯片负责专用推理任务。
不过,主机 CPU 仍占据重要位置。它们控制围绕加速器的数据准备和编排,其内存系统也会影响整套部署的运行效率。
OpenAI 的设计让 AMD 得以进入这一备受关注的定制芯片平台,也表明 x86 主机无需与加速器供应商共享同一架构,便可支持大规模推理机架。
对云服务提供商和 AI 实验室而言,这带来了一个可信的模块化替代方案。它们可以自行开发或采购专用加速器,同时保留熟悉的 CPU、操作系统和服务器管理方式。
Nvidia 希望 Vera 让相反的路线更具吸引力。其主张是,协调一致的 CPU、GPU、网络和软件栈能够带来更好的整体系统性能。
因此,Jalapeño 在模块化与集成化之间引发了一场实际的竞争。胜负将取决于部署结果、软件质量和总体运营成本,而不只是处理器基准测试。
真正的逆转是选择性控制,而非彻底退出 Nvidia
OpenAI 正在其自定义设计能够带来优势的领域拆解 Nvidia 的平台,同时在替代会增加风险的地方保留成熟组件。
对 Jalapeño 最有力的解读,并不是 OpenAI 已经放弃 Nvidia。相反,该公司正在将 AI 机架拆分为不同层级,并决定哪些层级值得进行定制化控制。
推理显然是起点。OpenAI 运营着 ChatGPT、Codex、其 API 和其他产品,这些产品产生了海量的模型服务流量。
相较于通用 GPU,定制推理加速器可以更有针对性地处理这些持续性工作负载。OpenAI 可以围绕自身模型优化芯片、内存层级、网络、内核和调度系统。
Jalapeño 的架构同时应对语言模型推理的两个主要阶段。Prefill 负责处理用户提示词,计算密集度相对较高。Decode 负责生成 token,更依赖内存带宽。
在专用资源之间迁移模型状态可能增加通信延迟。OpenAI 表示,Jalapeño 会让重要状态——包括生成过程中使用的 KV 缓存——靠近活跃的计算资源。
该公司称,在峰值吞吐量下,Jalapeño 每瓦完成的 AI 工作量是其对比系统的 1.5 至 1.9 倍。它还称端到端延迟降低了 1.7 至 3.6 倍。
这些首批基准测试结果涵盖了 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T。OpenAI 在多个运行条件下采用了 SemiAnalysis 公开的 InferenceX 基准测试。
OpenAI 将每颗 Jalapeño 芯片的额定功耗定为 700 瓦。该公司称,在受测工作负载中,实测持续功耗维持在 550 瓦或以下。
这些数据值得关注,但仍是由芯片设计者呈现的早期结果。OpenAI 选择了其发布内容中所描述的配置、工作负载、软件和对比方法。
SemiAnalysis 表示,其团队观察了在真实硅片上进行的测试。这比模拟或预测规格提供了更多证据,但不能替代在多样化生产环境中的独立基准测试。
对比同样聚焦于已商用的 Nvidia 系统,而非 Vera Rubin。这限制了这些结果对于 Nvidia 下一代架构所能说明的内容。
Jalapeño 的优势可能在与 OpenAI 内部服务模式相似的工作负载上最为明显。这种专用化正是其目的,但也限制了关于整体加速器领导地位的广泛主张。
通用 GPU 必须支持多种模型、框架、数值格式和研究工作负载。内部 ASIC 可以牺牲部分灵活性,以提高在更狭窄运营目标上的效率。
OpenAI 能够接受这一取舍,因为它掌控模型、服务软件和需求。对于为未知未来工作负载采购基础设施的企业而言,情况则不同。
这正是 Turin 决策颇具启示性的地方。OpenAI 在加速器上追求专用化,因为推理效率能够直接影响产品延迟和算力需求。
它并未对周边的每一层都进行专用化。主机 CPU 仍是一个兼容性、可用性和合作伙伴经验比架构新颖性更重要的领域。
这一策略类似于对 AI 平台进行可控拆解。OpenAI 保留与其模型路线图关系最密切部分的控制权,并为其余部分采购经过验证的组件。
在这一模式中,Broadcom 和 Celestica 仍不可或缺。定制芯片并不意味着自给自足,因为实现、网络、制造、板卡和机架集成都需要经验丰富的供应商。
AMD 同样受益于这种选择性方法。其处理器成为 OpenAI 系统的一部分,是因为它可作为成熟构件发挥作用,而不是因为 OpenAI 采用了 AMD 完整的加速器平台。
Nvidia 面临压力,因为其业务日益依赖于销售一体化 AI 工厂。拆分这些层级的客户可以将价值转移至自研芯片和替代供应商。
不过,集成方案仍保有重要优势。单一供应商能够在整台机器上优化一致的内存、互连、软件、诊断和支持能力。
OpenAI 必须围绕 Jalapeño 重建或协调其中许多能力。其早期硬件效率主张,只有在部署规模扩大时运营栈仍保持可靠才有意义。
因此,这种逆转有所限制,却意义重大。OpenAI 不再将加速器供应商的完整架构视为不可分割的一体化方案。
早期基准测试无法回答生产环境的问题
Jalapeño 仍需证明其在持续内部工作负载下的可靠性、利用率和经济价值。
当系统面对真实流量时,基准测试领先地位可能迅速消失。生产需求会因模型、提示词长度、输出长度、批量大小、延迟目标和地理区域而变化。
交互式服务也会经历剧烈的需求变化。即使请求模式不同于基准测试配置,机架也必须维持有价值的利用率,同时避免让用户等待。
OpenAI 的测试采用公开模型和定义明确的推理测试套件。这些结果支持了该芯片能够正常工作并可高效运行大型语言模型的说法。
但它们无法证明数千颗加速器长期运行时的可靠性。硬件故障、网络拥塞、散热限制、软件缺陷和维护要求,只有在长期部署中才会变得更清楚。
双机架结构增加了物理复杂性。每个加速器托盘都依赖相应的主机托盘、多条 PCIe 电缆以及独立的交换层。
这种模块化可以简化替换流程,并保留组件选择空间。但它也可能增加工程师必须监控、维护和验证的连接数量。
功耗数据同样需要谨慎解读。芯片额定功耗有助于标准化基准测试结果,但数据中心支付的是完整系统、冷却、网络、存储和闲置容量的成本。
一套 160 千瓦的配对机架必须提供足够的持续吞吐量,才能证明其基础设施投入是合理的。峰值基准性能并不能保证这一运营结果。
软件是另一个未解问题。Nvidia 的优势不仅在于芯片,还包括成熟的库、分析工具、编译器、编排工具以及庞大的资深开发者群体。
OpenAI 可以围绕一组受控的内部模型构建软件。然而,每一种新的模型架构或数值格式,都可能需要额外优化,才能高效利用 Jalapeño。
该公司称,AI 协助了 Jalapeño 的部分设计和编程过程。这可能缩短优化周期,但在缺少公开生产力对比的情况下,这仍是一项由公司自行报告的优势。
模型演进带来了更长期的风险。部署前数年就开始设计的专用方案,必须在推理技术变化时仍保持实用价值。
从最狭义的角度看,Jalapeño 并非完全固定功能的设计,并且支持多个大型模型。不过,其经济优势仍取决于工作负载是否符合其架构背后的假设。
Nvidia 的通用方案为意外变化提供了更多保障。客户可以将 GPU 重新用于训练、推理、模拟和其他加速工作负载。
OpenAI 可以通过规模抵消这一劣势。如果 ChatGPT 和 API 需求保持庞大,即使是适用范围较窄的加速器,也能在可预测的服务工作中维持高利用率。
Turin 主机带来了另一项不确定性。它们的选择部分基于成熟度,但 OpenAI 并未披露 CPU 层执行的全部工作负载。
在缺少这一拆分信息的情况下,读者无法判断 1.5TB 主机内存是否是模型服务、运营灵活性还是未来软件需求所必需的。
这一决定也并不能证明 Vera 不合适。Nvidia 的 CPU 正通过多个系统供应商和云合作伙伴进入市场,更广泛的部署证据仍在出现。
Ho 的评估适用于一个项目的进度和风险限制。在 Jalapeño 的首个系统设计已经确定后,Vera 的成熟度仍可能继续提升。
当 Vera 通过其一致性 NVLink 连接与 Rubin 协同运行时,Nvidia 也可能展示出优势。这种集成配置不同于将 Vera 用作第三方芯片的主机。
因此,公平的比较必须在等效工作负载下审视完整系统。它应衡量延迟、吞吐量、功耗、可用性、软件投入和总体部署成本。
在此类证据出现之前,OpenAI Jalapeño ASIC 的部署仍是一个前景可期的内部平台,而不是对主流 GPU 基础设施的既定替代方案。
三个信号将揭示 OpenAI 的押注是否成立
部署规模、生产表现和 Vera 的独立结果将决定 Turin 只是更稳妥,还是在战略上更优。
第一个信号是 OpenAI 计划持续至 2026 年底的 Jalapeño 扩展。该公司已承诺进行初始部署,但尚未公开量化将迁移至该平台的推理流量占比。
有意义的生产扩展将加强 Jalapeño 在受控测试之外同样有效的论据。相关证据可能包括更广泛的模型覆盖、稳定的机架可用性,或可见的产品延迟改善。
缓慢或有限的推出并不必然意味着失败。供应限制、数据中心就绪程度和软件认证,都可能推迟原本功能正常的硬件部署。
不过,反复调整进度将削弱九个月开发周期的叙事。如果系统集成需要很长时间才能开始提供有用服务,快速流片的重要性就会降低。
第二个信号是来自双机架设计的运营证据。OpenAI 最终应提供基于持续生产使用的测量数据,而不只是加速器功耗额定值。
有价值的数据包括完整机架功耗、利用率、故障率、维护间隔,以及混合请求模式下的性能。这些测量将检验模块化主机安排是否维持了 Jalapeño 的效率。
关注 OpenAI 更新其内核和模型支持的频率。针对新架构的快速优化将表明,其软件栈能够跟上模型开发的步伐。
还应关注后续 Jalapeño 世代是否继续采用 AMD 主机。持续使用将表明,模块化 x86 基础设施的持久价值并不止于首个项目的期限。
若改用 Vera、另一款 Arm 处理器或定制 OpenAI CPU,则意味着 Turin 只是扮演过渡性角色。OpenAI 已将 Jalapeño 描述为一个跨多代平台的开端,为未来主机选择保留了空间。
第三个信号是 Nvidia Vera 在 Nvidia 自行控制的加速器系统之外的表现。独立部署将检验 Ho 提出的确切成熟度担忧。
Nvidia 已宣布获得云服务提供商和主要服务器制造商的支持。它们的生产可用性、软件兼容性和独立基准测试,将显示 Vera 缩小这一感知差距的速度。
如果独立部署的 Vera 系统推进顺利,并且在智能体工作负载上的表现优于 x86 主机,那么 OpenAI 的选择将显得越来越具有特定时间表考量。Nvidia 一体化平台的论点仍将成立。
如果这些部署遭遇延迟或采用范围有限,Turin 的入选则会显得更具战略意义。这将表明,即使 AI 加速器日益专业化,成熟的 x86 基础设施仍能保有自身角色。
开发者和企业买家应当关注此事,因为主机架构影响的不只是基准测试图表。它还决定了软件可移植性、基础设施可用性、运维复杂度,以及未来系统可选择的供应商范围。
AI 产品用户可能会间接受到影响。成功的定制化推理可能减少等待时间,支持更长的智能体工作流,并让服务容量在需求激增期间更具可预测性。
芯片发布本身并不能保证实现上述任何好处。它们取决于完整系统能否以稳定且经济的方式大规模提供推理能力。
关键问题如今已经很明确:在 Nvidia 的 Vera 生态系统成熟之前,OpenAI 能否将其定制加速器和 AMD 主机设计打造为可重复部署的生产平台?
应关注部署进展,而非头条式的对比。如果 Jalapeño 在保持效率的同时扩展至更多模型和数据中心,OpenAI 的选择性硬件战略将更具可信度。如果 Vera 率先弥合成熟度差距,Nvidia 的高度一体化路线仍将难以被取代。



