OpenAI Jalapeño ASIC 将设计基线缩短至九个月,但人类仍牢牢掌控全局
OpenAI 在九个月内将其 Jalapeño ASIC 从初始寄存器传输级设计推进至流片,AI 在整个过程中辅助工程师开展工作。这一时间表的重要性超过了又一组加速器基准测试成绩。它挑战了半导体行业组织芯片设计、验证、软件开发及专业人才配置的既有方式。
OpenAI Jalapeño ASIC 并非由一个自主系统根据提示词产出成品芯片。工程师选择架构、评估结果,并保留最终决策权。Broadcom 负责关键的物理实现工作,而成熟的电子设计自动化工具仍是签核不可或缺的一环。
因此,真正的竞争并非 OpenAI 对阵 Nvidia,而是 AI 辅助工程对阵传统芯片开发周期。OpenAI 表示,其方法将通常需要 18 个月到两年的工作,压缩为从初始 RTL 到流片的九个月。
这一说法已经引起硬件公司的关注,它们感兴趣的是这一流程,而非芯片本身。如果该方法能够超出 OpenAI 的范围得到迁移,更短的迭代周期可能会成为半导体工程领域的竞争要求。
OpenAI 压缩了时间表中成本最高的部分
重要变化不只是 OpenAI 设计了一枚芯片,而是该公司在没有移除工程师的前提下压缩了艰难的设计周期。
Jalapeño 是 OpenAI 首款定制推理处理器。专用集成电路,即 ASIC,是针对特定工作负载优化的芯片,而非面向广泛通用计算。
OpenAI 与 Broadcom 及系统制造合作伙伴 Celestica 共同开发了这款处理器。根据最初的发布公告,合作伙伴在九个月内完成了从初始设计到制造流片的推进。
流片是完成的设计交付制造的节点。在这一节点之后发现的错误可能需要代价高昂的修订,因此速度不能以牺牲验证为代价。
整个项目从最初架构概念到可工作的硅片,用时不到 20 个月。九个月这一数字涵盖从初始 RTL 到流片的阶段。RTL 是对芯片数字逻辑和数据移动的代码级描述。
OpenAI 硬件负责人 Richard Ho 将这一进度与此前约 18 个月至两年的基线进行了对比。他表示,即使团队复用现有知识产权或成熟架构,这些更长的周期同样可能适用。
Jalapeño 起步时没有可供修改的既有 OpenAI 加速器设计。团队同时在创建架构、开发软件,并定义未来语言模型将如何使用硬件。
这一差异使该时间表格外引人注目。衍生芯片能够复用经过验证的模块、已知的工具流程和积累的知识。第一代架构存在更多不确定性,因为工程师必须在满足量产截止日期的同时建立这些基础。
OpenAI 并未独自完成每一个阶段。其硬件团队设计了端到端系统,包括加速器、内存层级和网络架构。Broadcom 则负责从逻辑门开始的物理设计工作。
这种分工是理解该成果的关键。OpenAI 提供模型知识、系统架构和 AI 辅助的前端工作;Broadcom 则提供成熟的实现专业能力以及通向量产的路径。
这一安排也限制了外界能够得出的结论。九个月的周期并不表明任何小型工程团队都可以凭借一个商用聊天机器人复现 Jalapeño。它表明,一个专业团队在拥有内部模型、研究资源、成熟工具和经验丰富的半导体合作伙伴时能够实现什么。
不过,这一成就确立了一个可信的参照点。OpenAI 表示,设计团队在硬件、系统、软件、供应链及相关职能上的平均人数不足 100 人。这一统计不包括 Broadcom 人员。
如今,压力落在拥有更大芯片团队和更慢发布周期的组织身上。高管将会追问:是否确实需要更多工程师,还是更好的迭代系统就能带来更快的成果。
这一问题不止关乎人员配置。更短的设计周期会改变产品团队何时能够承诺支持工作负载、软件能够多快适配,以及公司能够多早响应新的模型架构。
传统芯片项目面临时机问题。语言模型和推理技术可能会在硅片到来前发生变化。针对较旧工作负载组合优化的处理器,可能在软件已转向其他方向后才投入使用。
通过缩短开发时间,OpenAI 缩小了这一差距。在工程师冻结设计时,这款芯片可以反映关于 ChatGPT、Codex、API 和智能体工作负载的更新认知。
因此,九个月的成果构成了本文的核心张力。AI 并未取代半导体专业知识;它提升了经验丰富的工程师在固定截止日期前能够评估的迭代数量和速度。
AI 如何改变芯片设计循环
OpenAI 将 AI 用作迭代引擎,帮助专家探索替代方案、分析结果并优化代码,同时不放弃设计决策权。
“AI 设计芯片”这一说法容易让人形成错误的想象。Jalapeño 并非一次生成而成,OpenAI 也没有披露一个能够独立设计量产处理器的通用系统。
相反,模型进入了工程工作流程中几个边界明确的环节。OpenAI 表示,它们帮助探索实现方案、缩短测量和验证循环,并优化算术电路。
这一差异很重要,因为芯片设计包含不同类型的工作。有些任务类似软件工程,适合语言模型处理;另一些则需要专业工具、物理约束和确定性的检查。
一个重要桥梁是 XLS,这是一个最初由 Google 开发的高层次综合系统。工程师可以用类似软件的语言描述硬件行为,之后 XLS 会生成 Verilog 硬件描述。
这种表述方式为 OpenAI 的模型提供了更熟悉的操作界面。它们可以处理代码和结构化规范,之后传统工具再将这些决策转换为更底层的硬件逻辑。
OpenAI 技术团队成员 Chris Leary 曾在 Google 任职期间参与创建 XLS。他的专业能力让团队能够判断模型生成的修改是否有效、有用,并且符合预期架构。
这种组合说明了领域知识为何仍不可或缺。AI 可以快速提出或完善实现方案,但经验丰富的工程师知道该提出什么要求,以及如何解读输出结果。
模型还协助了验证工作,在这一环节中,团队会测试逻辑行为是否在多种条件下与规范一致。更快的测试生成和失败分析,能够缩短设计变更与获得可信结果之间的等待时间。
算术电路优化提供了另一个合适目标。OpenAI 表示,AI 帮助在保持项目按计划推进的同时,将更多计算性能纳入芯片。
首批硅片回片后,工作流程从芯片设计扩展至软件优化。内核是将模型操作映射到处理器计算和内存资源上的专用程序。
定制加速器需要为每个支持的模型系列配备高效内核。即便底层芯片设计出色,薄弱的软件也可能让大量硬件能力闲置。
OpenAI 将其模型用于解决这一问题。其性能披露显示,Codex 和 GPT-Astra 在两个月内帮助三个原本未计划支持的开放权重模型实现高性能。
对于选定的 GPT-OSS 注意力和混合专家模块,AI 生成的实现版本比现有专家编写版本快 1.5 至 1.8 倍。OpenAI 明确将这一比较限定于选定模块,而非完整模型。
另一个优化案例展示了单个循环能够变得多么显著。在一个 DeepSeek 多头潜在注意力内核上,利用率据称在约 40 小时内从 0.31% 提升至 88.94%。
这一数字描述的是一个经过基准测试的内核相对于芯片理论上限的性能。它不应被解读为 Jalapeño 整个工作负载组合提升了 88.94%。
不过,该结果仍说明了这一流程为何受到关注。内核优化历来需要稀缺的专业人才,他们必须理解模型数学、内存行为、编译器细节和硬件调度。
模型能够持续搜索这一实现空间。它们可以生成替代方案、运行测量、解读反馈,并在工程师监督目标和约束的情况下尝试另一种映射方式。
Jalapeño 也被构建为支持这一循环。OpenAI 将该处理器描述为可预测的编程目标,其设计围绕本地张量、显式通信和明确的同步机制展开。
这些特性有助于人类理解执行过程。它们也为模型提供了一个易于处理的表述方式,用以确定工作应在何处运行、数据应何时移动,以及任务应如何协调。
因此,这一过程双向运作。AI 帮助设计芯片,而工程师则设计芯片,使后续 AI 系统能够更有效地为其编程。
Ho 在硬件访谈中清晰概括了这种安排。他说:“我们没有替换工程师;他们只是变得超级高效。”
这种表述比全面自动化的说法更具影响力。它将 AI 描述为已经拥有艰深专业知识的团队的力量倍增器。
它也暗示了采用将从何处开始。企业更可能在可衡量的工程循环中部署 AI,而不是将完整芯片项目交给自主智能体。
有用的单位不是一项生成的设计,而是一个经验证的迭代:它比此前工作流程所允许的速度更快地抵达专家手中。
OpenAI Jalapeño ASIC 将协同设计转化为优势
OpenAI Jalapeño ASIC 最强的优势来自模型、软件、网络和硅片之间的共享可见性。
芯片公司传统上为众多客户制造处理器。广泛的市场会奖励灵活性,但也会限制其获取每位客户的机密模型路线图和生产运行行为。
OpenAI 面临的情况恰恰相反。其硬件团队可以与了解未来模型、服务模式、内核和产品要求的研究人员并肩工作。
这种紧密协作实现了全栈协同设计。团队能够判断瓶颈究竟位于模型、编译器、运行时、网络、内存系统,还是物理处理器。
Ho 认为,与第三方硅片供应商进行这种交流将会很困难。即便公司签署保密协议,研究细节仍可能泄露模型架构或未来产品计划。
内部访问让 OpenAI 能更早作出权衡。成本高昂的硬件功能可以转移到软件中,而反复出现的服务瓶颈则可获得专门的架构支持。
Jalapeño 面向推理,即运行已训练模型以生成答案的过程。OpenAI 选择这一工作负载,是因为响应速度和服务效率会直接影响用户体验及运营成本。
推理本身包含相互竞争的阶段。预填充处理用户提示词,通常对算力要求较高。解码则按顺序生成 token,且往往更依赖内存带宽。
当模型状态在不同核心或芯片之间移动时,通信又会成为另一项约束。数据跨越系统期间,处理单元可能处于闲置状态。
OpenAI 表示,Jalapeño 会尽可能将模型状态保留在本地,以减少这些延迟。这包括键值缓存,它存储生成 token 时使用的注意力信息。
该系统围绕这些工作负载阶段整合计算、内存、网络和软件。OpenAI 将其描述为一个大型互连域,能够让更多请求处理留在同一系统内完成。
这一架构旨在避免一种常见妥协:有些系统为单个用户实现低延迟,另一些系统则通过批量处理大量请求来最大化总吞吐量。
OpenAI 声称,Jalapeño 可在这些运行点之间切换,而无需采用彼此独立的架构。该公司展示了 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 1T 的测试结果。
这些模型意义重大,因为它们并非全都由 OpenAI 创建。它们的纳入支持了该公司的论点:Jalapeño 是可编程的,而不是为某个专有模型家族硬编码设计。
该系统仍需要针对模型定制的 kernel。每一种新架构都可能带来不同的注意力模式、内存需求和通信行为。
AI 辅助编程有助于应对这一维护负担。如果模型能够快速生成优化的 kernel,定制处理器就能进行适配,无需等待数月的人工软件开发。
随着模型设计日益多样化,这一能力愈发重要。专家混合系统、长上下文、推理工作负载和交互式智能体,都会以不同方式对硬件施加压力。
协同设计的优势也改变了竞争比较。Nvidia 销售的是由成熟软件和庞大开发者基础支撑的广泛计算平台。OpenAI 则围绕自身需求优化更为狭窄的技术栈。
Google 已通过其 Tensor Processing Units 走上类似的垂直整合路线。Amazon 正在开发 Trainium 和 Inferentia,Microsoft 则为其云基础设施推出了定制加速器。
Jalapeño 让一家拥有巨大推理需求的模型开发商加入了这一阵营。它并未消除 OpenAI 对商用加速器的依赖,尤其是在训练方面。
OpenAI 表示,Nvidia 和其他合作伙伴仍将是其基础设施的一部分。其定制芯片提供了另一种算力来源,而非彻底替代方案。
这一细微差别对买家和开发者至关重要。Jalapeño 最初是内部基础设施组件,并非可通过零售渠道或常规云实例获得的通用加速器。
Ho 表示,该芯片理论上可以服务外部用户,但 OpenAI 自身需求将优先得到满足。该公司预计,满足内部工作负载就已足以让团队忙碌不已。
因此,眼下的竞争影响将首先体现在 OpenAI 的产品内部。更快的响应、更稳定的访问,或更低的服务成本,都将表明这一架构正在产生运营价值。
不过,对半导体团队而言,这一设计过程已清晰可见。他们无需获得 Jalapeño 硬件,也能研究 OpenAI 如何组织这项工作。
九个月基准给芯片团队与 EDA 厂商带来压力
如果九个月成为可重复实现的设计目标,成熟的半导体组织就必须提升迭代速度,同时不能削弱验证能力。
Ho 将 Jalapeño 的开发周期称为新的基准。这一表述之所以带来压力,是因为它将单个项目转化为拟议的行业标准。
Ho 所描述的旧基准是 18 个月到两年。这类周期由多种因素造成,包括架构复杂性、验证要求、物理实现以及组织协调。
AI 能比其他方式更直接地解决其中部分约束。在工程师能够通过自然语言、代码、测试和可衡量反馈来表达任务的领域,它表现尤为出色。
马里兰大学半导体项目主任 Ankur Srivastava 指出,设计自动化已存在数十年。语言模型在工程工作仍部分依赖语言的场景中能够创造价值。
这包括规格说明、源代码、测试计划、文档和诊断推理。这些任务连接人类意图与形式化系统,因此适合获得模型辅助。
物理实现则是另一类挑战。工程师必须布置组件、布线互连、完成时序收敛、管理功耗,并满足制造规则。
OpenAI 在大量后端工作上依赖 Broadcom。这一区分意味着 Jalapeño 不能作为语言模型能够自动化完整半导体流程的证据。
标准电子设计自动化软件仍是必需的。Ho 表示,OpenAI 在签核环节使用成熟流程,因为目前尚不存在可信的替代方案。
这应当引起 Cadence、Synopsys、Siemens 以及不断壮大的 AI 芯片设计初创企业群体的关注。OpenAI 的成果验证了对 AI 辅助的需求,同时也保留了对可信验证的必要性。
最可能的竞争焦点在于对工程闭环的控制。成熟厂商能够将模型整合到成熟工具中,而初创公司则可以围绕碎片化工作流构建基于智能体的界面。
芯片公司也可能利用专有设计数据创建内部系统。其过往的 bug、修复记录、时序失败案例和成功实现经验,都可能成为有价值的模型上下文。
OpenAI 还拥有另一项优势,因为它开发了工作流中使用的模型。研究人员可以微调内部系统,或在工具无法处理专业任务时提供支持。
这些系统并非全部公开可用。这一事实限制了可复现性,也让 OpenAI 拥有普通半导体团队无法立即购买的能力。
Broadcom 的角色也带来了另一项限制。芯片设计初创公司 Verkor 的联合创始人 David Chin 向 IEEE Spectrum 表示,Jalapeño 的开发周期可信,但高度依赖 Broadcom 的协助。
他的批评并未抹去这一成果,而是将论断从“AI 让九个月造芯片成为常态”收窄为“AI 能压缩一个获得充分支持的前端项目周期”。
加州大学圣迭戈分校教授 Andrew Kahng 将 OpenAI 的速度描述为很可能处于业内最佳水平。他的观点支持这一成果的重要性,但并未将其视为可以普遍复现的经验。
因此,最可信的教训在于组织层面。团队应将规格说明、实现、测试、测量和专家审查连接成一个更快的反馈系统。
仅仅在未改变的开发流程中加入聊天机器人,无法复现 Jalapeño。模型需要获取相关工具、结构化上下文、测试结果和清晰定义的目标。
工程师还需要拥有否决建议的权力。半导体错误可能在仿真中存活下来,只在异常条件下显现,并在流片后变得代价高昂。
当模型生成看似合理、却隐藏细微时序、安全或正确性缺陷的代码时,风险会进一步上升。更快的生成必须与更强的验证相匹配。
这一要求更有利于拥有资深审查人员的团队。AI 可以增加拟议变更的数量,但只有严谨的验证系统才能将这种规模转化为可靠进展。
因此,对劳动力的影响可能不同于简单替代。规模更小的专家团队可能尝试更大型的项目,而对能够界定问题并判断结果的工程师的需求则会上升。
初级岗位的工作也可能发生变化。曾用于培养新工程师的任务可能实现自动化,因此需要开辟不同路径来培养深厚的硬件专业能力。
半导体行业必须谨慎管理这一转变。如果不培养下一代专家,这一领域就无法无限期依赖资深审查人员。
Jalapeño 为 AI 辅助工程提供了一个具体案例。它并未解决企业应如何保存知识、分配责任或培训未来专家的问题。
九个月这一说法未能证明什么
Jalapeño 提供了一个有力的验证案例,但规模化生产和独立性能表现仍是更严峻的考验。
目前大多数详细性能数据均来自 OpenAI。该公司已使用 InferenceX 基准框架,公布了在多种开放权重模型上与 Nvidia 系统的对比。
对于 GPT-OSS 120B,OpenAI 报告称,其每千瓦峰值混合吞吐量约为 Nvidia GB200 系统的 1.9 倍,同时端到端延迟更低。
对于 DeepSeek R1 670B,OpenAI 报告称,其每千瓦峰值混合吞吐量约为 GB300 的 1.7 倍,端到端延迟则低 3.6 倍。
这些数据采用了特定的模型配置、运行点和封装功耗值,不应被泛化至所有工作负载或生产环境。
OpenAI 控制着 Jalapeño 上的软件栈,并选择了用于披露的配置。Nvidia 系统同样会通过软件、kernel、网络和部署调优不断演进。
更重要的不确定性在于集群运行。一款在受控基准测试中表现出色的芯片,仍必须在真实流量下维持可靠性、利用率和可预测行为。
OpenAI 计划在 2026 年底前开始将 Jalapeño 部署到其基础设施中。有限部署将检验该芯片测得的优势能否经受生产调度和混合工作负载的考验。
独立报道强调了这一不确定性。一项工程评估指出,所报告的性能提升仍需在大规模服务期间得到验证。
制造还带来了设计速度之外的限制。先进芯片依赖晶圆厂产能、高带宽内存、封装、网络组件、主板、机架、散热和供电能力。
Ho 承认,供应仍然紧张,扩充产能需要数年时间。九个月流片并不会创造九个月的制造产能。
这一快速周期还反映了务实的架构选择。Ho 表示,团队为尽快进入市场作出了权衡,因为 OpenAI 对算力的需求十分迫切。
采用三维堆叠或共封装光学技术的更复杂处理器,可能需要更长的开发周期。Ho 并未声称未来每一项设计都能在九个月内完成。
Jalapeño 面向推理,而非模型训练。因此,OpenAI 在其算力组合的重要部分仍依赖 Nvidia、AMD 和其他供应商。
这一边界使该芯片无法被简单视为“Nvidia 杀手”。它针对的是 OpenAI 服务栈内部一个特定的成本与延迟问题。
即使在推理领域,客户价值也必须通过观察而非想当然地确认。更好的芯片并不保证更低的 API 成本、更快的响应或更可靠的访问。
OpenAI 可以将效率收益用于服务更多需求、提升模型复杂度、改善利润率,或将这些结果结合起来。用户未必能看到直接的一对一收益。
AI 辅助设计的说法也需要更清晰的归因。OpenAI 已指出模型加速的任务,但尚未公布完整的节省工程工时核算。
该公司尚未说明,在没有 AI 的情况下,采用相同团队、架构和 Broadcom 支持,这一项目需要多长时间。这一反事实无法被直接测量。
OpenAI也没有披露足够细节,供其他组织复现这一工作流程。内部模型、专有数据、研究支持和保密的设计材料共同塑造了该项目。
更恰当的结论应当更为审慎,也更有力:OpenAI将AI整合进一项量产芯片项目,并在紧张的前端开发周期内完成了可正常工作的芯片流片。
这一成果值得关注,因为它超越了演示和玩具级设计。同时,它也值得审视,因为一次成功的项目并不能确立普遍适用的时间表。
行业应避免走向两个极端。Jalapeño既不证明芯片工程师已经过时,也不只是一次缺乏工程意义的营销活动。
它表明,当模型辅助迭代被嵌入具备足够技术能力的组织时,能够改变真实的开发进度。
三项信号将检验这一基准是否成立
量产部署、第二代产品的进度,以及外部采用情况,将决定Jalapeño究竟改变了芯片开发,还是仅仅创造了一次例外成果。
第一个信号是Jalapeño在OpenAI线上基础设施中的表现。该公司预计首批系统将在2026年底前投入使用,之后再逐步增加容量。
观察人士应关注关于集群利用率、可靠性、模型覆盖范围,以及由这款新处理器承担的推理流量比例等证据。
OpenAI的部署计划描述了先部署有限规模系统、随后扩大容量的安排。这种分阶段方式反映了成功流片与可靠基础设施之间的差异。
如果Jalapeño能以高利用率服务于多样化的生产工作负载,OpenAI关于全栈能力的论点将更有说服力。持续的软件或运维问题则会削弱这一论点。
第二个信号是Jalapeño后继产品的进度。OpenAI表示,其第二代芯片已进入深入开发阶段,同时第三代产品的规划也已启动。
衍生设计应当能够受益于可复用的知识产权、成熟的软件栈,以及不断积累的测量数据。Ho预计,这类项目的推进速度将快于首款芯片。
关键问题不在于下一款设计是否恰好在九个月内完成流片,而在于OpenAI能否在提升架构雄心的同时,重复实现快速开发。
如果第二代产品快速推出,将意味着这一工作流程具有累积效应。模型可从早期代码和测试中学习,而工程师则可复用已验证的接口和验证基础设施。
后继产品延期,并不必然否定AI辅助的价值。它可能反映出更高的复杂性、供应限制,或是有意扩展至新的工作负载。
然而,反复延期将削弱“九个月代表新基准”的说法。一个基准必须经受住不止一个经过精心界定的项目考验。
第三个信号是OpenAI之外的采用情况。Ho表示,硬件公司已接洽OpenAI,希望了解该团队如何实现这一开发进度,以及后续的性能提升。
这种兴趣聚焦于工作流程,而非获得Jalapeño芯片的使用权。OpenAI已表示,希望与行业分享更多自身方法。
具体证据可能包括公开发布的工具、详细的工程报告、商业模型能力,或采用类似方法且有独立文档记录的项目。
更广泛的采用将表明,Jalapeño的流程能够迁移到OpenAI之外,而不局限于其独特的模型、研究人员、工作负载和合作伙伴组合。
如果该方法始终依赖私有模型和紧密的研究资源,其影响力可能仅集中在少数资源雄厚的公司之中。
开发者和企业采购方应当关注这一点,因为芯片开发周期最终会塑造产品表现。更快的硬件迭代可能改变延迟、可用性以及运行AI服务的成本。
知识工作者或许会通过响应更迅速的智能体感受到影响,而非通过显而易见的硬件功能。随着每一步模型处理更快、功耗更低,耗时更长的任务将变得可行。
因此,OpenAI Jalapeño ASIC的重要性不止于一场基准测试竞赛。它提供了一种可检验的AI辅助工程模式,围绕专家、工具与快速反馈构建。
下一个问题很具体:OpenAI能否在可靠地大规模运行最终系统的同时,复现这一开发速度?
关注量产落地、第二代产品的进度,以及首批记录到可比成果的外部团队。这些信号将揭示,九个月究竟已成为基准,还是仍只是一个异常值。



