NVIDIA CoreWeave Vera Rubin 投产,但智能体经济性面临真正考验
NVIDIA 和 CoreWeave 已将 Vera Rubin 投入生产。Cognition 表示,其推理吞吐量最高可达上一代系统的 4.8 倍。NVIDIA CoreWeave Vera Rubin 的部署,将一次硬件发布转化为对智能体 AI 经济性的实战检验。更快的 token 固然重要,但前提是它们能帮助智能体可靠地完成有价值的工作。
开发 Devin 编程智能体的 Cognition,成为首家在 CoreWeave Vera Rubin NVL72 系统上运行生产工作负载的客户。该公司在机架交付后的数日内便开始使用这套基础设施。如此短的切换周期,是 CoreWeave 论证单一云平台能够跨越多代 NVIDIA 产品支持训练、强化学习和推理的重要依据。
这项公告也加剧了专业 AI 云服务商与 AWS、Microsoft Azure、Google Cloud 和 Oracle Cloud Infrastructure 等超大规模云厂商之间的竞争。CoreWeave 押注于更快部署新一代 NVIDIA 系统,以弥补其在覆盖范围和服务目录广度上相较大型供应商的差距。悬而未决的问题是,基准测试中的提升能否经受真实工作负载、不断增长的需求,以及高密度 AI 基础设施运营成本的考验。
NVIDIA CoreWeave Vera Rubin 已开始服务真实客户
关键变化不在于 Vera Rubin 已经问世,而在于已有客户正将其用于生产级智能体工作负载。
CoreWeave 于 2026 年 9 月 30 日在旧金山举办的 Fully Connected 大会上宣布,Vera Rubin NVL72 已有限度开放使用。该公司表示,数百块 Rubin GPU 已部署在多个地区。Cognition 是首个被点名的、在该平台上运行生产级智能体工作负载的客户。
一台 Vera Rubin NVL72 机架由 72 块 Rubin GPU 和 36 颗 Vera CPU 组成。NVLink 6 将这些处理器连接起来,使机架能够作为统一计算系统运行。该设计还采用了 ConnectX-9 网络适配器和 BlueField-4 数据处理单元。
CoreWeave 正将这些机架与 NVIDIA Spectrum-X 102.4 Tbps 以太网网络配套部署。这一横向扩展网络连接多个机架,同时管理训练、推理、存储和智能体工具产生的数据流量。CoreWeave 在宣布向客户开放前,已经启用了一个包含数百块 Rubin GPU 的集群。
与标准聊天机器人相比,Cognition 为这次发布带来了要求更高的测试场景。Devin 可在软件仓库中工作、生成并执行代码、评估结果,并调整自身的方法。每项任务都可能需要大量相互依赖的模型调用,后续步骤必须等待前序步骤完成。
这种依赖关系会让延迟不断累积。单独缩短一次模型响应的时间,价值有限;但若能在数十甚至数百个推理、检索、执行和评估步骤中节省时间,则可能实质性改变智能体完成任务的速度。
Cognition 表示,它将新系统与 NVIDIA GB200 NVL72 基线进行了比较。其工程师使用了代表公司自主软件工程任务的 SWE-2 推理工作负载。在相同交互性条件下,Cognition 测得每块 GPU 的总 token 吞吐量最高提升至 4.8 倍。
该公司还表示,在强化学习期间,每块 GPU 的输出 token 吞吐量提升了 3.8 倍。这些数据来自客户自行运行的测试,但参与公司公布了方法和结果。相关结果尚未在其他客户或其他智能体类别中得到独立复现。
CoreWeave 的详细生产基准测试称,Cognition 在获得访问权限后的数日内便开始运行工作负载。这一切换时间支撑了另一项主张:客户无需重建运营环境,即可采用新一代 GPU。
该部署运行在与 CoreWeave 现有 GB200 和 GB300 集群大体相同的工具体系下。客户可跨代使用公司的 Kubernetes、推理、存储和基础设施管理服务。这种一致性至关重要,因为部署机架只是进入生产环境的第一步。
系统还必须处理固件、网络、冷却、存储、调度、可观测性、故障和安全等问题。CoreWeave 希望客户将这些组成部分视作一个统一的托管平台。这正是 NVIDIA 芯片与 Cognition 应用之间的运营桥梁。
原始公告还介绍了更广泛的产品方向。CoreWeave 计划提供独立的 NVIDIA Vera CPU 算力,并推出 CoreWeave Forge——一个用于训练、评估和改进模型及智能体的环境。综合来看,这些产品将云定位为持续开发系统,而不只是一个租用 GPU 的地方。
为什么智能体 AI 改变了基础设施瓶颈
智能体 AI 将性能问题从模型回答得有多快,转变为一整条相互依赖的行动链能以多高效率完成。
传统推理请求通常是将输入发送给模型,再返回输出。智能体则可能检索文件、调用工具、运行代码、检查结果,然后再次尝试。每个循环都会消耗 token,并在处理器、内存、存储和外部服务之间传输数据。
长上下文带来了另一种压力来源。编程智能体可能需要在工作上下文中纳入仓库文件、任务说明、先前操作、测试结果和工具输出。这些信息会形成键值缓存,这是一种在生成过程中存储中间注意力数据以供复用的内存结构。
随着上下文和并发会话的增长,这一缓存会消耗更多高带宽内存。在 GPU、CPU 和存储之间移动它可能引入延迟。因此,若周围的网络和存储系统无法持续为其供给数据,再快的加速器也只能带来有限收益。
CoreWeave 的策略是将这些限制作为一个整体系统来解决。其多机架设计通过 Spectrum-X Ethernet 连接数百块 Rubin GPU。该公司称,每块 Rubin GPU 获得 1.6 Tbps 的横向扩展连接能力。
该运营商还利用本地缓存,将高频访问的数据保留在计算资源附近。跨区域写入加速让工作负载能够本地写入,同时在后台继续复制。对于智能体而言,这意味着中间状态和生成的产物不必总是等待远端存储操作完成。
该公司的多机架部署说明了对固件、网络、电力、液冷、存储和软件的验证流程。只有组件诊断和整机架工作负载测试通过后,机架才会投入生产。这个过程说明了为何生产可用性可能滞后于芯片发布。
NVIDIA 设计 Vera Rubin,也是为了应对同样的整体系统问题。其 NVL72 配置通过 NVLink 6 连接处理器,并通过 InfiniBand 或 Spectrum-X Ethernet 连接机架。NVIDIA 表示,在特定工作负载下,该系统每瓦推理吞吐量最高可达 Blackwell 的十倍。
该公司还声称,对于某些任务,该系统可将 token 成本降至十分之一,并将所需 GPU 数量降至四分之一。这些都是平台层面的预测,并非普遍适用的结果。模型规模、精度、批处理大小、延迟目标、软件优化、利用率和电力成本都会改变最终结果。
Cognition 的结果范围更窄,也更具参考价值。它在相同交互性条件下测试了真实的软件工程工作负载。4.8 倍这一数字仍是与供应商相关的基准测试,但它开始将硬件吞吐量与可识别的应用联系起来。
不过,总 token 吞吐量不等于任务完成。智能体可以生成更多 token,却未能解决更多问题;它也可能更快地重复错误,或将额外计算资源耗在无效路径探索上。
更有意义的指标,是单位时间、能耗和成本下完成的工作量。对于编程智能体,这包括获接受的代码变更、通过的测试、成功完成的仓库任务,以及所需人工修正的程度。这些指标才能揭示 Vera Rubin 的性能是否改善了产品,而不只是增加了活动量。
这一区别对企业买家很重要。基础设施团队购买的是算力,但应用团队需要可靠的结果。更快推理的价值取决于它是否缩短研究迭代周期、支持更多并发用户,或降低每项成功任务的成本。
CoreWeave 智能体 AI 将硬件获取能力转化为云战略
CoreWeave 正将对新一代 NVIDIA 系统的早期获取能力,作为对抗拥有更庞大客户基础和软件生态云厂商的竞争策略。
CoreWeave 与 NVIDIA 的合作关系可追溯至 2017 年及 Volta 一代。该公司称,其 V100 GPU 在近十年后仍服务于客户工作负载。与此同时,它正在平台商业周期的早期,将 Vera Rubin 算力投入生产。
这种重叠具有重要的财务意义。AI 加速器需要大量前期投资。当新架构到来后,旧系统仍能保持价值,云运营商便能获得更好的回报。
并非每项工作负载都需要最新的加速器。开发、较小的模型、数据准备和对延迟不那么敏感的推理,都可以在前代系统上运行。新机架则可服务于最受益于更高内存带宽、网络性能或能效的任务。
CoreWeave 将这种资源分配称为跨代可互换性。客户使用同一套软件环境,而运营商则为每项工作负载匹配合适的硬件。原则上,这种方式可避免架构过渡迫使所有客户同时迁移。
这一主张也回应了专业 AI 云服务商长期面临的风险:当 NVIDIA 推出更快的一代产品时,其实体资产可能失去竞争力。让 V100、Hopper、Blackwell 和 Rubin 系统保持高效运转,可延长资产寿命,并降低立即更换整个集群的压力。
CoreWeave 的软件层旨在实现这一目标。Mission Control 管理基础设施健康状态和生命周期运营。其 Kubernetes 服务调度容器化工作负载,而推理平台和存储服务则支持应用交付。
该公司还为高密度液冷机架构建了硬件管理组件。Valvey 控制冷却流量,并可在发生故障或维护时隔离机架。Racky 协调机架级控制,生命周期软件则负责检测、固件更新、验证、电力和冷却。
这些组件并不会让 CoreWeave 摆脱对 NVIDIA 的依赖,而是使其对 NVIDIA 的依赖得到更深入的工程化管理。当 CoreWeave 能够尽早获得新系统时,这种依赖会形成优势;但它也会集中技术和供应链风险。
超大规模云厂商面临的是不同的权衡。AWS、Microsoft Azure、Google Cloud 和 Oracle Cloud Infrastructure 可以将 AI 算力与数据库、安全服务、身份系统、全球网络及成熟的企业合同打包提供。其中一些还在开发自有加速器。
NVIDIA 已将这些超大规模云服务商与 CoreWeave、Crusoe、Lambda、Nebius、Nscale 和 Together AI 一同列为 Vera Rubin 合作伙伴。因此,平台发布并未赋予 CoreWeave 永久独家权。它为该公司提供了一个窗口,以证明专业化能够带来更快的部署和更高的利用率。
各方表示,Cognition 的快速接入为这一论点提供了佐证。该公司在不到九个月内便将规模扩展至 CoreWeave 上的数千块 GPU。如今,它通过同一家服务商运行训练、强化学习和生产推理。
这种整合可以减少研发与生产之间的摩擦。在一个环境中训练的模型,无需在为用户提供服务前迁移至另一套云架构。性能工程师也能够凭借对底层集群的直接了解来优化推理。
不过,这种集中化也会带来转换成本。将训练数据、模型工作流、评估系统和生产推理都放入一家专业云服务商的客户,将会受制于其可用性和运营模式。更快的迭代速度必须能够弥补这种依赖。
因此,这场竞争并不只是 CoreWeave 对阵 AWS 或 Azure,而是专业化对阵广度。CoreWeave 必须证明,其将每一代 NVIDIA 产品投入运营的能力,能够创造足够价值,以抵消大型云服务商在覆盖范围、采购熟悉度和服务多样性上的优势。
Vera Rubin 性能并不能决定商业经济性
该基准测试支持了 CoreWeave 的工程论点,但并未解决利用率、融资、需求或客户集中度风险。
Cognition 的测试在一类软件工程工作负载下,对 Vera Rubin NVL72 和 GB200 NVL72 进行了比较。报告的性能提升幅度很大,但这些结果并不能证明在每一种模型、延迟目标、批处理规模或智能体设计中都具备同样优势。
这一比较还侧重于每块 GPU 的吞吐量。买家需要了解每项已完成任务的总成本,包括网络、存储、CPU 环境、软件、电力和预留容量。当昂贵硬件处于闲置状态时,高吞吐量也无法带来有吸引力的经济效益。
对于智能体工作负载而言,利用率尤其重要。用户发起任务、智能体调用工具或研究团队运行实验时,需求可能会突然激增。服务商需要留有足够的备用容量来应对高峰,同时避免在低谷期让过多基础设施闲置。
CoreWeave 表示,现有几代 GPU 仍具有商业生产力。鉴于不同工作负载的需求各异,这一说法是合理的,但仍需要持续的证据支持。旧款加速器的有效寿命取决于软件支持、能效、客户需求以及代际之间的价格差异。
该公司的财务披露提供了更广泛的警示。CoreWeave 将大量负债、不断增长的资本需求、客户集中度以及对有限供应商的依赖列为重大风险。这些因素本就存在于一种需要在收入到来前购置昂贵基础设施的商业模式之中。
其 2026 年 6 月季度文件披露了一项新的 31 亿美元延迟提款定期贷款额度。文件还警告称,债务可能限制公司融资、应对市场变化以及为运营提供资金的能力。这些披露并未否定其运营进展,但界定了这些进展必须达到的标准。
CoreWeave 的风险披露还指出,有限的运营历史使趋势更难评估。当基础设施支出、利息成本和客户义务同步扩大时,快速增长可能与财务压力并存。
新硬件只有在客户以具吸引力的费率使用时,才能改善这一方程式。4.8 倍的吞吐量提升可能支持以相同数量的 GPU 运行更多智能体会话,也可能促使客户运行更大的工作负载,从而消耗现有容量。
哪一种效应占主导地位,将取决于需求弹性。当推理变得更便宜时,开发者往往会通过增加上下文、评估、并行尝试或更长的推理来提高使用量。单位成本下降并不必然降低总支出。
NVIDIA 与 CoreWeave 的关系中还存在一个循环因素。NVIDIA 提供核心处理器、支持该平台、持有 CoreWeave 的投资权益,并会在这家云服务商扩充容量时受益。CoreWeave 则从早期访问和联合工程中受益。
这种一致性能够加快部署,但也可能使人更难区分独立的市场需求与由紧密商业关系支持的增长。因此,投资者和客户应关注那些尚未与合作方建立深度联系的公司是否也会广泛采用。
竞争将带来另一项检验。一旦超大规模云服务商和其他 NVIDIA 云合作伙伴大规模提供 Vera Rubin,早期访问的差异化程度就会降低。CoreWeave 必须在可靠性、利用率、工程支持、网络、存储以及将工作负载推向生产的速度上展开竞争。
定制加速器从另一个方向施加压力。AWS、Google 和 Microsoft 可以将部分工作负载导向自研芯片,尤其是在这些系统能够为特定模型提供更好经济效益时。CoreWeave 则与 NVIDIA 的架构和发布周期保持着更紧密的一致性。
这些风险均未否定 Cognition 的结果。它们说明,单一强劲基准测试无法决定商业案例。生产成功需要可重复的客户成果、高利用率、持久需求,以及超过融资和运营成本的回报。
更快的 Token 对开发者和企业买家意味着什么
开发者应将此次发布视为基础设施正变得更不可见的证据,而非智能体可靠性问题已经解决的证据。
对于 AI 应用团队而言,直接好处是更短的迭代周期。训练、强化学习、评估和推理可以在一个平台上运行。工程师可以调整模型、针对智能体任务进行测试,并完成部署,无需在互不关联的环境之间迁移大型数据集。
Cognition 提供了这一工作流的具体范例。其团队通过 CoreWeave 训练 Devin 模型、运行强化学习、跟踪实验、调整推理,并处理生产请求。Vera Rubin 在无需单独由客户主导完成启用流程的情况下,增加了容量和吞吐量。
这种连续性可以缩短从实验到已部署功能的路径。它还使基础设施工程师能够针对应用所使用的同一生产工作负载,调优缓存管理、服务参数和运行时行为。
企业买家仍应区分三个问题。第一,服务商能否交付硬件?第二,平台能否可靠地运行它?第三,客户的应用能否产生足够的额外价值来证明所用容量的合理性?
NVIDIA CoreWeave Vera Rubin 公告对前两个问题的回应比第三个更直接。CoreWeave 已拥有投入运营的机架、多机架集群和生产客户。Cognition 则已在特定应用测试中公布了吞吐量提升。
第三个问题需要业务层面的衡量。编程智能体应完成更多被接受的任务、减少审查时间,或让开发者处理更大的积压工作。研究智能体应以可追溯的证据产出更准确的答案。支持智能体应在不提高纠正或升级率的前提下解决请求。
团队还需要在成本不变的情况下跟踪质量。更快的基础设施可能诱使开发者增加上下文长度、采样或并行尝试。这些选择或许能改善结果,但也可能在效率收益传递给客户之前将其消耗殆尽。
可靠性仍是一个独立的系统问题。智能体失败可能源于模型错误、权限缺失、工具不稳定、数据格式错误或规划不当。硬件吞吐量能够减少等待时间,却无法纠正这些失败。
采用智能体的组织将需要更强的评估系统。每项工作流都应具备具有代表性的任务、成功标准、成本上限和工具操作记录。缺少这些控制措施时,团队可能会将更高的活动量误认为更高的生产力。
它们还需要一个信息层,为智能体提供最新且考虑权限的上下文。更快的模型无法弥补文档不完整或项目历史碎片化的问题。一个可搜索的 AI 知识库可以帮助团队组织人员和 AI 工作流所使用的材料。
基础设施选择应随工作负载而定。具有高并发、长上下文和持续模型改进需求的团队,最有理由测试 Rubin 容量。较小的应用可能通过旧款 GPU 或托管模型服务获得更好的经济效益。
这正是 CoreWeave 的多代产品论点变得相关之处。如果平台能够将每项任务分配给合适的硬件,客户就无需将 Vera Rubin 视为所有任务的默认选择。他们可以为那些受益于其内存、网络和能效特征的工作负载预留它。
开发者也应要求提供基准测试细节。值得询问的问题包括:吞吐量是按每块 GPU 还是每个机架计算,延迟是否保持不变,使用了何种精度,以及比较是否涵盖了所有基础设施成本。特定应用的成功率比峰值 Token 指标更重要。
最理想的结果将是一个硬件代际成为稳定工具背后可互换资源的市场。开发者可以选择性能和成本目标,而云服务商负责调度、验证和故障处理。CoreWeave 正将这次部署定位为迈向这一模式的一步。
三项信号将显示 AI 闭环是否真正形成
下一阶段必须证明,早期生产访问能够转化为可重复的客户价值,而非短暂的硬件领先优势。
第一个信号是更广泛的客户采用。Cognition 是一个有意义的起点,因为编程智能体会产生高要求的序列化工作负载。CoreWeave 现在需要在不同智能体类别和模型架构中获得更多生产客户。
独立结果将加强这一论点。若客户支持、科学研究、金融分析或多模态智能体中也出现类似改进,将表明 Vera Rubin 的性能提升超出了单一优化工作负载的范围。其他领域较小的提升会收窄这一主张,但不会抹去 Cognition 的结果。
第二个信号是任务层面的经济性。CoreWeave 及其客户应报告每块 GPU 完成的任务数、每次成功会话的成本、整个工作流中的延迟,以及人工干预率。这些指标将 Token 吞吐量与应用价值联系起来。
如果这些结果得到改善,同时生成速度和质量保持稳定,NVIDIA CoreWeave Vera Rubin 的论点便会获得支持。如果工作负载只是消耗了更多 Token,基础设施会更快,却未必更具经济性。
第三个信号是,随着竞争性的 Rubin 容量扩大,CoreWeave 的表现如何。AWS、Azure、Google Cloud、Oracle Cloud 和其他专业服务商也正在采用该平台。它们的可用性将检验 CoreWeave 的优势究竟来自暂时的访问权,还是持久的运营专长。
如果其网络、存储、调度和工程支持能带来更高利用率,CoreWeave 应能留住客户。即使 Vera Rubin 本身表现良好,若客户迅速转向大型云服务商,也将削弱其专业化论点。
财务结果将提供一项并行验证。新系统的利用率提升和收入增长,最终应能抵消折旧、利息、电力及扩张成本。若持续大规模融资却未见回报改善,则说明技术进步尚未形成完整的经济闭环。
NVIDIA 和 CoreWeave 已跨过一个重要门槛:Vera Rubin 正在运行一款真实的智能体产品,而非停留在路线图上等待落地。Cognition 报告的收益使这项部署值得关注,但决定性的数字仍在后面。
对开发者而言,问题很实际:更快的基础设施能否帮助你的智能体在稳定预算内完成更多正确的工作,还是只会产生更多中间环节?应衡量完整任务的结果,测试多代硬件,并观察独立客户能否复现 Cognition 的收益。这些证据将决定 NVIDIA 和 CoreWeave 是否真正闭合了智能体 AI 的闭环,还是仅仅加速了其中的一环。



