top of page

Nvidia 与 SpaceX 的 AI 基础设施合作内含矛盾

在 Elon Musk 表示其公司将完全基于 Nvidia 构建系统后,Nvidia 和 SpaceX 登上了 Google News;而 SpaceX 此前一直在推广供应商中立的轨道计算机。这一决定使 Nvidia 的 Vera Rubin 硬件成为 SpaceX 计划中的 Starmind AI 卫星核心,也暴露出 SpaceX 对成熟芯片的迫切需求与其长期自主制造雄心之间的根本冲突。

Musk 在 SpaceX 8 月业绩讨论中称,Nvidia 的机架级 AI 计算机 Vera Rubin NVL72 是当前最好的架构。SpaceX 还表示,两家公司将共同开发 Starmind AI1 的计算载荷。这颗计划中的卫星将结合 Nvidia Rubin 图形处理器与 Vera 中央处理器,在轨实现数据中心级计算。

这听起来像是一次直接的供应商胜利,但事实并非如此。SpaceX 自己的 Starmind 材料将 AI1 称为模块化、供应商中立的平台,而其监管披露则警告,轨道 AI 所需芯片数量超过了 SpaceX 目前能够获得的规模。

因此,这项合作代表了一种妥协。SpaceX 需要 Nvidia 将 Starmind 从雄心勃勃的设计推进为可飞行硬件。Nvidia 获得了一位高知名度客户和一个轨道测试案例,但这段关系也将帮助 SpaceX 发展基础设施,最终可能降低其对外部芯片供应商的依赖。

AMD、Google、Amazon 及其他定制芯片开发商如今又面对一个案例:Nvidia 凭借完整计算系统取胜,而非单项处理器基准测试。不过,SpaceX 仍必须证明,一套地球上的 AI 机架是否真的适合部署到轨道上。

Nvidia 和 SpaceX 为何占据 Google News

眼下的变化在于,SpaceX 决定将下一代 AI 系统标准化为围绕 Nvidia 构建,同时联合调整这套硬件以适应轨道环境。

Musk 表示,SpaceX 及其 AI 业务将完全基于 Nvidia 构建,因为 Vera Rubin 架构是目前最强的选择。据报道,这一承诺覆盖地面系统和拟议中的 Starmind 卫星星座。

Vera Rubin NVL72 是一个机架级平台,这意味着其处理器、内存、网络和冷却系统作为一台协调一致的计算机运行。该系统旨在通过 Nvidia 的高速网络架构连接 72 枚 Rubin GPU。SpaceX 希望针对航天器优化这一集成设计,而不是将传统服务器机架装入卫星。

这一差别很重要。Nvidia 并非只是为一次发射试验出售单独的处理器。据报道,两家公司正在合作开发 Starmind AI1 的计算载荷,这决定了处理器、内存、网络、电源和热控制系统如何协同集成。

SpaceX 将 AI1 描述为一颗大型卫星,展开后高度为 20 米,翼展达 70 米。其公布的设计显示,平均计算载荷为 120 千瓦,峰值为 150 千瓦。这些数字反映的是电力负载,而不是该卫星将提供的有效 AI 运算次数。

官方 Starmind design 表示,结果将通过激光链路传入 Starlink 网络。该卫星将在太阳同步轨道运行,使其太阳能阵列能够持续暴露在相对稳定的阳光下。

SpaceX 认为,这种安排能够规避部分地面数据中心的限制。轨道系统无需争夺电网接入、工业用地或冷却水。Starship 将提供发射能力,而 Starlink 将提供通信层。

然而,太空并不意味着散热毫不费力。真空环境使工程师无法利用普通空气带走热量。硬件必须将热量传导至散热器,再由散热器以红外能量形式辐射出去。

这一过程需要大面积散热表面、精细的温度管理,以及能够承受反复热循环的硬件。SpaceX 表示其方案可以降低冷却开销,但目前尚无运行中的 Starmind 卫星在所述规模上验证这一说法。

AI1 仍是一项提案,而非已经部署的数据中心。SpaceX 表示,其 Bastrop 制造工厂最早可能在 2027 年底开始生产数千颗 AI 卫星。这一时间表取决于卫星生产、Starship 发射能力、芯片供应以及监管批准。

Nvidia 的公告改变了项目,因为它明确了首条严肃部署路径背后的计算架构。但它并未解决这一模式是否具备经济可行性。

这一差异常常在 Google News 摘要中消失:合作公告看起来可能像已经完成的基础设施。在这里,这项公告更应被理解为一项工程承诺,且仍存在多项未解决的依赖因素。

SpaceX 必须将 Nvidia 高度集成的地面系统转化为适航硬件。Nvidia 则必须支持一个面临辐射、发射振动、维修选择有限和更严格能源限制的平台。

两家公司均未公布完整的性能目标、卫星总数、部署合同,或经过独立测试的成本比较。这些缺口才界定了真正的新闻所在。

SpaceX 要建设轨道云,先得获得芯片

Nvidia 为 SpaceX 提供了最快获得可信 AI 算力的路径,但这种速度伴随着深度的供应商依赖。

SpaceX 的 AI 雄心在其公司架构吸收 xAI 和 Colossus 数据中心业务后得到扩张。这一整合将火箭、卫星连接、大型 GPU 集群和 AI 模型置于同一组织之下。

它也带来了巨大的算力需求。Colossus 已经使用 Nvidia 硬件进行模型训练和推理,即运行训练完成的模型以生成答案的过程。此后,SpaceX 已将其中部分基础设施转变为商业计算业务。

一份描述 Google 协议的公司文件为这一业务提供了有用的衡量尺度。该 compute agreement 涵盖约 110,000 枚 Nvidia GPU 及相关组件的使用权。

文件称,该服务计划在 2026 年 9 月前逐步提升规模。其中还包括交付要求,以及若 SpaceX 未能提供承诺算力时的终止权。

这份合同揭示了 Nvidia 为何在 Starmind 之外同样重要。SpaceX 为其自身模型、外部客户和轨道实验需要稳定的加速器供应。硬件交付延迟既可能影响收入,也会影响研究进度。

其地面集群也为拟用于轨道的系统提供了测试场。工程师可以在将设计改造为卫星用途之前,研究工作负载行为、网络瓶颈、组件故障和能耗。

Nvidia 的优势在于其周边平台。其 GPU 运行在 CUDA 之上——这是一个被广泛用于训练和部署 AI 模型的软件环境。Nvidia 还提供网络、通信库、处理器和参考系统设计。

迁离这一技术栈,远不只是更换一块电路板。开发者必须验证模型内核、分布式训练代码、内存行为、监控系统和故障恢复机制。

在轨道系统中,这些依赖变得更严格。维护人员无法更换故障组件。软件必须能够容忍通信中断、辐射导致的错误以及对硬件的有限访问。

Nvidia 已经为卫星和其他受限环境推出计算产品。其 space computing platform 专注于星载推理和传感器处理,尽管这些应用的规模小于 Starmind 拟议中的 AI 工厂。

SpaceX 可以借鉴这些经验,同时贡献发射系统、航天器生产、激光通信和轨道运营能力。每家公司都提供了对方所欠缺的东西。

这正是合作背后的机制。Nvidia 提供具有成熟开发者基础的一体化计算架构。SpaceX 则提供将这一架构置于地面电网之外的路径。

这一安排给 AMD 和定制芯片项目带来了压力。竞争处理器可能提供有吸引力的性能或采购经济性,但 SpaceX 正在优先考虑整个系统层面的部署确定性。

Google 和 Amazon 面临类似的张力。两家公司都开发内部 AI 加速器以降低对 Nvidia 的依赖,但外部客户往往希望获得 Nvidia 兼容性。SpaceX 的计算合同可以满足这种需求,而无需客户重写其工作负载。

当客户围绕 Nvidia 的网络和软件实现标准化时,Nvidia 的地位会更加强势。SpaceX 围绕 Vera Rubin 构建得越多,日后转型就越困难。

SpaceX 接受这种锁定,因为时间至关重要。等待内部芯片,或为另一家供应商重建软件,将会在竞争对手发展自身基础设施战略之际延误 Starmind。

因此,独家措辞传达的是紧迫性,而非永久的技术确定性。SpaceX 现在需要可用的系统,同时仍在推动一个更依赖内部制造的未来。

供应商中立承诺遇上 Nvidia 独家部署

SpaceX 同时承诺模块化轨道平台和 Nvidia 独家部署;只有当独家性是暂时的,这两种立场才能兼容。

矛盾出现在 SpaceX 自己的网站上。其 Starmind 页面称,卫星架构支持来自任何供应商的计算模块。这一表述将 AI1 描绘为可适配的载体,而非单一供应商的机器。

Musk 后来的言论则指向另一方向。他表示 SpaceX 将完全基于 Nvidia 构建,并特别称赞 Vera Rubin 是最好的 AI 计算机。

两种说法在不同层面上都可能准确。从理论上讲,一颗卫星可以支持可替换模块,同时其首个量产配置采用单一供应商。物理兼容性并不能保证实际可移植性。

软件构成最大的障碍。AI 工作负载依赖经过优化的库来完成矩阵运算、通信、内存管理和模型执行。Nvidia 已花费多年时间将这些层与其硬件整合。

竞争模块需要兼容的供电、冷却、机械连接、网络和适航软件。它还必须能够运行客户工作负载,而不需要进行不可接受的改动。

这是一种要求很高的模块化定义。若软件和网络无法支持,一个能够接入另一块板卡的插槽并不会形成有用的替代选择。

SpaceX 的 Terafab 提案又增加了一层复杂性。该公司描述了一项与 Tesla 的联合制造计划,最终将生产先进 AI 芯片。其招股书将这一努力视为预期合作领域,而非已经完成的制造能力。

半导体制造需要工艺技术、专用设备、封装、内存供应和可靠的量产良率。宣布一个制造项目并不能缩短这些开发周期。

因此,SpaceX 面临着一个时序问题。它希望掌控关键组件,但在内部替代方案出现之前需要 Nvidia 硬件。Nvidia 帮助 SpaceX 进入市场,同时也可能在培养未来的竞争对手。

Nvidia 能够承受这一风险,因为系统需求迫在眉睫。每个地面集群和 Starmind 原型都要消耗处理器、网络设备和软件支持。未来 SpaceX 自研的内部芯片,仍将需要与 Nvidia 的下一代架构竞争。

这种关系类似于其他 AI 基础设施合作:供应商同时也为客户提供融资、建议或支持。Nvidia 和 xAI 加入了围绕数据中心及配套资产投资而建立的更广泛基础设施合作伙伴关系

这些角色的重叠能够加速建设,但也会令需求更难解读,因为同一批公司同时扮演投资者、供应商、合作伙伴和客户。

对 Nvidia 而言,部署 Starmind 将展示其架构的覆盖范围。若 Vera Rubin 能在轨道功耗和热管理边界内运行,Nvidia 将获得任何传统云服务商都无法匹敌的参考设计。

对 SpaceX 而言,这项合作将抽象的轨道云计划转化为具名的硬件项目。它可以向投资者、客户和监管机构说明,其首台卫星计算机计划采用什么技术。

代价是议价能力下降。独家客户在供应短缺或合同谈判期间可选择的替代方案更少。SpaceX 的文件已将芯片可得性列为一项重大约束。

该公司表示,大规模轨道 AI 所需芯片数量远超其目前可获得的供应量。它还披露,采购安排可能使其面临制造产能、材料和地缘政治扰动的风险。

卫星项目会放大这些风险。SpaceX 需要为地面测试、替换库存、发射和后续世代准备芯片。任何一个组件延误,都可能拖延整艘航天器。

Nvidia 也面临自己的取舍。支持 SpaceX 需要为一个环境要求特殊的平台投入工程资源。在 SpaceX 证明其具备实用工作负载、可靠发射能力和有竞争力的运营成本之前,市场机会仍不确定。

因此,这项独家承诺应被理解为当前的架构决策。它并不意味着 Nvidia 将供应 Starmind 的每一代产品。

如果 Terafab 成功,SpaceX 就有理由引入自有芯片。如果 AMD 或其他供应商提供显著更优的系统,已宣传的模块化能力也会给 SpaceX 重新考虑的理由。

在此之前,Nvidia 赢得了首个配置,而这可能是最重要的一个。早期硬件选择会在多年内塑造软件、运营方式和客户预期。

轨道 AI 仍须胜过地面数据中心

最难对付的竞争者不是 AMD 或另一家芯片公司,而是将 AI 基础设施留在地球上的经济效率。

天基计算始于一个颇具说服力的现实约束。AI 数据中心需要大量电力、土地、冷却设备和输电容量。在拥挤的市场,新建电网连接可能需要数年时间。

SpaceX 提议通过持续收集太阳能和在轨散热来绕开这些瓶颈。Starship 将把大型系统送入轨道,Starlink 激光连接则将计算结果传回地面。

这种方法天然适合不需要持续与用户交互的工作负载。批量推理、科学处理和部分模型评估任务,比交互式助手更能容忍通信复杂性。

机载处理还可以减少传回地球的原始卫星数据量。航天器可在本地分析图像,只返回相关结果。

这些场景不同于在数千个高度同步的加速器上训练前沿模型。分布式训练依赖处理器之间快速、可预测的通信。微小延迟就可能让昂贵硬件闲置。

Nvidia 的 NVL72 系统通过高带宽互连解决机架内部这一问题。在轨扩展多个机架,则需要卫星之间或规模大得多的航天器内部同样精细的通信安排。

激光链路速度很快,但无法消除距离、指向要求、网络中断或路由开销。SpaceX 尚未发布比较 Starmind 与地面 Nvidia 集群的基准测试结果。

辐射带来另一项挑战。高能粒子可能损坏内存或改变计算结果,这种事件通常称为位翻转。工程师可以采用屏蔽、纠错、冗余和软件检查,但每种应对措施都会增加质量或消耗能源。

硬件更换同样成本高昂。故障的地面 GPU 可以由技术人员更换;故障的轨道模块可能要等到另一颗卫星发射后才能恢复可用。

技术迭代周期也让商业论证更加复杂。AI 处理器可能在数年内就在商业上过时。SpaceX 必须在更新的地面系统令一代轨道设备吸引力下降前,收回制造和发射成本。

该公司认为,可复用火箭和高产量卫星制造能够降低这些成本。这一说法取决于 Starship 能否以适合计算硬件的成本,实现高频、可靠的发射。

Starmind 的规模也带来监管和环境问题。数千颗大型卫星将影响发射频率、轨道交通、碰撞风险、天文学以及报废处置。

SpaceX 表示,它打算保护长期轨道可持续性。然而,完整的星座设计和相关监管申请将决定这一承诺在实践中如何落实。

地球上的电网限制也会引发地面方案的应对。公用事业公司可以增加发电能力,数据中心运营商可以选址靠近电力来源,芯片制造商则可以提高每瓦性能。

Nvidia 正与能源公司合作开发可根据电网状况调整负载的灵活数据中心。其电网计划表明,该公司并未将赌注完全押在轨道基础设施上。

这些地面方案无需承担发射和辐射风险,便可与 Starmind 竞争。它们还支持可维修设备和成熟的光纤连接。

这使 Nvidia 的合作关系在战略上颇为特殊。无论 SpaceX 继续购买地面集群,还是成功开发轨道集群,Nvidia 都能获益。SpaceX 承担了更多部署风险。

客户经济性尤其仍不明确。在开发者将工作负载移入轨道前,服务提供商必须在容量、可靠性、位置或成本方面提供实质性优势。

SpaceX 初期可将 Starmind 用于内部处理,从而减少立即赢得外部客户的需求。即便内部使用,仍需证明轨道运行优于在地球上增加 Colossus 容量。

一次成功的技术演示只能回答部分问题。一颗卫星可以证明硬件能存活,却无法确立星座级经济性、故障率或客户需求。

因此,读者应区分三项主张:Nvidia 硬件能够在太空中运行;Starmind 能够作为分布式 AI 系统运行;Starmind 能够在商业上与地面数据中心竞争。

第一项主张在较小规模上已有先例。第二项对于已披露的设计仍未得到验证。第三项则需要多年的运营和财务数据。

三个信号将显示这项合作是否重要

下一项证据必须来自硬件、供应承诺和付费工作负载,而不是又一次公告。

第一个信号是具备可验证规格的完整 Starmind AI1 原型。SpaceX 表示,预计将在 2027 年开始发射这套基于 Nvidia 的系统,但仅有发射日期提供的信息有限。

有意义的披露应说明已安装的 Rubin 配置、可用功率、内存、辐射防护、热性能和通信容量。它还应解释轨道设计与地面 NVL72 系统有何不同。

由独立方或客户观察到的工作负载,将进一步增强论据。一项成功测试应报告持续输出和错误率,而不仅是处理器峰值性能。

如果 AI1 能在较长时间内完成有用计算,这项合作将获得技术可信度。如果进度延误或载荷大幅缩小,结果将削弱机架级轨道 AI 即将到来的说法。

第二个信号是持久的芯片供应安排。SpaceX 需要足够的 Nvidia 硬件来服务 Colossus、外部计算合同、Starmind 测试以及任何初始卫星舰队。

一项长期协议将减少围绕分配的不确定性。它也可能揭示独家合作是否包括采购承诺、工程支持、融资,或优先获得未来架构的权利。

没有这样的安排,独家合作可能主要只是当前偏好的声明。SpaceX 已承认的对采购订单的依赖,仍将是一项核心风险。

供应条款还将明确 Nvidia 面临的风险敞口。一项坚定承诺将表明,这家芯片制造商认为 Starmind 不只是一次宣传性演示。

第三个信号是有客户愿意在轨道硬件上运行明确的工作负载。SpaceX 已证明自己能够向大型 AI 客户出售地面 Nvidia 容量。轨道服务则需要另一项需求证明。

最有力的证据应包括工作负载类型、服务级别预期、持续时间以及选择太空的理由。测试遥感或延迟容忍型批量推理的客户,初期比对延迟敏感的聊天机器人更合理。

缺少客户并不会扼杀该项目,因为 SpaceX 可以内部使用这些容量。不过,这将限制 Starmind 代表一个新云市场的说法。

这些信号应按这个顺序出现。硬件必须先正常工作,供应才能支撑一支卫星舰队,而客户需要可靠的系统后,才会承诺有意义的工作负载。

投资者还应关注 SpaceX 的表述。如果该公司持续将 Starmind 称为供应商中立,却只采购 Nvidia 系统,那么模块化仍是一项未来选项,而非已投入运行的特性。

转向 Terafab 硬件将证实 Nvidia 的独家合作只是过渡性的。持续依赖 Nvidia 则表明,集成平台的优势超过了 SpaceX 对垂直控制的追求。

开发者关注该项目则有不同理由。轨道计算可能改变某些工作负载的运行地点,但不会消除在地球上组织代码、评估、决策和技术证据的需要。

追踪长期项目的团队可以使用可搜索的知识库,将备案文件、基准测试和设计修订关联起来。当简短的 Google News 标题把提案、合作关系和已部署系统压缩成一个看似单一的事件时,这种严谨性尤为重要。

目前,Nvidia 已为 SpaceX 的轨道 AI 计划拿下首个可信的计算架构。SpaceX 则获得了一家拥有尝试该项目所需硬件、网络和软件的供应商。

这两项结果都不能证明轨道将成为大规模 AI 的下一个家园。这项合作只是让这一想法具备了可验证的形态。

读者面临的问题很简单:下一轮 Google News 周期会带来一颗运行中卫星的测量结果,还是又一个主要仍停留在演示幻灯片上的基础设施承诺?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page