top of page

Google Project Suncatcher 将 AI 数据中心送入太空,但物理定律决定成败

4天前
讀畢需時 13 分鐘

10 月 1 日,Google Project Suncatcher 将四颗 Tensor Processing Units 送入轨道,把一项尚属推测的基础设施构想变成了真实的硬件测试。这些芯片目前搭载在由 Planet 制造、由 SpaceX 发射的太阳能卫星中。Google 表示,航天器已建立通信,运行状态符合预期。

这次发射并不意味着 Google 已建成轨道云。它意味着该公司终于能够测量商用 AI 硬件在实验室之外如何应对辐射、发射应力和高温。结果将决定太空 AI 数据中心是否值得进一步投资,还是仍将停留在昂贵的概念实验阶段。

SpaceX、Nvidia、Starcloud、Blue Origin 以及多家较小的公司都在推进相关计划。它们的方案各不相同,但共享一个前提:地球的电网、供水系统和审批流程正成为 AI 扩张的约束。轨道似乎提供了充足的阳光和更少的本地阻力,但也以严苛的工程难题取代了这些地面限制。

Google Project Suncatcher 已从纸面走向轨道

Google 已跨越重要门槛,但其卫星仍是一项实验,而非真正运作中的轨道数据中心。

Project Suncatcher 原型搭载 SpaceX 的 Transporter-18 拼车发射任务升空。无人驾驶的 Falcon 9 从加州范登堡太空军基地将 130 个载荷送入近地轨道。

Google 与拥有紧凑型航天器制造经验的地球观测公司 Planet 共同开发了这颗卫星。载荷搭载四颗 Trillium TPU,它们是 Google 为机器学习工作负载设计的加速器。

Google 的原型更新称,公司将在未来数周收集运行数据。工程师将研究这些芯片对振动、辐射和极端温度的响应。

这些是最基本的生存问题。地面加速器运行于精心控制的建筑中,具备冗余供电、冷却、网络和维护条件。轨道版本则必须在没有技术人员、备件或稳定室内环境的情况下持续工作。

初始工作负载被刻意限制。芯片将在受控时段运行简短的 Gemini 查询,随后停止以便硬件冷却。这一安排表明,该测试距离持续提供 AI 服务仍有很大差距。

生产级系统需要让数千个处理器长时间保持运行。它还需要具备足够的内存、网络容量和容错能力,以便在众多卫星间分配大型工作负载。

Google 的更大规模设计设想由自由空间光链路连接的太阳能航天器集群。这些链路使用激光在卫星之间传输数据,无需物理线缆。

该公司的研究描述了一个由 81 颗卫星组成、在约一公里半径范围内飞行的集群。机器学习系统将协调编队并避免碰撞。

紧密编队至关重要,因为现代 AI 训练依赖加速器之间的快速通信。一组彼此孤立的芯片无法自动达到地面超级计算机的性能。

因此,Google 提出的光网络必须在低延迟下提供高带宽。它还必须在每颗卫星都以轨道速度飞行时维持精确对准。

与地面的通信构成另一项瓶颈。无线电链路足以满足当前原型需求,但大型轨道集群需要快得多的连接,才能与地球交换模型和数据集。

这些限制解释了 10 月发射为何重要。Project Suncatcher 不再完全建立在计算机模型和辐射测试之上。Google 现在能够将其假设与在轨收集的数据进行对比。

但这项实验尚未验证完整架构。它没有测试由 81 颗卫星组成的编队、连续运行、大型散热器,或与地面进行高容量光学连接。

这种区别至关重要。Google 已将 AI 处理器送入太空,但尚未证明轨道集群能够与传统数据中心竞争。

AI 的电力需求正在推动太空竞赛

涌向轨道的热潮始于一个地球上的问题:AI 开发者对电力的需求增长速度,快于公用事业公司能够交付的速度。

美国政府问责局表示,到 2028 年,数据中心可能占美国电力需求的 12%。AI 开发是这一预测背后的主要因素。

新设施可能需要经历数年的公用事业规划、输电升级、许可审批和本地协商。用水量和土地使用也可能引发拟建地点附近社区的反对。

这些限制会影响开发前沿模型的公司。更多算力支撑模型训练、实验、推理和客户增长。因此,基础设施延迟可能同时拖慢产品开发和收入增长。

轨道项目承诺了不同的能源模式。处于适宜近地轨道的太阳能电池板可以接收近乎持续的阳光,不受云层或昼夜循环影响。

Google 估计,其拟议轨道上的一块面板每年获得的太阳能,最多可达地球中纬度地点面板的八倍。这一优势反映的是光照条件,而非免费电力。

卫星仍需要大型阵列、电力电子设备、电池和控制系统。这些部件会增加重量,并且必须承受发射、辐射和反复的热应力。

随着地面容量愈发难以获取,能源论点变得更具吸引力。一家拥有发射器访问能力的科技公司,可以在不等待新建发电厂的情况下增加计算容量。

SpaceX 拥有最明显的垂直整合优势。它运营火箭、管理 Starlink 星座,并已提出专门设计的轨道数据中心卫星方案。

Elon Musk 曾表示,太空将在两到三年内成为 AI 成本最低的部署地点。这一预测仍是公司主张,而非已被证明的经济结果。

SpaceX 还提交了涉及多达一百万颗卫星的计划。这样的网络规模将远超当今仍处于实验阶段的计算载荷。

其优势不仅在于技术。发射能力可以决定哪些轨道项目能够测试硬件、替换故障设备并扩展容量。

竞争对手往往依赖 SpaceX 运输。Google 为 Project Suncatcher 原型使用了 Falcon 9,Starcloud 此前的 AI 硬件任务同样依赖 SpaceX。

这种依赖使发射能力成为战略杠杆。一家同时控制火箭和轨道算力的公司,可以优化自身成本,同时为竞争对手设定商业条件。

Blue Origin 提供了可能的制衡力量。该公司一直在推进大型卫星网络和重型发射能力,但其轨道计算战略仍不够成熟。

Nvidia 在供应链中占据另一位置。它推出了 Space-1 Vera Rubin Module,用于受限的轨道环境计算。

Nvidia 表示,该模块可支持大语言模型、地理空间分析和自主航天器。不过,其可用性和持续在轨性能仍有待验证。

Starcloud 正在测试更直接的商业模式。它已将一颗 Nvidia H100 加速器送入太空,并希望组建更大的集群用于训练和推理。

眼下的机会或许并非服务普通聊天机器人请求。在太空中处理生成的数据具有更明显的优势,因为信息无需完整往返于地球。

地球观测卫星捕获的原始影像,多于运营商能够高效传输的数量。机载 AI 系统可在将筛选后的结果发送到地面前,识别野火、受损基础设施或异常天气。

这种方法可降低下行链路需求并缩短响应时间。相比取代地面云区域,它也能以更小的规模运行。

因此,轨道数据中心竞赛包含两个市场。一个是让计算更接近已部署在太空中的传感器;另一个则试图将通用 AI 基础设施迁离地球。

第一个市场正在到来。第二个市场则需要在发射经济性、冷却、网络和维护方面取得大得多的突破。

太阳能充足,但冷却并非没有代价

核心权衡很简单:轨道提供更多阳光,而真空使废热更难排出。

AI 处理器会将大部分电力输入转化为热量。一颗消耗数百瓦功率的芯片,必须持续将这些热能转移到其他地方。

地面设施使用空气、水或专用液体带走热量。风扇、泵、冷却塔和冷水机组再将其传递至周围环境。

太空没有可用于对流的大气,也没有能从航天器吸收热量的外部液体。

轨道系统必须将每个处理器的热量输送到散热器。散热器再以红外辐射形式释放能量。

这一过程可行,但需要大量表面积。计算功率越高,产生的热量越多,所需散热器也越大。

一项 IEEE 热分析估计,一台 40 千瓦机架可能需要 80 平方米的散热器。该面积大致相当于一个匹克球场。

同一分析估计,一座 100 兆瓦设施至少需要 2,500 个这样的散热器。每个结构都会增加质量、阻力、展开机构和潜在故障点。

散热器还必须保持其散热能力。紫外线、原子氧和辐射会随时间降低暴露涂层的性能。

这种退化会带来复合问题。运营商可能需要在初始阶段发射额外的散热器容量,从而增加使系统成本高昂的质量。

太阳能阵列又带来另一项几何约束。它们需要足够的表面积,为处理器及其配套设备供电。

阵列和散热器都必须保持有效朝向。它们不能相互遮挡、破坏航天器稳定性,或产生难以管理的阻力。

太空可能寒冷,但寒冷的周围环境不会自动冷却物体。没有传导或对流,高温芯片只能通过其工程化热路径散失能量。

Google 承认,热管理仍是一项未完成的工作。其研究提出了热管和散热器,但尚未给出适用于生产级集群的成熟设计。

当前卫星通过运行短时工作负载来规避完整问题。冷却暂停在实验期间可以接受,但商业基础设施需要可预测的可用性。

辐射带来第二项妥协。传统卫星计算机使用抗辐射元件,专为承受高能粒子而设计。

这些处理器可靠,但在性能上通常落后于领先的 AI 加速器。现代大语言模型需要 Google TPU 或 Nvidia GPU 等商用芯片所提供的密度。

商用加速器更易受影响。高能粒子可能翻转内存位、破坏计算,或触发电气故障。

Google 表示,其地面测试让 Trillium TPU 经受了相当于五年任务期的辐射。报道称,这些处理器没有发生永久性故障,但工程师观察到了可恢复错误。

这一结果支持开展进一步测试,但少数幸存的处理器并不能证明整个机群具备可靠性。一个大型星座将包含更多组件、内存模块、连接和供电系统。

冗余可以降低单个故障对运营的影响。多个处理器可以执行同一计算、比较结果,并重启产生不一致答案的节点。

这种策略以数量替代加固。运营商发射更多常规硬件,并接受其中部分设备会失效的事实。

这种权衡只有在发射和替换成本足够低时才行得通。否则,每增加一个冗余处理器,都会在产生有用算力之前推高资本成本。

维修也带来相关挑战。技术人员可以在地面设施中例行更换损坏的硬盘、电缆、泵和加速器。

轨道运营商无法向每颗卫星派遣技术人员。机器人维修服务仍较为有限,而将硬件送回地球通常也没有什么经济意义。

因此,替换很可能成为维护策略。故障卫星将被退役、离轨,并由更新的设备替代。

频繁替换可能会随着新一代加速器的到来提升芯片性能。但这也可能形成成本高昂的发射循环,并给轨道交通管理带来更大压力。

发射成本和太空碎片挑战商业可行性

只有当运输、可靠性和可用算力同步改善时,轨道 AI 才能具备竞争力。

发射价格已经下降,但将重型设备送入轨道的成本,仍高于将其运入地面建筑。散热器、屏蔽层、推进系统和太阳能阵列进一步放大了这种差异。

Google 的经济模型将每公斤约 200 美元的近地轨道发射成本视为重要门槛。该公司预计,这一水平可能在 2030 年代中期实现。

这一假设依赖于可重复使用的重型运载火箭达到高发射频次。它还假设航天器制造商能够在不牺牲供电、散热或耐用性的前提下降低质量。

一项 BCG 成本模型估计,轨道系统相较地面设施仍存在显著溢价。即使在有利情境下,结果也对卫星故障率高度敏感。

因此,发射成本只是一个变量。如果处理器过早失效、散热器退化,或网络无法让昂贵的芯片保持高负载运行,低价发射也无济于事。

利用率之所以重要,是因为 AI 加速器只有在处理任务时才能创造价值。一个经常因散热而暂停、或等待数据的系统,将从相同硬件中交付更少的计算小时。

网络性能可能造成隐藏的闲置时间。训练大型模型要求处理器快速、反复地交换中间结果。

如果光链路失去对准,或无法匹配地面带宽,集群可能会花更多时间等待。增加卫星数量未必能解决这一问题。

延迟也区分了潜在工作负载。交互式应用必须快速响应地球上的用户和系统。

近地轨道增加了传输距离、地面站路由,以及光链路受天气干扰的风险。这些因素对批处理工作或许可以接受,但不太适合实时服务。

批量生成、科学建模、档案分析和翻译可以容忍延迟。如果轨道计算达到商业规模,这些任务可能成为早期候选应用。

敏感的政府工作负载是另一个潜在市场。分布式太空基础设施可以提供地理隔离,并直接访问轨道传感器。

然而,物理隔离并不能消除网络安全风险。运营商仍需要安全的指令通道、软件更新、身份验证,以及针对地面系统被攻破的防护措施。

环境问题更难定价。大型星座会增加碰撞风险,并使本已拥挤的轨道频段使用更加复杂。

GAO 评估警告称,新增卫星可能干扰天文学观测、威胁载人任务,并增加无线电频率协调需求。

一次碰撞可能产生长期留在轨道上的碎片,并危及其他航天器。更多物体意味着更多交会预警和规避机动。

最坏情况下,人们担心会出现级联效应:一次碰撞产生的碎片引发更多撞击。运营商会针对这一风险进行设计,但规模极大的计算星座将扩大潜在交会数量。

SpaceX 以 Starlink 的运营记录作为大型机群能够得到管理的证据。然而,轨道数据中心提案最终可能增加更重、更复杂、外部结构更庞大的平台。

寿命终止后的处置同样重要。处于足够低轨道的卫星可以重返大气层,但频繁替换将增加再入活动。

发射和再入都会产生排放。一项学术分析认为,这些排放可能抵消将数据中心迁离地球所带来的环境收益。

这一结论取决于未来火箭设计、发射频率、系统寿命,以及比较中纳入哪些排放,不应被视为定论。

尽管如此,不能将轨道计算描述为天然可持续。它只是将影响分散到能源生产、制造、发射运营、大气化学和太空碎片等领域。

近期最可信的应用场景仍是面向太空生成数据的定向计算。能够在本地筛选图像的卫星,可以降低通信成本,而无需宣称要取代一个超大规模云区域。

这种更狭窄的部署也能揭示真实的可靠性数据。运营商可以测量处理器错误、散热器性能、可用电力,以及每公斤硬件完成的有效工作量。

通用轨道云需要达到更高标准。它们必须优于持续通过先进散热、新能源合同和更高效芯片改进的地面替代方案。

地面运营商还可以将设施设在可再生能源、核能发电附近,或气候条件有利的地区。他们无需发射火箭便可升级硬件。

因此,竞争并非轨道与今天的数据中心之间的竞争,而是轨道与轨道系统最终实现规模化时可获得的地面基础设施之间的竞争。

三项信号将揭示轨道 AI 能否规模化

下一阶段应根据运营证据来评判,而不是依据监管申报文件中宣布的星座规模。

第一个信号是 Google 四颗 TPU 的持续性能。Project Suncatcher 必须证明,商用加速器能够在辐射和热循环条件下完成重复工作负载。

Google 最终应披露任务期间的错误率、运行温度、有效计算时间和性能变化。仅仅与航天器保持联络并不能回答这些问题。

强劲的结果将支持这样一种观点:标准 AI 芯片能够在软件管理的韧性机制下存活。频繁停机或不断累积的故障将削弱更大规模机群的经济性。

第二个信号是成功的多卫星组网演示。Google 的架构依赖于高度协同的航天器通过光链路交换数据。

该公司已讨论在 2027 年开展进一步测试。这些任务需要展示稳定的编队飞行、可靠的链路对准,以及轨道条件下的有效带宽。

这项测试将区分星载计算与真正的分布式数据中心。一颗卫星可以运行 AI 模型,但大型训练集群需要许多处理器像一个系统那样协同运行。

组网对 Google 尤为重要,因为其设计强调模块化卫星。该架构避免发射单一的超大型结构,但将复杂性转移到编队控制和通信上。

一场令人信服的演示将验证这一选择。不稳定的链路将使系统局限于独立的边缘计算节点,而非统一的 AI 集群。

第三个信号是由运营数据支撑的完整成本模型。SpaceX、Google、Starcloud 及其合作伙伴需要将发射、硬件、热管理系统、故障、通信和处置纳入计算。

仅基于免费阳光的比较忽略了系统的大部分成本。相关衡量标准是航天器在工作寿命内交付的有效算力。

这一计算应考虑散热暂停、辐射错误、太阳能输出衰减、替换发射和闲置容量,也应与不断改善的地面设施进行比较。

早期商业合同将在这一第三项信号中提供另一个线索。当本地分析能够节省时间或下行链路容量时,处理地球观测数据的客户可能会接受更高的计算成本。

面向大众市场的 AI 工作负载则面临不同考验。一家生成文本或图像的公司,可以在多个地面区域中选择,而无需为轨道硬件付费。

这一差异应塑造市场预期。轨道计算可以成为真正的业务,而无需取代常规云基础设施。

开发者和企业买家应关注工作负载部署,而不是夸张的卫星数量。首批有用服务很可能会处理已经在轨道中采集的信息。

知识工作者不会注意到每次模型查询在哪里运行。他们会注意到服务是否更快、更便宜、更可用,或受到更多限制。

评估 AI 系统的组织应将基础设施主张与产品性能区分开来。一个可搜索的 AI 知识库仍取决于安全的数据实践、可靠的检索和有用的回答,无论处理器位于何处。

Google Project Suncatcher 已让轨道 AI 变得可衡量。这才是当前竞赛背后真正的变化。

该项目现在必须经历更艰难的转变。它必须从四颗间歇运行的芯片,迈向能够提供可靠计算的网络化基础设施。

太阳能为轨道系统提供了一个令人信服的存在理由。散热、辐射、组网、对发射的依赖以及碎片,将决定这一理由是否足够充分。

未来一年,请关注运营数据、光学组网测试,以及每有效计算小时的成本。这些结果将揭示,太空是否正成为 AI 基础设施市场,还是仅仅仍是一座非凡的实验室。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page