top of page

NASA IBM 月球 AI 模型开放月球数据,但不替代任务决策

9月27日
讀畢需時 13 分鐘

NASA 和 IBM 发布了一款开源模型,可跨越不同仪器、分辨率和光照条件连接月球观测数据。NASA IBM 月球 AI 模型旨在解决一个长期存在的研究瓶颈:科学家拥有大量月球数据,但将其转化为一致的地图仍然困难重重。

这项发布不只是又一个科学图像分类器,而是试图将数十年彼此割裂的观测数据转化为可复用的技术基础。研究人员可在这一基础上适配陨石坑探测、火山测绘和极地冰稳定性估算等任务。

关键的矛盾在于加速研究与建立运行层面信任之间。NASA 希望科学家无需从零开始构建每个分析模型,也能从其档案中提取更多价值。然而,发布的模型尚未获得用于着陆点选择、危险清除或科学测量的认证。

随着月球探索转向更长期的任务和要求更高的地表作业,这一区别愈发重要。更好的地图能够指导研究重点和模拟工作,但无法取代仪器、测地产品或任务安全审查。

NASA 和 IBM 实际发布了什么

此次发布整合了训练完成的模型、适用于机器学习的数据、基准测试和代码,而非提供一个单一用途的月球测绘应用。

NASA 于 2026 年 9 月 10 日宣布推出 NASA-IBM Lunar Foundation Model。IBM Research、NASA 团队和学术合作伙伴共同开发了该模型,用于多模态月球遥感。

基础模型是在广泛数据上预训练、随后由研究人员适配至更窄范围任务的系统。这一方法不同于为每一份陨石坑目录或地质调查分别独立训练专用模型。

该模型可通过开源模型仓库获取,并采用 Apache 2.0 许可协议。其配套代码可与 TerraTorch 配合使用,后者是一款用于适配地理空间模型的开源工具包。

此次发布还包括 SomBench,这是一个为支持月球模型训练和比较而建立的数据集。其记录将来自不同仪器、覆盖相同地表位置的观测数据进行对齐。

NASA 表示,训练语料库包含近 200 万组共注册瓦片数据包,其中包括 963,609 组区域尺度数据包和 1,000,113 组高分辨率数据包。

区域影像覆盖约 51.2 千米见方的区域,分辨率约为每像素 100 米。更高分辨率的瓦片覆盖约 512 米范围,分辨率约为每像素 1 米。

这些数据涵盖两个尺度上的 11 种模态。模态是不同类型的观测,例如可见光影像、地形、高程坡度、热学特征、雷达信息或重力数据。

NASA 的 Lunar Reconnaissance Orbiter 提供了大部分影像。该航天器已观测月球 17 年,产生的数据量超过 NASA 其他行星任务的总和。

其他输入来自 NASA 的 GRAIL 和 Lunar Prospector 任务。该数据集还包括日本 Kaguya 任务以及多种专用月球仪器的观测数据。

NASA 的发布概览列出了三项近期研究方向:陨石坑测绘、不规则火山特征分割,以及极地冰远景评估。

该模型不会直接发现水,也不会认证某个着陆区是否安全。它学习的是可复用表征,研究人员可针对特定科学问题,借助带标签的示例对其进行适配。

这正是核心变化。研究人员如今拥有适用于多项月球任务的共同预训练起点,而不是另一个仅与单一数据集绑定的孤立模型。

此次发布还降低了实际使用门槛。规模较小的研究团队可以直接从预训练权重开始,而无需复现完整的数据准备和训练流程。

不过,获得模型并不意味着不再需要专业知识。团队仍需针对每项下游用途配备合适的标签、评估方法、计算资源和科学审查。

为什么月球数据需要不同的 AI 模型

月球带来了异常困难的计算机视觉问题,因为地表外观会随光照、尺度、传感器类型和观测几何而变化。

同一个陨石坑在一种光照角度下拍摄,与在另一种光照角度下拍摄时,外观可能存在显著差异。阴影会遮蔽岩石和坡面,眩光则可能抹去细微的地质边界。

这些影响在极地尤其严重。当地太阳始终接近地平线,令本就具有陡坡和深陨石坑的地形上形成长长的阴影。

月球也没有足以散射阳光的浓厚大气层。因此,图像中明亮地面与黑暗区域之间存在鲜明过渡,增加了不同轨道飞越之间进行比较的难度。

常规图像模型可能将这些视觉变化误判为物理差异。当研究人员将光学影像与高程、温度、雷达、矿物和重力测量数据结合时,问题会变得更加复杂。

不同仪器的观测尺度也存在巨大差异。区域地图能够捕捉广泛的地质背景,但会遗漏单个巨石、小型陨石坑和狭窄山脊。

高分辨率图像揭示这些局部特征,但覆盖面积小得多。一个有用的模型必须连接区域背景与局部细节,同时不能假装两种数据源测量的是同一件事。

NASA 和 IBM 团队改造了最初为多模态地球观测开发的 TerraMind 架构。月球版本使用了各含 12 层的 transformer 编码器和解码器。

其训练过程采用掩码词元学习。系统接收数据包中不完整的部分,并学习根据其余观测数据重建被隐藏的信息。

这一任务促使模型学习地形、反射率、坡度、光照和其他物理背景之间的关系,同时无需研究人员手动标记每一个预训练样本。

团队还将采集几何信息作为显式上下文加入模型。这些上下文包括太阳入射角、观测角度、航天器位置、瓦片位置和地面采样距离。

这种设计为模型提供了图像采集方式的信息,减少了模型必须完全依靠阴影和地表亮度推断已知几何信息的压力。

该模型还通过统一的混合训练流程,同时针对两大分辨率数据系列进行训练。因此,同一组权重可覆盖约 100 倍的尺度差异。

FlexiViT patch embeddings 使研究人员能够在适配过程中调整图像 patch 的大小,无需针对每种下游分辨率重新预训练整个主干网络。

训练仍需要大量算力。公开的模型卡显示,训练使用了 16 块 Nvidia H100 GPU、150,000 个训练步骤和约 1,100 GPU 小时。

这正说明共享模型的重要性。每个从事月球研究的团队都无需在测试一个更窄的假设之前,重复同样的大规模预训练工作。

这一机制类似于 NASA 和 IBM 此前发布的科学基础模型,但数据问题有所不同。Prithvi 专注于地球观测,而 Surya 专注于太阳。

该月球系统将这一策略延伸至行星科学领域。它将模型开发视为共享研究基础设施,而不是一款提供预设答案的成品应用。

NASA IBM 月球 AI 模型的表现如何

NASA IBM 月球 AI 模型在极地冰远景评估上展现出最明确的优势,而其他几项结果则具有竞争力,但并不具决定性。

团队在四项基准测试中评估了该系统,涵盖区域尺度陨石坑探测、米级陨石坑探测、不规则月海斑块分割和极地冰远景回归。

配套的技术论文将该预训练系统与多种成熟的计算机视觉主干网络进行了比较。这些基线包括 ResNet、ConvNeXt、SwinV2 和 vision transformer 模型。

在使用完整训练集的区域陨石坑探测中,采用低秩适配的模型取得了 0.2581 的平均精度均值,SwinV2-B 为 0.2420。

低秩适配通常称为 LoRA,它在保留大多数原始模型权重不变的情况下更新新增的小型矩阵,可降低面向特定任务训练所需的资源。

该模型还在区域陨石坑任务中展现出标签效率。仅使用一半可用训练数据时,其表现就超过了使用完整数据集训练的最强基线模型。

这一结果很重要,因为科学标签的成本很高。一份陨石坑目录或地质边界数据通常需要专家解读、仔细审查以及一致的空间定义。

在米级陨石坑探测中,结果则没有那么突出。最佳月球模型得分为 0.1543,而 SwinV2-B 为 0.1552。

模型卡恰当地将这些系统描述为表现相当。两者的差异小于重复训练运行中报告的波动范围。

不规则月海斑块也传递了类似的信息。这些罕见的火山特征可帮助研究人员探究月球火山活动持续了多久。

最佳模型配置取得了 0.5709 的交并比,领先的 ConvNeXtV2 基线为 0.5687,两者差距同样很小。

最显著的改进出现在极地冰远景评估中。最佳月球模型将均方根误差降至 0.0293,而 SwinV2-B 为 0.0377。

IBM 将这一结果描述为误差降低 22%。该公司还称,区域陨石坑探测在仅使用一半训练标签的情况下提升了近 19%。

这些说法与公开的基准数值一致。不过,基准表现必须结合所使用的确切数据集、目标和评估流程来理解。

冰远景评估尤其容易被误解。其输出估算的是与知识驱动型远景地图的相似度,并不直接探测或测量地下冰。

模型综合了与潜在冰稳定性相关的特征,包括温度、坡度、坡向、地形和建模所得的冰稳定深度。

科学家可以利用这类估算结果,优先分析更有潜力的区域。确认水的存在仍需直接观测、仪器以及针对任务的科学证据。

该模型还探测到 Einstein crater 附近一次火箭体撞击后形成的新陨石坑。撞击后的图像未被纳入预训练数据。

这一实验表明,该模型经过任务特定适配后可支持地表变化探测,但并不能证明它能够对整个月球进行持续运行监测。

综合来看,这些基准测试支持一个审慎的结论:当多种数据类型能够提供互补证据时,预训练的帮助最为明显。

结果并未显示该模型对所有专用模型都具有普遍优势。在某些任务上,其优势有限或并不存在。

真正的竞争是共享基础设施与任务专用模型之争

NASA 和 IBM 正在押注:可复用的月球主干模型能够比一组各自独立训练的专业系统节省更多科研投入。

当目标范围明确且标注数据集已相当成熟时,针对特定任务的模型可能颇具吸引力。研究人员可以围绕单一目标优化其架构、输入和损失函数。

但当每个项目都重复同样的准备工作时,这种方法就会变得低效。团队必须统一仪器数据、校正空间对齐、构建元数据,并预训练相似的表征。

NASA IBM lunar AI model 将这些共性成本前置。随后,一个共享骨干模型便可通过全量微调、LoRA 或冻结编码器支持多项任务。

因此,这一发布所挑战的是一种开发实践,而非某家竞争公司。月球研究人员必须判断,通用预训练是否能为其具体科学工作带来足够价值。

该模型在陨石坑任务上的结果体现了这种取舍。在区域尺度上,预训练提升了标签效率和准确率。在米级尺度上,最强基线在统计上仍具有可比性。

其冰资源结果则表明,多模态设计可能在哪些方面发挥价值。独立的模态适配器让系统能够处理多种观测类型,而不是简单将它们堆叠为单一输入。

该架构的随机初始化版本,已经在冰资源潜力预测任务中优于大多数 ImageNet 基线。预训练随后又带来了进一步提升。

这一发现表明,架构设计和月球领域经验都很重要。它也削弱了“仅靠预训练便带来所有提升”这种过于简单的说法。

项目的模型文档承认,研究人员尚未分离出每一项因素的具体贡献。几何标记和混合分辨率训练仍需要更详尽的消融研究。

消融研究会移除或改变单个组件,以衡量其影响。缺少这些测试时,团队无法完全区分每项设计选择的价值。

开放访问让这种不确定性更易于研究。独立团队可以复现基准测试、检验其他数据划分、引入额外基线,或将模型适配到新任务。

该模型还与 NASA 更广泛的 AI-for-science 计划相衔接。此前 NASA 和 IBM 发布的项目已将相关理念应用于地球观测、天气、气候和日球物理学。

Prithvi 表明,通用地理空间预训练可以支持洪水、农作物、火灾及其他地球应用。Surya 则将领域专属预训练应用于太阳观测和空间天气研究。

此次月球发布检验了这一平台化方法能否迁移至行星科学。若取得成功,将支持为火星、天体物理学及 NASA 其他研究领域构建类似的基础模型。

不过,平台价值取决于采用程度。如果科学家无法运行下载的检查点、不信任其数据谱系,或无法将其整合进既有工作流程,它的影响将十分有限。

因此,文档、稳定代码、基准透明度和社区维护与标题级准确率同样重要。科学基础设施必须在发布公告热度消退后依然可用。

这还涉及治理问题。一个共享模型可能会将关于预处理、地理划分、标签和缺失数据的假设,集中到一个被广泛复用的产物中。

开放代码有助于研究人员检查这些假设。但它并不能保证每位下游用户都会理解或传达它们。

因此,这个平台最有力的理由在于实用性,而非绝对性。它为研究人员提供了经过检验的起点和共同的比较基础。

这可以加快实验,同时让分歧更清晰可辨。团队能够判断一项结果究竟来自新标签、适配选择,还是共同骨干模型的变化。

该模型无法安全决定的事项

当前版本支持科学探索,但其已记录的局限性排除了将其用于着陆认证或危险排查时的无监督使用。

模型卡指出,生成的字段并非经过校准的科学预测。它们无法替代仪器、立体摄影测量或权威大地测量解决方案。

该模型也缺乏大地测量参考框架。它可以重建局部空间结构,同时却产生偏移的高程值或错误的绝对坐标。

生成的纬度和经度可能相差数十度。仅这一局限就使直接导航或运行规划变得不安全。

其冰资源输出呈现出另一种风险。目标是建模的资源潜力图层,而非在每个预测位置都已确认存在的冰。

一张看似令人信服的地图,仍可能编码了其源模型的假设。用户不得将视觉上的置信度转化为物理上的确定性。

高分辨率覆盖也并不均衡。模型卡称,其窄角相机预训练依赖于 1,095 帧图像及对应的三米立体地形模型。

这些地点在地理上有所分布,但并未形成全球范围的密集覆盖。在代表性不足的地形中,性能可能与基准表现不同。

在所有测试系统中,米级陨石坑得分都较低。一些标注来自原本以每像素五米进行标注的、更模糊影像。

这一结果说明,单一汇总指标无法证明模型已具备实地应用条件。数据集质量、地理覆盖范围和标注精度共同决定了表面上的性能上限。

尽管模型明确纳入了几何输入,光照仍是一项挑战。NASA 指出,不同的轨道照明条件会改变较小陨石坑的可见度。

系统可以学习光照与地形之间的关系。但它无法消除黑暗、眩光、有限分辨率或不完整观测带来的所有歧义。

该研究论文于 2026 年 9 月 8 日提交至 arXiv。ArXiv 可实现快速公开访问,但在该平台发布本身并不构成同行评审验证。

独立复现将十分重要。研究人员应在开发基准之外测试该模型,并报告准确率在哪些情况下下降。

任务团队需要比探索性研究人员更严格的证据。他们需要经过校准的不确定性、可追溯的输入、明确的失效情形,以及在相关运行条件下的验证。

着陆区决策还结合了图像理解以外的因素。通信、照明、坡度、热环境、飞行器约束和科学目标都会影响选择。

该模型可以为这一过程提供证据,但不应成为这一过程本身。

这一边界并未削弱该发布的价值。明确的局限性反而使模型在科学上更有用,因为研究人员可以围绕已知弱点设计评估。

真正的风险在于将三种不同的主张混为一谈。更快的分析、更好的基准表现和运行可靠性是彼此独立的成就。

NASA 和 IBM 已在部分任务中为前两者提供了证据。第三者仍明确不在已发布模型的验证范围内。

三个信号将表明月球 AI 是否兑现承诺

下一项考验是独立研究人员能否复现结果、扩展基准,并创建能够改善实际月球科学工作的经验证工具。

第一个信号是独立复现基准。外部团队应重新运行报告中的四项任务,并测试地理分布不同的数据划分。

一致的结果将增强这样一种判断:所学习的表征能够迁移到原始开发环境之外。性能若大幅下降,则会缩小其实际价值。

复现工作应包括困难的米级陨石坑基准。该任务相较最强基线未显示出明确优势,也暴露了当前的高分辨率局限。

第二个信号是有价值的下游采用。该代码库已经通过 TerraTorch 支持陨石坑检测、火山分割和冰资源潜力研究。

研究人员现在需要发布可信的微调模型、数据集和科学发现。仅凭下载量无法证明其研究影响力。

有力的采用信号将是一项同行评审研究:它利用该骨干模型减少标注需求,或发现一个可验证的月球规律。

第三个信号是任务级验证。NASA 或合作团队需要将模型辅助输出与仪器测量和既有制图流程进行对照测试。

这一过程应量化不同光照条件、区域、传感器和分辨率下的不确定性与失效率。它还应明确何时仍必须进行人工审查。

运行验证将强化这样一种论点:共享基础模型能够从档案研究进入任务工作流程。若验证失败,它们仍将保留作为探索性工具的价值。

该发布的开放设计使这三个信号都可被观察。公众可以查阅研究方法、下载检查点,并将新结果与已发布基线进行比较。

对开发者而言,眼前的机会并不是构建自主月球导航器,而是测试多模态预训练是否能够减少解决一个经过严格限定问题所需的工作量。

对科学家而言,该模型在不同仪器和尺度之间提供了共同的实验基础。这可以缩短准备时间,同时提升项目之间的可比性。

对任务规划人员而言,恰当的态度应是谨慎关注。模型输出可以指引调查方向,但经过验证的测量结果必须主导重要决策。

如果 NASA IBM lunar AI model 能成为持续维护的科学基础设施,而非一次性的展示,它就将具有重要意义。它最突出的贡献或许是围绕其建立的共享数据和评估框架。

下一步属于研究社区。独立团队能否复现这些提升、记录失败情形,并将这一开放基础转化为经得起科学审查的证据?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page