NASA 月球 AI 模型开放月球数据,但难点在于证明新发现
NASA 发布了一款由近 200 万个数据切片训练而成的月球 AI 模型,为分析数十年来积累的月球观测数据开辟了新路径。这款 NASA 月球 AI 模型可被调整用于绘制陨石坑、勾勒异常火山地貌,并估算极地冰层能够稳定存在的区域。它的发布改变了谁能够构建这类工具,以及他们需要多少面向特定任务的数据。
NASA 与 IBM Research 及学术合作伙伴共同开发了该模型,随后公开发布其权重、数据集、基准测试和微调资源。这使该项目不再只是一个内部自动化系统。外部研究人员可以将其与成熟的计算机视觉模型进行对比测试,并将其适配到新的月球研究问题上。
关键问题在于,可复用的 AI 并不会自动带来可靠的新发现。已发布的基准结果显示,它在部分任务上有明显提升,在另一些任务上则与对手接近,同时在标签和光照方面仍存在重要限制。该模型必须与 SwinV2 等通用系统竞争,而其科学输出仍需通过物理观测进行验证。
NASA 于 2026 年 9 月 10 日宣布发布该模型。根据该机构的发布详情,该项目是将基础模型应用于科学数据这一更广泛工作的一部分。
NASA 月球 AI 模型将档案转化为可用基础设施
NASA 和 IBM 正将一套难以利用的月球档案转化为适用于多种研究任务的可复用起点。
月球勘测轨道飞行器已对月球观测了 17 年。NASA 表示,该任务产生的数据量超过其所有其他行星任务的总和。其相机还制作了几乎连续的高分辨率月球表面拼图。
如此庞大的数据量带来了分析难题。研究小型陨石坑、火山构造或极地地形的科学家,无法人工检查每一项相关观测。为每个问题单独建立机器学习流程,也会消耗标注数据、计算资源和专业人员的时间。
新模型通过预训练来应对这一瓶颈。基础模型先从大型数据集中学习广泛模式,再针对更具体的任务接受额外训练。在这里,这些模式包括月球纹理、地形、光照、高程、温度、雷达响应和矿物信息。
底层训练语料包含近 200 万个经过地理对齐的切片数据包,覆盖两种空间尺度上的 11 种数据模态。其中一条数据轨道使用接近每像素一米的观测,另一条则覆盖接近每像素 100 米的地形。
这些切片主要来自月球勘测轨道飞行器相机。该模型还整合了与月球轨道激光高度计、Diviner 辐射计、Mini-RF 雷达及其他任务相关的信息。
支撑数据包括地形、坡度、地表朝向、重力、氢丰度、雷达测量和热力条件。这种组合很重要,因为光学图像中的暗斑并不一定意味着材料不同,它也可能仅仅反映了阳光照射角度。
因此,该模型学习的并不只是视觉上的相似性。它能够将图像与同一区域记录的观测几何信息及其他测量结果关联起来,从而为区分地形特征与光照伪影提供更好的基础。
NASA 表示,该模型使用超过 100 万张高分辨率图像和近 96.4 万张多光谱图像训练而成。多光谱成像会在选定的波段记录地表信息,揭示普通照片无法捕捉的内容。
研究人员如今可以适配这一预训练系统,而不必从随机模型权重开始。这应能减少部分项目所需的标注样本数量,也可以让不同月球研究之间的结果更易比较。
公开的模型卡提供检查点、评估结果、配置指引和针对特定任务的适配建议。这些材料采用 Apache 2.0 许可证。
该发布还支持 TerraTorch,这是一个用于适配地理空间基础模型的开源工具包。这一整合为机器学习团队提供了现成路径,使其无需重建数据接口即可微调模型。
最具影响力的变化在于可及性。专业月球分析曾与特定任务、实验室和定制流程紧密绑定。如今,同一个预训练骨干模型可支持行星科学家、大学和独立技术团队开展实验。
更广泛的访问并不会消除对月球专业知识的需求,但确实降低了测试新研究问题的工程成本。
该模型跨仪器与分辨率学习
核心技术押注在于:一个模型能够关联以不同尺度采集、服务于不同科学目的的测量数据。
月球遥感数据并非以一组整齐、完全相同的照片形式出现。相机、激光高度计、热学仪器、雷达系统和光谱仪分别测量不同属性,它们的覆盖范围和分辨率可能存在巨大差异。
NASA 月球 AI 模型采用视觉 Transformer 编码器和解码器。视觉 Transformer 会将图像划分为图块、转换为标记,并学习这些标记之间的关系。该模型将这种方法扩展至不同类型的月球数据。
训练期间,系统只接收部分观测信息,并学习重建缺失内容。这种掩码标记方法促使它发现地形、反射率、几何信息及其他测量数据之间的关系。
模型还将采集几何信息作为显式上下文输入,其中包括传感器如何观测某一地点的信息。几何信息在月球上尤其重要,因为长阴影会让同一个陨石坑在不同轨道观测中呈现不同外观。
第二项扩展使同一组权重能够处理米级和百米级观测。该模型使用可适配的图块嵌入,从而能够处理不同图像分辨率,而无需为每种尺度使用单独的骨干网络。
结果是对原本碎片化测量数据的一种统一表征。科学家可以针对陨石坑检测、极地冰潜在分布或火山特征分割,对这一表征进行微调。
“潜在分布”是一个重要区别。冰潜在分布图估算的是哪些区域的条件有利于冰稳定存在,而不是直接确认某处存在可开采的水。
冰任务结合了地表温度、坡度、朝向、永久阴影和模拟冰稳定深度等输入。输出结果代表其与基于现有科学知识构建的参考潜在分布图之间的一致程度。
这一更狭义的定义很重要,因为新闻标题很容易夸大 AI 的发现。该模型并未钻探月壤,也没有以确定性方式探测到埋藏的水。它只是根据与冰稳定性相关的条件,对地形进行排序。
在陨石坑绘图方面,系统可以在两种截然不同的尺度上工作。广角相机观测可提供接近每像素 100 米的区域背景,而窄角相机图像则可揭示接近每像素一米的小型特征。
该模型还瞄准不规则月海斑块。这些罕见的火山构造看起来比周边大部分表面更年轻。更精确的地图或可帮助科学家完善月球火山和热演化的时间线。
同行评审流程尚未完成,但团队已发布详细的技术论文。论文介绍了数据、架构、四项下游基准测试,以及与在普通地球图像上预训练的模型之间的比较。
系统的灵活性也延伸至微调方式。研究人员可以更新整个网络、冻结其编码器,或采用低秩适配。低秩适配通常称为 LoRA,它通过改变一小组新增参数来保留大部分原始权重。
IBM 表示,LoRA 测试中有 90% 的基础模型权重保持冻结。这降低了计算负担,也减少了抹除有用预训练特征的风险。
然而,没有一种适配方法赢得所有基准测试。LoRA 在陨石坑检测中表现良好,在火山分割中也保持竞争力。完整微调则在极地冰潜在分布任务中取得最强结果。
冻结编码器在最小的不规则月海斑块数据集上领先,但在陨石坑检测中落后于列出的所有基线。因此,研究人员仍须针对每种使用场景测试适配策略。
这并不是一个一键式月球分析系统,而是一套共享技术基础设施,仍然需要任务设计、标注样本、评估和科学解读。
在最需要上下文的领域,月球预训练胜过通用 AI
这些基准测试支持一个明确结论:月球预训练提升了数据效率,但并未在每一项比较中占据主导。
研究团队通过同一套微调框架评估了四项任务,包括区域陨石坑检测、米级陨石坑检测、不规则月海斑块分割和极地冰潜在分布。
比较对象包括 ResNet-50、ConvNeXt、SwinV2、DaViT,以及在 ImageNet 上预训练的视觉 Transformer。ImageNet 包含的是日常地球图像,而非专业的月球观测数据。
在使用一半可用训练数据进行区域陨石坑检测时,该月球模型的平均精度均值达到 0.2541。所列最强通用基线 SwinV2-B 在这一数据设置下得分为 0.2313。
使用全部区域陨石坑训练数据时,最佳月球配置达到 0.2581,SwinV2-B 达到 0.2420。这些结果表明,领域预训练有助于模型更高效地利用陨石坑标签。
IBM 将使用一半数据的结果描述为较对比模型提升近 19%。该公司的基准测试摘要还表示,该月球系统在更精细的每像素一米陨石坑尺度上与领先模型持平。
详细数字显示出这种接近的平局。月球模型在窄角相机陨石坑任务中记录到 0.1543 的平均精度均值,SwinV2-B 则为 0.1552。
这一结果具有价值,但并非明确胜利。它表明,可复用的月球模型能够在米级尺度上与强大的专用基线竞争,但并不证明其具有普遍优势。
在不规则月海斑块分割任务中,最佳月球配置的交并比得分达到 0.5709,领先的 ConvNeXtV2-B 基线达到 0.5687。
交并比衡量预测区域与参考标签之间的重叠程度。如此微小的差异意味着这些模型表现相当。不同重复训练运行之间的波动,也使得夸大性能优势的说法并不合适。
最明显的优势出现在极地冰潜在分布任务中。经过完整微调的月球模型实现了 0.0293 的均方根误差。报告中最强的基线得分为 0.0377,数值越低表示一致性越高。
IBM 将这一差距概括为错误率降低了 22%。这一结果支持了该项目的多模态设计,因为冰资源潜力取决于多种地形和温度输入。
论文还指出,同一架构的随机初始化版本在冰资源任务上优于许多通用基线模型。这表明,结果的提升不仅来自月球预训练,架构本身也发挥了作用。
这一区别是评估基础模型的核心。预训练系统应与采用相同架构、但从头训练的版本进行比较。否则,被归因于预训练的提升,实际上可能来自不同的网络设计。
研究人员加入了这一对照。预训练模型仍然取得了最强的冰资源结果,其区域陨石坑表现也优于随机初始化版本。
标签效率最终或许比小幅准确率提升更重要。创建可信的陨石坑轮廓或火山特征掩膜需要科学劳动。能够以更少标签达到有竞争力准确率的模型,可以缩短获得可用实验结果的路径。
该基准并未证明模型在每一个月球区域、季节、传感器条件或特征尺寸下都具有同等表现。其报告的分数来自特定数据集和地理划分。
不过,这一比较为 NASA 月球 AI 模型提供了可信的起点。最有力的证据并不是它解决了月球解译问题,而是月球预训练能够迁移到四项不同任务,而无需分别构建四个基础模型。
陨石坑、火山特征与冰资源带来不同测试
该模型的三项主要应用衡量的是不同能力,因此一项成功不能替代另一项。
陨石坑制图是最直观的任务。科学家通过统计和测量撞击陨石坑来估计地表的相对年龄。较新的地形通常比更古老的地形积累了更少的撞击痕迹。
自动化制图能够处理远多于人工检查的影像。它还可以标记不同观测之间的地表变化,为研究人员提供进一步审查的候选清单。
NASA 使用爱因斯坦陨石坑附近的图像测试了这一能力。2026 年 8 月 5 日,一枚 Falcon 9 上面级撞击月球,LRO 在数日后拍摄了结果。
该模型在预训练期间未见过这张撞击后的图像。经过适配后,它检测出既有陨石坑,并标出了新的撞击地点。这提供了变化检测而非简单记忆的具体案例。
NASA 对撞击图像的单独说明表明了这一任务为何仍然困难。观测序列中的视角和光照条件均发生了变化。
新陨石坑宽约 60 英尺、深不足 10 英尺。在有利条件下,LRO 的窄角相机能够分辨最小约三英尺的特征。
即使具备这种分辨率,阴影仍会影响小型陨石坑的可见性。比较两张图像的模型可能将光照差异解读为物理变化。NASA 明确指出,变化的光照是较小特征的一项限制。
不规则月海斑块带来了另一项挑战。这些火山构造稀少、视觉形态异常,且往往覆盖面积有限。由于其稀缺性,研究人员可用于训练的带标签样本更少。
基础模型可以通过迁移从更大规模无标签语料中学到的模式来提供帮助。火山基准表明这种迁移有效,尽管它相对于最强基线的优势仍然有限。
对这些斑块进行制图,可能有助于改进对月球火山活动何时结束的估计。一些构造看起来比预期年轻得多,对月球冷却后进入休眠状态的简单解释提出了挑战。
极地冰在科学和任务运营层面都很有价值。永久阴影区可在极长时间内保持低温,使挥发性物质得以在近地表存留。
潜在水资源会影响着陆点研究和长期探索规划。水能够支持乘组生活,并在处理后提供氧气或氢气等其他用途的资源。
然而,AI 生成的资源潜力地图并不能确定资源数量、纯度、可获取性或开采成本。这些问题需要直接测量、更好的遥感能力,以及最终的地表调查。
这一区别将科学优先级排序与发现本身区分开来。模型可以帮助团队识别值得关注的位置,但不能取代确认这些地点物质所需的仪器读数。
三项应用的错误代价也不同。漏掉一个小型陨石坑会改变统计计数;误分类罕见火山构造可能扭曲地质调查;夸大冰资源预测则可能影响任务规划。
因此,每项任务都需要各自的验收阈值和审查流程。单一的综合性能声明会掩盖这些差异。
短期内最好的应用方式是辅助分析。研究人员可以让模型筛选大型数据集,再利用领域专用工具检查其中最有价值的预测。
这种分工在利用 AI 规模能力的同时保留了人类判断。它也会产生改进未来版本所需的反馈。
开放权重并未消除验证缺口
NASA 的开放发布使独立测试成为可能,但基准表现与可靠的科学应用之间仍存在若干差距。
该项目包括模型权重、基准数据集,以及用于微调和推理的代码。研究人员可以检查配置、复现下游实验,并在共同框架下比较自己的方法。
公开代码包含模型骨干网络和 TerraTorch 集成的软件包。它还提供了用于陨石坑检测、火山分割和冰资源潜力预测的可运行配置。
一个重要限制出现在代码库文档中。该发布不包含预训练代码。外部团队可以使用检查点并复现下游工作,但无法仅凭公开代码库完整重跑原始训练。
这并不意味着该模型是封闭的,但确实缩小了可复现性的含义。复现微调结果不同于从原始数据重建预训练检查点。
硬件需求可能构成另一道障碍。发布的工件降低了起步成本,尤其是在研究人员使用 LoRA 时,但并未消除存储、数据准备或加速器需求。
数据集标签同样值得仔细审视。模型的基准分数衡量的是其与参考数据的一致程度。如果参考数据包含不完整的陨石坑标注或不确定的火山边界,模型也可能继承这些局限。
冰资源基准需要格外谨慎,因为其目标是资源潜力地图。较高一致性意味着模型复现了该参考数据中的模式,并不意味着它独立验证了月球冰资源。
地理泛化仍是另一个未解问题。模型接受了广泛覆盖范围的训练,但部分仪器仅观测特定区域。极地输入的覆盖范围可能远小于近乎全球的影像。
将模型应用于覆盖不足区域的团队,必须检查哪些模态数据可用。缺失数据可能改变性能,或迫使团队采用不同的微调配置。
光照仍是持续存在的误差来源。月球阴影会随观测几何变化,并可能遮蔽小型特征。显式几何信息能帮助模型,但无法创造传感器从未捕捉到的信息。
罕见事件带来相关问题。新形成的陨石坑、异常塌陷和少见的火山结构,可能与训练分布中的样本不同。它们的科学价值恰恰在于其不寻常性。
爱因斯坦陨石坑测试令人鼓舞,因为它涉及一个留出的地表变化案例。针对其他撞击事件和不同光照条件的独立测试将提供更有力的证据。
研究人员还应将该模型与更简单的方法进行比较。基础模型最有价值之处在于减少标签需求、提高准确率或整合多个工作流程。复杂性本身并不是科学收益。
已发布的工作通过纳入标准基线和随机初始化对照,使这种比较成为可能。未来用户应在新任务中保持同样的严谨性。
关键问题并不是该模型能否生成看似合理的地图,而是这些地图能否在新地点、新仪器和新观测条件下保持准确。
开放访问使科学界能够回答这一问题,但不会自动给出答案。
NASA 与月球研究人员下一步需要证明什么
下一阶段应检验独立复现、实地相关性,以及模型在真正新观测数据上的表现。
首先需要关注的信号,是外部团队能否复现四项已发布的基准。独立团队应能够下载检查点、使用发布的数据集,并在报告的变化范围内获得结果。
成功复现将增强性能声明的可信度,并暴露缺失的设置细节。若出现无法解释的巨大差距,则会削弱对当前基准的信心。
第二个信号是在并非由原团队汇集的观测数据上进行评估。新的 LRO 影像、更多撞击地点和独立标签,能够揭示该模型是否能泛化到其发布包之外。
地表变化检测提供了一个有用测试。研究人员可以比较已知撞击前后采集的观测数据,然后衡量由光照或观测几何导致的误检。
一系列成功测试将支持其用于筛选新影像的运营应用。反复出现的误报则表明,对几何因素的处理仍需改进。
第三个信号是月球科学家是否会在原始基准集之外构建有用的应用。例如巨石制图、滑坡识别、地形风险分析,或跨仪器异常检测。
可复用的基础模型应能迁移到开发者未直接优化的问题上。如果适配始终局限于发布时的四项任务,更广泛的基础模型主张就不那么有说服力。
这一发布也给其他行星科学项目带来压力。研究火星、小行星或地球观测的团队必须决定,多模态领域预训练能否取代一系列彼此孤立的模型。
NASA 与 IBM 已在地球科学和日球物理学的基础模型上展开合作。月球项目将这一战略扩展到一个由多种仪器、并以截然不同尺度观测的天体表面。
因此,它最强的贡献或许在于方法论。它展示了机构如何将公开科学观测数据打包为可复用的 AI 基础设施、基准和易于获取的检查点。
这种方法可以缩短归档测量数据与可检验假设之间的距离。它也能引入内部模型永远无法获得的外部审视。
NASA 月球 AI 模型并不是自动化的月球科学家。它是一个共享的分析层,能够在庞大的档案中引导关注重点。
决定性证据将来自独立研究人员利用它发现、否定和复现的结果。下载模型只是第一步。下一项有价值的行动,是测试一个聚焦的月球问题,记录基线,并发布成功案例与失败案例。



