top of page

NASA-IBM 月球 AI 模型让更多研究人员能够开展月球测绘

9月14日
讀畢需時 13 分鐘

NASA 和 IBM 于 9 月 10 日发布 NASA-IBM 月球 AI 模型,向外部研究人员开放其权重、代码、数据集和基准测试资源。该发布将约 200 万组月球图像包以及多种科学仪器数据整合进一个可复用系统。

这种规模带来了核心张力。NASA 积累的月球观测数据已经多到研究人员难以高效审阅,但 AI 预测无法替代经过科学验证的测量结果。该模型可以缩小搜索范围、标记地表变化,或识别有潜力的冰层信号。科学家仍须通过独立证据检验这些输出。

这项发布也挑战了行星分析的常规方法。研究团队往往会针对一种仪器和一个问题构建专用模型。NASA 和 IBM 则希望通过一个预训练基础模型,支持陨石坑检测、火山地貌测绘、极地冰层研究以及未来任务。

NASA-IBM 月球 AI 模型整合数十年的月球数据

眼下的变化并不只是出现了一种新算法。NASA 和 IBM 发布了一个共享的技术基础,用于分析此前彼此割裂的月球观测数据。

该模型是首批专为月球科学开发并公开提供的基础模型之一。基础模型先从大型数据集中学习广泛模式,研究人员随后再将其适配到更具体的任务中。

NASA 表示,该系统主要使用月球勘测轨道飞行器(Lunar Reconnaissance Orbiter,简称 LRO)的观测数据进行训练。这艘航天器已持续 17 年采集月球的详细测量数据。

LRO 数据覆盖了月球表面的大部分区域,并包含一幅近乎连续的高分辨率拼接图。NASA 称,该任务产生的数据量超过其他所有 NASA 行星任务的总和。

训练数据集包含约 200 万组经过空间对齐的图像包,其中包括逾 100 万张窄角相机图像,分辨率约为 1 米。

该数据集还包含近 96.4 万张多光谱图像,分辨率约为 100 米。这些覆盖范围更广的图像提供了区域背景信息,这是狭窄的高分辨率视角无法单独捕捉的。

其他输入数据来自 NASA 的 GRAIL 任务、Lunar Prospector 以及日本的 SELENE 任务。这些任务共同提供了地形、重力、矿物、温度、雷达、光照和氢相关测量数据。

IBM 表示,配套数据集汇总了来自四项任务、九种仪器的 30 多个对齐图层。公开的 月球模型发布说明提到了数万张源图像和科学地图。

对齐至关重要,因为不同仪器观测月球的方式并不相同。它们采用不同的分辨率、覆盖范围、波长、观测角度和测量方法。

一座在光学图像中可见的陨石坑,可能对应一张坡度图、热信号、雷达响应或重力测量数据。在科学分析真正开始之前,手动关联这些观测结果需要大量准备工作。

NASA-IBM 月球 AI 模型将这些对齐后的输入转化为可复用的表征。研究人员随后可针对明确问题微调该表征,而不必从头训练每一个模型。

NASA 和 IBM 还发布了模型权重、评估资源和适配代码。该模型采用 Apache 2.0 许可证,并可通过 Hugging Face 获取。

这种开放性改变了能够检验这项工作的主体。大学团队、独立实验室和国际研究人员无需协商私有访问权限,便可审查同一个起始模型。

这并不意味着所有月球数据集都完整或同样可靠。但它为外部团队提供了一个共同的研究对象,可供复现、质疑和扩展。

为何月球数据成为 AI 瓶颈

NASA 面临的问题已不再是缺少月球观测数据。压力来自如何将不断增长的档案转化为科学家能够审查的决策依据。

月球任务通过相机、光谱仪、雷达系统、激光高度计及其他传感器记录月表。每种仪器捕捉的物理属性都不同。

这些测量通常是围绕各自任务设计的。它们最初并不是以具有匹配坐标、尺度和格式的统一机器学习数据集形式汇集而成。

因此,研究人员需要花时间寻找文件、协调地图、校正几何关系并准备标注。这些工作必不可少,但也限制了团队测试新科学问题的速度。

传统机器学习项目还会增加另一层限制。一个团队可能训练一个模型识别陨石坑,另一个用于分割火山地貌,还有一个用于估算极地冰层状况。

每个项目都需要标注、计算资源、技术专长和反复评估。小型研究团队可能难以复现依赖私有预处理选择构建的系统。

新模型将预训练应用于这一瓶颈。在团队教会系统执行特定下游任务之前,预训练会先让系统接触广泛且大多未标注的观测数据。

NASA 的月球科学概述列出了三项早期用途:陨石坑测绘、不规则月海斑块检测,以及极地冰层潜在性评估。

陨石坑测绘兼具科学和运行价值。陨石坑计数可帮助研究人员估算地形年龄,并重建太阳系的撞击历史。

详细地图也可为着陆分析提供参考。陡坡、巨石和陨石坑密集的地形,可能对机器人或载人任务造成风险。

不规则月海斑块是小型火山特征,其年代似乎比周边大部分地形更年轻。它们的分布会影响关于月球火山活动何时结束的讨论。

极地冰层则带来不同挑战。永久阴影区几乎不受或完全不受阳光直射,因此难以通过普通光学图像进行研究。

这些区域足够寒冷,能够在极长时间内保存冰层。任何得到确认的沉积物,也可能影响持续月球活动的规划。

水可为人员提供支持,而其氢和氧成分在能源系统和推进剂生产中可能具有用途。不过,AI 概率地图并不等同于确认存在可获取的冰。

这一差异为行星科学家带来了富有成效的压力。他们如今拥有更快的地点排序方式,但仍须决定自动化应如何纳入经得起检验的科学工作流程。

同样的问题也关系到为医学、气候科学和材料研究开发 AI 的开发者。模型能够缩小搜索空间,但不能替代对底层科学问题的判断。

对于知识工作者而言,这一启示也并不陌生:只有当人们能够将输出追溯至证据和背景时,整理大型档案才会真正创造价值。

一个模型连接多种仪器与分辨率

该模型的主要技术贡献,是建立了一个跨越不同传感器类型及 100 倍分辨率差距的共享表征。

NASA-IBM 月球 AI 模型采用视觉 Transformer 编码器和解码器。视觉 Transformer 会将图像划分为多个图块,并学习这些图块之间的关系。

其训练方法使用掩码令牌学习。系统会隐藏输入中的部分内容,并学习重建或预测缺失信息。

这一过程促使模型关联可见地形、高程、成分、温度、雷达响应及其他可用信号。它并非只是记住一份陨石坑目录。

公开的模型卡描述了跨越两个空间尺度的 11 种模态。一个尺度聚焦于接近每像素 1 米的图像,另一个则处理接近 100 米的数据。

这一差异很重要。精细图像可以展示局部地形,而更广范围的观测则能揭示区域背景及延伸至单个图像块之外的模式。

NASA 和 IBM 在同一套混合工作流程中训练了两个分辨率系列。因此,同一组模型权重可以支持这两种尺度,而无需将它们完全分离。

该架构还将采集几何条件作为显式上下文。采集几何条件描述了光照角度、航天器位置和观测覆盖范围等条件。

光照会显著改变月球地形的外观。长阴影可能让一座小陨石坑显得突出,而另一种观测角度则可能掩盖同一结构的一部分。

提供已记录的光照信息,有助于模型区分地表属性和观测条件,也减少了仅凭外观推断已知几何信息的需要。

模型卡称,预训练使用了 16 块 H100 图形处理器,进行了 150,000 个训练步骤。其报告的全局批量大小为 1,536,耗时约 1,100 GPU 小时。

这些数字表明,起始模型需要大量基础设施。其实际承诺在于,下游研究人员不应需要重复完整训练过程。

团队可以改用全量微调或低秩适配,后者通常称为 LoRA。LoRA 会调整少量新增参数,同时保持大部分预训练权重不变。

该项目建议将 LoRA 作为若干已测试任务的合理默认选择。据称,在改变更少参数的情况下,其陨石坑检测结果达到或超过了全量微调。

NASA 还将该模型整合进 TerraTorch——一款用于地理空间模型训练的开源工具包。完整的代码库包含已发布基准测试的配置。

这种封装的重要性几乎不亚于模型检查点。缺少可用代码、文档化输入或可重复评估的模型,外部科学家依然难以采用。

这一方法对依赖孤立、任务专用流程的团队形成了压力。当多个项目使用重叠观测数据时,共享模型可以减少重复预处理和训练。

不过,当问题需要专门的物理模型、精心选择的标注或严格控制的传感器流程时,任务专用方法仍具优势。通用表征并不能消除领域专业知识的重要性。

因此,真正有意义的竞争存在于可复用预训练与反复构建模型之间。NASA 和 IBM 认为,月球研究现已拥有足够多的对齐数据,使复用变得值得。

陨石坑、冰层和火山特征构成首批测试

已报告的基准测试结果令人鼓舞,但它们衡量的是明确的研究任务,而非自主任务执行能力。

NASA 表示,该系统在四项评估中达到或超过了多个强基线模型。对比对象包括 SwinV2-B、ConvNeXt 和视觉 Transformer 等成熟图像架构。

对于接近 100 米分辨率的大范围陨石坑检测,IBM 报告称,该模型的表现比 SwinV2-B 高出近 19%。在该比较中,它使用的带标注训练数据也只有后者的一半。

在米级分辨率下,据称该模型产出的陨石坑识别结果与领先基线系统相当。NASA 和 IBM 强调的是较低的适配要求,而非一种普遍的准确率优势。

这种区别很重要。性能会随陨石坑大小、图像质量、光照、地理区域以及评估所选标签而变化。

对于极地冰分布潜力,IBM 表示,与 SwinV2-B 相比,该模型将均方根误差最多降低了 22%。该指标用于衡量预测值与参考值之间的差异。

该模型估计的是哪些区域的条件看起来有利于冰稳定存在。它并不会直接钻探、采样或通过化学手段确认水的存在。

这一输出仍然可能有用。研究人员可以将冰分布潜力地图与地形风险、光照、通信限制及其他任务要求结合起来。

对于不规则月海斑块,IBM 报告称,在使用不完美标签时,该模型相较 SwinV2-B 提升约 3%。NASA 表示,该系统取得了可与强大的专业方法相当的结果。

该模型还接受了地表变化检测测试。研究人员检查了 Einstein 陨石坑附近一处区域在火箭体撞击前后的影像。

撞击后的观测数据未被纳入预训练。在针对任务进行适配后,该系统在识别已有陨石坑的同时,标出了这一新增特征。

这个例子表明,可复用的表征可能有助于搜索近期撞击或其他地表变化。但这并不意味着该模型能够在所有光照条件下可靠地检测每一项变化。

NASA 明确指出,不同轨道飞越之间的光照差异会影响较小陨石坑的可见性。这是一项重要限制,因为月球阴影会随着观测几何关系而显著变化。

根据模型文档,大多数对比评估涵盖了五个随机种子。多个随机种子有助于揭示结果是否依赖于某一次有利的训练运行。

不过,基准测试作者与模型开发者之间存在显著重叠。独立复现将比仅凭发布时的结果提供更有力的证据。

模型自身的文档也限制了其预期用途。生成的字段是研究探针,而非适合直接用于运营决策、经过校准的科学预测。

这一警示避免了人们对基础模型的一种常见误解。一个跨多种模态训练的系统可以学习有用的关系,却未必能产出具有已知不确定性的测量结果。

任务规划人员需要不确定性估计、地理压力测试、失效分析和人工审查。他们还需要证明性能可迁移到精心策划的基准测试划分之外。

因此,首批结果支持进一步研究。它们并未证明某个模型已经解决了月球测绘、资源识别或着陆点选择问题。

开源将验证工作扩展至 NASA 和 IBM 之外

此次发布背后最有力的主张是可测试性:外部研究人员可以检查模型、重新运行基准测试,并暴露其弱点。

NASA 和 IBM 发布的不只是一个可下载的检查点。该软件包包括适用于机器学习的数据、基准测试集合、代码、模型配置和技术报告。

这种组合为复现提供了更清晰的路径。研究人员可以在相似的数据划分和评估规则下比较不同架构。

开放访问也让科学家能够测试可能在初始基准中代表性不足的区域。极地地形、异常光照和仪器覆盖缺口尤其值得关注。

数据集本身也需要接受审查。空间对齐并不能保证每个图层都具有同等的准确性、时间一致性、覆盖范围或物理含义。

有些测量数据几乎覆盖全球,另一些则仅覆盖较小区域。模型可能学习到由数据可用性形成的相关性,而非月球地质特征。

标签带来了另一项不确定性来源。不同陨石坑目录对边界和最小尺寸的界定可能不一致,而火山特征的边缘也可能存在歧义。

冰分布潜力带来了更深层的不确定性,因为目标部分是根据遥感观测推断得出的。针对估计参考值进行训练,可能会复现该参考值中固有的假设。

研究人员还应检查地理泄漏问题。相邻的月球图块可能共享地形模式,因此不谨慎的训练集与测试集划分可能夸大泛化能力。

模型卡称,SomBench 数据采用基于月球测绘区域和极冠的地理划分。这是一项有益的保障措施,但外部团队应验证其具体实现。

另一个问题涉及缺失模态。实际研究任务可能只有光学影像和高程数据,而训练数据集则包含许多额外信号。

该架构支持在适配期间添加或移除模态。独立测试应确定当重要图层缺失时,性能会以多大程度平稳下降。

算力仍是现实障碍。开放权重消除了许可限制,但大规模实验仍需要存储空间、专业硬件和数据工程能力。

规模较小的机构可能要依赖托管环境或合作关系。这比重复原始预训练更容易参与,但并非毫无成本。

本报道的核心也没有直接的商业竞争对手。主要替代方案仍是围绕单一数据集和单项任务构建更窄的流程这一既有做法。

当研究人员拥有高质量标签或任务特定约束时,专业系统仍将很有价值。它们在有限范围内可能更容易解释和验证。

NASA 和 IBM 的方法只有在独立测试后仍能实现复用时才算胜出。它必须节省人力,而不能引入需要同样高成本纠正的隐藏错误。

这正是开放的重要性所在。封闭系统可以发布有利结果,却不给外部人士足够材料来审查其假设。

此次发布延续了 NASA 与 IBM 在科学基础模型方面的既有合作。他们的 AI science portfolio 还包括地球观测和日球物理系统。

Prithvi 模型面向洪水测绘、灾害监测、天气分析和作物评估等应用。Surya 模型则聚焦太阳观测与空间天气预报。

月球项目将这一战略扩展到了地球和太阳之外。NASA 正将基础模型视为共享的科学基础设施,而非孤立的演示项目。

这一战略树立了重要先例。机构可以在发布模型的同时公开科学数据,让研究社群同时评估两者。

它也提高了文档要求。由公共资金支持的 AI 系统应披露预期用途、训练输入、基准测试、限制条件及可复现的适配路径。

三个信号将揭示该模型是否重要

衡量下一阶段成功的标准不是又一次发布公告,而是独立团队能否借助这一已发布系统产出可靠的月球科学成果。

第一个信号是独立复现基准测试。研究人员应使用已发布的配置,重新运行陨石坑、冰、火山特征和地表变化评估。

结果一致将增强人们对技术报告的信心。若存在较大差异,则表明未记录的设置、数据处理或基础设施可能影响了原始发现。

最有价值的复现将测试新的地理区域和不同的标签选择。一个仅在原始划分上表现良好的模型,只能为更广泛的科学价值提供有限证据。

第二个信号是在同行评审月球研究中的采用情况。下载量和代码仓库星标数体现关注度,但并不能证明该模型改善了科学结论。

更有力的结果将是一篇论文:该系统帮助识别候选特征、减少标注工作,或支持后来获得独立验证的观测结果。

研究人员应报告模型失效的位置,而不仅是其表现良好的地方。误差地图和不确定性分析可以揭示错误是否集中于阴影、极地或仪器覆盖稀疏区域。

第三个信号是融入任务规划工作流。NASA 描述了涉及风险、着陆区域、极地资源和长期地表活动的潜在用途。

运营集成所需的不仅是有前景的分割分数。团队还需要审查流程、可追溯的输入、经过校准的置信度,以及与现有测绘方法的比较。

如果该模型以有据可查的人工监督进入规划工作流,可复用基础模型的方法将获得可信度。如果它仍只是研究产物,其短期影响将更为有限。

竞争对手的反应不如社群行为重要。这主要不是两家销售月球软件的 AI 供应商之间的竞赛。

真正重要的竞争,是可复用科学模型与一次性分析流程之间的竞争。若有证据表明多个机构实现复用,将支持 NASA 和 IBM 的论点。

NASA-IBM 月球 AI 模型也为更广泛的开放科学 AI 提供了一项测试。它将公开观测数据与可访问的代码及明确的评估套件结合起来。

即使其中一些主张在复现后被削弱,此次发布仍然有价值。透明的失败可以改进整个领域的方法、数据集和基准设计。

NASA 的 Kevin Murphy 将这一机会描述为把大规模数据转化为发现。这一措辞很重要,因为仅有数据量并不会自动产生科学理解。

人们仍然负责选择问题、验证证据,并决定某项预测是否支持采取行动。该模型可以帮助研究人员审查更多档案数据,但责任仍由人类承担。

对于开发者和科研团队而言,眼下的行动很直接:检查数据集假设,复现一项基准测试,并在扩展系统前记录任何差异。

对于企业 AI 买家而言,更广泛的教训同样务实。只有当基础模型的输出在实际工作流中仍可追溯、可测试且可适配时,它才会产生价值。

独立月球科学家能否复现报告中的性能提升,并发现专业模型遗漏的结果?这将是 NASA-IBM 月球 AI 模型下一项值得关注的里程碑。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page