top of page

IBM 和 NASA 开源月球基础模型,但地图仍需人工验证

9月12日
讀畢需時 15 分鐘

IBM 和 NASA 于 9 月 10 日将 NASA-IBM Lunar Foundation Model 作为开源软件发布,旨在通过一套可复用系统解决三项复杂的月球测绘问题。该模型可分析来自分辨率差异极大的观测数据中的陨石坑、潜在冰沉积和火山地貌。它的发布挑战了科学领域惯常的工作流程:针对每种仪器和研究问题分别训练独立模型。

这项挑战比亮眼的性能数据更重要。IBM 表示,该模型在一项冰资源勘测基准测试中,相较广泛使用的视觉基线模型将误差降低了 22%。在低分辨率陨石坑检测中,据称它以一半训练数据实现了近 19% 的性能提升。这些结果颇具前景,但均来自项目团队设计和报告的基准测试。

因此,真正的较量并非 IBM 与另一家 AI 公司之间的竞争,而是可复用的多模态科学模型与围绕单一数据集构建的任务专用系统之间的对比。前者有望加快研究并扩大获取门槛,后者则仍更容易在狭窄的科学问题中完成验证。

NASA-IBM Lunar Foundation Model 整合碎片化观测数据

此次发布将一系列彼此割裂的月球测量数据,转化为科学 AI 项目的共同起点。

IBM 和 NASA 向外部研究人员发布了该模型、权重、支持数据集和适配工具。根据其公开的模型卡,该软件通过 Hugging Face 以 Apache 2.0 许可证提供。

基础模型是在广泛数据上训练的,研究人员可将其适配至多种下游任务。在这里,“广泛”指的是不同形式的月球遥感数据,而非互联网文本或对话知识。

这一区别很重要,因为它并不是一个可用于询问月球问题的聊天机器人。它是一个视觉系统,旨在提取并生成关于月球表面、地形属性和观测条件的表征。

IBM 和 NASA 还构建了一个适用于机器学习的数据集,其中包含超过 30 个空间对齐图层。根据项目的月球模型发布公告,这些图层来自与四项任务相关的九种仪器。

底层观测数据包括 NASA 的 Lunar Reconnaissance Orbiter 和 Gravity Recovery and Interior Laboratory 任务数据,也纳入了日本宇宙航空研究开发机构的 SELENE 测量数据,后者也被称为 Kaguya。

这些仪器观测月球的方式并不相同。有些记录可见表面细节,另一些则测量温度、重力、高程、雷达属性、矿物成分或氢丰度。

它们的空间分辨率也存在显著差异。Lunar Reconnaissance Orbiter 的 Narrow Angle Camera 可按约每像素一米捕捉地形,其 Wide Angle Camera 则以约每像素 100 米提供范围更广的背景信息。

重力测量的尺度可能要粗得多。整合这些数据源并不只是把多个图像文件放进同一个文件夹。

项目团队按地理位置对齐观测结果,并将其划分为共注册瓦片包。每个包通过多种仪器或衍生测量结果呈现同一片月球区域。

公开的 SomBench 预训练数据集包含约 200 万个此类数据包。其模型卡列出了 1,000,113 个 Narrow Angle Camera 数据包和 963,609 个 Wide Angle Camera 数据包。

该系统从两个主要空间尺度上的 11 种模态中学习。九种模态属于稠密的类图像数据源,其余输入则编码光学元数据和静态地理背景。

这些光学信息包括太阳入射角、出射角、相位角和方位角,也涵盖地面采样距离及相关的表面坐标。

光照信息在月球上格外重要。由于几乎没有大气层来散射光线,太阳角度的微小变化便可能产生截然不同的阴影和高光。

忽略这些条件的模型,可能将光照变化误判为地形变化。NASA-IBM Lunar Foundation Model 则将采集几何条件作为显式输入。

这一设计有助于区分仪器观测到了什么,以及它是在何种条件下观测到的。在研究人员比较不同时间或不同观测角度下的数据之前,这是必要的一步。

因此,该模型改变的不只是单项测绘任务的速度。它为过去需要大量预处理和任务专用工程工作的观测数据提供了共享表征。

这种共同表征也带来了本文的核心张力:可复用模型覆盖范围更广,但每一项下游科学结论仍需要任务层面的验证。

一套可复用模型为何会给任务专用系统带来压力

IBM 和 NASA 押注于月球研究人员应当适配一个共享骨干模型,而不是针对每个问题重建整条分析管线。

传统的科学机器学习通常从精心挑选的数据集和单一狭窄目标开始。研究人员可能训练一个模型寻找陨石坑,另一个勾勒火山地貌,还有一个评估冰资源潜力。

这种方法在概念上很清晰。每个模型都有明确的输入、目标标签和评估方法。

但它也会重复劳动。团队在真正研究科学问题之前,反复清洗数据集、设计输入管线、选择架构,并训练大量参数。

预训练的月球骨干模型将更多工作前移。研究人员可以从多种观测类型中学到的特征开始,再用规模更小的任务专用数据集适配模型。

IBM 和 NASA 通过完整微调、冻结编码器和低秩适配测试了这种方法。低秩适配通常称为 LoRA,它在保持大多数基础模型参数不变的同时训练小型辅助矩阵。

项目研究人员使用的 LoRA 配置使约 90% 的基础模型权重保持冻结。这可减少适配所需的计算和存储资源。

不过,公开结果并不支持一条通用的适配规则。模型卡称,LoRA 在陨石坑检测中与完整微调持平或表现更佳,而完整微调在两个小型基准测试中仍占优势。

完全冻结的编码器在一个小型火山特征数据集上表现最佳,但在陨石坑检测中低于所有基线模型。

这些差异很有价值,因为它们打破了过于简单的部署叙事。研究人员仍需测试哪种适配策略适合自己的数据、标签和误差容忍度。

更广泛的压力将落在围绕单一传感器组织的工作流程上。月球问题经常跨越仪器边界,因为一个地点的可见外观只能揭示其物理特征的一部分。

潜在冰沉积就是一个清晰例子。研究人员可能会考虑表面温度、坡度、光照、地形、雷达测量结果和地下稳定性估计。

传统图像模型可以将多个图层堆叠为输入通道。该月球模型则为每种模态配备独立的学习型适配器,然后在其 Transformer 架构中组合生成的 token。

Transformer 是一种用于评估输入元素之间关系的神经网络。在这里,这些元素代表不同月球测量数据中的图块,而非句子中的词语。

这种 token 级方法让模型在学习模态之间关系之前保留它们的差异。IBM 将冰资源基准测试的部分改进归因于这一设计。

该架构还跨越了 100 倍的分辨率差异进行训练。窄角和广角瓦片以各自原生分辨率进入同一混合训练流程。

FlexiViT patch embeddings 使研究人员能够在适配过程中改变图像 patch 大小,而无需从头重新训练骨干模型。当一项任务依赖细小的陨石坑边缘、另一项任务依赖区域模式时,这种灵活性尤为重要。

该系统从零开始训练,采用 Vision Transformer Base 编码器—解码器。编码器包含 12 层、12 个注意力头,隐藏维度为 768。

根据模型文档,预训练使用了 16 块 Nvidia H100 GPU,进行了 150,000 步训练。报告的工作负载总计约 1,100 GPU 小时,全局批次大小为 1,536。

对于单个研究团队而言,这些要求相当高。开放权重使外部团队无需重复承担预训练成本,但微调和评估仍需要合适的硬件。

这正是开放发布带来实际压力的地方。专门团队如今需要先说明为何要构建新的骨干模型,而不是先测试具备相关预训练特征的现有月球模型。

这种压力对标注数据有限的研究人员最为明显。在广角陨石坑基准测试中,使用一半可用训练数据的预训练变体,与使用完整数据集训练的领先基线模型表现持平或更佳。

开发者可通过项目的微调代码库获取可运行配置。该代码库包含陨石坑检测、火山特征分割和冰资源潜力评估模块。

根据其 README,该代码库并未包含预训练代码。对于希望从原始数据复现模型的人而言,这一缺失限制了“开源”的含义。

权重、适配代码、配置、许可证和基准数据集提供了相当大的访问权限。完整的预训练可复现性仍是另一项要求更高的标准。

评估此次发布的团队需要在自身技术记录中保留这些区别。一个可搜索的工程知识库可帮助关联模型版本、数据集假设、实验和评审决策。

因此,该模型并不会自动取代专用系统。它是一个可信的默认选择,专用系统如今必须在性能、简化程度或验证说服力上超越它。

该机制连接尺度、模态与月球光照

该模型的主要技术贡献并非单一准确率分数,而是一种能够跨越不兼容观测数据进行推理、同时不抹去其差异的方法。

IBM 和 NASA 改造了 TerraMind 的训练方法;TerraMind 是 IBM 与欧洲航天局开发的多模态地球观测模型。月球版本采用掩码 token 建模。

在掩码 token 训练中,输入的一部分会被隐藏,系统学习重建选定目标。这促使模型学习观测类型内部及不同观测类型之间的关系。

可见光图像可能有助于解释地形结构。热信息可能与阴影和表面成分有关。雷达或氢测量结果则可能提供普通摄影无法获得的线索。

系统能够学习这些关系,因为其训练图块覆盖相同的地理区域。空间对齐为模型提供了比较源自不同仪器测量结果的基础。

首个面向月球的新增内容是采集几何信息。每个图块都将观测和光照条件作为序列标记纳入其中。

这一选择直接应对了一项主要的视觉混淆来源。同一条山脊在一幅图像中可能呈现为明亮边缘,在另一幅图像中则会消失在阴影里。

在月球两极,低太阳高度角会形成长阴影,可能遮蔽危险因素。永久阴影区尤其难以处理,因为常规的反射光成像几乎无法呈现细节。

第二项新增内容是联合混合分辨率预训练。同一组权重同时处理米级与区域级观测数据,而不是将每种尺度视为独立的模型家族。

这对于陨石坑分析至关重要。小型陨石坑的坑缘可能需要高分辨率影像才能识别,而其周边地形则在更广阔的尺度上提供地质背景。

这对于潜在着陆区域同样重要。研究人员必须将局部危险因素与区域性的光照、坡度、温度及可达性考量联系起来。

模型的 11 种模态并非都具备全球覆盖范围。一些静态图层仅在特定仪器的覆盖范围内可用,某些极地产品也只覆盖相对较少的图块。

按模态进行标记化处理,使研究人员能够省略不可用的输入,或在微调时加入选定模态。模型并不要求每项任务都具备每一种观测类型。

这种灵活性对于真实的科学档案至关重要,因为缺失数据本属常态。但这也带来一个评估问题:性能会随可用模态的不同而变化。

已发布的基准测试涵盖四个下游问题,包括广角陨石坑检测、米级陨石坑检测、不规则月海斑块分割和极地冰潜在性评估。

不规则月海斑块是在月球暗色玄武岩平原中发现的异常、相对平滑的火山地貌。其年代和成因仍存在争议,因此绘制其边界可支持更广泛的地质分析。

在使用一半训练数据进行广角陨石坑检测时,表现最佳的月球模型配置实现了 0.2541 的平均精度均值。表现最佳的已报告 SwinV2-B 基线达到 0.2313。

平均精度均值汇总了不同置信度和重叠阈值下的检测质量。它会奖励既能找到相关对象、又能限制误检的系统。

使用完整的广角训练集时,最佳月球配置达到 0.2581。相应的 SwinV2-B 基线达到 0.2420。

在米级陨石坑检测中,差距几乎消失。该模型达到 0.1543,而领先基线为 0.1552。

这一结果与更显著的提升同样具有参考价值。它表明,预训练并未在每一种分辨率和任务中都形成决定性的优势。

对于不规则月海斑块分割,已报告的最佳月球结果达到 0.5709 的交并比得分。所列出的最强基线达到 0.5687。

交并比衡量预测区域与标注区域的重叠程度。这一微小差距不足以证明存在显著的能力鸿沟。

极地冰潜在性基准测试给出了最清晰的结果。月球模型的均方根误差为 0.0293,而 SwinV2-B 为 0.0377。

较低的均方根误差表明其在该回归任务中的预测更接近真实值。IBM 将这一差异描述为误差最高可降低 22%。

这些具体结果见于项目的技术报告。研究人员对大多数配置使用五个随机种子进行评估,这有助于显示不同运行之间的结果波动。

不过,基准性能与科学实用性并不完全等同。模型可以提升某项指标,却未必能产出经得起独立测量检验的发现。

近期最可能的角色是辅助排序。该系统能够突出值得通过更高分辨率成像、模拟或未来仪器进一步检验的位置、模式或异常现象。

这一功能具有实际价值。科学家无法人工检查数 PB 观测数据中的每一种组合,尤其是在数据源采用不同网格和尺度的情况下。

但模型输出仍应被视为研究线索。它并不是某一特定地表下存在冰的直接证据,也不能证明已绘制地貌具有某个特定年代。

开放权重并不能消除科学不确定性

模型可以缩小搜索范围,但无法将遥感相关性转化为已确认的月球资源或安全着陆决策。

IBM 的公告提出了三项主要应用:寻找更小的陨石坑、研究火山活动历史,以及估计月球冰可能存在的位置。每种使用场景都面临不同的验证要求。

陨石坑检测最接近可直接观察的成像任务。研究人员可以将预测的陨石坑位置与带标注图像及独立目录进行比较。

即便如此,标签本身也存在不确定性。小型陨石坑会重叠、侵蚀,或在复杂光照条件下消失,而不同数据集的标注标准也可能不一致。

火山任务更具挑战性,因为不规则月海斑块的边界可能存在模糊性。IBM 承认,评估使用了并不完美的标签。

因此,相对于某一已报告任务特定比较高出 3% 的结果应谨慎看待。与不确定标签更高的重叠度,并不能解决围绕这些地貌的科学争论。

冰潜在性呈现了模型输出与物理确认之间最大的差距。模型估计的是:哪些地点的条件和测量结果,与被视为有利于冰存在的区域相似。

它并不直接采集月球物质。在留出数据集上预测误差较低,无法确认任务地点冰的数量、深度、可获取性或纯度。

IBM 的发布材料使用了审慎措辞,将其描述为潜在冰沉积物及高潜在性区域。读者应保留这一限定。

这些基准比较同样来自设计模型并汇集数据集的团队。独立复现尚未确定所报告的提升能否迁移至其他区域、标签或任务定义。

数据泄漏是研究人员必须持续检验的另一项问题。地理位置相近的月球图块可能共享地形模式,即便它们被存储为不同样本。

项目称其采用了基于月球测绘分区和极冠区域的地理划分。这比随机划分相邻图块更严格,但外部团队仍应针对其预期任务审查这种划分方式。

覆盖偏差同样值得关注。密集观测往往集中于具有科学研究价值的区域,或由特定任务瞄准的区域。

在这些记录上训练的模型,可能会在观测稀疏的地形中呈现不同表现。缺失模态也会进一步改变其预测质量。

月球表面还存在极端的分布偏移。新仪器的噪声、校准、分辨率或观测几何条件,可能与 SomBench 所涵盖任务所使用的仪器不同。

微调可以有所帮助,但适配并不保证兼容性。研究人员在运营规划中依赖该模型前,仍需进行针对特定仪器的测试。

此次发布的开放特性提升了开展此类审查的可能性。外部团队可以下载权重、检查配置、复现下游测试,并建立区域基准。

Apache 2.0 也允许广泛的修改和再分发。这应能让大学、航天机构和商业月球公司更容易构建专用版本。

不过,缺少预训练代码限制了完整重建。研究人员能够评估发布的检查点,但仅凭公开仓库尚无法复现生成它的每一步过程。

硬件获取也构成另一条实际边界。避免 1,100 GPU 小时的预训练降低了门槛,但处理多模态月球数据集仍然需要大量计算资源。

文档和数据准备可能会成为比模型可用性更大的障碍。不同仪器采用不同的投影、分辨率、校准历史和物理单位。

只有当研究人员能够可靠地复现预处理过程,并将输出连接到既有科学工具时,一个技术上开放的模型才能真正广泛适用。

运营使用需要达到更高标准。着陆点选择不能依赖单一机器学习得分,因为导航危险会带来直接的安全后果。

任务规划人员会综合影像、地形模型、光照研究、通信限制、热条件和工程裕度。月球模型可以提供证据,但不能取代这一过程。

同样的克制也适用于资源规划。水冰可用于饮用水供应、制氧和推进剂制造,但可获取性决定了一处冰沉积是否具有运营价值。

一个从遥感看似有前景的地点,可能过深、过于分散,或难以到达。物理测量仍将具有决定性作用。

与“AI 绘制月球地图”这一说法相比,这种权衡更准确地定义了 NASA-IBM Lunar Foundation Model。它拓展了可检验假设的空间,同时将证明确立在仪器与科学家手中。

三个信号将显示开放月球 AI 是否重要

下一项检验是采用情况与独立验证,而不是原始团队发布的又一个吸睛基准结果。

第一个信号是第三方基准复现。独立研究人员需要利用发布的权重和已记录的数据划分,复现陨石坑、火山和冰相关结果。

如果团队在多个随机种子下获得相似结果,复现将增强信心。若结果明显逊色,则会削弱预训练表征提供可靠优势的主张。

最有参考价值的研究将测试不受原始团队控制的区域或标签。研究还应报告失败案例,而非只发布汇总得分。

这些失败案例能够揭示模型是否会将阴影误判为地形、难以处理缺失模态,或在观测稀疏区域中表现欠佳。

第二个信号是对新数据或任务工作流程的适配。当外部团队能够将可复用的基础模型应用于其原始基准包之外的场景时,它才真正配得上“基础模型”这一名称。

研究人员或许会测试另一项月球任务的影像、加入新的测量类型,或针对不同的地质特征微调骨干网络。成功迁移将支持 IBM 和 NASA 的共享模型战略。

反复出现的再训练困难则会指向相反结论。若每种新仪器都需要大量预处理和架构调整,任务专用管线可能仍保有实际优势。

公开软件已通过 TerraTorch 配置和可下载检查点提供了起点。下一个问题是,研究人员能否在无需其创造者密切协助的情况下扩展这一基础。

第三个信号是,该模型是否能够为观测或任务决策提供信息,并产生可验证的结果。这或许会先从确定优先成像目标开始,而不是直接用于运营性着陆指引。

一个有用的系统可以标记未记录的陨石坑供人工审查,识别值得进一步研究的火山边界,或为极地区域的后续测量排序。科学家随后便可将这些线索与独立数据进行比较。

时间表将取决于研究周期以及能否获取相关观测数据。更广泛的战略背景来自 NASA 的 Artemis program,该计划旨在支持持续性的月球探索,并为火星任务做准备。

IBM 和 NASA 此前已发布用于地球观测、天气、气候、科学文本和太阳物理学的科学基础模型。该月球项目将这一模式延伸至行星遥感领域。

这段历史意味着,此次发布不只是一次孤立的展示。IBM 和 NASA 正围绕公共数据和可复用架构,构建一系列共享的科学 AI 系统。

这种方法促使机构重新思考:模型开发应处于研究流程的哪个环节。通用底座能够减少重复训练,但集中式预训练也会使关于数据、架构与评估的假设更加集中。

开放访问有助于揭示这些假设,但并不能消除它们。

对开发者而言,眼下的机会在于试验一个输入具有物理意义的专业多模态模型。这不同于仅使用可见光照片来适配通用图像模型。

对科学家而言,机会在于连接不同仪器的观测结果,而无需从头重建每一种表征。其责任则是检验这些连接在科学上是否依然成立。

对任务规划人员而言,该模型提供了另一种为稀缺注意力和计算资源排序优先级的方式。它无法取代高分辨率观测、模拟、实地测量或工程审查。

这一边界应当决定人们如何评判此次发布。NASA-IBM Lunar Foundation Model 的首要成功标准,是成为有用的研究基础设施,而不是生成最具轰动效应的月球论断。

未来数月,请关注谁能够复现其基准结果,谁会将其适配至陌生数据,以及其预测是否能够指导独立观测。这些结果将表明,开放的月球 AI 会成为共享基础设施,还是仍只是一项令人印象深刻的研究发布。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page