NASA IBM Lunar Foundation Model 开放月球数据,但尚未达到任务就绪标准
IBM 和 NASA 于 9 月 10 日发布了一款开源月球模型,声称其在一项关键的月球冰层基准测试中将误差最多降低了 22%。NASA IBM Lunar Foundation Model 将来自不同仪器、不同分辨率和不同任务的观测数据整合进一个可复用的 AI 系统。
这种整合正是此次发布背后的核心张力所在。NASA 正在摆脱为不同科学问题分别构建独立算法的模式。如今,它希望研究人员从一个共享模型出发,再将其适配用于陨石坑测绘、火山分析或冰资源勘探。
这一发布挑战了长期塑造月球遥感领域的任务专用方法。然而,IBM 和 NASA 明确警告,该模型无法认证着陆点、排除危险,或确认冰的存在。它是一种科研加速工具,而非自主月球导航器。
NASA IBM Lunar Foundation Model 整合碎片化的月球数据
此次重要发布的不只是一款模型,更是一个用于整合此前碎片化月球观测数据的通用框架。
NASA IBM Lunar Foundation Model 是一种多模态基础模型,也就是说,它能够从多种科学数据中学习可复用的模式。研究人员可将这一共享表征适配到更具体的任务中,无需为每个系统从头开始训练。
IBM 和 NASA 使用 SomBench 训练了该模型。SomBench 是一个新的数据集,包含近 200 万组经过空间对齐的月球瓦片数据包。这些数据包覆盖 11 种数据模态和两种差异巨大的空间尺度。
广角数据包括 963,609 组以 Lunar Reconnaissance Orbiter Camera Wide Angle Camera 观测为中心的数据包。高分辨率数据集则包括另外 1,000,113 组基于 Narrow Angle Camera 图像的数据包。
该模型可处理影像、地形高程、坡度、观测几何、紫外反射率、热信息、雷达观测、重力数据、矿物测量和氢指标。这些数据源天然并不共享同一分辨率或格式。
NASA 的 Lunar Reconnaissance Orbiter 能够捕捉接近每像素一米的地表细节。GRAIL 重力观测则描述范围大得多的结构,部分产品的分辨率以每像素数公里计。
因此,IBM 和 NASA 构建了一个适用于机器学习的数据集,将来自四项任务、九台仪器的 30 多个数据层进行对齐。参与任务包括 Lunar Reconnaissance Orbiter、GRAIL、Lunar Prospector,以及日本的 SELENE 任务。
这一数据包之所以重要,是因为单张地图只能呈现部分信息。光学图像中的一片暗区,可能代表阴影、地表特征,或观测角度造成的伪影。
温度、地形、光照、雷达和氢测量数据可以补充背景信息。该模型尝试学习这些信号之间的联系,同时保留它们各自不同的作用。
NASA 将该系统描述为首批专为月球科学设计、且向公众开放的基础模型之一。其权重已通过开放模型存储库提供,并附有实现细节和使用指南。
代码和权重采用 Apache 2.0 许可证。研究人员可检查该系统、修改它,并构建专门应用,而无需依赖封闭的商业接口。
NASA 已确定三项初始应用:绘制陨石坑地图、分析不规则月海斑块,以及估算极地区域可能存在冰的位置。每项任务都将科学研究与未来地表作业的实际问题联系起来。
陨石坑地图有助于科学家估计地形年龄,并重建月球的地质历史。它们也能帮助任务规划人员识别需要进一步检查的坡地、巨石及其他危险因素。
不规则月海斑块是小型火山特征,其形成年代仍存在争议。更好的地图可帮助研究人员检验月球火山活动是否比早期证据所显示的持续得更久。
冰资源勘探具有更直接的作业意义。月球水资源可在长期任务中支持饮用水供应、氧气生产和燃料制造。
因此,这一发布将数十年的观测转化为可复用的起点。它并未取代专门分析,但改变了这些分析能够从何处开始。
为何月球 AI 模型在当下重要
在昂贵仪器、模拟和任务开展最终验证之前,NASA 需要更快地缩小科学问题的范围。
月球并不缺少数据。瓶颈在于,如何让跨越多年、由多种仪器收集的观测数据能够协同发挥作用。
NASA 表示,其科学档案库包含数 PB 的信息。根据一份月球科学报告,仅 Lunar Reconnaissance Orbiter 收集的数据就超过此前所有 NASA 行星任务的总和。
研究人员传统上会手动检查地图,或针对具体任务训练独立的机器学习系统。这项工作依然很有价值,但它可能需要专门标注、计算资源和重复的工程投入。
可复用的月球 AI 模型提供了另一条路径。它可以在预训练期间学习通用关系,再将这些表征迁移至规模较小的标注项目中。
随着 NASA 通过 Artemis 推进持续重返月球的计划,这种方法尤其及时。未来任务需要更好的地形、光照、热环境、通信和可获取资源信息。
极地区域是重点关注对象。月球有限的轴倾角使当地太阳始终低悬于地平线附近,形成漫长阴影和永久阴影区。
这些光照条件使光学解读变得困难。同时,它们也形成了极低温环境,令水冰能够长期被困在其中。
一个月球昼夜周期大约包括两周日照,随后是两周黑暗。当光照越过陨石坑、山脊和松散月壤时,地表外观可能发生显著变化。
对于传统图像分类器而言,这种变化可能看起来像是地形本身发生了改变。NASA IBM Lunar Foundation Model 将观测和光照几何作为显式输入,有助于将地表结构与光照效应区分开来。
这一时机也反映了围绕月球基础设施的更广泛竞争。美国并非唯一计划开展重复地表任务和长期科学作业的国家。
中国一直推进月球样品返回和极地探索,而印度、日本及私营公司已展示或尝试了新的着陆能力。更好的地图和资源评估具有科学、战略和后勤价值。
不过,开放模型并不会让 NASA 独占由此产生的技术。相同的开放性也使大学、国际机构和独立研究人员能够测试或扩展该系统。
这种开放性使此次发布不同于专有的任务规划工具。NASA 和 IBM 正在分发一项共享科研资产,其价值将取决于外部参与。
NASA 首席科学数据官兼代理首席数据与 AI 官 Kevin Murphy 直接指出了这个问题。他表示,收集数据只是工作的一部分,科学家还需要切实可行的方法来探索这些数据。
IBM 的发布公告将该模型定位为连接大型档案库与新发现的桥梁。现有证据支持的是一个更为审慎的结论。
该模型可以对有前景的区域进行排序、检测模式,并减少需要密集审查的地形范围。仪器、地质学专业知识和实际任务,仍将决定这些模式是否反映现实。
IBM NASA 月球 AI 模型如何跨越 100 倍尺度差异工作
该模型的主要技术贡献,是一种尊重不同仪器差异的共享表征,而不是将每项测量粗暴压缩为单一图像堆栈。
IBM 和 NASA 以 TerraMind 为基础构建该系统。TerraMind 是一种最初为地球观测开发的架构。他们将其掩码词元训练方法调整为可处理月球影像、科学测量和采集元数据。
掩码词元训练会隐藏输入的一部分,并要求模型重建选定信息。这鼓励系统学习不同模态之间的关系,而非记忆某一项带标签的任务。
最终模型采用具有 12 层和 12 个注意力头的 Vision Transformer Base 编码器。Transformer 编码器可识别图像块及其他结构化输入之间的关系。
九种模态专用词元化器将密集的科学数据层转换为离散表征。额外的序列输入则描述光学元数据和静态地图背景。
光学元数据包括太阳入射角、出射角、相位角和方位角。它还记录瓦片坐标、太阳直射点位置和地面采样距离。
这些细节并非装饰性的元数据。由于月球缺乏厚重的大气层来柔化阴影和眩光,光照几何会主导月球地形的视觉呈现。
静态背景包括热学、粗糙度、雷达、反照率、矿物、重力和氢相关产品。不同仪器的覆盖范围有所不同,因此模型还必须在部分通道不可用时正常工作。
训练过程同时使用了广角和窄角瓦片。广角样本代表跨度约 51.2 公里的区域,分辨率约为每像素 100 米。
窄角样本覆盖约 512 米,分辨率约为每像素一米。这形成了 100 倍的空间尺度差异。
两类分辨率并未在同一样本中混合。相反,IBM 和 NASA 通过混合批次流程,在两类数据上训练了一套模型权重。
FlexiViT 图像块嵌入让研究人员能在适配过程中调整图像块大小。模态专用词元化还允许项目移除不可用输入,或引入额外输入。
根据技术模型卡,预训练使用了 16 个 Nvidia H100 加速器,进行了 150,000 步训练。整个过程消耗约 1,100 个 GPU 小时。
对于独立起步的研究团队而言,这是一项可观的计算投入。开放权重使其他团队无需重复整个预训练阶段。
研究人员可以改为微调编码器、冻结选定层,或使用低秩适配。LoRA 仅更新一小组新增参数,同时保持大部分原始权重不变。
IBM 表示,其研究人员在轻量级适配期间冻结了 90% 的基础权重。公开模型卡建议将 LoRA 作为多项已测试任务的实用默认方案。
基准测试结果解释了共享模型为何具有吸引力。在广角陨石坑检测中,使用完整训练数据时,该系统的平均精度均值达到 0.2581。
所列出的最强基线 SwinV2-B 达到 0.2420。即使仅使用一半的陨石坑训练数据,该月球模型仍获得 0.2541 的分数,高于该完全训练的基线。
在米级陨石坑检测中,结果则更加接近。月球模型的最佳结果为 0.1543,而 SwinV2-B 为 0.1552。
这场近乎持平的较量意义重大。NASA IBM Lunar Foundation Model 并未在每项任务中占据绝对优势,尤其是在标签或图像质量限制性能的场景下。
在不规则月海斑块分割任务中,最佳模型配置的交并比得分为 0.5709。领先的对比模型得分为 0.5687,差距小于各次实验运行之间的波动。
最明显的提升出现在极地冰远景预测中。相对于报告中的 SwinV2-B 基线,该模型将均方根误差从 0.0377 降至 0.0293。
IBM 将这一变化概括为最高可达 22% 的误差降低。月球模型分析将这一优势部分归因于该架构先分别处理每种模态,再整合其 token 的方式。
这正是此次发布背后的机制。任务专用模型必须学习从可用输入到单一目标的狭窄映射。
基础模型则先学习连接多种月球测量数据的结构。随后,当标签有限时,它可以复用这一结构,不过每项下游任务仍需验证。
开源并不等于可直接用于任务
该模型可以建议科学家应调查哪些区域,但无法认证宇航员将在月表遇到什么。
这种区别在冰相关基准测试中最为清晰。该系统并不直接检测已测得的水冰沉积。
它预测的是一张基于知识的远景预测图,依据多个环境指标估算冰更可能存在的位置。因此,其输出是对潜力的建模,而非确认。
地图上的高亮预测不应在缺少额外证据的情况下成为钻探目标。研究人员仍需要轨道测量、物理模型、不确定性分析,以及最终的地表观测。
公开文档明确指出,该系统尚未经过着陆点认证或危险物清除验证。这一警告限制了读者应如何解读有关更安全着陆的说法。
陨石坑检测有助于识别值得审查的特征,但它本身无法判定某个地点是否满足着陆器、月球车、栖息地或载人任务的工程要求。
该模型还缺少大地测量参考框架,即将测量数据与权威位置和高程相连接的体系。它可以复现局部地形结构,同时却给出错误的绝对数值。
根据模型卡,生成的坐标可能偏移数十度。生成的高程可能保留形状,但其绝对偏移量会发生变化。
这些限制尤其重要,因为该架构支持多模态生成。生成字段能够揭示模型学到的关系,但并不是经过校准的科学预测。
开发者将这些输出描述为定性探针。它们不能替代仪器、立体摄影测量或成熟的大地测量方法。
基准测试范围也带来另一重不确定性。IBM 和 NASA 在受控的训练和数据划分条件下,对系统进行了四项 SomBench 任务评估。
这些测试在保持数据加载器、增强方法、损失函数和指标不变的情况下比较模型骨干网络。这一设计有助于隔离表征质量,但无法重现实际任务环境。
冰相关结果颇具前景,但它衡量的是与现有远景预测目标的一致性,并未证明该模型发现了科学家遗漏的、已验证的冰沉积。
米级陨石坑结果同样显示出广泛预训练的局限。在所比较的系统中,性能整体仍然较低,而 NASA 模型仅与领先基线持平。
该基准中的部分图像采用了较粗的有效分辨率进行标注。文档指出,该模型需要适配编码器,而不是完全冻结骨干网络。
不规则月海斑块的差距同样处于实验波动范围内。IBM 的公开材料称,绘制范围提升了 3%,但详细结果建议将领先系统视为性能相当。
这并未否定基础模型策略。它说明基准测试标题需要结合背景理解。
独立复现将至关重要。外部团队应测试不同的地理划分、仪器、标签,以及并非由模型开发者选定的任务。
他们还应检查错误是否集中在特定区域。极地阴影、不完整覆盖、特殊地质情况和仪器伪影都可能造成平均分数掩盖的失败。
开放获取使这种审查成为可能。Apache 2.0 许可证允许研究人员检查权重、开展消融实验,并发布竞争性结果。
然而,仅有访问权限并不保证采用。团队仍需要技术专长、合适的算力、精心准备的月球数据,以及理解这些测量数据的领域专家。
该模型目前的分发页面未列出托管推理服务提供商。用户必须自行搭建软件环境并运行系统。
这使得此次开源发布具有意义,但并非毫不费力。首个严肃考验将是独立的行星科学家能否在没有 IBM 或 NASA 直接支持的情况下复现这些结果。
NASA 的共享模型策略正在向任务专用工具施压
核心竞争并非 NASA 与另一家航天机构之间的较量,而是可复用的科学基础模型与孤立、任务专用流水线之间的竞争。
任务专用系统依然具有明确优势。专注的团队可以围绕一个定义清晰的科学问题,优化架构、标签集和损失函数。
这类系统可能更易于审计,因为每项输入和目标都对应一个更狭窄的问题。当项目拥有丰富且高质量的标签时,它们也可能优于通用模型。
NASA IBM Lunar Foundation Model 提供了另一种优势。一个预训练骨干网络可凭借近 200 万个月球样本中获得的知识,为多个项目提供起点。
这在标签稀缺时尤为重要。科学家可能拥有大量原始观测档案,但针对某一特定地质特征完成标注的集合却很小。
广角陨石坑测试为这种压力提供了最有力的证据。使用一半任务专用训练数据时,该预训练模型达到了或超过了使用完整数据集训练的领先基线。
如果独立团队复现这种效率,项目经济性将发生变化。研究人员可以减少构建大型标注集合的时间,将更多精力用于完善科学问题。
该模型还支持传统堆叠输入系统可能难以处理的组合。每种科学模态都会先获得自己的 tokenizer,然后模型再整合其表征。
这种方法保留了可见光影像、地形、雷达、重力和热数据之间的差异。当某种仪器仅覆盖部分月球区域时,它也为研究人员提供了灵活性。
NASA 更广泛的项目组合表明,这是一项战略,而非单次实验。其与 IBM 的合作已包含用于地球观测和天气研究的 Prithvi 模型,以及用于日球物理学的 Surya。
Prithvi 从地球卫星观测中学习。Surya 利用多年的太阳观测数据,支持对喷发和空间天气的研究。
NASA 在其科学 AI 项目组合中将这些项目列在一起。其模式一致:整理大型科学档案,预训练可复用模型,并公开发布成果。
月球系统将这一理念延伸至行星科学。它也在测试一种从地球观测改造而来的架构,能否迁移到拥有不同光照、地质、大气和运行限制的地表。
这一方法要求任务专用开发者说明,为何要从通用图像权重反复开始训练。一个在日常照片上预训练的模型,并不直接熟悉月球光照和传感器物理特性。
不过,这场竞争并不要求一种方法淘汰另一种。基础模型仍需要专用头部、标签、目标函数和专家审查。
最可能的结果是一种分层工作流。共享模型生成表征或候选区域,而专注系统和物理方法则检验最重要的结论。
对开发者而言,这类似于从围绕空白模型构建每个应用,转向在开放的科学底座上构建。困难工作将转向数据质量、评估、不确定性和集成。
企业 AI 团队也应认识到同样的经验:只有当系统保留上下文并暴露其局限性时,整合异构数据才有价值。
可搜索的 AI 知识库在不同尺度上遵循相似原则。共享层应帮助用户关联证据,而不应假装每一项检索到的关系都已得到验证。
NASA 的模型使这一边界格外清晰。其输出可以引导注意力,但人类专家和物理测量仍保有权威。
开源发布后值得关注的事项
三个信号将表明该月球 AI 模型会成为共享的科学基础设施,还是仅停留在文档完善的研究演示阶段。
第一个信号是独立复现。大学、航天机构和行星科学团队需要重新运行已发布的基准测试,并测试新的地理区域。
复现将增强 IBM 和 NASA 关于月球预训练能够创造可迁移价值的主张。如果脱离原始设置后性能发生重大变化,这一主张将被削弱。
最具参考价值的测试将针对光照困难、传感器覆盖不完整,或地质条件不同于训练示例的区域。研究人员应报告区域性误差,而不仅是全局平均值。
他们还应在等效算力预算下比较 LoRA 适配、完整微调和冻结编码器。这将澄清可复用模型是否降低了实际成本,而不仅仅是降低了标签需求。
第二个信号是来自新科学工作的证据。应关注同行评审研究是否利用该模型识别此前未编目的陨石坑、完善火山地图,或为极地观测确定优先级。
有价值的结果不必证明每一项模型预测都正确。它应表明,该系统能引导研究人员发现经独立分析后仍然成立的成果。
冰勘探尤其值得严格审视。后续研究应区分:是与现有远景预测图的一致性有所提高,还是出现了有关实际水冰沉积的新证据。
任何与任务规划相关的应用都应包括明确的人类审查和仪器验证。NASA 自身文档排除了将当前系统视为运行性清除工具的做法。
第三个信号是扩展到四项已发布基准之外。新的任务、仪器或月球数据产品将检验该基础模型是否真正可复用。
成功意味着研究人员可以在不重建骨干网络的情况下增加模态或目标。失败则表明,该系统仍与 SomBench 及其最初的评估选择紧密绑定。
社区活跃度将提供早期指标。对代码库的贡献、可复用的微调方案、外部数据集和透明的失败报告,比原始下载量更重要。
NASA IBM Lunar Foundation Model 已经改变了月球机器学习的起点。研究人员现在可以检查一个共享模型、统一数据集和已记录的局限性,而不必从彼此割裂的档案开始。
下一个问题是,科学界能否将这种访问能力转化为可复现的发现。开发者应依次关注独立基准测试、已发表的月球研究成果,以及对新任务的适应能力。
如果这些信号出现,可复用的多模态模型将在行星科学中发挥更重要的作用。即便没有出现,此次发布仍将提供一份宝贵的数据集,并清晰警示人们:AI 辅助制图与可直接用于任务的知识之间,仍存在相当距离。



