NASA-IBM 月球基础模型开源,但基准测试只是第一道考验
NASA 和 IBM 发布了 NASA-IBM 月球基础模型,该模型基于数十年来的月球观测数据训练,使用了约 200 万个图像切片。这一开源系统面向陨石坑制图、火山地貌分析,以及极地冰可能稳定存在区域的估算。其核心承诺很明确:研究人员可以从一个可复用模型出发,而不必为每个不同的月球问题单独构建系统。
这一承诺也构成了报道的主要张力。该模型在开发者进行的测试中,达到了或超过多项既有机器学习基线。不过,研究成果的发布并不等同于一张可用于宇航员着陆、资源定位或地表设备防护的作业地图。
因此,真正重要的较量并非 NASA 与其他航天机构之间,或 IBM 与其他科技公司之间的竞争,而是可复用的多模态基础模型与行星科学家已熟悉的任务专用工作流之间的比较。开放权重、公开数据集和可复现代码如今使外部研究人员能够检验哪种方法表现更好。
NASA-IBM 月球基础模型带来了什么改变
NASA 和 IBM 为多项月球科学任务发布了一个共享的技术起点,而不是一个能够自主理解月球的成品系统。
合作双方于 2026 年 9 月 10 日宣布推出这一开源模型。NASA 将其描述为首批专为月球科学打造的开源基础模型之一。基础模型是指先在广泛、主要未经标注的数据上进行预训练,再用规模较小的标注数据集适配到更具体任务的系统。
该模型可通过 Hugging Face 上的 月球模型合集 公开获取。该合集包含基础模型,以及针对陨石坑检测、火山地貌分割和冰资源潜力分析适配的版本。
NASA 还在 Apache 2.0 许可证下发布了配套的模型代码库。其中包含推理和微调软件包,以及三项重点研究任务的配置。该仓库未包含预训练代码,这对实现完整端到端可复现性而言是一个重要限制。
训练语料主要来自 NASA 的月球勘测轨道飞行器,即 LRO。该航天器自 2009 年以来一直研究月球,已采集覆盖月球大部分表面的影像和测量数据。
据 NASA 介绍,训练数据包含超过 100 万张高分辨率相机图像,分辨率约为 1 米。数据还包括近 96.4 万张多光谱图像,分辨率约为 100 米。
这些尺度服务于不同目的。米级影像能够揭示陨石坑边缘、岩石、坡度和相对较小的变化;较粗分辨率的多光谱图层则可捕捉普通照片中未必显现的、更广泛的物理或成分信号。
该项目还使用了 NASA GRAIL 任务、月球勘探者任务以及日本 SELENE 任务的数据。GRAIL 绘制了月球重力变化图,为科学家提供有关月球地壳和内部结构的信息。其他仪器则测量了高程、温度、反射率和化学性质。
IBM 表示,配套的机器学习数据集整合了来自四项任务、九台仪器的 30 多个图层。对齐至关重要,因为当每台仪器使用不同的网格、尺度或坐标惯例时,算法无法可靠地比较这些测量结果。
此次发布改变了能够试验这些整合观测数据的人群范围。大学实验室不再需要在测试月球制图想法前,独立汇集每一个输入图层。研究人员可以从已准备的数据集、预训练权重和有文档说明的下游任务开始。
这种便利不只是软件层面的好处。数据准备往往决定科学机器学习能否被另一支团队复现。发布通用数据框架,使这次发布成为其他研究人员能够检视、修改和质疑的基础设施。
不应将该模型与通用聊天机器人混为一谈。它不能以自然语言回答关于月球历史的任意问题。它处理遥感输入,并生成科学家可针对特定制图或预测形式进行适配的表征。
NASA 的月球 AI 概览将该系统定位为减少科学解读开始前所需工作的工具。因此,眼下的改变是工作流复用,而不是机器自主性。
为什么月球数据需要一个通用模型
最棘手的技术问题并不是月球观测数据不足,而是如何整合在不兼容尺度下、且受不断变化条件影响而产生的测量结果。
月球任务已产生数 PB 数据,但这些观测从未被创建为一个统一的机器学习数据集。每台仪器记录不同的物理属性,并采用各自的分辨率、几何关系、噪声特征和处理假设。
IBM 举了一个很有代表性的例子。GRAIL 以每像素约 20 千米的尺度绘制重力场,而 LRO 影像可分辨约 1 米尺度的特征。研究人员不能简单叠加这些图层,并期待获得有意义的逐像素比较。
光照让问题变得更复杂。月球几乎没有大气来散射阳光,因而形成强烈眩光和深重阴影。同一个陨石坑,在轨道器以不同照明角度拍摄时,外观可能截然不同。
极地区域的条件尤其困难。由于太阳始终贴近地平线,较高地形会投下长长的阴影。一些陨石坑内部永久处于阴影中,遮蔽了科学家希望用于研究冰和着陆风险的区域。
传统工作流通常会分别处理这些差异。一个模型可能利用高分辨率影像检测陨石坑;另一个模型则可能结合热学与地形信息估算冰的稳定性。每种工作流都需要自己的预处理规则、标注、架构和验证流程。
NASA-IBM 月球 AI 模型采取了不同路线。它基于 TerraMind 改造而来,后者是 IBM 与欧洲航天局开发的一种多模态地球观测架构。多模态意味着系统从多种测量类型中学习,而非只依赖单一图像流。
在预训练期间,该架构会遮蔽部分输入,并学习重建其潜在模式。这种掩码令牌方法鼓励模型识别不同测量结果之间的关系,包括出现在一种模态中、但在另一种模态中较弱或缺失的信号。
其结果是对月球地形形成一套共享的内部表征。研究团队可以针对更狭窄的任务微调这一表征,而不必从头训练完整的视觉系统。
在下游适配中,项目采用了低秩适配器,即通常所称的 LoRA。这些轻量组件仅调整模型的一小部分,同时保持大部分原始参数不变。IBM 表示,实验中冻结了基础模型 90% 的权重。
这一设计减少了每项新任务所需的算力和标注数据,也使此次发布对缺乏原始预训练所用基础设施的科研团队更具实用性。
这一机制很重要,因为月球标注数据稀缺。科学家可能拥有大量影像,但只有有限区域具备经过仔细验证的陨石坑边界、火山结构或冰相关参考数据。一个从有用通用表征出发的模型,可以从这些较小的标注集合中提取更多价值。
不过,共享表征也可能携带共享错误。如果对齐问题、观测偏差或光照伪影进入预训练,它们可能影响每一个下游模型。复用提升了效率,同时也集中放大了不完美基础所带来的后果。
这项取舍解释了为什么开放访问是此次公告的核心。研究人员需要能够检查输入、重复基准测试,并在开发者未重点强调的区域测试模型。
三类月球问题让模型接受检验
陨石坑检测、火山制图和极地冰估算,检验的是同一个基础模型能否同时支持科学解读与探索规划。
陨石坑制图是最直接的视觉任务。研究人员通过统计和测量撞击坑,估算月球表面的相对年龄。陨石坑形状也能够提供有关地质、撞击及早期观测之后发生变化的证据。
NASA 在爱因斯坦陨石坑附近的影像上演示了该模型,此前一枚废弃的 SpaceX 火箭箭体撞击月球。据该机构称,撞击后的图像未被纳入预训练。微调后,系统在识别附近此前已编录陨石坑的同时,也标出了新形成的陨石坑。
这一测试展示了变化检测的一种有用工作流。模型可以筛查庞大的影像档案以寻找差异,让科学家将注意力集中在最有希望的候选对象上。但这并不能证明每一处被标出的变化都是真实撞击。
据称,在米级分辨率下,NASA-IBM 月球基础模型生成的陨石坑结果可与强大的专用基线相媲美。在约 100 米的上下文分辨率下,IBM 表示,该模型在使用一半训练数据的情况下,性能比 SwinV2-B 模型高出近 19%。
SwinV2-B 是一种层级视觉 Transformer,即先分析局部视觉区域、再将其组合为更大模式的图像模型。它提供了可信的比较对象,但所报告的优势取决于选定的数据集、训练流程和评估指标。
第二项任务涉及不规则月海斑块,即 IMP。这些是纹理和形状看起来不同于周边平原的异常火山地貌。它们表观上的年轻性引发了有关月球火山活动何时结束的问题。
绘制 IMP 的完整范围,可帮助研究人员将其结构与附近地形进行比较。IBM 报告称,其模型在所选 SwinV2-B 基线上将分割性能提升了 3%,同时所需微调更少。
这一增幅不大,但并非没有意义。科学分割往往涉及有限且不完美的标注数据。若结合更低的适配成本,即便是小幅改进也足以值得进一步测试。
第三项任务,即极地冰资源潜力,与持续月球活动的关联最为直接。水冰可支持饮用水供应和氧气生产。氢和氧也可能有助于推进剂生产,尽管发现一个有前景的信号,并不意味着开采在技术或经济上可行。
该模型结合多种测量结果,估算冰可能在地表或地下保持稳定的位置。IBM 表示,与 SwinV2-B 相比,该模型将均方根误差最多降低了 22%。均方根误差衡量预测值与参考值之间差异的典型大小,分数越低表示吻合程度越高。
IBM 更广泛的发布说明称,在所评估的地理特征任务中,性能最高可提升 23%。读者应将这一数字视为开发方报告的基准结果,而非经独立确认的科学性能指标。
冰分布潜力也并不等同于直接探测到冰。它根据现有观测数据和参考地图,估计某些条件是否有利于冰的保存。即使某一区域得分较高,仍需通过其他仪器、模拟或地表测量进一步验证。
这一差异对任务规划至关重要。AI 生成的地图可以帮助确定目标优先级,但无法替代工程勘测或科学确认。着陆安全取决于地形、光照、通信、热环境、尘埃、导航以及飞行器限制等因素。
因此,近期最有价值的用途是初步筛选。该模型可以帮助识别值得进一步分析的位置或变化,从而减少专家需要人工检查的数据量。最终决策仍由科学家和任务团队作出。
可复用 AI 对专用月球工作流带来压力
NASA-IBM 的发布内容要求行星科学家在熟悉的专用流程与一个承诺可更快适应多类任务的通用模型之间作出选择。
专用系统依然具有重要优势。研究人员可以围绕一个物理问题、一种仪器以及一套经过严格控制的假设来设计它们。由于流程中隐藏的交互更少,其行为也可能更容易追溯。
通用基础模型提供的是另一种价值。其预训练成本只需支付一次,后续团队便可复用已学习到的表征。模型还能够连接跨仪器的信号,而单一用途的图像检测器可能会忽略这些信号。
任何一种路线都不会自动带来更好的科学成果。相关比较还应包括准确性、校准、计算需求、数据准备、可解释性,以及所需标注数据的数量。
NASA-IBM 的基准测试聚焦于这种比较的若干方面。据称,该模型在部分任务中与专用系统表现相当,在其他任务中超过它们,同时减少了所需的适配工作。这些结果支持继续研究,但并未终结这场讨论。
独立项目表明,NASA 和 IBM 并不是唯一追求通用月球表征的机构。另一个名为 LunarFM 的系统整合了来自三项任务、六种仪器的 18 个通道。其开发者发布了一个 768 维嵌入数据集,并展示了包括矿物测绘和地质分类在内的任务。
这项 LunarFM 研究反映出行星科学正更广泛地转向共享遥感模型。它也为研究人员提供了另一种架构、数据集设计和评估框架,以便与 NASA 和 IBM 的方法进行比较。
开放项目之间的竞争可以增强这一领域。团队可以在共同区域测试模型、复现结果、识别数据泄漏,并判断表面上的性能提升是否能经受光照或地理条件变化的考验。
这些替代方案也暴露出一个命名问题。“月球基础模型”描述的是一个技术类别,而非一个获得普遍认可的单一系统。读者应区分 NASA-IBM 官方模型与使用类似术语的其他项目。
NASA 和 IBM 已将基础模型策略应用于月球之外的领域。其 Prithvi 系列分析地球观测和天气数据。Surya 则面向日球物理观测,包括可能影响卫星、通信和电力基础设施的太阳活动。
这一不断扩展的产品组合显示出一种机构战略。NASA 希望通过可复用的 AI 组件,帮助研究人员处理庞大的科学档案。IBM 则获得了一个在传统语言和企业应用之外展示多模态模型能力的重要案例。
压力首先会落在维护孤立流程的团队身上。如果一个通用模型能够以更少的数据和计算资源达到相近的准确性,那么反复构建新的编码器就会变得更难以辩护。研究人员可以将更多精力投入验证、领域知识和结果解读。
不过,当任务依赖于非常规传感器或精确的物理约束时,专用方法仍将十分重要。广泛的表征可能遗漏经过精心设计的模型能够捕捉到的细节。一些科学问题还需要因果或基于物理规律的推理,而视觉模式识别无法提供这种能力。
最可能的结果并非完全替代。基础模型可以成为共享骨干,而任务和科学团队仍会围绕它们构建专门的验证层。开源发布让社区能够判断这种组合在何处有效。
这些基准测试仍需独立压力测试
最大的未知之处在于:报告中的性能提升,是否能在开发团队以外的数据集、数据划分和选定月球区域中保持可靠。
NASA 表示,该模型在所有评估任务中都达到了或超过了强基线模型。IBM 则针对极地冰、火山特征和陨石坑检测提供了更详细的比较。这两种说法都依赖于构建该系统的机构开展的工作。
这并不会否定这些结果。但这意味着首批基准测试应被视为支持一项研究假设的证据,而非最终结论。
该模型必须能够跨越对计算机视觉极具挑战性的条件实现泛化。月球外观会随光照角度、相机分辨率、轨道几何、传感器噪声和表面成分而变化。一个系统可能在某个精心整理的数据划分上表现良好,却在另一个区域失效。
NASA 在其陨石坑演示中承认了一个例子。不同轨道飞越时的光照条件可能改变较小陨石坑的可见度。自动化系统可能将这些外观变化解读为物理差异。
极地冰带来了另一种不确定性来源。科学家无法直接观测每一处疑似沉积物,尤其是在永久阴影区内部。因此,参考地图结合了测量数据和科学假设,而非提供简单的真实标签。
针对某一参考产品取得更低的预测误差,只能证明与该产品更一致。它并不能证明预测区域含有可获取的水冰。地表任务和额外的遥感观测仍然必不可少。
不规则月海斑块也带来相关的标注问题。其边界可能模糊不清,年龄仍存在争议。如果专家对正确轮廓存在分歧,分割得分便无法完全判定哪一个模型在科学上更有用。
可复现性同样值得谨慎表述。NASA 表示,完整代码库可供测试和实验。公开的 GitHub 仓库提供推理和微调软件,但其文档说明并未包含预训练代码。
研究人员可以下载模型权重、使用已发布的配置,并重复下游实验。但仅凭该仓库,他们尚无法重建原始模型训练的每一个阶段。
计算资源的可得性可能构成另一项实际障碍。使用适配器进行微调比从头训练基础模型负担更轻,但高分辨率月球数据仍需要存储、处理能力和技术专长。开放许可证并不会自动带来平等的使用条件。
模型置信度同样重要。研究工具应在输入偏离其训练分布,或多种解释仍然合理时给出提示。如果团队将预测地图视为权威,高置信度的错误尤其危险。
要实现运营层面的采用,仅有总体准确性还不够。科学家需要不确定性估计、地理误差分析、缺失数据说明,以及与既有物理模型的比较。任务规划人员则需要更严格的验证。
即使尚未达到运营标准,该模型仍可提供价值。它可以对候选区域排序、定位异常模式,并提示应将昂贵模拟或人工审查集中在哪些位置。这种角色让 AI 留在证据链之中,而不是置于其末端。
开源分发使这些压力测试成为可能。外部团队可以构建对抗性评估集、比较不同架构,并在无需等待私营供应商的情况下报告失败案例。因此,这次发布最重要的意义在于它邀请外界开展验证。
NASA-IBM 月球基础模型发布后应关注什么
三个信号将表明,这一开放模型究竟会成为持久的科学基础设施,还是仅停留在令人印象深刻的研究演示阶段。
第一个信号是独立的基准复现。学术和政府团队需要使用新的数据划分或地理上相互分离的测试区域,重新运行陨石坑、火山和冰相关实验。若性能提升得到复现,将加强其作为可复用月球骨干模型的论据。
测试不应只报告一个汇总分数。结果需要区分极地与赤道区域、明亮与阴影地形、不同仪器以及不同特征尺寸。这些细节将揭示模型在哪些场景下可靠,又在哪些场景下需要专业支持。
复现失败并不会让此次发布失去价值。它能够识别哪些假设无法迁移,并帮助研究人员设计更好的训练数据。模型的开放许可证允许这些反馈成为共享项目的一部分。
第二个信号是其在最初三项任务之外的采用情况。研究人员可以测试矿物丰度测绘、着陆危险筛查、地表变化检测或跨任务数据重建。每一次成功适配,都会支持这样一个核心主张:一种表征可以服务于多个科学问题。
采用程度应通过已发布的实验和持续维护的集成来衡量,而不应仅看下载量。一个模型可以吸引早期关注,却未必会成为长期研究工作流的一部分。
应关注贡献者是否增加经过测试的配置、问题报告、校准工具,或对额外传感器的支持。这些变化将表明该代码库正发展为社区基础设施。
第三个信号是与真实任务决策的连接。NASA 及其合作伙伴必须展示模型输出如何进入选址分析、仪器瞄准或未来观测的优先级安排。这并不要求允许 AI 作出最终决定。
一个可信的运营工作流应记录预测从何而来、不确定性如何表示,以及由哪些专家进行审查。它还应保留原始观测数据,以便团队能够质疑模型的结论。
NASA 的 Artemis 计划提供了一个显而易见的应用背景,但该机构尚未将此次发布描述为自主任务控制软件。该模型目前应属于科学准备层,在此处它可以降低搜索成本并呈现候选模式。
这一边界应保持明确。一张冰分布潜力地图可以提示应在哪里展开调查,但不能保证存在可获取的水。一套陨石坑检测器可以加速编目,但未经工程分析,无法认证某处为着陆地点。
对开发者而言,此次发布提供了一个将多模态 AI 应用于科学数据、而非文本生成的具体案例。最有价值的启示并不是某一种架构能够解决行星探索问题,而是经过整理的数据、可复用的表征和开放评估可以改变专业研究的经济模式。
对知识工作者而言,该项目也说明了:AI 系统要得出有价值的结论,首先必须妥善组织源材料。同样的原则也适用于个人知识库:可靠的检索始于结构化、可追溯的输入。
对科学家来说,下一步是直接开展实验。下载权重,查阅数据文档,将预测结果与熟悉的区域进行对比,并将失败案例与成功结果一同公开。
NASA-IBM Lunar Foundation Model 降低了测试面向月球的通用 AI 基础模型的门槛。它能否赢得科学家的信任,将取决于独立研究结果、更广泛的任务采用,以及在真实研究决策中的透明使用。这些信号中哪一个会最先出现,将决定该模型是成为共享的月球制图基础层,还是仅仅成为该领域最新一个前景可期的原型。



