NASA IBM 月球 AI 绘制月球冰分布图,但宇航员仍需实地验证
NASA 和 IBM 发布了一款开源月球 AI 模型,该模型基于约 200 万个图像切片训练而成,但轨道数据所能揭示的信息仍存在重大缺口。这款 NASA IBM 月球 AI 可以估算极地冰可能稳定存在的位置、绘制陨石坑地图,并识别异常的火山特征。它无法确认某个预测地点是否真的含有可获取的水资源。
这一区别界定了此次发布的真正意义。NASA 正以一个可复用模型取代零散、面向特定任务的分析方式,将多项月球任务的观测结果连接起来。宇航员和任务规划人员最终或可利用其地图来确定路线、着陆区域和科学目标的优先级。
该模型推出之际,NASA 正将长期探索重点放在月球南极。Apollo 计划证明了人类能够在月球上开展工作,但极地作业面临不同的问题。永久阴影、极端温度、陡峭地形以及不完整的资源地图,使每一次着陆或行进都更加复杂。
因此,NASA 与 IBM 构建的是一个研究平台,而不是自动化月球勘探设备。它的价值取决于科学家能否将广泛预训练转化为准确的局部预测,并随后通过直接测量验证这些预测。
NASA IBM 月球 AI 将数十年的观测整合为一个模型
最直接的变化是,月球科学家不再需要为每一个制图项目都从头开始构建完全独立的模型。
NASA 于 2026 年 9 月 10 日宣布推出 NASA-IBM Lunar Foundation Model。基础模型是一种先在广泛数据上进行预训练、再利用较小的标注数据集适配更具体任务的 AI 系统。该模型将这一方法应用于月球,而非语言或消费级图像。
根据这份月球模型发布说明,训练集合包含约 200 万个图像切片。其中超过 100 万张来自分辨率约为一米的高分辨率相机;近 96.4 万张则是分辨率约为 100 米的多光谱图像。
大部分材料来自 NASA 的 Lunar Reconnaissance Orbiter,即 LRO。该航天器已持续观测月球 17 年,产生的数据量超过 NASA 所有其他行星任务的总和。其覆盖范围为训练通用月球模型提供了异常广泛的基础。
数据集也不局限于普通照片。它纳入了 NASA GRAIL 和 Lunar Prospector 任务的影像与地形信息。来自日本 Selenological and Engineering Explorer、通常称为 SELENE 或 Kaguya 的数据,则增加了另一项观测来源。
这些仪器并非以相同方式观测月球。相机记录可见的表面细节,光谱仪则测量材料与不同波长之间的相互作用。测高数据描述地形高度,而重力测量则揭示与地下结构相关的变化。
由于这些数据的尺度、观测角度和覆盖范围各不相同,将它们整合起来并不容易。一项观测或许能够分辨一块巨石,另一项则可能代表数公里宽的区域。不同过境期间的光照,也会显著改变同一地形的外观。
IBM 将该模型称为多模态模型,因为它从多种形式的科学数据中学习。它采用 TerraMind 架构的一个版本,该架构此前由 IBM 与 European Space Agency 共同开发,用于地球观测。该架构学习对齐数据层之间的关系,而不是将每一种仪器视为孤立的数据源。
这种共享表征支持三项初始应用。科学家可以微调模型,以检测陨石坑、分割不规则月海斑块,并估计极地冰的远景潜力。冰远景潜力是对环境条件是否有利于冰保存的预测,而不是对冰浓度的直接测量。
陨石坑检测的意义不止于导航。科学家利用陨石坑数量估计月球表面的相对年龄。将部分工作自动化,可以帮助研究人员分析更大范围,同时将人工注意力保留给解读和存在争议的案例。
不规则月海斑块是小型火山地貌,其年龄似乎比科学家曾经预期的更年轻。绘制更多此类地貌,可能有助于完善月球火山活动史和热演化时间线。其形态也为测试模型能否识别罕见地质现象提供了有用案例。
第三项任务与人类探索的联系最为直接。极地冰或可用于提供饮用水、制氧和燃料制造。更好的远景潜力地图可以告诉任务团队应优先调查哪些区域,在昂贵的地表作业开始前缩小搜索范围。
NASA 表示,该系统在评估任务中达到了或超过了强基线模型的表现。它在陨石坑和火山特征制图方面表现相当,而在估计冰稳定性方面显示出更明显的优势。不过,NASA 并未将此次发布描述为发现了一处新的冰沉积证据。
该模型及其微调工具现已公开可用。研究人员可以检查开源模型代码、下载权重,并复现下游实验。该代码库包含用于陨石坑检测、火山特征分割和冰远景潜力研究的配置。
该代码库中已经可以看到一项限制。公开版本包含微调和推理代码,但不包含完整的预训练代码。外部团队可以测试和适配已发布的系统,但若要重建原始训练过程,可能仍需要额外文档。
此次发布仍改变了月球机器学习的起点。研究人员无需从头组装每一套数据集和训练流程,而是获得了一个通用骨干模型。关键问题在于,这种便利能否经受月球最严苛观测条件的考验。
为什么月球冰已成为任务规划问题
冰之所以有价值,是因为它可能减少人员必须从地球携带的物资,但轨道证据尚不足以界定可利用的资源。
月球曾一度被视为几乎完全干燥。Apollo 样本最初强化了这一观点,尽管后续分析发现火山玻璃中封存着氢。轨道任务随后在极地附近发现了更有力的水和氢证据。
永久阴影区域是现代搜寻工作的核心。这些区域是无法接受直射阳光的陨石坑底部和凹地。其温度可长期维持在足以捕获挥发性化合物的低水平,时间可达数百万乃至数十亿年。
NASA 的月球水资源历史梳理了几个重要步骤。Lunar Prospector 于 1998 年在永久阴影区域附近发现了高浓度氢。2009 年的 LCROSS 撞击暴露出水冰颗粒,随后对 Chandrayaan-1 数据的分析则绘制出了已确认的表面冰分布图。
这些发现证明月球水确实存在,却没有回答探险任务面临的操作性问题。任务规划人员需要知道冰的储量、埋藏深度、其在短距离内的变化情况,以及设备能否安全抵达。
这种差异类似于区域矿产调查与实际矿山之间的差距。遥感能够识别有前景的条件,但仅凭遥感无法确定矿床的品位、深度、物理形态或开采成本。
远景潜力模型通过整合多种信号来缩小这一差距。温度、光照、地形、氢测量和表面成分都可以提供证据。NASA IBM 月球 AI 从这些相互对齐的观测中学习模式,并估计稳定冰更可能存在的位置。
这项任务的风险格外高,因为南极本身也很难开展作业。太阳始终贴近地平线,形成漫长阴影和强烈眩光。一条山脊可能获得有用的光照,而附近的陨石坑却仍然黑暗且极度寒冷。
陡坡、岩石、松散风化层和不确定的能见度,都可能让一条短路线变成严重风险。通信也可能取决于当地地形。一个具有科学价值的冷阱,并不自动意味着它是宇航员或机器人可行的目的地。
资源潜力又增加了一层压力。水可直接支持人员生存,而电解可以将其分解为氢和氧。这些元素可用于可呼吸空气、能源系统或推进剂生产。
然而,每一种用途都需要基础设施。任务必须挖掘材料、将冰与风化层分离、进行净化、储存并运输。设备必须在磨蚀性粉尘和严酷热环境中运行,且不能造成比所替代的外运资源更大的风险。
这正是为什么在任何人开始开采之前,更好的地图就已具有价值。着陆系统、巡视车、钻机、通信中继和供电设备都需要作出布设决策。将硬件送往错误的陨石坑,可能浪费宝贵的任务时间和载荷能力。
该模型也在多年积累的月球观测之后推出。仅 LRO 就已形成广泛记录,但数据量已变得难以人工分析。NASA 的 Kevin Murphy 直接概括了这一问题:收集科学数据只是工作的一部分。
IBM 研究员 Juan Bernabé-Moreno 将该模型描述为一种在旅行者抵达之前理解地貌的方法。如果将输出视作指南,这一比喻是成立的;若将预测的冰区误认为经过验证的补给站,它就会产生误导。
近期科学研究同时凸显了机遇与不确定性。2024 年的一项 LRO 分析发现,永久阴影区域中存在冰的证据,范围至少延伸至南纬 77 度。极地冰研究也承认,轨道观测无法准确确定沉积物总体积。
同一研究无法确定部分冰层是否被干燥风化层覆盖。这种不确定性会影响挖掘深度、能源需求和设备设计。某个地点在轨道模型中可能看起来很有吸引力,但在地面上仍可能无法实际利用。
因此,NASA 面临来自两个方向的压力。其探索计划需要在地表任务发射前作出更好的决策;其科学家也必须防止预测地图获得超出原始数据所能支撑的确定性。
NASA IBM 月球 AI 如何连接不兼容的月球数据
该模型的核心优势来自跨仪器的共享预训练,而非用 AI 预测取代科学测量。
传统月球分析通常从一个范围明确的目标开始。研究人员收集合适的观测数据、标注样本、选择架构,并训练专用模型。这种方法可以有效运行,但为每一种特征重复这一流程会消耗时间和计算资源。
基础模型将大量这类工作转移至预训练阶段。系统首先从大规模未标注集合中学习反复出现的空间和光谱模式。研究人员随后可以利用一组较小、经过精心标注的样本,将其微调用于特定任务。
这种结构对行星科学很重要,因为标注成本高昂。一位经验丰富的研究人员可能需要检查图像、比对仪器读数,并判断陨石坑边界从何处开始。标注可能的冰区还涉及更多假设,因为目标往往隐藏在地表之下。
NASA 和 IBM 的月球 AI 将观测结果转化为称为 token 的更小内部表示。每个 token 都编码了输入某一部分的模式。模型学习这些 token 在不同位置、尺度和传感模式之间的关系。
多模态训练为模型提供了单张图像无法提供的上下文证据。照片中的暗斑可能代表阴影,而非不同的物质。热学、地形和光谱数据可以帮助区分这些可能性。
这在两极地区尤其有用,因为那里的光照会造成严重的视觉歧义。月球几乎没有大气来散射光线,因此会形成明亮高光和深邃阴影。光照变化可能使小型陨石坑在不同图像中看似出现、消失或改变形状。
NASA 通过爱因斯坦陨石坑附近的图像展示了这一挑战。该模型经过微调,用于比较火箭体撞击前后的场景。尽管撞击后的图像未被纳入预训练,它仍检测到了新形成的陨石坑。
这项实验表明,通用模型可以支持变化检测。但它也暴露出一项局限。NASA 指出,不同的光照条件可能改变较小陨石坑的可见性,从而制造与撞击无关的表观变化。
冰资源潜力带来了更困难的推断问题。陨石坑是可见的表面结构,但冰可能埋藏在干燥物质之下。该模型学习的是环境条件与参考地图之间的关系,而不是直接观测每一处冰沉积。
NASA 将其冰资源输出与 ConvNeXt 模型进行了比较,后者是一种作为基准使用的现代图像识别架构。该月球基础模型保留了参考潜力地图中更多细粒度模式。这一结果表明,多模态预训练将有用信息带入了这项专门任务。
不过,参考地图并非完美的真实标注。它反映了测量结果、物理模型、分辨率限制和科学判断。模型可能准确复现其模式,同时也继承其中的不确定性。
因此,其优势应被描述为更好的优先级排序。科学家可以识别出值得进行详细模拟、新的轨道观测或地表调查的区域。但仅凭神经网络给出高分,仍不能跳过这些后续阶段。
该系统在三项任务中的复用性,也比任何单一排行榜结果更具意义。陨石坑检测、火山地貌绘图和冰资源潜力评估需要不同类型的输出。相近的表现说明,一个预训练表示可以支持月球科学的多个分支。
这种效率可能扩大参与范围。一支大学团队或许没有资源去统一处理数百万张月球图像,或预训练一个大型模型。开放权重和基准数据集让这类团队可以从微调、评估或科学解读入手。
NASA 和 IBM 已在其他领域采用这一策略。它们的 Prithvi 模型面向地球观测,包括洪水、火灾、农作物和天气。它们的 Surya 模型则分析太阳观测数据,以研究可能影响卫星和电力系统的事件。
此次月球发布将这一产品组合扩展至行星科学。这表明 NASA 希望围绕主要观测领域构建可复用的科学模型。长期要应对的并非另一家 AI 公司,而是围绕彼此割裂的仪器和单一用途算法建立起来的碎片化工作流。
开放获取增强了这一挑战。独立团队可以测试替代训练方案、检查区域性失效情况,或将该模型与更简单的方法进行比较。它们还可以针对 NASA 未优先考虑的研究问题进行微调。
不过,开放也存在现实限制。大型数据集、专用格式和可观的算力需求,可能让较小团队望而却步。发布权重消除了一个障碍,但并不会让专家评估或月球数据工程变得轻而易举。
公共代码库还警告用户,预训练代码并未提供。这不会阻碍常规推理或微调,但会限制模型创建过程的完全可复现性;当研究人员研究偏差、表示选择或训练敏感性时,这一点很重要。
下一项技术考验并不是该模型能否生成吸引人的地图,而是 NASA 和 IBM 以外的团队能否复现其报告的下游性能。强有力的独立结果将表明,这一发布是科学基础设施,而非一次演示。
冰资源潜力地图并不等于发现冰
主要风险在于虚假的精确性,因为细致的预测可能看起来比其底层测量数据更确定。
“寻找冰”这一说法将多个科学步骤压缩成了两个字。该模型估计的是冰可能保持稳定的位置,以及多项观测与已知指标相似的位置。它不会钻入月壤、识别冰沉积的物理形态,或测量可开采的体积。
这一差异对新闻报道和任务规划都很重要。一张色彩编码地图可能暗示有希望和无希望的地面之间存在清晰边界。真实的月球沉积物可能在数米范围内变化,埋在干燥层之下,或以混杂在月壤中的微小颗粒形式存在。
模型也可能学习到在其训练分布之外失效的相关性。极区包含罕见的光照、温度和地形组合。一个主要基于更广泛月球覆盖范围训练的系统,在影响任务行动前,可能需要进行谨慎的本地验证。
空间分辨率带来了另一种不确定性来源。部分训练图像以每像素一米的分辨率呈现特征。其他图层的分辨率接近 100 米,而重力观测可代表更大范围的区域。
对齐这些图层并不会创造缺失的细节。模型可以根据已学习的关系推断可能的细粒度结构,但推断并不是测量。科学家必须区分真实分辨率与统计生成的细化结果。
基准设计也值得类似审视。性能取决于训练、验证和测试区域如何划分。相邻的月球图块可能共享地质条件、光照或传感器伪影,使表面上独立的样本比预期更相似。
公开技术材料让研究人员能够调查这些问题。独立团队可以测试地理上分离的区域、异常光照条件以及后续任务的数据。它们还可以将结果与专门的物理模型和更简单的统计基准进行比较。
另一项风险涉及标签。陨石坑目录存在遗漏和分歧,尤其是对于小型特征。形态不规则的月海斑块并不常见,且边界可能模糊。冰资源潜力标签依赖科学模型,而非对每一个地点进行直接采样。
基础模型可能减少某些误差,同时大规模复现其他误差。如果标签遗漏了一类小型陨石坑,模型就可能学习这种遗漏。如果参考冰图嵌入了不确定的假设,预测可能以更丰富的视觉细节重复这些假设。
正确的回应不是拒绝 AI 制图。人工解读同样存在不一致性,而且难以轻松扩展到数百万次观测。更稳健的方法是结合机器筛选、物理模型、专家审查和新的测量数据。
对于资源而言,直接探测仍是决定性步骤。着陆器或探测车可以测量当地氢含量、分析挥发性化合物、检查地下层,并测试机械性质。这些观测可以确认或否定轨道模型的优先级判断。
地表数据随后可改进模型的后续版本。每个经过验证的地点都会成为更强的微调和评估标签。失效案例同样有价值,因为它们揭示了轨道相关性在哪些地方失效。
任务规划人员还必须将风险评估与资源潜力分开进行。一处陨石坑底部可能因稳定冰而获得高排名,却仍可能因坡度、黑暗、温度或通信条件而难以抵达。最佳目标需要平衡科学价值、资源、安全、电力和机动性。
该模型最终可以为这一更广泛的决策系统作出贡献。地形分割可以识别风险,陨石坑地图可以支持路线规划,热学图层可以约束设备暴露条件。然而,NASA 目前展示的是相互独立的科学任务,而非一款经过认证的导航产品。
这一点也限制了关于宇航员的标题式承诺。机组人员不会只是打开一张 AI 地图,然后步行前往水源。任务团队会将模型输出与工程约束、轨道更新、机器人侦察及可接受风险规则结合起来。
因此,NASA 和 IBM 的月球 AI 更接近一种可复用的勘测工具,而非自主向导。它组织证据并对地点进行排序。人类专家仍负责解读不确定性,并决定后续行动。
这种审慎的表述保护了模型真正的贡献。科学工具不必在发布当天就带来戏剧性的发现。降低形成和检验更好假设的成本,可以在许多任务中创造价值。
它也让预期与月球现实保持一致。水冰不仅仅是一种被检测到的分子。出于探索目的,它必须以有用的浓度存在于可抵达的地形中,并具备可回收的物理形态。
NASA 的开放做法为批评者提供了检验这些假设的路径。研究人员可以检查代码、评估权重,并发布失败案例。这一过程将比对全面月球模型的宣传性描述更重要。
在宇航员依赖月球 AI 前应关注什么
三个信号将决定这一模型能否成为持久的科学基础设施:独立复现、新的真实标注,以及业务整合。
第一个信号是独立复现基准结果。研究团队应在已发布的数据集上运行公开的权重和微调工具。它们还应测试与原始评估不同的区域、光照条件和仪器。
复现将强化这样一种主张:一个月球基础模型可以支持多项任务。无法匹配 NASA 和 IBM 的结果,并不意味着这一发布毫无用处。它会揭示缺失的依赖项、文档缺口,或对特定训练选择的敏感性。
测试不应只报告平均准确率。科学家需要区域误差图、不确定性估计,以及不同特征尺寸下的表现。一个能处理大型陨石坑却漏掉较小风险的模型,在宽泛的聚合评分下仍可能显得很强。
第二个信号是与新测量数据进行比较。未来的轨道器、着陆器和机器人仪器可以提供预训练中未包含的观测。这些数据集构成了更干净的测试,因为模型不可能记住它们的确切模式。
冰预测需要最严格形式的验证。团队应将高潜力区域与氢、温度、成分和地下结构的直接测量进行比较。低潜力区域也需要采样,以衡量假阴性率。
即使不能完美估计沉积物,只要模型能持续将高产地点排在低产地点之前,便可帮助任务规划。如果预测在本地采样中失效,科学家就必须修订数据对齐、标签或物理假设。
第三个信号是与实际规划工具的集成。NASA 及其合作伙伴必须展示预测结果如何与坡度图、光照窗口、通信覆盖范围、电力预算和巡视器能力相互配合。
孤立的冰层无法决定着陆区。运行软件需要在整合相互竞争的约束条件时保留不确定性。工程师还必须了解模型何时超出其已验证的适用条件。
如果输出结果从研究走向载人安全,认证标准将变得重要。科学探索可以容忍实验性工具和不确定的假设。导航和着陆决策则需要有记录的限制条件、版本控制、可追溯性和后备程序。
开放式开发能够支持这一转变。外部研究人员可以在投入运行前发现边缘案例。任务团队可以比较不同模型版本,并保留每项建议背后的证据。
该模型还可能影响 NASA 未来仪器的设计方式。如果现有数据持续存在盲区,这些缺口可以指导传感器选择。一项新任务或许会优先考虑热分辨率、阴影成像或地下测量,尤其是在预测结果仍不稳定的区域。
这一反馈循环正是 NASA IBM lunar AI 背后更大的机遇。该模型不只是处理旧档案,还能揭示哪些新观测最能高效降低不确定性。
研究人员不应以生成地图的数量来衡量成功。更好的指标是,这些地图是否改善了科学决策。有价值的成果包括减少无效观测、加强着陆点比较,以及让地表实验的目标设定更加精准。
此次发布也为科学 AI 提供了更广泛的启示。基础模型可以连接数十年的观测数据,而不会把不确定性转化为确定性。它们最强大的作用是在于引导测量,而不是取代测量。
对宇航员而言,其实际前景仍颇具吸引力。更好的地图可以降低可避免的风险,并帮助机组人员将有限的地表时间投入到更有希望的地点。冰随后可能支持科学研究、生命支持系统以及未来的资源实验。
但月球将提供最终检验。只有在仪器勘测地形、科学家对结果进行核对之后,预测才会成为可操作的知识。在此之前,NASA 和 IBM 提供的是更好的搜索策略,而非已获确认的月球水源。
关注首批独立评估、首批与真正新观测数据的比较,以及首批引用模型输出结果的任务计划。这三项进展将表明,这一开放式月球 AI 会成为标准研究层,还是仍停留在一项雄心勃勃的实验。



