top of page

NASA-IBM Lunar Foundation Model、月面マッピングを開放するがミッション管制までは担わない

2 日前
読了時間: 20分

IBMとNASAは、空間スケールが大きく異なる約200万枚の月面画像タイルで学習させたNASA-IBM Lunar Foundation Modelを公開した。このオープンソースのシステムは、クレーターの地図化、火山地形の研究、極域で氷が安定して存在し得る場所の推定に向け、研究者に共通の出発点を提供する。

この公開により、科学者は別々の観測機器から得られた数十年分の観測データに対する取り組み方を変えられる。研究課題ごとに特化モデルをゼロから構築する代わりに、チームは月の事前学習済み表現を1つ適応させられるようになる。モデルと学習用リソースは公開されており、NASAやIBM以外の機関にとっても参入障壁を下げている。

このオープン性には中心的な緊張関係がある。再利用可能な基盤モデルは、断片化された観測を整理し、科学的に興味深い地点の探索を絞り込める。しかし、着陸地点を認証したり、氷の存在を確認したり、校正済みの観測機器に取って代わったりすることはできない。したがって本当の競争は、IBMと他のAIベンダーとの対決ではない。再利用可能なオープンモデリングと、用途に特化し運用面で検証された解析との競争である。

NASA-IBM Lunar Foundation Modelがアーカイブをインフラへ変える

この公開は、大量の月面観測データを再利用可能な研究レイヤーへと転換するものであり、完成済みの航法システムではない。

NASAは2026年9月10日、IBM Researchおよび複数の学術機関との広範な協力の一環として、このモデルを発表した。NASAはこれを、月科学のために特化して開発された最初期のオープンソースAIモデルの一つと説明している。重みはHugging Faceでホストされ、関連コードはGitHubで公開されている。

公式発表によると、このシステムは主にLunar Reconnaissance Orbiter(LRO)の観測データで学習された。このミッションは17年間にわたり、月に関する詳細な情報を収集してきた。NASAによれば、その出力データ量は、同機関の他のすべての惑星探査ミッションを合わせたデータ量を上回る。

学習には、1ピクセル当たり約1メートルの解像度を持つ高解像度カメラ画像100万枚超が用いられた。また、1ピクセル当たり約100メートルの解像度を持つマルチスペクトル画像も約96万4,000枚含まれている。これらのデータにより、モデルは局所的な地表の詳細と、より広域の地域パターンの双方に接することができる。

追加の入力には、NASAのGRAILおよびLunar Prospectorミッション、日本のSELENEミッションのデータが含まれる。統合されたデータは、画像、地形、重力、温度、鉱物、レーダー、照明、水素関連の情報を網羅する。観測機器によってカバー範囲は異なるため、すべての地点にすべての測定値があるわけではない。

このシステムは基盤モデルであり、より限定的なタスクに適応させる前に幅広い表現を学習する。クレーター検出や特定の地質学的特徴のセグメンテーションだけを目的に構築された従来型パイプラインとは異なる。研究者は、より小規模なラベル付きデータセットを使って共通バックボーンをファインチューニングできる。

NASAは当初、3つの用途を強調している。1つ目は、未カタログ化の小規模クレーターを含むクレーターの識別と測定。2つ目は、月の熱的な歴史を明らかにする可能性がある特異な火山地形「不規則な海パッチ」の地図化。3つ目は、極域における氷の存在可能性の推定である。

氷の存在可能性は、安定した氷に関連する条件についての予測であり、水の直接測定ではない。この区別は重要だ。利用可能な月の水は、飲料水、酸素生産、推進剤の供給を支え得る。有用な地図はさらなる調査の優先順位付けに役立つが、それ単体で資源の利用可能性を確立することはできない。

このモデルは、ビフォーアフター試験でEinstein crater近傍に新たに形成されたクレーターも検出した。研究者は事前学習から衝突後の画像を除外したうえで、地表変化を認識するようシステムを適応させた。NASAは、観測間の照明条件の違いが小規模クレーターの視認性に依然として影響し得るとしている。

この公開が重要なのは、モデルの重み以上のものを提供しているためだ。IBMとNASAは、機械学習に対応したデータセット、ベンチマークコレクション、コード、技術文書も公開した。この組み合わせにより、独立したチームは、データパイプライン全体を再構築することなく、テストを再現し、制約を検証し、新たな月面向けアプリケーションを開発できる。

重要な変化は、共通の基盤へのアクセスにある。従来、研究チームはデータ製品の特定、座標の整合、解像度の調整、タスク固有の入力の準備に大きな労力を費やす必要があった。オープンソースの月面AI公開は、こうした高コストな準備の一部を共有インフラへ移す。

月データに必要なのは、より良い画像だけではない理由

月は広範に観測されているが、センサーが根本的に異なるスケールで別々の現象を測定するため、データを組み合わせることは依然として難しい。

カメラ画像は月面地形を捉える一つの見方にすぎない。科学者には、高度、傾斜、温度、レーダー応答、表面組成、重力、照明、あるいはモデル化された氷の安定性も必要になる場合がある。それぞれの測定は異なる問いに答え、それぞれ固有の解像度、カバー範囲、不確実性を伴う。

スケールの差は特に大きい。LROのNarrow Angle Cameraは、1ピクセル当たり約1メートルの解像度で地形を捉えられる。一部の重力観測は、1ピクセル当たり数キロメートル規模の構造を記述する。これらの情報源を組み合わせることは、通常の写真を何枚か重ねることとは同じではない。

照明も別の問題を生む。太陽光を散乱する大気がほとんどないため、月面地形では強い反射と深い影が生じる。クレーターの縁は、観測および照明の幾何条件が変わると、劇的に異なって見えることがある。こうした条件を無視するアルゴリズムは、光の変化を地形の変化と誤認する可能性がある。

このモデルは、取得時の幾何条件を明示的なコンテキストとして与えることで、この問題に対処する。入力には、タイル座標と地上サンプリング距離に加え、太陽入射角、放出角、位相角、方位角の情報が含まれる。システムは、可視ピクセルだけからすべての照明条件を推論する必要がない。

その設計では、月面観測を別個のモダリティとしても扱う。モダリティとは、反射率、地形、重力のような、特定の測定形式を指す。モダリティ固有のトークン化により、システムがそれらの関係を学習する前に、こうした違いが維持される。

公開されたモデルカードによると、事前学習は11のモダリティと2つの空間スケールを対象とした。データセットには、広角バンドル963,609件と狭角バンドル1,000,113件が含まれている。各バンドルは、同じ領域に整列された測定値をまとめたものだ。

この2つのデータ群には、100倍の解像度差がある。完全に別々のバックボーンを学習させるのではなく、このプロジェクトでは、1組の重みを更新する混合解像度プロセスを採用した。異なる画像パッチサイズにvision transformerを適応させる手法であるFlexiViT patch embeddingは、バックボーンを再学習することなく後続のファインチューニングを支援する。

アーキテクチャはViT-Bエンコーダーとデコーダーに基づく。vision transformer(ViT)は、画像をパッチに分割し、そのパッチ間の関係を学習する。公開された構成では、12のattention headを持つ12層のエンコーダーと、それに対応する12層のデコーダーを使用している。

事前学習には、H100グラフィックスプロセッサ16基、150,000回の最適化ステップ、約1,100 GPU時間が必要だった。これらの数値は、共有モデルが価値を持ち得る理由を示す。個々の科学チームは、計算集約的な学習プロセス全体を繰り返す代わりに、公開されたチェックポイントから始められる。

IBMとNASAは、IBMと欧州宇宙機関が開発した地球観測モデルTerraMindで使われたマスクトークン手法を適応させた。学習中、システムは周囲のマルチモーダルなコンテキストから選択された情報を再構成することを学ぶ。これにより、単一の分類対象を記憶するのではなく、観測間の関係を捉えることが促される。

この仕組みは、測定値が疎である、ノイズを含む、あるいは一部の地域でしか利用できない場合に有用だ。複数のデータソースが有望な領域を総合的に示しているかどうかを、研究者が検証する助けとなり得る。ただし、観測機器が取得していない場所に、権威ある測定値を生み出すものではない。

したがってNASA-IBM Lunar Foundation Modelは、特定の科学課題に取り組む前に、統合の問題に取り組んでいる。その主要な資産は、観測機器をまたぐ共通表現にある。クレーター検出、火山地形の地図化、氷の存在可能性は、その表現をどのように適応できるかを示す実例である。

この区別は、この公開を現実的なものに保つ。このシステムは宇宙飛行士向けのチャットボットでも、自律走行するローバーの操縦士でも、月のデジタルレプリカでもない。準備済みの月面データセットから研究者がパターンを抽出するのを支援するために設計された、リモートセンシングのバックボーンである。

オープンソース月面AIがタスク特化型モデルに挑む

IBMとNASAは、適応可能な単一の月面表現によって、特化タスクの性能を犠牲にせず反復作業を減らせると見込んでいる。

従来の科学的機械学習は、多くの場合、明確に定義された目標から始まる。研究者はラベル付きの事例を集め、アーキテクチャを選び、その特定の目標に向けてモデルを学習させる。この方法で構築されたクレーター検出器は高い性能を発揮するかもしれないが、そこで学習した特徴や準備作業が氷の研究に円滑に転用できるとは限らない。

NASA-IBMのアプローチは、この順序を逆転させる。まず、幅広く、主にラベル付けされていない月面観測データから学習する。その後、研究者は問いに応じて、この共通バックボーンを検出、セグメンテーション、回帰に適応させる。

検出はクレーターのような個別の物体を特定する。セグメンテーションは画像領域にクラスを割り当て、不規則な海パッチの輪郭を描くことができる。回帰は、氷の存在可能性スコアのような連続値を推定する。これらのタスクには依然としてラベルと評価が必要だが、ランダムなモデル重みから始める必要はない。

プロジェクトでは複数の適応戦略を試験した。フルファインチューニングは、新しいタスクのためにモデル全体を更新する。凍結エンコーダーでは、タスク固有のコンポーネントだけを変更する。Low-rank adaptation(LoRA)は、元の重みの大半を変更せずに、小さな追加行列を学習させる。

IBMによると、LoRAの実験では基盤モデルの重みの90%を凍結した。モデルカードは、クレーター検出でフルファインチューニングと同等以上の結果を示し、セグメンテーションでも競争力を維持したため、LoRAをデフォルトとして推奨している。また、反復実行間のばらつきも小さかった。

この効率性は、より小規模な研究グループにとって重要である。基盤モデルの学習には相当な計算ハードウェアが必要だったが、その適応にははるかに少ないリソースで済む可能性がある。オープンな重みは高コストな共通作業を上流へ移す一方、科学チームには独自のラベル、評価、解釈に対する責任を残す。

この戦略は、より一貫した比較も可能にする。複数のグループが同じバックボーンとベンチマーク定義を使用すれば、性能差がデータ、適応手法、タスク設計のどこから生じるかを調査できる。方法論上の見解の相違をなくすものではないが、研究者により明確な共通の参照点を与える。

公開コードベースは、このモデルを地理空間基盤モデル向けのオープンソースツールキットTerraTorchと統合している。設定ファイルは、公開された下流タスクを対象としている。研究者は、ホストされたインターフェースだけに頼るのではなく、学習上の選択を検証できる。

Apache 2.0 ライセンスは、その条件の下で幅広い再利用、改変、配布を認めている。これにより、NASA-IBMモデルは管理されたデモンストレーション以上の存在となる。大学、宇宙機関、企業、独立研究者は、それぞれのデータや手法でこのモデルを検証できる。

ただし、公開されていることは、誰もが使えることと同義ではない。利用者にはリモートセンシングの専門知識、適切な計算資源、正しく位置合わせされたデータ、科学的に妥当なラベルが依然として必要となる。チェックポイントをダウンロードできても、こうした要件が解消されるわけではない。

競争圧力がかかるのは、タスク特化型のアプローチである。共有された事前学習モデルが、より少ないラベル付きデータで同等の性能を繰り返し達成するなら、チームは新しいバックボーンをすべてゼロから学習させる強い理由を求められる。その理由は、より高い精度、より明確なキャリブレーション、より低い実行コスト、あるいは特定の観測機器へのより高い適合性かもしれない。

共有モデルが自動的に勝つわけではない。特化型システムはドメイン上の前提をより直接的に組み込めるため、限定的な用途では検証しやすい場合がある。また、不要なモダリティを避けたり、運用環境における計算負荷を抑えたりすることも可能だ。

それでもIBMとNASAは、出発点となる問いを変えた。月面研究者は今、独立したパイプラインへの投資に踏み切る前に、新しい用途が共通表現から恩恵を得られるかを問えるようになった。即時のミッション投入がなくても、これは科学ソフトウェア開発における実践的な転換である。

IBMとNASAの月面AIはどのような性能を示したか

最も強いベンチマーク結果は氷の存在可能性評価で得られた一方、クレーターと火山に関する結果はより慎重な解釈を要する。

このプロジェクトでは、月面基盤モデルを複数の確立されたコンピュータビジョン用バックボーンと比較した。ベースラインにはResNet-50、ConvNeXtの各種モデル、SwinV2、DaViT、マスク付き自己符号化で学習したvision transformerが含まれる。セグメンテーション比較にはDeepLabV3+とSegFormerも含まれた。

全学習セットを用いた広角画像のクレーター検出では、最も適応されたNASA-IBMモデルが平均適合率の平均で0.2581を記録した。最も強力な公開ベースラインは0.2420だった。クレーター学習データを半分にした場合、月面モデルは0.2541に達し、ベースラインの0.2313を上回った。

モデルカードによれば、クレーターラベルの50パーセントを使った事前学習済みバリアントは、利用可能なラベルすべてで学習したSwinV2にすでに匹敵、または上回っていた。この結果はラベル効率の高さを支持する。幅広い月面事前学習が、その後の検出タスクに有用な特徴を捉えたことを示唆している。

ただし、1メートルスケールでは差はごくわずかだった。月面モデルは0.1543、最も強いベースラインは0.1552に達した。研究者らは、この差が反復実行間の変動より小さいため、両システムは同等と説明している。

狭角画像のクレーターベンチマークでも、全体として性能は低かった。このデータセットの一部は、メートルスケールの画像を用いているにもかかわらず、より粗い5メートルスケールでアノテーションされていた。凍結した月面エンコーダはランダム初期化モデルに近い性能にとどまり、適応がなお必要であることを示した。

不規則なmare patchのセグメンテーションでは、最良の月面構成がIoUスコア0.5709に達した。最も強いベースラインは0.5687だった。IoUは、予測領域がラベル付き参照領域とどの程度重なるかを測る指標である。

ここでも、この小さな優位だけで決定的な順位が確立されるわけではない。反復実行間のばらつきは、この差より大きかった。より重要なのは、ランダム初期化した月面アーキテクチャのスコアが0.3142まで低下した点であり、最良システム同士の最終結果が近接していても、事前学習が大きな価値をもたらしたことを示唆している。

氷の存在可能性評価は最も明確な結果を生んだ。適応されたNASA-IBMモデルは二乗平均平方根誤差0.0293を記録し、最も強いベースラインの0.0377を下回った。値が低いほど、推定値がベンチマーク目標に近いことを示す。

IBMはこれを誤差の22パーセント削減と位置付けた。同社の研究概要は、この優位の一部を複数データ型の処理に帰している。各モダリティは、トークンを統合する前に事前学習済みパッチアダプターを通る。

従来の比較モデルには代わりに、共通のstemを介して入力チャネルとして8層が積み重ねて与えられた。ランダム初期化の月面アーキテクチャは、このベンチマークでImageNet事前学習済みベースライン6モデルのうち5モデルをすでに上回っていた。月面事前学習が残りの改善をもたらした。

入力を取り除いて寄与を検証するアブレーションの一つでも、注目すべき結果が得られた。方位、傾斜、モデル化された氷安定深度のみを使う月面モデルは、完全な8層スタックを使うConvNeXtモデルにおおむね匹敵した。これは、このアーキテクチャが選択したモダリティを効率的に利用できることを示唆する。

ただし、これらの数値には文脈が必要だ。ベンチマークが測るのは、特定の準備済み目標に対する性能であり、有人探査シナリオでの成功ではない。氷の存在可能性評価は、温度、地形、その他の関連情報から構築された知識駆動型の参照マップを用いる。予測を、物理的に測定された月面氷の完全な目録と比較しているわけではない。

ベンチマークセットにも限界がある。モデルカードは、狭角画像の事前学習が利用可能なステレオ地形モデルを持つ地点に依存すると指摘している。月全体に分布する1,095フレームをカバーするが、全球的に高密度ではない。

したがって、このオープンソースの月面AIモデルが得たのは、信頼できる研究成果であって、運用上の認証ではない。公開された4つのベンチマークで競争力ある性能を示し、その最大の優位はマルチモーダルタスクで確認された。こうした改善が他の地域、ラベル、観測機器、科学的問いへどの程度移転するかは、独立した再現研究によって判断される。

オープンモデルにはなお厳しい科学的限界がある

モデルは有望なパターンを特定できるが、その文書自体が、それらのパターンを直接的な運用上の証拠として使うことを否定している。

最も明確な制約は、地形の位置を定めるための精密な測定・基準枠組みである測地学に関するものだ。モデルは絶対的な測地基準座標系を維持しない。局所的な地形構造を再現できても、標高をずらしたり、正しい地点から大きく外れた緯度・経度の値を生成したりする可能性がある。

この制約により、研究者は生成出力をミッション対応の地図として扱えない。クレーターの輪郭がもっともらしく見えても、その座標や標高基準がずれるなら十分ではない。着陸分析には、追跡可能な幾何情報、較正済みの観測、慎重に管理された不確実性が必要となる。

開発者らは、このモデルが着陸地点認証や危険性クリアランスのために検証されていないと明示している。これらのタスクは宇宙機と乗組員の安全に関わる。研究ベンチマークでの性能を大きく超える証拠基準が求められる。

生成されたフィールドにも、較正された予測上の意味はない。モデルは、何を学習したかを調べる手段として、もっともらしいクロスモーダル出力を作れる。こうした出力は定性的な検査であり、観測機器、ステレオ写真測量、正式な測地解の代替ではない。

氷に関する主張には、特に慎重さが求められる。モデルが推定するのは、温度、地形、その他の関連情報から構築された氷存在可能性マップとの類似性である。地下の堆積物を検出・測定するものではない。高いスコアは調査の指針にはなり得るが、採取可能な水が存在することを立証するものではない。

ベンチマーク設計も別の不確実性を生む。IBMとNASAは、すべてのタスクにおいて、ジオメトリトークン、混合解像度学習、月面事前学習がそれぞれどの程度寄与したかをまだ切り分けていない。氷の実験は部分的な証拠を示すが、すべての性能向上を説明するものではない。

小規模な評価セットも、強い結論を制限する。ラベル付き事例が限られたタスクでは、少数の難しいタイルが見出しとなる指標を変えうる。研究者らは複数のシードにわたる変動を報告しており、これは有用だが、新しい地域での独立テストは不可欠である。

照明条件は、表面変化の検出をなお複雑にしうる。NASAは、軌道ごとの照明差が小さなクレーターの視認性に影響する可能性があると指摘している。明示的なジオメトリはシステムに有用な文脈を与えるが、影や反射が生むすべての曖昧さを取り除くわけではない。

カバレッジも過去のミッション選択を反映する。一部の観測機器は月のほぼ全域を観測した一方、特定地域に焦点を当てたものもある。こうしたアーカイブで学習したモデルは、その不均一性を引き継ぐ。オープンな重みが、測定の限られた場所に同等の証拠を生み出せるわけではない。

自動化バイアスのリスクもある。視覚的に整合性のある出力は、不確かな入力や不完全な目標を反映していても、権威あるものに見える場合がある。研究者は、示されたパターンに基づいて行動する前に、不確実性の推定、生の観測値との比較、専門領域でのレビューを必要とする。

これらの限界は、NASA-IBM Lunar Foundation Modelの有用性を下げるものではない。むしろ、同モデルが安全に果たせる役割を定義する。地点の優先順位付け、マッピングの高速化、データソースの比較、専門家レビューのための仮説生成を支援できる。

最も妥当な位置付けは、運用上の意思決定より上流にあることだ。モデルは探索空間を絞り込み、観測機器と検証済みの分析パイプラインが証拠を確立する。したがって、再利用可能なモデリングとタスク特化型の検証は、開発資源を巡って競合しつつも、相互に補完し合う。

この境界線は、一般の期待を形作るべきである。この公開は科学的分析を改善することで月探査を支援する。Artemisミッションを自律的に計画したり、着陸機を操縦したり、地形を認証したり、極域のクレーターに利用可能な水があると証明したりするものではない。

公開の重要性を示す3つのシグナル

次の試金石は採用である。独立したチームがベンチマークを再現し、モデルを拡張し、その出力を新たな観測へ結び付けなければならない。

第一のシグナルは、独立したベンチマーク再現である。外部の研究者は、公開されたデータとコードを用いて、クレーター、不規則なmare patch、氷存在可能性の評価を再実行すべきだ。同等の結果が得られれば、実装と公開比較に対する信頼が高まる。

最も有益な再現研究は、新たな地理的分割と、これまで使われていない月面データプロダクトを検証するものになる。学習データと評価データが微妙な局所パターンを共有している場合、モデルは高い性能を示しうる。未知の地域で強い結果が出れば、その表現が元のベンチマーク設計を超えて移転することを示せる。

独立した研究では、不確実性、実行時間、メモリ使用量、適応手法の選択に対する感度も報告すべきだ。モデルが研究ワークフローに適合するかは、精度だけでは決まらない。検証や運用が容易なら、より小さな特化型モデルが引き続き望ましい場合もある。

第二のシグナルは、新たな下流アプリケーションの登場である。現在のデモンストレーションは、クレーター、火山性地形、極域の氷存在可能性を対象としている。研究者は同じバックボーンを、地滑り、巨石フィールド、表面成熟度、照明解析、変化検出に適応できる可能性がある。

最も強い証拠となるのは、元のチームが設計していないタスクであり、独立して準備されたラベルセットを用いるものだ。それは基盤モデルの中核的な主張を支持する。すなわち、広範な事前学習は、開発時に完全には定義されていなかった問いにも役立つはずである。

第三のシグナルは、新しいミッションデータや現地検証との接続である。後続の観測が予測を裏付けたり、異議を示したりすると、予測の価値は高まる。新たな軌道画像、地表測定、対象を絞った探査により、示唆された特徴が物理的条件に対応するかを明らかにできる。

NASAのより広範なAI科学戦略は、有用な文脈を提供する。同機関とIBMは以前、地球観測向けのPrithviモデルと、太陽物理学向けのSuryaを公開した。月面モデルは単発のプロジェクトではなく、このパターンを惑星科学へと拡張するものだ。

今後のリリースによって、NASAがツール、標準、データ準備を分断せずに、オープンな科学基盤モデル群を維持できるかが明らかになるかもしれません。TerraTorchのような共有ソフトウェアは役立ちますが、各科学分野には依然として固有の測定手法と検証手順が必要です。

研究者は、モデルが時間とともにどのように変化するかにも注意を払うべきです。モダリティの追加、測地処理の改善、狭視野データのより広いカバー範囲、較正済みの不確実性は、現在のいくつかの制約に対応するでしょう。真の進歩と評価条件の変化を区別するには、バージョン管理されたベンチマークが必要になります。

NASA-IBM Lunar Foundation Modelは、すでに一つの具体的な成果をもたらしています。科学者は現在、数十年にわたる月面観測から構築された共通表現をダウンロードできるようになりました。そのベンチマーク性能は、特にマルチモーダルな課題やラベルが限られたプロジェクトにおいて、このリリースを真剣に試験する価値のあるものにしています。

より長期的な重要性は、研究コミュニティが次に何をするかにかかっています。独立したチームは結果を再現し、当初の3つのタスクを超える応用を構築し、新たな証拠に照らして予測を検証できるでしょうか。こうした問いが、オープンなチェックポイントを永続的な科学インフラへと変えていきます。

開発者と科学チームにとって、直ちに取るべき行動は明確です。ドキュメントを確認し、範囲を限定した研究課題を選び、モデルを適応させる前に信頼できるベースラインを確立してください。出力を生の測定値と比較し、重要な判断が伴うあらゆる段階で人間によるレビューを維持してください。NASA-IBM Lunar Foundation Modelは、神託ではなく仮説生成エンジンとして扱うべきです。独立した研究がその利点を確認すると同時に失敗も明らかにできれば、このプロジェクトは洗練されたデモンストレーション以上に価値あるもの、すなわち月を研究するための共有可能で検証可能な手法を実現したことになります。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page