NASA Lunar AI Model, 달 데이터 활용의 문을 열다…새 발견 입증이 더 어려운 과제
NASA가 거의 200만 개의 데이터 타일로 학습한 lunar AI model을 공개하며, 수십 년간 축적된 달 관측 데이터를 탐색하는 새로운 길을 열었다. NASA lunar AI model은 크레이터 지도를 작성하고, 특이한 화산 지형의 윤곽을 파악하며, 극지 얼음이 안정적으로 남아 있을 가능성이 있는 위치를 추정하도록 조정할 수 있다. 이번 공개는 누가 이러한 도구를 만들 수 있는지, 그리고 작업별로 얼마나 많은 데이터를 필요로 하는지를 바꾼다.
NASA는 IBM Research 및 학계 파트너들과 함께 이 모델을 개발한 뒤, 가중치, 데이터세트, 벤치마크, 미세 조정 리소스를 공개했다. 따라서 이 프로젝트는 단순한 내부 자동화 시스템을 넘어선다. 외부 연구자들도 기존 컴퓨터 비전 모델과 성능을 비교하고, 새로운 달 연구 질문에 맞게 모델을 조정할 수 있다.
다만 재사용 가능한 AI가 자동으로 신뢰할 만한 발견을 만들어내는 것은 아니다. 공개된 벤치마크는 일부 작업에서 뚜렷한 향상을, 다른 작업에서는 거의 동등한 결과를, 또 라벨과 조명 측면에서는 중요한 한계를 보여준다. 이 모델은 SwinV2 같은 범용 시스템과 경쟁해야 하며, 과학적 출력은 여전히 물리적 관측을 통한 검증이 필요하다.
NASA는 2026년 9월 10일 이 공개를 발표했다. NASA의 출시 세부 정보에 따르면, 이 프로젝트는 foundation models를 과학 데이터에 적용하려는 더 폭넓은 노력의 일부다.
NASA Lunar AI Model, 아카이브를 실제 연구 인프라로 전환하다
NASA와 IBM은 다루기 어려운 달 아카이브를 다양한 연구 과제를 위한 재사용 가능한 출발점으로 전환하고 있다.
Lunar Reconnaissance Orbiter는 17년 동안 달을 관측해 왔다. NASA는 이 임무가 다른 모든 행성 탐사 임무를 합친 것보다 더 많은 데이터를 생산했다고 말한다. 이 탐사선의 카메라는 달 표면을 거의 연속적으로 포괄하는 고해상도 모자이크도 구축했다.
이 정도의 데이터 규모는 분석 문제를 낳는다. 작은 크레이터, 화산 지형, 극지 지형을 연구하는 연구자는 관련된 모든 관측값을 수작업으로 검토할 수 없다. 각각의 질문을 위해 별도의 머신러닝 파이프라인을 구축하는 일도 라벨링된 데이터, 컴퓨팅 자원, 전문 인력의 시간을 소모한다.
새 모델은 사전 학습을 통해 이 병목을 해결한다. foundation model은 먼저 대규모 데이터세트에서 광범위한 패턴을 학습한 뒤, 더 좁은 작업을 위해 추가 학습을 받는다. 여기서 패턴에는 달의 질감, 지형, 조명, 고도, 온도, 레이더 반응, 광물 정보가 포함된다.
기반 학습 코퍼스에는 지리적으로 정렬된 타일 번들이 거의 200만 개 포함돼 있다. 이는 두 가지 공간 규모에서 11개 데이터 모달리티를 아우른다. 한 트랙은 픽셀당 약 1미터 수준의 관측을 사용하고, 다른 트랙은 픽셀당 약 100미터 수준의 지형을 다룬다.
이 타일은 Lunar Reconnaissance Orbiter Camera 데이터에 크게 의존한다. 모델은 Lunar Orbiter Laser Altimeter, Diviner radiometer, Mini-RF radar 및 기타 임무와 관련된 정보도 통합한다.
지원 데이터에는 지형, 경사, 표면 방향, 중력, 수소 존재량, 레이더 측정값, 열 조건이 포함된다. 광학 이미지에서 어두운 부분이 반드시 다른 물질을 의미하지는 않기 때문에 이러한 조합은 중요하다. 단순히 햇빛의 입사각을 반영한 것일 수도 있다.
따라서 이 모델은 시각적 유사성 이상을 학습한다. 이미지를 같은 지역에서 기록된 관측 기하와 다른 측정값에 연결할 수 있다. 이는 지형 특징과 조명 인공물을 구분하는 더 나은 기반을 제공한다.
NASA는 이 모델이 100만 장이 넘는 고해상도 이미지와 약 96만4,000장의 다중분광 이미지로 학습됐다고 말한다. 다중분광 이미징은 선택된 파장대 전반에서 표면을 기록해 일반 사진으로는 포착할 수 없는 정보를 드러낸다.
연구자들은 이제 무작위 모델 가중치에서 시작하는 대신 이 사전 학습 시스템을 조정할 수 있다. 이는 일부 프로젝트에 필요한 라벨링 사례 수를 줄일 수 있다. 또한 서로 다른 달 연구 결과를 더 쉽게 비교할 수 있게 할 수 있다.
공개 model card는 체크포인트, 평가 결과, 구성 가이드, 작업별 조정 권고 사항을 제공한다. 자료에는 Apache 2.0 license가 적용된다.
이번 공개는 지리공간 foundation models 조정을 위한 오픈소스 툴킷인 TerraTorch도 지원한다. 이 통합을 통해 머신러닝 팀은 데이터 인터페이스를 다시 구축하지 않고도 기존 경로를 활용해 모델을 미세 조정할 수 있다.
가장 중요한 변화는 접근성이다. 전문적인 달 분석은 한때 개별 임무, 연구소, 맞춤형 파이프라인과 밀접하게 연결돼 있었다. 이제 동일한 사전 학습 백본으로 행성 과학자, 대학, 독립 기술 팀의 실험을 지원할 수 있다.
이처럼 폭넓어진 접근성이 달 전문 지식의 필요성을 없애지는 않는다. 하지만 새로운 연구 질문을 시험하는 데 드는 엔지니어링 비용은 줄인다.
모델은 서로 다른 장비와 해상도 전반에서 학습한다
핵심적인 기술적 가정은 하나의 모델이 서로 다른 규모와 과학적 목적에서 수집된 측정값을 연결할 수 있다는 것이다.
달 원격탐사 데이터는 동일한 사진이 깔끔하게 쌓인 형태로 들어오지 않는다. 카메라, 레이저 고도계, 열 측정 장비, 레이더 시스템, 분광기는 각각 다른 속성을 측정한다. 이들의 관측 범위와 해상도는 크게 다를 수 있다.
NASA lunar AI model은 vision transformer encoder와 decoder를 사용한다. vision transformer는 이미지를 패치로 나누고 이를 토큰으로 변환한 뒤, 토큰 간 관계를 학습한다. 이 모델은 그 접근 방식을 다양한 달 데이터 유형으로 확장한다.
학습 중 시스템은 관측값의 일부만 받고 누락된 정보를 복원하는 법을 배운다. 이 masked-token 방식은 지형, 반사율, 기하, 기타 측정값 간 관계를 발견하도록 유도한다.
이 모델은 수집 기하를 명시적 맥락으로도 입력받는다. 여기에는 센서가 특정 위치를 어떻게 관측했는지에 관한 정보가 포함된다. 달에서는 긴 그림자로 인해 같은 크레이터도 궤도마다 다르게 보일 수 있으므로 기하는 특히 중요하다.
두 번째 확장은 동일한 가중치가 미터급 및 수백 미터급 관측 전반에서 작동하도록 한다. 이 모델은 조정 가능한 patch embeddings를 사용해 각 규모에 별도 백본을 요구하지 않고 서로 다른 이미지 해상도를 처리할 수 있다.
그 결과, 그렇지 않으면 분절된 측정값들을 위한 공통 표현이 만들어진다. 과학자는 이 표현을 크레이터 탐지, 극지 얼음 잠재성, 화산 지형 분할에 맞게 미세 조정할 수 있다.
잠재성은 중요한 구분이다. 얼음 잠재성 지도는 안정적인 얼음에 유리한 조건이 어디에 있는지를 추정한다. 특정 위치에 채굴 가능한 물이 존재한다는 직접적인 측정이나 확인은 아니다.
얼음 작업은 표면 온도, 경사, 방향, 영구 그림자, 모델링된 얼음 안정 깊이 같은 입력을 결합한다. 출력은 기존 과학 지식으로 구축한 기준 잠재성 지도와의 일치도를 나타낸다.
AI가 무엇을 발견했는지에 관한 헤드라인은 쉽게 과장될 수 있으므로, 이처럼 좁은 정의는 중요하다. 이 모델은 달 토양을 시추하거나 매장된 물을 확실하게 탐지하는 것이 아니다. 얼음 안정성과 관련된 조건에 따라 지형의 순위를 매기는 것이다.
크레이터 매핑에서 이 시스템은 매우 다른 두 규모로 작동할 수 있다. Wide Angle Camera 관측은 픽셀당 약 100미터 수준의 지역적 맥락을 제공한다. Narrow Angle Camera 이미지는 픽셀당 약 1미터 수준에서 훨씬 작은 특징을 드러낸다.
이 모델은 irregular mare patches도 대상으로 한다. 이 드문 화산 지형은 주변 표면의 상당 부분보다 더 젊어 보인다. 더 나은 지도는 과학자들이 달의 화산 및 열 진화 연대표를 정교화하는 데 도움이 될 수 있다.
동료 심사 과정은 아직 완료되지 않았지만, 연구팀은 상세한 technical paper를 공개했다. 논문은 데이터, 아키텍처, 네 가지 downstream benchmarks, 그리고 일반적인 지구 이미지로 사전 학습한 모델과의 비교를 설명한다.
이 시스템의 유연성은 미세 조정에도 적용된다. 연구자들은 전체 네트워크를 업데이트하거나, encoder를 고정하거나, low-rank adaptation을 사용할 수 있다. 일반적으로 LoRA라고 불리는 low-rank adaptation은 원래 가중치 대부분을 보존하면서 추가된 소수의 매개변수를 변경한다.
IBM은 LoRA 테스트에서 기본 모델 가중치의 90%를 고정했다고 밝혔다. 이는 컴퓨팅 부담을 낮추고 유용한 사전 학습 특징을 지워버릴 위험을 줄인다.
다만 하나의 조정 방식이 모든 벤치마크에서 승리한 것은 아니다. LoRA는 크레이터 탐지에서 좋은 성능을 보였고 화산 지형 분할에서도 경쟁력을 유지했다. 극지 얼음 잠재성에서는 전체 미세 조정이 가장 강력한 결과를 냈다.
고정 encoder는 가장 작은 irregular mare patch 데이터세트에서 앞섰지만, 크레이터 탐지에서는 열거된 모든 기준 모델보다 낮은 성능을 보였다. 따라서 연구자들은 사용 사례마다 조정 전략을 시험해야 한다.
이는 한 번의 명령으로 달을 분석하는 시스템이 아니다. 과제 설계, 라벨링 사례, 평가, 과학적 해석이 여전히 필요한 공유 기술 인프라다.
맥락이 가장 중요한 곳에서 달 사전 학습이 범용 AI를 앞서다
벤치마크는 구체적인 결론을 뒷받침한다. 달 사전 학습은 데이터 효율을 높이지만, 모든 비교에서 우위를 점하는 것은 아니다.
연구팀은 동일한 미세 조정 프레임워크로 네 가지 작업을 평가했다. 여기에는 지역 크레이터 탐지, 미터급 크레이터 탐지, irregular mare patch 분할, 극지 얼음 잠재성이 포함됐다.
비교군에는 ResNet-50, ConvNeXt, SwinV2, DaViT, 그리고 ImageNet으로 사전 학습한 vision transformers가 포함됐다. ImageNet에는 특수한 달 관측 대신 일상적인 지구 이미지가 담겨 있다.
가용 학습 데이터의 절반을 사용한 지역 크레이터 탐지에서 달 모델은 평균 정밀도 0.2541을 기록했다. 해당 데이터 조건에서 가장 강력한 범용 기준 모델인 SwinV2-B는 0.2313을 기록했다.
모든 지역 크레이터 학습 데이터를 사용했을 때 최고의 달 모델 구성은 0.2581에 도달했다. SwinV2-B는 0.2420을 기록했다. 이 결과는 도메인 사전 학습이 모델이 크레이터 라벨을 더 효율적으로 활용하도록 돕는다는 점을 시사한다.
IBM은 비교 모델 대비 절반 데이터 결과가 거의 19% 향상됐다고 설명한다. 회사의 benchmark summary는 달 시스템이 더 세밀한 1미터 크레이터 규모에서 선두 모델과 동등한 성능을 보였다고도 전한다.
상세 수치는 그 접전을 보여준다. 달 모델은 Narrow Angle Camera 크레이터에서 평균 정밀도 0.1543을 기록했다. SwinV2-B는 0.1552를 기록했다.
이 결과는 가치가 있지만 명확한 승리는 아니다. 재사용 가능한 달 모델이 미터 규모에서 강력한 전문 기준 모델과 경쟁할 수 있음을 보여준다. 보편적 우월성을 입증하는 것은 아니다.
irregular mare patch 분할에서 최고의 달 모델 구성은 intersection-over-union 점수 0.5709를 기록했다. 선두 ConvNeXtV2-B 기준 모델은 0.5687을 기록했다.
intersection over union은 예측된 영역과 기준 라벨 간 중첩 정도를 측정한다. 작은 차이는 모델들이 비슷한 성능을 냈다는 뜻이다. 반복 학습 실행 간의 변동성도 광범위한 성능 주장을 부적절하게 만든다.
가장 뚜렷한 이점은 극지 얼음 잠재성에서 나타났다. 전체 미세 조정을 거친 달 모델은 root mean squared error 0.0293을 달성했다. 가장 강력한 보고 기준 모델은 0.0377을 기록했으며, 낮은 값이 더 높은 일치도를 의미한다.
IBM은 이 격차를 오류율 22% 감소로 요약한다. 이 결과는 얼음 잠재성이 여러 지형 및 온도 입력에 의존하기 때문에 프로젝트의 멀티모달 설계를 뒷받침한다.
논문은 동일한 아키텍처를 무작위 초기화한 버전도 얼음 과제에서 많은 일반 베이스라인을 능가했다고 보고한다. 이는 결과에 기여한 것이 달 사전학습뿐만 아니라 아키텍처 자체이기도 함을 시사한다.
이 구분은 파운데이션 모델을 평가하는 데 핵심적이다. 사전학습 시스템은 처음부터 학습한 동일한 아키텍처와 비교해야 한다. 그렇지 않으면 사전학습의 성과로 여겨진 향상이 실제로는 다른 네트워크 설계에서 비롯됐을 수 있다.
연구진은 이 대조군을 포함했다. 사전학습 모델은 여전히 가장 강력한 얼음 결과를 냈으며, 지역 크레이터 성능 역시 무작위 초기화 버전을 웃돌았다.
라벨 효율성은 궁극적으로 작은 정확도 향상보다 더 중요할 수 있다. 신뢰할 수 있는 크레이터 윤곽이나 화산 지형 마스크를 만드는 데에는 과학적 노동이 필요하다. 더 적은 라벨로 경쟁력 있는 정확도에 도달하는 모델은 활용 가능한 실험으로 가는 경로를 단축할 수 있다.
이 벤치마크가 모든 달 지역, 계절, 센서 조건 또는 지형 크기에서 동등한 성능을 입증하는 것은 아니다. 보고된 점수는 정의된 데이터세트와 지리적 분할에서 나온 것이다.
그럼에도 이 비교는 NASA 달 AI 모델에 신뢰할 수 있는 출발점을 제공한다. 가장 강력한 근거는 이 모델이 달 해석 문제를 해결했다는 데 있지 않다. 별도의 파운데이션 모델 4개를 요구하지 않고 달 사전학습이 서로 다른 4개 과제로 전이됐다는 점이다.
크레이터, 화산 지형, 얼음은 서로 다른 시험을 만든다
모델의 세 가지 핵심 응용은 서로 다른 능력을 측정하므로, 한 분야의 성공이 다른 분야를 대신할 수는 없다.
크레이터 매핑은 가장 직관적인 과제다. 과학자들은 표면의 상대적 연대를 추정하기 위해 충돌 크레이터의 수를 세고 크기를 측정한다. 일반적으로 새로운 지형은 오래된 지형보다 누적 충돌 흔적이 적다.
자동화된 매핑은 수작업 검토보다 훨씬 많은 이미지를 처리할 수 있다. 또한 관측 간 표면 변화를 표시해 연구자에게 추가 검토를 위한 후보 목록을 제공할 수 있다.
NASA는 아인슈타인 크레이터 인근 이미지로 이 능력을 시험했다. Falcon 9 상단부는 2026년 8월 5일 달에 충돌했으며, LRO는 며칠 뒤 그 결과를 촬영했다.
모델은 사전학습 중 충돌 후 이미지를 보지 못했다. 적응 후에는 기존 크레이터를 감지하고 새로운 충돌 지점을 강조했다. 이는 단순 암기가 아닌 변화 감지의 구체적인 사례를 제시한다.
NASA가 별도로 공개한 충돌 이미지 설명은 이 과제가 여전히 어려운 이유를 보여준다. 관측 순서에 따라 시야각과 조명이 달라졌다.
새 크레이터는 폭 약 60피트, 깊이 10피트 미만으로 측정됐다. LRO의 협각 카메라는 조건이 좋을 때 약 3피트 크기의 지형까지 분해할 수 있다.
그 정도 해상도에서도 그림자는 작은 크레이터의 가시성에 영향을 준다. 두 이미지를 비교하는 모델은 조명 차이를 물리적 변화로 해석할 수 있다. NASA는 작은 지형에 대한 한계로 조명 변화 가능성을 명시적으로 지적한다.
불규칙한 바다 평원 지대는 또 다른 난제를 만든다. 이러한 화산 지형은 드물고 시각적으로 특이하며, 대개 제한된 영역에만 분포한다. 희소성 때문에 연구자들이 학습에 쓸 수 있는 라벨링 사례도 적다.
파운데이션 모델은 훨씬 큰 비라벨 데이터 집합에서 학습한 패턴을 전이함으로써 도움을 줄 수 있다. 화산 벤치마크는 이러한 전이가 작동함을 시사하지만, 최강 베이스라인 대비 우위는 여전히 크지 않다.
이러한 지대를 매핑하면 달 화산 활동이 언제 끝났는지에 대한 추정이 개선될 수 있다. 일부 지형은 예상보다 훨씬 젊어 보이며, 달이 냉각되어 비활성 상태가 됐다는 단순한 설명에 도전한다.
극지 얼음은 과학적으로 가치가 있을 뿐 아니라 운영 측면에서도 중요하다. 영구 음영 지역은 매우 오랜 기간 저온을 유지할 수 있어 휘발성 물질이 표면 근처에 남아 있을 수 있다.
잠재적인 물 자원은 착륙지 연구와 장기 탐사 계획에 영향을 준다. 물은 승무원을 지원할 수 있고, 처리 후에는 다른 용도의 산소나 수소 생산에 기여할 수 있다.
그러나 AI가 생성한 잠재성 지도는 자원의 양, 순도, 접근성 또는 추출 비용을 입증하지 않는다. 이러한 질문에는 직접 측정, 개선된 원격 탐사, 그리고 궁극적으로 현장 조사가 필요하다.
이 차이는 과학적 우선순위 설정과 발견을 구분한다. 모델은 팀이 주목할 만한 위치를 식별하도록 도울 수 있다. 하지만 해당 위치의 물질을 확인하는 데 필요한 계측값을 대체할 수는 없다.
세 가지 응용은 오류의 비용도 서로 다르다. 작은 크레이터를 놓치면 통계적 집계가 달라진다. 희귀한 화산 지형을 잘못 분류하면 지질 조사를 왜곡할 수 있다. 얼음 예측을 과장하면 임무 계획에 영향을 줄 수 있다.
따라서 각 과제에는 고유한 승인 기준과 검토 절차가 필요하다. 단일 종합 성능 주장은 이러한 차이를 가리게 된다.
단기적으로 가장 적합한 활용 방식은 보조 분석이다. 연구자들은 모델로 대규모 데이터세트를 선별한 뒤, 분야별 도구로 가장 가치 높은 예측을 검토할 수 있다.
이러한 역할 분담은 AI의 규모 확장 능력을 활용하면서 인간의 판단을 보존한다. 또한 향후 버전을 개선하는 데 필요한 피드백을 생성한다.
공개 가중치가 검증 격차를 없애지는 않는다
NASA의 공개 배포는 독립적인 테스트를 가능하게 하지만, 벤치마크 성능과 신뢰할 수 있는 과학적 활용 사이에는 여전히 여러 격차가 존재한다.
프로젝트에는 모델 가중치, 벤치마크 데이터세트, 미세조정 및 추론 코드가 포함된다. 연구자들은 구성 설정을 검토하고, 하위 실험을 재현하며, 공통 프레임워크에서 자신의 방법을 비교할 수 있다.
공개 코드에는 모델 백본과 TerraTorch 통합용 패키지가 포함되어 있다. 또한 크레이터 탐지, 화산 지형 분할, 얼음 잠재성 분석을 위한 실행 가능한 구성도 제공한다.
중요한 한계 하나는 저장소 문서에 나타난다. 이 배포본에는 사전학습 코드가 포함되지 않는다. 외부 팀은 체크포인트를 사용하고 하위 작업을 재현할 수 있지만, 공개 저장소만으로는 원래의 학습을 완전히 다시 실행할 수 없다.
이것이 모델을 비공개로 만드는 것은 아니다. 다만 재현성의 의미를 좁힌다. 미세조정 결과를 재현하는 일은 원시 데이터로 사전학습 체크포인트를 다시 구축하는 일과 다르다.
하드웨어 요구사항도 또 다른 장벽이 될 수 있다. 공개된 아티팩트는 특히 연구자들이 LoRA를 사용할 때 시작 비용을 낮춘다. 하지만 저장 공간, 데이터 준비 또는 가속기 요구사항을 없애지는 않는다.
데이터세트 라벨도 면밀히 검토할 필요가 있다. 모델의 벤치마크 점수는 참조 데이터와의 일치도를 측정한다. 이 참조에 불완전한 크레이터 주석이나 불확실한 화산 경계가 있다면 모델도 이러한 한계를 물려받을 수 있다.
얼음 벤치마크는 목표가 잠재성 지도이기 때문에 특히 주의가 필요하다. 높은 일치도는 모델이 해당 참조의 패턴을 재현했다는 뜻이다. 이는 달의 얼음을 독립적으로 검증하지는 않는다.
지리적 일반화도 또 하나의 미해결 문제다. 모델은 광범위한 범위를 활용해 학습됐지만, 일부 기기는 특정 지역만 관측한다. 극지 입력은 거의 전 지구적 범위의 이미지보다 훨씬 제한적일 수 있다.
관측 범위가 부족한 지역에 모델을 적용하는 팀은 어떤 모달리티를 사용할 수 있는지 확인해야 한다. 누락된 데이터는 성능을 바꾸거나 다른 미세조정 구성을 요구할 수 있다.
조명은 지속적인 오류 원인으로 남는다. 달의 그림자는 관측 기하에 따라 변하며 작은 지형을 가릴 수 있다. 명시적 기하 정보는 모델에 도움이 되지만, 센서가 한 번도 포착하지 못한 정보를 만들어낼 수는 없다.
희귀 사건은 관련된 문제를 만든다. 새로 형성된 크레이터, 비정상적인 붕괴, 드문 화산 구조는 학습 분포와 다르게 보일 수 있다. 이들의 과학적 가치는 바로 그 비일상성 때문에 높다.
아인슈타인 크레이터 시험은 보류된 표면 변화를 포함하기 때문에 고무적이다. 다른 충돌과 조명 조건에 걸친 독립적인 시험은 더 강력한 근거를 제공할 것이다.
연구자들은 모델을 더 단순한 방법과도 비교해야 한다. 파운데이션 모델은 라벨링 필요성을 줄이거나, 정확도를 높이거나, 여러 워크플로를 통합할 때 가장 가치가 있다. 복잡성 자체는 과학적 이점이 아니다.
발표된 연구는 표준 베이스라인과 무작위 초기화 대조군을 포함함으로써 이러한 비교를 가능하게 한다. 향후 사용자는 새로운 과제에서도 같은 엄격함을 유지해야 한다.
핵심 질문은 모델이 그럴듯한 지도를 생성하는지 여부가 아니다. 그 지도가 새로운 위치, 기기, 관측 조건에서도 정확성을 유지하는지 여부다.
공개 접근은 과학계가 이 질문에 답할 수 있게 한다. 하지만 그 답을 자동으로 제공하지는 않는다.
NASA와 달 연구자들이 다음으로 입증해야 할 것
다음 단계에서는 독립 재현, 현장 관련성, 그리고 진정으로 새로운 관측에서의 성능을 시험해야 한다.
가장 먼저 주목할 신호는 공개된 네 가지 벤치마크의 외부 재현이다. 독립 팀은 체크포인트를 내려받고, 공개 데이터세트를 사용하며, 보고된 변동 범위 안의 결과를 얻을 수 있어야 한다.
성공적인 재현은 성능 주장을 강화하고 누락된 설정 세부사항을 드러낼 것이다. 설명되지 않는 큰 격차는 현재 벤치마크에 대한 신뢰를 약화시킬 것이다.
두 번째 신호는 원래 팀이 구성하지 않은 관측 자료에 대한 평가다. 새로운 LRO 이미지, 추가 충돌 지점, 독립 라벨은 모델이 공개 패키지를 넘어 일반화하는지 보여줄 수 있다.
표면 변화 감지는 유용한 시험을 제공한다. 연구자들은 알려진 충돌 전후에 촬영된 관측을 비교한 뒤, 조명이나 관측 기하로 인한 오탐지를 측정할 수 있다.
일련의 성공적인 시험은 새로운 이미지를 선별하는 운영적 활용을 뒷받침할 것이다. 반복적인 오탐지는 기하 정보 처리가 더 개선돼야 함을 보여줄 것이다.
세 번째 신호는 달 과학자들이 원래 벤치마크 집합 밖에서 유용한 응용 프로그램을 만드는지 여부다. 예로는 바위 매핑, 산사태 식별, 지형 위험 분석, 기기 간 이상 탐지가 있을 수 있다.
재사용 가능한 파운데이션 모델은 개발자가 직접 최적화하지 않은 문제로도 전이돼야 한다. 적응이 여전히 네 가지 공개 과제에 한정된다면, 더 광범위한 파운데이션 모델 주장은 설득력이 떨어진다.
이번 공개는 다른 행성과학 프로젝트에도 압박을 가한다. 화성, 소행성 또는 지구 관측을 다루는 팀은 멀티모달 도메인 사전학습이 고립된 모델 모음을 대체할 수 있는지 판단해야 한다.
NASA와 IBM은 이미 지구과학과 태양물리학용 파운데이션 모델에서 협력하고 있다. 달 프로젝트는 여러 기기로, 그리고 크게 다른 규모로 관측된 표면에 이 전략을 확장한다.
따라서 가장 강력한 기여는 방법론적일 수 있다. 이는 기관들이 공개 과학 관측을 재사용 가능한 AI 인프라, 벤치마크, 접근 가능한 체크포인트로 어떻게 패키징할 수 있는지 보여준다.
이 접근법은 보관된 측정값과 검증 가능한 가설 사이의 거리를 줄일 수 있다. 또한 내부 모델이라면 결코 받지 못할 외부 검증을 불러올 수 있다.
NASA 달 AI 모델은 자동화된 달 과학자가 아니다. 이는 방대한 아카이브 전반에서 주의를 이끌 수 있는 공유 분석 계층이다.
결정적인 근거는 독립 연구자들이 이를 통해 무엇을 발견하고, 기각하고, 재현하는지에서 나올 것이다. 모델을 내려받는 것은 첫 단계일 뿐이다. 다음으로 유용한 행동은 하나의 구체적인 달 관련 질문을 시험하고, 베이스라인을 문서화하며, 성공 사례와 실패 사례를 모두 공개하는 것이다.



