Il Lunar Foundation Model di NASA-IBM supera una baseline per i crateri con metà delle etichette
NASA e IBM hanno rilasciato il NASA-IBM Lunar Foundation Model dopo aver segnalato un miglioramento di quasi il 19% nel rilevamento dei crateri utilizzando metà dei dati di addestramento etichettati. Il risultato riguarda uno specifico benchmark a una risoluzione di circa 100 metri per pixel, non ogni attività di mappatura dei crateri. La distinzione è importante perché il valore più ampio del modello dipende dalla capacità dei ricercatori di adattare un'unica base di dati lunari a diversi problemi scientifici.
Il modello combina osservazioni raccolte a risoluzioni, angoli di osservazione e lunghezze d'onda differenti. I ricercatori possono perfezionarlo per il rilevamento dei crateri, la valutazione del potenziale del ghiaccio polare e la mappatura di insolite formazioni vulcaniche. NASA e IBM hanno inoltre rilasciato i pesi del modello, i dataset downstream e il codice per testare il sistema.
Si tratta di qualcosa di più di un'altra dimostrazione di riconoscimento delle immagini. La scienza lunare ha accumulato vasti dataset provenienti da strumenti che misurano proprietà fisiche diverse a scale radicalmente differenti. Gli scienziati in genere sviluppano pipeline specializzate per ogni attività, mentre il nuovo modello offre un punto di partenza riutilizzabile addestrato su osservazioni lunari.
Questo crea il test centrale. Un foundation model specifico per un dominio dovrebbe ridurre le etichette, le risorse di calcolo e il lavoro ingegneristico necessari per nuovi studi. Deve comunque produrre risultati scientificamente affidabili in luoghi non familiari, condizioni di illuminazione, strumenti e domande di ricerca diversi.
Il NASA-IBM Lunar Foundation Model trasforma gli archivi lunari in infrastruttura riutilizzabile
Il cambiamento immediato è che i ricercatori lunari dispongono ora di un modello preaddestrato e apertamente disponibile, invece di avviare ogni progetto di mappatura con un sistema di visione generico.
NASA ha annunciato il modello il 10 settembre 2026, nell'ambito della sua continua collaborazione con IBM Research sull'IA per la scienza. L'agenzia lo descrive come uno dei primi foundation model open source creati specificamente per la scienza lunare.
Un foundation model viene addestrato su un ampio dataset prima di essere adattato a compiti più circoscritti. In questo caso, il preaddestramento insegna al sistema schemi ricorrenti nel terreno lunare e nelle misurazioni dei sensori. I ricercatori possono quindi aggiungere dataset più piccoli e specifici per l'attività, destinati al rilevamento dei crateri, all'analisi del ghiaccio o alla mappatura vulcanica.
Il modello è stato addestrato principalmente sulle osservazioni del Lunar Reconnaissance Orbiter, o LRO, della NASA. Secondo la NASA, il veicolo spaziale ha raccolto in 17 anni di attività più dati di tutte le altre sue missioni planetarie messe insieme.
Secondo il rilascio del modello lunare dell'agenzia, il corpus di addestramento conteneva circa due milioni di tile di immagini. Il totale includeva oltre un milione di immagini di fotocamere ad alta risoluzione, con risoluzione di un metro, e quasi 964.000 immagini multispettrali, con risoluzione di 100 metri.
Altri input provenivano dalle missioni GRAIL e Lunar Prospector della NASA, oltre che dalla missione SELENE dell'agenzia spaziale giapponese. Queste missioni non hanno osservato la Luna in modi identici.
Le fotocamere ottiche registrano la luce riflessa. L'altimetria descrive l'elevazione, mentre le misurazioni termiche e spettrali catturano altre proprietà fisiche. Le loro risoluzioni spaziali possono variare da circa un metro per pixel a misurazioni che coprono chilometri.
Il modello NASA-IBM converte queste osservazioni eterogenee in una rappresentazione condivisa. Tale rappresentazione è la libreria interna di schemi che i modelli downstream possono riutilizzare.
NASA individua tre priorità scientifiche iniziali. I ricercatori vogliono catalogare piccoli crateri, studiare formazioni vulcaniche relativamente giovani e stimare dove il ghiaccio rimane stabile vicino ai poli lunari.
Ogni attività risponde a una domanda scientifica diversa. Il conteggio dei crateri aiuta i ricercatori a stimare l'età delle superfici. Le irregular mare patches, insolite formazioni vulcaniche, possono affinare la storia termica della Luna. Le mappe del ghiaccio polare possono orientare la ricerca sui volatili lunari e informare la pianificazione di future esplorazioni.
Il modello ha inoltre riconosciuto un cratere di recente formazione vicino al cratere Einstein in un test con immagini prima e dopo l'evento. Secondo NASA, l'osservazione successiva all'impatto è stata esclusa dal preaddestramento. Ciò rende l'esempio un utile test dell'adattamento a un cambiamento della superficie che il modello preaddestrato non aveva già visto.
Tuttavia, l'esempio non significa che il sistema abbia scoperto autonomamente un impatto sconosciuto sull'intera Luna. Mostra che un modello perfezionato può identificare un tipo noto di cambiamento all'interno di immagini orbitali predisposte.
Questa descrizione più circoscritta rappresenta comunque un progresso utile. Lo screening automatizzato può aiutare gli scienziati a ridurre un vasto archivio a un insieme gestibile di località candidate per la revisione da parte di esperti.
Perché il rilevamento dei crateri con l'IA richiede meno etichette, non soltanto un punteggio più alto
Il dato del 19% è importante perché i dati lunari etichettati sono scarsi, costosi da produrre e spesso dipendono dal giudizio di specialisti.
I sistemi di machine learning necessitano di esempi che colleghino un'immagine in input al risultato atteso. Per il rilevamento dei crateri, queste etichette descrivono dove compaiono i crateri e come dovrebbero essere rappresentati i loro confini.
Creare queste annotazioni non equivale a etichettare fotografie quotidiane. I crateri si sovrappongono, si erodono e appaiono in modo diverso al variare della luce solare. Piccole depressioni possono assomigliare a ombre o ad altre strutture del terreno. Anche la risoluzione determina quali formazioni siano sufficientemente visibili da poter essere classificate.
Il modello NASA-IBM affronta questa attività con conoscenze apprese da un corpo molto più ampio di dati lunari non etichettati. Non parte da parametri casuali né soltanto dagli schemi appresi da fotografie terrestri.
Questo preaddestramento dovrebbe essere particolarmente prezioso quando un progetto dispone di annotazioni limitate da parte di esperti. Invece di insegnare a un sistema l'intero linguaggio visivo della Luna, i ricercatori possono concentrare le loro etichette sull'obiettivo scientifico.
IBM afferma che il modello ha utilizzato l'adattamento a basso rango, o LoRA, per le attività downstream. LoRA modifica un insieme relativamente piccolo di parametri mantenendo invariata la maggior parte del modello preaddestrato. L'azienda riferisce che il 90% dei pesi di base è rimasto congelato durante l'adattamento.
Questa tecnica riduce la quantità di calcolo e di addestramento specifico per l'attività richiesta. Offre inoltre un percorso pratico per gruppi di ricerca che non possono addestrare da zero un grande modello di visione.
Il checkpoint dei crateri rilasciato utilizza la base lunare preaddestrata con una testa di rilevamento Faster R-CNN. Faster R-CNN è un'architettura di rilevamento degli oggetti che propone regioni probabili e poi ne classifica il contenuto.
Alla scala di contesto più ampia, il checkpoint lavora con immagini della Wide Angle Camera a circa 100 metri per pixel. Il suo benchmark contiene tile associate a un catalogo annotato manualmente di oltre due milioni di crateri da impatto lunari.
La model card del modello per i crateri pubblica risultati su cinque seed casuali. Le valutazioni pubblicate hanno mantenuto fissi split del dataset, augmentation, loader, funzioni di perdita e metriche, modificando al contempo l'encoder e la sua inizializzazione.
Con metà dello split di addestramento, il modello lunare completamente perfezionato ha raggiunto una precisione media media di 0,2541. La baseline SwinV2-B preaddestrata su ImageNet ha raggiunto 0,2313 nella medesima condizione con metà dei dati.
La precisione media media, o mAP, riassume la qualità del rilevamento su varie soglie di sovrapposizione. Una previsione deve sia trovare l'oggetto sia collocare il suo bounding box sufficientemente vicino al confine etichettato.
Il miglioramento del 19% ampiamente citato si riferisce alla misura più rigorosa AP@75. Con metà dei dati, il modello lunare ha ottenuto 0,2213, contro 0,1862 per SwinV2-B. Si tratta di un miglioramento di circa il 18,9%.
Il confronto è legittimo, ma richiede di indicare la metrica. Il miglioramento della mAP complessiva nella stessa condizione con metà dei dati era più vicino al 10%.
Un secondo confronto è probabilmente più rilevante. Con metà dei dati di addestramento, la mAP di 0,2541 del modello lunare ha superato il risultato di 0,2420 di SwinV2-B quando quella baseline utilizzava lo split completo di addestramento.
Il risultato sostiene la proposta centrale del modello. Il preaddestramento di dominio può compensare parte delle etichette mancanti per l'attività, almeno su questo benchmark.
Il vantaggio non era universale a tutti i livelli di risoluzione. Nel dataset della Narrow Angle Camera a scala metrica, il modello lunare adattato ha ottenuto una mAP di 0,1543. SwinV2-B ha raggiunto 0,1552, rendendo i due risultati statisticamente indistinguibili sulla base della variazione riportata.
Il modello di IA lunare della NASA non sostituisce quindi ogni rilevatore specializzato. Le sue prove più solide riguardano l'efficienza delle etichette e il rilevamento dei crateri alla scala di contesto, mentre le prestazioni ad alta risoluzione restano comparabili alla migliore baseline testata.
Un modello collega ora crateri, ghiaccio e terreno vulcanico
Il meccanismo più profondo è il preaddestramento multimodale, che consente a un'unica base di riutilizzare relazioni apprese tra diversi strumenti e obiettivi scientifici.
Un modello di immagini generale normalmente tratta un'immagine orbitale come qualsiasi altro input visivo. Può riconoscere forme e texture, ma non ha necessariamente appreso come temperatura lunare, elevazione, illuminazione e misurazioni spettrali siano collegate.
Il NASA-IBM Lunar Foundation Model è stato progettato attorno a queste relazioni. IBM afferma che la sua architettura deriva da TerraMind, un foundation model per l'osservazione della Terra sviluppato con l'Agenzia Spaziale Europea.
La versione lunare è stata addestrata su oltre 30 livelli spazialmente allineati provenienti da più strumenti. L'allineamento significa che il modello può associare misurazioni che descrivono la stessa località, anche quando le loro scale e formati originali differiscono.
Questo è importante vicino ai poli lunari. Una regione scura in un'immagine visibile non contiene automaticamente ghiaccio d'acqua. Potrebbe semplicemente essere rivolta lontano dal Sole durante quell'osservazione.
Un modello di valutazione del potenziale del ghiaccio deve esaminare diverse proprietà collegate. Tra queste figurano la temperatura massima della superficie, la pendenza, l'orientamento del terreno, le informazioni radar e le stime della profondità alla quale il ghiaccio potrebbe rimanere stabile.
IBM riferisce che il modello ha ridotto l'errore del 22% rispetto a un sistema basato su SwinV2 nella sua attività sul ghiaccio polare. Il beneficio riportato derivava dalla combinazione delle modalità, anziché chiedere a un modello a luce visibile di dedurre le condizioni del sottosuolo dal solo aspetto.
Il modello ha inoltre mantenuto previsioni utili quando i ricercatori hanno rimosso alcuni canali di input. Questo comportamento è importante perché i dataset planetari sono raramente completi e uniformi. Un'indagine futura potrebbe non disporre di un tipo di misurazione per una regione specifica.
Il potenziale del ghiaccio resta una stima del modello, non una conferma diretta di un deposito accessibile. La formulazione della NASA è prudente: il sistema stima dove le chiazze di ghiaccio hanno probabilità di rimanere stabili sulla superficie o al di sotto di essa.
La conferma richiede osservazioni di altri strumenti o misurazioni effettuate sul posto. Concentrazione, profondità, contaminazione e difficoltà di estrazione restano questioni separate.
La terza attività dimostrata riguarda le irregular mare patches. Queste formazioni appaiono più lisce e più giovani di gran parte del terreno circostante. La loro età apparente ha sollevato interrogativi su quanto a lungo sia persistita l'attività vulcanica lunare.
Nella valutazione riportata, il risultato di segmentazione del modello ha superato una baseline Swin specifica per l'attività di circa il 3%. La segmentazione assegna i pixel del terreno a una classe target, anziché disegnare un riquadro attorno a un oggetto.
Il guadagno è inferiore al dato principale sui crateri, ma l'attività amplia il significato del modello. Un'unica base preaddestrata ha gestito rilevamento, segmentazione e previsione di valori continui in diversi problemi della scienza lunare.
Quella flessibilità mette sotto pressione lo sviluppo per singolo compito. Nel vecchio approccio, un team di ricerca seleziona un’architettura, raccoglie le etichette, addestra un modello e mantiene una pipeline personalizzata per una sola domanda.
Una base lunare riutilizzabile trasferisce gran parte di questo lavoro a un livello condiviso. I nuovi studi necessitano comunque di conoscenze di dominio, etichette appropriate, valutazione e interpretazione. Non devono necessariamente reimparare i modelli statistici di base della Luna.
NASA e IBM hanno già seguito questa strategia con modelli per l’osservazione della Terra e del Sole. I modelli Prithvi supportano applicazioni geospaziali, mentre Surya è rivolto a compiti di eliofisica quali la previsione del meteo spaziale.
Il rilascio lunare estende questa famiglia di modelli oltre la Terra e il Sole. Verifica inoltre se i foundation model scientifici possano diventare infrastrutture di ricerca condivise anziché dimostrazioni isolate.
La dettagliata panoramica del modello di IBM definisce l’attuale rilascio come un primo passo. La descrizione è appropriata. La riusabilità è l’ipotesi in fase di verifica, non un risultato ormai acquisito.
Il risultato del 19% non risolve l’affidabilità scientifica
La principale incertezza è se l’efficienza mostrata nei benchmark resista in nuove regioni, con condizioni osservative differenti e per domande di ricerca non rappresentate nella valutazione.
Il risultato sui crateri deriva da dataset curati con suddivisioni fisse e annotazioni note. Le indagini reali introducono complicazioni che un benchmark potrebbe non cogliere.
L’illuminazione è un esempio. Le immagini della superficie lunare possono cambiare drasticamente in base all’angolo di incidenza solare. In alcune condizioni le ombre rivelano la topografia, ma in altre nascondono le caratteristiche più piccole.
NASA riconosce che condizioni di illuminazione diverse tra i passaggi orbitali possono influire sulla visibilità dei piccoli crateri. Un rilevatore di cambiamenti potrebbe quindi confondere le differenze di illuminazione con una modifica fisica della superficie.
Il benchmark stesso limita la variazione dell’illuminazione per alcune tessere alla scala del contesto. Questo rende più puliti i confronti tra modelli, ma non rappresenta pienamente ogni immagine orbitale che un sistema in produzione potrebbe incontrare.
Anche la qualità delle etichette pone un problema. I cataloghi di crateri generati da esseri umani sono preziosi set di riferimento, ma non sono descrizioni perfette della realtà fisica. Gli esperti possono non concordare su bordi degradati, impatti sovrapposti e sul diametro minimo necessario per qualificare una struttura come cratere.
Un modello ottimizzato rispetto a tali etichette apprende le loro convenzioni e omissioni. Una precisione media più elevata indica una maggiore concordanza con il benchmark, non una conferma indipendente che ogni previsione sia scientificamente corretta.
Anche la fuga geografica merita attenzione. Il modello è stato preaddestrato su un’ampia copertura LRO, quindi ottimizzato e valutato su dati lunari downstream. I ricercatori devono determinare se il vantaggio appreso si trasferisca a regioni geologicamente distinte, strumenti e condizioni di acquisizione.
Non si tratta necessariamente di un difetto. I foundation model dovrebbero riutilizzare conoscenze acquisite tramite un ampio preaddestramento. Tuttavia, una solida validazione dovrebbe distinguere una generalizzazione utile dalla familiarità con la più ampia distribuzione dei dati.
Il rilascio pubblico migliora le prospettive di questo tipo di verifica. NASA e IBM hanno reso disponibili, con licenza Apache 2.0, i pesi del modello, i dataset di benchmark, le configurazioni di fine-tuning e i checkpoint downstream.
Il codice rilasciato supporta fine-tuning e inferenza tramite TerraTorch. Include configurazioni per il rilevamento dei crateri, la segmentazione delle aree vulcaniche e la stima della probabilità di presenza di ghiaccio.
Tuttavia, il repository afferma che il codice di preaddestramento non è incluso. Ciò significa che i ricercatori esterni possono ispezionare e riprodurre più facilmente l’adattamento downstream rispetto al processo di preaddestramento originale.
I pesi aperti restano comunque sostanzialmente più utili di un servizio inaccessibile. Gli scienziati possono eseguire valutazioni controllate, analizzare i casi di errore, modificare la soglia di rilevamento e confrontare la base del modello con altri sistemi.
Eppure, la scienza aperta dipende anche dalla documentazione relativa alla preparazione dei dati, alla costruzione del modello e alle decisioni di addestramento. Il rilascio di ulteriori dettagli sul preaddestramento rafforzerebbe la riproducibilità e aiuterebbe altre istituzioni ad adattare l’approccio a Marte, agli asteroidi o a nuovi strumenti lunari.
Un’altra limitazione riguarda le affermazioni operative. Il modello può contribuire alla mappatura dei crateri o alla ricerca sul ghiaccio, ma NASA non lo ha presentato come un sistema certificato per la navigazione o la sicurezza dell’atterraggio.
Le decisioni di missione richiedono prodotti del terreno verificati, stime dell’incertezza e revisione ingegneristica. Un checkpoint di ricerca che ottiene buoni risultati su immagini non viste non è automaticamente adatto a controllare un veicolo spaziale.
La stessa cautela vale per la pianificazione delle risorse. Le mappe della probabilità di presenza di ghiaccio possono ordinare le località da approfondire. Non possono stabilire quanta acqua estraibile esista in un sito né se un sistema di esplorazione possa raggiungerlo in sicurezza.
La lettura migliore delle prove è quindi specifica. Il modello ha prodotto solidi risultati iniziali in diversi compiti di benchmark, con un notevole vantaggio nell’efficienza delle etichette nel rilevamento di crateri alla scala del contesto. La replica indipendente e la validazione orientata al campo devono determinarne la reale portata scientifica.
L’accesso aperto mette sotto pressione i modelli lunari specializzati
NASA e IBM mettono sotto pressione l’approccio dei modelli personalizzati offrendo ai ricercatori una base comune, dataset e configurazioni di compiti eseguibili.
La competizione principale non è NASA contro un’altra agenzia spaziale o IBM contro un’altra azienda tecnologica. È una scelta tecnica tra preaddestramento di dominio riutilizzabile e modelli separati costruiti per compiti individuali.
I sistemi generali di computer vision restano rilevanti per questo confronto. SwinV2-B, uno dei principali modelli di riferimento, è un vision transformer gerarchico inizialmente preaddestrato su normali dataset di immagini.
Questi modelli beneficiano di strumenti maturi e di test approfonditi. Possono anche ottenere buoni risultati nei compiti lunari dopo il fine-tuning, come dimostra il risultato sui crateri alla scala del metro.
Il vantaggio del modello lunare deriva dalla precedente esposizione al dominio di destinazione. I suoi dati di preaddestramento includono texture, scale, canali dei sensori e relazioni del terreno che un modello di immagini terrestri deve apprendere durante l’adattamento.
Questo vantaggio diventa più prezioso quando le etichette sono scarse. Il risultato riportato con metà dei dati suggerisce che un piccolo team di ricerca può avvicinarsi o superare le prestazioni a dati completi di un modello generale senza annotare altrettanti esempi.
L’economia differisce dall’IA generativa commerciale. Il costo rilevante non riguarda solo il tempo sugli acceleratori. Gli scienziati planetari devono definire le etichette, risolvere gli esempi ambigui, preparare dataset spaziali e validare gli output rispetto alle conoscenze scientifiche.
Ridurre questo lavoro può abbreviare un esperimento. Può inoltre rendere analisi specializzate accessibili a team con solide competenze scientifiche ma infrastrutture di machine learning limitate.
La distribuzione aperta modifica ulteriormente l’equilibrio. Il modello e i checkpoint downstream sono disponibili tramite la raccolta pubblica di modelli, anziché dietro un’interfaccia applicativa proprietaria.
I ricercatori possono effettuare il fine-tuning in locale, ispezionare le configurazioni e confrontare i risultati sui propri dati. Possono inoltre pubblicare analisi degli errori senza dipendere dal servizio ospitato di un fornitore.
Questo approccio è in linea con gli obiettivi più ampi di scienza aperta della NASA. Le osservazioni finanziate con fondi pubblici acquisiscono ulteriore valore quando istituzioni esterne possono sviluppare rappresentazioni riutilizzabili invece di ripulire ripetutamente gli stessi archivi.
Il rilascio crea anche pressione per benchmark migliori. Quando la comunità condivide una base comune, i disaccordi possono concentrarsi sulla progettazione della valutazione, sull’incertezza e sull’utilità scientifica.
I confronti futuri dovrebbero testare regioni geografiche non familiari, combinazioni di sensori modificate e cambiamenti temporali. Dovrebbero inoltre misurare la calibrazione, ossia se la confidenza del modello rifletta accuratamente il suo tasso di errore.
Gli utenti operativi avranno bisogno di più di un risultato in classifica. Devono sapere quando il modello è incerto, quale canale di input ha guidato una previsione e come cambiano le prestazioni quando le osservazioni sono assenti o degradate.
I team accademici possono ora indagare queste domande usando gli artefatti rilasciati. Le loro conclusioni stabiliranno se questo progetto diventerà un’infrastruttura duratura o resterà un’impressionante raccolta di dimostrazioni per singoli compiti.
Tre segnali mostreranno se l’IA lunare andrà oltre i benchmark
La fase successiva è la verifica della comunità, seguita dalla prova che la stessa base possa supportare nuova scienza senza un esteso riaddestramento.
Il primo segnale è la riproduzione indipendente dei benchmark. I team esterni dovrebbero essere in grado di recuperare risultati comparabili per crateri, ghiaccio e mappatura vulcanica a partire da pesi, dati e configurazioni rilasciati.
Questo test chiarirà il significato della cifra del 19%. Dovrebbe mantenere la distinzione tra AP@75, mAP complessivo, prestazioni con metà dei dati e la valutazione separata alla scala del metro.
La riproduzione rafforzerebbe la fiducia nelle affermazioni ingegneristiche. Differenze significative e inspiegate indebolirebbero l’argomentazione a favore dell’uso del modello come riferimento scientifico comune.
Il secondo segnale è il trasferimento a dati non familiari. I ricercatori dovrebbero testare regioni, geometrie osservative, strumenti o obiettivi diversi dai benchmark downstream rilasciati.
Un risultato convincente mostrerebbe che il NASA-IBM Lunar Foundation Model riduce i requisiti di etichettatura in un compito selezionato dopo il preaddestramento. Ciò sosterrebbe l’affermazione che abbia appreso rappresentazioni lunari ampiamente riutilizzabili.
Un trasferimento debole suggerirebbe che i guadagni attuali dipendono fortemente dalla distribuzione di addestramento. Il modello potrebbe restare utile, ma il suo ruolo assomiglierebbe più a quello di una solida base specializzata che a un’infrastruttura lunare generale.
Il terzo segnale è l’adozione in ricerche pubblicate o flussi di lavoro per la pianificazione delle missioni. Gli scienziati devono dimostrare che il modello modifica un processo analitico reale, non soltanto il suo punteggio di benchmark.
Prove utili potrebbero includere un nuovo catalogo di crateri, un insieme prioritario di osservazioni polari o una mappa vulcanica che gli esperti validano rispetto a misurazioni indipendenti. Un team di missione potrebbe anche documentare come gli output del modello abbiano ridotto lo screening manuale senza aggirare la revisione scientifica.
NASA e IBM dovrebbero pubblicare i casi di errore insieme alle applicazioni riuscite. Artefatti di illuminazione, canali mancanti, terreni insoliti ed etichette ambigue possono rivelare dove il giudizio umano rimanga essenziale.
Gli sviluppatori dovrebbero seguire il progetto anche per un’altra ragione. Il rilascio offre un test concreto dei foundation model di dominio al di fuori della generazione linguistica. La sua domanda centrale si applica alla medicina, alla scienza del clima, alla produzione industriale e al telerilevamento: un ampio preaddestramento non supervisionato può ridurre le costose etichette necessarie per il lavoro specializzato?
I ricercatori possono iniziare dal rapporto tecnico, esaminare le schede del modello e riprodurre un compito downstream prima di aggiungere nuovi dati. Il contributo più prezioso potrebbe non essere un punteggio più alto. Potrebbe essere un caso attentamente documentato in cui il modello lunare fallisce.
I team indipendenti confermeranno il suo vantaggio nell’efficienza delle etichette, per poi estenderlo a osservazioni e domande che NASA e IBM non hanno scelto? È questo lo standard che il NASA-IBM Lunar Foundation Model deve soddisfare prima che un benchmark promettente diventi un’infrastruttura scientifica affidabile.



