top of page

El modelo fundacional lunar de NASA-IBM supera una referencia de cráteres con la mitad de las etiquetas

hace 5 días
15 min de lectura

NASA e IBM lanzaron el modelo fundacional lunar NASA-IBM tras informar de una mejora de casi el 19% en la detección de cráteres usando la mitad de los datos de entrenamiento etiquetados. El resultado se refiere a un benchmark específico con una resolución aproximada de 100 metros por píxel, no a todas las tareas de cartografía de cráteres. Esta distinción es importante porque el valor más amplio del modelo depende de que los investigadores puedan adaptar una misma base de datos lunares a diversos problemas científicos.

El modelo combina observaciones recopiladas con distintas resoluciones, ángulos de observación y longitudes de onda. Los investigadores pueden ajustarlo para la detección de cráteres, la prospección de hielo polar y la cartografía de formaciones volcánicas inusuales. NASA e IBM también publicaron los pesos del modelo, conjuntos de datos posteriores y código para probar el sistema.

Esto es más que otra demostración de reconocimiento de imágenes. La ciencia lunar ha acumulado grandes conjuntos de datos procedentes de instrumentos que miden distintas propiedades físicas a escalas radicalmente diferentes. Los científicos suelen crear flujos de trabajo especializados para cada tarea, mientras que el nuevo modelo ofrece un punto de partida reutilizable entrenado con observaciones lunares.

Esto plantea la prueba central. Un modelo fundacional específico de un dominio debería reducir las etiquetas, la capacidad de cómputo y la ingeniería necesarias para nuevos estudios. Aun así, debe producir resultados científicamente fiables en ubicaciones, condiciones de iluminación, instrumentos y preguntas de investigación desconocidos.

El modelo fundacional lunar NASA-IBM convierte los archivos lunares en infraestructura reutilizable

El cambio inmediato es que los investigadores lunares disponen ahora de un modelo preentrenado y disponible abiertamente, en lugar de comenzar cada proyecto de cartografía con un sistema de visión generalista.

NASA anunció el modelo el 10 de septiembre de 2026, como parte de su colaboración continua con IBM Research en IA para la ciencia. La agencia lo describe como uno de los primeros modelos fundacionales de código abierto creados específicamente para la ciencia lunar.

Un modelo fundacional se entrena con un conjunto de datos amplio antes de adaptarse a tareas más concretas. En este caso, el preentrenamiento enseña al sistema patrones recurrentes del terreno lunar y las mediciones de sensores. Después, los investigadores pueden añadir conjuntos de datos más pequeños y específicos para la detección de cráteres, el análisis de hielo o la cartografía volcánica.

El modelo se entrenó principalmente con observaciones del Lunar Reconnaissance Orbiter de NASA, o LRO. NASA afirma que la nave ha recopilado más datos que todas sus demás misiones planetarias combinadas durante 17 años de operaciones.

Según el lanzamiento del modelo lunar de la agencia, el corpus de entrenamiento contenía aproximadamente dos millones de mosaicos de imágenes. Ese total incluía más de un millón de imágenes de cámaras de alta resolución a un metro de resolución y casi 964.000 imágenes multiespectrales a 100 metros de resolución.

Otras entradas procedían de las misiones GRAIL y Lunar Prospector de NASA, además de la misión SELENE de la agencia espacial japonesa. Estas misiones no observaron la Luna de formas idénticas.

Las cámaras ópticas registran la luz reflejada. La altimetría describe la elevación, mientras que las mediciones térmicas y espectrales capturan otras propiedades físicas. Sus resoluciones espaciales pueden abarcar desde aproximadamente un metro por píxel hasta mediciones que cubren kilómetros.

El modelo NASA-IBM convierte estas observaciones heterogéneas en una representación compartida. Esa representación es la biblioteca interna de patrones que los modelos posteriores pueden reutilizar.

NASA identifica tres prioridades científicas iniciales. Los investigadores quieren catalogar cráteres pequeños, estudiar formaciones volcánicas relativamente jóvenes y estimar dónde el hielo permanece estable cerca de los polos lunares.

Cada tarea responde a una pregunta científica diferente. Los recuentos de cráteres ayudan a los investigadores a estimar la edad de las superficies. Las manchas irregulares de mares lunares, que son formaciones volcánicas inusuales, pueden precisar la historia térmica de la Luna. Los mapas de hielo polar pueden orientar la investigación sobre volátiles lunares e informar la planificación de futuras exploraciones.

El modelo también reconoció un cráter recién formado cerca del cráter Einstein en una prueba de imágenes de antes y después. Según NASA, la observación posterior al impacto se excluyó del preentrenamiento. Esto convierte el ejemplo en una prueba útil de adaptación a un cambio superficial que el modelo preentrenado no había visto previamente.

Sin embargo, el ejemplo no significa que el sistema descubriera de forma autónoma un impacto desconocido en toda la Luna. Muestra que un modelo ajustado puede identificar un tipo conocido de cambio dentro de imágenes orbitales preparadas.

Esta descripción más limitada sigue representando un avance útil. El filtrado automatizado puede ayudar a los científicos a reducir un archivo enorme a un conjunto manejable de ubicaciones candidatas para la revisión de expertos.

Por qué la detección de cráteres con IA necesita menos etiquetas, no solo una puntuación más alta

La cifra del 19% importa porque los datos lunares etiquetados son escasos, caros de producir y a menudo dependen del criterio de especialistas.

Los sistemas de aprendizaje automático necesitan ejemplos que conecten una imagen de entrada con el resultado esperado. Para la detección de cráteres, esas etiquetas describen dónde aparecen los cráteres y cómo deben representarse sus límites.

Crear estas anotaciones no equivale a etiquetar fotografías cotidianas. Los cráteres se superponen, se erosionan y se ven de forma diferente bajo una iluminación solar cambiante. Las pequeñas depresiones pueden parecerse a sombras u otras estructuras del terreno. La resolución también determina qué formaciones son suficientemente visibles para clasificarlas.

El modelo NASA-IBM aborda esta tarea con conocimientos aprendidos de un conjunto mucho mayor de datos lunares sin etiquetar. No parte de parámetros aleatorios ni únicamente de patrones aprendidos de fotografías terrestres.

Este preentrenamiento debería ser especialmente valioso cuando un proyecto cuenta con anotaciones limitadas de expertos. En lugar de enseñar a un sistema todo el lenguaje visual de la Luna, los investigadores pueden concentrar sus etiquetas en el objetivo científico.

IBM afirma que el modelo utilizó adaptación de bajo rango, o LoRA, para las tareas posteriores. LoRA ajusta un conjunto relativamente pequeño de parámetros mientras mantiene sin cambios la mayor parte del modelo preentrenado. La empresa informa de que el 90% de los pesos base permanecieron congelados durante la adaptación.

Esta técnica reduce la capacidad de cómputo y el entrenamiento específico de cada tarea necesarios. También ofrece una vía práctica para grupos de investigación que no pueden entrenar desde cero un gran modelo de visión.

El checkpoint de cráteres publicado utiliza la base lunar preentrenada con una cabeza de detección Faster R-CNN. Faster R-CNN es una arquitectura de detección de objetos que propone regiones probables y luego clasifica su contenido.

A la escala de contexto más amplia, el checkpoint trabaja con imágenes de la Wide Angle Camera a aproximadamente 100 metros por píxel. Su benchmark contiene mosaicos asociados a un catálogo anotado manualmente de más de dos millones de cráteres de impacto lunares.

La ficha pública del modelo de cráteres informa resultados para cinco semillas aleatorias. Las evaluaciones publicadas mantuvieron fijas las divisiones del conjunto de datos, los aumentos, los cargadores, las pérdidas y las métricas, mientras cambiaban el codificador y su inicialización.

Con la mitad de la división de entrenamiento, el modelo lunar totalmente ajustado alcanzó una precisión media promedio de 0,2541. La referencia SwinV2-B preentrenada con ImageNet alcanzó 0,2313 bajo la misma condición de datos a la mitad.

La precisión media promedio, o mAP, resume la calidad de detección en varios umbrales de superposición. Una predicción debe encontrar el objeto y colocar su cuadro delimitador suficientemente cerca del límite etiquetado.

La mejora del 19% ampliamente citada se refiere a la medición más estricta AP@75. Con la mitad de los datos, el modelo lunar obtuvo 0,2213, frente a 0,1862 de SwinV2-B. Esto supone una mejora de aproximadamente el 18,9%.

La comparación es legítima, pero debe ir acompañada de la métrica. La mejora en el mAP general bajo la misma condición de datos a la mitad fue más cercana al 10%.

Una segunda comparación es posiblemente más relevante. Con la mitad de los datos de entrenamiento, el mAP de 0,2541 del modelo lunar superó el resultado de 0,2420 de SwinV2-B cuando esa referencia utilizó la división completa de entrenamiento.

Ese resultado respalda la propuesta central del modelo. El preentrenamiento específico del dominio puede compensar parte de las etiquetas de tarea ausentes, al menos en este benchmark.

La ventaja no fue universal en todos los niveles de resolución. En el conjunto de datos de la Narrow Angle Camera a escala métrica, el modelo lunar adaptado obtuvo un mAP de 0,1543. SwinV2-B alcanzó 0,1552, lo que hace que los dos sean estadísticamente indistinguibles según la variación reportada.

Por lo tanto, el modelo de IA lunar de NASA no sustituye a todos los detectores especializados. Su evidencia más sólida se refiere a la eficiencia en el uso de etiquetas y a la detección de cráteres a escala de contexto, mientras que el rendimiento a resolución fina sigue siendo comparable al de la mejor referencia probada.

Un modelo conecta ahora cráteres, hielo y terreno volcánico

El mecanismo más profundo es el preentrenamiento multimodal, que permite a una misma base reutilizar relaciones aprendidas entre varios instrumentos y objetivos científicos.

Un modelo de imágenes generalista normalmente trata una imagen orbital como otra entrada visual. Puede reconocer formas y texturas, pero no necesariamente ha aprendido cómo se relacionan la temperatura lunar, la elevación, la iluminación y las mediciones espectrales.

El modelo fundacional lunar NASA-IBM fue diseñado en torno a esas relaciones. IBM afirma que su arquitectura deriva de TerraMind, un modelo fundacional de observación de la Tierra desarrollado con la Agencia Espacial Europea.

La versión lunar fue entrenada con más de 30 capas espacialmente alineadas procedentes de múltiples instrumentos. La alineación significa que el modelo puede asociar mediciones que describen la misma ubicación, incluso cuando sus escalas y formatos originales difieren.

Esto es importante cerca de los polos lunares. Una región oscura en una imagen visible no contiene automáticamente hielo de agua. Podría simplemente estar orientada en dirección opuesta al Sol durante esa observación.

Un modelo de prospección de hielo debe examinar varias propiedades conectadas. Entre ellas se incluyen la temperatura máxima de la superficie, la pendiente, la orientación del terreno, la información de radar y las estimaciones de la profundidad a la que el hielo podría permanecer estable.

IBM informa de que el modelo redujo el error en un 22% frente a un sistema basado en SwinV2 en su tarea de hielo polar. El beneficio reportado provino de combinar modalidades, en lugar de pedir a un modelo de luz visible que infiera condiciones subsuperficiales solo a partir de la apariencia.

El modelo también mantuvo predicciones útiles cuando los investigadores eliminaron algunos canales de entrada. Este comportamiento es relevante porque los conjuntos de datos planetarios rara vez son completos y uniformes. Una investigación futura podría carecer de un tipo de medición para una región determinada.

La prospección de hielo sigue siendo una estimación del modelo, no una confirmación directa de un depósito accesible. La redacción de NASA es cautelosa: el sistema estima dónde es probable que las capas de hielo permanezcan estables sobre o bajo la superficie.

La confirmación requiere observaciones de otros instrumentos o mediciones realizadas en la ubicación. La concentración, la profundidad, la contaminación y la dificultad de extracción siguen siendo cuestiones independientes.

La tercera tarea demostrada se refiere a las manchas irregulares de mares lunares. Estas formaciones parecen más lisas y jóvenes que gran parte del terreno circundante. Su edad aparente ha suscitado preguntas sobre cuánto tiempo persistió la actividad volcánica lunar.

En la evaluación reportada, el resultado de segmentación del modelo superó a una referencia Swin específica para la tarea en aproximadamente un 3%. La segmentación asigna píxeles del terreno a una clase objetivo, en lugar de dibujar un cuadro alrededor de un objeto.

La mejora es menor que el titular sobre cráteres, pero la tarea amplía la relevancia del modelo. Una sola base preentrenada gestionó detección, segmentación y predicción de valores continuos en distintos problemas de ciencia lunar.

Esa flexibilidad ejerce presión sobre la vía de desarrollo tarea por tarea. Bajo ese enfoque anterior, un equipo de investigación selecciona una arquitectura, reúne etiquetas, entrena un modelo y mantiene una canalización personalizada para una pregunta.

Una base lunar reutilizable traslada gran parte de ese trabajo a una capa compartida. Los nuevos estudios siguen necesitando conocimiento del dominio, etiquetas adecuadas, evaluación e interpretación. No necesariamente necesitan volver a aprender los patrones estadísticos básicos de la Luna.

NASA e IBM ya siguieron esta estrategia con modelos de observación de la Tierra y del Sol. Los modelos Prithvi respaldan aplicaciones geoespaciales, mientras que Surya se dirige a tareas de heliofísica como la predicción del clima espacial.

La versión lunar extiende esa familia de modelos más allá de la Tierra y el Sol. También pone a prueba si los modelos fundacionales científicos pueden convertirse en infraestructura de investigación compartida en lugar de demostraciones aisladas.

La detallada descripción general del modelo de IBM califica la versión actual como una primera iteración. Esa descripción es adecuada. La reutilización es la propuesta que se está poniendo a prueba, no un resultado ya consolidado.

El resultado del 19% no resuelve la fiabilidad científica

La principal incertidumbre es si la eficiencia de los benchmarks se mantiene en nuevas regiones, distintas condiciones de observación y preguntas de investigación que no estuvieron representadas durante la evaluación.

El resultado sobre cráteres procede de conjuntos de datos curados con divisiones fijas y anotaciones conocidas. Las investigaciones reales introducen complicaciones que un benchmark puede no captar.

La iluminación es un ejemplo. Las imágenes de la superficie lunar pueden cambiar drásticamente según el ángulo de incidencia solar. Las sombras revelan la topografía en algunas condiciones, pero ocultan rasgos más pequeños en otras.

NASA reconoce que las distintas condiciones de iluminación entre pasadas orbitales pueden afectar la visibilidad de cráteres pequeños. Por tanto, un detector de cambios podría confundir diferencias de iluminación con un cambio físico de la superficie.

El propio benchmark limita la variación de iluminación en algunos mosaicos de escala contextual. Esto hace más limpias las comparaciones entre modelos, pero no representa por completo todas las imágenes orbitales que un sistema de producción podría encontrar.

La calidad de las etiquetas plantea otro problema. Los catálogos de cráteres generados por humanos son conjuntos de referencia valiosos, pero no son descripciones perfectas de la realidad física. Los expertos pueden discrepar sobre bordes degradados, impactos superpuestos y el diámetro mínimo que califica como cráter.

Un modelo optimizado frente a esas etiquetas aprende sus convenciones y omisiones. Una mayor precisión media implica una mejor concordancia con el benchmark, no una confirmación independiente de que cada predicción sea científicamente correcta.

La filtración geográfica también merece escrutinio. El modelo fue preentrenado con una amplia cobertura de LRO y luego ajustado y evaluado con datos lunares posteriores. Los investigadores deben determinar si la ventaja aprendida se transfiere a regiones, instrumentos y condiciones de adquisición geológicamente distintos.

Esto no es necesariamente un defecto. Los modelos fundacionales están diseñados para reutilizar conocimiento de preentrenamiento amplio. Sin embargo, una validación sólida debe separar la generalización útil de la familiaridad con la distribución de datos más amplia.

La publicación pública mejora las perspectivas para realizar dichas pruebas. NASA e IBM pusieron a disposición los pesos del modelo, los conjuntos de datos de benchmark, las configuraciones de ajuste fino y los checkpoints posteriores bajo una licencia Apache 2.0.

El código publicado admite ajuste fino e inferencia mediante TerraTorch. Incluye configuraciones para detección de cráteres, segmentación de zonas volcánicas y prospección de hielo.

Sin embargo, el repositorio indica que no se incluye el código de preentrenamiento. Esto significa que los investigadores externos pueden inspeccionar y reproducir la adaptación posterior con mayor facilidad de la que pueden recrear el proceso original de preentrenamiento.

Los pesos abiertos siguen siendo sustancialmente más útiles que un servicio inaccesible. Los científicos pueden ejecutar evaluaciones controladas, examinar casos de fallo, cambiar el umbral de detección y comparar la base con otros sistemas.

No obstante, la ciencia abierta también depende de documentar la preparación de datos, la construcción del modelo y las decisiones de entrenamiento. Publicar detalles adicionales del preentrenamiento reforzaría la reproducibilidad y ayudaría a otras instituciones a adaptar el enfoque a Marte, asteroides o nuevos instrumentos lunares.

Otra limitación se refiere a las afirmaciones operativas. El modelo puede orientar el mapeo de cráteres o la investigación sobre hielo, pero NASA no lo ha presentado como un sistema certificado de navegación o seguridad de aterrizaje.

Las decisiones de misión requieren productos de terreno verificados, estimaciones de incertidumbre y revisión de ingeniería. Un checkpoint de investigación que funciona bien con imágenes reservadas para evaluación no es automáticamente adecuado para controlar una nave espacial.

La misma cautela se aplica a la planificación de recursos. Los mapas de prospección de hielo pueden clasificar ubicaciones para estudios posteriores. No pueden establecer cuánta agua extraíble existe en un sitio ni si un sistema de exploración puede alcanzarlo de forma segura.

Por tanto, la mejor interpretación de la evidencia es específica. El modelo ha producido sólidos resultados iniciales en varias tareas de benchmark, con una notable ventaja de eficiencia de etiquetas en la detección de cráteres a escala contextual. La replicación independiente y la validación orientada al trabajo de campo deben determinar su alcance científico práctico.

El acceso abierto presiona a los modelos lunares especializados

NASA e IBM están presionando la vía de los modelos personalizados al ofrecer a los investigadores una base común, conjuntos de datos y configuraciones de tareas ejecutables.

La competencia principal no es NASA frente a otra agencia espacial ni IBM frente a otra empresa tecnológica. Es una elección técnica entre preentrenamiento reutilizable de dominio y modelos separados construidos para tareas individuales.

Los sistemas generales de visión por computadora siguen siendo relevantes para esa comparación. SwinV2-B, una de las principales líneas base, es un transformador visual jerárquico preentrenado inicialmente con conjuntos de datos de imágenes comunes.

Esos modelos se benefician de herramientas maduras y pruebas extensas. También pueden funcionar bien en tareas lunares tras el ajuste fino, como demuestra el resultado de cráteres a escala métrica.

La ventaja del modelo lunar es su exposición previa al dominio objetivo. Sus datos de preentrenamiento incluyen las texturas, escalas, canales de sensores y relaciones del terreno que un modelo de imágenes terrestres debe aprender durante la adaptación.

Esa ventaja se vuelve más valiosa cuando las etiquetas escasean. El resultado comunicado con la mitad de los datos sugiere que un equipo de investigación pequeño puede aproximarse o superar el rendimiento de un modelo general con todos los datos sin anotar tantos ejemplos.

La economía difiere de la IA generativa comercial. El coste relevante no es solo el tiempo de aceleradores. Los científicos planetarios deben definir etiquetas, resolver ejemplos ambiguos, preparar conjuntos de datos espaciales y validar las salidas frente al conocimiento científico.

Reducir ese trabajo puede acortar un experimento. También puede poner análisis especializados al alcance de equipos con una sólida experiencia científica, pero infraestructura limitada de aprendizaje automático.

La distribución abierta modifica aún más el equilibrio. El modelo y los checkpoints posteriores están disponibles a través de la colección pública de modelos, en lugar de permanecer tras una interfaz de aplicación propietaria.

Los investigadores pueden realizar ajuste fino localmente, inspeccionar configuraciones y comparar resultados con sus propios datos. También pueden publicar análisis de fallos sin depender de un servicio alojado por un proveedor.

Este enfoque se alinea con los objetivos más amplios de ciencia abierta de NASA. Las observaciones financiadas con fondos públicos adquieren valor adicional cuando instituciones externas pueden basarse en representaciones reutilizables, en lugar de limpiar repetidamente los mismos archivos.

La publicación también genera presión para mejorar los benchmarks. Una vez que la comunidad comparte una base, los desacuerdos pueden orientarse hacia el diseño de la evaluación, la incertidumbre y la utilidad científica.

Las comparaciones futuras deberían probar regiones geográficas desconocidas, combinaciones de sensores modificadas y cambios temporales. También deberían medir la calibración, que pregunta si la confianza del modelo refleja con precisión su tasa de error.

Los usuarios operativos necesitarán más que un resultado en una tabla de clasificación. Deben saber cuándo el modelo es incierto, qué canal de entrada impulsó una predicción y cómo cambia el rendimiento cuando faltan observaciones o estas se degradan.

Los equipos académicos ya pueden investigar estas cuestiones usando los artefactos publicados. Sus hallazgos decidirán si este proyecto se convierte en infraestructura duradera o sigue siendo una impresionante colección de demostraciones de tareas.

Tres señales mostrarán si la IA lunar avanza más allá de los benchmarks

La siguiente etapa es la verificación por parte de la comunidad, seguida de evidencia de que la misma base puede respaldar nueva ciencia sin un reentrenamiento extenso.

La primera señal es la reproducción independiente de los benchmarks. Equipos externos deberían poder recuperar resultados comparables en cráteres, hielo y mapeo volcánico a partir de los pesos, datos y configuraciones publicados.

Esta prueba aclarará el significado de la cifra del 19%. Debe preservar la distinción entre AP@75, mAP global, rendimiento con la mitad de los datos y la evaluación independiente a escala métrica.

La reproducción reforzaría la confianza en las afirmaciones de ingeniería. Diferencias significativas sin explicación debilitarían el argumento a favor de usar el modelo como una línea base científica común.

La segunda señal es la transferencia a datos desconocidos. Los investigadores deberían probar regiones, geometrías de observación, instrumentos u objetivos que difieran de los benchmarks posteriores publicados.

Un resultado convincente demostraría que el NASA-IBM Lunar Foundation Model reduce los requisitos de etiquetado en una tarea seleccionada después del preentrenamiento. Eso respaldaría la afirmación de que aprendió representaciones lunares ampliamente reutilizables.

Una transferencia deficiente sugeriría que las ganancias actuales dependen en gran medida de la distribución de entrenamiento. El modelo podría seguir siendo útil, pero su papel se parecería más al de una sólida base especializada que al de infraestructura lunar general.

La tercera señal es la adopción en investigaciones publicadas o flujos de trabajo de planificación de misiones. Los científicos deben demostrar que el modelo cambia un proceso analítico real, no únicamente su puntuación de benchmark.

La evidencia útil podría incluir un nuevo catálogo de cráteres, un conjunto priorizado de observaciones polares o un mapa volcánico que expertos validen frente a mediciones independientes. Un equipo de misión también podría documentar cómo las salidas del modelo redujeron la revisión manual sin eludir la revisión científica.

NASA e IBM deberían publicar casos de fallo junto con aplicaciones exitosas. Los artefactos de iluminación, los canales ausentes, el terreno inusual y las etiquetas ambiguas pueden revelar dónde el juicio humano sigue siendo esencial.

Los desarrolladores deberían seguir el proyecto por otra razón. La publicación ofrece una prueba concreta de los modelos fundacionales de dominio fuera de la generación de lenguaje. Su pregunta central se aplica a la medicina, la ciencia climática, la fabricación y la teledetección: ¿puede el preentrenamiento amplio sin etiquetas reducir las costosas etiquetas necesarias para trabajo especializado?

Los investigadores pueden comenzar con el informe técnico, examinar las tarjetas de modelo y reproducir una tarea posterior antes de añadir nuevos datos. La contribución más valiosa quizá no sea una puntuación más alta. Puede ser un caso cuidadosamente documentado en el que el modelo lunar falla.

¿Confirmarán equipos independientes su ventaja de eficiencia de etiquetas y luego la extenderán a observaciones y preguntas que NASA e IBM no eligieron? Ese es el estándar que el NASA-IBM Lunar Foundation Model debe cumplir antes de que un benchmark prometedor se convierta en infraestructura científica fiable.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page