top of page

El modelo lunar de IA de NASA e IBM abre los datos de la Luna, pero no las decisiones de misión

27 sept
14 min de lectura

NASA e IBM publicaron un modelo de código abierto que conecta observaciones lunares de distintos instrumentos, resoluciones y condiciones de iluminación. El modelo lunar de IA de NASA e IBM aborda un persistente cuello de botella en la investigación: los científicos disponen de abundantes datos de la Luna, pero convertirlos en mapas coherentes sigue siendo difícil.

El lanzamiento es más que otro clasificador de imágenes científicas. Es un intento de convertir décadas de observaciones desconectadas en una base técnica reutilizable. Los investigadores pueden adaptar esa base para la detección de cráteres, la cartografía volcánica y las estimaciones de estabilidad del hielo polar.

El conflicto clave se sitúa entre acelerar la investigación y generar confianza operativa. NASA quiere que los científicos extraigan más valor de sus archivos sin tener que construir cada modelo analítico desde cero. Sin embargo, el modelo publicado no está certificado para seleccionar lugares de alunizaje, evaluar riesgos ni realizar mediciones científicas.

Esta distinción importa a medida que la exploración lunar avanza hacia misiones más largas y operaciones de superficie más exigentes. Mejores mapas pueden orientar las prioridades de investigación y las simulaciones. No pueden sustituir los instrumentos, los productos geodésicos ni las revisiones de seguridad de las misiones.

Lo que NASA e IBM realmente publicaron

El lanzamiento combina un modelo entrenado, datos preparados para aprendizaje automático, benchmarks y código, en lugar de ofrecer una aplicación de cartografía lunar de propósito único.

NASA anunció el NASA-IBM Lunar Foundation Model el 10 de septiembre de 2026. IBM Research, equipos de NASA y socios académicos lo desarrollaron para la teledetección lunar multimodal.

Un modelo fundacional es un sistema preentrenado con datos amplios antes de que los investigadores lo adapten a tareas más específicas. Este enfoque difiere de entrenar un modelo especializado de forma independiente para cada catálogo de cráteres o estudio geológico.

El modelo está disponible a través de un repositorio abierto de modelos bajo la licencia Apache 2.0. Su código de apoyo funciona con TerraTorch, una herramienta de código abierto para adaptar modelos geoespaciales.

El lanzamiento también incluye SomBench, una colección creada para respaldar el entrenamiento y la comparación de modelos lunares. Sus registros alinean observaciones de distintos instrumentos sobre ubicaciones coincidentes de la superficie.

NASA afirma que el corpus de entrenamiento contiene casi dos millones de conjuntos de teselas coregistradas. Incluye 963.609 conjuntos a escala regional y 1.000.113 conjuntos de alta resolución.

Las imágenes regionales cubren áreas de unos 51,2 kilómetros de lado, con aproximadamente 100 metros por píxel. Las teselas de mayor resolución abarcan unos 512 metros, con cerca de un metro por píxel.

Los datos representan 11 modalidades en esas dos escalas. Las modalidades son tipos distintos de observaciones, como imágenes visibles, topografía, pendientes, comportamiento térmico, información de radar o datos gravitacionales.

El Lunar Reconnaissance Orbiter de NASA proporcionó gran parte de las imágenes. La nave espacial ha observado la Luna durante 17 años y ha generado más datos que el conjunto de las demás misiones planetarias de NASA.

Las entradas adicionales procedieron de las misiones GRAIL y Lunar Prospector de NASA. La colección también incluye observaciones de la misión japonesa Kaguya y de varios instrumentos lunares especializados.

La visión general del lanzamiento de NASA describe tres áreas de investigación inmediatas. Se trata de la cartografía de cráteres, la segmentación de formaciones volcánicas irregulares y las estimaciones del potencial de hielo polar.

El modelo no descubre agua directamente ni certifica una zona segura de alunizaje. Aprende representaciones reutilizables que los investigadores pueden adaptar con ejemplos etiquetados para una cuestión científica concreta.

Ese es el cambio central. Los investigadores cuentan ahora con un punto de partida común preentrenado para varias tareas lunares, en vez de otro modelo aislado vinculado a un único conjunto de datos.

El lanzamiento también reduce una barrera práctica de acceso. Los equipos de investigación más pequeños pueden comenzar con pesos preentrenados en lugar de reproducir todo el proceso de preparación de datos y entrenamiento.

Sin embargo, el acceso no elimina la necesidad de experiencia especializada. Los equipos siguen necesitando etiquetas adecuadas, métodos de evaluación, recursos informáticos y revisión científica para cada uso posterior.

Por qué los datos lunares necesitan un modelo de IA distinto

La Luna plantea un problema de visión por computadora excepcionalmente difícil porque el aspecto de su superficie cambia según la iluminación, la escala, el tipo de sensor y la geometría de observación.

Un cráter fotografiado bajo un ángulo de iluminación puede parecer sustancialmente distinto bajo otro. Las sombras pueden ocultar rocas y pendientes, mientras que el resplandor puede borrar límites geológicos sutiles.

Estos efectos son especialmente graves cerca de los polos. Allí el Sol permanece bajo en el horizonte, creando largas sombras sobre un terreno que ya contiene pendientes pronunciadas y cráteres profundos.

La Luna tampoco tiene una atmósfera sustancial que difunda la luz solar. Por ello, las imágenes contienen transiciones abruptas entre el terreno iluminado y la oscuridad, lo que complica las comparaciones entre pasadas orbitales.

Los modelos de imagen convencionales pueden confundir estos cambios visuales con diferencias físicas. El problema se vuelve más difícil cuando los investigadores combinan imágenes ópticas con mediciones de elevación, temperatura, radar, minerales y gravedad.

Los distintos instrumentos también observan a escalas radicalmente diferentes. Un mapa regional puede capturar un contexto geológico amplio, pero pasar por alto rocas individuales, cráteres pequeños y crestas estrechas.

Las imágenes de alta resolución revelan esas características locales, pero cubren áreas mucho menores. Un modelo útil debe conectar el contexto regional con el detalle local sin pretender que ambas fuentes miden lo mismo.

El equipo de NASA e IBM adaptó la arquitectura TerraMind, desarrollada originalmente para la observación multimodal de la Tierra. La versión lunar utiliza un codificador y un decodificador transformer de 12 capas cada uno.

Su proceso de entrenamiento utiliza aprendizaje de tokens enmascarados. El sistema recibe partes incompletas de un conjunto de datos y aprende a reconstruir información oculta a partir de las observaciones restantes.

Esta tarea anima al modelo a aprender relaciones entre el terreno, la reflectancia, la pendiente, la iluminación y otros contextos físicos. No exige que los investigadores etiqueten manualmente cada ejemplo de preentrenamiento.

El equipo añadió la geometría de adquisición como contexto explícito. Ese contexto incluye la incidencia solar, los ángulos de observación, la posición de la nave espacial, la ubicación de la tesela y la distancia de muestreo en tierra.

Este diseño proporciona al modelo información sobre cómo se capturó una imagen. Reduce la presión para que el modelo infiera una geometría ya conocida únicamente a partir de las sombras y el brillo de la superficie.

El modelo también se entrena con ambas familias principales de resolución mediante un único proceso de entrenamiento mixto. Por tanto, los mismos pesos cubren una diferencia de escala de aproximadamente 100 veces.

Las incrustaciones de parches FlexiViT permiten a los investigadores ajustar los tamaños de los parches de imagen durante la adaptación. No necesitan preentrenar de nuevo toda la arquitectura base para cada resolución posterior.

El entrenamiento siguió requiriendo una capacidad informática considerable. La ficha de modelo publicada informa de 16 GPU Nvidia H100, 150.000 pasos de entrenamiento y unas 1.100 horas totales de GPU.

Ese coste explica por qué importa un modelo compartido. No todos los equipos de investigación lunar necesitan repetir el mismo gran trabajo de preentrenamiento antes de probar una hipótesis más limitada.

El mecanismo se parece a los anteriores modelos fundacionales científicos de NASA e IBM, pero el problema de datos es distinto. Prithvi se centra en observaciones de la Tierra, mientras que Surya se centra en el Sol.

El sistema lunar amplía esa estrategia a la ciencia planetaria. Trata el desarrollo de modelos como infraestructura compartida para la investigación, en lugar de como una aplicación terminada con respuestas predeterminadas.

Cómo rindió el modelo lunar de IA de NASA e IBM

El modelo lunar de IA de NASA e IBM mostró su ventaja más clara en el potencial de hielo polar, mientras que varios otros resultados fueron competitivos más que concluyentes.

El equipo evaluó el sistema en cuatro benchmarks. Estos abarcaron la detección regional de cráteres, la detección de cráteres a escala métrica, la segmentación de manchas irregulares de mares lunares y la regresión del potencial de hielo polar.

El artículo técnico que acompaña al lanzamiento compara el sistema preentrenado con varias arquitecturas consolidadas de visión por computadora. Esas bases incluyen modelos ResNet, ConvNeXt, SwinV2 y vision transformer.

Para la detección regional de cráteres utilizando el conjunto completo de entrenamiento, un modelo adaptado de bajo rango alcanzó una puntuación de precisión media de 0,2581. SwinV2-B alcanzó 0,2420.

La adaptación de bajo rango, habitualmente llamada LoRA, actualiza pequeñas matrices añadidas mientras deja sin cambios la mayoría de los pesos originales del modelo. Puede reducir los recursos necesarios para el entrenamiento específico de una tarea.

El modelo también mostró eficiencia en el uso de etiquetas para los cráteres regionales. Con solo la mitad de los datos de entrenamiento disponibles, superó a la base más sólida entrenada con el conjunto completo.

Este resultado importa porque las etiquetas científicas son costosas. Un catálogo de cráteres o un límite geológico a menudo exige interpretación experta, revisión cuidadosa y definiciones espaciales coherentes.

En la detección de cráteres a escala métrica, el resultado fue menos llamativo. El mejor modelo lunar obtuvo 0,1543, frente a 0,1552 de SwinV2-B.

La ficha de modelo describe adecuadamente esos sistemas como comparables. La diferencia es menor que la variación informada entre ejecuciones repetidas de entrenamiento.

Las manchas irregulares de mares lunares ofrecieron una lección similar. Estas inusuales formaciones volcánicas pueden ayudar a los investigadores a analizar cuánto tiempo continuó la actividad volcánica lunar.

La mejor configuración del modelo obtuvo un valor de intersección sobre unión de 0,5709. La base líder ConvNeXtV2 alcanzó 0,5687, de nuevo con una diferencia estrecha.

La mejora más importante apareció en el potencial de hielo polar. El mejor modelo lunar redujo el error cuadrático medio de la raíz a 0,0293, frente a 0,0377 de SwinV2-B.

IBM describe ese resultado como una reducción del error del 22 por ciento. La empresa también afirma que la detección regional de cráteres mejoró casi un 19 por ciento utilizando la mitad de las etiquetas de entrenamiento.

Estas afirmaciones son coherentes con los valores de benchmark publicados. Sin embargo, el rendimiento en benchmarks debe interpretarse dentro de los conjuntos de datos, objetivos y procedimientos de evaluación exactos utilizados.

El potencial de hielo es especialmente fácil de malinterpretar. El resultado estima la similitud con un mapa de potencial basado en conocimiento. No detecta ni mide directamente el hielo subterráneo.

El modelo combina características asociadas con la posible estabilidad del hielo. Entre ellas se incluyen la temperatura, la pendiente, la orientación, el terreno y la profundidad modelada de estabilidad del hielo.

Los científicos pueden utilizar esas estimaciones para priorizar áreas prometedoras para análisis posteriores. Confirmar la presencia de agua sigue requiriendo observaciones directas, instrumentos y evidencia científica específica de cada misión.

El modelo también detectó un nuevo cráter creado cerca del cráter Einstein después del impacto de un cuerpo de cohete. La imagen posterior al impacto se había excluido del preentrenamiento.

Ese experimento muestra que el modelo puede respaldar la detección de cambios en la superficie tras una adaptación específica para la tarea. No demuestra una monitorización operativa continua de toda la Luna.

En conjunto, los benchmarks respaldan una conclusión mesurada. El preentrenamiento ayuda más cuando varios tipos de datos aportan evidencia complementaria.

Los resultados no muestran una superioridad universal frente a todos los modelos especializados. En algunas tareas, la ventaja es modesta o inexistente.

La verdadera competencia enfrenta la infraestructura compartida con los modelos específicos para cada tarea

NASA e IBM apuestan a que una arquitectura lunar reutilizable ahorrará más esfuerzo científico que una colección de sistemas especializados entrenados de forma independiente.

Un modelo específico para una tarea puede resultar atractivo cuando el objetivo es acotado y el conjunto de datos etiquetados está consolidado. Los investigadores pueden optimizar su arquitectura, sus entradas y su función de pérdida para un único objetivo.

Ese enfoque se vuelve ineficiente cuando cada proyecto repite la misma preparación. Los equipos deben armonizar instrumentos, corregir la alineación espacial, diseñar metadatos y preentrenar representaciones similares.

El modelo lunar de IA de NASA e IBM traslada esos costes comunes a una fase previa. Una base compartida puede después respaldar varias tareas mediante ajuste fino completo, LoRA o un codificador congelado.

Por tanto, el lanzamiento cuestiona una práctica de desarrollo, no a una empresa competidora. Los investigadores lunares deben decidir si el preentrenamiento general aporta suficiente valor a su trabajo científico específico.

Los resultados del modelo sobre cráteres ilustran esta disyuntiva. A escala regional, el preentrenamiento mejoró la eficiencia de las etiquetas y la precisión. A escala métrica, el mejor modelo de referencia siguió siendo estadísticamente comparable.

Sus resultados sobre hielo muestran dónde puede compensar un diseño multimodal. Adaptadores independientes para cada modalidad permiten al sistema procesar varios tipos de observación sin limitase a apilarlos en una sola entrada.

La versión de esa arquitectura inicializada de forma aleatoria ya superaba a la mayoría de los modelos de referencia de ImageNet en prospección de hielo. El preentrenamiento aportó después una mejora adicional.

Este hallazgo sugiere que tanto la arquitectura como la experiencia lunar importan. También debilita cualquier afirmación simplista de que el preentrenamiento por sí solo causó todas las mejoras.

La documentación del modelo del proyecto reconoce que los investigadores no han aislado cada contribución. Los tokens geométricos y el entrenamiento con resoluciones mixtas todavía requieren estudios de ablación más detallados.

Un estudio de ablación elimina o modifica componentes individuales para medir su efecto. Sin esas pruebas, el equipo no puede separar por completo el valor de cada decisión de diseño.

El acceso abierto facilita investigar esa incertidumbre. Equipos independientes pueden reproducir los benchmarks, probar otras particiones, incorporar modelos de referencia adicionales o adaptar el modelo a nuevas tareas.

El modelo también se conecta con el programa más amplio de IA para la ciencia de NASA. Lanzamientos anteriores de NASA e IBM aplicaron ideas relacionadas a la observación de la Tierra, la meteorología, el clima y la heliofísica.

Prithvi demostró que el preentrenamiento geoespacial general podía respaldar aplicaciones relacionadas con inundaciones, cultivos, incendios y otros ámbitos terrestres. Surya aplicó preentrenamiento específico del dominio a observaciones solares e investigación sobre el clima espacial.

El lanzamiento lunar pone a prueba si este enfoque de plataforma se transfiere a la ciencia planetaria. El éxito respaldaría fundamentos similares para Marte, la astrofísica y otros ámbitos de investigación de NASA.

Sin embargo, el valor de una plataforma depende de su adopción. Un checkpoint descargable tiene un impacto limitado si los científicos no pueden ejecutarlo, confiar en la procedencia de sus datos o integrarlo en flujos de trabajo establecidos.

Por ello, la documentación, el código estable, la transparencia de los benchmarks y el mantenimiento comunitario importan tanto como la precisión destacada en los titulares. La infraestructura científica debe seguir siendo utilizable cuando se desvanece el anuncio de su lanzamiento.

También existe una cuestión de gobernanza. Un modelo compartido puede concentrar supuestos sobre preprocesamiento, particiones geográficas, etiquetas y datos ausentes en un único artefacto ampliamente reutilizado.

El código abierto ayuda a los investigadores a examinar esos supuestos. No garantiza que todos los usuarios posteriores los comprendan o comuniquen.

Por eso, el argumento más sólido a favor de la plataforma es práctico, no absoluto. Ofrece a los investigadores un punto de partida probado y una base compartida para comparar resultados.

Eso puede acelerar los experimentos y, al mismo tiempo, hacer más legibles los desacuerdos. Los equipos pueden identificar si un resultado procede de nuevas etiquetas, decisiones de adaptación o cambios en la base común.

Lo que el modelo no puede decidir de forma segura

La versión actual respalda la exploración científica, pero sus límites documentados excluyen el uso sin supervisión para certificar aterrizajes o despejar riesgos.

La tarjeta del modelo afirma que los campos generados no son predicciones científicas calibradas. No pueden sustituir instrumentos, fotogrametría estereoscópica ni soluciones geodésicas autorizadas.

El modelo tampoco cuenta con un marco de referencia geodésico. Puede reconstruir la estructura espacial local mientras produce valores de elevación desplazados o coordenadas absolutas incorrectas.

La latitud y longitud generadas pueden equivocarse por decenas de grados. Esa limitación por sí sola hace insegura la navegación directa o la planificación operativa.

Su salida sobre hielo presenta otro riesgo. El objetivo es una capa modelada de prospectividad, no hielo confirmado medido en cada ubicación predicha.

Un mapa convincente aún puede codificar los supuestos de su modelo fuente. Los usuarios no deben convertir la confianza visual en certeza física.

La cobertura de alta resolución también es desigual. La tarjeta del modelo señala que su preentrenamiento con cámaras de ángulo estrecho se apoya en 1.095 fotogramas con modelos estereoscópicos del terreno coincidentes de tres metros.

Esos sitios están distribuidos geográficamente, pero no ofrecen una densidad global. El rendimiento en terrenos escasamente representados puede diferir del comportamiento observado en los benchmarks.

Las puntuaciones de cráteres a escala métrica fueron bajas en todos los sistemas evaluados. Algunas anotaciones procedían de imágenes más borrosas, etiquetadas originalmente a cinco metros por píxel.

Ese resultado muestra por qué una sola métrica resumida no puede demostrar preparación para el terreno. La calidad del conjunto de datos, la cobertura geográfica y la precisión del etiquetado determinan el aparente techo de rendimiento.

La iluminación sigue siendo un desafío pese a las entradas geométricas explícitas. NASA señala que la iluminación orbital variable puede modificar la visibilidad de los cráteres más pequeños.

El sistema puede aprender relaciones entre la luz y el terreno. No puede eliminar todas las ambigüedades causadas por la oscuridad, el deslumbramiento, la resolución limitada o las observaciones incompletas.

El artículo de investigación se envió a arXiv el 8 de septiembre de 2026. ArXiv permite un acceso público rápido, pero publicar allí no establece por sí mismo una validación revisada por pares.

La replicación independiente será importante. Los investigadores deberían evaluar el modelo fuera de sus benchmarks de desarrollo e informar dónde se degrada la precisión.

Los equipos de misión requerirán pruebas más estrictas que los investigadores exploratorios. Necesitan incertidumbre calibrada, entradas trazables, casos de fallo definidos y validación en condiciones operativas pertinentes.

Una decisión sobre una zona de aterrizaje también combina factores que van más allá de la comprensión de imágenes. Las comunicaciones, la iluminación, la pendiente, las condiciones térmicas, las limitaciones del vehículo y los objetivos científicos influyen en la selección.

El modelo puede aportar evidencia a ese proceso. No debería convertirse en el proceso.

Este límite no resta valor al lanzamiento. Unas limitaciones claras hacen que el modelo sea más útil científicamente porque los investigadores pueden diseñar evaluaciones en torno a debilidades conocidas.

El peligro surgiría al fusionar tres afirmaciones distintas en una sola. Un análisis más rápido, un mejor rendimiento en benchmarks y la fiabilidad operativa son logros separados.

NASA e IBM cuentan con evidencia de los dos primeros en tareas seleccionadas. El tercero sigue explícitamente fuera del alcance validado del modelo publicado.

Tres señales mostrarán si la IA lunar cumple

La próxima prueba es si investigadores independientes pueden reproducir los resultados, ampliar los benchmarks y crear herramientas validadas que mejoren la ciencia lunar real.

La primera señal es la reproducción independiente de los benchmarks. Equipos externos deberían volver a ejecutar las cuatro tareas comunicadas y probar particiones geográficamente distintas.

Resultados consistentes reforzarían la idea de que la representación aprendida se transfiere más allá del entorno de desarrollo original. Grandes caídas de rendimiento reducirían su valor práctico.

La reproducción debería incluir el difícil benchmark de cráteres a escala métrica. Esa tarea no mostró una ventaja clara frente al mejor modelo de referencia y revela las actuales limitaciones de alta resolución.

La segunda señal es una adopción útil en etapas posteriores. El repositorio ya admite detección de cráteres, segmentación volcánica y trabajo de prospectividad de hielo mediante TerraTorch.

Ahora los investigadores deben publicar modelos ajustados de forma creíble, conjuntos de datos y hallazgos científicos. Las cifras de descargas por sí solas no pueden demostrar impacto investigador.

Una señal sólida de adopción sería un estudio revisado por pares que use la base para reducir las necesidades de etiquetado o descubrir un patrón lunar verificable.

La tercera señal es la validación apta para misiones. NASA o equipos asociados tendrían que contrastar resultados asistidos por el modelo con mediciones instrumentales y procedimientos cartográficos establecidos.

Ese proceso debería cuantificar la incertidumbre y las tasas de fallo en distintas condiciones de iluminación, regiones, sensores y resoluciones. También debería definir cuándo la revisión humana sigue siendo obligatoria.

La validación operativa reforzaría el argumento de que los modelos fundacionales compartidos pueden pasar de la investigación de archivo a los flujos de trabajo de misión. El fracaso preservaría su valor como herramientas exploratorias.

El diseño abierto del lanzamiento hace observables las tres señales. El público puede examinar la metodología de investigación, descargar el checkpoint y comparar nuevos resultados con los modelos de referencia publicados.

Para los desarrolladores, la oportunidad inmediata no es construir un navegador lunar autónomo. Es comprobar si el preentrenamiento multimodal reduce el trabajo necesario para un problema cuidadosamente delimitado.

Para los científicos, el modelo ofrece un sustrato experimental común entre instrumentos y escalas. Esto puede acortar el tiempo de preparación y mejorar la comparabilidad entre proyectos.

Para los planificadores de misiones, la postura adecuada es de interés cauteloso. Las salidas del modelo pueden orientar dónde investigar, pero las mediciones verificadas deben regir las decisiones relevantes.

El modelo lunar de IA de NASA e IBM importará si se convierte en infraestructura científica mantenida, y no en una demostración puntual. Su contribución más sólida puede ser el marco compartido de datos y evaluación que lo rodea.

El próximo paso corresponde a la comunidad investigadora. ¿Podrán equipos independientes reproducir las mejoras, documentar los fallos y convertir esta base abierta en evidencia que resista la revisión científica?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page