Kurzfassung: NASA und IBM haben ein multimodales Basismodell für die Analyse der Mondoberfläche veröffentlicht. Gewichte, Datensätze sowie Code für Anpassung und Inferenz sind öffentlich; der Code für das Vortraining fehlt. Die oft genannte Verbesserung von „bis zu 23 Prozent“ ist kein allgemeiner Genauigkeitswert, sondern fasst unterschiedliche Aufgabentests zusammen.
Zwei Millionen Bildausschnitte, mehrere Auflösungen
Das NASA-IBM Lunar Foundation Model wurde vor allem mit 17 Jahren Daten des Lunar Reconnaissance Orbiter trainiert. NASA nennt rund zwei Millionen Bildausschnitte: mehr als eine Million Kameraaufnahmen mit einer Auflösung von einem Meter sowie knapp 964.000 multispektrale Aufnahmen mit 100 Metern pro Bildpunkt. Hinzu kommen Daten von GRAIL, Lunar Prospector und der japanischen SELENE-Mission.
Der technische Kern basiert auf einer Variante von TerraMind, einem von IBM und der Europäischen Weltraumorganisation entwickelten Erdbeobachtungsmodell. Das System bringt Messungen verschiedener Instrumente, Blickwinkel und Auflösungen in eine gemeinsame Repräsentation. Forscher können es anschließend mit vergleichsweise wenigen markierten Beispielen für einzelne Aufgaben anpassen.
NASA priorisiert drei Anwendungen: kleine Krater erkennen, junge vulkanische Strukturen abgrenzen und die Stabilität möglicher Eisvorkommen an den Mondpolen abschätzen. Letzteres kann die Auswahl wissenschaftlich und technisch interessanter Standorte unterstützen. Eine Modellprognose ist jedoch kein direkter Nachweis von Wassereis und ersetzt keine Messung vor Ort.
Was die Benchmarks tatsächlich zeigen
Die pauschale Herstellerangabe „bis zu 23 Prozent besser“ verdeckt deutliche Unterschiede. IBM nennt für die Eisabschätzung eine um 22 Prozent reduzierte Fehlerrate gegenüber einem spezialisierten SwinV2-Modell. Bei der Kratererkennung erreichte das Modell auf Ein-Meter-Bildern eine vergleichbare Leistung; bei 100 Metern pro Bildpunkt lag es mit halb so vielen Trainingsdaten knapp 19 Prozent vorn. Bei der Segmentierung unregelmäßiger Mare-Flächen betrug der Vorsprung drei Prozent.
Diese Ergebnisse stammen von den beteiligten Organisationen und wurden kurz nach Veröffentlichung noch nicht unabhängig reproduziert. Außerdem sind die Prozentwerte wegen unterschiedlicher Aufgaben und Bezugsgrößen nicht direkt miteinander vergleichbar.
Offen, aber nicht vollständig reproduzierbar
Modellgewichte, Konfigurationen, Benchmark-Datensätze und der Code für Feinabstimmung und Inferenz stehen auf Hugging Face und GitHub bereit; das Repository verwendet Apache 2.0. Die README hält zugleich ausdrücklich fest, dass der Code für das Vortraining nicht enthalten ist. Externe Teams können das veröffentlichte Modell prüfen und anpassen, aber den vollständigen Entstehungsprozess nicht allein mit dem Repository nachbauen.
Pandorex Einschätzung: Der praktische Wert liegt weniger in einem einzelnen Rekordwert als in der gemeinsamen Verarbeitung sehr unterschiedlicher Mondmessungen. Für belastbare wissenschaftliche Nutzung sind nun unabhängige Wiederholungen, klar dokumentierte Rechenanforderungen und Tests außerhalb der drei veröffentlichten Aufgaben entscheidend.
