NASA и IBM Research опубликовали NASA-IBM Lunar Foundation Model — одну из первых открытых foundation-моделей для лунных исследований. Модель обучена на почти 2 миллионах связанных снимков с орбитального аппарата Lunar Reconnaissance Orbiter (LRO) и данных ещё трёх миссий. По словам IBM, она предсказывает залежи льда в полярных кратерах точнее базовых методов на 22%, а крупные кратеры — на 19% при половинном объёме размеченных данных.
Главная задача модели — сделать огромный архив наблюдений NASA пригодным для машинного обучения. «NASA десятилетиями собирала данные о Луне, но собрать — лишь часть работы, — говорит Кевин Мёрфи, главный по научным данным NASA. — Эти данные нужно сделать удобнее для учёных». Foundation-модель в отличие от узкоспециализированных алгоритмов обучается на больших объёмах неразмеченных данных, а потом дообучается под конкретную задачу всего на нескольких примерах с метками.
Почти 2 миллиона мультимодальных связок за 17 лет наблюдений
Модель обучена с нуля на датасете SomBench — по словам команды, крупнейшем корегистрированном мультимодальном корпусе лунных данных. Он содержит почти 2 миллиона связок тайлов по 11 модальностям и двум пространственным масштабам.
Около 1 миллиона снимков высокого разрешения (примерно метр на пиксель) взяты с узкоугольной камеры NAC, ещё чуть меньше 964 тысяч мультиспектральных изображений (100 метров на пиксель) — с широкоугольной. Основная масса данных — 17 лет наблюдений LRO. По данным NASA, объём его данных превышает объём всех остальных планетарных миссий NASA вместе взятых.
Дополнительно в датасет вошли данные миссии GRAIL (гравитационное поле), Lunar Prospector (водород) и японского зонда Kaguya/SELENE (минералогия). Всего в наборе свыше 30 пространственно выровненных слоёв данных с девяти инструментов четырёх миссий.
Чтобы избежать утечки между обучающей, валидационной и тестовой выборками, корпус разделён географически по картографическим зонам, а не случайным распределением отдельных тайлов.
Модель получает условия освещения на вход вместо того, чтобы их угадывать
Модель основана на TerraMind — мультимодальной модели наблюдений Земли, но обучена с нуля, а не дообучена. Для каждого тайла модель получает геометрию съёмки как явный контекст: углы освещения, положение Солнца и границы тайла.
На Луне геометрия освещения влияет на то, как выглядит поверхность, гораздо сильнее, чем реальные свойства поверхности. Вместо того чтобы заставлять модель корректировать это из сырых пикселей, команда просто подаёт ей эту информацию.
Модель разбивает лунные изображения, данные о высоте и геометрию съёмки на токены и учится их связям, предсказывая замаскированные части. Она также учится одновременно на снимках высокого разрешения и крупномасштабных в одном прогоне обучения, захватывая и мелкие детали, и широкий контекст. Технология FlexiViT позволяет одной обученной модели адаптироваться к задачам с разным размером патчей изображения без переобучения.
Предсказание льда — где модель отрывается сильнее всего
Команда протестировала модель на обнаружении кратеров в масштабе 100 метров и 1 метр и на предсказании залежей полярного льда. Ещё ей пришлось сегментировать Irregular Mare Patches (IMP) — молодые вулканические образования, которые бросают вызов устоявшимся представлениям о сроках остывания Луны.
На всех задачах предобученная модель сравнялась или превзошла как общие базовые методы, так и архитектурно идентичную контрольную модель со случайной инициализацией, говорится в техническом отчёте.
Самый большой выигрыш показала задача предсказания залежей льда. Постоянно затенённые полярные области остаются достаточно холодными, чтобы сохранять водяной лёд миллиарды лет, и считаются потенциальным ресурсом для воды, кислорода и ракетного топлива. Модель сократила ошибку предсказания до 22% по сравнению с лучшим базовым методом SwinV2-B, утверждает IBM.
| Задача | Преимущество NASA-IBM FM | Условия |
|---|---|---|
| Предсказание льда | До 22% точнее SwinV2-B | Полный датасет |
| Крупные кратеры (100 м) | Почти 19% точнее SwinV2-B | Половина размеченных данных |
| Мелкие кратеры (1 м) | Примерно на уровне базовых методов | — |
| Сегментация IMP | IBM заявляет 3% над SwinV2-B, на практике сопоставимо | — |
Для крупномасштабного обнаружения кратеров модель превзошла SwinV2-B почти на 19%, по данным IBM. Эта цифра получена при обучении только на половине данных, что говорит о том, что модель требует меньше размеченных примеров для хорошей работы.
Часть преимущества идёт от того, как модель обрабатывает разные типы данных
Даже контрольная модель со случайной инициализацией превзошла пять из семи базовых методов на предсказании льда без какого-либо лунного предобучения. По словам исследователей, часть преимущества идёт от того, как модель обрабатывает разные типы данных. Она назначает каждому слою данных свой путь обработки, в то время как базовые модели трактуют все входы как сложенные каналы.
На метровом обнаружении кратеров и сегментации IMP модель примерно сравнялась с сильнейшими базовыми методами, различия укладываются в разброс между запусками обучения. IBM заявляет 3% преимущества над SwinV2-B на IMP, но результаты выглядят скорее сопоставимыми, чем явно лучше.
По словам исследователей, LoRA — более лёгкий метод дообучения, который обучает только часть параметров — сравнялся с полным дообучением по всем задачам и показал лучше на обнаружении кратеров. Полное дообучение выигрывает только на двух самых маленьких задачах.
Где взять модель и что с ней делать
NASA-IBM Lunar Foundation Model выложена в открытый доступ на Hugging Face и GitHub. Модель позволяет учёным быстрее картировать кратеры, обнаруживать ранее активные вулканические образования, оценивать местоположения льда и поддерживает потенциальные будущие миссии лунных исследований.
Модель работает с данными разных модальностей, захваченными под разными углами и пространственными масштабами — NASA и IBM называют её первой ИИ-моделью, интегрирующей наблюдения такого рода. Основное применение — научные задачи, где наблюдательных данных много, а размеченных примеров мало.
Ограничения очевидны: модель не гарантирует точность в областях, не представленных в обучающих данных, и её предсказания требуют проверки другими методами. На задачах с высоким разрешением (NAC, 1 метр на пиксель) все модели, включая NASA-IBM FM, показали себя хуже, чем на крупномасштабных снимках.



