2026 年 9 月 10 日,IBM 与 NASA 联合开源了 NASA-IBM Lunar Foundation Model,这是首批面向月球科学、面向公众可用的基础模型之一。模型权重以 Apache-2.0 协议托管在 Hugging Face,微调代码与训练管线放在 NASA-IMPACT 的 GitHub 仓库,下游适配走 TerraTorch 框架。整套发布第一次把覆盖 17 年观测的 LRO 数据,加上 GRAIL 重力、JAXA SELENE/Kaguya 多源数据,聚合成了一个机器学习就绪的多模态、多分辨率月面数据集 SomBench,和模型一起同步开放给研究者。
架构与预训练:从零训的 ViT-B,几何信息当一等公民
模型走的是 ViT-B 编解码器架构:12 层、768 维、12 个注意力头,从头训练而非继承自 ImageNet。训练集是 SomBench 里约 200 万对空间配准的月球切片瓦片,涵盖 11 种模态,两种空间尺度——LRO 窄角相机约 1 米/像素的窄角图像,以及宽角相机约 100 米/像素的宽角图像,对应 NAC_HighRes 与 WAC_LowRes 两个数据轨道。其中窄角切片来自 1095 张配准后的 NAC 帧共 100 万余瓦片、约 1.4 TB;宽角切片来自 54080 条 WAC 记录共 96 万余瓦片、约 38 TB。两者在同一套权重下做混合 batch 训练,跨越 100 倍分辨率尺度仍共用同一套编码器,这是发布里被反复强调的一点。
预训练规模是 16 张 H100、跑 15 万步、global batch 1536、bf16 精度,大约 1100 GPU-小时。模态编码用 9 个 VQ-VAE tokenizer,FSQ 量化,DDPM 解码,目标函数是离散词表上的交叉熵。每个瓦片的光照几何(太阳角、相机帧锚、瓦片足迹)被显式 token 化作为编码器输入——这一点很关键,官方在技术报告里直接点明:月球表面外观主要由光照几何决定,而不是本征反射率变化,所以把几何当作一等公民塞进输入,比把所有瓦片当 i.i.d. 图像处理要靠谱。
基准表现:最大 margin 出现在极区冰沉积
基准表现是这份发布里最有信息量的部分。官方给的核心数字是:在月球极区冰沉积预测任务上,模型 RMSE 降到 0.0293,而 SwinV2-B(ImageNet 预训练)在同一基准上是 0.0377,随机初始化对照组是 0.0397——这一项也是相对基线提升最大的地方,技术报告里把它标为「最宽 margin」。在不规则月海斑块(IMP)分割任务上,IoU1 跑到 0.5709,基线 ConvNeXtV2-B 是 0.5687,差距小但在带噪声标签的设定下仍维持优势。在 WAC 影像 Robbins 陨石坑检测上,用 LoRA 微调 mAP 跑到 0.2581,SwinV2-B 是 0.2420。IBM 的口径是「极地冰沉积探测误差降低最多 22%,撞击坑检测在 100 米上下文尺度上以一半训练数据超过 SwinV2-B 约 19%」——这两个最大幅度数字是同一份技术报告里的最大值,不是平均值,作者自己也在脚注里提示 NAC 陨石坑和 IMP 两项的领先 margin 接近种子间波动,应当视为「可比」而非显著优于。
边界与定位:加速假设生成,不是最后一公里决策工具
需要把边界写清楚。模型卡自承三点:不是科学级生成模型;没有自带大地测量参考框架;未经任务方验证用于着陆点认证或 hazard clearance 这种操作决策。冰沉积输出回归的是一个由先验知识构建的模糊叠合图,而不是实测冰。SomBench 数据卡也注明了异质空间分辨率与数十米级绝对地理定位不确定性。换句话说:这是给研究者加速假设生成、缩小搜索空间的预训练底座,不是给任务方当最后一公里决策工具。
Prithvi 系列的延展:从地球到月球的「基座 + 数据 + 工具链」三件套
这套模型也是 IBM-NASA 合作的 Prithvi 开源基础模型家族的新成员,此前已经覆盖地理空间、天气、日球层物理,现在加上了月球。NASA 首席科学数据官 Kevin Murphy 与 IBM Research Europe UK/Ireland 负责人 Juan Bernabe-Moreno 的官方表态都强调「让科学家从共享基座出发,而不是每个问题重造一套算法」——这也是这一系列发布的一贯叙事。训练数据走的是 NASA 80MSFC25M0084 奖项下完成的工作。整套东西已经在 Hugging Face(nasa-ibm-ai4science/NASA-IBM-Lunar-Foundation-Model)和 NASA-IMPACT 的 GitHub 上线。
所以呢:为什么这次发布值得专门拆一篇
Prithvi 系列把「领域基础模型 + 公开配准数据集」这套范式从地球延到了月球,意味着以后做月面研究的实验室不需要再从零训 ViT,也不需要再为对齐 LROC、GRAIL、Kaguya 多个分辨率档位的数据写胶水代码,直接 fine-tune 或 LoRA 适配到自己的细分任务。这种「数据集 + 预训练底座 + 下游工具链一起开源」的形态,放在 NASA 重返月球的背景下,实际上把月面遥感这件事从「少数团队能做的闭门工作」推进到了「任何地球上的 CV 组都可以上手」。这也是为什么 IBM 把它框定为「one of the first publicly available foundation models for scientific exploration of the Moon」——重点不是「最大」「最强」,而是「公开、可改、可用」。这一发布也部分回应了科学界对 AI for Science 工具能否真正开放的反复质疑:权重 Apache-2.0、代码 GitHub 开源、数据 CC BY 4.0 三件套同时到位,在同类地球科学模型发布里算是走得最远的一次。
参考资料:
- IBM newsroom 官方发布(主要来源):https://newsroom.ibm.com/2026-09-10-ibm-and-nasa-release-open-source-ai-model-to-support-lunar-exploration
- Unite.AI 独立技术解读(包含完整架构细节、benchmark 表与训练细节):https://www.unite.ai/ibm-and-nasa-open-source-lunar-foundation-model-with-sombench-dataset/