ai china

中国月球撞击坑普查:让数据的不确定性清晰可见

6 条来源 6 条一手来源 已翻译 2026年9月29号

正在加载阅读与收藏统计…
正文
第谷撞击坑中央山群的山脊沐浴在阳光中,长长的阴影投向崎岖的月面。

第谷撞击坑的中央峰,由美国国家航空航天局(NASA)月球勘测轨道飞行器于 2011 年 6 月 10 日拍摄。图片来源:NASA 戈达德太空飞行中心/亚利桑那州立大学。这张历史影像用于展示月表起伏与光照,未标注 LUC-GRAS200 的识别结果。[6]

日出时分,第谷撞击坑中央的山群将阴影投向坑底。2011 年 6 月,NASA 的月球勘测轨道飞行器(LRO)从斜向视角拍下这一景象,镜头掠过一片宽约 15 公里的山群。[6] 照片中的月表地形清晰分明,令人赞叹。将数百万处远没有这般醒目的地貌转化为可以相互比较的测量数据,则需要另一种观察方式。

LUC-GRAS200 将这项工作的规模推向了新的量级。中国科学院国家天文台于 2026 年 7 月 2 日公布了这份目录,其中收录 10,699,651 个月球撞击坑,直径从 200 米到 2,050 公里。[1] 这项由 Wei Zuo 及其同事主导的研究于 6 月 24 日发表于 Journal of Geophysical Research: Planets。[2] 科学家打开数据集,看到总数之后,接着就要面对一个重要问题:这些条目中,哪些可靠到可以进入他们要做的比较?

新增数量主要来自小型撞击坑

中国对这一问题的研究早于当前这份目录。2020 年 12 月,吉林大学介绍了一项合作研究:研究团队将深度迁移学习用于嫦娥一号和嫦娥二号的观测数据,识别出 109,956 个此前尚未辨认的撞击坑,并为其中 18,996 个直径超过 8 公里的新识别撞击坑判定了所属地质时期。神经网络以已知撞击坑为学习起点,逐步掌握识别所需的知识。[3]

这些数字对应的是另一项研究成果。用今天的目录总量除以早期新发现的数量,所得比值无法衡量模型准确率的提升。前者统计的是目录收录量,后者统计的是早期研究中新识别出的地貌数量。

国家天文台在 2026 年的公告中更具体地说明了增量来自何处:约 79% 的条目直径介于 200 米与 1 公里之间。研究团队把分辨率为 7 米的嫦娥二号影像、高程数据和 LRO 地形信息合在一起,再做自动识别、地形测量、人工核验,并与其他目录比对。[1]

由此,科学研究可以在更广阔的区域里考察更小尺度的问题。研究者可以先选定区域和直径范围,再分析其中的撞击坑群体。一个地貌能否纳入样本,其判定规则与最初发现它同样重要。

普查之前,先准备训练影像

论文说明,这项研究使用的识别模型是 YOLO-SCNet。[2] 模型的公开代码库让人得以了解前期准备工作。中文说明首先要求将月球影像切分成相互重叠的图块,原因很具体:跨越两幅图像边缘的撞击坑存在漏检风险。[4]

同一份说明还要求标注样本涵盖不同的撞击坑尺寸、类型、光照条件和背景,并收集覆盖多种月球地貌的背景影像。接着,它说明训练样本怎样生成,标注怎样转换成模型可用的格式。[4]

“找出撞击坑”看似简单,落到数据准备阶段,会变成若干具体判断。用哪些样本教会模型辨认撞击坑?影像切分之后,难以辨识的地貌是否仍然可见?训练样本是否涵盖了足够多的光照变化?代码库让这些问题有据可查;至于其他团队是否已复现完整的全球目录,仅凭代码库公开这一点仍无法确认。

一条记录里的两类置信度

公开的数据字典尤其值得细看。每条记录可包含位置、直径、深度、坑缘高度和坡度等测量值。confidence_level 字段标出该地貌作为真实撞击坑的可信程度,另一个字段 secondary_confidence 则描述它属于次生撞击坑的置信度。[5]

较大撞击抛出的物质回落并再次撞击月表,就会产生次生撞击坑。[2] 这样的坑可以是真实存在的,只是它与最初撞击事件的关系有所不同。因此,次生坑置信度得分高,只能按这一特定含义解读,不能作为识别质量的总体保证。

设想一位分析人员正在筛选撞击坑,以研究某个区域的撞击历史。第一步需要区分可靠识别结果与存疑地貌,随后再决定如何处理疑似次生坑。两项判断若顺序颠倒或混为一谈,样本即使经过细致筛选,也有偏离研究问题的风险。这一推论来自字段定义,文中并未对目录开展新的分析。

数据发布页面列出了完整目录、以次生坑为重点的文件和 README。文档还标明了高程数据分辨率的分界,并建议为极区与非极区分别设定统计基准。[5] 一份可用的数据集,需要把这些限定条件一并带进后续计算。

最小收录直径与完整度须分别考察

国家天文台报告称,直径约 1 公里以上撞击坑的识别完整度超过 90%,全球完整度直径的中位数约为 330 米。[1] 这些数值属于团队报告的目录特征,应与独立评估结果相区分;各个地点的情况还需分别考察。

在小尺寸端,这一区别尤其重要。目录收录了直径小至 200 米的识别结果;至于各处 200 米撞击坑是否同样容易被发现,仅凭收录下限还无法判断。论文明确指出,光照、高程数据分辨率的变化,以及次生撞击坑的影响,都会给识别和分析带来复杂情况,小型撞击坑和高纬度地区尤其如此。[2]

据此,区域比较有一项直接的操作要求:先选定在两个区域都站得住脚的尺寸范围和质量筛选标准,再解释数量差异。否则,表面上的地质差别也存在另一种解释:其中一部分反映的是观测与识别过程的差异。

LUC-GRAS200 对中国科学研究中人工智能应用的贡献,因而体现在模型推理之后的后续研究里。有了目录,其他研究者就能筛选、比较和质疑测量结果,省去从轨道观测档案重新起步的工作。下一步,更有力的价值展示,是一条经得起质量筛选调整的地质结论。上千万条记录,为这类尝试准备了丰富得多的材料。

来源

  1. 中国科学院国家天文台,《全球月球撞击坑数据库达到千万量级》(2026 年 7 月 2 日,中文一手公告)。目录收录范围、输入数据及报告中的完整度。
  2. Wei Zuo 及其同事,“LUC-GRAS200: A Global Lunar Crater Catalog at Sub-Kilometer Scale–Construction, Validation and Spatial Characteristics”,Journal of Geophysical Research: Planets(2026 年 6 月 24 日)。摘要、通俗摘要以及数据与软件可用性声明。
  3. 吉林大学,《合作团队为月球与行星探测提供新数据和新方法》(2020 年 12 月 30 日,中文一手报道)。早期基于嫦娥数据的撞击坑识别与地质时期估算研究。
  4. 国家天文台研究代码库 YOLO-SCNet。中文 README 介绍影像切分、标注与训练样本准备;查阅日期:2026 年 9 月 29 日。
  5. 中国探月工程数据发布与信息服务系统,LUC-GRAS200 数据集及其链接的 README,版本 1.0.0(2026 年 4 月)。文件清单、置信度字段定义和分辨率标记。
  6. NASA,《第谷撞击坑的山峰》(2011 年 6 月 30 日)。这张 LRO 历史照片摄于 2011 年 6 月 10 日,图片署名为 NASA 戈达德太空飞行中心/亚利桑那州立大学。
Previous 天眸芯的快慢两路视觉,始于 AI 模型运行之前

Recommended In ai china

Matched by subject and format