ai china

中国遥感 AI 竞赛正向上游延伸:传感器与观测档案成为焦点

8 条来源 5 条一手来源 已翻译 2026年7月21号

正文
明亮洁净的生产大厅内,多排小型吉林一号高分 03 遥感卫星正在批量生产。

2022 年批量生产中的吉林一号高分 03 卫星。这张照片呈现了 AI 技术栈的上游:相机、航天器、重复过境,以及基础模型学习地球之前必须已经存在的影像档案。[8]

最能揭示中国遥感 AI 竞赛走向的一幅照片,画面里看不到 AI。明亮的生产大厅内,一排排小型吉林一号卫星安放在带轮支架上。新华社于 2022 年 12 月刊发这张照片,当时的报道记录了长光卫星技术股份有限公司从逐颗建造、测试卫星转向并行生产的过程。[8] 模型位于这座工厂的下游,它们要等相机、发射任务、地面链路、标定工作以及多年积累的观测资料先行到位。

截至 2026 年 7 月 21 日,这条上游链条正成为故事的主线。从 RingMoSkySenseMaRSCGEarthEye,这段演进常被写成视觉模型规模不断扩大、能力逐步增强的序列。若把竞争单位本身纳入观察,图景会清楚许多。这个单位已经扩大:哪些传感器生成了像素,光学与雷达观测能否成对,同一片地面多久重访一次,空间细节能保留多少,以及谁能检查或复现训练档案,都已进入竞争范围。[1][2][3][5][7]

遥感图像与从远处拍摄的普通照片有着根本差异。光学传感器记录反射光;合成孔径雷达记录微波后向散射,在云层遮挡或黑暗条件下仍能观测。一块田地随季节改变面貌。一栋建筑在某种分辨率下只占几个像素,换到另一种分辨率,便能分辨屋顶、阴影和边缘。由此浮现的“现场信号”,重心落在学会判断:面对这一任务、这一尺度、这一时刻,哪一种观测带有有效信息;把每一种传感器都加入系统,无法代替这种取舍。

RingMo 首先把遥感视觉域确立为核心对象

RingMo 于 2022 年发布,较早与一条常见捷径拉开距离:先用日常照片预训练模型,再适配卫星影像。中国科学院空天信息创新研究院称,其训练集包含 200 多万张无标签图像,分辨率约为 0.1 至 30 米,采自卫星和航空平台。该院还提到,数据覆盖 150 多个具有代表性的城市、城镇、机场和港口,包含 1 亿多个目标实例。[1]

规模之外,RingMo 还采用了针对遥感特征设计的掩码图像预训练,尤其关注微小、密集分布且方向任意的目标。研究在八个标准数据集上评估模型,任务覆盖分类、检测、识别、提取以及与变化相关的分析。最初的技术约定由此清晰起来:先学习遥感领域可复用的表征,再接入面向具体任务的头部网络。[1]

RingMo 尚未证明单一编码器能够理解每一种传感器或每一片地理区域。它的基准成绩也没有确立模型在洪水应对、规划部门或农作物保险流程中的实际运行表现。它重新设定了基线:训练资产的战略价值从 ImageNet 式自然照片转向观测档案本身。

SkySense 显示,融合收益高度不均

SkySense 在 2024 年拓宽了这份技术约定。它的 20.6 亿参数系统使用 2150 万条时序序列预训练,数据来自高分辨率光学影像、中等分辨率多光谱观测和合成孔径雷达。独立的空间编码器与融合模块,使模型既能处理单幅静态光学图像,也能处理已经对齐的光学—雷达时间序列。论文在 16 个数据集、七类任务上评估了这套系统。[2]

其中的决定性观念是,时间、模态与位置各有含义,不能被当作可互换的元数据;它们本身就是输入的一部分。一块农田只观测一次,得到的是外观;反复观测,得到的则是一条生长曲线。云层挡住光学观测时,雷达可以保留信号,不过雷达也带有斑点噪声、叠掩效应,并以另一种物理关系描绘地面。因此,配对两类传感器的观测,远比增加一个色彩通道复杂。

SkySense V2 把这种取舍呈现得格外具体。在论文的 PASTIS-MM 作物制图设置中,静态 Sentinel-2 输入得到 75.0 分;使用 Sentinel-2 时间序列后,结果升至 85.5;再加入 Sentinel-1 雷达时间序列,得分仅升至 85.6;在光学时间序列上加入高分辨率影像,则得到 86.7。[3] 在这项基准上,时间带来 10.5 分的提升;已有时间信息后,雷达增加 0.1 分。

这些数字无法给出传感器的普遍排名。它们只对应一个数据集、一项任务、一种指标和一套训练设置。在夜间洪灾或厚云覆盖下,雷达可以成为最重要的观测。适用范围清楚的结论是:融合收益取决于缺失的那部分信息。SkySense V2 的共享骨干网络、分模态输入处理和时间融合,适合被理解为一套证据路由架构;它无法证明所有可用数据流都应始终融合。[3]

MaRS 用时间广度换取成对的亚米级细节

武汉大学的 MaRS 于 2026 年 3 月在 AAAI 发表,处理的是另一项薄弱环节。许多多模态系统依赖中等分辨率的 Sentinel 数据,许多甚高分辨率系统又只使用光学影像。MaRS 使用约 1680 万对光学—雷达图块训练,地面采样距离约为 0.35 米。它的跨粒度训练专门应对这样一种事实:即便描绘同一地点,局部雷达图块与光学图块也存在无法严密对齐的情况。[5]

这一转向改变了模型能够辨认的细节范围。在亚米级分辨率下,道路、建筑和受损形态带有十米级像素无法保留的细部。论文把 MaRS 作为骨干网络,测试了配准、缺失模态映射、图像转换、损伤检测与变化检测、目标与建筑检测、高度估计和道路提取。它们属于研究基准,与已部署的单一应急系统尚有距离,却清楚呈现了预期的交接方向:从宽泛的场景理解,走向观测不完整时的细粒度判读。[5]

配套代码仓库尤其有用,因为它同时展现了开放程度及其限度。武汉大学发布了光学和雷达预训练权重、预处理代码以及可复现的预训练流程。不过,仓库说明,完整的 约 5 TB MaRS-16M 语料库未向公众开放,已发布内容仅限学术研究使用。[6] 外部团队可以测试骨干网络,却无法仅凭此次发布重建完整观测档案。

CGEarthEye 把星座资源转化为模型优势

CGEarthEye 明确呈现了向上游移动的路线。作者来自长光卫星技术股份有限公司和吉林大学,模型以吉林一号星座为基础设计,没有采用通用的公开影像混合库。2025 年的论文介绍了 JLSSD:一个从吉林一号 2023 年覆盖影像中抽样而成的语料库,包含 1500 万张 0.75 米分辨率图像。在中国境内,同一地点按季度取景;在中国境外,则使用年度镶嵌影像。五种模型规模从 2200 万参数延伸至 11 亿参数。[7]

季节性设计比参数总量更有分量。卫星运营方可以决定在哪里采集、多久重访一次、剔除哪些低质量观测,以及如何对齐更新。CGEarthEye 把这些采集决策编排为训练课程:全球多样性、中国境内的重复观测,以及细致的空间信息。这是从论文数据构造中得出的推论,尚不足以证明专有档案总能胜过开放的 Sentinel 数据。它确实说明,进入架构比较之前,传感器所有权已经能够转化为 AI 优势。[7]

现在再看那张生产车间的照片,它已经超出一般航天工业配图的含义。每一颗造好的卫星都会增加潜在重访能力;每一次重访都能给档案加入另一个季节、另一组变化配对或一次罕见事件。工厂与模型之间隔着多年的工程工作,却同属一个数据系统。[7][8]

开放权重不等于开放观测站

SkySense++ 也提醒人们,模型访问权与数据可复现性不能画上等号。这个 2025 年的系统使用 2700 万张多模态图像,并加入语义预训练阶段,意在改善模型面对七个领域、十二项地球观测任务时的少样本迁移。它的代码已经公开。数据声明同时指出,部分组成数据集受原始协议限制,不能再次分发,研究人员需要向各自的数据提供方申请访问。[4]

这种限制并非中国独有。高分辨率商业影像、国家地面站档案和灾害数据常受法律、安全或许可条件约束。不过,“开放”的含义也随之改变。可下载的检查点足以支持下游实验,却无法让预训练数据混合变得可审计、可更新或可独立复现。在遥感领域,模型卡还需要一份配套记录,说明传感器、采集日期、地理抽样、云层与质量筛选、标定、许可和缺失观测。

以下四项测试可以判断,这套传感器—档案策略是否已经越过基准领先,走向成熟:

  1. 地理迁移: 按地区、气候和聚落形态留出测试集,避开从同一批影像的邻近图块随机切分训练集与测试集。
  2. 传感器与时间漂移: 测试预训练阶段未曾出现的新一代卫星、标定变化、不同季节和灾后条件。
  3. 运行交接: 对照模型所要改进的数值流程或人工流程,报告延迟、不确定性、误报和人工复核情况。
  4. 可复现的数据沿袭: 公布足够的采集、筛选与配对元数据,让外部研究者在底层商业像素不能再次分发时,仍能解释结果。

证伪条件很直接。若基于可获取的中等分辨率档案训练的模型,在细粒度且按地理区域留出的任务上持续追平与星座相连的系统,那么传感器所有权构成的护城河就比当前呈现的更浅。若收益遇到新传感器、新季节或新区域便消失,那么“基础模型”的称谓过于宽泛,模型展现的只是对基准的熟悉。反过来,持久的迁移能力将确认,观测系统与编码器一道,已经成为中国 AI 能力的核心层。

遥感竞赛由此同时朝两个方向推进。架构正在学习如何更有选择地调度光学、雷达、时间和分辨率,机构则沿链条上行,进入让这些选择得以成立的档案。最终影响最深远的模型未必拥有最大的参数量。它或许连接着一套观测系统,在基准停止变化之后仍能持续观测、标定与学习。

来源

  1. 中国科学院空天信息创新研究院,“首个跨模态遥感数据生成式预训练基础模型发布”(2022 年 8 月 22 日;RingMo 的数据来源、分辨率范围、自监督设计与评估范围)。
  2. Xin Guo 等,“SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery”,CVPR 2024(模型规模、光学—SAR 时序语料库、架构与评估范围)。
  3. Yingying Zhang 等,“SkySense V2: A Unified Foundation Model for Multi-modal Remote Sensing”,ICCV 2025(共享骨干网络设计、模态消融实验与 PASTIS-MM 作物制图结果)。
  4. Kang Wu 等,“A semantic-enhanced multi-modal remote sensing foundation model for Earth observation”,Nature Machine Intelligence 7(2025;SkySense++ 预训练、少样本任务范围、代码和数据访问声明)。
  5. Ruoyu Yang 等,“MaRS: A Multi-modality Very-high-resolution Remote Sensing Foundation Model with Cross-Granularity Meta-Modality Learning”,AAAI 2026(成对的 0.35 米语料库、传感器对齐问题与下游评估范围)。
  6. 武汉大学 RSIDEA,WanderRainy/MaRS(官方权重、预训练代码、数据可用性限制与仅限学术用途的条款)。
  7. Zhiwei Yi 等,“CGEarthEye: A High-Resolution Remote Sensing Vision Foundation Model Based on the Jilin-1 Satellite Constellation”(2025;JLSSD 抽样、季节性设计、模型家族与评估设置)。
  8. 新华社,“‘吉林一号’背后的技术”(2022 年 12 月 14 日;批量生产背景,以及本文所用纪实卫星照片的来源)。
Previous TM-Bench 为传统蒙古文提供了一张专属成绩单 Next 标尺尚未定型,中国已着手建立 AI 计量市场

Recommended In ai china

Matched by subject and format