两张从空中拍摄的影像,记录了同一片街区相隔数年的面貌:一座仓库拔地而起,树木换了颜色,阴影也朝向不同的方向。要让建筑变化检测器真正有用,就得从这些视觉差异中辨认出新增建筑。北京航空航天大学研究人员开发的基准数据集 LEVIR-CD 特意纳入季节与光照变化,让这项区分更具挑战。[5]
Open-CD 将变化检测模型纳入同一套软件技术栈,让它们共用可复用的训练工具和统一的推理接口。[1] 对中国 AI 研究而言,它的意义在于工程成果能够持续积累:一个模型上的工作,可以成为下一个研究团队直接使用的材料。
从单个模型到共用工具
Open-CD 于 2022 年 7 月发布,2023 年 4 月迁移至 OpenMMLab 2.0,2024 年 2 月加入推理 API。2025 年 7 月,维护者宣布项目的技术报告获 ACM Multimedia 接收。[1] 沿着这些时间节点,可以看到工具箱如何随着一项项研究贡献逐渐扩充。
曹向勇在西安交通大学的教师主页于 2024 年 8 月发布了一则通知,介绍这份报告并列出合作作者。[2] 项目与中国研究机构的联系清晰可查,同时,软件采用的基础组件及其汇集的贡献也属于国际研究社区。
技术报告交代了这套工具的组织思路:用配置文件指定模型、优化器、数据集和预处理方法。Open-CD 采用 OpenMMLab 的组件,并由 MMEngine 运行训练流程。[3] 阅读配置文件,就能了解一项实验如何组装起来。
MMEngine 的文档进一步说明了这项分工。它的 Runner 统筹训练、验证和测试,创建所需组件,并在运行过程中的指定位置调用钩子(hook)。研究人员负责模型与数据,共用的运行框架负责调度。研究人员也可以自定义循环,不过,改变钩子的调用顺序存在引发行为不一致的风险。[4]
设想一个团队正在研究:换用另一种特征提取器,能否更好地识别小型新增建筑。共享技术栈让他们可以集中修改这一部分,同时沿用熟悉的训练循环和评估流程。这带来了工程上的便利;实验比较是否公平,仍取决于其余设置是否保持一致,以及是否得到完整报告。
数据集规定了什么算作“变化”
LEVIR-CD 为这个抽象问题给出了具体尺度。它最初发布时包含 637 对影像,每幅为 1,024 × 1,024 像素,分辨率为 0.5 米/像素。影像取自得克萨斯州的 20 个区域,每对影像的观测时间相隔五至十四年。标签记录建筑物的增加与消失,标注人员据此判断哪些差异属于任务所关心的变化。[5]
当模型输出被笼统地称为对变化的“理解”时,数据集的这项规定尤其需要说清楚。为这项任务训练的检测器,学会回答的是一个关于建筑物的特定问题。如果把同一套软件用于作物种植类型转换、风暴灾损或道路施工,就得重新审视标签,以及用来判断检测是否成功的依据。数据集本身就是任务定义的一部分。
这也提醒我们,按国家归类 AI 研究时,需要分清几件事。中国研究人员可以利用美国城市的影像,开发出可供广泛复用的工具。研究出自哪里的机构,测试数据又来自哪里的地理区域,回答的是两个不同的问题。模型到了新的地区表现如何,还需要另外检验。
统一基准仍有附注
Open-CD 的报告在 LEVIR-CD 的测试集上评估各类方法。训练通常使用一张 RTX 3090,批大小为八,迭代 40,000 次。报告也列明了例外,包括更大的裁剪尺寸和不同的训练安排。评估指标重点衡量“变化”类别。[3]
其中一条关于基础模型的说明很能体现这些细节的重要性:对于 BAN 和 TTP,比较时只统计可学习参数。即使骨干网络被冻结,推理时仍然需要计算。因此,阅读报告中的参数量时,还要对照计算量和实测速度两列。[3]
有了这一区分,才能准确理解某种高效适配方法的实际意义。只更新少量权重,可以减轻训练负担;完整检测器的体积与运行速度,仍需单独考察。表格从几个角度呈现实验,只挑最有利的一列来看,就会丢掉有用的信息。
共享工具让这些选择更容易核查,各项选择对比较结果的影响依然存在。要让比较具有说服力,仍须说明每个结果对应的完整实验设置,尤其是在一种方法借助预训练基础模型、另一种方法采用小得多的网络时。
复用经过接口,也带上依赖
公开的推理示例使用 OpenCDInferencer:加载配置文件与检查点,再传入一对影像。示例中的类别是 unchanged 和 changed;它也能处理多对影像并保存预测结果。[1] 从训练好的检测器到使用其输出的程序,中间如何衔接,由此变得比较明确。
这个接口功能有限,却很有用。制图应用可以读取输出的掩码,同时承担检测前后的工作:选择具有可比性的观测影像,复核可疑检测结果,再决定将哪些更新纳入持续维护的地图。这是一种可设想的集成方式,示例本身展示的范围仍限于推理调用。
复用也会把软件依赖一并带入后续工作。截至 2026 年 9 月 25 日的检查显示,Open-CD 的初始化代码对 MMCV、MMEngine、MMSegmentation 和 MMDetection 都设有强制版本范围。[1] 因此,一项可复现的实验除了模型配置和检查点,还需要记录软件环境。
这为中国 AI 技术栈增添了什么
从 Open-CD 的组织方式来看,它更持久的贡献,在于让工程成果能够跨越模型代际继续使用。一个研究团队交付新检测器时,可以采用其他团队已经熟悉的形式,让对方按惯用流程训练、测试和检查。通用视觉基础工具由此获得一项专门用途,专门领域的研究成果也有了回到共享软件中的通道。
接下来,更有分量的证据将来自成功的复用:一个新数据集顺利接入,一项已发表的结果在有记录的软件环境中得到复现,或是一项模型改进在换到其他地区后仍然成立。这些结果将展示工具箱最有价值的作用:让另一个团队的下一次实验更容易开展,也让实验本身更容易被准确理解。
来源
- Open-CD 维护者,官方代码仓库,包括发布历程、
docs/inference.md和opencd/__init__.py;代码与文档核查日期为 2026 年 9 月 25 日。 - 曹向勇,西安交通大学教师主页,“Technical report of our change detection toolbox (OpenCD) is released on arXiv”,2024 年 8 月 27 日;研究机构发布的一手公告及作者名单。
- Kaiyu Li 及合作者,“Open-CD: A Comprehensive Toolbox for Change Detection”,arXiv 第 2 版,2025 年 4 月 11 日;架构、实验设置,以及表 3 关于参数量统计口径的说明。
- OpenMMLab,MMEngine 文档,“Runner”;共用运行框架的职责、自定义循环及钩子顺序约束。
- Hao Chen 和 Zhenwei Shi,LEVIR-CD 官方数据集页面;影像尺寸、分辨率、地理范围、观测间隔及建筑变化标注规则。
- Peter Potrowl,“Xi’an Jiaotong University 5.jpg”,2010 年 4 月 1 日,Wikimedia Commons;校园照片原图及 CC BY 3.0 署名信息。