变化监测的难点往往不在于模型能否说出“这里变了”,而在于它能否稳定指向多个小对象,并让生产人员复查变化发生在哪个候选区域、两个时相分别看到了什么。把结果压成一个坐标,会掩盖候选覆盖不足、同类目标密集和时相证据不一致等问题。候选区域选择提供了一条更可审查的路线:先提出可见的空间对象,再由模型选择。

研究的八项固定口径

  1. 论文《From Coordinates to Candidate Regions: Temporal Change Localization via Region Selection in Remote Sensing Multimodal LLMs》于 2026 年 9 月 8 日以 arXiv:2609.08391v1 提交。

  2. 作者指出,直接以坐标 token 表示遥感目标时,小目标、密集目标和多目标场景容易出现定位不稳定。

  3. RS-RegionSelect 先用文本条件的候选区域生成器提出区域,再让多模态大语言模型从 <roi_k> 标记中选择目标区域。

  4. 论文为每个候选区域编码代理 token 与逐时相的对象 token,以保留视觉和时序信息。

  5. 训练任务覆盖定位、指代表达、视觉定位与理解,并覆盖单时相和多时相遥感数据。

  6. 候选区域生成器基于 MM-Grounding-DINO,并在 xView、DIOR、DOTA-v2、FAIR1M 和 SODA-A 上微调,统一了 36 个类别。

  7. 在 xBD 建筑物定位上,论文报告 RS-RegionSelect 的 F1 为 69.4,而坐标基线为 32.3。

  8. 在 S2Looking 变化定位上,论文报告 RS-RegionSelect 的 F1 为 50.5,而坐标基线为 36.4。

核心机制

这条路线把“找位置”拆成两件可分别验收的事。第一步由候选生成器按任务文本提出若干区域;第二步由多模态模型在 <roi_k> 中选择。每个候选携带代理 token 和逐时相对象 token,所以选择并非只看一个框的平面位置,也可利用变化前后图像的局部证据。

这种拆分有明确边界:候选阶段漏掉了真实对象,后续模型无从选择。因此不要只汇报最终 F1;生产验收应同时记录候选召回率、候选数量、选择准确率和人工复核后的有效率。论文中 xBD 的 69.4 对 32.3、S2Looking 的 50.5 对 36.4,说明其在论文协议下的相对表现,不能直接换算为任一地区的交付精度。

GIS 场景

把每个 <roi_k> 当作暂定空间对象,而不是一次性推理的内部编号。变化图层至少应保存任务 ID、候选 ID、几何范围、前后时相影像 ID、文本提示、候选分数、被选状态、模型版本和复核结论。这样,某个建筑变化或灾损标注可以回跳到两个影像时相及全部竞争候选;质检人员也能区分“候选未覆盖”“模型未选中”和“变化定义不一致”。

对于国土巡查、灾后建筑核查和设施变化清单,最终入库对象只应来自已确认的候选。未选候选与被拒绝候选仍需保留一段可审计期限,避免在阈值调整或投诉复核时失去证据。

技术路径

第一,固定两期或多期影像的采集时间、正射处理、坐标参考和覆盖范围,避免把配准误差误判为变化。第二,以任务文本生成候选区域,保存每个候选的几何、来源模型和召回评估。第三,绑定候选与每个时相的局部影像、云量或遮挡标记,让选择可追溯。第四,写入模型选择的 <roi_k>、分数和理由摘要,并把选择结果与候选表关联。第五,对边缘、低分、密集目标和高风险类别实施人工复核;确认后才生成正式变化对象及统计表。

检查清单

  1. 每个变化对象能否回到候选 ID、几何范围和全部输入时相?
  2. 是否分别量化候选召回、候选选择和人工确认,而没有只保留最终框?
  3. 影像配准、云影、季节差异和传感器差异是否有状态记录?
  4. <roi_k> 与空间要素是否是一一对应且可重放的关系?
  5. 高风险变化是否保留人工确认人、时间和拒绝原因?

风险边界

论文是预印本,报告数字受其数据、类别和评估协议限制。候选生成器在 xView、DIOR、DOTA-v2、FAIR1M 和 SODA-A 上的 36 类微调,并不保证覆盖本地业务类别。多时相中的阴影、季节物候、视角与配准偏差也会造成伪变化。候选区域选择提升可审查性,不替代影像质量控制和人工判读。

结论

变化定位要能交付,不能只让模型吐出一个坐标。将候选区域、各时相证据、选择结果和人工复核一起保存,团队才能知道错误发生在召回、选择还是判读,并把真正确认的变化稳定写入 GIS 数据库。

资料来源