业务问题:工具跑通了,结论就能写进报告吗

地理 AI agent 可以调用 GIS 工具、下载数据、算面积并生成地图。真正危险的时刻往往是命令返回成功以后:坐标系不适合测量、两期影像季节不一致、训练测试样本空间相邻,或者变化面积没有不确定性说明,结果仍可能看起来很专业。GeoAI Skills 项目把这一层称为用户请求与地理结论之间的方法层。它收集 18 个 Agent Skills,但明确说自己不替代 GDAL、PostGIS、Earth Engine、ArcGIS、QGIS、Python 库或 MCP server;它关注的是哪些前提必须成立、哪些检查要运行,以及什么时候应缩小主张或停止。

资料依据:成功的命令与可辩护的主张是两回事

README 把 CRS、单位、有效性、可比性、空间泄漏、不确定性和来源追溯列为地理主张前的检查项。它给出的 Sentinel-2 例子很直接:如果 2024 年 5 月与 2025 年 9 月的场景季节不匹配,agent 不应把像元差异汇总成确定的变化公顷数,而应解释为什么当前证据不支持该结论,并指出需要补齐什么数据。

该项目把 18 个技能分成获取、遥感准备、建模检测、空间分析决策和交付运维五个阶段。范围从传感器与处理级别可比性,到空间/组泄漏、阈值敏感性、克里金不确定性、网络障碍、SQL 正确性和制图表达。分层的价值在于:模型不必背诵所有工具文档,但每一种结论都要回到相应的方法门槛。

业务场景:灾后变化面积应该怎样被拦截

设想一个灾后团队让 agent 比较两期卫星影像并输出受损面积。正确流程先检查传感器、处理级别、季节、配准、共同有效掩膜和阈值敏感性;再记录 AOI、像元大小、类别定义和人工抽样;最后才报告带不确定性范围的面积。如果其中任一步没有证据,输出应是待补数据清单或暂定分析计划,而不是一个精确到小数点后的面积。

这并不降低自动化价值。它把 agent 的角色从“替人给答案”改为“替团队暴露主张所缺的证据”。对于规划、监管、灾害响应和公共沟通,这种停止条件比一次漂亮的地图更有用。

技术实施路径:给每次空间主张增加一道门

  • 将输出拆为工具结果、方法检查、可报告结论三层;
  • 对面积和距离记录投影 CRS、单位、AOI 与数据版本;
  • 对时序与变化检测记录传感器、时相、配准、掩膜和阈值;
  • 对机器学习记录空间或分组切分,而非只保留随机切分分数;
  • 对每个拒答或缩小结论保存触发规则和所缺证据;
  • 发布地图前检查分类、图例、色彩可达性和不确定性表达。

证据边界:项目测量不能被当成通用性能承诺

项目公布了路由测量:167 个案例的 routing precision 为 99.17%、recall 为 96.77%,并明确这只说明该技能被路由到何处,不能证明答案正确。另一个配对行为测量有 92 对干净样本,启用技能组观察到 4/92 个 critical spatial failures,控制组为 13/92。README 同时披露这些行为评分由模型评判、尚未校准和未完成人工验证;项目自身的 Phase 3 质量门槛也仍未通过。

这种把有效结果、失败门槛和未完成验证一起发布的做法,正是 agent 评估应保留的边界。不要把单一模型、运行时和测试套件的结果外推成所有 GIS agent 的安全性。

结论

地理 AI 的质量不应只看有没有调用工具,还要看它是否知道何时证据不足。把可比性、CRS、空间验证、来源和不确定性变成输出前的验收条件,才能让“命令成功”升级为可复核的空间结论。

关键词:GIS 是地理信息系统的分析环境;空间分析必须保留坐标系与不确定性;GeoAI agent 需要对证据不足给出可解释的停止条件。

来源:https://github.com/muend/geoai-skills