“某地过去二十年有多少次热浪”看起来像一句普通提问,落到地球观测数据却同时包含地点边界、温度单位、连续天数、时段与栅格取样规则。直接让大模型生成 SQL,最危险的不是报错,而是生成一条能运行、却把地点、单位或统计口径解释错的查询。STRATOS 的研究把这些歧义放在 SQL 生成之前处理,为 GIS 数据门户提供了一套更可审计的思路。
可核查事实
STRATOS 于 2026 年 7 月 3 日提交 arXiv。论文面向 Copernicus 气象与地球观测数据的自然语言查询,指出这些数据通常以 NetCDF 或 GRIB 等专业格式交付;即使进入关系数据库,通用 Text-to-SQL 仍会在符号表达和数值/数组数据之间失配。
作者将 STRATOS 定义为 Spatio-Temporal Resolution Agent for Text-to-SQL。系统先解析地点与语义歧义,再生成 SQL:地理上下文部分通过外部知识库将地点解析为边界;领域知识部分把模糊概念映射到局部本体;数组语义提示帮助生成面向土地覆盖二维整型数组的访问逻辑;查询重写器则改写高成本空间谓词。
论文用“热浪”说明符号到数值的差距:定义会依本地气候、可用变量和持续条件而变化。其示例工作定义为日最高温 不低于 35°C 且连续至少三天,而底层气温可能需从 Kelvin 转换。这个例子不是通用热浪标准,而是说明查询系统必须把定义、单位转换和适用地点一起暴露给使用者。
STRATOS Evaluation Workload 含 7,520 组自然语言—SQL 对。它从 161 个经领域专家核验的问题出发,扩展为 376 个参数化模板,并使用 7 个气候变量、从日到十年的时间尺度,以及瑞士和希腊 20 个地点采样。工作负载涵盖聚合与时间汇总 1,580 对、变化趋势 840 对、事件/阈值/持续性 1,200 对、极值 2,440 对、排序 580 对和空间/高程约束 880 对。
在论文的 Qwen3-Coder 与 OpenSearch-SQL、三样本设置中,接入 STRATOS 后总体执行准确率从 10.44% 升至 49.60%,Valid Execution Score 从 0.086 升至 0.487。这是指定模型、提示和基准下的结果,不能外推成任何自然语言 GIS 查询都可靠。
论文还比较精确多边形和包围盒近似查询。对中等执行难度的 gold SQL,重写使平均数据库运行时间从 24.214 秒降至 1.708 秒,最大运行时间从 2,964.138 秒降至 332.069 秒;精确原始查询的 27 次超时在重写后为 0。不过,在 752 条测试 gold SQL 中,包围盒近似下有 59.2% 的答案在论文设定的容差下发生变化,说明提速不能替代空间精度声明。
核心机制
这项研究把“生成 SQL”拆成三个可检查阶段:第一阶段把地点名称变成明确边界或栅格点集;第二阶段把自然语言概念、单位和数组字段映射为可追溯的规则;第三阶段才生成并重写执行计划。每一阶段都应输出中间证据,使分析师能判断系统到底是在回答问题,还是仅拼出了语法正确的查询。
本体规则尤其应与模型提示分开版本化。若“热浪”“干旱”“城市”或“湖泊”的定义改变,系统应显示所选定义、阈值、单位转换和数据时间范围,并允许业务人员确认;不能把这些选择隐藏在一次 LLM 调用里。
GIS 场景
气候风险看板、流域调度、农业监测和城市热风险服务都可能需要自然语言入口。对这些场景,更稳妥的产品输出不是一句最终结论,而是查询卡片:区域几何或 ID、数据集合与版本、变量及单位、时间窗口、聚合方式、SQL/执行计划、近似标记、运行耗时和结果表。地图上的统计值由此可以回到同一套口径复算。
若系统把多边形简化为包围盒,应在界面上明确显示近似范围与误差风险,并禁止将该结果直接写入预警、执法或资源分配记录。空间条件越复杂、时间跨度越长,越需要区分“可运行”与“可用作决策依据”。
技术路径
- 为每个自然语言意图建立受控词表、本体规则、单位转换和责任人,并保留版本号。
- 将地点解析结果作为可见的几何、行政区 ID 或栅格点集,供用户在执行前确认。
- 对精确空间过滤、近似过滤和不同时间窗口分别记录结果差异、耗时与超时率。
- 建立包含区域外推、单位混淆、连续阈值和数组字段的回归查询集,而不是只测试简单问答。
- 将执行 SQL、数据版本、参数、近似标记和人工确认一并归档;高影响结论必须复核原始时空数据。
检查清单
- 是否显示地点边界、CRS 和解析来源,而非只显示地名。
- 是否显示概念定义、单位转换、阈值和连续时间条件。
- 是否标注精确过滤或近似过滤,并量化两者的结果差异。
- 是否保存数据集合版本、SQL、参数、运行耗时和超时处理。
- 是否让人工复核预警、执法和资源分配等高影响结果。
风险边界
STRATOS 证明的是论文数据模型与评测设置中的改进,并不证明本地 Copernicus 副本、行政区边界、传感器产品或业务定义已经正确对齐。近似空间查询即使更快,也可能改变统计答案;本体规则也会随政策、气候基准期和业务目的而变化。自然语言入口应服务于可回读的数据分析,不能替代专业人员对定义和空间范围的确认。
结论
气象与地球观测查询的难点不在于让模型写出 SQL,而在于把地点、定义、单位、数组语义和执行代价变成可检查的中间成果。GIS 团队若先建立这条证据链,再提供对话式入口,才能在提速的同时保住空间统计的可解释性。