导读 | Introduction
中国科学院空天信息创新研究院城市陆表环境遥感团队在近地表气温降尺度方向取得进展,基于ConvLSTM深度学习算法,对人口密集、社会经济活动强度较大的中国江北气候区实现了2m高度气温降尺度,获得了0.001°(WGS84,约100m)空间分辨率的日尺度最高/最低/平均气温数据集,并开展了时空精度验证分析。该成果发表在期刊Scientific Data,第一作者为博士研究生孙梦祺,通讯作者为孟庆岩研究员。

研究背景 | Background全球变暖导致极端高温事件频发,在人口密集和社会经济发达的城市地区,复杂地理环境和剧烈人类活动进一步加剧夏季极端高温严重性,亟需监测城市热环境演变趋势。近地表2m高度的空气温度是热环境研究的核心要素,但难以通过稀疏气象站准确获取连续空间分布的气温数据,且传统插值方法无法反映复杂环境中的细尺度温度变化,卫星衍生的地表温度虽能提供高分辨率城市热分布,但地表温度与空气温度在物理过程和时空特性上存在显著差异。机器学习降尺度方法通过构建高分辨率空间数据与气象站观测温度的关系能够实现气温降尺度,然而,大多数方法忽略了温度与环境之间的时空相关性,限制了其在复杂城市环境中的处理效果。
研究方法 | Methodology
1. 研究区与数据源
本研究聚焦于中国江北气候区,该区是中国气象局气候分类中的二级气候区,位于北亚热带(经度110.22°E-121.91°E,纬度27.20°N-34.10°N,WGS84坐标系)。其东部涵盖经济发达、人口密集的长江三角洲城市群,西部包括湖南和湖北部分地区。这些区域夏季常发生极端高温事件,对社会经济和环境造成严重影响。研究区内城市人口密度高、地表异质性强,城乡差异显著,导致温度在小尺度上呈现复杂变化。因此,选择江北气候区并聚焦夏季进行分析具有重要代表性。研究区域包含276个气象站提供温度记录。由于气象站未覆盖水体,且陆地与水体热性质差异明显,研究通过掩膜排除了水体温度数据。

图1 研究区示意图
研究涉及的多源数据集包括:
(1)ERA5与ERA5-land再分析数据:ERA5-land提供0.1°分辨率的每小时陆地温度数据,但陆水交界处存在缺失,采用0.25°分辨率的ERA5数据填补。所有数据转换为中国时区(UTC+8),通过双线性插值将ERA5重采样至0.1°并与ERA5-land融合,计算每日最高温度(Tmax)、最低温度(Tmin)和平均温度(Tmean)。
(2)辅助数据:SRTM90数字高程模型(DEM)提供地形信息,因高程与温度密切相关;CLCD土地使用/覆盖(LULC)数据反映不同土地类型对温度的影响;基于Sentinel-2影像计算植被覆盖率(FVC),通过NDVI估算(公式:FVC = (NDVI – NDVI_min) / (NDVI_max – NDVI_min))。气象站数据作为训练和测试标签。
(3)比较数据集:选用WData(2019-2022年6-8月日数据)和TData(2019-2023年6-8月月数据)评估降尺度结果(CMData)性能,时间尺度统一为月尺度。
2. 模型结构与参数
为捕捉温度的时空相关性,本研究采用ConvLSTM算法。该模型由三个ConvLSTM层(隐藏单元数分别为128、64、64)和一个卷积层组成,卷积核大小为5×5。模型以批处理大小32训练50轮,损失函数为Tmax、Tmin和Tmean的加权均方误差(MSE),权重分别为0.4、0.4和0.2,以优化Tmax和Tmin的预测精度。

图2 ConvLSTm模型结构
3. 降尺度工作流程
研究基于两项假设:周围环境影响中心位置温度、温度与环境因素关系在数年内相对稳定。工作流程如下:
(1)数据预处理:ERA5、ERA5-land、DEM、LULC和FVC数据经双线性插值处理至100米分辨率。输入变量包括Tmax、Tmin、Tmean、DEM、FVC和LULC。
(2)训练过程:以气象站数据为标签,提取站点及周围5×5窗口数据,标准化后输入模型。训练和测试站点随机划分,损失函数为加权MSE。
(3)结果验证:使用MAE、RMSE和R²评估模型性能,并与WData和TData比较,在上海(沿海)和长沙(内陆)两城市剪裁数据进行精度和分布对比。
(4)模型推理:采用滑动窗口方法,对每个像素推断Tmax、Tmin和Tmean,生成100米分辨率的每日温度数据。
核心结论 | Results
ConvLSTM模型通过MAE、RMSE和R²指标评估性能,比较了气象站观测值与预测值。结果显示,训练集与测试集精度相近,表明模型未过拟合,具有良好的泛化能力。Tmean预测精度最高,MAE为0.564°C,RMSE为0.733°C,R²为0.943;Tmax精度最低,MAE为0.784°C,RMSE为1.027°C,R²为0.929;Tmin居中,MAE为0.696°C,RMSE为0.908°C,R²为0.892(图3)。整体而言,模型预测误差较小,适用性强。

图3 总精度结果图
在月度尺度上,8月预测精度高于6月和7月,MAE和RMSE较低,R²较高,且8月的IQR(四分位距)较小(图4(a))。这可能与LSTM的记忆特性有关,模型在后期时间步更准确。在年度尺度上,2020年和2023年精度较低,IQR较大,2023年预测值偏高;2022年Tmax和Tmin预测精度较高,2019年Tmax精度也较好(图4(b))。总体来看,8月精度最高,年度精度无明显规律。

图4 月尺度与年尺度验证结果
站点的验证结果显示大多数气象站预测精度高,MAE低于1°C,R²高于0.9(图5)。但个别站点表现异常:58317站(岳西,安徽)Tmax预测MAE达2.34°C,R²仅0.40,影响Tmax整体精度;58514站(星子,江西)Tmin预测MAE为1.23°C,R²为0.63。Tmean预测普遍较准,MAE多低于0.8°C,R²高于0.9,但58317站仍较低(MAE 1.1°C,R² 0.69)。这些异常站点影响了Tmax、Tmin和Tmean的整体性能。

图5 站点验证分布结果
研究测试了辅助数据(LULC、DEM、FVC)对模型性能的影响(图6)。森林地区精度最低,Tmax MAE为1.00°C,Tmin 0.76°C,Tmean 0.68°C。高海拔(335.3-759.1米)站点精度下降,Tmax MAE为1.24°C,Tmin 0.85°C,Tmean 0.78°C。高植被覆盖(FVC>0.75)区域精度稍低,Tmax MAE为0.81°C,Tmin 0.71°C,Tmean 0.58°C。58317站(森林,海拔427米,FVC 0.90)和58514站(农田,海拔41米,FVC 0.81)的低精度与这些因素相关。总体上,非森林、低海拔、中等植被区域预测更准。

图6 辅助数据验证结果
与WData(日尺度)和TData(月尺度)相比,CMData(本研究数据集)在空间分辨率(100米 vs. 1公里)和时间覆盖(含2023年)上占优(图7)。WData在重叠期精度略高(MAE和RMSE多低于0.5°C),但CMData更能反映城市及中心区域温度变化和热岛效应。TData精度较差(MAE和RMSE 2-4°C),CMData远超之(MAE和RMSE多低于1°C)。在上海(图8)和长沙(图9),CMData边界更清晰,热岛效应更明显,优于WData的模糊分布。

图7数据集对比结果

图8上海市和市中心数据集对比示意图

图9长沙市和市中心数据集对比示意图
根据空间分布图可知,高海拔地区温度显著低于低海拔,北部低于南部,沿海低于内陆,每日温度在7月中旬至8月初达峰值,并且受到显著的天气波动影响。2023年7月15日(图10)的气温分布图显示,江北气候区高海拔地区温度低,但东部沿海因热岛效应未显现低温;上海城市中心温度高于周边,中心城区Tmax西南高,Tmin东部高,Tmean西南和东部均较高。

图10江北气候区、上海市、上海市中心2023年7月15日影像
文章引用格式 | Reference:
Sun M, Meng Q*, Zhang L, et al., 2025. Convolutional Long Short-Term Memory network for generating 100 m daily near-surface air temperature[J/OL]. Scientific Data, 12(1): 749. DOI:10.1038/s41597-025-05032-6.
论文链接 | Link:
https://www.nature.com/articles/s41597-025-05032-6
数据集链接 | Link:


