Urban Land Surface Environment Remote Sensing



团队成果 | 基于CNN和视觉Transformer协作学习的场景分类方法

Published by

on

导读 | Introduction

中国科学院空天信息创新研究院城市陆表环境遥感团队在城市灰度方向取得研究进展,提出一种基于CNN和视觉Transformer协作学习的场景分类方法。该方法可通过图像级标签导出精确的像素级伪标签,缩小了弱监督变化检测与全监督变化检测的差距,减少了变化检测任务的标注成本。该成果发表于国际遥感领域期刊IEEE Transactions on Geoscience and Remote Sensing (2024年影响因子:8.2),第一作者为赵茂帆博士,通讯作者为孟庆岩研究员和张琳琳助理研究员。

研究背景 | Background

CNN对局部结构特征有很好的表征能力捕捉到,但很难捕捉到长距离信息,而视觉Transformer善于提取长距离信息但容易忽略局部特征。目前,结合CNN和视觉Transformer进行高分辨率图像场景分类的工作较少,且存在以下问题:(1)特征仅简单堆叠,没有交互来形成更具判别力的融合特征;(2)CNN和视觉Transformer缺乏相互协作以增强其各自的特征提取能力。

研究方法 | Methodology

图1 总体框架

本研究将CNN和视觉Transformer分别视为局部网络和长距离网络,因此基于二者构建局部分支和长距离分支分别提取局部特征和长距离特征,并通过三种方式增强了它们之间的协作学习:(1)局部和长距离特征相互作用,以校准和融合特征;(2)局部分支和长距离分支互相学习,以弥补其不足;(3)局部特征、长距离特征和融合特征协同利用未标记样本,以进一步提高性能。本研究的主要贡献如下:

(1)设计了一种用于高分辨率图像语义识别的局部和长距离协作框架(L2RCF),如图1所示,该框架可以使得CNN和视觉Transformer充分协作;

(2)为有效改进融合特征的表示,设计了用于特征融合的跨特征校准(CFC)如图2所示;

(3)提出了基于深度监督和深度互相学习的联合损失,其不仅可以进一步改进融合特征,而且可以有效增强双分支特征提取器;

(4)为进一步挖掘未标记数据的潜力,设计了一种两阶段半监督训练策略。

图2 CFC示意图

核心结论 | Results本研究选择ResNet(ResNet18、Res—Net34、ResNet50)和DeiT(DeiT-T、DeiT-S)分别作为局部分支和长距离分支的骨干。因此形成了L2RCF-18-T、L2RCF-18-S、L2RCF-34-T、L2RCF-34-S、L2RCF-50-T、L2RCF-50-S六种不同参数量的L2RCF。

为有效评估L2RCF的性能,在RSSCN7、AID、NWPU三个数据集上进行实验,并与一些优异的场景分类方法对比。基于手工特征的方法(△)、基于CNN的方法(○)、基于视觉Transformer的方法(∗)以及基于CNN和视觉Transformer的方法(⊛)在表格中被分开展示。由于视觉Transformer应用于遥感领域还较少,对比方法中基于CNN的方法占比较多。

针对RSSCN7数据集,L2RCF与其它方法在20%和50%的训练比例下的总体精度(OA)对比结果如表1所示。基于CNN的方法表现远好于基于手工特征的方法,基于CNN的方法在20%和50%训练比例下分别获得了92.65%和95.54%的OA,而基于手工特征的方法仅为76.98%和81.69%。但它们的表现都远低于L2RCF,在不同骨干的设置下,L2RCF在20%和50%训练比例下的精度分别达到了94.22%-94.70%和95.56%-96.00%。

表1 L2RCF与其它方法的OA对比(RSSCN7数据集)

表2展示了基于AID与NWPU数据集本方法与其它方法的对比结果。在20%训练比例下,L2RCF明显优于对比方法。在50%训练比例下,L2RCF的表现明显优于基于手工特征的方法、基于CNN的方法和基于视觉Transformer的方法,并略优于基于CNN-VT的方法。此外,CTNet、SCBiT、HHTL和C²-CapsViT中使用的视觉Transformer骨干(ViT-B)的模型复杂度和计算复杂度远远高于L2RCF-50-S。

表2 L2RCF与其它方法的OA对比(AID和NWPU数据集)

为进一步探索L2RCF在较少标签样本下的性能,本研究在AID数据集上将训练比例设置为1%-10%,将步长设置为1%进行实验。图3显示了L2RCF-18-T、对应的骨干和基线的结果。当训练比例小于4%时,通过增加训练比例,所有模型的准确性都有明显改善。然而,当训练比例为4%时,DeiT-T精度提升明显减弱,ResNet18和Concat-18-T的精度甚至降低。这可能是由于训练比例太低,导致更大的随机性,即选出了不具代表性的训练样本。当训练比例较低时,L2RCF的改进更为明显。因此,L2RCF可有效应用于遥感任务中的标注样本不足的情景。

图3 基于AID数据集1%-10%比例下不同方法的OA

图4所示的球状图显示了L2RCF、局部网络(ResNet)和长距离网络(DeiT)基于AID数据集(20%训练比例)的精度和复杂度之间的关系。横轴代表计算复杂度,纵轴代表精度,球体大小代表模型复杂度。L2RCF-50-S取得了最高精度,且其计算复杂度和模型复杂度都处于中等水平。在局部网络和长距离网络中,ResNet152和DeiT-B获得了最高精度,这与它们的计算复杂度和,模型复杂度符合。L2RCF-18-T在L2RCF中精度最低,但它仍远远优于ResNet152和DeiT-B。且L2RCF-18-T的计算复杂度和模型复杂度显著优于ResNet152和DeiT-B。因此,L2RCF在精度、计算复杂度和模型复杂度方面都远远优于局部网络和长距离网络。

图4 精度与计算复杂度和模型复杂度的关系

文章引用格式 | Reference:

M. Zhao, Q. Meng, L. Zhang, X. Hu and L. Bruzzone, “Local and Long-Range Collaborative Learning for Remote Sensing Scene Classification,” in IEEE Transactions on Geoscience and Remote Sensing, vol. 61, pp. 1-15, 2023, Art no. 5606215, doi: 10.1109/TGRS.2023.3265346.

论文链接 | Link:

https://doi.org/10.1109/TGRS.2023.3265346

了解 城市陆表环境遥感 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读