导读 | Introduction
中国科学院空天信息创新研究院城市陆表环境遥感团队在单目卫星影像三维建筑提取方向取得进展,提出一种名为BDH-Net的实例级多任务学习方法,代码与数据集已在GitHub开源:https://github.com/wishx98/BDHNet。该方法创新性地利用倾斜视角(Off-Nadir)卫星影像,通过分析建筑屋顶与基底的几何偏移向量,直接且精确地推断建筑高度 。研究摆脱了传统正射影像缺少直接高度线索的限制,并通过实例级建模来捕捉建筑间的空间关系,显著提升了单目三维重建的精度。该方法为大范围、低成本的城市三维建模提供了新的解决方案,有效减少了对LiDAR等高成本数据源的依赖 。该成果发表于国际遥感领域期刊IEEE Transactions on Geoscience and Remote Sensing。第一作者为中国科学院空天信息创新研究院博士研究生石文旭,通讯作者为孟庆岩研究员。

研究背景 | Background
从遥感影像中精确提取三维建筑信息对城市规划、灾害响应等应用至关重要。当前,高精度的三维信息提取主要依赖机载Lidar和多视点立体影像,但其数据采集和处理成本高昂,导致数据可用性存在显著缺口。
为降低成本,基于深度学习的单张正射影像(即垂直俯视影像)高度估计方法应运而生。然而,这类方法性能受限于影像中缺乏直接的高度线索,模型只能依赖阴影等间接、不稳定的特征进行推断,这是一个本质上不适定的问题,难以保证精度。
为解决正射影像信息不足的问题,本研究尝试利用倾斜视角卫星影像进行单目三维建筑提取。倾斜影像虽然暴露了建筑立面,为高度估计提供了可能,但也带来了新的挑战,主要存在以下问题:
(1)几何关系建模复杂:如何在倾斜视角下复杂的透视关系中,利用屋顶与基底的偏移等线索,建立可靠、精确的高度估计模型。
(2)实例级信息融合困难:如何有效融合建筑的语义、边界、高度等多种实例级属性,并充分利用建筑与建筑之间的空间上下文关系,以应对遮挡并提升模型精度。
研究方法 | Methodology

图1 模型架构图
为实现从单张倾斜影像中提取实例级三维建筑信息的目的,研究设计了一个名为BDH-Net的端到端多任务学习框架。该框架的整体结构受到Mask2Former的启发,并针对建筑提取任务进行了深度优化,主要包含四大核心模块:
(1)图像编解码器(Image Encoder-Decoder):此模块是网络的基础,负责从输入的倾斜卫星影像中提取丰富的多尺度特征。编码器部分采用Swin Transformer 作为骨干网络,高效地捕捉图像的全局和局部信息。解码器则融合了特征金字塔网络(FPN)的思想,生成用于后续处理的多层次特征图。
(2)查询变化器编解码器(Query Transformer Decoder):该模块是连接像素级特征和实例级分析的桥梁。它接收前一阶段输出的像素特征,并通过一系列级联的交叉自注意力(CSA)模块,将这些特征提炼为针对每一个独立建筑的“实例查询”。每一个查询都代表着模型对一个潜在建筑实例的初步识别,包含了其类别、边界、高度和偏移向量等综合属性。
(3)多任务解码器(Multitask Decoder):在识别出独立的建筑实例后,此模块通过不同的多层感知(MLP)分支,对每个实例的属性进行并行化和精细化的预测。它会分别输出建筑的类别、用于生成边界的掩码嵌入(mask embeddings)、偏移向量嵌入以及高度嵌入等信息。其中,边界预测是通过将实例级的掩码嵌入与底层的像素嵌入进行矩阵相乘,从而生成精确到像素的建筑轮廓。(4)高度解码器(Height Decoder):此模块专门负责对建筑高度进行精准预测,通过以下三个关键策略来提升精度:1.实例内注意力(Intra-instance Attention):首先,模型整合了每个建筑实例的多种属性,包括其几何中心坐标和影像的尺度信息。随后,通过实例内注意力机制,对这些多模态属性进行筛选和融合,为每个建筑提炼出最能代表其高度的紧凑特征表示。2.实例间注意力图(Inter-instance Attention Graph, IAG):为解决建筑间遮挡等问题,研究引入了图神经网络。该模块将图像中的所有建筑实例视为图中的节点,通过学习它们之间的关系来构建一个“注意力图”。这使得模型可以利用“一个区域内的建筑高度可能相似”这一先验知识,当某个建筑因被遮挡而信息不全时,可以参考其邻近建筑的信息进行更可靠的高度推断。3.自适应分箱高度回归器(Adaptive Bins Height Regressor):在最终的高度预测阶段,模型并未采用传统的直接回归方式,而是将高度估计视为一个分类问题。它会根据场景特征动态地将连续的高度值划分到不同的“箱”中,然后通过对这些“箱”进行线性组合来得到最终的高度预测值。这种方法已被证明在深度估计任务中具有更高的稳定性和准确性。
核心结论 | Results
本研究通过一系列全面的定量和定性实验,验证了所提出的BDH-Net框架在单目三维建筑提取任务中的性能。实验结果表明,该框架在建筑轮廓分割和高度估计两个方面均取得了当前最优(SOTA)水平。
在建筑轮廓识别任务上,BDH-Net的平均精度(AP)达到了34.5,在更严格的IoU=0.75阈值下(AP75)为38.9。该性能指标全面超越了包括Cascade Mask R-CNN(AP 34.0 )在内的所有对比模型,证明了BDH-Net在复杂城市场景中精确勾勒建筑实例边界的卓越能力。

表1 实例分割度量的比较分析
在核心的建筑高度估计任务中,BDH-Net展现出显著的优势,总体平均绝对误差(MAE)为5.00米,均方根误差(RMSE)为7.77米,在所有对比方法中表现最佳。将建筑按高度分层评估后发现,BDH-Net的优势在高层建筑(27-100米)类别中尤为突出,其MAE(7.94米)相比次优方法提升了23%。对于数量最多的低层建筑(0-27米),其MAE也达到了最低的3.61米。

表2 不同方法高度估计指标的比较分析
通过消融实验结论得知,在基础模型之上,无论是引入屋顶-基底偏移向量(Offset)还是影像尺度信息(Scale)作为核心特征,模型的边界分割与高度估计精度均有显著提升,且偏移向量带来的性能增益最为突出。此外,实例间注意力图(IAG)和自适应分箱回归器(Adabins)模块的加入也对模型精度有明确的正向贡献。当同时集成偏移向量、尺度信息、IAG以及Adabins所有模块时,模型的综合性能达到最优(MAE 5.00m,AP 34.5),其精度远超仅使用部分组件的组合。这表明,将直接的几何线索(偏移与尺度)与先进的关系建模模块(IAG)相结合,能够协同增强模型对建筑实例的理解和三维信息的提取能力。

表3 BDH-Net消融研究的性能评估
为检验BDH-Net模型的泛化能力,在北京之外的上海、天津、武汉、广州、成都等五个城市进行了额外测试。实验结果表明,BDH-Net在所有测试城市中均展现出优越的泛化性,其建筑轮廓提取精度(AP)和高度估计误差(MAE)等关键指标全面优于其他对比方法。

表4 不同城市泛化结果的比较分析
文章引用格式 | Reference:
Shi W, Meng Q, Zhang L, et al. Instance-Level Multitask Learning for 3D Building Extraction from Monocular Off-Nadir Satellite Sensor Imagery[J/OL]. IEEE Transactions on Geoscience and Remote Sensing, 2025: 1-1. DOI: 10.1109/TGRS.2025.3591180.
论文链接 | Link:


