多传感器融合基础之二深度图空间(Depth Map Space)全面解析
多传感器融合基础之二深度图空间(Depth Map Space)全面解析
深度图空间是多传感器融合体系中一个极为特殊且重要的测量空间。它既不完全属于二维图像空间的范畴,也并非三维点云空间的直接等价物,而是恰好站立在两者之间的分界线上,以二维网格为骨架,以三维几何为灵魂,构成了一座连接外观与形状、纹理与尺度的桥梁。在自动驾驶、机器人导航、增强现实以及三维重建等几乎所有涉及真实世界感知的领域中,深度图空间都扮演着一个承上启下的中枢角色——它从图像空间继承了规则的数据结构与邻域拓扑,又将每一个像素从纯粹的光度载体升级为几何测量的载体,使得密集的三维感知成为可能。要全面理解深度图空间,必须从它的数学定义出发,循着维度、数据结构、采集方式、坐标变换、遮挡特性、算法生态以及与其他测量空间的交互关系这条完整的脉络,逐一加以解剖,并在与图像空间和点云空间的对比中,逐渐明晰它那独一无二的“2.5维”本质。
相关内容可以看我的其他文章:
1.多传感器融合基础之一图像空间(Image Space)全面解析_像素矩阵 hwc-CSDN博客
2.多传感器融合基础之二深度图空间(Depth Map Space)全面解析-CSDN博客
3.多传感器融合基础之三点云空间(Point Cloud Space)全面解析-CSDN博客
4.多传感器融合基础之四雷达检测空间(Radar Detection Space)全面解析-CSDN博客
5.多传感器融合基础之五体素空间(Voxel Space)全面解析-CSDN博客
一、基本定义与数学表示
深度图在数学上可以定义为一个二维标量函数,其中定义域与一幅常规图像完全相同,是离散像素坐标
构成的矩形网格,而值域则是非负实数,代表从相机光心沿着穿过该像素的射线方向到最近物体表面的物理距离。

与普通彩色图像将颜色作为输出不同,深度图的输出维度是
(虽然有时会加入置信度通道形成双通道),它所编码的信息不再是与光照、材质相关的光度属性,而是真实世界中物体表面到传感器之间的欧氏距离(在N维空间中两个点之间的直线距离)。这个距离可以是沿着光轴方向的深度值
,也可以是沿着射线方向的径向距离
,取决于具体的传感器与坐标定义。在针孔相机模型下,通常所说的深度图指的是沿着光轴方向的
分量,因为这种定义与透视投影模型天然契合,使得深度图能够以最简洁的方式和彩色图像共享同一套内外参。
从映射的角度审视,深度图实现了从二维图像空间到一维深度值的函数映射,形成了一个的三元组集合。这种结构在计算机图形学与计算机视觉文献中常常被称为“2.5维”表示,因为它虽然以二维网格为载体,却每个像素都携带着明确的第三维几何信息,然而这个第三维只存在于可见表面上,无法表达完整的体积或背面结构。如果我们将彩色图像看作是对场景外观的密集采样,那么深度图就是对场景可见表面几何的密集采样,两者在像素级别上一一对齐,共同构成了一幅完整的信息图景。这种对齐特性是深度图空间区别于其他几何表示的最根本特征之一:它天然地维持了与对应彩色图像(如果有的话)的像素级对应关系,无需像点云那样通过投影和外参对齐才能找到图像像素与三维点的映射。在数学形式上,如果用齐次坐标表达,一个像素
与其深度
的关系可以通过反投影公式直接得到三维点
:

其中是相机内参矩阵的逆。这个公式的简洁性深刻地揭示了深度图空间的本质:它不是三维点云,但随时可以无歧义地、逐像素地转换为三维点云;它不是纯二维图像,但它的每一个像素都锚定了一个确切的三维位置。正是这种双向的可转换性,使深度图空间成为二维与三维之间的过渡地带。
二、维度的双重性
深度图空间的维度属性是其最迷人却也最容易引起混淆的地方。从数据结构的角度看,它只有两个空间坐标轴和
,因此它是一个二维域上的函数。但每个位置上的函数值
携带的是第三维的几何信息,意味着它在信息维度上已经超越了普通二维图像。通常我们用“2.5维”来称呼这种表示,因为它并非完整的三维——你无法旋转一幅深度图从另一个角度观察场景,也无法看到物体的背面或被遮挡的结构。与真正的三维体素网格相比,深度图仅仅是三维场景在当前视角下的一个薄壳,它是一层表面而非一个体积。

将深度图与彩色图像并置时,维度差异更加明显。彩色图像在网格上附加了
个光谱通道,但这些通道并不增加任何空间几何维度,它们只描述该像素位置接收到的光线的颜色成分。深度图则在
网格上附加了唯一的深度通道,这个通道恰恰指向了图像所缺失的那个空间维度——深度。因此,一幅彩色图和一幅与之配准的深度图组合在一起,就形成了一个
的丰富表示,既拥有纹理外观,又拥有尺度几何。RGB-D相机正是以这种组合作为其原生输出格式,而这一格式的威力在于,它为每一个可见表面点同时赋予了“看起来像什么”和“在哪里”的双重答案。

与三维点云空间对比时,维度差异同样鲜明。点云空间有三个独立的几何自由度,点可以在空间中任意分布,不受网格束缚。深度图空间虽然在信息内容上与从该视角采集的点云几乎等价(都只能看到可见表面),但它将点云的三个坐标中的两个——和
——通过网格位置隐式编码了,只需存储Z一个显式几何值。这相当于对点云进行了一次结构化的降维:用规则的二维索引取代了两个浮点坐标,从而在存储和访问上获得了巨大优势,但代价是失去了表达任意视角几何的灵活性。简而言之,深度图是一种带有强烈视角依赖的结构化三维信息,它的维度“在二与三之间”,成就了它独一无二的桥梁地位。

三、数据结构:规则网格上的几何载体
深度图在计算机中的存储形式与普通灰度图像几乎完全一致:它是一个二维数组或矩阵,每个元素存储一个深度值。这种规则网格的数据结构赋予了深度图所有图像空间的结构性优点——O(1)随机访问、行列连续存储、便 SIMD向量化和GPU纹理缓存优化。当一张深度图被加载到GPU显存中时,它可以直接被纹理单元采样,甚至可以利用硬件的双线性插值单元进行亚像素深度查询。这一特性在实时渲染、点云重建和视觉SLAM中极为重要,因为许多应用需要频繁地在像素坐标与三维坐标之间进行快速转换。
然而,深度图作为数值矩阵也有其特殊之处。与彩色图像不同,彩色像素通常以8位无符号整数存储(意味着每个颜色通道用一个8位无符号整数来表示其强度值。在RGB色彩模式下,一个彩色像素通常由红(R)、绿(G)、蓝(B)三个通道组成,每个通道的数值范围是0 - 255,这是8位无符号整数的极限。),而深度值需要更高的精度和更大的动态范围。室内RGB-D相机(如微软 Kinect、英特尔RealSense)通常输出16位无符号整数,以毫米为单位存储深度,这样可以表示0到65.535米的距离,精度足以满足室内应用。室外激光雷达投影出的深度图则往往需要32位浮点数来表示更大的距离范围和更高的相对精度。此外,深度图常常伴随无效值——某些像素可能由于遮挡边界、镜面反射、吸光材质或超出量程而无法获得有效的深度读数,这些位置通常被标记为0或一个特殊的NaN值,形成一个稀疏的孔洞图案。这种有效与无效像素的混合使得深度图在某种程度上介于稠密与稀疏之间,后续章节将详细讨论。
从多传感器系统的角度看,深度图的数据结构恰好处于图像和点云之间的最优位置:它保持着图像数组的规整性,使得它可以轻松地与同尺寸的彩色图像进行通道拼接,送入任何为图像设计的神经网络;同时它的数值内容是三维几何,可以随时展开为点云。这种兼容性使得深度图在数据融合流水线中几乎不需要做任何结构转换——如果融合发生在二维域,直接拼接通道即可;如果融合发生在三维域,反投影为点云后再进行处理。因此,深度图数据结构上的“平庸”恰恰是其工程价值的重要来源。
四、信息的密度与稀疏性:稠密与稀疏的双重面孔
深度图在信息密度上呈现出一种有趣的双重性。一方面,从传感器的设计目标来看,深度图被视为稠密表示——理想情况下,每一个像素都应该有一个对应的深度值,就像彩色图像每一个像素都有颜色一样。被动式双目立体匹配和主动式结构光或飞行时间相机,其最终目的都是输出一幅与图像等分辨率的稠密深度图。在这种稠密形态下,深度图能够提供连续的表面几何信息,不会像激光雷达点云那样在物体表面之间留下巨大的空白。它能够精确地刻画人脸微小的起伏、布料褶皱的细节、墙壁上不平整的纹理,这些是稀疏点云难以企及的几何细粒度。
但另一方面,实际获取的深度图往往远非完美稠密。双目立体匹配在无纹理区域(如白墙、天空)会失败,产生大片空洞;ToF相机在多路径反射和强环境光下会产生飞点或饱和;结构光相机在远距离或倾斜表面处精度下降甚至无法解码。即便在正常工作的区域,深度图在物体边缘处也常出现“膨胀”或“空洞”现象——前景物体边缘的像素往往混合了前景和背景的深度,导致深度值不可靠。因此,许多实际应用中的深度图是部分稀疏的,需要通过空洞填充、边缘保持平滑等后处理步骤来提高完整性。来自激光雷达投影的深度图更是极度稀疏的典型:激光雷达在垂直方向通常只有16线、32线或128线,投影到高分辨率图像平面后,可能99%以上的像素都没有有效深度。这种稀疏深度图在形式上是一张图像,实质上却更接近一个带有网格索引的点云,它兼备了图像的结构和点云的稀疏。
因此,深度图空间的密度是一个连续谱,从极度稀疏(几根激光雷达线束投影)到半稠密(视觉SLAM的稀疏特征深度)再到近乎完美稠密(高精度结构光扫描),各种密度级别都有对应的传感器和算法。这种灵活性是深度图区别于其他测量空间的显著优势:它可以根据任务需求和硬件条件在密度、算力与精度之间进行细粒度权衡,而图像永远是完全稠密的,点云则天然是稀疏的,唯有深度图能够在这一谱带上自由滑动。
五、采集方式:从被动三角到主动飞行
深度图的获取方式极为多样,几乎涵盖了从光学三角测量到时间飞行、从被动立体到主动投射、从物理传感器到数据驱动学习的所有技术路径。每一种采集方式都在深度图的质量、密度、量程、精度、成本和对环境光照的敏感性上留下了独特的印记。
1.被动式双目立体视觉
被动式双目立体视觉是最经典的方法。它通过两台水平排列的相机同时拍摄场景,利用立体匹配算法在左右图像之间寻找对应像素,计算出视差,再通过三角测量公式
将视差转换为深度。双目系统的优势在于成本低、硬件简单、无主动光源干扰,但它完全依赖于场景纹理——遇到白墙、天空或重复纹理时,匹配就会失败,产生大面积空洞。此外,深度精度随距离的平方衰减,使得双目更适合于中近距离应用。多视角立体则进一步扩展,用几十甚至上百张不同角度的图像进行密集匹配,生成极高精度的深度图,这是摄影测量和电影特效中三维建模的常用手段。

可以利用Python的OpenCV库通过视差图来估算深度图。这种方法需要一对立体图像,通过计算两幅图像中对应点的视差来得到深度信息。以下是实现将一对立体图像转换为深度图,并对比原图与生成深度图效果的完整代码:
import cv2
import numpy as np
import matplotlib.pyplot as plt
# 读取立体图像对
imgL = cv2.imread('C:/Users/lzm08/Desktop/left_image.jpg', 0)
imgR = cv2.imread('C:/Users/lzm08/Desktop/right_image.jpg', 0)
# 创建视差计算器
stereo = cv2.StereoBM_create(numDisparities=16, blockSize=15)
# 计算视差图
disparity = stereo.compute(imgL, imgR)
# 将视差图转换为深度图
# 这里简化处理,深度与视差成反比
depth = 1.0 / (disparity + 1e-6) # 加一个小值避免除零错误
# 归一化深度图以便显示
depth = cv2.normalize(depth, None, 0, 255, cv2.NORM_MINMAX, dtype=cv2.CV_8U)
# 显示原图和深度图
plt.figure(figsize=(15, 5))
plt.subplot(131)
plt.imshow(imgL, cmap='gray')
plt.title('Left Image')
plt.axis('off')
plt.subplot(132)
plt.imshow(imgR, cmap='gray')
plt.title('Right Image')
plt.axis('off')
plt.subplot(133)
plt.imshow(depth, cmap='jet')
plt.title('Depth Map')
plt.axis('off')
plt.show()
上述代码中,首先读取一对立体图像,然后使用cv2.StereoBM_create创建视差计算器,接着计算视差图,再将视差图转换为深度图。最后,使用matplotlib库将原图和深度图显示出来,方便对比效果。
2.主动式
主动式方法通过向场景投射已知模式的光来简化匹配问题。结构光相机(如第一代 Kinect)使用近红外投影仪投射伪随机散斑图案,然后由一个红外相机拍摄该图案的形变,通过三角测量计算深度。由于投射图案为场景增加了丰富的“人工纹理”,结构光即使在无纹理的表面上也能可靠工作。但其量程有限(通常数米以内),且在室外阳光中的红外成分干扰下难以使用。飞行时间(ToF)相机则走了一条完全不同的路:它发射调制红外光脉冲,测量光往返的时间或相位差,直接计算出距离。ToF相机的优点是计算量小、帧率高、近距离精度好,但存在多路径反射干扰和距离混叠问题,分辨率通常低于彩色相机。更高级的间接ToF和直接ToF传感器在移动设备的面部解锁和手势识别中已得到广泛普及。

激光雷达虽然通常输出点云,但将其点云通过内外参投影到图像平面上,就得到了一幅稀疏深度图。这种深度图继承了激光雷达的量程远、精度高、对光照不敏感的优点,但也继承了线数有限带来的垂直稀疏性。近年来,固态激光雷达和 4D 成像雷达也开始输出致密化的深度图,模糊了传统雷达与深度相机之间的界限。此外,纯视觉的单目深度估计利用深度神经网络从单张彩色图像中直接回归深度图,在大量标注数据的驱动下,甚至能够对无纹理区域和远距离做出合理预测,尽管其绝对精度和泛化性仍不及物理传感器。采集方式的百花齐放意味着深度图空间并非一种单一物理过程的产物,而是一类具有共同数据格式的几何信息的统称,这赋予了它极强的适应性与异构融合的潜力。
六、坐标系统与变换:二维网格与三维几何的转换枢纽
深度图空间的坐标系统建立在图像空间坐标系与相机坐标系之间的一种紧密耦合关系之上。理解这种关系,是理解深度图何以成为桥梁的关键。深度图本身使用像素坐标作为索引,这与任何普通图像毫无二致。但每个像素所隐含的几何实体不是一个颜色值,而是一条从相机光心出发、穿过该像素在成像平面上位置的射线。给定内参矩阵
,像素
对应的归一化方向向量为:

这个方向向量再乘以深度值 ,就得到了相机坐标系下的三维点
。这个过程被称为反投影。反过来,若已知相机坐标系下的三维点,投影到深度图像素坐标并获取深度值的公式就是透视投影公式,只不过深度值恰好是
(对于光轴深度定义)。

这种变换的一个重要特性是:深度图与二维图像之间的坐标变换是恒等的——同一个像素 在彩色图和深度图中对应着完全相同的位置,前提是两图已经配准且分辨率一致。这就意味着,深度图空间中并不存在独立于图像空间的新的二维变换。深度图不需要单独的单应变换、仿射变换,因为它永远伴随一幅参考图像而存在,任何对深度图的裁剪、缩放、旋转都应该与对应的彩色图像同步进行。然而,深度图向三维空间的转换是它独有的能力:将整幅深度图反投影,就得到一个结构化的点云——说它“结构化”,是因为点云中的点与二维网格保持着有序对应,每个点都知道自己是从哪个像素来的。这种有序性在图像引导的点云滤波、深度图补全、BEV变换等任务中发挥了巨大作用,是普通无序点云不具备的信息。
在世界坐标系与深度图之间,变换链路为:世界坐标系 →(外参[R∣t])→ 相机坐标系 →(内参K)→ 深度图像素坐标。由于深度图的像素本身就携带着 ,从深度图重建世界坐标只需走反向链路即可。在多传感器系统中,往往需要将激光雷达点云变换到相机坐标系,再投影到深度图进行像素级对齐;或者将深度相机获取的深度图反投影为点云,再变换到激光雷达坐标系进行几何一致性检查。所有这些操作都频繁地使用上述变换链。正是这种坐标系统上的双重归属——既属于二维图像网格体系,又可无缝切换至三维笛卡尔体系——使深度图空间成为了多传感器标定与融合的首选中间层。
七、邻域与拓扑:规则网格上的几何边界
由于深度图在数据结构上与普通图像完全一致,它天然继承了图像空间的规则邻域拓扑。任何一个内部像素,它的四邻域或八邻域在空间索引上是确定且固定的,不需要像点云那样执行K近邻或半径搜索。这种规则性使得几乎所有为图像设计的空间滤波器和卷积算子都可以直接应用在深度图上,而无需任何算法层面的适配。均值滤波、中值滤波、双边滤波、引导滤波——这些原本用于图像降噪和边缘保持的工具,在深度图上同样有效,且有着清晰的几何解释:它们在对表面进行局部平滑。
但是,深度图的规则邻域中隐藏着一个图像所没有的复杂性:深度不连续边缘。在彩色图像中,物体的边界通常表现为颜色或亮度的突变,这些突变虽然对边缘检测有意义,但并不破坏像素之间的邻域拓扑关系——一个像素仍然与它的所有邻居在网格上是连通的。但在深度图中,位于物体边界上的像素,其深度值会从一个距离(前景物体)突然跳跃到一个完全不同的距离(背景)。如果简单地在这样一个边界像素上应用常规的邻域平滑滤波,就会将前景和背景的深度混合,产生“膨胀”伪影,使物体边缘看起来像被涂抹过一样。这一问题在深度图处理中相当棘手,催生了一类专门针对深度图边缘的滤波算法,它们通常会联合彩色图像中的边缘信息来指导滤波过程——这就是引导滤波背后的动机:用彩色图的强边缘来约束深度图的平滑区域,避免跨越物体边界进行深度平滑。
解释说明:在深度图处理中,针对边界像素应用常规邻域平滑滤波产生“膨胀”伪影问题,可采用引导滤波算法来解决。引导滤波引入“引导图像”,让滤波过程具备“针对性”,通过引导图的像素分布约束,实现“平坦区域强平滑、边缘区域弱平滑”,既彻底压制噪声,又完整保留图像的边缘、纹理等关键细节,避免了常规邻域平滑滤波在边界像素处产生“膨胀”伪影的问题,甚至可实现跨模态图像的协同优化。
在深度学习领域,深度图同样受益于规则的邻域拓扑。2D卷积神经网络可以直接以深度图作为输入通道之一,与RGB通道一起送入网络,让网络在早期就获得几何线索。一些专门用于深度图处理的网络,如深度补全网络,则利用2D卷积的平移等变性和局部感受野来从稀疏深度测量扩散出稠密的深度估计。由于深度图的邻域是规则的,这些网络可以在不进行任何体素化或邻域查询的情况下,高效地学习几何先验,如表面的局部平滑性、平面性以及边界处的急剧过渡。与点云上的图神经网络或稀疏卷积相比,深度图上的2D卷积在计算效率和实现简洁性上具有明显优势,这也解释了为何许多实时深度补全和深度估计系统仍然选择在深度图空间操作,而不是将稀疏测量直接转换为点云再进行处理。
八、表征能力:几何精度与纹理语义的十字路口
深度图空间的表征能力恰好位于图像空间与点云空间之间,它既不像图像那样完全没有几何,也不像点云那样几乎没有纹理。深度图本身就是几何——它是一个视点依赖的表面几何的密集快照。在理想条件下,一幅高分辨率深度图可以捕捉到亚毫米级的表面细节,远超人眼的分辨极限。工业级结构光扫描仪输出的深度图能够重现硬币上的浮雕图案、指纹的脊线、机械零件上的微小划痕,这些细节在对应的彩色图像中可能因为均匀的颜色而无法被察觉,而深度图则通过纯粹的几何起伏将它们忠实地记录下来。这种对表面微观几何的敏感使深度图在工业检测、逆向工程、文物保护等领域不可或缺。
然而,深度图表征能力的上限受制于其视角依赖性。它只能表达从当前视点可见的表面几何,对于被遮挡的背面、物体的内部结构、场景中相互穿插的体积关系,深度图完全无能为力。此外,深度图本身不携带颜色信息——虽然我们常将RGB与深度对齐,但深度图作为一个独立的测量空间,其值域中只编码了距离。即便某些传感器同时输出RGB和深度,这也是两个并行空间的信息,而非深度图空间内在的多模态融合。因此,深度图单独存在时,它能提供精确的几何但缺乏语义纹理;彩色图单独存在时,它有丰富的外观但缺乏尺度。只有在二者对齐的情况下,才能获得既有几何又有纹理的完整表面表示。这也是为什么RGB-D数据集成为了室内场景理解的基石:它将两种互补的表征能力耦合在一个统一的像素网格上。
与点云空间的对比可以更加清晰地凸显深度图的表征优势与劣势。相对于稀疏点云,深度图的优势在于几何连续性:点云中相邻两个激光点之间可能相距数厘米甚至数十厘米的间隙,在这段间隙内的表面几何是不可知的,而深度图的密集采样能够完整地填充这些间隙。相对于稠密点云(如来自高精度三维扫描仪),深度图的优势在于结构规整和与图像的天然对齐。但深度图的劣势同样明显:它是一种“二维半”快照,无法像真正的三维点云那样自由旋转和融合多视角信息——想要获得完整的物体几何,必须采集数十甚至数百张不同角度的深度图,然后通过配准和融合(如截断符号距离函数TSDF融合)将它们合并成一个完整的三维模型。这个过程本身就说明了单幅深度图的表征是不自足的,它渴望着与其他视角深度图或者三维空间的整合。
九、遮挡与视角:所见即所得,所不见即所失
深度图的另一个根本属性是其强烈的视角依赖性,这一点与单张彩色图像完全相同。每一幅深度图都是从某个特定的相机姿态出发,对场景进行的一次“可见表面采样”。在光心到场景的射线上,只有第一个被击中的表面会产生有效的深度值,该表面之后的一切都被遮挡,完全无法在深度图中体现。因此,深度图与图像一样,都患有“单视角盲区”这一顽疾。一张从正面拍摄的人脸深度图能够精确地记录鼻尖、眼窝和嘴唇的起伏,但它对后脑勺的形状一无所知;一张俯拍的道路深度图能够描绘路面和车辆顶部的距离,但对车底和路沿下方的几何毫无涉及。
这种遮挡特性使得单幅深度图不适合直接用于完整的三维场景理解。在机器人导航中,如果仅依赖当前帧的深度图来做避障,机器人可能看不到桌子下面悬空的空间,也感知不到转角背后的障碍物。这正是SLAM和三维重建系统需要融合多帧深度图来构建全局地图的原因——通过将不同视角的深度图累积到一个世界坐标系下的体素网格或面元(surfel)集合中,逐步填补单帧的遮挡盲区。经典的KinectFusion算法就是将连续的多帧深度图实时融合进一个TSDF体素场,从而获得不断扩展的完整几何模型,这一工作的革命性之处就在于它巧妙地克服了单幅深度图固有的视角局限性。
但视角依赖性并非全然是缺点。在某些应用场景中,这种以自我为中心的几何表示恰恰是最方便的形式。例如,在增强现实设备中,用户需要的是当前视角下周围环境的深度信息,用以实现虚拟物体的正确遮挡和物理碰撞。此时,提供一个相对于用户视点的深度图比提供全局点云更加直接和高效。自动驾驶中的视觉感知模块也常以当前相机视角的深度估计作为中间输出,再转换到BEV空间进行融合。因此,遮挡与视角限制既是深度图的短板,也是它在特定任务中的定位优势——它天然就是“以观察者为中心”的几何表达,而许多交互任务恰好需要这种以自我为中心的空间参照系。
十、处理算法:从经典滤波到深度学习
深度图空间的算法生态可以大致分为两个层级:底层图像处理与高层感知推理。在底层,深度图继承了图像处理领域数十年的算法积累。深度图降噪是其中最基础也最重要的一个环节。原始的深度图常常伴随着多种噪声源:ToF相机的散粒噪声和热噪声、结构光相机的散斑解码误差、双目匹配的随机错误匹配。针对这些噪声,中值滤波能够有效地去除孤立的飞点,双边滤波则能在平滑深度表面的同时保留物体的边缘——它通过在空间距离权重之外再引入深度值差异权重,阻止了跨边界平滑。引导滤波更进一步,使用同一视角的高质量彩色图像作为引导图,将彩色图中的边缘结构迁移到深度图上,实现了比双边滤波更高效且无梯度反转伪影的边缘保持效果。这些滤波器的共同前提是深度图的规则网格结构,使得它们可以直接从图像处理工具箱中取出使用,无需适应不规则数据。
空洞填充是深度图处理的另一大主题。由于遮挡、材质或匹配失败产生的无效像素需要被合理地填补。最简单的方法是膨胀或近邻插值,但这会在边缘处造成几何失真。更高级的方法使用快速行进法或基于偏微分方程的修复,从有效区域向空洞内逐步扩散深度值,同时尊重边缘边界。在消费级RGB-D相机中,厂商通常会在驱动层面实现一套复杂的深度图后处理流水线,包括时域滤波(利用前后帧信息)、空域滤波和空洞填充,最后才输出给用户相对干净的深度图。
在高层感知方面,深度图在深度学习时代获得了全新的生命力。深度图可以直接作为卷积神经网络的输入通道之一,与RGB通道堆叠在一起,形成四通道或更多通道的混合输入。这种简单的早期融合策略在许多RGB-D语义分割和目标检测任务中被证明非常有效,因为网络可以在第一层就学习到颜色和几何特征的联合表达。更精妙的设计包括使用两个独立的编码器分别处理RGB和深度图,再通过特征融合模块交换信息,这种双流架构允许网络在不同的层级捕捉外观与几何之间的关联。在深度补全任务中,输入是一幅极度稀疏的深度图(比如从激光雷达投影而来)和一幅对应的稠密彩色图像,输出则是一幅稠密的完整深度图。网络通常以编码器-解码器结构为基础,利用彩色图中的物体边界和纹理来引导深度值向稀疏空洞区域的外插,这是图像空间引导深度图空间恢复几何的典型范例。
另外一条重要路径是将深度图反投影为点云后,再使用三维点云网络进行处理。这种“先提升再处理”的策略放弃了深度图的规则结构优势,转而利用三维空间中的几何不变性。然而,许多最新的研究开始重新审视在深度图空间直接推理的价值,因为二维卷积的效率优势过于显著。比如在自动驾驶中,视觉BEV(鸟瞰图)感知方法通常在深度估计阶段输出像素级的深度分布,然后将图像特征沿深度维度“提升”到三维空间,这整个过程都在深度图空间及其扩展上进行运算。可以说,深度图空间的算法设计总是围绕着这样一个核心权衡:是利用规则的二维网格高效运算,还是提升到三维空间获得几何一致性?不同的任务和系统架构会选择不同的平衡点。
十一、存储与计算:轻量几何的代价
深度图的存储开销与其分辨率直接相关。一幅640×480的深度图,若以16位整数存储,未经压缩时占用约600 KB;若以32位浮点存储,则翻倍至约1.2 MB。考虑到同分辨率的彩色图(8 位三通道)未压缩约900 KB,深度图的存储成本与彩色图大致处于同一量级。这个量级对于现代存储和传输系统来说几乎可以忽略不计,与动辄几十MB的高分辨率图像或几百万个点的点云文件相比,深度图显得非常轻巧。在实时系统中,连续不断地以30 fps甚至60 fps产生深度图,所需的数据带宽也完全在USB 3.0、PCIe或车载以太网的传输能力之内,这是深度相机能够广泛应用于消费电子和机器人领域的重要工程基础。
深度图的压缩是另一个值得讨论的方面。由于深度图与自然图像在统计特性上有着显著差异,传统的图像压缩算法(如JPEG)并不适合直接用于深度图。JPEG的DCT变换和量化是基于人类视觉系统对高频颜色细节不敏感这一特性而设计的,但深度图中的高频成分——如物体边缘处的深度跳变——恰恰是最重要的几何信息,一旦被压缩损失,将直接导致反投影后的三维表面产生错误。因此,专门针对深度图的压缩方法被提出,比如利用深度图的平滑区域多、边界锐利的特性,采用基于分层或基于边缘保持的编码方式。在三维视频编码标准(如MPEG V-PCC)中,深度图与对应的彩色图和属性图被一起编码,利用它们之间的相关性进行联合压缩。不过,在许多嵌入式应用中,为了极低的延迟,深度图常以原始格式或轻量无损压缩格式进行传输和处理,用带宽换时间。
计算方面,在深度图上运行二维卷积的成本与同分辨率的图像处理完全相当。一个轻量级的深度补全网络在嵌入式GPU上可能仅需几毫秒,就能将稀疏深度图变成稠密深度图。相比之下,在点云上运行图神经网络或在体素网格上运行三维稀疏卷积,计算开销通常要高出数倍甚至一个数量级以上。这也是为何在一些算力受限的场景中,即使传感器本身是激光雷达(输出点云),工程师们仍然倾向于将点云投影成深度图,在图像域中完成部分处理(如深度补全、语义分割),然后再反投影回点云进行后续的三维推理。深度图空间规则的结构使其天然适用于现有的高性能图像处理硬件流水线,这种计算亲和性在实时系统中是一个不容忽视的竞争优势。
十二、融合:作为多传感器之间几何语义的桥梁
在多传感器融合体系中,深度图空间所扮演的桥梁角色是其他任何测量空间都难以替代的。它拥有二维图像的网格结构,承载的却是三维几何信息,这种双重属性使它能够以极低的转换成本与图像域和点云域同时对接。首先看图像域:由于深度图与彩色图在像素网格上天然对齐,二者的融合几乎不需要任何几何变换。最简单的融合就是将深度图作为彩色图的一个附加通道,输入到一个多通道的卷积神经网络中。稍微复杂一些的融合策略是使用深度图来调制彩色图的特征——例如,根据深度值对不同距离的物体赋予不同的注意力权重,使网络能够显式地利用距离信息来改善尺度不变性。更进一步的融合发生在三维域:将深度图反投影为点云,然后将这个点云与激光雷达点云在三维空间中进行融合。由于深度图反投影出来的点云是有序的(每个点都知道自己的像素来源),它可以提供比激光雷达点云更稠密的表面采样,特别是对于近距离的细小物体。
在自动驾驶的多传感器融合架构中,深度图空间常常作为视觉感知模块的内部表示而存在,而不是最终的输出。一个典型的流程是:相机图像先通过一个深度估计网络生成稠密深度图;然后利用内外参将深度图反投影为三维点云或直接映射到BEV网格中;接着这个由视觉生成的三维几何表示与激光雷达点云生成的BEV特征进行拼接或交叉注意力融合;最后在BEV空间中进行目标检测和运动预测。

在这个流程中,深度图空间是视觉信息从二维通往三维的必经中转站。它的质量直接决定了视觉三维感知的上限,而激光雷达的点云则可以作为“几何真值”来监督深度估计网络的训练,从而实现跨模态的互监督。在室内场景中,RGB-D SLAM系统如ORB-SLAM3、RTAB-Map等,也大量利用深度图与彩色图的融合来实现鲁棒的位姿估计和稠密建图,深度图为视觉特征点赋予了真实的尺度,解决了单目SLAM的尺度模糊问题,这正是深度图空间作为融合支点的价值体现。
十三、应用场景侧重:从桌面到开放的几何感知
深度图空间的应用谱系极为广泛,其不同密度和精度的变体覆盖了从工业精密测量到消费级体感交互的广阔领域。在工业检测与逆向工程中,高精度结构光或激光扫描仪产生的深度图可以达到微米级精度,被用来检测机械零件的尺寸公差、复原文物和化石的三维形态、或者为电影特效提供精细的三维模型。在这些场景中,深度图的规则网格和高分辨率是核心优势,因为每一个像素都代表一个可靠的表面测量点,大面积连续的无纹理表面也能被完美捕获——这是立体视觉和激光雷达都难以做到的。
在室内机器人与增强现实领域,RGB-D相机输出的VGA或HD分辨率深度图成为了标准配置。机器人利用深度图进行障碍物检测、可通行区域分割和物体抓取——机械臂需要知道目标物体的精确三维位置和表面取向,而这些信息直接从深度图中反投影即可获得,不需要复杂的多视角重建。增强现实设备则依赖深度图来实现虚拟物体与真实环境的遮挡关系和物理交互:虚拟的皮球需要落在地板上弹起,虚拟的角色需要被真实的桌子遮挡,这些效果的前提就是有一幅实时且准确的、从用户视角出发的深度图。SLAM系统更是深度图的重度用户,无论是稀疏的视觉SLAM还是稠密的RGB-D SLAM,深度图都为视觉特征提供了真实的尺度基准,让定位和建图不再局限于无尺度的任意单位。
在自动驾驶领域,深度图的作用相对间接但同等重要。纯视觉方案中,单目或双目深度估计网络输出的深度图是构建BEV特征的核心输入。即便在激光雷达主导的方案中,激光雷达点云也常被投影为稀疏深度图,用于与相机特征进行像素级融合。此外,深度图在停车辅助、近距离泊车障碍物检测等低速场景中也有独立应用——超声波雷达可以输出粗略的距离,但只有稠密深度图能精确描绘路缘石、立柱和矮墙的形状。深度图空间的广泛应用证明了它作为一种通用几何表示的巨大灵活性:无论精度、量程、密度如何变化,其规则的二维网格结构和直接的几何承载能力,使得它可以在几乎任何需要“知道前方物体有多远”的视觉任务中发挥作用。
十四、坐标系变换关系详解:从世界到像素再返回
深度图空间中的坐标变换关系值得用更加仔细的笔墨来梳理,因为这是理解深度图在多传感器系统中桥梁角色的数学基础。整个变换链涉及四个坐标系:世界坐标系W、相机坐标系C、图像平面坐标系I和深度图坐标系D。其中D与I共享相同的像素网格,因而通常被视为同一坐标系的不同属性层面。
从世界坐标系中的一点
出发,首先通过外参矩阵[R∣t]变换到相机坐标系:

接着,相机坐标系下的点通过内参矩阵K投影到图像平面:

这里恰好就是深度值(在光轴深度定义下)。因此我们可以将深度图的生成直接表述为:每一个有效像素
存储的是其对应相机坐标系点的
分量。这个看似简单的陈述隐含了一个重要事实:深度图本身并不存储
和
,但这两个分量可以通过像素坐标和内参精确地计算出来:

这就是反投影的本质。从深度图到世界坐标系的变换则是上述过程的逆:先将深度图像素反投影到相机坐标系,再应用外参的逆变换
回到世界坐标系。在多传感器融合中,一个常见的操作是将激光雷达点云投影到深度图坐标系,其步骤为:世界坐标系 → 激光雷达坐标系 → (外参变换)→ 相机坐标系 → (内参投影)→ 深度图像素坐标。在这个像素坐标处,我们可以比较激光雷达测得的深度与深度相机测得的深度,进行一致性校验或互补融合。另一个常见操作是将深度图反投影为点云,再变换到激光雷达坐标系或世界坐标系,与激光雷达点云在三维空间中对齐。所有这一切操作的数学基础,都建立在上述齐次坐标变换链之上。深入理解这条链,就等于掌握了深度图空间与所有其他测量空间之间进行几何对话的语法。
十五、优缺点对比:2.5维的代价与馈赠
将深度图空间置于图像空间和点云空间的参照系中进行系统性的优缺点比较,可以更加鲜明地揭示其独特地位。相较于图像空间,深度图最突出的优点是它拥有尺度与几何。图像中的一切都在二维平面上,没有距离概念,而深度图直接告诉观察者“那个像素对应的表面离传感器有多远”。这一信息对于三维检测、避障、抓取等任务是决定性的。深度图同时对光照变化更加鲁棒——主动式深度相机自带照明,被动式双目在黑暗中失效但可以用红外补光,而普通相机在极暗或极亮条件下会丢失纹理。深度图的缺点则在于其外观信息的贫乏:纯深度图是一幅灰度图,无法提供颜色、纹理、文字等丰富语义,必须依赖与彩色图的配准才能补全这方面的短板。此外,深度图的分辨率和精度受传感器物理限制,远不如现代彩色相机的数千万像素来得高。
相较于三维点云空间,深度图最显著的优势在于其规则的网格结构和二维领域拓扑带来的计算高效性。在深度图上跑一个卷积网络和在彩色图上一样容易,而在点云上则需要特殊设计的算子。深度图还有一个不那么显眼却非常重要的优势:有序性。深度图反投影出的点云是结构化的,每个点都可以回溯到它在图像中的像素邻居,这种有序性为点云分割、边缘提取和异常值剔除提供了额外线索,是普通激光雷达点云不具备的奢侈信息。深度图的缺点也同样明显:它是单视角的,遮挡盲区与图像一样大,无法像多视角融合后的点云那样呈现完整的三维形状。深度图的量程和精度通常逊于激光雷达,尤其是在室外远距离场景下,普通深度相机的有效距离仅有数米到十几米,而激光雷达可以轻松达到两百米以上。此外,深度图对外部干扰(如阳光中的红外成分、多路径反射)的抵抗能力不如高端激光雷达。
|
对比维度 |
深度图空间 |
图像空间 |
三维点云空间 |
|
优点 |
是视觉信息从二维通往三维的必经中转站,质量直接决定视觉三维感知的上限;可通过激光雷达点云监督训练,实现跨模态互监督;可将三维几何先验知识和纹理信息融入,生成增强点云。 |
数据获取简单,处理速度快;包含丰富的纹理和颜色信息,适合图像识别和分类任务。 |
直接表示三维空间中的物体位置和形状,具有直观的三维信息;不受光照条件影响,对环境感知能力强。 |
|
缺点 |
深度估计存在误差,影响后续三维感知的准确性;生成深度图的计算量较大。 |
缺乏直接的三维信息,难以准确判断物体的深度和距离;对光照、遮挡等因素敏感。 |
数据稀疏,处理难度大;数据量较大,处理和存储成本高。 |
简而言之,深度图空间是一把两面刃:它以放弃三维完整性和远距离性能为代价,换取了二维规则的运算效率和与图像天然对齐的融合便利。这种折衷使它在特定距离范围、特定视角、特定算力约束下成为最优的几何表示选择,而在需要全方位三维感知或超远距离的场合,它必须与点云空间协作互补。
十六、进一步拓展:从深度图到更广阔的几何表示空间
深度图空间并非孤立的,它作为二维与三维之间的过渡地带,与一系列更高级的几何表示有着深刻的数学联系。体素占用网格(Occupancy Grid)可以看作是多幅深度图在三维空间中的融合产物:每一帧深度图被反投影到三维空间后,沿着射线更新体素网格的占据概率,那些被深度图表面的点穿过并终结的体素被标记为占据,射线经过的自由空间体素被标记为空,未被任何射线穿过的体素保持未知。这一过程在机器人学中被称为占用栅格建图,其核心思想就是将深度图的单帧表面测量转化为三维空间的体积理解。截断符号距离函数(TSDF)则是另一种融合方式:每个体素不存储二元占据,而是存储该体素中心到最近表面点的符号距离,多帧深度图通过加权平均逐步更新 TSDF 值,从而获得高精度的连续表面模型。这两种表示都以深度图为原始输入,将其单视角的几何碎片缝合为全局一致的三维场景。
神经辐射场(NeRF)和新兴的3D高斯泼溅(3D Gaussian Splatting)为代表的连续神经表示,与深度图空间之间也存在有趣的关系。NeRF通过最小化渲染图像与真实图像之间的光度误差来优化一个连续场景函数,而深度图可以作为一种额外的监督信号加入到训练中——如果有深度图真值,可以同时约束每条射线上的终止深度分布,从而改善几何重建的质量,减少“浮空”伪影。在少视角重建或稀疏输入场景中,深度图的几何约束往往是决定成败的关键。反过来,训练好的NeRF可以渲染出任意视角的深度图,这些合成的深度图又可以作为下游任务(如机器人抓取、SLAM回环检测)的输入。于是,深度图空间在离散几何表示(像素网格)与连续几何表示(神经场)之间建立起了一个可互操作的接口——它既能为神经场提供几何监督,又能从神经场中渲染生成,成为两种范式的转换通道。
随着多传感器融合向更强的异构性和更深的端到端学习发展,深度图空间可能会以更加多样化的面貌出现。也许未来的自动驾驶系统不再显式输出稠密深度图,而是直接在特征空间中完成从透视图到BEV空间的映射,但这一映射的内在数学仍然是对深度信息的学习与编码。也许事件相机会催生出异步深度图的概念,每个像素的深度更新不再与固定帧率绑定,而是由场景动态触发。无论形式如何演变,深度图所承载的核心思想——在规则的二维网格上捕获可见表面的几何距离——将始终是多传感器融合体系中不可动摇的一根支柱。它那处于二与三维之间的微妙位置,注定了它既不会取代图像,也不会消融于点云,而是作为两者之间最自然、最高效的“信息栈”,长久地驻留在感知系统的底层架构之中。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)