作者介绍

胡庭恺,西南大学电子信息工程学院,计算机科学与技术专业在读博士研究生,主要研究方向为无监督毫米波雷达SAR成像,长期致力于毫米波雷达与深度学习的交叉融合研究,尤其关注技术成果的工程转化能力与商业化落地潜力。亦在探索AI Agent技术在电子信息工程领域的赋能场景与应用实践。

编者按:当机器人在真实场景中遇到“视觉失效或信息不足”的情况,有没有“其他方案”做为视觉感知的补充,让机器人更真实的理解周围环境?

本文的研究给出了机器人在视觉受遮挡时,使用毫米波雷达感知三维空间信息的一种方案,为机器人多模态感知提供了一种新的可能。补充视觉感知缺失的能力,甚至看清被遮挡物体的三维形状。
我们相信毫米波雷达是具身智能等物理AI的多模态融合感知中不可或缺的感知手段,学术界的前沿探索正在证明这个判断。

如何解决视觉遮挡感知难题

毫米波雷达有一个很诱人的能力:它能穿过纸板、布料等常见遮挡物,接收到隐藏物体的反射信号。

仓储机器人、AR 设备和智能空间系统都可能用到这种能力,这个能力“视觉”却不具备!

而毫米波雷达要具备这个能力,主要在于穿透除了解决“能不能收到信号”,还能不能解决“看清 3D 形状”。

传统路线通常先做合成孔径雷达成像,再把高反射体素筛出来当作点云。

这个做法对大目标还算可用,因为建筑、车辆这类物体的尺寸远大于雷达深度分辨率。

可一旦变成勺子、杯子、剪刀或电钻这类小目标,几厘米级深度误差就会吞掉关键几何细节。

mmNorm系统与勺子重建效果

图中 77GHz 雷达安装在 UR5e 机械臂末端,目标物体藏在纸箱里,RGB-D 相机只用于采集真值。

第一个硬约束是雷达带宽

研究中指出,商用毫米波雷达的可用带宽通常只有约 4GHz 带宽,对应的深度分辨率约 4cm。

对机器人抓取而言,4cm 不是小误差。

勺柄、杯把、刀刃边缘本身就只有厘米级宽度,点云一旦被拉厚,抓取规划看到的就不是表面,而是一团空间占据。

第二个硬约束来自反射机制

毫米波照到很多日常物体时,反射更接近镜面反射:只有表面法向量朝向雷达孔径的那部分区域,才更容易把信号反射回接收端。

换句话说,雷达并不是均匀看到整个物体,它只在不同扫描位置接收到不同表面片段的回应。

第三个约束是通用性

学习式方法可以针对人体、车辆或房间这类固定目标补出高分辨率形状,但隐藏的日常物体种类太多,训练集很难覆盖所有组合。

mmNorm 方法选择从物理关系入手,而不是要求模型记住每一种物体长什么样。

  • 🚗 Backprojection 点云阈值法

    能定位高反射区域,但深度方向被带宽限制拉厚,物体轮廓容易变成宽体素云。

  • 🔍 Interferometric 方法

    利用相位变化估计深度,但常需要参考高度,面对复杂日常物体时结果稀疏且稳定性不足。

  • 🧠 学习式重建方法

    能在特定类别上获得漂亮结果,但依赖训练数据和类别先验,换到未知小物体时泛化压力很大。

这个研究中要解开的核心矛盾是硬件带宽不能无限加,目标类别不能提前限定,系统又必须恢复足够细的 3D 表面。

毫米波雷达如何破局

mmNorm 的关键判断很直接:如果带宽不足以直接给出清晰表面,那就不要先追问“哪里是表面”,而是先追问“表面朝向哪里”。

对镜面反射占主导的毫米波场景,强回波并不只是能量提示,它还携带了几何方向信息。

镜面反射与表面法向量

只有法向量指向雷达孔径的表面区域,才更容易把信号反射回雷达。

对空间中的一个候选体素,系统会从这个体素指向每个雷达采集位置,构造一组候选法向量。

若某个采集位置对该体素的回波贡献更强,说明这个位置更可能接近真实法向量方向。

候选法向量投票过程

mmNorm 先构造候选法向量,再用不同雷达位置的贡献强弱加权,最后求出该体素的法向量估计。

投票权重不能简单由幅度决定,因为一个体素的最终值来自多个雷达位置的复数信号叠加。

mmNorm 设计了相干滤波:把每个位置的复数回波投影到总回波方向上,投影越一致,说明该位置对最终成像值的贡献越有效。

这个处理把“谁真正推动了总回波”从混合信号里分离出来,错误方向的候选向量也更容易在求和时抵消。

法向量场解决的是方向问题,还没有解决位置问题。

同一组法向量可以对应多张不同高度的表面。

mmNorm 借用符号距离函数的思想,构建相对符号距离函数 RSDF,把所有候选表面放进同一个隐式函数中。

随后,系统对不同等值面做回波前向仿真,谁生成的回波更接近真实采集信号,谁就被选为最终表面。

这套方法的价值在于它没有把低分辨率毫米波图像硬解释成高分辨率点云,而是先提取更稳定的局部几何方向,再用物理一致性把表面位置找回来。

雷达算法的核心步骤

回波拆成方向投票

输入是雷达在二维合成孔径上采集到的 FMCW 回波。

mmNorm 对每个体素构造指向各个雷达位置的候选法向量,并用相干滤波计算各位置的贡献权重。

输出是一片 3D 法向量场,表示空间中不同候选表面的朝向。

方向场变成候选表面族

法向量场不能直接唯一决定表面,所以系统把它积分成 RSDF

毫米波图像中的高反射连通区域还会被拆成多个组件,杯身和杯把这类不同曲面可以分别生成候选等值面。

这一步把“方向信息”转成了“可搜索的表面集合”。

候选表面接受回波检验

最后,mmNorm 对候选等值面做射线追踪和自由空间路径损耗仿真,得到每个表面应该产生的接收信号。

真实回波与仿真回波的差异构成优化目标,最小差异对应的等值面,就是系统输出的 3D 重建结果。

算法链路的取舍很清楚:它用扫描和计算换取几何精度。

当前实现依赖机械臂形成合成孔径,并在 CPU/GPU 平台上处理数据,离实时嵌入式模块仍有距离。

性能全面领先

研究中报告了 116 次真实实验,覆盖 61 个 MITO 日常物体,包括杯子、薯片罐、电钻、叉子、刀和勺子等。

材料覆盖金属、塑料、纸板、橡胶、泡沫和玻璃。非视距实验中,目标被一层纸板完全遮挡。

定性重建结果

图中三个 NLOS 物体和多物体场景的重建结果。

mmNorm 的表面形状比两类基线方法更接近真值。

  • 精度对比: mmNorm 的中位 3D F-score 达到 96%,Backprojection 为 72%,Interferometric 基线为 78%。

    3D F-score 同时考察预测点云的准确性和对真值形状的覆盖程度。96% 意味着重建结果已经不是“能看到一团物体”,而是能较好保留物体表面结构。

  • 难样本表现: 25 分位 3D F-score 上,mmNorm 为 84%,Backprojection 为 60%,Interferometric 为 49%。

    25 分位更接近困难样本的表现。这个差距说明,法向量路线对复杂曲面和多材料物体有更高稳定性。

  • 点级误差: 相对点误差小于物体尺寸 5% 的点,mmNorm 占 85%,两个基线方法都只有 44%。

    对十几厘米大小的工具或餐具来说,5% 对应毫米到厘米级偏差。这个量级已经开始接近机器人抓取和近距离识别需要的几何输入。

性能CDF曲线

mmNorm 在形状误差、位置误差和相对点误差上都优于两类基线方法。

速度对比: 研究中没有报告端到端毫秒级延迟,也没有给出单帧实时处理速度。现有实现使用 Python/C++/CUDA,运行在 Intel Xeon CPU NVIDIA GTX 1080 GPU 上;硬件采集依赖 UR5e 机械臂以约 0.1 m/s 扫描 60cm × 45cm 孔径。

工程可行性翻译: mmNorm 当前更接近高精度扫描式毫米波 3D 重建原型,而不是可直接部署在车载雷达或移动终端里的实时算法。

它证明了一个关键方向:在 77.5GHz 到 80.5GHz 商用雷达带宽下,仍可以通过物理建模突破传统点云阈值法的 4cm 深度涂抹。真正产品化还需要更快的阵列扫描、更紧凑的标定链路和面向实时性的计算优化。

从仿真到实测

这个研究中的硬件闭环比较完整,雷达采集 512 个样本,频率范围为 77.5GHz 到 80.5GHz;

机械臂带着雷达移动,形成 60cm × 45cm 的二维合成孔径,目标物体大约放在孔径下方 40cm。

测试环境不是理想消声室。实验在办公室完成,环境中有桌椅、多径反射、人员走动以及 WiFi、蓝牙干扰。

非视距场景中,物体被纸板完全遮挡。RGB-D 相机只用于移除遮挡后的真值采集,不参与毫米波重建。

NLOS影响实验

LOSNLOS 下的点误差对比。纸板遮挡对 mmNorm 的中位误差影响很小。

  • 视距条件下,中位点误差为 0.39cm,90 分位误差为 1.1cm;
  • 纸板遮挡的非视距条件下,中位点误差为 0.43cm,90 分位误差为 1.2cm。
  • 纸板遮挡只让中位误差增加 0.04cm,说明普通遮挡没有破坏该方法依赖的回波几何关系。

以上数值很有说服力!

同时边界也很明确。金属或很厚的遮挡会让系统失效,空心物体可能同时产生上下表面反射,受限孔径会漏掉法向量朝孔径外的表面。

写到最后

mmNorm 给毫米波雷达感知提供了一个新的研究方向:当带宽不足以直接换来高分辨率成像时,可以从反射方向、局部法向量和前向物理一致性中提取几何信息。

机器人抓取是最直接的应用场景,物流箱、抽屉、杂物堆或暗光环境里的目标,视觉传感器很容易失效。若毫米波能提供隐藏物体的可用表面结构,机器人就能把“非视距存在检测”推进到“非视距几何操作”。

AR 和智能空间也可能受益。头显或移动设备如果能积累多视角毫米波观测,就有机会为遮挡物体生成粗到中等精度的 3D 模型。

它不会替代相机,但可以补上相机被遮挡时缺失的空间信息。下一步工程挑战集中在三件事:缩短扫描时间、降低计算延迟、扩大可恢复表面覆盖角。

没有这三项改进,mmNorm 更适合离线扫描或半自动检测;补齐之后,才有机会进入机器人和空间计算产品链路。

视觉AI用了十年,让机器"看懂"了平面世界;我们相信 AI 毫米波雷达会让机器"看懂"立体的物理世界 – 全天候、可测速、懂语义。

SuperRadar 社区愿意与更多开发者一起,共建 AI 雷达生态,推动 AI 雷达应用,创新 AI 雷达市场,为智能时代的到来贡献力量,致力于服务 AI 雷达的同行者,共建繁荣生态。

原论文信息

论文标题: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation

发表日期: 2025年06月

发表单位: 麻省理工学院 (Massachusetts Institute of Technology)、Cartesian Systems

期 刊: The 23rd Annual International Conference on Mobile Systems, Applications and Services (MobiSys '25)

会议论文集原文链接: https://dl.acm.org/doi/10.1145/3711875.3729138

开源代码: https://github.com/signalkinetics/mmNorm

通讯作者: Fadel Adib

文章仅代表个人理解及观点,不构成任何论文审核或项目落地推荐意见,具体以相关组织评审结果为准。

欢迎就文章内容交流探讨,理性发言哦~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐