3D 视觉论文精读
一、趋势
① 简单介绍
CVPR2026 的 3D 视觉方向共收录并解读 156 篇论文,覆盖从底层几何表示、重建渲染,到生成式 3D、场景理解、SLAM 与机器人具身的完整技术栈。它不是独立小方向,而是连接「感知—重建—生成—理解—行动」的中枢,也是大模型化、实时化浪潮中最先被「重做一遍」的视觉子领域。
② 方法范式趋势:三化合一
本届最显著的特征是方法底座的高度收敛与叠加:3D 高斯泼溅(3DGS)作为可微辐射场,已成为横跨 15/18 类、71 次出场的统一几何引擎;与此同时,Transformer / 自回归大模型(Decoder-only 系列合计横跨 14 类)把「3D 当作序列/语言」推向主流;而以 VGGT/π³ 为代表的前馈式重建则用一次推理替代逐场景优化。三股力量叠加,而非互相替代。
③ 问题 frontier:从标准场景走向难场景
当室内/物体等标准场景被基本攻克,研究算力正集体转向过去「做不好」的真实边缘:事件/脉冲相机、第一人称与全年龄段人体、铰接物体、反光/透明/弱纹理材质(22TB 级数据集)、形变与零样本/类别无关。生成式方向则首次系统引入 RL / 偏好对齐(如 Hi-GRPO)来对齐人类审美与物理合理性。
二、方法
下表按「论文覆盖度」统计各方法家族——即 156 篇中至少使用一次该家族技术的论文数量与占比(一篇可同时归属多个家族):
|
方法家族 |
涉及论文 |
占比 |
简单介绍 |
|
3D 高斯泼溅 / 辐射场 |
75 |
48.1% |
用可微高斯/辐射场作为统一几何与外观表示,覆盖重建、渲染、SLAM、动态与生成。 |
|
Transformer / 自回归大模型 |
29 |
18.6% |
把 3D 当序列/语言:前馈重建、3D token、自回归生成与 3D-LLM 全面上位。 |
|
扩散生成 |
8 |
5.1% |
文/图/动作生 3D/4D,强调可控、拓扑一致,并引入 RL/偏好对齐优化审美。 |
|
前馈几何重建 |
11 |
7.1% |
单次前向推理直接输出深度、点云、相机与轨迹,取代逐场景优化。 |
|
经典几何 / 优化 |
21 |
13.5% |
代价体、运动恢复结构与刚体群仍是鲁棒性的基石,与可微渲染深度融合。 |
|
异质传感 / 高效架构 |
11 |
7.1% |
脉冲/事件相机、线性复杂度架构把 3D 推向高速、暗光、边缘等极限工况。 |
读表要点:3DGS (48.1%)成为绝对底座;Transformer/自回归大模型紧随其后,标志 3D 进入「大模型化」;经典几何(代价体/SfM/SE(3))仍被 21 篇复用,说明可微渲染并未取代几何,而是与之融合;扩散生成与前馈几何是两条上升的新主线。
三、主题(分类、应用场景与每类一篇论文精读)
论文可归为 18 个细类,并可进一步聚为 6 大宏观主题群。每个细类给出简述 / 意义 / 代表。
A 组 · 表征与重建底座
1. 3D 高斯泼溅:重建、渲染与表征
简述:围绕 3D Gaussian Splatting(3DGS)的渲染质量、分辨率、存储与表面重建做工程与算法改进。
意义:3DGS 已成为实时辐射场重建的事实标准,本类聚焦如何让它更省显存、任意分辨率无锯齿、支持表面提取与跨实例配准,是大量下游任务的底层引擎。
代表:3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors
2. 3D 高斯泼溅:SLAM 与定位
简述:把 3DGS 作为地图表示接入 SLAM / 视觉定位,处理曝光变化、位姿不准与实时性。
意义:将可微辐射场与定位紧耦合,是替代传统特征点地图的新一代稠密 SLAM 路线,直接影响机器人导航与 AR。
代表:AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM
3. 网格与表面重建
简述:从图像/点云恢复显式网格、CAD(B-rep)、UDF 表面与连续切片。
意义:显式表面是制造、仿真与编辑的刚需,关注拓扑自适应、薄结构与可微表示。
代表:BRepGaussian: CAD Reconstruction from Multi-View Images with Gaussian Splatting
4. 新视角合成与视角编辑
简述:给定少量视图生成任意新视角,或做可控的视角/立体/风格编辑。
意义:新视角合成是 3D 内容生产与影视/VR 的基础能力,强调外推、可控性与跨视角一致性。
代表:Beyond Geometry: Artistic Disparity Synthesis for Immersive 2D-to-3D
B 组 · 动态与 4D 世界
1. 动态 / 4D 场景重建
简述:从单目/多目/无人机视频重建带时间的 3D 场景,处理运动分解、遮挡补全与物理一致性。
意义:4D 重建是数字孪生、具身智能与视频生成的交汇点,关注如何得到几何完整、时间连贯、可编辑的动态世界模型。
代表:4D Primitive-Mâché: Glueing Primitives for Persistent 4D Scene Reconstruction
2. 立体匹配、事件与脉冲视觉
简述:事件相机 / 脉冲相机的立体匹配、深度与场景重建,以及非对称双目装置。
意义:事件/脉冲相机提供微秒级、高动态范围感知,是高速、暗光与无帧率场景的刚需,技术栈与传统 RGB 差异大。
代表:ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation
3. 深度估计(单目 / 立体 / 全景 / 事件)
简述:从单张图、立体对、全景或事件流恢复度量或相对深度。
意义:深度是几乎所有 3D 任务的底层几何信号,本类覆盖从极稀疏 dToF 补全到全景基础模型的多模态方案。
代表:AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth Estimation
C 组 · 前馈几何与感知
1. 多视图几何与前馈重建
简述:用前馈网络(如 VGGT/π³ 系)一次推理直接输出深度、点云、相机与轨迹。
意义:前馈式重建把传统逐场景优化变成通用模型推理,是实时 SLAM、视频 3D 理解与具身感知的新范式。
代表:AMB3R: Accurate Feed-forward Metric-scale 3D Reconstruction with Backend
2. 点云处理(配准 / 分析 / 压缩)
简述:点云的配准、域自适应、分类分割与几何压缩。
意义:点云是激光雷达与扫描仪的直接输出,是自动驾驶、机器人抓取与三维理解的核心数据格式。
代表:AnyPcc: Compressing Any Point Cloud with a Single Universal Model
3. 6D 物体位姿估计
简述:估计物体在三維空间中的 6 自由度位姿(旋转+平移),含类别级、零样本与形变情形。
意义:6D 位姿是机器人抓取与 AR 放置的前提,趋势是从 CAD 依赖走向零样本、开放类别与抗形变。
代表:AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment
4. SLAM 与视觉定位(非 3DGS)
简述:特征/坐标回归式的视觉定位、SLAM 与视角选择。
意义:定位是移动智能体的空间锚,关注大规模、动态、暗光与边缘设备的鲁棒性。
代表:AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual Localization
D 组 · 生成式 3D / 4D
1. 3D 生成(文 / 图生 3D)
简述:从文本、图像或视频生成 3D 资产、动画与场景,含偏好对齐与编辑。
意义:生成式 3D 是内容工业化的核心,关注如何得到拓扑一致、可编辑、且符合人类审美偏好的资产。
代表:Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
2. 铰接物体重建与生成
简述:椅子、剪刀等含关节的可动物体的重建、位姿与生成。
意义:铰接物体是室内场景的主体,其部件级运动建模对仿真、机器人与生成式 3D 资产至关重要。
代表:ART: Articulated Reconstruction Transformer
E 组 · 场景理解与人体
1. 3D 场景理解
简述:3D 语义/实例分割、可供性、变化检测、稠密描述与开放词汇理解。
意义:让机器“读懂”三维场景的语义与功能,是导航、交互与决策的上层智能。
代表:AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers
2. 人体与头像重建
简述:单目/多视角下的人体网格、手势、人群与可驱动 3D 头像(含第一人称)。
意义:数字人、虚拟穿戴与具身交互的基础,强调全年龄段、遮挡鲁棒与实时可驱动性。
代表:AvatarPointillist: AutoRegressive 4D Gaussian Avatarization
F 组 · 具身、数据与方法论
1. 机器人 / 具身智能
简述:把 3D 感知用于抓取、双臂操作、装配与导航的策略与系统。
意义:3D 视觉落地的终极场景,强调把几何先验、可供性与多视角一致性转化为可执行动作。
代表:GAP: Action-Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation
2. 数据集 / 基准 / 综述
简述:新数据集、评测基准与领域综述。
意义:数据是 3D 研究的瓶颈,本类揭示材质/形变/第一人称等长期被忽略的空白与评测陷阱。
代表:3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, Low-Texture Objects
3. 自监督 / 预训练 / 表征学习
简述:无需 3D 真值的前馈 3D 表征学习与蒸馏。
意义:用 2D 视频与多教师蒸馏“白嫖” 3D 感知,是降低对稀缺 3D 标注依赖的关键路线。
代表:3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)