导读:

在汉斯出版社《人工智能与机器人研究》期刊上,有文章提出一种面向对象的三维场景语义理解框架,旨在从无标签数据中学习以对象为中心的连续场景表达。

作者信息:

高 丽:沈阳城市学院生命与健康管理学院,辽宁 沈阳;王一可, 尹竞瑶:沈阳城市学院智能与工程学院,辽宁 沈阳

论文详情

方法

本文方法的整体框架如图 1 所示,包含三个核心模块:场景感知模块、场景理解模块与模型优化模块。

图片

本文将场景表达为高斯混合模型的层次化扩展。

初始分组:空间邻近性聚类。

精细分组:二维语义线索引导。

对象组分的形成与优化。

本文设计了三类自监督信号,充分利用无标签数据中蕴含的物理约束: 

几何一致性约束

光度一致性约束

物理合理性约束

上述三类约束组合为统一的自监督损失函数:

图片

本方法引入多模态先验知识作为对抗学习的判别依据。

实验与分析

实验在三个室内场景数据集上进行评估:

1) ScanNet:包含 1513 个真实室内场景的 RGB-D 扫描数据,提供三维重建与语义标注基准;

2) Replica:高保真合成室内场景数据集,具有完美的几何与外观真值;

3) InteriorGS:最新发布的基于 3DGS 的语义场景数据集,包含 80 余种室内环境类型。

如表 1 所示,本文方法在三个数据集上的渲染质量均优于基线 3DGS 方法。

图片

表 2 展示了各模块对最终性能的贡献。

图片

图片

结论

实验结果表明,本文方法在无需人工标注的条件下,在三维重建质量和语义理解能力两个维度均取得了有竞争力的性能,验证了面向对象表达与无标签学习相结合的有效性。该方法为降低三维场景理解对标注数据的依赖、提升模型的泛化能力与可解释性提供了可行的技术路径。 

未来工作将聚焦于三个方向:

1) 将方法扩展至动态场景,引入时序建模能力;

2) 探索更轻量化的模型设计,降低训练开销;

3) 将学习到的面向对象表达应用于机器人交互与场景编辑等下游任务,验证其实际应用价值。

基金项目:

辽宁省教育厅 2025 年度高校基本科研项目,项目编号:LJ212513220003

原文链接:

https://doi.org/10.12677/airr.2026.154099

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐