3DGS 速报 · 第 4 期(2026.08.10 – 08.16)
追踪 3D Gaussian Splatting 前沿,每周一更。点击「关注」并设为星标 ⭐,第一时间拿到最新论文、工具与落地动态。
本期关键词:分层语义理解 · 具身操作 · 野火数字孪生 · 概率计算硬件
📌 本期头条:LEGO(ECCV 2026)把"花盆 → 花束 → 花蕾 → 花瓣"这样的语义谱系搬进 3D 高斯。
一、本周速览
| 名称 | 一句话 | 来源 / 时间 |
|---|---|---|
| 【论文】LEGO | 分层语言高斯:多粒度语义谱系 + 语言场景图,LLM 空间推理(ECCV 2026) | arXiv:2608.10057,8/10 |
| 【论文】LocusGS | 前馈 3DGS 的 query token 加 3D 锚态,抑制"高斯散落" | arXiv:2608.12825,8/13 |
| 【论文】GS-CPE | 3DGS 统一 6DoF 相机位姿估计,粗到细 warp 精化(IROS 2026) | arXiv:2608.10938,8/11 |
| 【论文】ProbSplat | 概率计算硬件跑高斯混合,18pJ/次推断(ISVLSI 2026) | arXiv:2608.13143,8/13 |
| 【落地】Embodied Grounding | 语义 3DGS 做具身操作共享接口,长时程成功率 60%(ACM MM 2026) | arXiv:2608.10756,8/11 |
| 【落地】WildFireGS | 野火物理仿真直接跑在语义高斯森林上,无需转网格 | arXiv:2608.11100,8/11 |
| 【落地】HandSplatter | 神经渲染自动量关节角度,替代手工量角器(EMBC 2026) | arXiv:2608.09735,8/10 |
同期 arXiv 上还有 CasDeblurGS(两张模糊图去模糊重建,2608.10345)、CausalSplat(3DGS 层次化因果推理,ACM MM 2026,2608.11150)、Seed2GS(免相机免训练物体提取,2608.11928)、GS²CI(快照压缩成像 + 大视觉模型先验,2608.13502)、锥束 CT 金属伪影抑制(2608.13159)等十余篇工作,限于篇幅不逐篇展开。
本文提及的 12 篇本周 arXiv 论文提交日期均已逐一核验,全部落在 8/10–8/16 窗口内。下文精选代表性工作转述点评。
二、硬核论文
1. LEGO:让 3D 场景理解拥有"语义谱系"
开放词表场景理解大多停留在"认出物体"这一层,但真实场景的语义是分层的——“花盆 → 花束 → 花蕾 → 花瓣”,从整体到局部逐级细化。
SAM 这类基础模型虽能在 2D 里切出多粒度结构,但划分严格受视角束缚,缺乏跨视角共识。LEGO 的做法:把多视角下"漂移"的 SAM 粒度自适应重整(re-grade),得到一个统一、3D 一致的层级结构,为多级 3D 分割提供结构连贯的监督。
在此之上,用 CLIP 嵌入给各层分段接地开放词表语义,再加入空间关系,把分段升维成分层语言场景图——让大语言模型能在 3D 场景里做上下文感知的空间推理与精准视觉定位。
据论文实验,LEGO 在可提示(promptable)与开放词表 3D 分割基准上均建立新的 SOTA。
来源:arXiv:2608.10057,Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang,Submitted 10 Aug 2026,cs.CV,comments 注明 Accepted to ECCV 2026。(作者机构未在 arXiv 页面标注,故不臆测。)
速报点评:这篇的洞察是"语义不是平面而是谱系"。2D 分割模型的粒度天然视角相关,直接投影到 3D 会打架;LEGO 用"重整粒度"代替"硬投票",让层级结构本身成为 3D 一致的监督信号。语言场景图 + LLM 的组合,也把 3DGS 从"可渲染"进一步推向"可推理"。
2. LocusGS:给前馈 3DGS 的 query token 装上"3D 锚"
查询式(query-based)前馈 3DGS 用一组可学习查询表示场景,每个查询聚合多视角证据后解码一组高斯。理想情况下不同查询应各自"承包"一块连贯的局部区域。
但现有方法有个毛病:解码自同一查询的高斯,常常散落在相距遥远的场景区域——查询级空间一致性差,与场景结构对不齐。作者把根因归为查询的纯隐式表示。
LocusGS 给每个高斯查询增加一个由中心和支撑半径组成的 3D 锚态(anchor state),在解码器逐层精化,并贯穿查询交互、多视角特征聚合与高斯生成全程:锚到射线的几何偏置把查询引向空间相关的图像观测,锚中心解码则把该查询的高斯组织在局部区域内。
实验显示,同等高斯预算下渲染质量优于查询式 token 基线,学到的锚形成连贯空间布局、高斯分布更有结构。
来源:arXiv:2608.12825,Wenyu Li, Sidun Liu, Tongrui Hu, Peng Qiao, Yong Dou,Submitted 13 Aug 2026,cs.CV。
速报点评:"隐式 query 语义漂移"是前馈 3DGS 一个挺本质的问题——token 没有空间身份,高斯自然乱飞。给 token 显式挂一个可精化的 3D 锚,思路朴素但直击要害:为前馈范式补上空间组织性。这条"token 空间化"的脉络值得持续跟踪。
3. GS-CPE:用 3DGS 统一 6DoF 相机位姿估计(IROS 2026)
视觉定位从场景坐标回归到直接位姿回归一路演进,但"泛化好"与"精度高"总是难以两全。
GS-CPE 提出粗到细框架:先在 3DGS 场景表示上做检索引导的几何位姿估计得到粗位姿;再最小化可见性感知的掩码 RGB warp 目标,在多尺度优化框架中配合自适应重渲染做精化。
在 7Scenes、Cambridge Landmarks、FAST-LIVO2 数据集及自建数据集上,据论文实验,精度与泛化均稳定优于对比方法。
来源:arXiv:2608.10938,Huaiyuan Weng, Chul Min Yeum, Su-Min Kang,Submitted 11 Aug 2026,cs.CV,comments 注明 accepted at IROS 2026。
速报点评:位姿估计是 3DGS 的"老本行"(位姿与高斯本就联合优化),但把它做成独立交付的通用 6DoF 定位系统、并跨室内外与 LiDAR-视觉数据集验证,工程完成度是亮点。
4. ProbSplat:把高斯泼溅装进"概率计算硬件"(ISVLSI 2026)
3DGS 的加速讨论几乎都停留在算法与 GPU 软件栈,这篇直接下沉到电路层。
ProbSplat 提出受存内计算(CIM)启发的架构:用可编程、高能效的浮栅反相器列做概率计算,把高斯混合分量的均值与方差都编程存储在硬件里,重建时直接对数似然求值。通过确定性地调节浮栅 MOSFET 阈值电压,均值与方差可独立控制,硬件编程概率分布的保真度更高。
关键数据(180nm CMOS、1.8V、50MHz 仿真):3D 高斯混合建模的均值-方差独立性偏差 <2.4%;4 位精度下每次对数似然推断仅耗能 18pJ(500 个混合分量);据论文,8 位精度下场景重建达 21.99 dB PSNR。
来源:arXiv:2608.13143,Siddarth Gottumukkala, M P Samartha, Vedant Pahariya, Priyanshi Jain, Amit Ranjan Trivedi, Priyesh Shukla,Submitted 13 Aug 2026,cs.ET,comments 注明 Accepted at ISVLSI 2026。
速报点评:这是"3DGS 专用硬件"路线的一个存在性证明——不是买更好的 GPU,而是让电路原生会说"高斯"这门语言。18pJ/次的能效对机器人、AR/VR 眼镜等边缘设备诱惑力不小。不过要提醒:据论文,目前为 180nm 工艺的仿真结果,尚无流片公开数据。
三、应用落地
1. Embodied Grounding:语义 3DGS 成为机器人的"共享操作接口"(ACM MM 2026)
具身移动操作要求语言、视觉观测、3D 结构与动作可行性在执行前对齐。这篇工作(全名 Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting,下文简称 Embodied Grounding)研究少样本下的开放词表目标接地。
它的核心设计:把任务驱动的局部语义 3DGS 作为贯穿全流程的共享接口——主动多视角感知、语言条件 3D 定位、避障场景推理、底盘位姿准备、动作模型的语义条件化,全都挂在同一张可刷新的语义高斯地图上。为保住预训练动作先验,3D 语义线索只注入动作专家的后期模块。
真机数据(50 次试验,据论文):完整系统长时程成功率 60%(PointVLA 40%、DexVLA 28%);重度杂乱下 74%(单视角变体 52%、PointVLA 46%);75cm 高度变化下仍维持 75%,并消除了"照片诱导的误抓取"。
来源:arXiv:2608.10756,Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji,Submitted 11 Aug 2026,cs.RO / cs.CV,comments 注明 Accepted to ACM Multimedia 2026。
速报点评:数据点很有说服力——重度杂乱场景下,完整系统成功率 74%,明显高于其单视角变体的 52%(据论文)。"照片诱导误抓取"这个失效模式的消除,也与显式 3D 语义表示的持久性相一致。这为"3DGS 作为具身智能世界模型底座"提供了一个量化证据点。
2. WildFireGS:野火仿真直接跑在重建的高斯森林上
气候驱动下野火频率与强度双双上升,仿真与预测成为刚需,但现有物理野火模型多依赖合成环境与理想化森林结构知识,难以用于真实航拍数据。
WildFireGS 在大规模、语义增强的 3DGS 森林重建上直接运行物理仿真:给高斯原语附加编码植被类型与燃料特性的语义与材质属性,提出原生作用于高斯表示的粒子燃烧模型,模拟点火、传热、燃烧与火焰蔓延——无需转换为显式网格或体素网格。
据论文,合成场景与真实航拍森林上均展现物理一致的野火行为(蔓延随植被密度、风速、地形坡度缩放),并通过防火隔离带实验与生物量损失估算做了验证,还以降雨冷却的能量汇机制模拟了火情遏制。
来源:arXiv:2608.11100,Nienke Driessen, Joris Rijsdijk, Sören Pirk, Wojtek Palubicki, Dominik L. Michels, Michael Weinmann,Submitted 11 Aug 2026,cs.GR。
速报点评:不转网格、直接在高斯原语上做传热与蔓延计算,是"高斯即资产"的又一次外延。"真实数据驱动的灾害数字孪生"在应急管理与林业方向的应用潜力值得关注——不过据论文,目前的验证限于合成场景与真实航拍数据的仿真层面,距实际业务系统仍有距离。
3. HandSplatter:神经渲染替代手工量角器(EMBC 2026)
手与手指疾病是肌肉骨骼致残的重要成因,临床用关节活动度(ROM)做诊断、康复监测与手术评估。
标准工具至今还是手工量角器(goniometer)——费时费力,评分者间信度不稳;现有软件替代方案的精度又常不达临床要求。
HandSplatter 提出用神经渲染做 3D 手部关节定位与姿态估计的流水线:2D 特征提取 + 视图合成结合提升精度,配合离散密度爬山算法在 3D 空间中修正投影关键点,为客观功能评估提供稳健工具。
来源:arXiv:2608.09735,Emmett Chen, Neal Chen, Xiang Li, Quanzheng Li, Siyeop Yoon,Submitted 10 Aug 2026,cs.CV,comments 注明 Accepted at EMBC 2026(IEEE 医学与生物学工程年会)。
速报点评:医疗场景的"小切口"样本——不求大场景重建,只求把一个临床动作(量角度)做准做稳。同期批次里还有锥束 CT 金属伪影抑制(2608.13159,已刊于期刊 Computer Graphics Forum)等医学影像方向工作。
四、技术科普
语义 3DGS × 具身智能:机器人为什么需要"可刷新的 3D 语义地图"?
本周 Embodied Grounding(ACM MM 2026)与 LEGO(ECCV 2026)分别从"操作"与"理解"两端,把"语义 3DGS"推到了台前。这里轻量科普一下它到底解决什么问题。
VLA 机器人的"眼脑断层":当前视觉-语言-动作(VLA)模型大多以 2D 图像(或点云)为输入。
但 2D 观测没有"持久性"——机器人转头看别处,刚才看到的杯子在表示里就消失了;点云有 3D 却没语义,也不知道"这是能抓的杯柄还是不能碰的电线"。
语言指令说"把那束花里还没开的花蕾摘掉",2D/点云表示很难解析这种嵌套指代。
语义 3DGS 的角色:把 CLIP 等语言特征关联到高斯表示(原语级或分段级,不同方法粒度不同),得到一张"3D 结构带语言身份"的地图。它的三个特性正好补上断层——
- 持久:观测离开视野,语义仍在地图里(Embodied 论文中"照片诱导误抓取"的消除,与表示的持久性相一致);
- 可刷新:主动多视角再看几眼,局部地图就能更新,应对杂乱与遮挡;
- 可分层:LEGO 式的语义谱系让"花束 → 花蕾"嵌套指代在 3D 里有了落点,还能组装成语言场景图交给 LLM 做空间推理。
与动作侧的握手:Embodied Grounding 的做法值得注意——3D 语义线索只注入动作模型的后期模块,避免污染预训练动作先验。这是一个务实的工程判断:“地图管感知,VLA 管动作,语义做桥梁”。
一句话:当"看得见"(渲染)、“认得出”(语义)、“记得住”(持久地图)三者合一,3DGS 就从渲染引擎变成了机器人的世界模型接口——这是本周两条顶会工作共同指向的方向。
五、行业脉搏
观察 1:一周六篇录用、五个不同的会——学术渗透面在拉宽
本周已验证录用的论文分属五个不同会议:LEGO(ECCV 2026,计算机视觉)、Embodied Grounding 与 CausalSplat(均 ACM MM 2026,多媒体)、GS-CPE(IROS 2026,机器人)、ProbSplat(ISVLSI 2026,芯片与超大规模集成)、HandSplatter(EMBC 2026,医学与生物学工程)。
从视觉会议一路铺到芯片会议和医学会议,说明 3DGS 已不再是 CV 圈的"内部话题",而是跨学科的通用基础设施候选。
观察 2:算法层之下,硬件层开始进场
ProbSplat(ISVLSI 2026)是个信号:当一项技术的能效瓶颈开始由电路研究者接手,说明它已进入"落地倒计时"。
受存内计算启发的概率计算架构为高斯混合量身定制电路,18pJ/次推断的能效区间瞄准的是边缘设备。据论文,目前为仿真结果,但方向值得 AR/VR 与机器人团队保持关注。
六、本周小结
本周 3DGS 生态呈现三个清晰信号:
- 语义理解走向分层化、结构化:LEGO 把"花盆→花束→花蕾→花瓣"的谱系装进高斯,配合语言场景图让 LLM 在 3D 里做推理;语义 3DGS 正从"贴标签"升级为"建谱系"。
- 具身智能成为 3DGS 最有说服力的新落点:Embodied Grounding 的真机试验显示,完整系统在重度杂乱场景成功率达 74%(其单视角变体 52%)——"世界模型接口"的叙事有了量化证据点。
- 物理与硬件双向外延:WildFireGS 让燃烧物理原生跑在高斯上,ProbSplat 把高斯装进概率电路;一个向上接真实世界动力学,一个向下接边缘算力。
一句话:当语义有了层级、操作有了证据、硬件有了入场者,3DGS 正从"重建与渲染技术"演化为"空间智能的底座"。
如果你在做具身智能或场景理解,LEGO 的分层语言场景图(ECCV 2026,项目页已开放)与 Embodied Grounding 的"语义只注入后期模块"设计,都是值得上手复现的参考。
💬 聊聊:本周的五个方向——分层语义、具身操作、野火孪生、位姿估计、概率硬件——你认为哪个会最先规模化落地?留言区说说你的判断 👇
🛠 顺手安利 · 关于 3DGSFlow
如果你正在使用 3DGS,欢迎试试 3dgsflow.com —— 一款免费的在线 3DGS 编辑器,支持 PLY/SPLAT/SPZ 导入、多模型融合编辑、一键校准、体积裁剪、物品展览配置,并可基于 Spark 引擎导出网页包。浏览器打开即用,无需注册。
本文为公开信息整理,尊重原作者知识产权,不构成任何技术或投资建议。所有论文引用均标注 arXiv 编号、作者与发布时间,读者可通过 arXiv 编号查阅原文核实。ProbSplat 硬件数据为 180nm CMOS 仿真结果,尚无流片公开数据。
本文由作者主导选题与编辑,AI 工具协助资料整理与措辞排版。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)