3DGS 速报第 5 期,光线追踪跑赢光栅化
追踪 3D Gaussian Splatting 前沿,每周一更。点击「关注」并设为星标 ⭐,第一时间拿到最新论文、工具与落地动态。
本期关键词:可微光线追踪 · 大场景生成 · 4D 数字人 · 具身视角鲁棒
📌 本期头条:VoroTracing(arXiv:2608.17682)在 Mip-NeRF 360 上把可微光线追踪做到 623 FPS(RTX 5090),吞吐是最快光线追踪方法的 3.2 倍、3DGS 光栅化的 2.8 倍——"光线追踪太慢"这个多年的行业假设,被沃尔沃旗下自动驾驶公司 Zenseact 的团队动摇了。
一、本周速览
| 名称 | 一句话 | 来源 / 时间 |
|---|---|---|
| 【论文】VoroTracing | 可微 Voronoi 光线追踪:623 FPS,吞吐 2.8× 3DGS,鱼眼/卷帘快门/景深原生支持 | arXiv:2608.17682,8/18 |
| 【论文】GS-Voxel | 免拟合结构化隐变量 + 流模型:以卫星图为条件生成大范围航拍 3DGS 场景 | arXiv:2608.17988,8/18 |
| 【论文】4DAnyone | 随手单目视频 → 多视角一致视频 → 4DGS 数字人,解决几十目标视角的一致性崩塌 | arXiv:2608.20335,8/20 |
| 【论文】GS-VLA | 4M 参数 3DGS 规范化器前置到冻结 VLA 策略,缓解视角漂移(最坏 90%→10% 掉分) | arXiv:2608.19066,8/19 |
| 【论文】TopoSurfel | 高斯面元与网格闭环互校:可微等值面提取代理网格,压浮点、补孔洞 | arXiv:2608.20687,8/21 |
| 【论文】3DGART | 光线追踪版 3DGS 训练加速:反向传播从像素中心改为原语中心,约 3–3.5× | arXiv:2608.17298,8/18 |
| 【论文】QuARC-GS | 量化锚定残差编码 + 变化门控致密化:动态场景逐帧存储最高省 11 倍 | arXiv:2608.18285,8/18 |
| 【论文】NGS-Marker | 3DGS 原生水印:任意局部区域可解码所有权,专防"只偷一部分高斯" | arXiv:2608.17447,8/18 |
| 【论文】GroupForward | 实例分组前馈 3DGS:稀疏无位姿输入重建实例结构,VLM 做指代推理 | arXiv:2608.17535,8/18 |
| 【论文】SPVC | 驾驶场景渲染修复:位姿/3D 框/高精地图作结构条件,跨数据集通用 | arXiv:2608.17420,8/18 |
| 【论文】CoMVS-GS | MVS 稠密初始化 + PatchMatch 互监督 + Delaunay 图割网格化,室外表面重建 | arXiv:2608.18413,8/19 |
| 【落地】Nuke 17.1v1 | Foundry 合成软件支持动态高斯泼溅与重打光 | Radiance Fields,8/20 |
| 【落地】NavVis IVION 12 | 工业扫描平台把 3DGS 列为点云、全景之外的第三种可视化模式 | Radiance Fields,8/19 |
| 【落地】SuperSplat API | PlayCanvas 开放 REST 发布接口,第三方工具直连 superspl.at 托管 | Radiance Fields,8/19 |
| 【落地】Splat.js | Arrival.Space 开源 WebGPU 库:浏览器标签页里跑 SIFT SfM + 3DGS 训练 | Radiance Fields,8/21 |
| 【科普】雷峰网长文 | 拆解 CVPR 2026 八篇工作:EcoSplat、TokenGS、Video2Robo、ParticleGS 等 | 雷峰网,8/17 |
| 【科普】iPhone 训练提速 | 开发者 Sebastian Beyer 的 Scantic:iPhone 本地训 3DGS,小型扫描约 1 分钟出 Splat | 据 CG Channel 报道,8/19 |
同期 arXiv 上还有:稀疏光场采样(2608.20602,Waller 与 Fridovich-Keil 团队,用消费级多摄相机提升 casual 3D/4D 重建质量)、Stream4D(2608.19556,用前馈 4D 重建奖励替换"静态批判器",缓解流式扩散视频越生成越僵的问题)、beta surfels 表面重建(2608.20000,平均仅 267 个面元 + 伴随法光传输,比最强点基线少 28.5% Chamfer 距离)等。另有一篇标题挂着"Depth Anything V4"的稿件(2608.18388),作者已在 v2 页面自注"Major errors in research",与原 Depth Anything 系列无关,请读者甄别。
二、硬核论文
1. VoroTracing:光线追踪跑赢了光栅化
先把话说准确:VoroTracing 的原语不是高斯,是 Voronoi 单元。它出现在本栏目里,是因为它干了一件直接冲击 3DGS 立身之本的事——在 Mip-NeRF 360 上,RTX 5090 渲染 623 FPS,吞吐是最快先前光线追踪方法的 3.2 倍,是 3DGS 光栅化的 2.8 倍。
3DGS 这几年的统治力,一半来自表示(显式原语好优化、好编辑),另一半来自光栅化管线的吞吐。光线追踪那一边,表达式天然更强:鱼眼、卷帘快门、景深、运动模糊,在光线追踪里只是"换一种光线生成方式",在光栅化里却要一个个专门扩展。代价是慢——这是行业多年的默认设定。
Zenseact(沃尔沃旗下自动驾驶软件公司,论文代码就发布在 research.zenseact.com)的团队不认这个默认。他们把可微 Voronoi 光线追踪的吞吐拆成三笔账:遍历长度、每单元开销、内存局部性,然后逐项压:
- 紧凑八面体外观纹理:压内存流量——纹理访问是光线追踪的命门;
- 表面集中的不透明度:鼓励提前终止,光线少走冤枉路;
- 固定预算表示:不做剪枝和致密化,表示规模训练前就定死,换来可预测的遍历行为,GPU 端按"连贯遍历"设计执行。
结果除了 623 FPS 这个数字,还有一条容易被忽略:质量总体与 3DGS 相当(据论文 Table 2:全场景 PSNR 差 0.13 dB,室内场景反超、室外落后约 0.7 dB——固定预算的已知代价,作者把这写进了局限章节)。它不是拿质量换速度的 demo,是一套完整的可微渲染器,源码已开源。
来源:arXiv:2608.17682,Bernardo Taveira, Carl Lindström, Joakim Johnander, Fredrik Kahl,Submitted 18 Aug 2026,cs.CV。代码:research.zenseact.com/publications/vorotracing。
速报点评:来自一家自动驾驶公司,这事本身就有信息量。车载相机的卷帘快门、广角畸变,恰恰是光栅化 3DGS 最难伺候的场景——Zenseact 有真实动机把光线追踪做快。对 3DGS 社区,这篇是一记提醒:速度护城河不是永久的,"快"是工程属性,不是范式属性。同一天还有 3DGART(2608.17298)在训练端干类似的事(下文细说),光线追踪派一周之内同时攻了推理和训练两端。
2. GS-Voxel:大场景 3DGS 的生成式路线,走到了"免拟合"这一步
潜空间 3D 生成器这几年跑得很快,但基本都建在结构化张量上;3DGS 重建产物却是无序点集,原语数量因场景而异、相差悬殊,硬塞进固定分辨率的张量要么丢信息、要么白算。GS-Voxel 的回答是:别拟合,直接换轨道。
做法分三步:
- 免拟合结构化:把预优化好的 3DGS 重建确定性地转成稀疏活跃体素——不引入逐场景优化,且保留被选中原语的亚体素位置和渲染属性;
- GS 专用分解 VAE:体素几何和局部高斯属性分开编码成稀疏 3D 隐变量,隐变量大小随占用体素数增长,而不是被固定的"全场景原语数"卡死;
- 图像条件流模型:在这个隐空间里训练生成模型,产出航拍 3DGS 场景。
最有想象力的是应用层:overlap-aware 分块推理,让生成范围越过单个训练 crop,以卫星视角图像为条件往外扩展——拍一小块,生成一整片。
来源:arXiv:2608.17988,Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen,Submitted 18 Aug 2026,cs.CV。机构据 arXivDaily:浙江大学、北京大学、高德地图、阿里巴巴。
速报点评:作者机构里出现了高德和阿里,这事的落点就不难猜——航拍大场景 + 卫星图条件,就是地图业务的形状。技术上我喜欢"隐变量容量随占用体素增长"这个设计,它承认了 3DGS 场景天然的不均匀性,而不是用固定张量硬抹平。和 4DAnyone 放在一起看更清楚:生成式管线正在把 3DGS 当作"出口格式",这比"生成式管线里用了个高斯"是强得多的信号。
3. 4DAnyone:随手一段视频,产出 4D 数字人
思路一句话:拿相机可控的视频扩散模型,从单目视频"脑补"出几十个目标视角的一致视频,再把它们提升(lift)成 4DGS。难点不在扩散模型本身,而在"几十个视角"这个规模——现有模型一超过单次 DiT 前向的注意力容量,就必须分组生成,然后一致性崩掉。
作者把这个失败模式命名为有界注意力上下文问题,并拆出两个耦合的瓶颈:参考侧,条件于全部已生成视角,上下文长度 O(N) 增长,跨视角外观引导被稀释;目标侧,分组之间无法直接交换信息,全局结构漂移。
4DAnyone 的两个设计分别对症:
- RCP(参考上下文打包):把不断增长的参考视角压缩成定长的混合分辨率上下文,复杂度 O(1);
- TCR(目标上下文路由):去噪过程中轮换目标视角的分组——高噪声步跨组共享上下文,低噪声步稳定细节。
数据侧,团队用自研游戏引擎构建了 MVGameHuman 数据集,再混入光场采集棚(light-stage)与野外视频数据。结果(据论文):在 DNA-Rendering 和 DyMVHumans 上,新视角视频质量与下游 4DGS 重建都超过此前方法,且对野外素材泛化良好。代码与视频见项目页 4danyone.github.io。
来源:arXiv:2608.20335,Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu,Submitted 20 Aug 2026,cs.CV。机构据 arXivDaily:浙大 CAD&CG 国重实验室、Robbyant、港中文、蚂蚁集团、港科大。
速报点评:把扩散模型当"多视角数据工厂"、把 4DGS 当"落地表示",这个分工干净利落。TCR 的"高噪声共享、低噪声稳定"是个挺漂亮的调度直觉——粗糙阶段求全局一致,精细阶段各自收尾。对做虚拟人、直播、影视预演的团队,"随手拍 → 4D 人体资产"这条链路的每一环本周都在变短。
4. GS-VLA:4M 参数,稳住 VLA 的"晕机"
VLA(视觉-语言-动作)模型有个几乎没人明说的前提:训练和部署时相机得装在同一个位置。论文实测(据摘要):相机支架一点点位移,LIBERO 基准上的成功率最坏从约 90% 掉到约 10%。传统解法是大规模微调或生成式数据增强——贵,还有灾难性遗忘的风险。
GS-VLA 的观察是:视角偏移本质上是个局部新视角合成问题。在"扰动局限于工作空间附近一个有界区域"的假设(Locality assumption)下,视角规范化退化成一个与场景、与策略都无关的补遮挡(disocclusion)任务——而补遮挡,恰好是 3DGS 新视角合成的看家本领。
实现上就是一个 4M 参数的 3D 高斯规范化器,前置在冻结的 VLA 策略之前。策略权重一个字不动,三个正交维度(不同策略架构、未见任务套件、不同扰动幅度)上的表现均有大幅恢复。
来源:arXiv:2608.19066,Yechan Park, HyunJin Kim(檀国大学),Submitted 19 Aug 2026,cs.CV。
速报点评:部署鲁棒性是具身智能落地时最不性感、也最致命的一环——论文里 90% 的成功率,换个相机支架就剩 10%,这种脆性在真机上是灾难。"冻结主干 + 轻量视觉前置"这个结构也值得记住:不动大脑,只给眼睛戴副眼镜。连同 8/17 提交的 LaGSplat、本周的 GroupForward,3DGS 正在具身栈里扮演"视觉接口层"的角色。
三、应用落地
1. Nuke 17.1v1:合成师的节点树里有了动态高斯(8/20)
据 Radiance Fields 报道,Foundry 发布 Nuke 17.1v1,带来动态高斯泼溅与重打光支持:GeoDeletePoints 节点支持分数密度掩码,SplatRender 新增 Overscan 选项,另有 8 项 splat 相关修复。
Nuke 是影视合成的工业标准。对 3DGS 而言,进入 Nuke 的节点树意味着它不再只是"预览资产",而是合成师可以直接调密度、做删除、参与最终合成的生产素材。高斯在专业管线里的身份,这周正式升了一级。
2. NavVis IVION 12:3DGS 成为第三种"官方语言"(8/19)
工业级移动与激光扫描厂商 NavVis 在 IVION 12 中加入高斯泼溅,成为点云、全景之外的第三种可视化模式。目前以 beta 形式面向 NavVis MLX 客户开放。
这条新闻的分量在姿态:NavVis 的客户是工厂、电站、基建这类企业级数字孪生用户。把 splat 与点云、全景并列为三种模式,等于在企业测绘平台上给 3DGS 发了正式工牌。此前消费端的 HarmonyOS 端侧重建往下沉,这次是企业测绘从专业端往上接,两头正在合拢。
3. 工具生态三连:发布走 API、训练进浏览器、生成进 Unity(8/19–8/21)
一周之内,3DGS 的工具链路补上了三块拼图(均据 Radiance Fields):
- PlayCanvas 开放 SuperSplat REST 发布 API(8/19):第三方扫描和训练工具可以把高斯直接上传到 superspl.at 托管,不用手动导出导入;
- Arrival.Space 发布 Splat.js(8/21):MIT 许可的 WebGPU 库,在浏览器标签页里跑 SIFT SfM 加 3DGS 训练——重建这件事,不再需要本地装环境;
- Streamed Reality 在 Unity 编辑器内生成 3DGS(8/19):运行时优化,Windows + CUDA 显卡上训练并导出 PLY。
加上同期 Houdini 一侧的动作——GSOPs 3.0.0(支持 Houdini 22、高斯烘焙到网格与体积、NanoGS 精简、mip-splatting 导入,8/17)和 TACTYC Onesplat(Houdini 内单图生成高斯,本地 NVIDIA GPU,8/17)——"采集 → 训练 → 编辑 → 发布"这条链路,本周每一环都有人交付了新东西。
4. LocalMesh:一张照片,本地 GPU,splat 带网格(8/19)
LocalMesh 开放 beta(据 Radiance Fields):单张照片先用 TripoSplat 生成高斯泼溅,再把 60 张泼溅深度图凿进 768³ 的 TSDF 体素融合成带纹理的网格,全程本地 GPU 完成。
单图 → splat + mesh 的组合并不多见,"全本地"的定位也戳中了一批不想把素材传云端的用户。beta 阶段,效果以实际使用为准。
四、技术科普
光栅化为什么快,光线追踪为什么"慢",以及这周发生了什么
3DGS 的渲染管线是光栅化路线:把三维高斯投影到屏幕、按 tile 分桶排序、每个 tile 内按深度做 alpha 混合。它快的根源是"只算屏幕上需要的东西",代价是灵活性——鱼眼镜头、卷帘快门、景深、运动模糊这些"非标准成像",每一个都需要专门的管线扩展,反射折射更是免谈。
光线追踪反着来:从像素出发发射光线,与场景求交。上面那些效果在光线追踪里只是改一改光线生成与采样方式,管线一行不用动。代价是慢——遍历、求交、着色,每一步都是实打实的计算。
本周的两篇论文,一头一尾动摇了"慢":
推理端,VoroTracing(2608.17682):先把吞吐的决定因素列出来——遍历长度、每单元开销、内存局部性——再逐项优化,最后 623 FPS,反超 3DGS 光栅化 2.8 倍。
训练端,3DGART(2608.17298):光线追踪版 3DGS 训练慢的瓶颈不在光线遍历,而在反向传播——以像素为中心回传梯度时,大量线程往同一些高斯参数上做原子累加,线程互相卡死。3DGART 把反向传播重组为以原语为中心:用保守的透视屏幕边界建紧凑中间缓冲,让每个线程负责"一个原语在 tile 内覆盖的所有像素",梯度计算从争抢式的 scatter 变成结构化的 gather。Mip-NeRF 360 上训练提速约 3–3.5 倍(对比逐像素基线),对 3DGRT 约 4 倍,训练时长追平了光栅化管线。
两篇的共同方法论值得抄:不换范式,先把性能模型写清楚,再对着最大的那一项下刀。"光线追踪慢"从来不是物理定律,只是没人把账算到这个精度。
对你的意义很具体:如果你在做车载视觉(卷帘快门)、全景内容(鱼眼)、XR(动态模糊与景深),光线追踪路线现在值得重新评估——它不再意味着"离线渲染"。
五、行业脉搏
观察 1:DCC 工业软件集中"补票"
Nuke 17.1(合成)、GSOPs 3.0.0 与 Onesplat(Houdini)、Streamed Reality(Unity)、NavVis IVION 12(企业测绘)——一周四家工业级工具更新 3DGS 支持。加上此前行业里的鸿蒙端侧重建、UE 的 LCC 插件等动作,“3DGS 会不会被工业管线采纳"这个问题已经过时了,现在的问题是"怎么用顺”:格式转换、烘焙到网格、重打光、发布托管,工具链正在往深处走。
观察 2:"具身底座"叙事在中文产业圈起势
雷峰网 8/17 发长文拆解 CVPR 2026 八篇工作——EcoSplat(前馈重建按算力裁剪高斯数量,5% 原语保 24.72 dB PSNR)、SparseSplat(信息熵稀疏化,15 万高斯——约为传统 688 万高斯的 22%——达 24.20 dB PSNR,持平甚至超越 SOTA)、CaT-GS(帧间缓存,700 万高斯城市场景 10 倍渲染加速)、EDGS(稠密初始化替代分裂试错,15% 训练时长)、TokenGS(NVIDIA,可学习 token 解耦像素绑定,端侧只微调 token)、SGAD-SLAM(深度偏移实时修正)、ParticleGS(Neural ODE 物理外推)、Video2Robo(单视频造数字孪生、批量合成机器人训练数据)——结论指向"3DGS 正在成为具身智能的物理底座"。本周 arXiv 侧的 GS-VLA 与 GroupForward 也在给同一条线补砖。科研供给和产业叙事,正在中文圈形成正反馈。
观察 3:"快"的战场从论文 FPS 转移到你的设备
开发者 Sebastian Beyer 的夏季项目 Scantic(据 CG Channel 与 Radiance Fields 报道):最初用 Brush 引擎在 MacBook Air 上跑第一个 Splat 花了 3 个多小时,他借助 Claude AI 工具持续优化并逐步把管线搬到 iPhone 上——最终版在 iPhone 端全本地运行,小型扫描约 1 分钟出 Splat。关于提速幅度,两个来源口径不一:作者本人博客称"整体提速约 1000×",CG Channel 报道称"最高约 260×",本刊无法裁定,仅如实列出。注意:3 个多小时和约 1 分钟是两个阶段、两条管线的数字,中间隔着整条管线的迁移,不宜直接当成"同一任务的提速对比"。同周,Arrival.Space 把 SfM 加 3DGS 训练塞进浏览器标签页,Streamed Reality 把训练塞进 Unity 编辑器。加上 GPU 端的 VoroTracing 与 3DGART,性能叙事出现了分层:数据中心卷帧率,设备端卷"几分钟能出活"——后者才是普通创作者感知得到的速度。
六、本周小结
本周 3DGS 生态的三个信号:
- 渲染范式之争重新开赛。VoroTracing 在推理端把光线追踪做到 2.8 倍于 3DGS 光栅化的吞吐,3DGART 在训练端把光线追踪版 3DGS 的训练时长追平光栅化管线。"光栅化才快"这个 3DGS 的立身假设,被撕开了一角。
- 生成式 3DGS 从"物件"走向"场景与人"。GS-Voxel 以卫星图为条件生成大范围航拍场景,4DAnyone 从随手单目视频生成 4D 数字人——3DGS 正在从重建管线的"输出",变成生成管线的"目标格式"。
- 工业管线与具身接口同步加厚。Nuke、NavVis、Houdini、Unity 一周内集中更新;GS-VLA 用 4M 参数前置模块缓解 VLA 部署的视角脆弱性。3DGS 作为"资产格式"和"视觉接口"的两条工程化路线,这周都有实质交付。
一句话:光栅化的速度护城河上出现了脚印,而泼溅本身的疆域,又往外扩了一圈。
如果你在做车载、全景或 XR 渲染,VoroTracing 与 3DGART 的代码都已开源,值得拉下来跑一遍基准;做内容管线的团队,本周 Nuke、GSOPs、SuperSplat API 的更新直接决定工作流怎么搭。
💬 聊聊:光线追踪反超光栅化、卫星图生成大场景、单目视频出 4D 数字人、VLA 视角规范化——这四个方向里,你觉得哪个最先进入你的工作流?留言区聊聊 👇
🛠 顺手安利 · 关于 3DGSFlow
作者开发的免费在线 3DGS 编辑器,支持多模型融合编辑、一键校准、体积裁剪、物品展览配置,还能基于 Spark 引擎导出网页包。浏览器打开即用,无需注册。与此同时,3DGS本地训练工具也即将开放下载,敬请期待。
说明:本文为公开信息整理,尊重原作者知识产权,不构成任何技术或投资建议。所有论文均标注 arXiv 编号,可据编号查阅原文核实;平台动态以各厂商官方发布为准。个别信息源存在口径差异或 beta 未定状态,已在正文相应位置如实标注,请以一手来源为准。
本文由作者主导选题与编辑,AI 工具协助资料整理与措辞排版。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)