摘要

本文解读 ECCV 2026 论文《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》。该论文提出物理在环(physics-in-the-loop)的仿真就绪人-场景交互(HSI)重建框架,通过融合场景定向强化学习直接仿真奖励优化(DSRO)生成式 3D 结构先验,让重建结果第一次"进得了仿真器、上得了真机",其特别之处在于把物理仿真器从结果检验者变成主动监督者,双向优化人体运动与场景几何。实验表明Easy 档稳定性从 HSfM 的 10.52% 提升到 53.68%、穿透率降至 22.9%,并配套发布 HSIBench 基准(300 个交互实例)与 Unitree G1 人形机器人真机部署,为具身智能提供了从视觉重建到物理可行的完整范式借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions
标题(中文) 物理在环的仿真就绪人–场景交互重建
作者 Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu
机构 S-Lab · 南洋理工大学(NTU)· ACE Robotics · 上海人工智能实验室
会议 ECCV 2026
arXiv arXiv:2603.15612
项目网站 yukangcao.github.io/HSImul3R

背景与动机:为什么重建不等于可用

具身智能要让智能体在真实世界感知、推理与行动,重建高质量的人-场景交互(HSI)数据是构造仿真就绪数据集的关键路径。但现有方法存在一条清晰的感知-仿真鸿沟(perception-simulation gap):视觉上合理的重建常常违反物理约束,放进物理引擎就失稳,无法支撑具身 AI 应用。HSImul3R 的动机正是把重建的验收标准从"看起来对"升级为"物理可行"。

现有工作沿三条割裂的技术路线发展,各有盲区:

  • 3D 场景重建(NeRF / 3DGS / DUSt3R):只重建环境几何,忽略人体动力学与接触;
  • 人体运动估计(4DHumans / ViTPose):遮挡下鲁棒,但缺乏物理接触建模;
  • 交互建模(BEHAVE / InterCap):数据集规模、多样性与物理验证有限。

即便是 HOSNeRF、HSfM 这类联合建模的统一框架,也主要优化 2D 图像空间,缺少度量尺度与接触保真,结果缺重力、缺交互力验证,进仿真器即不稳定。从历史视角看,HSI 重建经历 BEHAVE(2022,首个大规模人-物交互捕捉数据集)→ HOSNeRF(2023,隐式神经场统一重建)→ HSfM(2025,首个未标定稀疏视图 3D HSI 重建)的演进,但始终停留在"捕捉与视觉对齐"层面。HSImul3R 首次把物理仿真器反馈引入重建闭环,完成从 3D 视觉到具身智能的技术迁移。

研究主线:从问题到结论

Mermaid 图 1:HSImul3R 研究主线流程图——从感知-仿真鸿沟到仿真就绪真机部署(Mermaid 流程图)

图 8:研究主线——问题 → 双向优化 → HSIBench → 真机部署(Mermaid 流程图)

基准/方法设计:仿真器成为主动监督者

HSImul3R 的核心是把重建表述为物理在环双向优化:前向用场景定向 RL 优化人体运动,反向用 DSRO 修正场景几何,同一个仿真器同时扮演运动优化器几何考官

HSImul3R 总览:从休闲拍摄重建仿真就绪的 HSI,仿真器作为主动监督者双向优化运动与场景几何,最终部署到 Unitree G1 人形机器人

图 1:HSImul3R 总览——仿真器作为主动监督者双向优化运动与场景几何,最终部署到 Unitree G1 人形机器人

设计要点:

  1. 显式 3D 结构先验:SAM 分割物体 → MIDI 生成高保真 3D 结构,弥补 DUSt3R 重建中物体拓扑非水密、表面缺失等缺陷;
  2. 穿透感知对齐:用物体表面有符号距离函数(SDF)构造接触约束,惩罚穿透深度;
  3. 双向闭环:运动在固定几何下优化,几何在物理验证的运动下修正,形成自洽回路。

方法分类全景

Mermaid 图 2:HSImul3R 方法分类全景——重建对齐/场景目标RL/DSRO/真机部署四大模块(Mermaid 流程图)

图 9:方法分类全景——物理在环四大模块(Mermaid 流程图)

方法细节:双向优化闭环

HSImul3R 系统框图:重建与 3D 结构先验对齐后,前向用场景目标 RL 优化运动,反向用 DSRO 依据仿真稳定性修正物体几何

图 2:HSImul3R 系统框图——前向 RL 优化运动、反向 DSRO 修正几何

重建与对齐:DUSt3R 重建场景,SAM2 / 4DHumans / ViTPose 估计人体,MIDI 生成物体的 3D 结构先验,以显式 3D 约束统一坐标系。对齐阶段用两类损失:非接触项 $\ell_{\text{non-contact}} = \frac{1}{|H_p|}\sum_{j}\lVert \mu_i^h - \mu_j^o \rVert_2 + \frac{1}{N_o}\sum_j \min_{i \in H_p} \lVert \mu_j^o - \mu_i^h \rVert_2$ 拉近人体与物体表面点;接触项 $\ell_{\text{contact}} = \frac{1}{|H_p|}\sum_{i \in H_p} \max(0, -\delta(\mu_i^h))$ 惩罚 SDF 穿透深度。

前向:场景目标 RL。在 PHC 运动跟踪基础上叠加场景奖励 $\ell_{\text{scene}} = \frac{1}{N_c N_s}\sum_{j=1}^{N_c}\sum_{i=1}^{N_s} \lVert \mu_i^o - k_j^h \rVert_2^2$,强制人体接触关键点贴近物体局部表面,防止人形"把物体踢开",在运动保真与接触稳定双监督下优化人体运动。

反向:DSRO(Direct Simulation Reward Optimization)。把仿真反馈(重力稳定 + 交互成功)转成稳定性标签 $l(x_0) \in {0,1}$,作为去噪损失权重:$\ell_{\text{DSRO}} = -T\,\mathbb{E}\,[\,w(t)\,(1-2\,l(x_0))\, \lVert \epsilon - \epsilon_\theta(x_t, t) \rVert_2^2\,]$,稳定样本负权重强化、不稳定样本正权重弱化。用 LoRA 微调 MIDI(rank 64、学习率 $10^{-5}$、1800 步、4×A100),无需人工标注或 3D 真值——监督信号完全来自仿真结果。

实验设计与结果

HSIBench 基准:19 个物体(8 椅 / 3 桌 / 3 沙发等)、2 男 1 女志愿者、300 个交互实例,每例 16 视角多视图采集,按交互复杂度分 easy / medium / hard 三档。伪真值由多视图 2DGS 重建物体几何 + SMPL 估计人体运动构成;每实例 15 个随机种子 × 每视角重跑完整重建+仿真管线,保证统计可靠性并系统收集 DSRO 训练信号。指标覆盖稳定性-HSI(重力稳定 + 场景稳定 + 保持交互)、SP-3D 穿透率、W-MPJPE / PA-MPJPE、CD / F-Score、Stability-Gravity。基线:HSfM、V1(HSfM+MIDI)、V2(无场景距离)、V3(CLoSD 中心距离)、V4(无 DSRO)、MIDI、DSO*。

HSIBench 数据与仿真结果总览:多样物体与交互场景,右侧展示本方法在仿真器中的稳定交互状态

图 3:HSIBench 数据与仿真结果总览

主结果(稳定性-HSI 与穿透率)

方法 Easy↑ Medium↑ Hard↑ SP-3D↓
HSfM 10.52 4.50 2.66 69.51
V1(HSfM+MIDI) 13.96 8.81 4.17 77.12
V2(无场景距离) 39.56 22.71 7.05
V3(中心距离) 42.57 23.84 10.18
V4(无 DSRO) 29.56 16.62 5.17
Ours(HSImul3R) 53.68 30.56 13.92 22.90

Easy 稳定性 10.52% → 53.68%(约 5.1 倍),SP-3D 穿透率 69.51% → 22.9%(降低约 2/3)。

与 HSfM 的仿真定性对比:HSfM 常把物体踢开、人形独自站立;HSImul3R 全程保持稳定交互

图 4:与 HSfM 的仿真定性对比——HSImul3R 全程保持稳定交互

消融与运动质量:场景目标 RL 是关键组件——V2(去掉 $\ell_{\text{scene}}$)Hard 仅 7.05%,V3 用 CLoSD 中心距离 10.18% → Ours 表面距离 13.92%;DSRO 同样关键——V4(无 DSRO)Easy 29.56% → Ours 53.68%,重力稳定 SG 79.19% → 91.50%,CD 0.198 → 0.173。运动质量 W-MPJPE 5.02 → 4.09,PA-MPJPE 2.79 → 2.17

图像到 3D 物体生成定性对比:MIDI / DSO 存在结构畸变(缺腿、表面鼓包),DSRO 微调后几何更忠实、仿真更稳定

图 5:图像到 3D 生成对比——DSRO 微调后几何更忠实

图像到 3D 生成质量(附录 E)

方法 Easy↑ Medium↑ Hard↑ SG↑
MIDI 29.56 16.62 5.17 79.19
DSO*(MIDI 上微调) 38.75 25.91 7.88 87.23
Ours(DSRO) 53.68 30.56 13.92 91.50

几何精度同样全面领先:CD 0.198(MIDI)→ 0.191(DSO)→ 0.173(Ours),F-Score 81.95 → 86.26 → 88.25*——DSRO 同时提升物理合理性与几何精度,无性能权衡。

输入视图数稳健性(附录 D):16 视图 Easy 55.16% 略高,但 10 视图 52.93% 与 4 视图 53.68% 几乎持平,穿透率相近(21.81 / 21.00 / 22.90)——4 张稀疏视图即足够

场景目标消融(附录 D + 图 7):移除 $\ell_{\text{scene}}$ 后人形大幅摆动、频繁踢开物体;加入表面距离监督后保持稳定交互,验证了该奖励设计的必要性。

真机部署:优化后的运动经 GMR 重定向到 Unitree G1 人形机器人,在 IsaacGym 中训练扩散引导 RL 全身控制策略,经 Unitree SDK 部署到物理硬件,验证了从重建到真机交互的完整链路。

真机部署:GMR 把精化运动重定向到 Unitree G1,扩散引导 RL 训练全身控制策略(IsaacGym),经 Unitree SDK 部署到真实机器人

图 6:真机部署——Unitree G1 人形机器人全身控制

场景目标仿真消融:去掉 ℓscene 距离最小化项后人形运动夸张、把物体踢开;加上表面距离监督后保持稳定交互

图 7:场景目标仿真消融——表面距离监督是稳定交互的关键

结果对比总结

Mermaid 图 3:结果对比总结——HSImul3R 对 HSfM 的稳定性提升与穿透率下降(Mermaid 流程图)

图 10:结果对比总结——稳定性 5.1 倍、穿透率降 2/3、SG 91.50%(Mermaid 流程图)

关键发现

  • 首个仿真就绪的 HSI 重建:Easy/Medium/Hard 稳定性达 53.68% / 30.56% / 13.92%,全面超越 HSfM(10.52% / 4.50% / 2.66%);
  • 穿透率降低约 2/3:SP-3D 从 69.51% 降至 22.90%,物理合理性显著提升;
  • DSRO 双赢:重力稳定性 SG 79.19% → 91.50%,同时 CD 0.198 → 0.173、F-Score 81.95 → 88.25,物理与几何质量兼得;
  • 稀疏输入即可用:4 视图与 16 视图稳定性几乎持平(53.68% vs 55.16%),显著降低数据采集成本;
  • 每个组件都有贡献:V1–V4 四个消融变体形成清晰梯度(29.56%–42.57%),证明 MIDI 注入、场景损失、表面距离度量与 DSRO 缺一不可;
  • 真机验证闭环:从重建到 Unitree G1 人形机器人全身控制部署全链路打通。

局限性

  • 成功率仍有上限:复杂交互或多物体(>3 个)场景稳定性显著下降,Hard 档仅 13.92%;
  • 典型失败模式:人形与物体常"各自独立站立",未能保持有效交互;
  • 域偏差:DSRO 微调继承 MIDI 原始训练集与 HSIBench 采集的双重偏差,限制域外场景泛化;
  • 作者展望把框架作为低成本数据生产器:从 YouTube 级海量数据规模化精化运动,为大规模具身智能模型提供训练数据。

常见问题(FAQ)

HSImul3R 和 HSfM 的本质区别是什么?

HSfM 是首个未标定稀疏视图下的 3D HSI 重建方法,但只在 2D 图像空间做投影对齐;HSImul3R 把优化目标换成 3D 物理量(仿真稳定性),让物理仿真器作为主动监督者参与双向优化,因此产出能直接进仿真器、上真机。

DSRO 和 DSO 是什么关系?

DSO(Aligning 3D Generators with Simulation Feedback for Physical Soundness,ICCV 2025)是已有的用仿真反馈微调生成模型的方法;DSRO 是本文的改进:用稳定性标签 $l(x_0) \in {0,1}$ 加权扩散去噪损失(稳定样本负权重、不稳定样本正权重),LoRA 微调 MIDI,同时提升物理稳定性(SG 87.23% → 91.50%)与几何精度(CD 0.191 → 0.173)。

为什么 4 张视图就够用?

实验表明视图数从 4 增到 16,稳定性与穿透率几乎不变(Easy 53.68% → 55.16%),因为物理在环的优化信号来自仿真器反馈而非更多视角——生成式 3D 先验已经补足了稀疏视图缺失的结构信息。

HSIBench 评测的"稳定性-HSI"是怎么判定的?

三个准则同时满足:物体在重力下保持直立且物理稳定、重建场景在仿真器中达到稳定终态、终态保持真实接触(而非物体独立落地);每实例 15 个随机种子重跑,保证统计可靠性。

重建结果如何部署到真实机器人?

精化后的运动经 GMR 重定向到 Unitree G1,在 IsaacGym 中用扩散引导 RL 训练全身控制策略,再通过 Unitree SDK 部署到物理硬件——从重建到真机交互的完整链路均有验证。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐