摘要

本文解读 arXiv 2026 论文《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》。该论文提出物理在环的人-场景交互仿真就绪重建框架 HSImul3R,通过融合场景定向强化学习直接仿真奖励优化(DSRO)显式 3D 生成先验,把物理仿真器从事后检验者变成主动监督者,双向优化人体运动与场景几何,目标是让重建结果真正能放进物理引擎、直接支撑具身智能应用。其特别之处在于首次闭合了"重建→仿真→反馈→再重建"的回路,并配套发布包含 300 个交互实例的 HSIBench 基准。实验表明交互稳定率从 HSfM 的 10.52% 提升到 53.68%、场景穿透率从 69.51% 降至 22.9%,优化后的运动还能重定向到 Unitree G1 人形机器人真机部署,为物理 AI 与机器人学习提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions
标题(中文) 物理在环的人-场景交互仿真就绪重建
作者 Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu
机构 S-Lab, 南洋理工大学 (NTU) · 上海人工智能实验室 · ACE Robotics
会议 arXiv 2026
arXiv https://arxiv.org/abs/2603.15612
项目网站 https://yukangcao.github.io/HSImul3R/

背景与动机

具身智能要把智能体放进真实世界,而人-场景交互(HSI)重建是连接被动观察与主动部署的关键一环:从稀疏视图或单目视频重建出高保真的人与场景,可以为仿真训练提供可规模化、仿真就绪的数据。然而现有方法普遍存在感知-仿真鸿沟(perception-simulation gap)——视觉上合理的三维重建一旦放入物理引擎就会失稳,机器人把物体踢开、场景坍塌,根本无法支撑下游任务。

这一鸿沟源于三条技术路线的割裂:

  1. 3D 场景重建(NeRF、3D Gaussian Splatting、DUSt3R)优先环境几何,忽略人体动力学;
  2. 人体运动估计(4DHumans、ViTPose)在遮挡下鲁棒,但不建模物理接触与环境约束;
  3. 交互建模(BEHAVE、SMPLOlympics 等数据集驱动)规模有限且缺乏物理验证。

最近出现 HOSNeRF、HSfM 等统一框架,但都在 2D 图像空间优化对齐,几何与物理有效性仍然缺失。HSImul3R 的核心差异是:把优化目标从"图像对齐"换成"仿真稳定性"这个 3D 物理量,让仿真器全程参与重建。

研究主线:从问题到结论

HSImul3R 研究主线流程图:感知-仿真鸿沟到物理在环双向优化再到真机部署

图 1:HSImul3R 研究主线——从感知-仿真鸿沟出发,经物理在环双向优化,到 HSIBench 基准与真机部署。

基准/方法设计

HSImul3R 的第一阶段是重建与显式 3D 对齐:DUSt3R 恢复场景结构,SAM2 + 4DHumans + ViTPose 估计人体运动与 2D 关键点,再通过人体中心束调整与全局对齐统一坐标系。针对重建中的结构伪影(断连组件、缺失表面、非水密拓扑)与遮挡问题,作者引入显式 3D 结构先验:用 SAM 分割物体、预训练图像转 3D 生成模型(MIDI)合成高保真物体,并以接触/非接触两类损失精修人体与物体的相对位置,把穿透从源头压掉。

HSImul3R 物理在环重建流程:casual 拍摄输入到 Unitree G1 人形机器人部署

图 2:HSImul3R 流程与真实世界人形机器人部署——casual 拍摄 → 双向物理优化重建 → 迁移到 Unitree G1 人形机器人。

分类全景

HSImul3R 方法分类图:前向场景定向RL、反向DSRO、HSIBench数据

图 3:HSImul3R 方法分类全景——前向场景定向 RL、反向 DSRO、HSIBench 数据三足支撑。

方法细节

前向优化(Scene-targeted RL):在 IsaacGym 等物理仿真器中,用基于运动跟踪的强化学习优化人体运动,并加入场景定向监督信号——人体接触关键点 $k_j^h$ 到最近物体表面点 $\mu_i^o$ 的平均欧氏距离:

$\ell_{\text{scene}} = \frac{1}{N_{\text{contact}} N_{\text{surf}}} \sum_j \sum_i \lVert \mu_i^o - k_j^h \rVert_2^2$

这迫使仿真中的人形与物体保持物理上合理的接触,而不是把物体踢开。若物体与人体未接触,则用非接触损失拉近两者重心投影;接触时用带符号距离函数惩罚穿透深度。

反向优化(DSRO):即便前向优化到位,残缺几何(如缺腿的桌子)仍会让仿真失败。DSRO 把仿真反馈转成扩散模型的训练奖励:

$\ell_{\text{DSRO}} = -T \cdot \mathbb{E}[\, w(t)\,(1-2\,l(x_0))\,\lVert \epsilon - \epsilon_\theta(x_t, t) \rVert_2^2\,]$

稳定性标签 $l(x_0) \in {0, 1}$ 由三个判据决定:物体在重力下保持直立、场景达到稳定终态、交互产生真实接触。稳定样本获得负权重(强化),不稳定样本正权重(弱化),从而让生成模型学会"站得住"的几何。实现上以 LoRA rank 64、batch 1、学习率 $10^{-5}$、1800 步在 4 张 A100 上微调 MIDI。

HSImul3R 物理在环优化管线:3D 显式生成先验注入对齐 → 前向场景定向 RL → 反向 DSRO

图 4:HSImul3R 物理在环优化管线——显式 3D 生成先验注入对齐,前向场景定向 RL 优化人体运动,反向 DSRO 用仿真反馈微调场景几何。

实验设计与结果

HSIBench 基准:3 名志愿者(两男一女)、19 个物体(8 椅 + 3 桌 + 3 沙发)、300 个交互实例,每例 16 视角同步采集;多视角 2DGS 重建物体伪真值、SMPL 估计运动伪真值;按交互复杂度分为 Easy / Medium / Hard 三档。

HSIBench 数据集概览:多样椅子桌子沙发交互场景与仿真结果

图 5:HSIBench 数据集概览与仿真结果——覆盖 Easy/Medium/Hard 三档难度的稳定交互状态。

评测指标:穿透率 SP-3D(越低越好)、Stability-HSI(重力稳定 + 场景稳态 + 有效接触,越高越好)、仿真后运动质量 W-MPJPE / PA-MPJPE(越低越好)。

主结果表(HSI 重建与仿真)

方法 Stability Easy ↑ Stability Medium ↑ Stability Hard ↑ SP-3D ↓
HSfM 10.52 4.50 2.66 69.51
V1(HSfM+MIDI) 13.96 8.81 4.17 77.12
V2(无场景损失) 39.56 22.71 7.05
V3(中心点距离) 42.57 23.84 10.18
V4(无 DSRO) 29.56 16.62 5.17
HSImul3R(Ours) 53.68 30.56 13.92 22.90

图像转 3D 生成质量表(DSRO 微调对比)

方法 Stability Easy ↑ Stability Medium ↑ Stability Hard ↑ SG ↑ CD ↓ F-Score ↑
MIDI 29.56 16.62 5.17 79.19 0.198 81.95
DSO* 38.75 25.91 7.88 87.23 0.191 86.26
Ours 53.68 30.56 13.92 91.50 0.173 88.25

HSImul3R 与HSfM仿真对比:稳定的人-物体交互状态

图 6:与 HSfM 的仿真定性对比——HSfM 重建常把物体踢开、人独立站立;HSImul3R 保持稳定交互。

图像转3D生成对比:DSRO修正细长结构畸变

图 7:图像转 3D 生成对比(Ours vs DSO vs MIDI)——DSRO 修正桌腿缺失与遮挡导致的表面畸变。

场景定向损失消融:移除后机器人踢开物体

图 8:场景定向仿真损失消融——移除距离最小化项后人形动作夸张、踢开物体;加入后稳定接触。

真实世界部署:GMR重定向到Unitree G1人形机器人

图 9:真实世界部署——优化后的运动经 GMR 重定向到 Unitree G1,配合扩散引导强化学习训练全身控制策略并真机部署。

附录补充(输入视角数分析)

视角数 Stability Easy ↑ Stability Medium ↑ Stability Hard ↑ SP-3D ↓
16 视角 55.16 29.51 13.59 21.81
10 视角 52.93 32.17 13.03 21.00
4 视角 53.68 30.56 13.92 22.90

结果对比总结

HSImul3R结果对比总结:稳定率穿透率全面领先

图 10:结果对比总结——HSImul3R 在稳定率、穿透率、重力稳定性全面领先,并支撑真机部署。

关键发现

  1. 稳定率提升 5 倍以上:Easy 难度 Stability-HSI 从 HSfM 的 10.52% 提升到 53.68%,Medium/Hard 分别达到 30.56% 与 13.92%。
  2. 穿透率大幅下降:SP-3D 从 HSfM 的 69.51% 降至 22.90%,下降近 47 个百分点。
  3. 每个组件都有贡献:V2(无场景损失)39.56%、V3(中心点距离)42.57%、V4(无 DSRO)29.56%,均显著低于完整方法的 53.68%。
  4. 物体生成更稳更准:重力稳定性 SG 达 91.50%(MIDI 79.19%),Chamfer 距离 0.173、F-Score 88.25。
  5. 运动质量同步提升:W-MPJPE 4.09(HSfM 5.02)、PA-MPJPE 2.17(HSfM 2.79)。
  6. 稀疏视角即可用:4 视角与 16 视角的稳定性几乎持平(53.68% vs 55.16%),穿透率差异很小。

局限性

  • 复杂场景成功率不高:多物体(超过 3 个)或复杂交互下稳定率明显下降,Hard 档仅 13.92%。
  • 失败模式集中:失败时人形机器人与物体常各自独立静止,未形成有效交互。
  • 域外泛化受限:DSRO 微调继承了 MIDI 预训练数据与 HSIBench 采集的偏差。
  • 场景假设:单目视频扩展目前假设静态场景、人体是唯一运动实体。

作者展望:提升复杂交互成功率、覆盖可形变物体与动态场景,并把管线接入大规模网络视频数据,为具身智能模型提供训练数据。

常见问题(FAQ)

HSImul3R 解决了什么问题?

解决了"感知-仿真鸿沟":视觉上合理的 3D 重建放进物理引擎会失稳。HSImul3R 让物理仿真器作为主动监督者参与重建,双向优化人体运动与场景几何,产出仿真就绪(simulation-ready)的人-场景交互重建。

什么是物理在环双向优化?

前向用场景定向强化学习优化人体运动(接触距离奖励保证交互稳定);反向用直接仿真奖励优化(DSRO)把仿真反馈转成扩散模型奖励,微调图像转 3D 生成模型修正残缺几何。两个方向互为监督,形成闭环。

HSIBench 数据集有多大?

19 个物体(8 椅、3 桌、3 沙发)、3 名志愿者、300 个交互实例,每例 16 视角同步采集,按交互复杂度分为 Easy/Medium/Hard 三档,每例以 15 个随机种子重复运行仿真管线收集训练信号。

HSImul3R 效果比 HSfM 好多少?

Easy 难度交互稳定率从 10.52% 提升到 53.68%(约 5 倍),场景穿透率从 69.51% 降至 22.9%,运动质量 W-MPJPE 从 5.02 改善到 4.09。

重建结果能直接用于机器人吗?

能。优化后的运动经 GMR 重定向到 Unitree G1 人形机器人,配合扩散引导强化学习在 IsaacGym 中训练全身控制策略,并通过 Unitree SDK 成功部署到真实硬件。

需要多少输入视角?

4 个稀疏视角即可:4/10/16 视角下稳定性几乎持平(53.68% / 52.93% / 55.16%),更多视角只轻微改善运动质量,对稳定性与穿透影响很小。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐