【arXiv 2026】HSImul3R 论文解读:物理在环重建仿真就绪人-场景交互|从物理AI具身智能视角
摘要
本文解读 arXiv 2026 论文《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》。该论文提出物理在环的人-场景交互仿真就绪重建框架 HSImul3R,通过融合场景定向强化学习、直接仿真奖励优化(DSRO)与显式 3D 生成先验,把物理仿真器从事后检验者变成主动监督者,双向优化人体运动与场景几何,目标是让重建结果真正能放进物理引擎、直接支撑具身智能应用。其特别之处在于首次闭合了"重建→仿真→反馈→再重建"的回路,并配套发布包含 300 个交互实例的 HSIBench 基准。实验表明交互稳定率从 HSfM 的 10.52% 提升到 53.68%、场景穿透率从 69.51% 降至 22.9%,优化后的运动还能重定向到 Unitree G1 人形机器人真机部署,为物理 AI 与机器人学习提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions |
| 标题(中文) | 物理在环的人-场景交互仿真就绪重建 |
| 作者 | Yukang Cao, Haozhe Xie, Fangzhou Hong, Long Zhuo, Zhaoxi Chen, Liang Pan, Ziwei Liu |
| 机构 | S-Lab, 南洋理工大学 (NTU) · 上海人工智能实验室 · ACE Robotics |
| 会议 | arXiv 2026 |
| arXiv | https://arxiv.org/abs/2603.15612 |
| 项目网站 | https://yukangcao.github.io/HSImul3R/ |
背景与动机
具身智能要把智能体放进真实世界,而人-场景交互(HSI)重建是连接被动观察与主动部署的关键一环:从稀疏视图或单目视频重建出高保真的人与场景,可以为仿真训练提供可规模化、仿真就绪的数据。然而现有方法普遍存在感知-仿真鸿沟(perception-simulation gap)——视觉上合理的三维重建一旦放入物理引擎就会失稳,机器人把物体踢开、场景坍塌,根本无法支撑下游任务。
这一鸿沟源于三条技术路线的割裂:
- 3D 场景重建(NeRF、3D Gaussian Splatting、DUSt3R)优先环境几何,忽略人体动力学;
- 人体运动估计(4DHumans、ViTPose)在遮挡下鲁棒,但不建模物理接触与环境约束;
- 交互建模(BEHAVE、SMPLOlympics 等数据集驱动)规模有限且缺乏物理验证。
最近出现 HOSNeRF、HSfM 等统一框架,但都在 2D 图像空间优化对齐,几何与物理有效性仍然缺失。HSImul3R 的核心差异是:把优化目标从"图像对齐"换成"仿真稳定性"这个 3D 物理量,让仿真器全程参与重建。
研究主线:从问题到结论

图 1:HSImul3R 研究主线——从感知-仿真鸿沟出发,经物理在环双向优化,到 HSIBench 基准与真机部署。
基准/方法设计
HSImul3R 的第一阶段是重建与显式 3D 对齐:DUSt3R 恢复场景结构,SAM2 + 4DHumans + ViTPose 估计人体运动与 2D 关键点,再通过人体中心束调整与全局对齐统一坐标系。针对重建中的结构伪影(断连组件、缺失表面、非水密拓扑)与遮挡问题,作者引入显式 3D 结构先验:用 SAM 分割物体、预训练图像转 3D 生成模型(MIDI)合成高保真物体,并以接触/非接触两类损失精修人体与物体的相对位置,把穿透从源头压掉。

图 2:HSImul3R 流程与真实世界人形机器人部署——casual 拍摄 → 双向物理优化重建 → 迁移到 Unitree G1 人形机器人。
分类全景

图 3:HSImul3R 方法分类全景——前向场景定向 RL、反向 DSRO、HSIBench 数据三足支撑。
方法细节
前向优化(Scene-targeted RL):在 IsaacGym 等物理仿真器中,用基于运动跟踪的强化学习优化人体运动,并加入场景定向监督信号——人体接触关键点 $k_j^h$ 到最近物体表面点 $\mu_i^o$ 的平均欧氏距离:
$\ell_{\text{scene}} = \frac{1}{N_{\text{contact}} N_{\text{surf}}} \sum_j \sum_i \lVert \mu_i^o - k_j^h \rVert_2^2$
这迫使仿真中的人形与物体保持物理上合理的接触,而不是把物体踢开。若物体与人体未接触,则用非接触损失拉近两者重心投影;接触时用带符号距离函数惩罚穿透深度。
反向优化(DSRO):即便前向优化到位,残缺几何(如缺腿的桌子)仍会让仿真失败。DSRO 把仿真反馈转成扩散模型的训练奖励:
$\ell_{\text{DSRO}} = -T \cdot \mathbb{E}[\, w(t)\,(1-2\,l(x_0))\,\lVert \epsilon - \epsilon_\theta(x_t, t) \rVert_2^2\,]$
稳定性标签 $l(x_0) \in {0, 1}$ 由三个判据决定:物体在重力下保持直立、场景达到稳定终态、交互产生真实接触。稳定样本获得负权重(强化),不稳定样本正权重(弱化),从而让生成模型学会"站得住"的几何。实现上以 LoRA rank 64、batch 1、学习率 $10^{-5}$、1800 步在 4 张 A100 上微调 MIDI。

图 4:HSImul3R 物理在环优化管线——显式 3D 生成先验注入对齐,前向场景定向 RL 优化人体运动,反向 DSRO 用仿真反馈微调场景几何。
实验设计与结果
HSIBench 基准:3 名志愿者(两男一女)、19 个物体(8 椅 + 3 桌 + 3 沙发)、300 个交互实例,每例 16 视角同步采集;多视角 2DGS 重建物体伪真值、SMPL 估计运动伪真值;按交互复杂度分为 Easy / Medium / Hard 三档。

图 5:HSIBench 数据集概览与仿真结果——覆盖 Easy/Medium/Hard 三档难度的稳定交互状态。
评测指标:穿透率 SP-3D(越低越好)、Stability-HSI(重力稳定 + 场景稳态 + 有效接触,越高越好)、仿真后运动质量 W-MPJPE / PA-MPJPE(越低越好)。
主结果表(HSI 重建与仿真):
| 方法 | Stability Easy ↑ | Stability Medium ↑ | Stability Hard ↑ | SP-3D ↓ |
|---|---|---|---|---|
| HSfM | 10.52 | 4.50 | 2.66 | 69.51 |
| V1(HSfM+MIDI) | 13.96 | 8.81 | 4.17 | 77.12 |
| V2(无场景损失) | 39.56 | 22.71 | 7.05 | — |
| V3(中心点距离) | 42.57 | 23.84 | 10.18 | — |
| V4(无 DSRO) | 29.56 | 16.62 | 5.17 | — |
| HSImul3R(Ours) | 53.68 | 30.56 | 13.92 | 22.90 |
图像转 3D 生成质量表(DSRO 微调对比):
| 方法 | Stability Easy ↑ | Stability Medium ↑ | Stability Hard ↑ | SG ↑ | CD ↓ | F-Score ↑ |
|---|---|---|---|---|---|---|
| MIDI | 29.56 | 16.62 | 5.17 | 79.19 | 0.198 | 81.95 |
| DSO* | 38.75 | 25.91 | 7.88 | 87.23 | 0.191 | 86.26 |
| Ours | 53.68 | 30.56 | 13.92 | 91.50 | 0.173 | 88.25 |

图 6:与 HSfM 的仿真定性对比——HSfM 重建常把物体踢开、人独立站立;HSImul3R 保持稳定交互。

图 7:图像转 3D 生成对比(Ours vs DSO vs MIDI)——DSRO 修正桌腿缺失与遮挡导致的表面畸变。

图 8:场景定向仿真损失消融——移除距离最小化项后人形动作夸张、踢开物体;加入后稳定接触。

图 9:真实世界部署——优化后的运动经 GMR 重定向到 Unitree G1,配合扩散引导强化学习训练全身控制策略并真机部署。
附录补充(输入视角数分析):
| 视角数 | Stability Easy ↑ | Stability Medium ↑ | Stability Hard ↑ | SP-3D ↓ |
|---|---|---|---|---|
| 16 视角 | 55.16 | 29.51 | 13.59 | 21.81 |
| 10 视角 | 52.93 | 32.17 | 13.03 | 21.00 |
| 4 视角 | 53.68 | 30.56 | 13.92 | 22.90 |
结果对比总结

图 10:结果对比总结——HSImul3R 在稳定率、穿透率、重力稳定性全面领先,并支撑真机部署。
关键发现
- 稳定率提升 5 倍以上:Easy 难度 Stability-HSI 从 HSfM 的 10.52% 提升到 53.68%,Medium/Hard 分别达到 30.56% 与 13.92%。
- 穿透率大幅下降:SP-3D 从 HSfM 的 69.51% 降至 22.90%,下降近 47 个百分点。
- 每个组件都有贡献:V2(无场景损失)39.56%、V3(中心点距离)42.57%、V4(无 DSRO)29.56%,均显著低于完整方法的 53.68%。
- 物体生成更稳更准:重力稳定性 SG 达 91.50%(MIDI 79.19%),Chamfer 距离 0.173、F-Score 88.25。
- 运动质量同步提升:W-MPJPE 4.09(HSfM 5.02)、PA-MPJPE 2.17(HSfM 2.79)。
- 稀疏视角即可用:4 视角与 16 视角的稳定性几乎持平(53.68% vs 55.16%),穿透率差异很小。
局限性
- 复杂场景成功率不高:多物体(超过 3 个)或复杂交互下稳定率明显下降,Hard 档仅 13.92%。
- 失败模式集中:失败时人形机器人与物体常各自独立静止,未形成有效交互。
- 域外泛化受限:DSRO 微调继承了 MIDI 预训练数据与 HSIBench 采集的偏差。
- 场景假设:单目视频扩展目前假设静态场景、人体是唯一运动实体。
作者展望:提升复杂交互成功率、覆盖可形变物体与动态场景,并把管线接入大规模网络视频数据,为具身智能模型提供训练数据。
常见问题(FAQ)
HSImul3R 解决了什么问题?
解决了"感知-仿真鸿沟":视觉上合理的 3D 重建放进物理引擎会失稳。HSImul3R 让物理仿真器作为主动监督者参与重建,双向优化人体运动与场景几何,产出仿真就绪(simulation-ready)的人-场景交互重建。
什么是物理在环双向优化?
前向用场景定向强化学习优化人体运动(接触距离奖励保证交互稳定);反向用直接仿真奖励优化(DSRO)把仿真反馈转成扩散模型奖励,微调图像转 3D 生成模型修正残缺几何。两个方向互为监督,形成闭环。
HSIBench 数据集有多大?
19 个物体(8 椅、3 桌、3 沙发)、3 名志愿者、300 个交互实例,每例 16 视角同步采集,按交互复杂度分为 Easy/Medium/Hard 三档,每例以 15 个随机种子重复运行仿真管线收集训练信号。
HSImul3R 效果比 HSfM 好多少?
Easy 难度交互稳定率从 10.52% 提升到 53.68%(约 5 倍),场景穿透率从 69.51% 降至 22.9%,运动质量 W-MPJPE 从 5.02 改善到 4.09。
重建结果能直接用于机器人吗?
能。优化后的运动经 GMR 重定向到 Unitree G1 人形机器人,配合扩散引导强化学习在 IsaacGym 中训练全身控制策略,并通过 Unitree SDK 成功部署到真实硬件。
需要多少输入视角?
4 个稀疏视角即可:4/10/16 视角下稳定性几乎持平(53.68% / 52.93% / 55.16%),更多视角只轻微改善运动质量,对稳定性与穿透影响很小。
参考链接
- arXiv 论文页:HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions
- 项目网站:https://yukangcao.github.io/HSImul3R/
- 基线 HSfM:Reconstructing 3D Human-Scene Interactions from Sparse Views (CVPR 2025)
- 生成模型 MIDI:Image-to-3D Generation with Explicit 3D Priors (CVPR 2025)
- 重建基座 DUSt3R:DUSt3R: Geometric 3D Vision Made Easy (CVPR 2024)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)