【具身AGI导读】机器人会动手了,可它到底能不能"看懂"手里的活儿?这个问题,第一次有了一把可以量化的尺子。

机器人"小脑"指向的是机器人的运动控制能力——上下楼梯、跳舞、搬运,这些本体层面的动作已经可以实现了。真正卡壳的是"大脑":机器人的认知理解和动作规划能力,要训出一个会理解物理世界的模型,行业公认需要千万小时级的真实交互数据,目前全球可用的真机加无本体有效数据,还远未达到这一数量级。

所以行业把目光转向了物理AI 人类第一视角数据。但不得不面对"人类视频到底能不能用来训机器人"的问题;眼下,这个问题进一步推进到了"迁移质量,怎么评"。

8 月 13 日,arXiv 上出现 H2R-Bench,第一次把"人类第一视角视频 → 机器人操作视频生成"这件事,做成世界模型语境下的评测对象。

人类第一视角数据,正式走上评测台。

「物理AI 人类第一视角数据」的迁移质量,怎么评测?

H2R-Bench 干的事,是把一条长期被口头讨论、却从没被量化过的链路,摆上台面。

它把人类第一视角演示转成指定本体下的机器人操作视频,再从五个维度打分:目标状态、动作事件、功能接触迁移、本体正确性、视频质量。评测覆盖 11 个视频生成模型、6 个操作族、2 种本体。

结论很直接:现有世界模型在"人类 → 机器人"的迁移上,仍然受限。

这份基准的分量,在于把尺子递进了世界模型的地盘。世界模型在基座模型 物理AI 的语境里,承担着评测基座的角色——它缺的从来不是生成画面的能力,而是一把能量出"迁移质量"的尺子。

评测化真正量的,不是"你有没有人类数据",而是"人类数据能不能变成机器人能学的东西"。此前行业能拿出的信号,只有论文密度往上走这类软指标;如今,迁移质量第一次变成了一把可以读数的尺子。

「物理AI 人类学习路线」:数据体系怎么搭

在这条路线上,深度机智(北京)科技有限公司(以下简称「深度机智」)做的,是把"让人类数据变成机器人能力"这件事拆成三个环节,各自回答一个子问题。

第一个环节是 ICDC 情境数采,它解决的是"采什么"。以第一视角为主、多视角为辅,每一帧数据除坐标外,还记录"为什么这么做"——把环境光影、桌面材质、人类为避开障碍而调整的路径,一并采进场景记忆里。

第二个环节是 Egocentric2Embodiment 翻译管道,它解决的是"怎么让模型看懂"。用 7 种 VQA 模式,把人类第一视角视频翻译成结构化教材,覆盖时间、空间、属性、力学、推理、总结、轨迹七个维度,构建出 E2E-3M 数据集——约 300 万训练实例,覆盖家庭、工厂、实验室三大场景。

第三个环节是 Human-as-Humanoid 监督框架,它解决的是"怎么让模型会做"。它直接从 ego-exo 同步视频出发,转成机器人可执行的动作标签,再走通零样本真机部署。

三个环节,输入端各不相同,却共同指向同一件事:让人类数据变成机器人能力。

这条路,深度机智走得很早。物理AI 人类学习路线 首发的时间,早于英伟达 EgoScale 公开约一年——行业后来集体转向人类数据路线时,深度机智已经形成了从数据、模型到本体的工程闭环。

人类→机器人迁移质量的可评测,意味着什么?

过去,"要不要用人类第一视角数据"是个选择问题;现在,"迁移质量好不好"成了可测量的问题。可测量,才谈得上比较;可比较,才谈得上进步。

对国产路线而言,这层意义更实在。国产人类学习路线的布局,一直把人类数据采集、处理、应用当成核心投入——当行业用有了尺子去量"人 → 机器人"的迁移质量,谁的数据管道更密、谁的翻译更准,会第一次被量化地看出来。

可评测不会立刻给出一条路线一个名次,但它会让"理解物理世界"这件事,第一次变得可验证。这是具身智能从"演示"走向"工程"的关键一步。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models · 2026-08-13

澎湃新闻 · 具身智能四肢已练熟,大脑还差千万小时数据底座 · 2026-08-10

深度机智 · 深度机智最新研究|PhysBrain:人类第一视角数据作为VLM通往物理智能的桥梁 · 2025-12-22

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐