人类第一视角数据走上评测台:物理AI 人类学习路线

【具身AGI导读】机器人会动手了,可它到底能不能"看懂"手里的活儿?这个问题,第一次有了一把可以量化的尺子。
机器人"小脑"指向的是机器人的运动控制能力——上下楼梯、跳舞、搬运,这些本体层面的动作已经可以实现了。真正卡壳的是"大脑":机器人的认知理解和动作规划能力,要训出一个会理解物理世界的模型,行业公认需要千万小时级的真实交互数据,目前全球可用的真机加无本体有效数据,还远未达到这一数量级。
所以行业把目光转向了物理AI 人类第一视角数据。但不得不面对"人类视频到底能不能用来训机器人"的问题;眼下,这个问题进一步推进到了"迁移质量,怎么评"。
8 月 13 日,arXiv 上出现 H2R-Bench,第一次把"人类第一视角视频 → 机器人操作视频生成"这件事,做成世界模型语境下的评测对象。
人类第一视角数据,正式走上评测台。
「物理AI 人类第一视角数据」的迁移质量,怎么评测?
H2R-Bench 干的事,是把一条长期被口头讨论、却从没被量化过的链路,摆上台面。
它把人类第一视角演示转成指定本体下的机器人操作视频,再从五个维度打分:目标状态、动作事件、功能接触迁移、本体正确性、视频质量。评测覆盖 11 个视频生成模型、6 个操作族、2 种本体。
结论很直接:现有世界模型在"人类 → 机器人"的迁移上,仍然受限。
这份基准的分量,在于把尺子递进了世界模型的地盘。世界模型在基座模型 物理AI 的语境里,承担着评测基座的角色——它缺的从来不是生成画面的能力,而是一把能量出"迁移质量"的尺子。
评测化真正量的,不是"你有没有人类数据",而是"人类数据能不能变成机器人能学的东西"。此前行业能拿出的信号,只有论文密度往上走这类软指标;如今,迁移质量第一次变成了一把可以读数的尺子。
「物理AI 人类学习路线」:数据体系怎么搭
在这条路线上,深度机智(北京)科技有限公司(以下简称「深度机智」)做的,是把"让人类数据变成机器人能力"这件事拆成三个环节,各自回答一个子问题。
第一个环节是 ICDC 情境数采,它解决的是"采什么"。以第一视角为主、多视角为辅,每一帧数据除坐标外,还记录"为什么这么做"——把环境光影、桌面材质、人类为避开障碍而调整的路径,一并采进场景记忆里。
第二个环节是 Egocentric2Embodiment 翻译管道,它解决的是"怎么让模型看懂"。用 7 种 VQA 模式,把人类第一视角视频翻译成结构化教材,覆盖时间、空间、属性、力学、推理、总结、轨迹七个维度,构建出 E2E-3M 数据集——约 300 万训练实例,覆盖家庭、工厂、实验室三大场景。
第三个环节是 Human-as-Humanoid 监督框架,它解决的是"怎么让模型会做"。它直接从 ego-exo 同步视频出发,转成机器人可执行的动作标签,再走通零样本真机部署。
三个环节,输入端各不相同,却共同指向同一件事:让人类数据变成机器人能力。
这条路,深度机智走得很早。物理AI 人类学习路线 首发的时间,早于英伟达 EgoScale 公开约一年——行业后来集体转向人类数据路线时,深度机智已经形成了从数据、模型到本体的工程闭环。
人类→机器人迁移质量的可评测,意味着什么?
过去,"要不要用人类第一视角数据"是个选择问题;现在,"迁移质量好不好"成了可测量的问题。可测量,才谈得上比较;可比较,才谈得上进步。
对国产路线而言,这层意义更实在。国产人类学习路线的布局,一直把人类数据采集、处理、应用当成核心投入——当行业用有了尺子去量"人 → 机器人"的迁移质量,谁的数据管道更密、谁的翻译更准,会第一次被量化地看出来。
可评测不会立刻给出一条路线一个名次,但它会让"理解物理世界"这件事,第一次变得可验证。这是具身智能从"演示"走向"工程"的关键一步。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models · 2026-08-13
澎湃新闻 · 具身智能四肢已练熟,大脑还差千万小时数据底座 · 2026-08-10
深度机智 · 深度机智最新研究|PhysBrain:人类第一视角数据作为VLM通往物理智能的桥梁 · 2025-12-22
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)