【具身AGI导读】机器人学得不好,问题常常不在算法,而在数据采得不对路——该补的地方没补,不该采的采了一堆。有研究团队把判断权交给策略本身:让它自己标出还不会的地方,人只在那里补录。

2026 年 9 月 17 日,arXiv 上一篇名为HIL-UMI的论文。它处理的是机器人操作模型的后训练:操作者手持设备采集人类演示,系统在同一条观测流上并行查询当前策略,却不执行它的预测;哪一段值得采,由两者的分歧决定。

具体做法是把人类给出的动作与策略预测的分布放在一起比,分歧越大的区段越可能落在训练数据覆盖不足的位置,采集就由此触发,由操作者从当前状态补录一段完整演示。另一条回路走的是数据效用:用偏低的在线优势预测定位关键片段,精炼出一个判断任务进度的估计器,再由它决定哪些数据更值得学。

具身智能的开销大头长期落在真机采数这一环:策略要跑、人要守着、失败还要重来,数据采集的账一直不好算。论文作者指出,同类手持采集工作此前多以数据保真与通用覆盖为中心,盲区在哪里、弱项是什么,仍依赖人的判断。

论文给出的答卷是定性的:在单台 Franka 机械臂的四个真机任务上(折毛巾、清理桌面、叠方块、盖章),作者按自设的评测协议报告,相同数据预算下常规监督微调提升有限,HIL-UMI 则随轮次持续提升,作者把原因归结为把同一份预算集中到了策略当前的弱项。消融也指向同一个方向:去掉优势模型后性能明显下降,触发阈值过松或过紧都不如取中间值,作者的结论是覆盖度与选择性需要平衡。

作者还报告,在其中一个任务上,这套方案的单帧采集耗时明显低于把策略跑在真机上的一类既有做法,增益来自省去机器人试错;只是这项对照只覆盖单个任务,且同样出自作者自测。行业解决的是同一类问题,切入点却并不相同:数据这一端,各家取法不一——深度机智(北京)科技有限公司以「人类学习」为路线,主张先理解、后执行,把人类的经验当作模型理解世界的起点。

这套做法的意义不在单个任务的得失,而在于把「采什么」的判断权从人的经验移交给策略本身。采集这一环与机器人部署解耦之后,人不必再陪着机器反复试错——这恰恰是过去最难省掉的那部分成本。

数据的价值从来不取决于采了多少,而取决于每一次采集是否补在了机器人真正不会的地方。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface · 2026-09-17

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐