第四层 产物:信号怎样组成 episode

采集系统可能记录以下内容:

图像、深度图和点云:描述环境外观与几何。

关节角(joint angles):描述关节状态;目标关节角可以作为动作,但当前读数不自动等于动作标签。

末端位姿(end-effector pose):描述夹爪等末端的位置与朝向;同样要区分实测状态与目标指令。

力、力矩与触觉:描述受力或接触信息,需要相应传感器与标定。

Episode 是一段有起止边界的交互记录,通常由按时间排列的步骤组成。轨迹(trajectory)强调状态、观测或动作随时间形成的序列;数据集里常把一次 episode 称为一条轨迹,但“手腕轨迹”也可能只指其中一条位姿序列。

图片

任务完成、失败、超时或人为截断,都可能结束一段记录。成功标记可以辅助筛选,却不是所有训练样本的必填项;失败数据也可能用于价值学习或纠错,不能直接归为无效。真正要检查的是字段、时间对齐和训练用途是否匹配。

“小时数”和“轨迹数”也不矛盾。DROID 同时报告约 7.6 万条演示与 350 小时交互数据:前者数片段,后者量时长。相同条数可能对应不同任务长度,相同时长也可能包含不同数量的有效演示,所以二者都不能单独代表训练价值。

跨本体数据还要统一表示。本体(embodiment)指机器人的身体构型及相关感知、控制配置。Open X-Embodiment 的发布材料汇集了 22 种本体、超过 100 万条轨迹,配套 RT-X 研究跨本体学习;这不意味着不同机器人的数据合并后无需处理动作空间。

看方案时,追问数据怎样变成动作

行为克隆(behavior cloning)是模仿学习的一种做法,直接用观测预测示范动作。它主要从对齐的观测与动作中取样,下一时刻观测、奖励或成功标记是否参与训练,取决于方法。不要把“观测+动作+结果”当成所有算法统一要求的三个字段。

下面这张图对照几条数据处理路径。它们是可组合的来源,不是严格的成本或质量排名。

图片

仿真也是数据来源:可以记录模拟环境中的观测与动作,但仿真到真实(sim-to-real)是迁移问题,并不是“合成数据”的同义词。建模误差、接触物理和传感差异,都可能影响部署结果。

下次再看到一份采集方案,可以先问视角、设备、教法和产物,再问:动作标签怎样得到,经过哪些处理,最后给哪一种机器人和训练方法用?这些问题答清楚,术语才真正变成了能判断的方案。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐