Ego数据处理管线 for 具身操作
EgoSmith 数据处理管线(数据流)
依据:
ref_paper/EgoSteerv1+egosmith
范围:只讲数据过滤与 4D/标注主路径,按数据流向自上而下。
数据过滤流示意图
1. Pre-filtering:丢掉不适合重建的片段
两道门一起判;连续 ≥3 帧不合格才剪掉,单帧闪一下放过。
走路 / 大幅头动(camera gate)
稀疏光流:每帧取 128 个网格点,用金字塔 Lucas–Kanade 追回 15 帧前;RANSAC 拟合相似变换,看平移量。平移超过图像长边的 10% → 判不合格(走路/甩头)。
遮挡 / 无手 / 路人手(hand gate)
YOLO 检手,框要同时满足:conf ≥ 0.30;面积在画面 2%–50%;与下中部 ROI(横 [0.075,0.925]、纵 [0.075,1.0])相交。一帧至少 2 个合格手才过关——没手、被挡、只有远处旁人手都会掉。
留下的片段:相机相对稳 + 双手清晰可见。
2. 4D Motion Estimation:造度量世界系手轨迹
数据流是三段拼起来:
- 手(相机系):HaWoR 的 ViT,对检测裁剪后的手做时序窗回归 → MANO 姿态/形状 + 相机系根平移。
- 相机(无尺度轨迹):DPVO 替代原 HaWoR 的 DROID-SLAM → 得到 up-to-scale 的相机位姿 + 焦距。
- 尺度(变成米制):Any4D 出逐帧度量深度;窗口间做 scale 对齐;在背景像素上算
s = median(D_Any4D / D_DPVO),用s把 DPVO 轨迹拉到真实尺度。
最后用度量相机位姿,把相机系手关节变到世界系:
x_world = Rᵀ (x_cam − p)。
输出:世界系双手状态/动作、内外参、MANO、度量深度。
3. Language Labeling:语义过滤 + 五层指令
Qwen3.5-VL-Plus 先砍掉「启发式过了但没有有效手–物操作」的 clip(约再丢 3.5%);留下的生成 粗→细五级 语言指令(任务语义 + 动作时空描述)。
4. Post-filtering:重建结果质检(粗→细)
Episode:本段相机平移/旋转统计 vs 同数据集分布;落在 [Q1−2.5·IQR, Q3+2.5·IQR] 外 → 整段丢(追漂、仍像走路/东张西望)。
Chunk:滑窗(约过去 5s + 未来 30 帧)里,腕相对相机、指相对腕;再套同款 IQR,并卡 1.5 m 物理上限;任一窗违规 → 整 episode 丢。
Frame:邻帧增量硬阈值——相机平移 ≤0.20 m、腕/指 ≤0.30 m、相机转 ≤28°、腕转 ≤41°;超了当重建跳变,整段丢。
5. 导出
过检样本打成 WebDataset:图像 + lowdim/动作 + MANO + meta(+可选深度)+ 多粒度指令,供后续 VLA 预训。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)