所有具身智能大脑小脑的训练,都绕不开一个原点:数据

image.png

但你可能没细想过,一个来自真实物理世界交互的具身数据样本,到底长什么样?

它从来不是单一信号。

具身智能的一个有效样本,从来不是一个时刻一张图。它是一个时刻,捆着四五种完全不同的信号:

  • 表面肌电信号(sEMG):腕带上读肌肉活动,动作还没发生,信号已经先到了。它告诉你"想干什么"。

  • 头戴式第一人称视频:人在看什么,手在做什么,它告诉你"面对什么"。

  • 光学动捕:每只手贴几十个反光点,亚毫米精度告诉你手在三维空间里每一帧的位置和角度。它告诉你"在哪里、做什么动作"。

  • IMU惯性数据:加速度、角速度,捕捉突发运动和姿态变化。

  • RGB-D深度图:物体距离、深度层次,补全空间信息。

图片

每一种信号单独拿出来都有用。

但真正让具身智能模型学会"理解动作"的,是它们发生在同一时刻,并且时间戳严格对齐。

一个伸手动作,EMG(表面肌电信号surface Electromyography) 提前几百毫秒就发出了肌肉激活信号,动捕记录的是手在空间中的运动轨迹,头戴视频记录的是视角变化和交互对象。这几种信号叠加在一起,机器人才能完整理解“为什么伸手、怎么伸手、伸向哪里”。

但现实情况是,这几种数据来自不同的传感器和采集硬件,各跑各的时钟、各存各的格式,录制完了才发现时间轴对不上,几堆数据互相不认。

采集很难,采集对齐的多模态数据更难!

清华大学席子恒作为第一作者发表的EgoEMG这篇论文,做的就是这件事。

image.png

今年5月,清华大学自动化系席子恒在arXiv上公开了一篇论文《EgoEMG:A Multimodal Egocentric Dataset with Bilateral EMG and Vision for Hand Pose Estimation》。

这个数据集的名字已经说明了一切:

Egocentric(第一人称视角)+ EMG(肌电信号)。

研究人员对 41个人同步采集了五种模态的数据:

- 双侧腕带EMG(16通道,2kHz采样)

- IMU数据(120Hz)

- 头戴式第一人称RGB视频

- 外部RGB-D视频

- FZMotion光学运动捕捉数据(用于姿态标注)

最终重建出包含22个自由度的手部关节角标签,覆盖60类手势,累计采集时长超过10小时。

图片

FZMOTION

动捕数据,是整个数据集的“骨架”

说到这里,不得不提的一个细节。

EgoEMG里所有的手部姿态标签,也就是让模型学习的“标准答案”全部来自FZMotion光学运动捕捉系统。

团队设计了一套基于学习的markers2mano流水线,将动捕标记点位置转换为MANO手部模型参数。

相比此前EMG2Pose数据集采用的逐帧逆运动学求解器(报告无效帧率12.7%),EgoEMG的学习式重建将无效帧率降至3.6%,整体降幅超过3.5倍。

重建后MANO网格与标记点的平均对齐误差仅为4.3毫米。

换句话说:没有高精度的动捕数据,就没有EgoEMG的高质量姿态标签。

视觉图像只能给你“看起来像什么”,EMG信号只能给你“肌肉在干什么”,但动捕数据给你的是一只手在三维空间里精确到毫米的位置和角度,这是所有其他模态的“锚点”,是整个数据集的ground truth。

图片

FZMotion光学运动捕捉系统做了什么?

在EgoEMG的采集设置中,每只手贴了21个反光标记点,FZMotion光学动捕系统以120Hz的帧率实时追踪这些标记点的三维空间轨迹。

  • 亚毫米级的定位精度,保证了每一帧手部姿态标签的准确性。

  • 多模态时间同步能力,保证了EMG信号、视频帧和动捕数据能在同一时间轴上严格对齐。

  • 高帧率实时追踪,保证了快速手势动作也能被完整记录,不会丢帧。

image.png

这些能力叠加在一起,才让EgoEMG成为了业界首个同时提供肌电、视觉、深度、运动四种模态、且全部时间同步的公开手部姿态数据集。

说回正题

无论是具身智能的哪种训练范式,模仿学习、遥操作,还是基于大模型的跨本体动作迁移、无本体采集,它们都有一个共同的底层需求:足够准确、足够丰富的多模态数据。

而这个需求,最终都指向同一个问题:数据从哪来?精度和同步怎么保证?"

靠视觉估?精度不够,遮挡就崩。

靠传感器猜?没有绝对坐标,误差累积。

只有光学动捕,能给你亚毫米级、带绝对空间坐标的ground truth。

图片

EgoEMG这篇论文,用41个人、10小时、60种手势的实际数据证明了一件事:高质量的多模态具身数据集,底座一定是高精度的动捕系统。

从0到1搭建一套多模态采集系统,耗时、费力、容易踩坑。EgoEMG给出的标准答案:高精度动捕系统,是所有多模态数据的底座。

FZMotion,就是这套底座。

元客视界,已经为你准备好了。

论文链接:

https://arxiv.org/abs/2605.05712 

数据已开源,欢迎下载使用。

https://github.com/zhenqis123/EgoEMG

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐