近期,一支由多所高校与研究机构组成的联合团队提出了一套面向移动操作任务的视觉-语言-动作(VLA)模型训练框架,旨在解决移动机器人在大范围空间中执行多阶段操作任务时面临的数据采集与感知难题。

移动操作要求机器人同时控制移动底盘与机械臂,并在运动过程中持续感知环境。传统遥操作系统通常将底盘与手臂的控制分开,操作者需同时操作多个设备,采集效率偏低。研究团队开发了一套全身遥操作系统,操作者仅需穿戴VR头显与手柄、腰部和脚踝追踪器,系统即可通过通用运动重映射算法将人体姿态实时转换为轮式双臂机器人的底盘速度、手臂关节角度和夹爪指令,实现了自然、协调的全身控制。基于该系统,团队采集了约5.5小时、800条真实环境演示轨迹,同步记录了局部视角图像、360度全景图像、机器人状态与动作数据。

针对全景图像与常规视觉编码器之间的差异,研究团队设计了PanoVLA模型。该模型采用混合专家变换器架构,在原有局部视觉-语言处理模块之外,增设全景编码器与全景专家模块,专门提取全景图像中的空间布局信息,并与语言指令和机器人状态融合后用于动作生成。实验在四项真实移动操作任务上进行,包括移动笔、移动积木、拉开窗帘和擦拭长桌。结果表明,PanoVLA的阶段完成率达91.3%,端到端成功率达73.4%,明显优于仅使用局部视角的对比模型(58.6%和30.0%),验证了全景空间信息对移动操作任务中目标搜索、多阶段状态跟踪与闭环控制的关键作用。该研究为移动机器人在开放环境中的操作学习提供了可扩展的技术路径。

参考文献:Yang, D., Chen, H., Chen, X., Liu, L., Li, M., Tu, C., Xu, K., Ma, X., & Liu, S. (2026).Learning panorama-aware VLA for mobile manipulation with whole-body teleoperation. arXiv.

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐