【无标题】
Franka机器人赋能模型训练——PHRVLA:面向视觉语言动作模型的规划时域推理框架
在机器人操作领域,视觉语言动作模型(VLA)能够依托语言指令与视觉观测输出机器人动作,为通用机器人操控提供可行路径。但现有多数 VLA 模型偏向反应式决策,仅依据当前时刻画面输出动作,缺少对未来任务动态变化的显式推理能力,在接触交互丰富的精细拆装、装配类任务中存在性能短板。PHRVLA 便是针对该痛点提出的训练辅助框架,为 VLA 模型引入规划时域推理能力。
Franka机器人赋能模型训练——PHRVLA:面向视觉语
项目核心思路

图 1:PHRVLA 框架。
PHRVLA 的核心创新在于仅在训练阶段引入未来动态的隐式监督信号,推理阶段不增加额外计算开销。
该框架以 SmolVLA 作为基础 VLA 策略,增设轻量化辅助 Future Head 头网络。训练过程中,利用演示数据里规划时域范围内的未来图像帧,通过冻结的视觉编码器提取场景隐变量动态特征。
模型联合优化标准 VLA 损失与对齐损失,让 VLA 内部表征和未来场景动态隐变量完成对齐,引导模型学习预判后续场景变化。
在实际部署推理时,辅助头网络与额外编码器直接舍弃,沿用原始 VLA 的推理链路,不会带来时延与内存负担。
研究团队从相机视角、特征粒度、编码器选型、损失权重等多个维度开展消融实验。实验表明,腕部相机的块级隐动态监督可以带来较为可观的性能增益;相较于直接监督绝对视觉特征,监督场景特征变化量的效果表现更好。

图 2:方法总览。
Franka Emika Panda(Franka Research 3)机器人在项目中的作用
Franka Research 3(文中为 Franka Emika Panda)7 自由度机械臂是本项目真实世界实验的硬件载体,承担实物验证的关键作用。

真实任务执行载体:仿真环境 LIBERO、MetaWorld 仅能完成模拟任务测试,机器人硬件用来搭建接触密集的实物拆装任务集,一共设计 4 套不同形式的拆装作业,包含按压解锁、轴体拔取、滑动抽离、旋转拆卸等操作,这些任务需要精细的力位协同控制,用来检验模型从仿真迁移到现实场景的表现。
多模态数据采集平台:机械臂搭载腕部相机与第三方固定 RGB 相机,配合遥操作方式采集真实世界演示数据集。每套任务收集 100 组人工示教样本,同步记录图像、机器人本体感知状态、语言指令,全部数据流以 10Hz 完成时间对齐,为 PHRVLA 提供真实场景的训练素材。
模型效果的实物验证:在实物拆装测试中,基于 Franka 机械臂开展多组对照。基线 SmolVLA 实物任务成功率为 63.3%,经过 PHRVLA 优化后提升至 82.5%。不同任务下,模型在旋转拆卸这类高难度任务上的提升尤为明显,证实规划时域隐动态监督可以改善现实机器人精细操作能力。
结语:
PHRVLA 属于训练阶段的辅助优化目标,并不是推理阶段的规划器,不会在测试阶段修正策略输出。未来可以结合触觉、力觉信息拓展监督信号,围绕物体为中心构建块级监督,进一步提升机器人复杂操作表现。
项目详情:
PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)