参考文献:从零开始构建愿景-语言-行动模型

漫谈具身智能(1):VLA 简史 - 知乎

VLA:动作-语言-行动模型

一:实验目标:

利用机械臂将红色方块移到绿色方块的位置

二:模型核心组件:

- `models/encoders.py` — 图像、文本和机器人状态的编码器

- `models/fusion.py` — 使用 MLP 融合视觉-语言-动作嵌入

- `models/diffusion_head.py` — 使用扩散策略生成动作,核心功能是去噪声

- `models/vla_diffusion_policy.py` — 将以上所有组件组合在一起
包含部件:vision encoder,language encoder,state encoder

三:实验步骤

准备阶段:仿真环境下执行

第一步:采集数据,借助虚拟camera采集虚拟环境下的各方位图像

第二步:训练模型:用到三种编码器

第三步:测试模型并生成视频

#第一步
python -m scripts.collect_data --episodes 50 --output-path data/dataset.npz
#第二步
python -m scripts.train --dataset-path data/dataset.npz --epochs 50 --batch-size 32 --save-path checkpoints/model_trained.pt --device cpu
#第三步
python -m scripts.test --checkpoint checkpoints/model_big_final.pt --env-name push-v3 --episodes 5 --max-steps 150 --instruction "push the object to the goal" --device cpu --save-video --video-dir videos_test

微调:核心参数:lr,batch-size,epochs

衡量标准:reward大小,仿真视频执行任务的情况

将提取数据和训练的epoch数改为200

得到的reward值显著提高到800,观看视频也可以明显发现机械臂的动作变得更精准,

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐