日期:2026-09-02


2. SmolVLA 与 LeRobot 定位

2.1 SmolVLA

SmolVLA 是面向机器人操作任务的轻量级 Vision-Language-Action 模型。

典型输入:

RGB Camera
+
Robot State
+
Language Instruction

输出:

Action Chunk

抽象表示:

        Front Camera ─────┐
                         │
        Wrist Camera ─────┤
                         │
        Robot State ──────┼──→ SmolVLA ──→ Action Chunk
                         │
        Language ─────────┘

相比单步策略:

obs_t → action_t

SmolVLA 更接近:

obs_t → [action_t, action_t+1, ..., action_t+N]

因此 Action Chunking 能减少模型推理频率,但会引入一个新的工程问题:

模型预测频率、机器人执行频率和 Action Chunk 长度必须协调。


2.2 LeRobot

LeRobot 在整个系统中承担:

  • Robot Dataset 统一格式;
  • 摄像头 / Robot State / Action 数据组织;
  • Policy 接口;
  • SmolVLA / ACT 等策略训练;
  • Checkpoint 管理;
  • 仿真环境接入;
  • Evaluation;
  • 真机数据采集;
  • 模型推理。

推荐把 LeRobot 当成:

              LeRobot
                 │
   ┌─────────────┼─────────────┐
   │             │             │
Dataset       Policy        Robot I/O
   │             │             │
   └─────────────┼─────────────┘
                 │
              Evaluation

而不是把它当成单独的“VLA 模型仓库”。


3. 推荐总体架构

3.1 开发阶段架构

┌────────────────────────────────────────────────┐
│                 Training PC                    │
│                                                │
│   LeRobotDataset                               │
│         │                                      │
│         ▼                                      │
│   SmolVLA Fine-tune                            │
│         │                                      │
│         ▼                                      │
│   checkpoint / pretrained_model                │
│         │                                      │
│         ▼                                      │
│   lerobot-eval                                 │
└─────────┬──────────────────────────────────────┘
          │
          ▼
┌────────────────────────────────────────────────┐
│             MuJoCo / gym-aloha                 │
│                                                │
│ Camera → Observation → Policy → Action         │
│                ↑                    │           │
│                └──── Environment ───┘           │
└────────────────────────────────────────────────┘

3.2 真机部署架构

推荐:

Camera Drivers
     │
     ├──── Front RGB
     ├──── Wrist RGB
     └──── Optional Side RGB
     │
     ▼
Sensor Synchronizer
     │
     ├────────── Joint State
     └────────── Task Instruction
                 │
                 ▼
          SmolVLA Policy Node
                 │
            Action Chunk
                 │
                 ▼
        Action Postprocessor
                 │
       ┌─────────┼──────────┐
       │         │          │
 Joint Limit  Velocity    Workspace
   Check       Limit        Check
       │         │          │
       └─────────┼──────────┘
                 │
                 ▼
          Trajectory Buffer
                 │
                 ▼
      ros2_control / MoveIt 2
                 │
                 ▼
            Robot Driver
                 │
                 ▼
              Robot

重要:

SmolVLA
   ≠
Safety Controller

VLA 输出必须经过独立安全层。


4. 推荐验证阶段

建议划分为 7 个阶段。

阶段内容是否控制真机
P0软件环境 / 模型 Smoke Test
P1Dataset 离线验证
P2SmolVLA 离线推理
P3ALOHA 仿真闭环
P4ROS 2 Replay / Shadow Mode
P5真机低速闭环
P6正式任务闭环与长期回归

最终:

P0 → P1 → P2 → P3 → P4 → P5 → P6

任何阶段未通过,都不建议直接跳到下一阶段。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐