《VLA 系列》VLA + 灵巧手方案技术解析 :七大方案的架构、数据与落地要点
面向 VLA + 灵巧手方案的盘点和分析,覆盖 7 种方案:GR00T N1.7、DexGraspVLA、Dexora、LingBot-VLA 2.0、GR-Dexter、Being-H0.5、HEX。
从双系统到端到端,从 2 千条演示到 6 万小时数据,七条技术路线的架构选择、数据配方与落地陷阱,一篇文章理清 VLA + 灵巧手的当前版图与选型逻辑。
一、方案总览
七家机构,七种答案。下表先呈现全貌,差异集中体现在架构形态、动作空间与数据来源三个维度,这也是后文展开的线索。
| 方案 | 机构 / 发布 | 参数量 | 核心架构 | 灵巧手 / 动作空间 | 训练数据 | 开源状态 |
|---|---|---|---|---|---|---|
| GR00T N1.7 | NVIDIA GEAR / 2026-04(EA) | 3B | 双系统 Action Cascade:Cosmos-Reason2-2B(Qwen3-VL 架构)VLM + 32 层 DiT 动作头 |
跨本体统一相对末端位姿空间,支持 22-DoF 手指级控制 | 数千小时遥操作 + 20,854 小时第一视角人类视频(EgoScale) | ✅ 权重+代码 |
| Dexora | 清华 / BAAI / 北大等 / 2026-05(ICRA 2026) | 0.4B–1B(DiT 策略) | 单网络端到端:SigLIP/T5 编码 + RDT 风格 Diffusion Transformer + 判别器质量加权训练 |
双臂 AIRBOT(6-DoF×2)+ 双手 XHAND(12-DoF×2),共 36 可控 DoF | 100K 仿真轨迹(6.5M 帧)+ 10K+ 真机遥操作(2.92M 帧) | ✅ 全栈(代码+数据+权重) |
| LingBot-VLA 2.0 | 蚂蚁灵波(Robbyant)/ 2026-07 | 6B(Qwen3-VL-4B 主干 + MoE 动作专家) | 统一动作空间 + 动作专家 MoE(无损负载均衡)+ 双查询蒸馏(深度+视频教师) |
统一动作空间覆盖头/腰/底盘/灵巧手(Hand 6D 等语义槽位) | 60,000 小时:50K 真机(20 种构型、17 品牌)+ 10K 第一视角人类视频 | ✅ 权重+代码+后训练版 |
| DexGraspVLA | 北大 + 灵初智能 / 2025-02(AAAI’26 Oral) | VLM 冻结 + 轻量 DiT | 分层式:冻结 VLM 规划器 + SAM/Cutie 掩码跟踪 + DINOv2 特征 + DiT 扩散控制器 |
RealMan RM75 臂 + PsiBot G0-R 6-DoF 手 | 2,094 条人工遥操作抓取演示 | ✅ 代码+控制器权重(硬件驱动代码未开) |
| GR-Dexter | 字节跳动 Seed / 2025-12 | 4B | GR-3 同款 Mixture-of-Transformer VLA,联合训练 VL/跨本体/人类轨迹 |
ByteDexter V2(21-DoF,指尖压阻触觉),动作含手指关节+指尖位置 | 双臂遥操作 + 跨本体数据集(ActionNet/白虎/RoboMIND)+ VR 人类轨迹 | ❌ 仅技术报告 |
| Being-H0.5 | BeingBeyond / 2026-01 | 未公开(InternVL-3.5 初始化) | Mixture-of-Transformers + Mixture-of-Flow 动作专家 + 统一状态-动作空间 |
物理语义对齐的统一槽位空间,MANO 人手作为"广义本体"映射进同一空间 | UniHand-2.0:35,000+ 小时,30 种本体 | ✅ 权重+部分数据 |
| HEX | 北京人形创新中心等 / 2026-04 | 2.4B | Qwen3-VL-2B + MoE 统一本体感知预测器(UPP)+ 流匹配动作头(高层 VLA + 低层 RL 全身控制器) |
人形对齐通用状态表征(按身体部位槽位),直接输出臂/手/腰动作,腿部交低层 RL | 12M+ 帧、7 种人形本体、4 个数据源 | ⚠️ 代码+权重已开,数采管线与底层控制器未开 |
顺着这张表往下看,几条贯穿性的脉络逐渐清晰:
- 双系统与端到端的分野。GR00T N1.7、DexGraspVLA、HEX 走的是"慢思考、快执行"的分层路线;Dexora、LingBot-VLA 2.0、Being-H0.5、GR-Dexter 则更接近单网络端到端,VLM 与动作专家共享注意力主干。
- 动作空间是灵巧手的关键一跃。高自由度手指让动作维度从夹爪的 7–14 维膨胀到 36–88 维,主流解法有两类:统一语义槽位(LingBot、Being-H0.5、HEX),以及物理对齐的重定向(GR-Dexter 的指尖对齐、GR00T 的相对末端位姿)。
- 数据来源决定泛化上限。各家都在遥操作之外另辟蹊径:人类第一视角视频(GR00T EgoScale、Being-H0.5 UniHand、LingBot)、仿真合成(Dexora)、跨本体公开数据集(HEX、GR-Dexter)。
- 生成式动作头已成共识。七家不约而同地使用 Diffusion 或 Flow Matching 生成连续动作块,真正的差别在去噪步数、条件注入方式与异步执行策略。
二、论文 / 项目 / 开源地址汇总
| 方案 | 论文 | 项目页 | 开源地址 |
|---|---|---|---|
| GR00T N1.7 | GR00T N1 白皮书 arXiv:2503.14734(架构基础;N1.7 无单独论文) | NVIDIA Isaac GR00T | GitHub: NVIDIA/Isaac-GR00T |
| DexGraspVLA | arXiv:2502.20900 | dexgraspvla.github.io | GitHub: Psi-Robot/DexGraspVLA |
| Dexora | arXiv:2605.18722 | dexoravla.github.io | GitHub: dexoravla/Dexora;数据集: HF Dexora/Dexora_Real-World_Dataset |
| LingBot-VLA 2.0 | arXiv:2607.06403 | technology.robbyant.com/lingbot-vla-v2 | GitHub: Robbyant/lingbot-vla-v2;权重 robbyant/lingbot-vla-v2-6b(HF / ModelScope) |
| GR-Dexter | arXiv:2512.24210 技术报告 | byte-dexter.github.io/gr-dexter | 无 |
| Being-H0.5 | arXiv:2601.12993 | research.beingbeyond.com/being-h05 | GitHub: BeingBeyond/Being-H(含 H0.5 训练/推理代码、HF 权重、UniHand_Preview 数据) |
| HEX | arXiv:2604.07993 | —(北京人形官网新闻) | GitHub: Open-X-Humanoid/HEX(含 2.4B 权重与评测数据集) |
三、各方案技术思路解析
3.1 GR00T N1.7(NVIDIA):双系统架构的"完全体",首次把手指级控制做进通用 VLA
N1.7 是 NVIDIA 人形基础模型这条线的最新一站,这一步迈在两方面:任务与子任务级别的推理,以及真正落到手指的精细控制,同时首次给出了可商用的授权。

其中有几点值得展开:
- Action Cascade 双系统。System 2(VLM)负责语义理解与长程任务拆解,System 1(DiT)把高层表征去噪成连续动作,两者紧耦合、端到端联合训练。N1.7 的 VLM 主干升级为 Cosmos-Reason2-2B(Qwen3-VL 架构),DiT 自 N1.6 起加深至 32 层。
- EgoScale 或许是机器人灵巧性的第一条 Scaling Law。N1.7 预训练混入约两万小时人类第一视角视频;NVIDIA 给出的观察是,这部分数据从一千小时增至两万小时,平均任务完成率翻了一倍有余。这为"用人类视频补机器人数据"的路线提供了少见的量化佐证。
- 动作空间采用机器人与人类共享的相对末端执行器位姿表达,维度覆盖到 22-DoF 手部控制,官方明确支持小零件装配这类接触富集任务。
- 推理性能在 RTX 5090 上约 27 Hz,并已接入 Hugging Face LeRobot,示范数据格式与微调流程都沿用社区标准。
3.2 DexGraspVLA(北大+灵初):把"域迁移"挡在模仿学习之外的分层框架
它没有去追求大一统,而是换了个思路:借助基础模型,把多变的语言与视觉输入逐层转化为域不变表征,于是小规模演示数据也能撑起上千种未见场景。

这套设计的巧妙之处在细节里:
- 域不变表征链是核心。语言经 VLM 变成包围盒,图像经 SAM 与 Cutie 变成持续跟踪的掩码,像素经 DINOv2 变成语义特征——每一环都把千变万化的输入换成分布稳定的中间表征,模仿学习只需在稳定表征上学映射,域偏移自然缓解。论文还用 t-SNE 与注意力可视化验证了模型内部行为跨场景的一致性。
- 规划器同时是监控器。VLM 以 1 Hz 检查抓取成败,成功则执行脚本化放置并规划下一个目标,失败则复位重试。长程能力与失败恢复由此而来,而非靠端到端硬学。
- 数据效率相当可观。控制器只用 2,094 条演示、36 种家居物体训练,却在上千种未见物体、光照与背景组合的零样本环境中保持 90% 以上成功率,并首次同时展示了自由长程指令、对抗物体鲁棒性与人为干扰恢复。
- 规划器即插即用。换成更强的 Qwen2.5-VL-72B 后,长程完成率与包围盒精度进一步提升,这也是作者的官方推荐配置。
3.3 Dexora(清华/BAAI 等):首个原生"双臂+双手"36 自由度开源 VLA
Dexora 把高自由度灵巧操作的三件难事——数据怎么采、仿真怎么造、质量怎么筛——做成了一条完整的开源流水线,论文已被 ICRA 2026 接收。

拆开来看:
- 混合遥操作把手臂与手指解耦采集:外骨骼管手臂运动学,Vision Pro 无标记追踪管手指,真机与数字孪生同步驱动。就目前而言,这是采高质量高 DoF 数据相当务实的做法。
- 判别器引导的质量感知训练是全文最出彩的一笔。先用能量代理 log π̂(z-score 后)训练一个 PU-loss 判别器给演示片段打质量分,再经 DWBC 映射为损失权重。数据质量由此变成可学习的信号,而不必依赖人工逐条筛选;消融显示它对灵巧任务的成功率与平滑度(Acc/Jerk)都有实质贡献。
- 策略本体是 RDT 风格的 Diffusion Transformer(约 0.4B),观测与指令经 SigLIP 与 T5 编码;训练用 1000 步 DDPM(cosine 调度),推理换 DPM-Solver++ 只需 5 步。
- 成绩方面,基础任务平均 89.6%(GR00T N1 为 82.1%、π₀ 为 50.4%),灵巧任务平均 66.7%(GR00T N1 为 51.7%),并可迁移到 Franka、ALOHA、G1+Inspire 等本体。
- 局限也写得坦诚:没有触觉反馈,拧瓶盖这类接触敏感任务成功率只有 25%;36-DoF 的硬件成本同样不低。
3.4 LingBot-VLA 2.0(蚂蚁灵波):60,000 小时喂出来的"一脑多机"基座
这是一个明显面向产业落地的跨本体基座:统一动作空间、MoE 动作专家、双教师蒸馏,支持 20 种构型(含灵巧手),在 RTX 4090D 上把推理压到了 130ms。

几处设计值得琢磨:
- 无损负载均衡的 MoE。动作专家的 FFN 全部换成 MoE,一个共享专家沉淀通用先验,细粒度路由专家负责专门化;路由沿用 DeepSeek-V3 式的 sigmoid 打分加纠偏 bias,把负载均衡与动作学习目标解耦。等激活参数的对照实验里,MoE 在训练损失与 GM-100 验证误差上双双优于 Dense,说明收益来自稀疏容量的分配方式,而非单纯堆参数。
- 双查询蒸馏让模型学会"往前看一步"。在视觉与文本 token 之后追加两个可学习查询:Q_t 对应当前帧,Q_{t+T} 对应一个动作块之后的未来帧,分别向 LingBot-Depth(深度几何)与自研 DINO-Video(DINOv3 底座加因果时序注意力)蒸馏。VLM 内部由此长出对未来场景的预判能力,策略也就从反应式向预判式迈了一步。
- 数据工程很扎实。从九万小时的池子里清洗出五万小时真机数据,剔除了视频与状态错位、模糊遮挡、速度/加速度/加加速度异常、静止片段等,覆盖 17 个品牌、20 种构型,自由度含头、腰、底盘与灵巧手。
- 成绩:上海交大 GM-100 双臂基准上,任务进度分与成功率均超过 π0.5 和 GR00T N1.7(Cobot Magic 平台 66.2/34.4);RoboTwin 2.0 仿真达到 93.52%(clean)与 92.80%(randomized)。
3.5 GR-Dexter(字节 Seed):硬件-模型-数据一体化的双臂灵巧手系统
字节 Seed 交出的是一份系统级答卷:自研 21-DoF 触觉灵巧手、GR-3 架构的 4B VLA,加上跨本体与人类轨迹的联合训练。遗憾的是代码与权重均未开源,留下的只有这份技术报告——好在报告本身写得足够细。

报告里有几手可以直接借鉴:
- 动作空间的冗余表达。每个动作同时包含臂关节、末端 6D 位姿、16 个手部活跃关节与指尖 3D 位置,关节空间与任务空间并存,不同来源的数据各取所需,缺失的维度用掩码屏蔽。
- 指尖对齐的跨本体重定向。异构手的轨迹对齐到 ByteDexter V2 时,对齐的是指尖位置而非法关节角,任务相关的接触几何得以保留,关节级形态差异被绕开。人类 VR 轨迹也经可见性与速度过滤后映射到同一表征。
- 联合训练的收益有清晰量化。梳妆台整理的 OOD 布局下达到 0.89,纯遥操作 VLA 只有 0.64;可泛化抓取放置中,未见物体 0.85、未见指令 0.83。报告还给了一个反例:域内场景里 VL 联合训练没有额外信息,反而略拖优化,可见数据配方需按场景权衡。
- 遥操作栈把 Quest 手柄绑在 Manus 手套背侧以保证腕手协同,脚踏辅助手臂控制;手部重定向建模为 SQP 求解的约束优化,聚合腕尖向量、拇尖向量、防碰撞与正则项。
3.6 Being-H0.5(BeingBeyond):把人手当作"广义本体"的人类中心路线
BeingBeyond 的答案是回到人本身:用 35,000 小时人类中心数据做"物理交互的母语预训练",配合统一状态-动作空间与 Mixture-of-Flow,一个 checkpoint 驱动五种本体。代码与权重已按 Apache-2.0 开源。

其中有两个反常识的决策,以及一处容易被低估的工程功夫:
- 统一空间的两个反常识决策。其一,人手 MANO 参数直接映射进统一空间——腕部全局位姿对齐机器人末端子空间,手指弯曲进入"精细操作"槽位,人类视频与机器人数据由此说同一种动作语言。其二,拒绝常见的 [-1,1] 统计归一化,保留弧度与厘米的物理量纲;在作者看来,1 弧度与 10 厘米的物理含义本身就是模型该学的先验。
- Mixture-of-Flow。针对动作专家容量远小于生成模型流专家的现状,把共享运动基元与本体专精专家解耦,可看作 MoE 思想在连续流匹配动作头上的变体。
- 部署工程是真功夫。MPG(流形保持门控)解决少步数去噪下的传感偏移鲁棒性,UAC(通用异步分块)用硬前缀锁定加缓冲硬拼接,统一了不同延迟与控制频率本体的分块控制。消融显示,拿掉 UAC 后长程任务成功率骤降,双臂协同也变得脆弱。
- 成绩:LIBERO 98.9%、RoboCasa 53.9%。真机上的结论颇耐人寻味——专才模型仍然最强,但通才模型已惊人地接近,且在长程与双臂任务上对 π0.5 有明显优势。
3.7 HEX(北京人形):全身 VLA——灵巧手放进行走中的身体
HEX 把目光从桌面移向全身:高层 VLA 直接输出臂、手、腰的动作,腿部交给低层 RL 全身控制器,让全尺寸双足人形在行走中完成抓握搬运。代码与 2.4B 权重已开源,底层控制器未开。

技术上值得注意的有:
- 人形对齐通用状态表征。七种异构人形的状态被对齐到共享的身体部位槽位,允许不同本体的状态定义不一致(例如天工 3.0 多出 IMU 与手部触觉信号),这是跨本体预训练的地基。
- MoE 统一本体感知预测器(UPP)。4 层 Transformer、16 个路由专家加 2 个共享专家、top-1 路由,预测未来 50 步的本体状态——先让模型理解身体接下来会怎么动,再去生成动作。对行走中操作这种全身耦合、动态平衡的场景,这一步尤为关键。
- 残差门控融合。视觉-语言线索与本体动力学预测自适应融合后送入流匹配动作头;轻量历史 token 摘要历史观测,推理时不必重复编码历史图像。
- 训练成本意外地省。预训练 200K 步、约 1K A100 GPU 小时;在快速反应与长程场景达到 SOTA,也可直接在 LIBERO 仿真上评测。
四、实际使用要点
4.1 通用工程要点(不论选哪个方案)
- 数据格式正在向 LeRobot 收敛。GR00T、Dexora、HEX 均采用 LeRobot v2.x 标准,每个数据集都要正确编写
modality.json(状态与动作维度映射)。接入自研本体时,八成的坑出在 modality 配置与归一化统计上。 - 动作空间对齐是接入新本体的第一道关。先想清楚你的本体用关节空间还是末端位姿、绝对量还是相对量、旋转如何参数化,这直接决定能否复用预训练权重。Being-H0.5 的语义槽位映射和 GR00T 的 embodiment tag 都是现成范式,但人工对齐校准这一步省不掉。
- 给生成式动作头留好推理预算。Dexora 用 DPM-Solver++ 5 步、LingBot 用 10 步做到 130ms;步数翻倍,延迟近似线性上涨。灵巧任务对平滑度敏感时可适度加步数,但要与控制频率(通常 10–50Hz)匹配。
- 灵巧手任务的评估别只盯成功率。接触富集任务建议同时看轨迹平滑度(加速度/Jerk)、接触稳定性与失败恢复率;Dexora 的判别器思路也可以借来给自己的数据做质量分层。
4.2 分方案落地提示
- GR00T N1.7:生态最完整,LeRobot 集成、server-client 部署、Jetson/Blackwell 端侧路径一应俱全。微调时注意,N1.6 起 DiT 加深后更容易过拟合,小数据微调要降步数、加正则;embodiment tag 与 modality 配置务必与本体匹配。Apache-2.0 可商用,是企业落地的低摩擦选项。
- DexGraspVLA:分层管线组件较多(VLM 规划器 + SAM + Cutie + DINOv2 + DiT),规划器建议直接上 Qwen2.5-VL-72B——包围盒精度接近完美,代价是需要多卡部署或走 API。硬件驱动代码因 IP 未开源,复现需自行对接手臂与手。它适合以抓取为中心的场景,不适合需要接触力控的精细操作。
- Dexora:全栈 MIT 开源,训练、推理、数采、遥操作代码连同数据与权重全部放出,是研究双臂双手高 DoF 最顺手的起点。硬件绑定 AIRBOT + XHAND,迁移到自家平台时,它的跨本体投影实验(Franka/ALOHA/G1+Inspire)可作直接参照。别忘了它没有触觉,接触敏感任务需自行补强。
- LingBot-VLA 2.0:完整训练需额外下载 Qwen3-VL-4B、MoGe-2、LingBot-Depth 与 DINO-Video 的教师权重;只做后训练的话,用它的高效后训练版本即可。20 种构型的预训练覆盖对非主流本体最友好,你的机器人很可能已经在它的预训练分布里。
- GR-Dexter:闭源,价值在报告的配方。88 维冗余动作空间、指尖对齐重定向、动作维度掩码联合训练,这三点可以直接移植进自己的 VLA 管线。
- Being-H0.5:统一空间不做归一化,意味着接入新本体时必须严格保证物理单位与坐标系定义一致(弧度、米、世界系相对量),否则会静默出错;部署侧的 MPG/UAC 文档(Being-H-EDU 教程)值得通读。
- HEX:2.4B 权重可直接下载推理或微调,但低层全身控制器未开源。官方建议 G1 用户搭配 HOMIE 或 AMO 等开源全身控制器,且高层输出的命令空间与低层期望的输入空间必须严格一致,数据集构建也要遵循同一接口。
4.3 选型速查
| 场景 | 优先考虑 |
|---|---|
| 人形机器人整机、要商用授权与完整工具链 | GR00T N1.7 |
| 单臂+灵巧手的通用抓取、学术复现 | DexGraspVLA |
| 双臂双手高 DoF 研究/教学、需要数据与代码全开放 | Dexora |
| 跨品牌多本体规模化部署、国内商用落地 | LingBot-VLA 2.0 |
| 用人类视频撬动跨本体泛化、低资源本体启动 | Being-H0.5 |
| 全尺寸双足人形、行走中全身协同操作 | HEX |
七个方案路径各异,落点却渐渐收敛:数据的成色、动作空间的设计、部署工程的细致程度,正在比模型结构本身更大地决定灵巧操作能走多远。愿这份梳理能帮你在选型与复现时少走些弯路。
分享完成~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)