面向 VLA + 灵巧手方案的盘点和分析,覆盖 7 种方案:GR00T N1.7、DexGraspVLA、Dexora、LingBot-VLA 2.0GR-Dexter、Being-H0.5、HEX

从双系统到端到端,从 2 千条演示到 6 万小时数据,七条技术路线的架构选择、数据配方与落地陷阱,一篇文章理清 VLA + 灵巧手的当前版图与选型逻辑。

一、方案总览

七家机构,七种答案。下表先呈现全貌,差异集中体现在架构形态、动作空间与数据来源三个维度,这也是后文展开的线索。

方案 机构 / 发布 参数量 核心架构 灵巧手 / 动作空间 训练数据 开源状态
GR00T N1.7 NVIDIA GEAR / 2026-04(EA) 3B 双系统 Action Cascade:Cosmos-Reason2-2B(Qwen3-VL 架构)VLM + 32 层 DiT 动作头 跨本体统一相对末端位姿空间,支持 22-DoF 手指级控制 数千小时遥操作 + 20,854 小时第一视角人类视频(EgoScale) ✅ 权重+代码
Dexora 清华 / BAAI / 北大等 / 2026-05(ICRA 2026) 0.4B–1B(DiT 策略) 单网络端到端:SigLIP/T5 编码 + RDT 风格 Diffusion Transformer + 判别器质量加权训练 双臂 AIRBOT(6-DoF×2)+ 双手 XHAND(12-DoF×2),共 36 可控 DoF 100K 仿真轨迹(6.5M 帧)+ 10K+ 真机遥操作(2.92M 帧) ✅ 全栈(代码+数据+权重)
LingBot-VLA 2.0 蚂蚁灵波(Robbyant)/ 2026-07 6B(Qwen3-VL-4B 主干 + MoE 动作专家) 统一动作空间 + 动作专家 MoE(无损负载均衡)+ 双查询蒸馏(深度+视频教师) 统一动作空间覆盖头/腰/底盘/灵巧手(Hand 6D 等语义槽位) 60,000 小时:50K 真机(20 种构型、17 品牌)+ 10K 第一视角人类视频 ✅ 权重+代码+后训练版
DexGraspVLA 北大 + 灵初智能 / 2025-02(AAAI’26 Oral) VLM 冻结 + 轻量 DiT 分层式:冻结 VLM 规划器 + SAM/Cutie 掩码跟踪 + DINOv2 特征 + DiT 扩散控制器 RealMan RM75 臂 + PsiBot G0-R 6-DoF 手 2,094 条人工遥操作抓取演示 ✅ 代码+控制器权重(硬件驱动代码未开)
GR-Dexter 字节跳动 Seed / 2025-12 4B GR-3 同款 Mixture-of-Transformer VLA,联合训练 VL/跨本体/人类轨迹 ByteDexter V2(21-DoF,指尖压阻触觉),动作含手指关节+指尖位置 双臂遥操作 + 跨本体数据集(ActionNet/白虎/RoboMIND)+ VR 人类轨迹 ❌ 仅技术报告
Being-H0.5 BeingBeyond / 2026-01 未公开(InternVL-3.5 初始化) Mixture-of-Transformers + Mixture-of-Flow 动作专家 + 统一状态-动作空间 物理语义对齐的统一槽位空间,MANO 人手作为"广义本体"映射进同一空间 UniHand-2.0:35,000+ 小时,30 种本体 ✅ 权重+部分数据
HEX 北京人形创新中心等 / 2026-04 2.4B Qwen3-VL-2B + MoE 统一本体感知预测器(UPP)+ 流匹配动作头(高层 VLA + 低层 RL 全身控制器) 人形对齐通用状态表征(按身体部位槽位),直接输出臂/手/腰动作,腿部交低层 RL 12M+ 帧、7 种人形本体、4 个数据源 ⚠️ 代码+权重已开,数采管线与底层控制器未开

顺着这张表往下看,几条贯穿性的脉络逐渐清晰:

  1. 双系统与端到端的分野。GR00T N1.7、DexGraspVLA、HEX 走的是"慢思考、快执行"的分层路线;Dexora、LingBot-VLA 2.0、Being-H0.5、GR-Dexter 则更接近单网络端到端,VLM 与动作专家共享注意力主干。
  2. 动作空间是灵巧手的关键一跃。高自由度手指让动作维度从夹爪的 7–14 维膨胀到 36–88 维,主流解法有两类:统一语义槽位(LingBot、Being-H0.5、HEX),以及物理对齐的重定向(GR-Dexter 的指尖对齐、GR00T 的相对末端位姿)。
  3. 数据来源决定泛化上限。各家都在遥操作之外另辟蹊径:人类第一视角视频(GR00T EgoScale、Being-H0.5 UniHand、LingBot)、仿真合成(Dexora)、跨本体公开数据集(HEX、GR-Dexter)。
  4. 生成式动作头已成共识。七家不约而同地使用 Diffusion 或 Flow Matching 生成连续动作块,真正的差别在去噪步数、条件注入方式与异步执行策略。

二、论文 / 项目 / 开源地址汇总

方案 论文 项目页 开源地址
GR00T N1.7 GR00T N1 白皮书 arXiv:2503.14734(架构基础;N1.7 无单独论文) NVIDIA Isaac GR00T GitHub: NVIDIA/Isaac-GR00T
DexGraspVLA arXiv:2502.20900 dexgraspvla.github.io GitHub: Psi-Robot/DexGraspVLA
Dexora arXiv:2605.18722 dexoravla.github.io GitHub: dexoravla/Dexora数据集: HF Dexora/Dexora_Real-World_Dataset
LingBot-VLA 2.0 arXiv:2607.06403 technology.robbyant.com/lingbot-vla-v2 GitHub: Robbyant/lingbot-vla-v2;权重 robbyant/lingbot-vla-v2-6b(HF / ModelScope)
GR-Dexter arXiv:2512.24210 技术报告 byte-dexter.github.io/gr-dexter
Being-H0.5 arXiv:2601.12993 research.beingbeyond.com/being-h05 GitHub: BeingBeyond/Being-H(含 H0.5 训练/推理代码、HF 权重、UniHand_Preview 数据)
HEX arXiv:2604.07993 —(北京人形官网新闻 GitHub: Open-X-Humanoid/HEX(含 2.4B 权重与评测数据集)

三、各方案技术思路解析

3.1 GR00T N1.7(NVIDIA):双系统架构的"完全体",首次把手指级控制做进通用 VLA

N1.7 是 NVIDIA 人形基础模型这条线的最新一站,这一步迈在两方面:任务与子任务级别的推理,以及真正落到手指的精细控制,同时首次给出了可商用的授权。

任务/子任务级推理 + 高层动作 token

40步动作块,相对末端位姿空间,含22-DoF手指

多视角 RGB 图像

System 2: Cosmos-Reason2-2B VLM

语言指令

本体状态:关节/速度/末端位姿

状态编码器

System 1: 32层 Diffusion Transformer

机器人执行

预训练数据:数千小时遥操作 + 20,854h 人类第一视角视频(EgoScale)

在这里插入图片描述

其中有几点值得展开:

  • Action Cascade 双系统。System 2(VLM)负责语义理解与长程任务拆解,System 1(DiT)把高层表征去噪成连续动作,两者紧耦合、端到端联合训练。N1.7 的 VLM 主干升级为 Cosmos-Reason2-2B(Qwen3-VL 架构),DiT 自 N1.6 起加深至 32 层。
  • EgoScale 或许是机器人灵巧性的第一条 Scaling Law。N1.7 预训练混入约两万小时人类第一视角视频;NVIDIA 给出的观察是,这部分数据从一千小时增至两万小时,平均任务完成率翻了一倍有余。这为"用人类视频补机器人数据"的路线提供了少见的量化佐证。
  • 动作空间采用机器人与人类共享的相对末端执行器位姿表达,维度覆盖到 22-DoF 手部控制,官方明确支持小零件装配这类接触富集任务。
  • 推理性能在 RTX 5090 上约 27 Hz,并已接入 Hugging Face LeRobot,示范数据格式与微调流程都沿用社区标准。

3.2 DexGraspVLA(北大+灵初):把"域迁移"挡在模仿学习之外的分层框架

它没有去追求大一统,而是换了个思路:借助基础模型,把多变的语言与视觉输入逐层转化为域不变表征,于是小规模演示数据也能撑起上千种未见场景。

推理任务链,输出单步抓取指令 l + 目标包围盒

Receding Horizon:执行前 H_a 步后重规划

1Hz 监测抓取成败,失败则复位重试

用户指令 p(可为长程任务)

规划器:冻结 VLM(Qwen-VL-Chat / Qwen2.5-VL-72B)

头部相机

SAM 生成初始掩码

Cutie 逐帧跟踪掩码 m_t

DINOv2(冻结)提取头部/腕部图像特征

腕部相机

ViT 投影掩码特征,与头部特征逐patch拼接

MLP 融合 + 本体状态

DiT 扩散控制器:DDPM 去噪生成动作块

7-DoF 臂 + 6-DoF 手

在这里插入图片描述

这套设计的巧妙之处在细节里:

  • 域不变表征链是核心。语言经 VLM 变成包围盒,图像经 SAM 与 Cutie 变成持续跟踪的掩码,像素经 DINOv2 变成语义特征——每一环都把千变万化的输入换成分布稳定的中间表征,模仿学习只需在稳定表征上学映射,域偏移自然缓解。论文还用 t-SNE 与注意力可视化验证了模型内部行为跨场景的一致性。
  • 规划器同时是监控器。VLM 以 1 Hz 检查抓取成败,成功则执行脚本化放置并规划下一个目标,失败则复位重试。长程能力与失败恢复由此而来,而非靠端到端硬学。
  • 数据效率相当可观。控制器只用 2,094 条演示、36 种家居物体训练,却在上千种未见物体、光照与背景组合的零样本环境中保持 90% 以上成功率,并首次同时展示了自由长程指令、对抗物体鲁棒性与人为干扰恢复。
  • 规划器即插即用。换成更强的 Qwen2.5-VL-72B 后,长程完成率与包围盒精度进一步提升,这也是作者的官方推荐配置。

3.3 Dexora(清华/BAAI 等):首个原生"双臂+双手"36 自由度开源 VLA

Dexora 把高自由度灵巧操作的三件难事——数据怎么采、仿真怎么造、质量怎么筛——做成了一条完整的开源流水线,论文已被 ICRA 2026 接收。

质量感知训练

数据采集

DPM-Solver++ 5步去噪

外骨骼背包:手臂粗运动

混合遥操作

Apple Vision Pro 无标记手部追踪:手指细运动

真机平台 + MuJoCo 数字孪生同步驱动

真机数据集 10K+ episodes / 2.92M 帧(LeRobot v2.1)

DexMimicGen + Objaverse 资产 + Qwen2.5-VL 属性标注

100K 仿真轨迹 / 6.5M 帧

三阶段训练

Stage2b:数字孪生开环回放筛除碰撞/失败片段

Stage2c:离线判别器(PU loss)给每个片段打分

Stage3:按 DWBC 权重加权的 DiT 扩散策略后训练

36-DoF 双臂双手执行

在这里插入图片描述

拆开来看:

  • 混合遥操作把手臂与手指解耦采集:外骨骼管手臂运动学,Vision Pro 无标记追踪管手指,真机与数字孪生同步驱动。就目前而言,这是采高质量高 DoF 数据相当务实的做法。
  • 判别器引导的质量感知训练是全文最出彩的一笔。先用能量代理 log π̂(z-score 后)训练一个 PU-loss 判别器给演示片段打质量分,再经 DWBC 映射为损失权重。数据质量由此变成可学习的信号,而不必依赖人工逐条筛选;消融显示它对灵巧任务的成功率与平滑度(Acc/Jerk)都有实质贡献。
  • 策略本体是 RDT 风格的 Diffusion Transformer(约 0.4B),观测与指令经 SigLIP 与 T5 编码;训练用 1000 步 DDPM(cosine 调度),推理换 DPM-Solver++ 只需 5 步。
  • 成绩方面,基础任务平均 89.6%(GR00T N1 为 82.1%、π₀ 为 50.4%),灵巧任务平均 66.7%(GR00T N1 为 51.7%),并可迁移到 Franka、ALOHA、G1+Inspire 等本体。
  • 局限也写得坦诚:没有触觉反馈,拧瓶盖这类接触敏感任务成功率只有 25%;36-DoF 的硬件成本同样不低。

3.4 LingBot-VLA 2.0(蚂蚁灵波):60,000 小时喂出来的"一脑多机"基座

这是一个明显面向产业落地的跨本体基座:统一动作空间、MoE 动作专家、双教师蒸馏,支持 20 种构型(含灵巧手),在 RTX 4090D 上把推理压到了 130ms。

蒸馏

蒸馏

10步去噪,130ms@4090D

9万小时原始数据清洗 → 5万h真机 + 1万h第一视角人类视频,共6万h

统一动作空间:Arm/EEF/Gripper/Move/Waist/Head/Hand 语义槽位

Qwen3-VL-4B-Instruct 理解专家

动作专家:全部 FFN 替换为 MoE(共享专家+细粒度路由专家)

双查询 [Q_t, Q_t+T]

LingBot-Depth 深度教师:几何监督(L1)

DINO-Video 视频教师:因果时序监督(F范数)

20种构型机器人:单臂/双臂/双足/轮式+灵巧手

在这里插入图片描述

几处设计值得琢磨:

  • 无损负载均衡的 MoE。动作专家的 FFN 全部换成 MoE,一个共享专家沉淀通用先验,细粒度路由专家负责专门化;路由沿用 DeepSeek-V3 式的 sigmoid 打分加纠偏 bias,把负载均衡与动作学习目标解耦。等激活参数的对照实验里,MoE 在训练损失与 GM-100 验证误差上双双优于 Dense,说明收益来自稀疏容量的分配方式,而非单纯堆参数。
  • 双查询蒸馏让模型学会"往前看一步"。在视觉与文本 token 之后追加两个可学习查询:Q_t 对应当前帧,Q_{t+T} 对应一个动作块之后的未来帧,分别向 LingBot-Depth(深度几何)与自研 DINO-Video(DINOv3 底座加因果时序注意力)蒸馏。VLM 内部由此长出对未来场景的预判能力,策略也就从反应式向预判式迈了一步。
  • 数据工程很扎实。从九万小时的池子里清洗出五万小时真机数据,剔除了视频与状态错位、模糊遮挡、速度/加速度/加加速度异常、静止片段等,覆盖 17 个品牌、20 种构型,自由度含头、腰、底盘与灵巧手。
  • 成绩:上海交大 GM-100 双臂基准上,任务进度分与成功率均超过 π0.5 和 GR00T N1.7(Cobot Magic 平台 66.2/34.4);RoboTwin 2.0 仿真达到 93.52%(clean)与 92.80%(randomized)。

3.5 GR-Dexter(字节 Seed):硬件-模型-数据一体化的双臂灵巧手系统

字节 Seed 交出的是一份系统级答卷:自研 21-DoF 触觉灵巧手、GR-3 架构的 4B VLA,加上跨本体与人类轨迹的联合训练。遗憾的是代码与权重均未开源,留下的只有这份技术报告——好在报告本身写得足够细。

数据金字塔

88维动作:臂关节7×2 + 末端位姿6D×2 + 手指关节16×2 + 指尖3D×5×2

网络视觉-语言数据(沿用 GR-3)

联合训练(动作维度掩码处理异构)

跨本体双臂数据:ActionNet/白虎/RoboMIND,指尖对齐重定向

VR 人类轨迹(Pico):过滤+映射到机器人表征

遥操作真机轨迹:Quest VR腕部 + Manus手套 + 脚踏,SQP重定向

GR-Dexter 4B:Mixture-of-Transformer VLA

双 Franka FR3 + 双 ByteDexter V2(21-DoF,指尖压阻触觉)

在这里插入图片描述

报告里有几手可以直接借鉴:

  • 动作空间的冗余表达。每个动作同时包含臂关节、末端 6D 位姿、16 个手部活跃关节与指尖 3D 位置,关节空间与任务空间并存,不同来源的数据各取所需,缺失的维度用掩码屏蔽。
  • 指尖对齐的跨本体重定向。异构手的轨迹对齐到 ByteDexter V2 时,对齐的是指尖位置而非法关节角,任务相关的接触几何得以保留,关节级形态差异被绕开。人类 VR 轨迹也经可见性与速度过滤后映射到同一表征。
  • 联合训练的收益有清晰量化。梳妆台整理的 OOD 布局下达到 0.89,纯遥操作 VLA 只有 0.64;可泛化抓取放置中,未见物体 0.85、未见指令 0.83。报告还给了一个反例:域内场景里 VL 联合训练没有额外信息,反而略拖优化,可见数据配方需按场景权衡。
  • 遥操作栈把 Quest 手柄绑在 Manus 手套背侧以保证腕手协同,脚踏辅助手臂控制;手部重定向建模为 SQP 求解的约束优化,聚合腕尖向量、拇尖向量、防碰撞与正则项。

3.6 Being-H0.5(BeingBeyond):把人手当作"广义本体"的人类中心路线

BeingBeyond 的答案是回到人本身:用 35,000 小时人类中心数据做"物理交互的母语预训练",配合统一状态-动作空间与 Mixture-of-Flow,一个 checkpoint 驱动五种本体。代码与权重已按 Apache-2.0 开源。

UniHand-2.0:35,000+h / 30种本体(人类手部动作 + 机器人操作 + 视觉文本理解)

统一状态-动作空间:物理语义槽位对齐,MANO人手映射为广义本体,Axis-Angle旋转,不做统计归一化

InternVL-3.5 初始化的 Mixture-of-Transformers 主干:统一序列建模

Mixture-of-Flow 动作专家:共享运动基元 + 本体专精专家,Rectified Flow 生成连续动作

后训练:本体适配 + Manifold-Preserving Gating(抗传感偏移)

Universal Async Chunking + 双线程部署:硬前缀锁定 + 缓冲拼接

单权重驱动 PND Adam-U / Franka+Inspire / Unitree G1 / D1 / SO-101

在这里插入图片描述

其中有两个反常识的决策,以及一处容易被低估的工程功夫:

  • 统一空间的两个反常识决策。其一,人手 MANO 参数直接映射进统一空间——腕部全局位姿对齐机器人末端子空间,手指弯曲进入"精细操作"槽位,人类视频与机器人数据由此说同一种动作语言。其二,拒绝常见的 [-1,1] 统计归一化,保留弧度与厘米的物理量纲;在作者看来,1 弧度与 10 厘米的物理含义本身就是模型该学的先验。
  • Mixture-of-Flow。针对动作专家容量远小于生成模型流专家的现状,把共享运动基元与本体专精专家解耦,可看作 MoE 思想在连续流匹配动作头上的变体。
  • 部署工程是真功夫。MPG(流形保持门控)解决少步数去噪下的传感偏移鲁棒性,UAC(通用异步分块)用硬前缀锁定加缓冲硬拼接,统一了不同延迟与控制频率本体的分块控制。消融显示,拿掉 UAC 后长程任务成功率骤降,双臂协同也变得脆弱。
  • 成绩:LIBERO 98.9%、RoboCasa 53.9%。真机上的结论颇耐人寻味——专才模型仍然最强,但通才模型已惊人地接近,且在长程与双臂任务上对 π0.5 有明显优势。

3.7 HEX(北京人形):全身 VLA——灵巧手放进行走中的身体

HEX 把目光从桌面移向全身:高层 VLA 直接输出臂、手、腰的动作,腿部交给低层 RL 全身控制器,让全尺寸双足人形在行走中完成抓握搬运。代码与 2.4B 权重已开源,底层控制器未开。

KV

预测的未来本体状态 KV

臂/手/腰 直接动作

高层指令

图像 + 指令 + 历史查询token(轻量时序记忆)

Qwen3-VL-2B VLM

人形对齐通用状态表征(按身体部位槽位)

MoE 统一本体感知预测器 UPP:16路由+2共享专家,预测未来50步状态

残差门控融合 + 流匹配动作头(16层DiT-B,100步动作块)

上半身控制

低层 RL 全身控制器:腿部步态与平衡

12M+帧预训练:天工2.0/3.0、天轶 + G1/H1 + AgiBot Colosseo + RoboCOIN乐聚

在这里插入图片描述

技术上值得注意的有:

  • 人形对齐通用状态表征。七种异构人形的状态被对齐到共享的身体部位槽位,允许不同本体的状态定义不一致(例如天工 3.0 多出 IMU 与手部触觉信号),这是跨本体预训练的地基。
  • MoE 统一本体感知预测器(UPP)。4 层 Transformer、16 个路由专家加 2 个共享专家、top-1 路由,预测未来 50 步的本体状态——先让模型理解身体接下来会怎么动,再去生成动作。对行走中操作这种全身耦合、动态平衡的场景,这一步尤为关键。
  • 残差门控融合。视觉-语言线索与本体动力学预测自适应融合后送入流匹配动作头;轻量历史 token 摘要历史观测,推理时不必重复编码历史图像。
  • 训练成本意外地省。预训练 200K 步、约 1K A100 GPU 小时;在快速反应与长程场景达到 SOTA,也可直接在 LIBERO 仿真上评测。

四、实际使用要点

4.1 通用工程要点(不论选哪个方案)

  • 数据格式正在向 LeRobot 收敛。GR00T、Dexora、HEX 均采用 LeRobot v2.x 标准,每个数据集都要正确编写 modality.json(状态与动作维度映射)。接入自研本体时,八成的坑出在 modality 配置与归一化统计上。
  • 动作空间对齐是接入新本体的第一道关。先想清楚你的本体用关节空间还是末端位姿、绝对量还是相对量、旋转如何参数化,这直接决定能否复用预训练权重。Being-H0.5 的语义槽位映射和 GR00T 的 embodiment tag 都是现成范式,但人工对齐校准这一步省不掉。
  • 给生成式动作头留好推理预算。Dexora 用 DPM-Solver++ 5 步、LingBot 用 10 步做到 130ms;步数翻倍,延迟近似线性上涨。灵巧任务对平滑度敏感时可适度加步数,但要与控制频率(通常 10–50Hz)匹配。
  • 灵巧手任务的评估别只盯成功率。接触富集任务建议同时看轨迹平滑度(加速度/Jerk)、接触稳定性与失败恢复率;Dexora 的判别器思路也可以借来给自己的数据做质量分层。

4.2 分方案落地提示

  • GR00T N1.7:生态最完整,LeRobot 集成、server-client 部署、Jetson/Blackwell 端侧路径一应俱全。微调时注意,N1.6 起 DiT 加深后更容易过拟合,小数据微调要降步数、加正则;embodiment tag 与 modality 配置务必与本体匹配。Apache-2.0 可商用,是企业落地的低摩擦选项。
  • DexGraspVLA:分层管线组件较多(VLM 规划器 + SAM + Cutie + DINOv2 + DiT),规划器建议直接上 Qwen2.5-VL-72B——包围盒精度接近完美,代价是需要多卡部署或走 API。硬件驱动代码因 IP 未开源,复现需自行对接手臂与手。它适合以抓取为中心的场景,不适合需要接触力控的精细操作。
  • Dexora:全栈 MIT 开源,训练、推理、数采、遥操作代码连同数据与权重全部放出,是研究双臂双手高 DoF 最顺手的起点。硬件绑定 AIRBOT + XHAND,迁移到自家平台时,它的跨本体投影实验(Franka/ALOHA/G1+Inspire)可作直接参照。别忘了它没有触觉,接触敏感任务需自行补强。
  • LingBot-VLA 2.0:完整训练需额外下载 Qwen3-VL-4B、MoGe-2、LingBot-Depth 与 DINO-Video 的教师权重;只做后训练的话,用它的高效后训练版本即可。20 种构型的预训练覆盖对非主流本体最友好,你的机器人很可能已经在它的预训练分布里。
  • GR-Dexter:闭源,价值在报告的配方。88 维冗余动作空间、指尖对齐重定向、动作维度掩码联合训练,这三点可以直接移植进自己的 VLA 管线。
  • Being-H0.5:统一空间不做归一化,意味着接入新本体时必须严格保证物理单位与坐标系定义一致(弧度、米、世界系相对量),否则会静默出错;部署侧的 MPG/UAC 文档(Being-H-EDU 教程)值得通读。
  • HEX:2.4B 权重可直接下载推理或微调,但低层全身控制器未开源。官方建议 G1 用户搭配 HOMIE 或 AMO 等开源全身控制器,且高层输出的命令空间与低层期望的输入空间必须严格一致,数据集构建也要遵循同一接口。

4.3 选型速查

场景 优先考虑
人形机器人整机、要商用授权与完整工具链 GR00T N1.7
单臂+灵巧手的通用抓取、学术复现 DexGraspVLA
双臂双手高 DoF 研究/教学、需要数据与代码全开放 Dexora
跨品牌多本体规模化部署、国内商用落地 LingBot-VLA 2.0
用人类视频撬动跨本体泛化、低资源本体启动 Being-H0.5
全尺寸双足人形、行走中全身协同操作 HEX

七个方案路径各异,落点却渐渐收敛:数据的成色、动作空间的设计、部署工程的细致程度,正在比模型结构本身更大地决定灵巧操作能走多远。愿这份梳理能帮你在选型与复现时少走些弯路。

分享完成~

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐