摘要:当前国内具身操作赛道并存隐式VLA、显式/隐式世界模型、WAM、IL/RL、虚实混合数据多条技术路线。各大厂商对外均宣称「虚实融合」,但底层数据权重、模型架构信仰截然不同。本文梳理路线矛盾,给出收敛时间窗口与各家演进推演。

一、先厘清两条正交技术坐标轴

很多讨论陷入误区:把世界模型、VLA、IL/RL放在同一维度对比。实际是两套独立维度,可以自由组合。

  1. 模型架构维度
  • 隐式路线(原生VLA):无独立可调用预测模块,感知直接输出动作;延迟低、工程简单,缺少前瞻推演能力。
  • 显式世界模型:策略与动力学预测解耦,可在模型内部预演多条动作轨迹,支持想象规划、MPC;痛点是预测幻觉、算力开销高。
  • WAM(世界-动作模型):尝试一体化建模状态预测与动作输出,分为显式WAM、隐式WAM两个分支。
  1. 训练与数据范式维度
  • IL(模仿学习):依托专家示教轨迹,基线稳定,是现阶段落地的基础入场券;局限是难以超越示范样本。
  • RL(强化学习):具备自主优化潜力,但纯真机RL样本成本极高;行业主流方向为想象RL(在世界模型内交互训练)
  • 虚实混合数据:核心分歧不在于“要不要仿真”,而是训练各阶段真机/仿真采样权重谁占主导

训练三阶段标准链路:
基座预训练 → 任务协同Co-training → 真机现场精调

二、六家厂商底层路线底色(核心差异)

厂商 数据策略 模型主线 训练重心 天然短板 优势场景
千寻智能 真机优先;仿真仅补充长尾,不主导训练 隐式VLA;逐步轻量外挂世界模型 IL为主,少量局部RL 新场景扩张依赖真机集群;原生缺少前瞻规划 产线力控、柔性物料、长时间连续作业
SUDO苏度 仿真优先;真机作为校准锚点(Real2Sim2Real) 显式3D世界模型+MPC规划 中长期目标:想象RL 缺少足量真机微调时,Sim2Real衰减明显 多技能快速拓展、新能源装配、边界场景探索
极佳视界 生成式世界模型构建数据金字塔;仿真≠物理引擎,靠生成扩充样本 显式WAM(世界+动作一体化) IL打底,探索想象RL 生成数据存在物理一致性幻觉、算力需求高 通用机器人多场景泛化预研
银河通用 仿真基座预训练,少量真机任务微调 隐式WAM(介于VLA与显式WM中间形态) IL为主 精细力交互任务上限受限 零售杂乱SKU、密集物品抓取
智元机器人 真机集群+自研仿真平台双线均衡发展 ViLLA(增强隐式VLA),渐进叠加世界模型 IL+在线失败样本采集 路线偏稳健,前沿架构迭代偏保守 仓储物流、标准化工业场景、人形落地
无界动力 真机搭建基线,仿真重点扩充失败负样本 潜空间显式世界模型 技术路线偏好RL 大规模工程落地案例偏少 长时序多步骤连续操作

关键真相:
所有厂商都宣传「虚实融合」,但路线鸿沟在于:基座预训练、协同训练阶段,到底是真机分布主导,还是仿真分布主导。
这也是相同演示效果下,真机上线后稳定性差距巨大的根源(温漂、机械间隙、接触摩擦、传感器噪声等隐性扰动难以在仿真完整复现)。

三、技术范式收敛时间窗口推演

1. 短期:2026–2028|路线融合期,不会大一统

不会出现VLA、世界模型、WAM单一架构消灭对手。
行业统一演进方向:分层混合架构成为主流工程基线

  • 上层:LLM负责长时序任务拆解(低频)
  • 中层:轻量化潜空间显式世界模型,滚动推演、风险预判、候选动作评估
  • 底层:高频执行单元(VLA/简化WAM)负责连续动作输出
  • 训练范式:IL搭建基础能力 + 想象RL优化策略 + 真机数据持续校准抑制幻觉

路线差异从「有没有世界模型」收缩为:
世界模型规模大小、虚实数据采样权重、RL承担的优化比例。
纯隐式VLA(无预测模块)、纯像素级显式世界模型两条极端路线很难独立支撑高端工业交付。

2. 中期:2028–2030|阶段性范式收敛分水岭

头部厂商完成大规模量产验证,行业形成公认标准基线架构。
对外宣传的架构叙事差异大幅缩小。
竞争重心发生转移:

  1. 高质量真机交互数据集底座;
  2. Sim2Real系统化校准管线(处理温漂、机械非线性等工业特有误差);
  3. 虚实混合动态采样训练框架;
  4. 端侧低延迟模型部署与软硬一体优化。

简单类比:如同CV领域CNN与Transformer之争,最终Transformer成为统一底座;后续比拼不再是架构选择,而是数据与工程能力。

3. 长期:2030以后|存在范式跃迁可能性

当前整套体系以视觉RGB为主模态,力觉、触觉、本体动力学属于附加输入。
未来潜在新方向:

  • 视觉+力觉+触觉+本体动力学原生联合建模的多模态物理基座;
  • 神经网络+可微分物理融合架构;
  • 脱离自回归Transformer的类脑时序连续预测框架。

即便新架构诞生,存量VLA/WAM混合架构仍会在工业场景长期服役,不会瞬间被替代。

四、落地选型核心结论

  1. 2026–2028项目选型不要迷信“架构先进论”
  • 固定产线、力控作业、长时间连续运行:优先考察真机数据是否占据训练主体(千寻、智元优势区间);
  • 多品类泛化、快速试点、大量长尾场景探索:世界模型路线迭代速度更强(SUDO、极佳视界),前提是配套充足真机现场微调。
  1. 收敛 ≠ 同质化
    架构模块趋同只是表层现象;数据分布、训练管线、针对机器人硬件噪声的深度适配,会持续构成长期壁垒。

  2. 终局不是单一技术胜出,而是场景匹配
    不存在万能架构。工业高精度交互场景天然对真机数据权重要求更高;通用开放式机器人会持续依靠世界模型提升泛化与前瞻规划能力。

赛道下一阶段竞争不再是“VLA vs 世界模型”的路线辩论。真正拉开差距的命题:如何构建一套自适应动态虚实配比训练体系,根据任务类型、部署阶段,自动平衡仿真数据的泛化能力与真机数据的物理真实性。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐