写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

UniJEPA:让机器人同时“听懂、预见、动起来”的统一表征学习

导读

机器人操作模型需要同时解决两类本质不同的问题:一类是“把自然语言任务听懂”,例如“把橙子从架子上拿下来”;另一类是“估计下一刻会发生什么”,例如机械臂绕开障碍后,目标是否还在可抓取区域。前者适合离散的语言符号,后者更像连续的物理过程。把它们混成同一种 token 去学习,往往会让模型在语义、预测和控制之间相互牵制。

UniJEPA 的答案是把统一放在共享主干与联合训练上,而不是强迫所有信息使用同一表示:离散分支负责理解与规划,连续分支预测未来视觉特征,动作分支以 flow matching 生成连续动作块。作者将这条路径概括为 understanding → generation → execution(理解→生成→执行)。在仿真和两类真实机器人上,论文报告其对分布外物体、长程任务与跨平台控制有更稳健的泛化表现。

论文UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning(ICML 2026,arXiv v3)
项目页UniJEPA Project
关键词:具身智能、VLA、世界模型、连续表征、机器人操作、Flow Matching

图 1:UniJEPA 总览——在离散理解、连续预测与动作执行三条链路上联合学习

图 1:论文总览。UniJEPA 将任务理解、未来视觉预测和机器人执行放进一个共享骨干,但保留各自匹配的表示与专家头。图片来源:论文 Figure 1。

一、先说结论:UniJEPA 的创新到底是什么?

如果只记住一句话:UniJEPA 不是“让 VLA 多输出几句推理文本”,而是让策略在执行前先在连续特征空间里预测未来,再用这个预测去约束动作生成。

它有三个相互咬合的设计。

  1. 离散与连续,分工而不割裂。
    语言问答、子任务规划属于离散输出,用交叉熵学习;未来观测的演化则在视觉编码器的连续特征空间中,用均方误差学习。两者共享主模型,却由不同专家处理。
  2. 把“看见未来”变成策略的中间变量。
    模型并不直接回归未来 RGB 图像,而是预测冻结视觉编码器给出的未来特征。这样既保留了与物体、布局、运动有关的信息,也避开像素级预测对纹理细节的过度执着。
  3. 动作采用生成式而非单点回归。
    动作专家使用 flow matching:从噪声动作块逐步去噪至可执行轨迹。它天然适合连续控制中的多模态解——同一个“拿起杯子”,可以有多条合理接近路径。

这不是传统意义上“世界模型先滚动很多步、再规划”的完整闭环规划器;更准确地说,UniJEPA 把未来状态预测作为策略训练与推理中的条件信息,借此让动作模型获得面向后果的表示。

二、论文要解决的痛点:VLA 为什么会在新物体上失灵?

现有通用机器人策略常从视觉语言模型出发:它们很擅长识别“橙子”“抽屉”“右侧”,却未必理解“手臂这样移动后,遮挡、接触和可达性会怎样变化”。反过来,像素级视频生成虽能建模动态,却容易把大量算力耗在背景纹理、光照等与控制无关的细节上。

因此,单一离散 token 空间不够承载连续动力学;单一像素空间也不够承载任务语义。UniJEPA 的关键判断是:机器人策略需要同时拥有语义坐标系与动态坐标系。

三、方法拆解:一个骨干,三个专长

图 2:UniJEPA 架构。左为离散理解,中为连续未来特征预测,右为动作流匹配

图 2:模型结构。共享 UniJEPA 主干之上配置理解、生成、动作三类专家;雪花代表冻结模块,火焰代表可训练模块。图片来源:论文 Figure 2。

3.1 输入不是一串 token,而是一条有层级的因果序列

给定当前观测 o t o_t ot、语言指令 l l l、本体状态 s t s_t st,模型将图像、文本、未来连续特征、状态与动作组织为带块因果掩码的序列:同一模态内部可双向交互,模态之间则遵循从观测到预测、再到动作的因果顺序。这样动作不能“偷看”真实未来,却可以读取模型自己预测出的未来表征。

底座是 PaliGemma 视觉语言模型。作者没有为三项任务完全复制三个大模型,而是在共享骨干中加入 Mixture-of-Transformers(MoT)式的专用 QKV 投影与 FFN:理解专家服务文本预测,生成专家服务未来特征,动作专家服务控制。这种安排比“所有任务共用一套头”更少互相干扰,也比三套独立模型更节省主体参数。

3.2 连续预测:预测“有意义的未来”,而非每个像素

对于未来时刻的视觉表示 c c c,生成专家根据当前观测和指令给出预测 c p r e d c_{pred} cpred。第一阶段的联合目标可写成:

$$
\mathcal{L}1 = \frac{1}{n}\sum_i\lVert c{pred}{(i)}-c{(i)}\rVert_2^2

  • \frac{1}{m}\sum_j\log P_\theta(d_j\mid d_{<j},l,o_t).
    $$

前半部分是未来连续特征的 MSE,后半部分是文本、问答或规划 token 的交叉熵。论文比较了蒸馏特征、DINOv3 与 SigLIP;最终选择 SigLIP,因为它与 VLM 原生视觉嵌入的对齐更自然。这里的取舍很重要:控制不需要像视频生成那样复原所有像素,却需要保留物体位置、接触前后关系等可行动信息。

3.3 动作生成:用 flow matching 产生一段动作

第二阶段将动作块 A A A 与高斯噪声 ϵ \epsilon ϵ 在时间 τ \tau τ 上插值:

A τ = ( 1 − τ ) ϵ + τ A , L f l o w = E ∥ U ( A τ , o t , s t , l , τ ) − ( A − A τ ) ∥ 2 2 . A_\tau=(1-\tau)\epsilon+\tau A, \qquad \mathcal{L}_{flow}=\mathbb{E}\left\lVert U(A_\tau,o_t,s_t,l,\tau)-(A-A_\tau)\right\rVert_2^2. Aτ=(1τ)ϵ+τA,Lflow=EU(Aτ,ot,st,l,τ)(AAτ)22.

其中 U U U 是动作专家学习的速度场。训练时,动作专家一边学习从噪声恢复动作,一边继续接收未来视觉特征预测损失:

L 2 = 1 n ∑ i ∥ c p r e d ( i ) − c ( i ) ∥ 2 2 + L f l o w . \mathcal{L}_2=\frac{1}{n}\sum_i\lVert c_{pred}^{(i)}-c^{(i)}\rVert_2^2+\mathcal{L}_{flow}. L2=n1icpred(i)c(i)22+Lflow.

直觉上,这相当于要求策略不仅回答“现在手该往哪里走”,还要让该动作与“接下来场景应如何变化”的预测一致。论文在真实机器人中使用 10 步动作块;这会提升轨迹连贯性,但也意味着部署时仍需依赖持续的视觉重观测来纠正误差。

四、训练数据与训练流程:先学世界变化,再把它接到手上

第一阶段使用混合数据进行统一预训练:约 32 万段带细粒度子任务和完整任务描述的机器人视频、约 87 万段机器人/人类操作视频,以及 56 万条通用视觉问答数据。前两类数据构成任务指令到未来表征(TI2E)与具身问答训练,通用 VQA 用于缓解语言视觉能力遗忘。论文摘要将其概括为超过百万规模的互联网操作视频预训练。

第二阶段只用具身数据,将连续预测表征映射到动作。最终模型共 29 亿参数:约 23 亿为 VLM 主体,生成与动作专家各约 3 亿。论文强调,额外专家增加的是训练参数容量,在其设计下不额外增加推理延迟;但这仍是一种资源较重的路线,并非面向极小端侧模型的方案。

图 3:四组评测环境——CALVIN、SimplerEnv,以及 7 自由度机械臂和 12 自由度灵巧手

图 3:评测覆盖两套仿真基准与两类真实本体。图片来源:论文 Figure 3。

五、实验告诉我们什么?不要只看“谁的分数最高”

5.1 仿真:连续预测带来的收益最清楚

在 CALVIN ABC→D 长程任务中,UniJEPA 的平均完成子任务数为 4.11/5,略高于 UP-VLA 的 4.08;在 SimplerEnv 的 WidowX 设置中,报告平均成功率为 71.0%,Google Robot 设置为 78.4%。不同方法的输入视角、是否重现实验并不完全一致,论文也对部分基线标注了复现结果,因此这些数字更适合用来观察趋势,而不宜简单视为完全公平的排行榜。

更有说服力的是消融:在 WidowX 上,去掉预训练且不做连续预测时平均成功率为 49.8%;加入连续特征预测后为 69.3%;再加上统一预训练达到 71.0%。这说明未来特征并非可有可无的辅助头,而是策略泛化的重要来源。

5.2 真实机器人:新物体才是重点考题

作者在 7 自由度 Franka 机械臂和带灵巧手的 12 自由度 XArm 上测试,覆盖抓取、放置、开合抽屉、按键、线缆等操作,并区分已见物体、未见物体与误导性物体。论文摘要报告,UniJEPA 相比强基线在仿真和真实分布外场景上分别提升约 9%12%

图 4:7 自由度 Franka 真实机械臂结果

图 4:Franka 真实任务的成功率对比。图片来源:论文 Figure 4。

图 5:12 自由度 XArm 灵巧手真实任务结果

图 5:灵巧手任务及分布外任务结果。图片来源:论文 Figure 5。

在 XArm 的三项消融任务上,完整 UniJEPA 平均成功率为 76.7%;去掉预训练降至 60.8%,去掉离散理解预训练为 71.7%。它揭示了一个容易被忽视的事实:连续预测很关键,但离散任务理解仍不能省——机器人面对新物体时,先得准确知道“要拿什么、放到哪里”。

六、猫先生认为:UniJEPA 的价值,不在于把模型做得更“大”

UniJEPA 最值得借鉴的是它对 VLA 内部矛盾的处理方式:语义理解和物理演化不是竞争关系,而是需要不同接口的协作关系。 文本 token 适合表达可组合的任务意图;连续特征适合保留时间变化;生成式动作头适合表达多种可行轨迹。共享骨干负责信息流通,专用专家负责避免表示互相污染。

这也给“世界模型是否一定要生成视频”提供了一个实用答案:未必。对控制而言,真正需要的是足够预测动作后果、又与策略可对接的表征。UniJEPA 把世界建模压缩为未来视觉特征预测,是一条相当务实的折中路线。

不过,仍有三点需要冷静看待:第一,29 亿参数与两阶段大规模视频训练的成本不低;第二,真实实验覆盖两种本体、有限任务与试验次数,跨实验室、跨传感器和长时间自治仍待验证;第三,10 步动作块能带来平滑性,也可能在突发接触或观测误差下放大开环偏差。未来更值得关注的方向,是让这种连续“预见”与在线重规划、不确定性估计和更轻量的端侧部署结合起来。

七、读完论文,你应该带走的 5 个要点

  1. 统一不等于单一表示。 离散语言和连续动态可以共享模型,但不必共享同一种预测空间。
  2. 未来特征是控制友好的世界模型接口。 它比像素预测更聚焦于任务相关变化,也能直接条件化动作。
  3. 专家化是多任务 VLA 的实用解法。 MoT 在共享主体中为理解、生成、执行保留专长。
  4. 预训练与连续预测缺一不可。 实验显示,两者分别为真实泛化与仿真控制带来可观增益。
  5. 评价重点应从“已见物体分数”转向“新物体下是否仍理解任务并预测后果”。 这正是通用机器人真正的难题。

参考资料

  1. UniJEPA 论文(arXiv)
  2. UniJEPA 项目页

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐