从动作坐标到三维点流,再到混合 Transformer:高中生也能理解的机器人基础模型完整指南

摘要

要让一个人工智能模型控制汽车、机械臂、人形机器人和灵巧手,需要同时解决两个相互独立的问题。

第一个问题是:

不同机器人的动作格式完全不同,怎样用一种通用语言描述它们?

这属于动作接口或动作表示问题。典型方案包括:

  • 关节角;
  • 末端位姿;
  • Cosmos 3 的统一动作接口;
  • Action Point 或三维点流;
  • 离散动作 token;
  • 连续 diffusion 或 flow-matching 动作。

第二个问题是:

文本、图像、视频和动作进入模型以后,应该由一套 Transformer 处理,还是由多套专门的 Transformer 处理?

这属于模型主干架构问题。典型方案包括:

  • Dense 统一 Transformer;
  • FFN-only MoE;
  • Mixture-of-Transformers,也就是 MoT;
  • 独立模型加连接器。

这两个问题是正交的:

动作表示≠Transformer 架构 \boxed{ \text{动作表示}\neq\text{Transformer 架构} } 动作表示=Transformer 架构

例如:

  • Cosmos 3 的低维统一动作可以放进 MoT;
  • 同一种统一动作也可以放进 Dense Transformer;
  • Action Point 可以由 Dense Transformer 预测;
  • Action Point 也可以由 MoT 预测。

本文先解释各种动作表示,再分析它们对人类级灵巧手的表达能力,最后推导 Dense、MoE 和 MoT 的性能差异。


第一章:什么是动作表示

1. 原始机器人动作为什么难以统一

不同机器人的底层动作可能完全不同。

一台七轴机械臂可能输出:

q=[q1,q2,…,q7] \mathbf q= [q_1,q_2,\ldots,q_7] q=[q1,q2,,q7]

一台双臂机器人可能输出:

q∈R14 \mathbf q\in\mathbb R^{14} qR14

一只灵巧手可能输出:

qhand∈R26 \mathbf q_{\mathrm{hand}}\in\mathbb R^{26} qhandR26

汽车则可能输出:

a=[方向盘角度,油门,制动] \mathbf a= [\text{方向盘角度},\text{油门},\text{制动}] a=[方向盘角度,油门,制动]

这些向量不仅长度不同,而且同一位置的数字含义也不同。

例如,第一个数字可能分别表示:

  • 肩关节角;
  • 拇指关节角;
  • 方向盘转角。

因此,直接把各种原始动作混在一起训练,模型很难形成跨机器人的共同知识。


2. 四个主要动作空间

机器人动作大致可以分成四层。

第一层:关节空间

直接表示关节角、关节速度或力矩:

at=[qt,q˙t,τt] \mathbf a_t= [\mathbf q_t,\dot{\mathbf q}_t,\boldsymbol\tau_t] at=[qt,q˙t,τt]

优点是可以直接对应具体机器人。

缺点是不同机器人的关节数量和定义不同,跨机器人共享困难。


第二层:任务空间或末端位姿

不描述每个关节,而描述夹爪或工具末端的位置和方向:

at=[pt,Rt] \mathbf a_t= [\mathbf p_t,R_t] at=[pt,Rt]

其中:

pt\mathbf p_tpt 是三维位置,RtR_tRt 是旋转。

这种表示具有更强的跨机器人一致性,因为不同机械臂都可以完成“让夹爪向前移动五厘米”。


第三层:稀疏关键点

用手腕、指尖或机器人关键点的位置描述动作:

Pt={p1,t,…,pN,t} P_t= \{ \mathbf p_{1,t},\ldots,\mathbf p_{N,t} \} Pt={p1,t,,pN,t}

Cosmos 3 对人手使用的五指指尖表示,就可以看成一种非常稀疏的关键点表示。


第四层:稠密 Action Point Flow

在机器人或物体表面选取大量三维点,描述每个点怎样运动:

$$
\mathbf f_{i,t}

\mathbf p_{i,t+1}-\mathbf p_{i,t}
$$

全部点流组成:

Ft={fi,t}i=1N F_t= \{\mathbf f_{i,t}\}_{i=1}^{N} Ft={fi,t}i=1N

PointWorld 使用的就是这种三维点流思想:它将机器人动作和场景状态放进共同的三维点流空间,以减少对机器人专属关节定义的依赖。turn646507view1


第二章:Cosmos 3 的统一动作接口

3. Cosmos 3 统一了什么

Cosmos 3 是一个同时处理语言、图像、视频、音频和动作的全模态世界模型,并采用 MoT 主干。

它并没有要求所有机器人输出完全相同的底层控制向量,而是把动作拆成几个共享的几何组件:

$$
\boxed{
\text{动作}

\text{主体位姿}
+
\text{末端位姿}
+
\text{抓取状态}
}
$$

这统一的是动作的含义,而不是所有机器人的电机命令。


4. 主体位姿 Ego Pose

主体位姿描述汽车、移动机器人、头部相机或机器人躯干怎样运动。

Cosmos 3 使用三维平移和六维旋转编码:

et=[Δx,Δy,Δz,r6D]∈R9 \mathbf e_t= [ \Delta x,\Delta y,\Delta z, \mathbf r_{6D} ] \in\mathbb R^9 et=[Δx,Δy,Δz,r6D]R9

它表面上有九个数,但真正的物理自由度只有:

3平移+3旋转=6 3_{\text{平移}}+3_{\text{旋转}}=6 3平移+3旋转=6

因为六维旋转是三维旋转的一种冗余编码。


5. 末端位姿 Effector Pose

机械臂夹爪、手腕或工具末端同样使用九维表示:

ut=[Δpt,r6D,t]∈R9 \mathbf u_t= [ \Delta\mathbf p_t, \mathbf r_{6D,t} ] \in\mathbb R^9 ut=[Δpt,r6D,t]R9

其中:

Δpt=[Δxt,Δyt,Δzt] \Delta\mathbf p_t= [\Delta x_t,\Delta y_t,\Delta z_t] Δpt=[Δxt,Δyt,Δzt]

表示相邻时间步之间的位置变化。


6. 抓取状态

普通二指夹爪通常使用一维连续变量:

gt∈R g_t\in\mathbb R gtR

例如:

gt=0 g_t=0 gt=0

表示打开,

gt=1 g_t=1 gt=1

表示闭合。

因此单臂机器人的统一动作长度通常为:

9+1=10 9+1=10 9+1=10

双臂机器人的动作长度为:

2×(9+1)=20 2\times(9+1)=20 2×(9+1)=20


7. Cosmos 3 如何表示人手

对于第一视角人类动作,Cosmos 3 使用:

  • 头部或相机位姿;
  • 左右手腕位姿;
  • 每只手五个指尖相对于手腕的三维位置。

一只手的指尖状态为:

ht=[pthumb,pindex,pmiddle,pring,plittle]∈R15 \mathbf h_t= [ \mathbf p_{\mathrm{thumb}}, \mathbf p_{\mathrm{index}}, \mathbf p_{\mathrm{middle}}, \mathbf p_{\mathrm{ring}}, \mathbf p_{\mathrm{little}} ] \in\mathbb R^{15} ht=[pthumb,pindex,pmiddle,pring,plittle]R15

因为:

5×3=15 5\times3=15 5×3=15

第一视角双手动作的总长度可以写为:

9+9+15+9+15=57 9+9+15+9+15=57 9+9+15+9+15=57

相关维度和领域专属输入、输出投影在 Cosmos 3 技术报告的统一动作设计中给出。


第三章:相对位姿和 pseudo-action

8. 为什么不直接使用绝对位置

设物体在两个时刻的位姿为:

Tt−1 T_{t-1} Tt1

和:

Tt T_t Tt

相对运动为:

ΔTt=Tt−1−1Tt \Delta T_t= T_{t-1}^{-1}T_t ΔTt=Tt11Tt

其中:

T=[Rp0⊤1] T= \begin{bmatrix} R&\mathbf p\\ \mathbf 0^\top&1 \end{bmatrix} T=[R0p1]

使用相对运动有几个优点:

  1. 不依赖机器人位于房间的绝对位置;
  2. “向前五厘米”可以跨场景复用;
  3. 数值范围通常更小;
  4. 与相邻视频帧的变化自然对应。

9. 什么是 pseudo-action

如果数据没有记录控制器真正发出的命令,但记录了连续状态,就可以计算:

Tt−1,Tt⟶ΔTt T_{t-1},T_t \longrightarrow \Delta T_t Tt1,TtΔTt

这种由状态变化反推出的动作称为 pseudo-action。

它描述的是:

系统最终发生了什么运动。

而不是:

控制器最初发送了什么电流、力矩或速度命令。

因此 Cosmos 的统一动作更接近高级几何动作语言,而不是底层电机接口。


第四章:六维旋转为什么不是六个旋转自由度

10. 欧拉角的问题

若用三个角度表示旋转,可能出现数值跳变。

例如:

179∘ 179^\circ 179

和:

−179∘ -179^\circ 179

在空间中非常接近,但数字相差:

358∘ 358^\circ 358

神经网络可能错误地认为它们差异很大。


11. 六维旋转的构造

设网络预测两个三维向量:

a1,a2∈R3 \mathbf a_1,\mathbf a_2\in\mathbb R^3 a1,a2R3

先将第一向量归一化:

b1=a1∥a1∥ \mathbf b_1= \frac{\mathbf a_1}{\|\mathbf a_1\|} b1=a1a1

从第二向量中去掉与第一向量平行的部分:

$$
\widetilde{\mathbf b}_2

\mathbf a_2-
(\mathbf b_1^\top\mathbf a_2)\mathbf b_1
$$

再归一化:

b2=b~2∥b~2∥ \mathbf b_2= \frac{\widetilde{\mathbf b}_2} {\|\widetilde{\mathbf b}_2\|} b2=b 2b 2

第三个方向由叉乘得到:

b3=b1×b2 \mathbf b_3= \mathbf b_1\times\mathbf b_2 b3=b1×b2

最终旋转矩阵为:

R=[b1 b2 b3] R= [\mathbf b_1\ \mathbf b_2\ \mathbf b_3] R=[b1 b2 b3]

六维表示只是用六个连续数字编码三维旋转,实际旋转自由度仍是三个。


第五章:Cosmos 统一动作支持的三个任务

12. 正向动力学

给定当前观察和动作,预测未来:

p(vt+1:t+H∣v≤t,at:t+H−1) p(v_{t+1:t+H}\mid v_{\leq t}, a_{t:t+H-1}) p(vt+1:t+Hvt,at:t+H1)

例如:

如果夹爪向下运动并闭合,未来是否能抓住杯子?


13. 逆向动力学

给定动作前后的观察,推断动作:

p(at∣vt−1,vt) p(a_t\mid v_{t-1},v_t) p(atvt1,vt)

例如:

从人拿杯子的视频中推测手腕和指尖怎样移动。


14. 策略生成

给定当前观察和语言任务,预测动作:

p(at:t+H−1∣v≤t,instruction) p(a_{t:t+H-1} \mid v_{\leq t}, \text{instruction}) p(at:t+H1vt,instruction)

Cosmos 3 将动作作为可以输入或输出的原生模态,并支持策略、正向动力学和逆向动力学形式。turn694509view0


第六章:Action Point Flow 是什么

15. 基本定义

设手、机器人或物体上有 NNN 个点:

Pt={p1,t,p2,t,…,pN,t} P_t= \{ \mathbf p_{1,t}, \mathbf p_{2,t}, \ldots, \mathbf p_{N,t} \} Pt={p1,t,p2,t,,pN,t}

每个点为:

pi,t∈R3 \mathbf p_{i,t}\in\mathbb R^3 pi,tR3

单步点流是:

$$
\mathbf f_{i,t}

\mathbf p_{i,t+1}

\mathbf p_{i,t}
$$

如果预测未来 HHH 步,则可以表示为:

$$
\mathcal F_{t:t+H}

\left{
\mathbf p_{i,t+k}
\right}_{
\substack{
i=1,\ldots,N\
k=1,\ldots,H
}
}
$$

Action Point 的直观含义是:

不只描述一个坐标系怎样运动,而是描述实体上的许多点具体怎样移动。


第七章:相关点流方法并不完全相同

“Action Point Flow”可以作为一类方法的统称,但你列出的论文实际表示不同对象。

16. PointWorld

PointWorld 把:

  • 机器人动作;
  • 场景状态变化;

都表示成三维点流。

机器人的点流通过已知 URDF 和正向运动学产生,使不同机器人在共享三维空间中学习。PointWorld 主要使用夹爪上的稠密点流,每个夹爪约有 300∼500300\sim500300500 个点,并将其与六自由度末端位姿、关节状态和全身点流进行了消融比较。turn646507view1


17. Point Policy

Point Policy 用人手和物体的语义关键点统一观察与动作,从人类示范视频中学习机器人策略。

它最终把预测关键点转换为机器人末端位姿和夹爪动作,因此关键点主要是一个动作中间表示,而不是完整的人手关节控制接口。论文在八个真实任务上报告平均成功率约为 88%88\%88%。turn646507view6


18. ATM

ATM 预测图像平面中任意点的二维轨迹:

pi,t=[ui,t,vi,t] \mathbf p_{i,t}= [u_{i,t},v_{i,t}] pi,t=[ui,t,vi,t]

它只建模二维轨迹,从而不要求深度、多视角或相机标定。轨迹作为视觉子目标,再由另一个策略输出机器人控制。turn329475view7

因此 ATM 的点轨迹不是完整的三维机器人动作。


19. FlowBot3D

FlowBot3D 预测的是关节物体表面点的瞬时运动方向,而不是机器人自身的完整动作。

对于平移关节:

fp=v \mathbf f_p=\mathbf v fp=v

对于旋转关节:

fp=ω×r∥ω×rmax⁡∥ \mathbf f_p= \frac{ \boldsymbol\omega\times\mathbf r }{ \| \boldsymbol\omega\times\mathbf r_{\max} \| } fp=ω×rmaxω×r

其中 ω\boldsymbol\omegaω 是旋转轴,r\mathbf rr 是点到轴的径向向量。

它的主要用途是告诉机器人:

  • 应该接触物体表面的哪个位置;
  • 接触后应该沿哪个方向移动。

FlowBot3D 把这种表示称为三维关节流。


第八章:Cosmos 位姿与 Action Point 的数学关系

20. 位姿如何展开成点流

设一个刚体动作由旋转 RRR 和平移 t\mathbf tt 构成:

$$
\mathbf p_i’

R\mathbf p_i+\mathbf t
$$

点流为:

fi=pi′−pi \mathbf f_i= \mathbf p_i'-\mathbf p_i fi=pipi

代入得到:

fi=(R−I)pi+t \boxed{ \mathbf f_i= (R-I)\mathbf p_i+\mathbf t } fi=(RI)pi+t

这个公式说明:

Cosmos 的刚体位姿动作可以展开为一整组 Action Point Flow。


21. 纯平移

如果没有旋转:

R=I R=I R=I

则:

fi=t \mathbf f_i= \mathbf t fi=t

所有点的流完全相同。


22. 纯旋转

如果没有平移:

t=0 \mathbf t=\mathbf 0 t=0

则:

fi=(R−I)pi \mathbf f_i= (R-I)\mathbf p_i fi=(RI)pi

不同位置的点会产生不同点流。

离旋转轴越远,点的位移通常越大。


23. 小角度近似

当旋转很小时:

R≈I+[ω]× R\approx I+ [\boldsymbol\omega]_\times RI+[ω]×

因此:

fi≈ω×pi+t \mathbf f_i \approx \boldsymbol\omega \times \mathbf p_i + \mathbf t fiω×pi+t

这里:

  • t\mathbf tt 是整体平移;
  • ω×pi\boldsymbol\omega\times\mathbf p_iω×pi 是旋转产生的局部运动。

第九章:如何从点流恢复位姿

24. 刚体拟合

设点运动后的位置为:

yi=pi+fi \mathbf y_i= \mathbf p_i+\mathbf f_i yi=pi+fi

希望找到旋转和平移:

yi≈Rpi+t \mathbf y_i \approx R\mathbf p_i+\mathbf t yiRpi+t

可以求解:

min⁡R∈SO(3)t∈R3∑iwi∥yi−(Rpi+t)∥22 \min_{ \substack{ R\in SO(3)\\ \mathbf t\in\mathbb R^3 } } \sum_i w_i \| \mathbf y_i- (R\mathbf p_i+\mathbf t) \|_2^2 RSO(3)tR3miniwiyi(Rpi+t)22

先计算中心:

$$
\bar{\mathbf p}

\frac{\sum_iw_i\mathbf p_i}
{\sum_iw_i}
$$

$$
\bar{\mathbf y}

\frac{\sum_iw_i\mathbf y_i}
{\sum_iw_i}
$$

中心化:

$$
\widetilde{\mathbf p}_i

\mathbf p_i-\bar{\mathbf p}
$$

$$
\widetilde{\mathbf y}_i

\mathbf y_i-\bar{\mathbf y}
$$

构造:

H=∑iwip~iy~i⊤ H= \sum_i w_i \widetilde{\mathbf p}_i \widetilde{\mathbf y}_i^\top H=iwip iy i

HHH 做奇异值分解:

H=UΣV⊤ H=U\Sigma V^\top H=UΣV

即可恢复最佳旋转,再计算:

$$
\mathbf t=
\bar{\mathbf y}

R\bar{\mathbf p}
$$

所以对于刚体:

位姿与足够完整的点流可以相互转换 \boxed{ \text{位姿与足够完整的点流可以相互转换} } 位姿与足够完整的点流可以相互转换


第十章:Cosmos 与 Action Point 的相同点

两者都在尝试解决跨具身动作不统一问题。

25. 都从关节编号转向几何运动

原始关节空间可能是:

q(A)∈R7 \mathbf q^{(A)}\in\mathbb R^7 q(A)R7

q(B)∈R26 \mathbf q^{(B)}\in\mathbb R^{26} q(B)R26

Cosmos 使用主体、末端和指尖几何。

Action Point 使用表面点或关键点几何。

两者都比“第几个关节转多少”更具跨机器人意义。


26. 都可以从已有数据构造

Cosmos 位姿可以由连续状态差分得到:

ΔTt=Tt−1−1Tt \Delta T_t= T_{t-1}^{-1}T_t ΔTt=Tt11Tt

Action Point 可以由关节轨迹和正向运动学得到:

qt→FKPt \mathbf q_t \xrightarrow{\mathrm{FK}} P_t qtFK Pt

因此二者都可以利用没有专门统一动作标签的数据。


27. 都不能直接替代底层控制器

Cosmos 输出末端目标后,还需要逆运动学:

$$
\mathbf q_{\mathrm{target}}

IK(T_{\mathrm{target}})
$$

Action Point 输出点目标后,也需要刚体拟合、动作重定向或逆运动学。

两者都不是直接的电流或力矩命令。


第十一章:Cosmos 与 Action Point 的主要不同点

28. 压缩表示与展开表示

Cosmos 单臂每一步只需要约:

10 10 10

个数。

PointWorld 若使用 N=300N=300N=300 个点,每一步需要:

3N=900 3N=900 3N=900

个坐标。

预测十步时:

10×10=100 10\times10=100 10×10=100

对比:

3×300×10=9000 3\times300\times10=9000 3×300×10=9000

因此:

Cosmos 是低维压缩表示 \boxed{ \text{Cosmos 是低维压缩表示} } Cosmos 是低维压缩表示

Action Point 是高维几何展开表示 \boxed{ \text{Action Point 是高维几何展开表示} } Action Point 是高维几何展开表示


29. Cosmos 显式表示位姿,点流隐式表示位姿

Cosmos 直接给出:

R,t R,\mathbf t R,t

Action Point 通过许多点的相对运动隐式表示旋转和平移。


30. Action Point 显式保存机器人形状

两种夹爪可以执行相同末端位姿:

$$
\Delta T^{(A)}

\Delta T^{(B)}
$$

在 Cosmos 中动作可能相同。

但它们形状不同:

pi(A)≠pi(B) \mathbf p_i^{(A)} \neq \mathbf p_i^{(B)} pi(A)=pi(B)

所以点流不同:

fi(A)≠fi(B) \mathbf f_i^{(A)} \neq \mathbf f_i^{(B)} fi(A)=fi(B)

因此 Action Point 更容易显式推理:

  • 手指宽度;
  • 夹爪表面;
  • 接触位置;
  • 遮挡区域;
  • 碰撞风险。

31. Cosmos 更容易跨汽车、相机和机械臂

汽车和相机天然可以用主体位姿表示。

若把整辆汽车采样成数千个点,也可以使用点流,但计算代价很高,而且很多任务并不需要完整表面几何。

因此 Cosmos 的动作组件更适合广泛的 Physical AI 场景。


32. Action Point 更容易表示形变和多刚体运动

单个刚体位姿要求:

$$
\mathbf p_i’

R\mathbf p_i+\mathbf t
$$

但布料、绳索或软体手的每个点可以独立运动:

$$
\mathbf p_i’

\mathbf p_i+\mathbf f_i
$$

一般不存在一个共同的 RRRt\mathbf tt

因此 Action Point 的表达范围更广。


第十二章:人手究竟有多少自由度

“人手有多少自由度”取决于建模精细程度。

一种基础模型包括:

  • 四根普通手指各 444 个;
  • 拇指约 555 个;
  • 手腕约 222 个。

总计:

4×4+5+2=23 4\times4+5+2=23 4×4+5+2=23

若加入掌骨弯曲和掌弓变化,可以得到约:

26 26 26

个自由度。

若再加入前臂旋前旋后,可以达到:

27 27 27

个左右。


33. 一个较完整的 262626 自由度列表

编号 部位 运动
111 食指 MCP 屈伸
222 食指 MCP 侧摆
333 食指 PIP 屈伸
444 食指 DIP 屈伸
555 中指 MCP 屈伸
666 中指 MCP 侧摆
777 中指 PIP 屈伸
888 中指 DIP 屈伸
999 无名指 MCP 屈伸
101010 无名指 MCP 侧摆
111111 无名指 PIP 屈伸
121212 无名指 DIP 屈伸
131313 小指 MCP 屈伸
141414 小指 MCP 侧摆
151515 小指 PIP 屈伸
161616 小指 DIP 屈伸
171717 拇指 CMC 屈伸
181818 拇指 CMC 外展、内收
191919 拇指 CMC 对掌旋转
202020 拇指 MCP 屈伸
212121 拇指 IP 屈伸
222222 掌部 第四掌骨弯曲
232323 掌部 第五掌骨弯曲
242424 掌部 掌弓杯状变化
252525 手腕 掌屈、背伸
262626 手腕 桡偏、尺偏

前臂旋前旋后若单独计算,可作为第 272727 个自由度。


第十三章:Cosmos 能否完整表示 262626 自由度灵巧手

34. 表面数字数量不等于自由度数量

Cosmos 对一只手使用:

9+15=24 9+15=24 9+15=24

个存储数字。

但手腕九维位姿实际只有六个物理自由度:

3+3=6 3+3=6 3+3=6

因此它包含的任务空间量最多约为:

6+15=21 6+15=21 6+15=21

而不是二十四个完全独立的自由度。


35. 关节空间与任务空间

设完整人手状态为:

q∈R26 \mathbf q\in\mathbb R^{26} qR26

Cosmos 保存手腕和五指指尖:

y=F(q) \mathbf y= F(\mathbf q) y=F(q)

其中:

y=[Twrist,p1,…,p5] \mathbf y= [ T_{\mathrm{wrist}}, \mathbf p_1,\ldots,\mathbf p_5 ] y=[Twrist,p1,,p5]

Cosmos 保存的是正向运动学的结果,而不是完整的关节变量。


36. 为什么指尖位置不能唯一恢复关节角

只考虑手内部的二十四个自由度:

qint∈R24 \mathbf q_{\mathrm{int}} \in\mathbb R^{24} qintR24

五指指尖只有十五个坐标:

ptips∈R15 \mathbf p_{\mathrm{tips}} \in\mathbb R^{15} ptipsR15

局部变化满足:

Δptips≈JΔqint \Delta\mathbf p_{\mathrm{tips}} \approx J \Delta\mathbf q_{\mathrm{int}} ΔptipsJΔqint

其中:

J∈R15×24 J\in\mathbb R^{15\times24} JR15×24

矩阵的秩最多为:

rank⁡(J)≤15 \operatorname{rank}(J)\leq15 rank(J)15

所以零空间维度至少为:

$$
\dim\ker(J)

24-\operatorname{rank}(J)
\geq9
$$

存在许多非零关节变化:

Δqint≠0 \Delta\mathbf q_{\mathrm{int}} \neq\mathbf 0 Δqint=0

但指尖位置不变:

$$
J\Delta\mathbf q_{\mathrm{int}}

\mathbf 0
$$

因此:

相同指尖位置可能对应不同的内部关节姿态 \boxed{ \text{相同指尖位置可能对应不同的内部关节姿态} } 相同指尖位置可能对应不同的内部关节姿态


37. 单根手指的简单例子

一根平面手指有三个关节角:

θ1,θ2,θ3 \theta_1,\theta_2,\theta_3 θ1,θ2,θ3

指尖位置为:

x=l1cos⁡θ1+l2cos⁡(θ1+θ2)+l3cos⁡(θ1+θ2+θ3) x= l_1\cos\theta_1+ l_2\cos(\theta_1+\theta_2)+ l_3\cos(\theta_1+\theta_2+\theta_3) x=l1cosθ1+l2cos(θ1+θ2)+l3cos(θ1+θ2+θ3)

y=l1sin⁡θ1+l2sin⁡(θ1+θ2)+l3sin⁡(θ1+θ2+θ3) y= l_1\sin\theta_1+ l_2\sin(\theta_1+\theta_2)+ l_3\sin(\theta_1+\theta_2+\theta_3) y=l1sinθ1+l2sin(θ1+θ2)+l3sin(θ1+θ2+θ3)

有三个未知角,却只有两个观测坐标。

所以通常存在多组:

(θ1,θ2,θ3) (\theta_1,\theta_2,\theta_3) (θ1,θ2,θ3)

产生相同:

(x,y) (x,y) (x,y)


38. Cosmos 还缺少什么

Cosmos 当前的五指指尖表示不显式包含:

  • 每个指关节角度;
  • 指尖方向;
  • 掌弓形状;
  • 接触力;
  • 关节力矩;
  • 手指刚度;
  • 触觉;
  • 滑动状态。

所以它可以表示:

人手动作的主要外部几何效果 \boxed{ \text{人手动作的主要外部几何效果} } 人手动作的主要外部几何效果

但不能无损表示:

完整的 26 自由度关节动作和动力学状态 \boxed{ \text{完整的 }26\text{ 自由度关节动作和动力学状态} } 完整的 26 自由度关节动作和动力学状态


第十四章:Cosmos 能否控制 262626 自由度灵巧手

可以作为高层任务空间目标。

Cosmos 输出:

T^wrist \widehat T_{\mathrm{wrist}} T wrist

和:

p^1,…,p^5 \widehat{\mathbf p}_1,\ldots, \widehat{\mathbf p}_5 p 1,,p 5

具体机器人再求:

$$
\widehat{\mathbf q}

\arg\min_{\mathbf q}
\sum_{i=1}^{5}
w_i
|
FK_i(\mathbf q)

\widehat{\mathbf p}_i
|_2^2
+
\lambda R(\mathbf q)
$$

其中正则项可以包含:

$$
R(\mathbf q)

\alpha
|
\mathbf q-\mathbf q_{\mathrm{prev}}
|2^2
+
\beta
C
{\mathrm{collision}}(\mathbf q)
$$

用来保证:

  • 动作平滑;
  • 不超过关节限制;
  • 避免自碰撞;
  • 姿态自然。

因此流程是:

Cosmos 指尖目标→动作重定向→26 维关节控制 \boxed{ \text{Cosmos 指尖目标} \rightarrow \text{动作重定向} \rightarrow 26\text{ 维关节控制} } Cosmos 指尖目标动作重定向26 维关节控制

它不能直接唯一给出二十六个关节角。


第十五章:Action Point 能否表示 262626 自由度灵巧手

答案取决于 Action Point 的数量、位置和身份。


39. 只使用五个指尖

五个三维点一共有:

3×5=15 3\times5=15 3×5=15

个坐标。

对应 Jacobian:

JP∈R15×26 J_P\in\mathbb R^{15\times26} JPR15×26

所以:

rank⁡(JP)≤15<26 \operatorname{rank}(J_P)\leq15<26 rank(JP)15<26

零空间至少有:

26−15=11 26-15=11 2615=11

维。

因此:

五指尖 Action Point 一定不能完整表示 26 自由度 \boxed{ \text{五指尖 Action Point 一定不能完整表示 }26\text{ 自由度} } 五指尖 Action Point 一定不能完整表示 26 自由度

它与 Cosmos 的五指指尖状态面临相同问题。


40. 至少需要多少个三维点

从维数上看,需要:

3N≥26 3N\geq26 3N26

所以:

$$
N\geq
\left\lceil
\frac{26}{3}
\right\rceil

9
$$

但九个点只是必要条件,不是充分条件。

点必须放在能够观察各关节运动的位置。


41. 点为什么不能放在旋转轴上

设关节绕轴 a\mathbf aa 旋转,轴经过 c\mathbf cc

点的位置是 p\mathbf pp

点对关节角的变化率为:

$$
\frac{\partial\mathbf p}{\partial\theta}

\mathbf a
\times
(\mathbf p-\mathbf c)
$$

如果点位于旋转轴上:

p−c∥a \mathbf p-\mathbf c \parallel \mathbf a pca

则:

$$
\frac{\partial\mathbf p}{\partial\theta}

\mathbf 0
$$

关节转动时这个点不动,因此无法观察该自由度。


42. 完整判据:Jacobian 满秩

将所有点拼起来:

$$
P(\mathbf q)

[
\mathbf p_1(\mathbf q),
\ldots,
\mathbf p_N(\mathbf q)
]
\in\mathbb R^{3N}
$$

Jacobian 为:

$$
J_P(\mathbf q)

\frac{\partial P}{\partial\mathbf q}
\in\mathbb R^{3N\times26}
$$

要在某个姿态附近区分全部关节变化,需要:

rank⁡(JP)=26 \boxed{ \operatorname{rank}(J_P)=26 } rank(JP)=26

这表示每个自由度都会在点运动中留下无法被其他自由度完全代替的痕迹。


43. 完整三维骨架点

若使用二十一个手部骨架点:

N=21 N=21 N=21

坐标数量为:

3N=63 3N=63 3N=63

从维数上已经足够。

但如果所有点都位于指骨中心轴线上,可能无法观察某些轴向旋转。

因此完整骨架点可以很好地表示屈伸和侧摆,但不一定保证恢复所有旋转自由度。


44. 每根指骨上的表面点

若在一根刚性指骨上选择三个不共线点:

p1,p2,p3 \mathbf p_1,\mathbf p_2,\mathbf p_3 p1,p2,p3

并满足:

(p2−p1)×(p3−p1)≠0 (\mathbf p_2-\mathbf p_1) \times (\mathbf p_3-\mathbf p_1) \neq \mathbf 0 (p2p1)×(p3p1)=0

三个点可以确定该指骨完整的三维位姿。

定义:

$$
\mathbf e_1

\frac{\mathbf p_2-\mathbf p_1}
{|\mathbf p_2-\mathbf p_1|}
$$

再构造与之垂直的:

e2 \mathbf e_2 e2

以及:

e3=e1×e2 \mathbf e_3= \mathbf e_1\times\mathbf e_2 e3=e1×e2

即可得到指骨方向矩阵:

E=[e1 e2 e3] E= [\mathbf e_1\ \mathbf e_2\ \mathbf e_3] E=[e1 e2 e3]

动作前后分别得到 EEEE′E'E,旋转为:

R=E′E⊤ R=E'E^\top R=EE

平移为:

t=p1′−Rp1 \mathbf t= \mathbf p_1'-R\mathbf p_1 t=p1Rp1

因此,在每个关键刚性连杆上放置足够的不共线表面点,原则上可以恢复所有连杆位姿,再恢复关节角。


45. 从指骨位姿恢复关节角

父连杆位姿为:

Tparent T_{\mathrm{parent}} Tparent

子连杆位姿为:

Tchild T_{\mathrm{child}} Tchild

相对变换为:

$$
T_{\mathrm{rel}}

T_{\mathrm{parent}}^{-1}
T_{\mathrm{child}}
$$

若关节轴已知,就可以从相对旋转中提取:

$$
q_j

\operatorname{ExtractAngle}
(T_{\mathrm{rel}},\mathbf a_j)
$$

对全部关节重复:

$$
\widehat{\mathbf q}

[
\widehat q_1,\ldots,\widehat q_{26}
]
$$

于是:

稠密三维表面点→指骨位姿→26 个关节角 \boxed{ \text{稠密三维表面点} \rightarrow \text{指骨位姿} \rightarrow 26\text{ 个关节角} } 稠密三维表面点指骨位姿26 个关节角


46. Action Point 的最终判断

Action Point 类型 是否完整表示 262626 DoF
五个指尖 不能
少量末端关键点 不能
单视角二维轨迹 通常不能
完整三维骨架点 基本可以,但可能有旋转歧义
各指骨三维表面点 运动学上原则上可以
点、关节、接触力和触觉联合表示 最完整

PointWorld 式表示在原理上可以扩展到多关节灵巧手,因为它依据 URDF 和正向运动学把机器人连杆动作展开为三维表面点流;但 PointWorld 的公开实验主要覆盖 Franka 和双臂人形机器人,并未直接证明完整人手级灵巧手控制。它也指出,刚性运动学点流可能无法准确处理柔顺、欠驱动或肌腱驱动关节。turn646507view1


第十六章:Action Point 的优点和缺点

47. 优点

显式包含接触几何

可以直接计算手部点和物体点之间的距离:

$$
d_{\min}

\min_{i,j}
|
\mathbf p_i^{\mathrm{hand}}

\mathbf p_j^{\mathrm{object}}
|_2
$$

这对多指抓取和碰撞预测很重要。

跨具身更自然

不同机器人的关节数不同,但都可以表示为三维表面点。

冗余提高鲁棒性

若多个点有独立测量噪声,平均误差在理想情况下大致随点数下降:

Var⁡(pˉ)≈σ2N \operatorname{Var}(\bar{\mathbf p}) \approx \frac{\sigma^2}{N} Var(pˉ)Nσ2


48. 缺点

维度高

二十六维关节动作预测十步只需要:

26×10=260 26\times10=260 26×10=260

个数。

三百个点预测十步则需要:

3×300×10=9000 3\times300\times10=9000 3×300×10=9000

个数。

无效点可能稀释训练信号

若只有 NcN_cNc 个点接近接触区域,总点数为 NNN,有效比例为:

ρ=NcN \rho= \frac{N_c}{N} ρ=NNc

当全身点很多而接触点很少时:

ρ≪1 \rho\ll1 ρ1

PointWorld 的消融表明,夹爪局部点流在接触建模和效率之间取得了更好平衡,过多全身点不一定更优。turn646507view1

预测结果可能违反骨骼约束

一根刚性指骨上两点间距离应保持不变:

$$
|
\mathbf p_{i,t}

\mathbf p_{j,t}
|_2

l_{ij}
$$

神经网络独立预测点时可能破坏这一约束。

可以加入:

$$
L_{\mathrm{rigid}}

\sum_{(i,j)}
\left(
|
\widehat{\mathbf p}_i-
\widehat{\mathbf p}_j
|_2

l_{ij}
\right)^2
$$

或者把点投影回合法关节状态。


第十七章:运动学完整不等于灵巧控制完整

即使 Action Point 完整恢复二十六个关节角,它通常仍然缺少动力学信息。

相同点位置可能对应不同接触力:

P(1)=P(2) P^{(1)}=P^{(2)} P(1)=P(2)

但:

fcontact(1)≠fcontact(2) \mathbf f_{\mathrm{contact}}^{(1)} \neq \mathbf f_{\mathrm{contact}}^{(2)} fcontact(1)=fcontact(2)

完整灵巧操作还可能需要:

$$
\mathbf s_{\mathrm{hand}}

[
\mathbf q,
\dot{\mathbf q},
\boldsymbol\tau,
\mathbf f_{\mathrm{contact}},
\mathbf s_{\mathrm{tactile}}
]
$$

因此:

Action Point 可以完整表示运动学,不一定完整表示动力学控制 \boxed{ \text{Action Point 可以完整表示运动学,不一定完整表示动力学控制} } Action Point 可以完整表示运动学,不一定完整表示动力学控制


第十八章:动作表示与 Transformer 架构是两个问题

现在进入第二条主线。

无论采用:

  • Cosmos 统一动作;
  • 关节角;
  • Action Point;
  • 离散动作 token;

都还要决定由什么模型处理这些 token。

常见选择是:

  1. Dense 统一 Transformer;
  2. MoE;
  3. MoT;
  4. 独立模型加连接器。

第十九章:Transformer 的基本数学

49. Token 是向量

文本、图像和动作都先变成向量:

h=[h1,h2,…,hd] \mathbf h= [h_1,h_2,\ldots,h_d] h=[h1,h2,,hd]

Transformer 对每个 token 计算:

Q=HWQ Q=HW_Q Q=HWQ

K=HWK K=HW_K K=HWK

V=HWV V=HW_V V=HWV

可以直观理解为:

  • Query:我想寻找什么;
  • Key:我包含什么;
  • Value:如果关注我,可以获取什么。

50. 点积注意力

两个 token 的相关程度为:

$$
s_{ij}

\mathbf q_i^\top\mathbf k_j
$$

展开后:

$$
s_{ij}

q_{i,1}k_{j,1}
+
q_{i,2}k_{j,2}
+\cdots+
q_{i,d}k_{j,d}
$$

标准注意力为:

$$
\operatorname{Attn}(Q,K,V)

\operatorname{Softmax}
\left(
\frac{QK^\top}{\sqrt d}+M
\right)V
$$

其中 MMM 是注意力掩码。


51. FFN

信息交换后,每个 token 经过前馈网络:

$$
\operatorname{FFN}(\mathbf h)

W_2
\sigma(W_1\mathbf h+\mathbf b_1)
+
\mathbf b_2
$$

可以把 Attention 理解为“交流”,FFN 理解为“独立加工”。


第二十章:Dense 统一 Transformer

52. 基本结构

Dense 模型中,所有 token 使用同一套参数:

$$
\theta_{\mathrm{text}}

\theta_{\mathrm{vision}}

\theta_{\mathrm{action}}
$$

一层可以简化为:

$$
H^{\ell+1}

H^\ell+
\operatorname{Attn}{\theta_A\ell}(H\ell)
+
\operatorname{FFN}
{\theta_F\ell}(H\ell)
$$

优点:

  • 参数少;
  • 部署简单;
  • 知识共享直接;
  • 动作数据少时,可以利用视觉语言预训练知识。

缺点:

  • 所有任务争夺同一套参数;
  • 文本自回归和连续生成的训练目标差别大;
  • 带噪视频 token 可能干扰语言表示。

第二十一章:使用统一 Backbone 的经典模型

53. RT-2

RT-2 把机器人动作表示为文本 token,并与视觉语言任务共同训练:

$$
p(z_1,\ldots,z_D\mid I,L)

\prod_i
p(z_i\mid I,L,z_{<i})
$$

它使用同一个视觉语言模型完成自然语言输出和动作输出。


54. OpenVLA

OpenVLA 将每个连续动作维度离散为 256256256 个区间:

ai⟶zi∈{0,…,255} a_i \longrightarrow z_i\in\{0,\ldots,255\} aizi{0,,255}

然后使用标准 next-token prediction 预测动作 token。turn329475view1

OpenVLA 是一个七十亿参数的开源 VLA,基于 Llama 2,并融合 DINOv2 和 SigLIP 视觉特征。论文报告它在二十九项任务上的平均成功率比 RT-2-X 高 16.516.516.5 个百分点,但这并不是 Dense 与 MoT 的受控架构比较。


55. EO-1

EO-1 使用单一统一 decoder-only Transformer。

输入包括:

  • 文本;
  • 图像;
  • 视频;
  • 机器人状态;
  • 带噪连续动作。

共享 Backbone 上接两个输出头:

  • 自回归语言头;
  • 连续 flow-matching 动作头。

所有模态由同一套 Transformer 权重处理。

EO-1 在 LIBERO 上报告:

  • 连续 flow 版本:98.2%98.2\%98.2%
  • 纯自回归动作版本:88.0%88.0\%88.0%

这个差距主要说明连续 flow 动作解码优于纯离散自回归解码,不能单独证明 Dense 架构优于 MoT。


56. UWM

Unified World Models 把动作 diffusion 和视频 diffusion 放进同一个 Diffusion Transformer,并为两个模态设置独立 diffusion timestep。turn329475view3

通过调节两个 timestep,同一个模型可以执行:

p(a∣o) p(a\mid o) p(ao)

策略;

p(o′∣o,a) p(o'\mid o,a) p(oo,a)

正向动力学;

p(a∣o,o′) p(a\mid o,o') p(ao,o)

逆向动力学;

p(o′∣o) p(o'\mid o) p(oo)

视频预测。

UWM 在其五个 LIBERO 任务的分布外评测中平均成功率为:

0.79 0.79 0.79

而 Diffusion Policy 为:

0.71 0.71 0.71

这证明统一视频—动作 diffusion 在该实验中有效,但没有直接和 MoT 比较。turn646507view3


第二十二章:什么是梯度

57. 一个简单例子

设损失函数为:

L(w)=(w−3)2 L(w)=(w-3)^2 L(w)=(w3)2

导数为:

$$
\frac{\mathrm dL}{\mathrm dw}

2(w-3)
$$

若:

w=5 w=5 w=5

则:

dLdw=4 \frac{\mathrm dL}{\mathrm dw}=4 dwdL=4

梯度下降:

$$
w_{\mathrm{new}}

w-\eta
\frac{\mathrm dL}{\mathrm dw}
$$

若学习率为:

η=0.1 \eta=0.1 η=0.1

则:

$$
w_{\mathrm{new}}

5-0.1\times4

4.6
$$

参数向最优值 333 靠近。


第二十三章:什么是梯度冲突

58. 两个任务共用参数

设理解损失为:

LU L_U LU

生成损失为:

LG L_G LG

总损失:

L=LU+λLG L= L_U+ \lambda L_G L=LU+λLG

共享参数的梯度:

$$
\nabla_\theta L

\nabla_\theta L_U
+
\lambda
\nabla_\theta L_G
$$

记:

gU=∇θLU \mathbf g_U= \nabla_\theta L_U gU=θLU

gG=∇θLG \mathbf g_G= \nabla_\theta L_G gG=θLG

若:

gU⊤gG>0 \mathbf g_U^\top\mathbf g_G>0 gUgG>0

两个任务方向相近。

若:

gU⊤gG<0 \mathbf g_U^\top\mathbf g_G<0 gUgG<0

两个任务在部分参数方向上相互对抗。


59. 二维例子

设:

gU=[1,0] \mathbf g_U=[1,0] gU=[1,0]

gG=[−1,1] \mathbf g_G=[-1,1] gG=[1,1]

点积为:

$$
\mathbf g_U^\top\mathbf g_G

-1
$$

总梯度为:

$$
\mathbf g_U+\mathbf g_G

[0,1]
$$

理解任务希望第一个参数变化,但被生成任务抵消。


第二十四章:Dense 为什么容易冲突

Dense 模型中,Attention 和 FFN 都共享。

因此:

$$
\nabla_{\theta_A}L

\nabla_{\theta_A}L_U
+
\lambda
\nabla_{\theta_A}L_G
$$

$$
\nabla_{\theta_F}L

\nabla_{\theta_F}L_U
+
\lambda
\nabla_{\theta_F}L_G
$$

语言任务需要:

  • 因果注意力;
  • 离散 token;
  • 高层语义;
  • 逻辑关系。

视频和动作生成需要:

  • 连续向量;
  • 噪声去除;
  • 双向上下文;
  • 空间和时间细节;
  • 数值精度。

同一套参数需要同时适应两种优化目标,因此可能产生冲突。


第二十五章:BAGEL 的 FFN-only MoE

60. MoE 分开了什么

BAGEL 的 MoE 消融只复制每层 FFN:

$$
H_U’

Z_U+
\operatorname{FFN}_{\theta_U}(Z_U)
$$

$$
H_G’

Z_G+
\operatorname{FFN}_{\theta_G}(Z_G)
$$

其中:

θU≠θG \theta_U\neq\theta_G θU=θG

但 Attention 参数仍然共享:

$$
\theta_A^U

\theta_A^G

\theta_A
$$

BAGEL 使用硬路由:

  • 文本和 ViT token 进入理解 Expert;
  • VAE token 进入生成 Expert。

论文明确指出,MoE 只复制 FFN,而 MoT 复制全部 Transformer 可训练参数。


61. 为什么 MoE 仍有梯度冲突

共享 Attention 的梯度仍是:

$$
\nabla_{\theta_A}L

\nabla_{\theta_A}L_U
+
\lambda
\nabla_{\theta_A}L_G
$$

所以 Q、K、V 和输出投影仍然可能被两个任务推向不同方向。


62. 按 token 路由不等于按损失路由

文本 token 虽然进入理解 FFN,但生成 VAE token 会读取文本信息:

OG=Attn⁡(QG,KU,VU) O_G= \operatorname{Attn}(Q_G,K_U,V_U) OG=Attn(QG,KU,VU)

生成损失通过链式法则可能更新理解 FFN:

$$
\frac{\partial L_G}{\partial\theta_U}

\frac{\partial L_G}{\partial O_G}
\frac{\partial O_G}{\partial H_U}
\frac{\partial H_U}{\partial\theta_U}
$$

只要生成过程使用了理解 token:

∂LG∂θU≠0 \frac{\partial L_G}{\partial\theta_U} \neq0 θULG=0

因此:

不同 token 进入不同 Expert≠不同损失完全隔离 \boxed{ \text{不同 token 进入不同 Expert} \neq \text{不同损失完全隔离} } 不同 token 进入不同 Expert=不同损失完全隔离


第二十六章:Mixture-of-Transformers

63. MoT 分开整个 Transformer

MoT 为理解和生成分别使用独立的:

  • LayerNorm;
  • Q 投影;
  • K 投影;
  • V 投影;
  • Attention 输出投影;
  • FFN。

例如:

QU=HUWQ,U Q_U=H_UW_{Q,U} QU=HUWQ,U

QG=HGWQ,G Q_G=H_GW_{Q,G} QG=HGWQ,G

并且:

WQ,U≠WQ,G W_{Q,U}\neq W_{Q,G} WQ,U=WQ,G

K、V、FFN 和归一化参数也分别独立。


64. “共享注意力”有三种不同含义

共享参数

如果两个任务共用:

WQ,WK,WV,WO W_Q,W_K,W_V,W_O WQ,WK,WV,WO

就会在同一参数上直接竞争。

共享算子

注意力运算:

Softmax⁡(QK⊤d)V \operatorname{Softmax} \left( \frac{QK^\top}{\sqrt d} \right)V Softmax(d QK)V

本身没有必须共享的可训练参数。

两套独立 QKV 可以进入同一个联合注意力运算。

共享计算图

如果生成输出读取理解隐藏状态,生成损失仍然能通过计算图进入理解路径。

因此:

共享注意力算子≠共享注意力参数 \boxed{ \text{共享注意力算子} \neq \text{共享注意力参数} } 共享注意力算子=共享注意力参数


第二十七章:Cosmos 3 的 MoT

65. Reasoner

Reasoner 使用自己的参数:

QR=HRWQ,R Q_R= H_RW_{Q,R} QR=HRWQ,R

KR=HRWK,R K_R= H_RW_{K,R} KR=HRWK,R

VR=HRWV,R V_R= H_RW_{V,R} VR=HRWV,R

并只对自身进行因果注意力:

$$
O_R

\operatorname{Attn}_{\mathrm{causal}}
(Q_R,K_R,V_R)
$$

因此带噪 Generator token 不会进入 Reasoner 的前向计算。


66. Generator

Generator 使用独立参数:

QG=HGWQ,G Q_G= H_GW_{Q,G} QG=HGWQ,G

KG=HGWK,G K_G= H_GW_{K,G} KG=HGWK,G

VG=HGWV,G V_G= H_GW_{V,G} VG=HGWV,G

但 Generator 可以读取两路 K/V:

$$
O_G

\operatorname{Attn}_{\mathrm{full}}
\left(
Q_G,
[K_R;K_G],
[V_R;V_G]
\right)
$$

所以前向信息流是:

R⟶G \boxed{ R\longrightarrow G } RG

不是完全对称的双向污染。

Cosmos 3 采用自回归 Reasoner 和 diffusion Generator 的双塔 MoT,并让生成流读取推理流提供的条件。


第二十八章:MoT 是否完全消除了梯度冲突

没有。

67. Generator 损失仍能进入 Reasoner

因为:

LG=LG(OG) L_G=L_G(O_G) LG=LG(OG)

同时:

OG=OG(KR,VR,KG,VG) O_G=O_G(K_R,V_R,K_G,V_G) OG=OG(KR,VR,KG,VG)

所以:

∂LG∂KR≠0 \frac{\partial L_G}{\partial K_R} \neq0 KRLG=0

以及:

∂LG∂VR≠0 \frac{\partial L_G}{\partial V_R} \neq0 VRLG=0

进一步:

$$
\frac{\partial L_G}
{\partial W_{K,R}}

H_R^\top
\frac{\partial L_G}{\partial K_R}
$$

因此 Reasoner 参数的总梯度可能为:

$$
\nabla_{\theta_R}L

\nabla_{\theta_R}L_R
+
\lambda
\nabla_{\theta_R}L_G
$$

若:

⟨∇θRLR,∇θRLG⟩<0 \left\langle \nabla_{\theta_R}L_R, \nabla_{\theta_R}L_G \right\rangle<0 θRLR,θRLG<0

Reasoner 中仍然存在冲突。


68. Reasoner 损失不会进入 Generator

Reasoner 不读取 Generator:

HR′=FR(HR;θR) H_R'=F_R(H_R;\theta_R) HR=FR(HR;θR)

所以:

$$
\frac{\partial L_R}{\partial\theta_G}

0
$$

Generator 参数主要只接收生成损失:

$$
\nabla_{\theta_G}L

\lambda
\nabla_{\theta_G}L_G
$$

因此 MoT 的耦合是不对称的。


第二十九章:用 Jacobian 理解 MoT 的单向传播

一层 MoT 可以写成:

HR′=FR(HR) H_R'=F_R(H_R) HR=FR(HR)

HG′=FG(HG,HR) H_G'=F_G(H_G,H_R) HG=FG(HG,HR)

微小变化满足:

$$
\begin{bmatrix}
\mathrm dH_R’\
\mathrm dH_G’
\end{bmatrix}

\begin{bmatrix}
J_{RR}&0\
J_{GR}&J_{GG}
\end{bmatrix}
\begin{bmatrix}
\mathrm dH_R\
\mathrm dH_G
\end{bmatrix}
$$

右上角为零,因为 Reasoner 不读取 Generator。

反向传播时:

$$
\delta_R

J_{RR}^\top\delta_R’
+
J_{GR}^\top\delta_G’
$$

$$
\delta_G

J_{GG}^\top\delta_G’
$$

这表示:

  • 生成梯度可以进入 Reasoner;
  • 理解梯度不会进入 Generator;
  • 耦合经过跨塔 Jacobian 过滤。

第三十章:MoT 为什么仍然比 MoE 更容易优化

69. MoE 使用同一个注意力度量

共享 Q/K 时:

$$
S_{ij}

H_iW_QW_K^\top H_j^\top
$$

记:

B=WQWK⊤ B= W_QW_K^\top B=WQWK

则:

$$
S_{ij}

H_iBH_j^\top
$$

文本到文本、生成 token 到文本、生成 token 到生成 token,都必须使用同一个相似度规则 BBB


70. MoT 可以学习三种不同关系

Reasoner 自注意力:

$$
S_{RR}

H_RW_{Q,R}W_{K,R}^\top H_R^\top
$$

Generator 读取 Reasoner:

$$
S_{GR}

H_GW_{Q,G}W_{K,R}^\top H_R^\top
$$

Generator 读取自己:

$$
S_{GG}

H_GW_{Q,G}W_{K,G}^\top H_G^\top
$$

因此可以分别学习:

  • 什么叫语言语义相关;
  • 生成 token 应该如何读取语言条件;
  • 视频或动作 token 之间什么叫时空相关。

这就是 MoT 相比 FFN-only MoE 的关键表达优势。


第三十一章:MoT 仍存在的问题

71. Reasoner 仍可能被生成任务影响

若:

∥λ∇θRLG∥≫∥∇θRLR∥ \| \lambda\nabla_{\theta_R}L_G \| \gg \| \nabla_{\theta_R}L_R \| λθRLGθRLR

Reasoner 可能过度服务生成任务。


72. Softmax 注意力竞争

Generator 同时关注 Reasoner 和自身 token:

AG=Softmax⁡([SGR,SGG]) A_G= \operatorname{Softmax} ([S_{GR},S_{GG}]) AG=Softmax([SGR,SGG])

所有权重之和为:

$$
\sum_{j\in R}a_j+
\sum_{k\in G}a_k

1
$$

Reasoner token 获得更多注意力时,Generator 自身 token 可获得的注意力可能减少。

这属于激活竞争,不是共享权重的直接梯度冲突。


73. 表示空间需要对齐

跨塔分数是:

$$
S_{GR}

\frac{
H_GW_{Q,G}
(H_RW_{K,R})^\top
}{
\sqrt d
}
$$

若两塔表示不兼容:

QGKR⊤≈0 Q_GK_R^\top\approx0 QGKR0

Generator 就无法有效读取 Reasoner。


74. 参数和显存更大

若单一 Backbone 参数量约为:

P P P

双 Expert MoT 总参数量约为:

PMoT≈2P P_{\mathrm{MoT}}\approx2P PMoT2P

每个 token 只通过一套 Expert 时,活跃 FLOPs 不一定翻倍,但权重显存、优化器状态和系统复杂度会增加。


第三十二章:如果使用 stop-gradient

可以将 Reasoner 的 K/V 停止反向传播:

K~R=sg⁡(KR) \widetilde K_R= \operatorname{sg}(K_R) K R=sg(KR)

V~R=sg⁡(VR) \widetilde V_R= \operatorname{sg}(V_R) V R=sg(VR)

其中:

$$
\frac{\partial\operatorname{sg}(x)}
{\partial x}

0
$$

此时:

$$
\frac{\partial L_G}{\partial\theta_R}

0
$$

实现完整梯度隔离。

但代价是 Reasoner 不能根据生成任务学习“什么表示对生成更有帮助”。

因此 MoT 通常选择:

参数分离+可微的信息交流 \boxed{ \text{参数分离} + \text{可微的信息交流} } 参数分离+可微的信息交流

而不是完全切断。


第三十三章:BAGEL 的受控性能实验

BAGEL 比较了:

  • Dense Transformer;
  • 只复制 FFN 的 MoE;
  • 复制全部 Transformer 参数的 MoT。

实验使用约 1.51.51.5B 的 Qwen2.5 模型,保持数据、超参数和活跃 FLOPs 相同。MoE 和 MoT 的总参数量约为 Dense 的两倍,但每个 token 只激活一套 Expert。

结果是:

  • MoT 的生成 MSE 收敛最快;
  • MoT 的最终生成损失最低;
  • MoT 的理解 CE 总体也最好;
  • MoT 相比 MoE 的优势在生成任务上最明显。

论文据此认为,理解与生成目标会把模型参数推向不同的优化区域,在该规模下分开完整 Transformer 参数能减少优化冲突。

但需要注意:

  1. MoT 总参数量更大;
  2. 结论来自特定规模和训练设置;
  3. 不能推出 MoT 在所有任务中永远最好。

第三十四章:Cosmos 3 是否直接证明 MoT 优于 Dense

没有完成严格的同条件证明。

Cosmos 3 的主要模型都采用 MoT,但没有公开一个完全控制以下变量的 Dense 对照:

  • 相同数据;
  • 相同参数预算;
  • 相同训练步数;
  • 相同 token 数;
  • 仅改变主干架构。

Cosmos 3 报告称其完整系统在多项理解、生成和策略评测中达到很强结果,但最终性能同时受到:

  • 数据规模;
  • 模型规模;
  • 编码器;
  • 动作表示;
  • 后训练;
  • 采样算法;
  • 合成数据;

等多个因素影响。

所以不能把 Cosmos 3 的全部优势只归因于 MoT。


第三十五章:经典模型架构总表

模型 主干类型 动作表示 是否生成未来视觉 主要特点
RT-2 统一 AR VLM 离散动作 token 把动作当文字预测
OpenVLA 统一 AR VLA 每维量化为 256256256 个区间 开源七十亿参数 VLA
EO-1 统一 Dense Transformer 连续 flow 动作 主要用于动作 AR 推理与 flow 动作共享 Backbone
UWM 统一 Diffusion Transformer 连续 diffusion 动作 视频和动作联合 diffusion
BAGEL Dense 消融 Dense 视觉生成 token 所有参数共享
BAGEL MoE 消融 FFN-only MoE 视觉生成 token 分开 FFN,共享 Attention 参数
BAGEL 正式模型 MoT 视觉生成 token 完整理解、生成 Expert
Cosmos 3 MoT 主体、末端、抓取统一动作 Reasoner 加 Generator
PointWorld 三维世界模型 稠密夹爪点流 预测三维场景流 显式接触几何
Point Policy 关键点策略 人手和机器人关键点 从人类视频迁移到机器人
ATM 轨迹模型加策略 二维任意点轨迹 预测点轨迹 视频预训练子目标
FlowBot3D 点云网络加解析策略 物体三维关节流 预测物体可动方向

第三十六章:不同架构和动作接口的最佳使用场景

75. Cosmos 统一动作加 Dense Transformer

适合:

  • 主要目标是机器人策略;
  • 模态数量有限;
  • 不要求高质量视频生成;
  • 计算和显存受限;
  • 希望充分利用 VLM 预训练。

76. Cosmos 统一动作加 MoT

适合:

  • 同时需要语言推理、视频、音频和动作生成;
  • AR 与 diffusion 目标差异很大;
  • 数据和计算预算充足;
  • 希望生成任务尽量不破坏推理能力。

Cosmos 3 属于这一类。


77. Action Point 加统一 Transformer

适合:

  • 重点是三维操作;
  • 需要显式接触推理;
  • 不同机器人具有不同几何;
  • 模型容量和数据足以处理高维点流。

PointWorld 属于这一方向。


78. 低维位姿加局部点流残差

一种很有潜力的组合方式是:

$$
\mathbf f_i

\underbrace{
(R-I)\mathbf p_i+\mathbf t
}{\text{刚体主运动}}
+
\underbrace{
\boldsymbol\epsilon_i
}
{\text{局部残差}}
$$

其中:

  • Cosmos 式位姿负责高层刚体动作;
  • Action Point 残差负责柔性变形、接触误差和局部运动。

这可以兼顾低维效率与高维几何表达能力。


第三十七章:怎样公平比较模型性能

一个模型的最终性能不是只由架构决定。

可以概括为:

$$
\text{性能}

f(
\text{动作表示},
\text{主干架构},
\text{参数量},
\text{数据},
\text{损失函数},
\text{训练预算},
\text{控制频率},
\text{采样算法}
)
$$

因此:

  • EO-1 的 98.2%98.2\%98.2%88.0%88.0\%88.0% 主要比较连续 flow 与纯 AR 动作;
  • UWM 的 0.790.790.790.710.710.71 主要比较联合视频—动作建模与普通策略;
  • OpenVLA 的优势同时来自数据、视觉编码器和训练设计;
  • BAGEL 的实验最接近真正的 Dense、MoE、MoT 架构消融;
  • PointWorld 的消融最接近低维动作与点流动作的比较;
  • Cosmos 3 没有提供低维统一动作与 Action Point 的直接同条件对照。

第三十八章:最终结论

关于动作表示

Cosmos 3 使用:

主体位姿+末端位姿+抓取状态 \boxed{ \text{主体位姿} + \text{末端位姿} + \text{抓取状态} } 主体位姿+末端位姿+抓取状态

它低维、紧凑,适合大规模多模态世界模型。

Action Point 使用:

机器人或物体表面各点的三维轨迹 \boxed{ \text{机器人或物体表面各点的三维轨迹} } 机器人或物体表面各点的三维轨迹

它高维、几何明确,适合接触、碰撞和形变推理。

刚体情况下二者满足:

fi=(R−I)pi+t \boxed{ \mathbf f_i= (R-I)\mathbf p_i+\mathbf t } fi=(RI)pi+t

所以 Cosmos 位姿可以看成刚体点流的低维参数化。


关于灵巧手

Cosmos 的手腕加五指尖表示:

可以表达人手动作的主要任务空间效果 \boxed{ \text{可以表达人手动作的主要任务空间效果} } 可以表达人手动作的主要任务空间效果

但不能无损恢复:

26 个完整关节自由度 \boxed{ 26\text{ 个完整关节自由度} } 26 个完整关节自由度

五指尖 Action Point 同样不能。

稠密三维 Action Point 若满足:

rank⁡(JP)=26 \boxed{ \operatorname{rank}(J_P)=26 } rank(JP)=26

并在每个关键指骨和手掌连杆上配置足够的不共线表面点,则在运动学上原则上可以表示全部二十六个自由度。

但无论 Cosmos 还是 Action Point,要实现真正的人类级灵巧控制,还需要:

  • 接触力;
  • 力矩;
  • 触觉;
  • 刚度;
  • 摩擦;
  • 软组织形变。

关于 Transformer 架构

Dense:

全部参数共享,知识迁移强,但冲突最大 \boxed{ \text{全部参数共享,知识迁移强,但冲突最大} } 全部参数共享,知识迁移强,但冲突最大

FFN-only MoE:

分开 FFN,但 Attention 参数仍直接竞争 \boxed{ \text{分开 FFN,但 Attention 参数仍直接竞争} } 分开 FFN,但 Attention 参数仍直接竞争

MoT:

分开完整 Transformer 参数,通过联合注意力交换信息 \boxed{ \text{分开完整 Transformer 参数,通过联合注意力交换信息} } 分开完整 Transformer 参数,通过联合注意力交换信息

MoT 没有完全消除梯度耦合。

它把原本的:

两个任务直接争夺同一套 QKV、FFN 和 LN 参数 \text{两个任务直接争夺同一套 QKV、FFN 和 LN 参数} 两个任务直接争夺同一套 QKVFFN  LN 参数

转化为:

生成任务通过条件注意力选择性影响 Reasoner 表示 \text{生成任务通过条件注意力选择性影响 Reasoner 表示} 生成任务通过条件注意力选择性影响 Reasoner 表示

因此:

MoT 是结构化地减少冲突,而不是让冲突完全消失 \boxed{ \text{MoT 是结构化地减少冲突,而不是让冲突完全消失} } MoT 是结构化地减少冲突,而不是让冲突完全消失


最值得记住的一句话

动作接口决定“机器人动作怎样被描述”,模型架构决定“这些描述怎样被学习” \boxed{ \text{动作接口决定“机器人动作怎样被描述”,模型架构决定“这些描述怎样被学习”} } 动作接口决定机器人动作怎样被描述,模型架构决定这些描述怎样被学习

Cosmos 3 选择了:

低维统一几何动作+MoT 全模态主干 \boxed{ \text{低维统一几何动作} + \text{MoT 全模态主干} } 低维统一几何动作+MoT 全模态主干

PointWorld 选择了:

高维三维点流动作+三维世界模型 \boxed{ \text{高维三维点流动作} + \text{三维世界模型} } 高维三维点流动作+三维世界模型

两条路线并不互相排斥。未来更强的机器人系统很可能同时使用:

低维动作进行规划+点流进行接触预测+关节、力和触觉进行底层控制 \boxed{ \text{低维动作进行规划} + \text{点流进行接触预测} + \text{关节、力和触觉进行底层控制} } 低维动作进行规划+点流进行接触预测+关节、力和触觉进行底层控制
:::

这篇文档已经把动作接口、灵巧手自由度、Action Point、Dense、MoE、MoT、梯度传播和代表模型放在同一条逻辑链中。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐