目录

一、ACT的提出背景与模型定位

1.1 为什么单步动作预测不适合精细操作

1.2 ACT是什么

1.3 ACT和ALOHA是什么关系

1.4 ACT不是VLA模型

二、ACT的数据组织与动作分块

2.1 一条示范Episode是什么

2.2 状态、动作与下一状态的关系

2.3 一条Episode怎样切成动作块样本

2.4 动作块和训练批次的张量形状

2.5 动作分块的作用

2.6 ACT的输出形式:连续动作块而不是动作Token

三、ACT的模型结构

3.1 先明确ACT中几个容易混淆的名称

3.2 ACT完整结构

3.3 第一部分:CVAE Encoder负责提取动作风格

3.4 第二部分:ACT Policy负责预测动作块

3.5 图像如何进入ACT Policy

3.6 Policy内部的Transformer Encoder负责什么

3.7 Policy内部的Transformer Decoder负责什么

3.8 ACT到底有几个Encoder和Decoder

四、ACT的训练过程

4.1 ACT不是分成两个阶段分别训练

4.2 一条训练样本的形状

4.3 动作重建损失

4.4 KL正则项

4.5 为什么需要潜变量z

4.6 推理时为什么z不在每一步随机采样?为什么z=0?

4.7 能不能z随机采样一次,并保持整条Episode不变

4.8 ACT和Diffusion的噪声作用不同

五、ACT的推理与时序集成Temporal Ensembling

5.1 推理阶段保留哪些模块

5.2 ACT实际会在每一步重新预测

5.3 时序集成Temporal Ensembling是什么

5.4 ACT仍然是闭环策略

六、ACT的能力与实验意义

6.1 少量示范学习精细任务

6.2 为什么ACT适合双臂任务

6.3 ACT解决了什么,没解决什么

七、ACT的贡献、局限与技术演进

7.1 ACT的核心贡献

7.2 ACT的主要局限

7.3 ACT、RT-1和Diffusion Policy的区别

7.4 整体总结

哲学视角



1.1 为什么单步动作预测不适合精细操作

传统行为克隆通常根据机器人当前观察ot预测当前一步动作at:

这种方法在简单抓取任务中可以工作,但在双臂协作、插入电池、打开杯盖和穿过魔术贴等精细任务中容易出现误差累积。模型在某一步产生较小误差后,机器人就可能进入训练示范中很少出现的状态;下一步预测误差继续增大,最终偏离正确轨迹。ACT论文将这一问题称为模仿学习中的Compounding Error,即误差随着任务时间不断累积。

精细操作通常还需要较高控制频率。ALOHA系统以50Hz记录和执行动作,一段10秒的操作轨迹就包含约500个时间步。如果策略每次只预测一个动作,那么一个任务需要连续作出数百次决策,任何一步的偏差都可能影响后续过程。ACT因此不再只预测当前一步,而是一次预测未来一段动作序列。

1.2 ACT是什么

ACT全称为Action Chunking with Transformers,由Tony Zhao等人在2023年随ALOHA双臂机器人系统提出。ACT是一种基于Transformer、CVAE和动作分块的模仿学习策略,主要面向高频、双臂和精细接触操作。其核心映射不是:

而是:

其中:

表示从当前时刻开始的未来H步动作块。ACT通过一次预测多个连续动作,将原本数百步的任务压缩成数量更少的高层决策单元,从而降低任务的有效决策长度。

1.3 ACT和ALOHA是什么关系

ALOHA全称为A Low-cost Open-source Hardware System for Bimanual Teleoperation,是一套低成本双臂遥操作和数据采集平台;ACT则是使用ALOHA采集的数据训练出的模仿学习算法。二者不是同一个概念:

ALOHA=机器人硬件与遥操作采集系统

ACT=根据示范学习动作序列的策略模型

原始ALOHA系统使用两台ViperX机械臂作为执行端,两台较小的WidowX机械臂作为人类操作端,并通过关节空间映射进行遥操作。系统配有前方、顶部和两个腕部摄像头,图像、机器人状态和遥操作动作以50Hz同步记录。

1.4 ACT不是VLA模型

ACT通常不接收自然语言指令,也没有使用互联网预训练VLM。原始ACT一般针对一个具体任务单独训练,例如“插入电池”或“打开杯盖”,输入是多视角图像和机器人关节状态,输出是未来连续动作块。因此更准确的定位是:

ACT=任务专用的视觉—动作模仿学习策略

ACT的重要意义主要在动作建模侧:它证明了动作分块、CVAE和时序集成可以显著提升高频精细操作的稳定性。


二、ACT的数据组织与动作分块

2.1 一条示范Episode是什么

一条ACT示范Episode,是人类操作者通过遥操作控制机器人,从任务开始到任务结束所记录的一段完整轨迹,可以表示为:

其中,T表示整条Episode包含的控制时间步数。在每一个时刻t,系统同步记录:

原始ALOHA中,观察由4路RGB图像和两条机械臂的当前关节位置组成;动作标签采用两台Leader机械臂的目标关节位置,而不是根据相邻图像计算出的视觉位移。ALOHA双臂系统中,每条机械臂包含6个关节和1个夹爪维度,左右两条机械臂合计:7+7=14维,因此当前状态和动作通常都是:

其中:

因此,qt和at虽然形状相同,但含义不同:

qt=当前实际关节位置

at=当前下发的目标关节位置

动作标签采用Leader机械臂记录的目标关节位置,而不是根据前后图像计算得到的视觉位移,也不是电机电流或力矩。

2.2 状态、动作与下一状态的关系

在示范数据采集过程中,人类操作者根据当前图像和机器人状态给出目标动作;训练完成后,ACT策略将代替人类操作者,根据当前观察预测目标动作:

得到目标动作后,底层位置控制器驱动机器人从当前实际状态qt向目标位置at移动:

当底层位置控制器跟踪速度较快、控制周期较短时,可以近似认为:

但二者并不严格相等:

因此,时间轴上的关系可以理解为:

随后在下一控制时刻继续记录:

整条Episode就是这些图像、实际状态和目标动作沿时间轴连续排列形成的轨迹。

2.3 一条Episode怎样切成动作块样本

首先定义当前观察:

其中,ot包含时刻t的多视角图像和机器人当前实际关节状态。假设动作块长度为H,从完整专家动作轨迹中截取从时刻t开始的未来H步动作:

一条完整Episode可以沿时间轴切成:

 

相邻两个动作块会重叠H−1个动作,只沿时间轴向后移动一个控制步。因此,在时刻t,一条ACT训练样本可以写成:

展开为:

ACT从功能上学习的是:

也就是:

当前多视角图像+当前实际关节状态→未来连续目标动作块

因此,每一个时间步都会对应一个从当前状态开始的未来动作块。训练标签直接来自人类示范中从当前时刻开始的真实目标关节位置序列,ACT学习的是状态下的连续动作块:

而不是根据qt+1−qt或相邻图像位移计算得到。

注:ot是状态,At是连续动作块,at是模型要求机器人执行的目标关节位置,It是图像,qt是机器人当前的关节位置。

2.4 动作块和训练批次的张量形状

ACT输出的是未来多步的双臂目标关节位置:

其中H是动作块包含多少个时间步;D是每个时间步的动作维度。在原始ALOHA双臂机器人中H=100,D=14,展开就是:

如果训练批次大小为32,真正进入网络的数据形状通常是:

含义是:32条训练样本×每条100个未来动作×每个动作14维。因此,一条ACT训练样本可以写成:

这些目标位置由机器人底层高频PID控制器跟踪,ACT本身不直接输出各电机的电流或力矩。原始ACT实验常使用H=100,在50Hz控制频率下,100个动作点约覆盖未来2秒:

100÷50=2秒

但ACT并不是每2秒才观察一次,再完全开环执行100步。实际推理时,模型会不断根据新图像和新关节状态重新预测相互重叠的动作块,后续再通过Temporal Ensembling融合这些预测。

2.5 动作分块的作用

ACT不只预测当前一个动作,而是根据当前观察一次预测未来H步连续动作,动作分块主要有两个作用。

第一,它可以缩短任务的有效决策长度。假设一项任务包含T=500个控制时间步,单步策略需要连续进行约500次动作决策;若动作块长度为H=100,模型每次可以同时学习未来100步动作之间的连续关系。从策略规划角度看,任务可以被理解为约5个较长的动作阶段:

500个单步动作→约5个长度为100的动作段

这并不代表机器人实际上只更新5次,而是说明模型一次输出的内容覆盖更长时间范围,不再把每一个动作都看成相互独立的决策,而是能够整体学习“靠近目标—抓取—抬起”等连续动作结构,从而降低长轨迹中的误差累积

第二,动作块可以提供更完整的时间上下文。人类遥操作数据中经常包含短暂停顿,例如操作者在对准目标时停顿,或者在思考下一步时保持姿态。若模型只根据当前状态预测一个动作:

相似画面可能同时对应“继续移动”和“暂时保持不动”,模型较难判断当前任务阶段。ACT一次学习完整动作块:

即使动作块中间出现停顿,模型也能结合停顿前后的动作判断它是正常操作过程的一部分,而不是机器人应该永久停止。论文指出,动作分块有助于处理人类示范中的时间相关干扰和非马尔可夫行为。

2.6 ACT的输出形式:连续动作块而不是动作Token

ACT与RT-1、RT-2不同。RT-1和RT-2先把动作离散化为动作Token,而ACT直接输出连续目标关节位置,

其中一个at就包括当前的2个机械臂的14个动作信息,是一个连续向量,不是14个离散Token。

因此ACT从输出形式上更接近连续回归模型,而不是动作分类模型。它虽然通过CVAE建模动作分布,但最终Decoder输出的是连续数值,不需要经过256档离散化和反量化。


三、ACT的模型结构

3.1 先明确ACT中几个容易混淆的名称

ACT的结构之所以容易理解混乱,是因为同一个网络会从不同层级被赋予不同名称。首先需要明确四个概念:

名称

实际作用

训练时

推理时

CVAE Encoder

从真实动作块中提取动作风格z

使用

删除

ACT Policy

根据图像、机器人状态和z预测动作块

使用

使用

CVAE Decoder

ACT Policy在CVAE框架下的功能名称

使用

使用

Transformer Decoder

ACT Policy内部负责生成动作块的具体模块

使用

使用

Act的模型结构:

1个训练专用的CVAE Encoder+1个作为CVAE Decoder的ACT Policy

ACT官方项目将其描述为:CVAE Encoder将动作序列和关节状态压缩成风格变量z,ACT Policy作为CVAE的Decoder,根据多视角图像、关节状态和z预测动作序列。最关键的一点是:

ACT Policy=CVAE Decoder

也就是说,“CVAE Decoder”和“ACT Policy”指的是同一个整体策略网络,只是命名角度不同:从CVAE角度看,它负责把条件和潜变量z解码成动作块;从机器人控制角度看,它就是根据当前观察预测未来动作的Policy。而在这个Policy内部,又包含:

视觉编码器+Transformer Encoder+Transformer Decoder+动作输出层

3.2 ACT完整结构

ACT训练阶段的整体结构可以表示为两条汇合路径。

第一条路径负责提取动作风格:

第二条路径负责预测动作:

其中:

3.3 第一部分:CVAE Encoder负责提取动作风格

训练时,ACT拥有真实专家动作块:

CVAE Encoder接收:

但通常不接收相机图像。它要解决的问题不是“画面里有什么”,而是:

这一段专家动作采用了什么运动方式或动作风格?

例如,同样完成抓取任务,专家可能从左侧靠近,也可能从右侧靠近;可能先抬高手臂再横向移动,也可能先横向移动再抬高。这些轨迹差异由潜变量z描述。CVAE Encoder的输入序列可以概括为:

其中,14维关节状态和每一个14维动作向量都会先通过线性层转换为连续特征向量,再送入Transformer Encoder。这里的“动作Token”只是Transformer内部的连续嵌入,不是RT-1、RT-2那种离散动作Token。CVAE Encoder最后根据[CLS]位置的输出预测:

然后通过重参数化得到:

因此,z是对整段动作轨迹风格的低维概括,而不是未来某一个具体关节动作。官方说明中将z称为动作序列的Style,并指出CVAE Encoder使用Transformer实现。

3.4 第二部分:ACT Policy负责预测动作块

得到z之后,ACT Policy接收三类信息:

然后直接输出未来动作块:

这个ACT Policy在CVAE框架中被称为CVAE Decoder,因为它把观察条件和潜变量z解码成动作序列。但它不是一个简单的全连接Decoder,而是由以下模块组成:

ResNet视觉编码器→Transformer Encoder→Transformer Decoder→连续动作输出层

因此,后文讨论“Policy内部的Transformer Decoder”时,不要再把它理解成另一个CVAE Decoder。二者关系是:

3.5 图像如何进入ACT Policy

ACT使用多台摄像头观察环境,例如前方相机、顶部相机和左右腕部相机。每一路图像先经过ResNet-18:

其中,c表示摄像头编号,Ftc是保留空间位置的视觉特征图。特征图沿空间维度展开后形成视觉特征序列:

每个:

都是一个连续视觉Token。不同相机产生的视觉Token被组合起来,为模型提供全局场景、目标物体位置以及夹爪附近的精细信息。原始ALOHA系统使用多视角RGB相机进行闭环视觉控制。

3.6 Policy内部的Transformer Encoder负责什么

当前机器人状态qt和动作风格z分别经过线性投影:

然后与多视角视觉Token一起进入Policy内部的Transformer Encoder:

其中:

可以称为Encoder Memory。它综合表示:

因此,Policy内部的Transformer Encoder负责的是:

多模态信息融合

而不是直接输出机器人动作。

3.7 Policy内部的Transformer Decoder负责什么

为了输出未来H个动作,ACT设置H个可学习的Action Query:

每个Action Query对应动作块中的一个未来时间位置:

Transformer Decoder让这些Action Query读取Encoder Memory,即Transformer Encoder编码器Mt输出+Transformer Decoder解码器中的Q映射到特征hi

其中,每个:

表示未来第i个时间位置的动作特征。最后,每个动作特征经过同一个连续动作输出层

得到:

于是完整输出为:

这里没有256档离散化,没有动作词表,也没有从Token反量化的过程。Transformer Decoder输出的是动作隐藏向量,最后由线性层直接变成连续关节目标。

3.8 ACT到底有几个Encoder和Decoder

从完整网络结构看,ACT可以分为两个结构:

①1个CVAE Encoder

它内部使用Transformer Encoder,从真实动作块中提取z。

②1个CVAE Decoder(Policy)

1个视觉Encoder+1个Transformer Encoder+1个Transformer Decoder+1个动作输出头

因此,可以最终记成如下,推理时用于提取z的CVAE Encoder会被删除。


四、ACT的训练过程

4.1 ACT不是分成两个阶段分别训练

ACT虽然包含“提取z”和“预测动作块”两条处理路径,但并不是先训练完CVAE Encoder,再单独训练动作预测网络。一次完整训练前向过程为:

然后一次反向传播同时更新:

因此更准确的说法是:

ACT在结构上包含动作风格编码和动作预测两个功能模块,但整个模型通过同一个总损失端到端联合训练。

ACT的数据来自人类遥操作示范,其核心训练目标仍属于模仿学习中的行为克隆。模型根据当前图像和关节状态预测人类接下来会执行的动作块,并让预测结果接近真实示范。ACT不依赖机器人在线随机探索,也不主要使用环境奖励训练策略。

4.2 一条训练样本的形状

对于一条训练样本,输入观察为:

专家动作块为:

其中:

双臂ALOHA中:

如果训练批次大小为B,动作数据形状为:

三个维度分别代表:

训练样本数量×未来动作数量×每个动作的维度

4.3 动作重建损失

ACT Policy输出:

然后与专家动作块逐时间步、逐动作维度计算L1损失:

 

例如:

会与专家示范中的:

进行比较。损失不仅要求当前动作正确,还要求整个未来动作块都接近专家轨迹。ACT使用行为克隆学习专家动作序列,并通过动作分块缩短策略的有效决策长度。L1损失会对每一个未来时间步、每一个关节维度计算绝对误差。论文作者报告,使用L1比L2更有利于精确建模动作序列;同时,直接预测绝对目标关节位置比预测关节增量效果更好。

4.4 KL正则项

CVAE Encoder产生:

ACT还使用KL损失,使该分布接近标准正态分布:

总损失可以写成:

其中,重建损失要求z能够帮助Policy还原真实动作块,KL损失则避免每条示范的z分布得过于分散,使训练阶段得到的潜变量接近统一先验分布。β控制隐变量中可以携带多少动作风格信息。原始ACT实验中使用β=10。

4.5 为什么需要潜变量z

同一幅画面、同一机器人状态下,可能存在多条合理轨迹。例如:

如果直接使用普通回归,模型可能把两条轨迹平均:

平均轨迹未必是一条合理轨迹。ACT使用z描述不同示范的整体动作风格,使Policy能够根据:

当前观察+动作风格

重建对应的完整动作块。不过,原始ACT在推理阶段并没有重点追求多样化采样,而是更重视动作稳定和任务成功率。

4.6 推理时为什么z不在每一步随机采样?为什么z=0?

①推理时为什么z不在每一步随机采样?

假设每一个控制时间步都重新采样:

可能出现:

t时刻:zt代表从左侧靠近

t+1时刻:zt+1代表从右侧靠近

这样两个连续动作块可能选择不同风格,导致机械臂轨迹左右跳动。尤其ACT每个控制周期都会重新预测一个动作块,如果每次z都随机变化,策略会缺少时间一致性。

②推理时为什么z=0?

推理阶段没有真实未来动作,因此无法再通过CVAE Encoder计算z。ACT直接丢弃Encoder,并将:

z=0

也就是使用标准高斯先验的均值,进行确定性动作解码。这样能够获得较稳定、可重复的动作轨迹,可以得到确定性输出:

相同观察→相同动作块

这对于真实机器人安全和动作平滑更加重要。但也意味着原始ACT在实际部署时没有充分随机采样多种动作模式。

4.7 能不能z随机采样一次,并保持整条Episode不变

可以。这比每个时间步重新采样更合理:

然后整条Episode中固定这个z:

z0=z1=⋯=zT

这样可以让机器人选择一种动作风格,并在整个任务中保持一致。不过原始ACT实验更关注任务成功率和稳定性,而不是生成多样化行为,所以直接采用z=0使用先验均值进行确定性推理。

4.8 ACT和Diffusion的噪声作用不同

ACT的z和Diffusion Policy的随机噪声看起来相似,但角色完全不同。

①ACT中:

z=低维动作风格条件

策略直接一次输出动作块:

所以ACT中的z只是帮助Decoder选择动作模式,不是需要被还原成动作的噪声本体。

②Diffusion Policy中:

这里的随机噪声与最终动作块具有相同或相近的形状,例如:

模型必须经过多轮去噪:

随机噪声是Diffusion生成过程必需的初始状态。没有这个随机噪声,就没有“从噪声逐步生成动作”的过程。

③两者综合比较


五、ACT的推理与时序集成Temporal Ensembling

5.1 推理阶段保留哪些模块

推理阶段没有真实专家动作块,因此删除:

CVAE Encoder

只保留ACT Policy:

多视角图像+当前关节状态+z→视觉编码器→Transformer Encoder→Transformer Decoder→动作块

完整映射为:

其中:

5.2 ACT实际会在每一步重新预测

假设在时间t,ACT输出:

机器人并不是必须把整个动作块完全开环执行结束。到了时间t+1,模型读取新的图像和关节状态,再输出:

因此,相同的未来执行时刻会被不同时间生成的动作块重复预测。例如真实时间t+2会得到:

5.3 时序集成Temporal Ensembling是什么

需要注意,Temporal Ensemblin不会只采用最新动作块中的预测,而是对所有指向同一真实时间步的动作进行加权平均。例如在时间t,模型预测:

到了时间t+1,模型根据最新观察又预测:

到了时间t+2,再次预测:

因此对于真实时间t+2,一共有三份预测:

时序集成将它们加权平均:

通常越新的预测权重越高,因为它使用了更新的图像和机器人状态。所以Temporal Ensembling的本质是:

旧规划提供稳定性+新规划提供最新环境反馈

这样可以减少模型每次重新预测动作块时产生的轨迹跳变和机械臂抖动。

5.4 ACT仍然是闭环策略

ACT虽然一次输出未来多个动作,但仍然会持续读取新观察:

观察→预测动作块→执行当前融合动作→新观察→重新预测

因此ACT不是:

当前观察→一次输出2秒动作→完全不再观察

而是:

动作块规划+高频视觉反馈+时序集成


六、ACT的能力与实验意义

6.1 少量示范学习精细任务

原始论文使用ALOHA采集人类示范,每个真实任务通常包含约50条示范,单条示范持续8至14秒,约相当于10分钟左右的总示范数据。ACT在打开透明调味杯、插入电池、打开拉链袋、准备胶带和穿鞋等高精度双臂任务上表现出明显优势;论文报告多项任务达到约80%至90%的成功率。

6.2 为什么ACT适合双臂任务

一个时刻的动作:

同时包含左右两条机械臂,因此模型不会分别独立预测左右手,而是联合生成:

模型能够同时学习:

这比单独预测两条机械臂更容易保持双臂的时间协调。双臂操作要求两条机械臂在时间上保持一致,例如一只手固定物体,另一只手完成插入;或者一只手交接胶带,另一只手接住。如果左右手动作分别独立预测,容易出现一只手先到、另一只手未准备好的问题。Transformer在生成时可以联合建模左右手在未来多个时间步的协调关系,因此比逐手、逐步预测更适合双臂协作。

6.3 ACT解决了什么,没解决什么

ACT重点解决的是:

高频长轨迹+误差累积+人类示范随机性+双臂时序协调

但它没有解决开放语言理解、跨机器人泛化和互联网知识迁移。原始模型每个任务从头训练,主要学习固定机器人、固定相机和固定任务的数据分布。因此原始ACT更准确的定位仍然是:

任务专用的视觉—动作模仿学习策略

而不是通用VLA或世界模型。


七、ACT的贡献、局限与技术演进

7.1 ACT的核心贡献

第一,ACT将机器人策略从单步动作预测改为未来动作块预测,将高频长任务的有效决策长度明显缩短。

第二,它提出Temporal Ensembling,将多个重叠动作块对同一时间步的预测融合,提高动作平滑性和闭环响应能力。

第三,它通过CVAE潜变量z建模人类示范中的动作变化,而不是只用普通单一回归。

第四,它证明低成本双臂硬件配合高质量示范和动作分块策略,也能完成插接、开盖和柔性物体操作等精细任务

7.2 ACT的主要局限

第一,ACT通常针对单一任务从头训练,不具备RT-2或π0那样的互联网视觉语言知识。

第二,行为克隆仍受训练分布限制,机器人进入示范中没有覆盖的状态后可能无法恢复。

第三,动作块长度需要在连贯性和反馈速度之间权衡,过长会削弱环境变化响应,过短则失去分块优势。

第四,Temporal Ensembling要求每一步重新运行模型并维护重叠预测,增加推理计算。

第五,虽然训练时使用CVAE描述动作变化,但原始部署把z固定为0,实际生成接近确定性策略,没有充分利用CVAE生成多种行为的能力。

第六,视觉感知不清晰时,动作分块无法解决目标位置本身难以识别的问题;论文在穿魔术贴和打开扁平拉链袋等任务中仍观察到明显失败。

7.3 ACT、RT-1和Diffusion Policy的区别

对比项

RT-1

ACT

Diffusion Policy

模型定位

多任务语言条件策略

精细动作块策略

扩散式视觉运动策略

输入

语言+最近6帧图像

当前多视角图像+关节状态

视觉或状态观察历史

输出

单步离散动作Token

连续动作块

连续动作块

动作生成

并行分类

CVAE+Transformer直接解码

从噪声迭代去噪

多模态建模

较弱

CVAE隐变量

扩散动作分布

闭环方式

每步重新预测

重叠动作块+时序集成

Receding Horizon

语言能力

USE任务条件

原始模型通常无语言

原始模型通常无语言

7.4 整体总结

1.ACT训练阶段:

【CVAE编码】真实动作块+当前关节状态→CVAE Encoder→z

【CVAE解码】:多视角图像→ResNet→视觉Token

视觉Token+当前关节状态+z→Policy内部Transformer Encoder

H个Action Query+Encoder Memory→Transformer Decoder

H个动作隐藏向量→线性动作头→H×D预测的连续动作块

动作重建损失+KL损失→整个模型联合反向传播

2.ACT推理阶段:

删除CVAE Encoder

z=0

当前图像+当前关节状态→ACT Policy→未来动作块

不同时间产生的重叠动作预测→Temporal Ensembling→当前执行动作

3.ACT需要重点记住八点:

①ACT从结构上是一个条件VAE,但真正部署的机器人策略是CVAE的Decoder。

②CVAE Decoder与ACT Policy是同一个整体模块,不是两个不同的动作解码器。

③ACT Policy内部包含视觉编码器、Transformer Encoder、Transformer Decoder和连续动作输出层。

④训练时另外存在一个CVAE Encoder,用真实动作块和当前关节状态提取潜变量z。

⑤训练阶段一共有两个Transformer Encoder,但只有一个Transformer Decoder。

⑥推理阶段删除CVAE Encoder,只保留Policy内部的Transformer Encoder和Transformer Decoder。

⑦一个动作:

一个动作块:

双臂示例中可以写成:

⑧ACT最终直接输出连续动作向量,不进行动作离散化,也没有动作词表。

⑨推理时使用z=0,是因为它是标准正态先验的均值,可以提供稳定、确定的动作风格;它与Diffusion Policy的动作噪声不是同一个概念。

⑩Temporal Ensembling即“时序集成”,平均的是不同时间对同一未来执行时刻的预测,而不是把相邻时刻的动作直接平均。


哲学视角

“动作分块不是少做决策,而是让决策彼此承担后果。”

——当50Hz控制把一次精细操作拉成长达数百步的轨迹,100步动作块便不再只是批量输出,CVAE中的z也不只是随机变量,Action Query、连续关节目标与Temporal Ensembling更不是彼此孤立的模块;它们共同把容易累积的单步误差,翻译成可被整体建模、持续校正的运动结构。ACT表面上是在预测双臂下一段怎么动,本质上是在重新安排决策与反馈的边界:旧动作块保留惯性,新观察修正规划,z=0约束风格,时序集成消解跳变。真正改变的不是机器人一次看得更远,而是每一次新判断都能继承过去,又允许现实及时改写未来。

结尾语:如果本文对您有帮助,请点赞鼓励一下,这对我真的很重要。您的每一次鼓励,都是我继续创作的动力,谢谢啦!下次见。
 

 

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐