MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

于现代强化学习系统里, 像是训练视觉语言动作模型VLA或者大规模机器人控制策略时, 因策略滞后亦即Lag, 致使数据Off -现象变成难于避免的常态了。不论在数据被反复复用迭代的同步更新当中, 还是在采样与训练解耦的分布式Actor -异步架构之下, 都存在数据与当前策略的脱节问题。尤其是在具身真机场景里, 鉴于物理采集缓慢且高度依赖历史数据回放, 这种滞后程度更是被推到了极端。

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

近期, 树根科技与三一集团团队联合提出了GIPO算法, 在机器人操控中, , 在大语言/视觉动作模型(VLA)强化学习训练里, GIPO显著缓解了数据短缺导致的策略滞后痛点, 还有效改善了PPO硬截断引发的“利用率崩溃()”问题。

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

GIPO :用比例看问题,而不是用绝对差值看问题

核心公式

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

对数空间对称性:一种优雅的平衡

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

平滑性与非零梯度:拯救 “死样本”

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

偏差 - 方差的 “帕累托旋钮”

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

-Aware GIPO

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

理论基石:策略性能下界与有限样本保证

代理目标的理论下界

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

有限样本控制与稳定性

于真实的强化学习训练里, 鉴于没办法计算期望, 仅仅能够从回放池中提取有限的批次大小(假定为N)去开展经验估计():

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

从实验得出的结果是, 存在方差, 存在偏差平衡性能, 以及7B VLA在工业领域实现应用落地。

方差 - 偏差平衡性能帕累托最优

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

诸多分析结果呈现出了GIPO具备的良好方差 - 偏差平衡性, 在那种严重滞后的特定场景下, 也就是Case A以及Case B的情形里, PPO测算得到的方差可谓是竟然为0, 然而真实状况并非是由于PPO自身稳定, 是因为其硬截断机制把所有样本都直接判定为“越界”, 进而造成了100%的样本梯度走向死亡, 没有了梯度, 自然而然就没有了方差, 这就等同于模型停止了自身的学习。

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

图2, 呈现的是, 2x2网格世界里的, 偏差与方差的权衡情况。其中, GIPO(虚线所示), 切实地定义了, 帕累托前沿(), 然而, PPO在高滞后场景下, 却完全停止了学习。

工业级验证规模

于当下的具身智能范畴之内, 因受限于高昂的物理交互成本以及长视野连续控制的繁杂性, 可把策略优化算法径直部署至数十亿参数模型之上的研究是不多见的。GIPO团队为了对其算法在真实世界的扩展性予以验证, 投入了规模庞大的计算资源, 模型基座采用了7B参数量的-OFT当作骨干网络, 整个评估流程耗费了超过10, GPU小时, 在机器人多任务操作基准方面, 处理了超过7.3亿次交互采样。

研究团队为评估算法针对策略滞后的鲁棒性从而设计了两种数据场景, 借助控制采样器与训练器的比例以实现人为制造不同程度的数据滞后, 新鲜场景是配置 10 个采样器对应 1 个训练器(或者类似高吞吐配置), 使得数据收集速度快, 进而让回放池中的样本极为接近当前策略。过期情境(Stale): 硬性削减吞吐量(像是 1 个采样器对应 1 个训练器), 致使训练器必须再三咀嚼回放池里过时的过往数据, 造成类似真机情境的策略延迟。

如图3所示, 在所呈现的新鲜场景当中, GIPO、PPO以及SAPO, 每一个都能够获取到相当不错的表现, 其中GIPO略微占据优势或者处于持平状态。不过, 只要一旦进行切换, 转变到陈旧场景的时候, 算法相互之间的性能差距便会被拉开。当面对陈旧数据的情形下, PPO的学习曲线通常在早期阶段就会陷入到停滞状态, 最后收敛到一个相对较低的平均回报水平。SAPO尽管引入了软门控, 然而在处理高滞后数据之际, 依旧展现出较大的波动以及次优的样本效率。GIPO 具备这样的特性, 它能够以更快的速度去逼近最优成功率, 进而展现出极为强大的抗滞后能力, 以及稳定性。

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

图3, 机器人套件学习曲线,在诸如 - 和 -10这般的复杂任务里头, GIPO的优势历经进一步的加大过程, 它向世人展示了其于数十亿参数VLA任务当中所具备的实战价值。

多种子实验

在陈旧数据环境当中, 团队对八种算法配置进行了对比, 这八种当中包含优势感知变体。这些配置覆盖了十个不同的机器人操控任务。为了把随机性干扰给消除掉, 对于每一个配置, 采用了五个随机种子, 一共运行了四百个独立的训练实例。把统计指标IQM(也就是所谓的Mean, 即分位数均值)拿来作排名, GIPO呈现出极大优势, 如下方聚合排名表所呈现的那样, GIPO系列占据靠前的前6个名次, 其中GIPO(1.0, 1.0)的平均归一化得分是(0.730), 竟然达到了PPO(0.180)的4倍还要多。

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

GIPO变体的IQM表现, 显著高于SAPO以及PPO基准, 即便处于策略滞后环境, 其展现的成功率提升曲线依旧保持惊人平滑度, 同时实验结果有力验证“对数对称性”与“优势感知”能够兼容且相得益彰, GIPO的数学框架可轻松嵌入非对称逻辑, 同时维持其独有的理论稳定性上限。

要留意的是, GIPO 的出色之处并非仅仅限定于应对延迟的 “救场”情况。处于策略迟缓很轻微的全新情景当中, GIPO 同样体现出了良好的性能上限。置身于包含 10 个任务、总共 250 次独立训练运行的大规模 Fresh 实验里, GIPO 依旧维持着领先地位。如下表所呈现的, 哪怕是在通用配置时, GIPO 的 IQM(分位数均值)得分仍然达到了 PPO 的两倍多。这表明, GIPO不但能够对“旧数据”予以处理, 而且还能够将“新数据”的价值更优地予以发挥, 在线RL的学习效率由此得到显著提升。

强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差_MEAN

大模型落地的 “稳压器”:GIPO 助推 登顶 SOTA

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

进行数十亿参数规模的视觉 - 语言 - 动作(VLA)模型的强化学习训练, 怎样做到高效, 这是行业公认的难题。为此, 团队推出了, 首个专为 VLA 模型设计的框架, 这个框架是全异步、解耦式强化学习与世界模型框架。

历经物理隔离训练, 经过推理, 借助采样流, 打破了传统框架里头的同步壁垒, 还首次导入了“即插即用”的能够训练的世界模型, 达成了令人吃惊的200倍(20,000%)的数据效率提高, 可是, 这种极为出色的工程性能给底层有着更严格要求, 这恰恰是GIPO完全展示本领的地方。 标点符号有点难严格按要求来, 尽力了。

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

为什么 选择 GIPO?

运用物理隔离设计由此使得系统的吞吐量得到了大幅度的提升。可是呢, 这样一种“全异步”的分布式架构属于一把双刃剑: 它于消除硬件闲置、达成吞吐量超线性扩展之际, 不可避免地造成了剧烈的策略滞后(Lag)。

训练与采样可在非阻塞管道里独立开展, 致使回放池中满是陈旧的 Off-数据。经实验证实, 于这种滞后情形下, 标准 PPO 会频繁触动硬截断机制, 使得大量含有关键修正信号的样本梯度直接变为零, 成为没有作用的“死样本”, 对训练效率产生阻碍。

GIPO凭借其独具标志性的平滑高斯信任权重, 为其提供了一套有着数学保证的阻尼机制, 让其一以贯之地稳稳消化这些过时样本, 进而成为了整个框架处理异步偏差的核心优化引擎。另外, 它实现了借助世界模型想象生成强化学习训练数据之事。虽说这些数据拓宽了探索边界但也依旧存在合成偏差之状况。GIPO借助对数空间对称性, 从当中提取了改进信号, 致使“在想象中学习”不会再因梯度不稳定而走向崩溃。

如下如所示, 在针对算法目标开展的消融实验里, 配备GIPO的系统展现出了令人惊异的学习速度, GIPO在约8,000步时所达到的性能水准, 标准PPO要花费60,000步才可触碰到, 这表明在相同的硬件情形下, GIPO把样本利用效率提高了整整7.5倍。

图 4:GIPO 和 PPO 在 AcceRL 中效果对比

图 4:GIPO 和 PPO 在 中效果对比

登顶

在名为长视野(Long-)的操控任务里, GIPO起到助力作用, 在此助力下展示出了优秀的稳定性。相较于对早期误差敏感的传统监督微调而言(其成功率为90.7%), 在GIPO的支撑状况下达成了突破: 在-Long任务套件当中, 达成了99.1%的成功率。这样的表现源自GIPO具备的优异偏差 - 方差权衡, 该权衡确保了模型在执行复杂多步动作之际, 能够从轻微的扰动里恢复过来, 维持了策略在长周期期间的连续性以及稳定性。

结语:算法美学与工程力量的共振

框架获取成功, 这验证了GIPO于大规模异步训练里的底层基石作用。GIPO凭借稳健地处理异策略偏差之举, 突破了分布式系统中的稳定性瓶颈, 能为‘大规模VLA + 异步RL + 世界模型’此一架构予以可靠的算法护航, 最终于基准测试中收获了SOTA成绩。

MEAN_强化学习策略滞后数据Off-policy GIP算法机器人操控大语言视觉动作模型VLA PPO硬截断利用率崩溃对数空间对称性帕累托旋钮优势感知理论基石策略性能下界有限样本保证方差偏差

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐