1.为什么DDPM适合用于预测机器人动作分布?

强大的多峰分布(Multimodal)表达能力。在复杂环境中,完成同一任务通常有多种有效动作(例如遇到大树,左转或右转都是满分,但直走会撞树)。传统强化学习常用的高斯策略(单峰)会取平均值(直走撞树),而 DDPM 能够完美拟合离线数据中复杂、多模态的人类演示行为,既保留了动作的多样性,又能严守数据的“安全边界”。

2.DDPM的训练和推理过程的区别?(特别是对于生成过程的迭代次数)

  • 训练过程(极快,仅需 1 步): 在前向加噪后,系统会随机抽取任意 1 个时间步 $t$,让网络只去预测这一步注入的噪声。各时间步之间互相独立,支持批处理并行计算。

  • 推理过程(极慢,需迭代 $K$ 步): 部署时必须从纯随机噪声开始,严格按顺序执行 $K$ 次(通常数十到数百次)去噪公式。所以有DDIM这种加速采样的方法生成。

  • 总结: 训练是只考一题的“随机抽查”,推理是必须按顺序走完所有步骤的“马拉松”。

3.为什么DDPM相比于一般的Energy-Based Model(EBM)训练要稳定?

绕开了训练时的 MCMC 采样。传统的 EBM 在训练时,为了计算归一化常数(配分函数)的梯度,必须在内循环中进行极其耗时且容易崩溃的 MCMC(如郎之万动力学)采样。DDPM 通过“去噪分数匹配(Denoising Score Matching)”技术,将复杂的能量模型训练直接降维成了最简单的均方误差(MSE)回归任务(只求预测的噪声和真实注入的噪声相等),彻底避开了训练时的采样过程,从而获得了极高的稳定性。

4.DDPM每次预测噪声和样本的概率分布之间有什么关系?

  • 预测噪声精确等价于预测概率分布的“对数梯度(Score)”。

  • 数学上,网络预测的噪声方向,就是当前数据点在对数概率分布上的负梯度方向($-\nabla_x \log p(x)$)。

  • 也就是说,预测噪声本质上是在描绘高维空间中的“重力地形图”——它指引着带噪样本,顺着概率密度升高的方向,一步步“滑落”到真实样本概率最大的“谷底”。

5.DDPM的怎么实现有标签的预测呢?

  • 核心逻辑:将标签作为额外输入“条件化(Conditioning)”。在原来的噪声预测网络中,除了带噪样本 $x_t$ 和时间步 $t$,额外增加一个标签/条件向量 $c$(例如图像类别、文本提示,或者我们前面讨论的机器人观测状态 $O_t$)。此时网络的任务变成了学习条件概率分布,即预测 $\epsilon_\theta(x_t, t, c)$。

  • 网络注入方式:

    1. 特征拼接(Concatenation): 直接将标签向量与噪声图像在通道维度上拼在一起。

    2. 交叉注意力(Cross-Attention): (目前最常用,如 Transformer 中)将带噪样本作为 Query,将标签/条件特征映射为 Key 和 Value,让网络“看着”标签去去噪。

    3. 自适应归一化(如 AdaGN): 用标签特征来控制网络层中的缩放和平移参数。

  • 主流增强技巧:无分类器引导(Classifier-Free Guidance, CFG)。这是目前大模型(如 Stable Diffusion 或高级机器人策略)落地的核心。训练时,以一定概率(如 10%)故意把标签置空,让模型同时学会“无条件生成”和“有条件生成”。推理时,通过公式 $\epsilon_{最终} = \epsilon_{无条件} + w \cdot (\epsilon_{有条件} - \epsilon_{无条件})$,利用权重系数 $w$ 强力放大标签的影响,从而极大地提升生成动作/图像与标签的匹配度。

更多更详细的可在 Diffusion Policy: Visuomotor Policy Learning via Action Diffusion了解。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐