偏微分方程 & 热力学视角 到动力学看具身模型
大模型特征处理、空间映射、结构变换核心数学
整体链路:原始输入 →特征提取 →映射到隐空间 →注意力结构变换 →非线性激活 →输出预测。
没有拉普拉斯、Z变换;主力是线性代数、矩阵运算、概率统计、微分求导、三角/复数。
1、特征投影:把原始数据映射进隐空间
1.1 Embedding(词/Token嵌入)
hi=We⋅xi \boldsymbol h_i = \boldsymbol W_e \cdot x_i hi=We⋅xi
We∈Rdmodel×VW_e\in\mathbb R^{d_{model}\times V}We∈Rdmodel×V 嵌入矩阵;xix_ixi是one‑hot token索引。
作用:离散token映射到连续高维隐空间向量。
1.2 跨模态Projector(视觉、语音接入LLM,你VLA经常碰到)
基础线性投影:
hout=W⋅hin+b \boldsymbol h_{out}=W\cdot \boldsymbol h_{in}+b hout=W⋅hin+b
升级:多层MLP、LN归一化。
不同模态维度不一致,通过矩阵乘法,对齐到同一个公共隐空间。
Layer Normalization 层归一化(每一层必用)
LN(x)=γx−μσ2+ϵ+β \mathrm{LN}(\boldsymbol x)=\gamma \frac{\boldsymbol x-\mu}{\sqrt{\sigma^2+\epsilon}}+\beta LN(x)=γσ2+ϵx−μ+β
μ\muμ均值,σ\sigmaσ方差;约束隐空间向量分布,防止数值爆炸/漂移。
2、位置信息注入:给特征带上时序/空间位置
RoPE旋转位置编码(复数形式,代码拆成实数)
Q~=Q⊙[cosmθsinmθ],K~=K⊙[cosmθ−sinmθ] \tilde{Q}=Q \odot \begin{bmatrix}\cos m\theta \\ \sin m\theta\end{bmatrix},\quad \tilde{K}=K \odot \begin{bmatrix}\cos m\theta \\ -\sin m\theta\end{bmatrix} Q~=Q⊙[cosmθsinmθ],K~=K⊙[cosmθ−sinmθ]
复数视角:qejmθq e^{jm\theta}qejmθ,用复指数旋转向量,给特征附加相对位置。
仅数学形式是复指数,不做拉普拉斯变换。
3、注意力:隐空间特征做结构交互变换(Transformer核心)
Scaled Dot‑Product Attention
Attention(Q,K,V)=softmax(QK⊤dk)V \mathrm{Attention}(Q,K,V)=\mathrm{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right)V Attention(Q,K,V)=softmax(dkQK⊤)V
- Q,K,VQ,K,VQ,K,V全部是矩阵;QK⊤QK^\topQK⊤:计算token与token之间相似度;
- dk\sqrt{d_k}dk缩放,防止点积数值过大;
- softmax:把相似度转为0~1概率权重;
- 乘以V:按照权重聚合其它token的特征,完成特征的信息交换、结构重组。
多头注意力
MultiHead(Q,K,V)=Concat(head1,...,headh)WO \mathrm{MultiHead}(Q,K,V)=\mathrm{Concat}(\mathrm{head}_1,...,\mathrm{head}_h)W^O MultiHead(Q,K,V)=Concat(head1,...,headh)WO
headi=Attention(QWiQ,KWiK,VWiV) \mathrm{head}_i=\mathrm{Attention}(QW_i^Q,KW_i^K,VW_i^V) headi=Attention(QWiQ,KWiK,VWiV)
把隐空间拆多组子空间,每组捕捉不同类型语义特征。
因果掩码(时序/轨迹生成)
mask把未来位置的分数设置为−inf-inf−inf,softmax之后权重=0,看不到未来token。
4、非线性变换 MLP(给模型带来复杂拟合能力)
h′=Act(W1h+b1)W2+b2 \boldsymbol h' = \mathrm{Act}(W_1\boldsymbol h +b_1)W_2 +b_2 h′=Act(W1h+b1)W2+b2
主流激活:
- GELU:GELU(x)=x Φ(x)\mathrm{GELU}(x)=x\,\Phi(x)GELU(x)=xΦ(x),Φ\PhiΦ高斯累积分布函数;
如果没有非线性,无论堆多少层,整体等价一个大矩阵乘法,只能做线性变换,无法学习复杂语义。
5、输出层 & 概率建模
Softmax,把隐特征映射为token概率分布
softmax(zi)=ezi∑jezj \mathrm{softmax}(z_i)=\frac{e^{z_i}}{\sum_j e^{z_j}} softmax(zi)=∑jezjezi
损失函数(训练阶段)交叉熵
L=−1N∑ilog(pmodel(yi∣xi)) \mathcal L=-\frac1N\sum_i \log(p_{model}(y_i|x_i)) L=−N1i∑log(pmodel(yi∣xi))
衡量模型预测分布和真实标签分布差距。
6、训练反向传播:自动微分(求参数更新)
链式法则:
∂L∂W=∂L∂hout∂hout∂W \frac{\partial \mathcal L}{\partial W}=\frac{\partial \mathcal L}{\partial h_{out}} \frac{\partial h_{out}}{\partial W} ∂W∂L=∂hout∂L∂W∂hout
Adam优化器:基于梯度一阶、二阶矩更新权重矩阵 W←W−η⋅m^/v^+ϵW\leftarrow W-\eta\cdot \hat m/\sqrt{\hat v+\epsilon}W←W−η⋅m^/v^+ϵ。
全部数值微分,不是解析拉普拉斯、不是Z变换。
7、扩散 / 流匹配(VLA生成轨迹,动作特征)
流匹配:学习向量场 vt(xt,t)v_t(x_t,t)vt(xt,t),ODE数值演化
dxdt=vθ(xt,t) \frac{dx}{dt}=v_\theta(x_t,t) dtdx=vθ(xt,t)
用欧拉、RK做数值积分求解微分方程,只是数值迭代,不解析求拉普拉斯变换。
8、矩阵视角总概括
整个大模型前向,本质一串:
矩阵乘法(空间投影)→归一化 →位置旋转 →注意力矩阵相似度聚合 →非线性激活 →重复堆叠N层
没有出现的数学
- ❌拉普拉斯变换 sss域
- ❌Z变换、零极点、单位圆
这一套属于伺服控制,不在Transformer内部;大模型输出轨迹张量之后,交给伺服DSP才会用到。
速记对照表
| 模块 | 核心数学 | 作用 |
|---|---|---|
| Embedding / Projector | 矩阵乘法 Wx+bWx+bWx+b | 原始特征映射到统一隐空间 |
| LayerNorm | 统计均值方差归一化 | 稳定隐空间分布,对抗表征漂移 |
| RoPE | 复指数旋转(cos/sin) | 给特征增加位置信息 |
| 注意力 | QK⊤QK^\topQK⊤矩阵点积+softmax | 特征之间做结构交互、信息聚合 |
| MLP | 矩阵乘法+非线性激活 | 拟合复杂语义模式 |
| 输出预测 | softmax+交叉熵 | 隐特征转为离散token/动作概率 |
| 训练 | 链式求导+Adam梯度更新 | 更新所有权重矩阵 |
| 流匹配/扩散 | ODE数值欧拉/RK积分 | 生成连续动作轨迹 |
相关数学算法分类汇总
分为四大块:力学矩阵(机器人)、回归算法、空间/几何算法、深度学习常用算子,区分:哪些在机器人动力学用、哪些在大模型用。
一、拉格朗日系列(机器人动力学,大模型本身不用)
1.拉格朗日动力学矩阵
拉格朗日方程:
M(q)q¨+C(q,q˙)q˙+G(q)=τ\boldsymbol M(\boldsymbol q)\ddot{\boldsymbol q}+\boldsymbol C(\boldsymbol q,\dot{\boldsymbol q})\dot{\boldsymbol q}+\boldsymbol G(\boldsymbol q)=\boldsymbol \tauM(q)q¨+C(q,q˙)q˙+G(q)=τ
- M(q)\boldsymbol M(\boldsymbol q)M(q):质量惯性矩阵(正定对称矩阵)
- C\boldsymbol CC:科氏/离心力矩阵
- G\boldsymbol GG:重力项
- τ\boldsymbol\tauτ:关节力矩
RNEA递归牛顿‑欧拉是数值计算这套;Pinocchio库底层求解。
用途:机械臂逆动力学、前馈力矩计算、仿真。
2.拉格朗日乘子(约束优化)
L=f(x)+λg(x)\mathcal L=f(x)+\lambda g(x)L=f(x)+λg(x)
用于带约束优化:机器人关节限位、碰撞约束、QP二次规划;
也出现在部分损失函数约束、SVM。
注意区分:拉格朗日(力学优化)≠拉普拉斯(微分变换)。
二、回归算法(拟合输入输出映射)
线性回归
y^=XW+b\hat y = XW+by^=XW+b
最小二乘损失:L=∥XW−y∥22\mathcal L=\|XW-y\|_2^2L=∥XW−y∥22
用途:系统辨识、基线拟合;深度学习最基础单元。
岭回归(L2正则)
L=∥XW−y∥22+λ∥W∥22\mathcal L=\|XW-y\|_2^2+\lambda\|W\|_2^2L=∥XW−y∥22+λ∥W∥22
防止矩阵奇异、过拟合。
Lasso回归(L1正则)
L=∥XW−y∥22+λ∥W∥1\mathcal L=\|XW-y\|_2^2+\lambda\|W\|_1L=∥XW−y∥22+λ∥W∥1
产生稀疏权重,做特征筛选。
弹性网 Elastic‑Net
L1+L2组合,兼顾稀疏与稳定。
逻辑回归
y^=σ(XW+b),σ(z)=11+e−z\hat y=\sigma(XW+b),\quad \sigma(z)=\frac1{1+e^{-z}}y^=σ(XW+b),σ(z)=1+e−z1
做二分类;Transformer最后分类头本质就是逻辑回归。
多项式回归
把特征升阶,拟合非线性曲线。
高斯过程回归 GPR
概率式非参数回归,输出均值+方差;机器人状态估计、噪声预测。
贝叶斯回归
权重视作随机分布,给出置信区间。
大模型里的MLP本质就是堆叠多层广义非线性回归。
三、空间 & 几何算法(机器人三维空间、向量空间)
1.刚体变换
- 旋转矩阵 R∈R3×3R\in\mathbb R^{3\times3}R∈R3×3
- 齐次变换矩阵 T=[Rp01]T=\begin{bmatrix}R & p\\0 & 1\end{bmatrix}T=[R0p1]:正向运动学FK
- 四元数:避免万向锁,姿态表示
- Twist(扭量):6维运动旋量(线速度+角速度)
- Wrench(力旋量):6维力力矩
2.运动学
- 正向运动学 FK:关节角度→笛卡尔位姿
- 逆向运动学 IK:笛卡尔目标→求解关节角度;数值IK常用雅可比迭代
- 雅可比矩阵 J(q)J(q)J(q):关节空间 ↔笛卡尔空间速度映射
x˙=J(q)q˙\dot x=J(q)\dot qx˙=J(q)q˙
3.空间矩阵分解
- SVD奇异值分解:姿态求解、矩阵伪逆、降维、最小二乘解、雅可比求逆
- QR分解:最小二乘、正交化
- Cholesky分解:正定矩阵(惯性矩阵M)快速求逆、QP求解
- LU分解:线性方程组求解
4.优化/几何规划
- QP二次规划:机器人力矩优化、柔顺控制、接触力求解
- 梯度下降:空间位姿迭代优化
- 主成分分析PCA:向量空间降维,找数据主方向
- 流形优化:旋转、姿态属于流形,不能直接欧式梯度更新
5.距离度量(向量隐空间)
- L2距离:∥a−b∥2\|a-b\|_2∥a−b∥2,向量库HNSW检索
- 余弦相似度:cosθ=a⊤b∣a∣∣b∣\cos\theta=\dfrac{a^\top b}{|a||b|}cosθ=∣a∣∣b∣a⊤b,RAG检索、注意力Q‑K相似度
- L1曼哈顿距离
四、深度学习/大模型常用矩阵&算子
- 嵌入矩阵 WeW_eWe:离散token映射隐空间
- 多头注意力矩阵 Q,K,VQ,K,VQ,K,V;softmax(QK⊤d)V\mathrm{softmax}(\frac{QK^\top}{\sqrt d})Vsoftmax(dQK⊤)V
- LayerNorm:向量归一化,对抗表征漂移
- RoPE:复指数旋转矩阵,位置编码
- MLP:矩阵乘法+非线性激活(GELU/ReLU)
- 交叉熵损失:分类概率拟合
- 自动微分链式法则,Adam优化
扩散 /流匹配
ODE向量场:dxdt=vθ(xt,t)\dfrac{dx}{dt}=v_\theta(x_t,t)dtdx=vθ(xt,t),欧拉、RK数值积分
五、快速区分哪些在哪用
| 算法 | 主要使用领域 |
|---|---|
| 拉格朗日动力学M/C/G矩阵 | 机械臂动力学,不在大模型内部 |
| 拉格朗日乘子 QP | 约束优化、机器人控制 |
| 线性/岭/Lasso回归 | 辨识、基线模型;大模型单层等价线性回归 |
| 高斯过程回归 | 机器人状态估计 |
| 旋转矩阵、四元数、Twist、雅可比 | 机器人三维几何运动学 |
| SVD/QR/Cholesky | 通用:机器人、深度学习、向量库 |
| PCA、余弦相似度 | LLM向量检索、特征降维 |
| Transformer整套矩阵算子 | 大模型VLA特征映射与变换 |
边界提醒:
- 拉格朗日动力学矩阵属于机器人物理层;VLA大模型输出目标轨迹,动力学矩阵在下层控制器/仿真中计算。
- 回归算法可以单独做模型,也可以作为神经网络的单层组件。
偏微分方程 & 热力学视角:扩散模型用到的核心方程
注意:大模型代码不直接解解析PDE,全部做数值离散;热力学只是类比,不是真的物理热力学系统。
扩散模型名字来自物理扩散(热扩散),数学是热方程(抛物型偏微分)。
1. 热方程 Heat Equation(热力学/物理扩散,原型PDE)
一维热传导偏微分方程:
∂u∂t=D∂2u∂x2 \frac{\partial u}{\partial t}=D\frac{\partial^2 u}{\partial x^2} ∂t∂u=D∂x2∂2u
- u(x,t)u(x,t)u(x,t):位置xxx、时刻ttt的温度;DDD扩散系数
- ∂u∂t\dfrac{\partial u}{\partial t}∂t∂u:时间偏导,温度随时间变化
- ∂2u∂x2\dfrac{\partial^2 u}{\partial x^2}∂x2∂2u:空间二阶偏导(拉普拉斯算子Δu=∇2u\Delta u=\nabla^2 uΔu=∇2u)
写成高维向量形式(图像/隐向量,x∈Rd\boldsymbol x\in\mathbb R^dx∈Rd)
∂u∂t=D Δu \frac{\partial u}{\partial t}=D\,\Delta u ∂t∂u=DΔu
物理含义:温度从高温向低温扩散;最终整个系统趋向均匀(熵增大,热力学第二定律)。
物理过程:正向 = 不断扩散,信息抹平、熵增加;逆向 = 去噪,恢复原图,熵减小,就是扩散模型生成。
2. 概率版本:Fokker‑Planck 福克‑普朗克方程(扩散模型核心PDE)
热方程的概率推广,描述概率密度随时间演化。
设 pt(x)p_t(\boldsymbol x)pt(x) 是ttt时刻隐变量的概率密度:
∂pt∂t=−∇⋅(f(x,t) pt(x))+12Δ(g2(t) pt(x)) \frac{\partial p_t}{\partial t}=-\nabla\cdot \big(f(\boldsymbol x,t)\,p_t(\boldsymbol x)\big)+\frac12\Delta \big(g^2(t)\,p_t(\boldsymbol x)\big) ∂t∂pt=−∇⋅(f(x,t)pt(x))+21Δ(g2(t)pt(x))
- 第一项:漂移项fff(确定性漂移)
- 第二项:扩散项,拉普拉斯Δ\DeltaΔ,随机噪声扩散
DDPM正向扩散
DDPM离散版本,不直接解PDE;每一步加高斯噪声。
连续时间DDPM就是Fokker‑Planck方程特例。
正向过程:不断往图片加噪声,概率分布往高斯分布扩散,等价物理扩散。
逆向过程:求解逆时间PDE,从纯噪声恢复图像。
3. SDE随机微分方程(与Fokker‑Planck成对)
Fokker‑Planck描述概率密度;SDE描述单个样本轨迹。
dxt=f(xt,t)dt+g(t) dwt d\boldsymbol x_t = f(\boldsymbol x_t,t)dt + g(t)\,d\boldsymbol w_t dxt=f(xt,t)dt+g(t)dwt
- dwtd\boldsymbol w_tdwt:维纳过程(布朗运动,热力学分子随机运动)
- fff漂移;ggg噪声强度
DDPM正向就是离散SDE;DDIM是SDE去掉随机项,退化成确定性ODE常微分方程。
4. ODE 概率流 ODE(DDIM、流匹配 Flow‑Matching)
把随机SDE关掉噪声项,得到确定性常微分方程:
dxtdt=vθ(xt,t) \frac{d\boldsymbol x_t}{dt}=v_\theta(\boldsymbol x_t,t) dtdxt=vθ(xt,t)
- 流匹配直接学习这个向量场vθv_\thetavθ;
- 注意:这是常微分方程ODE,不是偏微分PDE;对时间求导,没有空间二阶偏导。
- 推理时用欧拉、RK4做数值积分求解,无解析PDE求解。
对比
- 热方程 / Fokker‑Planck:PDE偏微分方程,含空间二阶拉普拉斯Δ\DeltaΔ,物理热力学原型
- 概率流ODE:ODE常微分方程,扩散模型推理用,没有空间二阶偏导
5. 热力学概念,扩散模型只是类比(重点,没有真实物理)
-
熵 Entropy
物理热力学:封闭系统熵只增不减。
扩散模型正向加噪声:分布熵不断变大,信息丢失;
逆向生成:人为降低熵,属于开放系统,不违反热力学第二定律。 -
自由能 Free energy
部分扩散论文用自由能做损失函数;只是数学类比,不是真实物质热力学自由能。
6. 关键算子:拉普拉斯算子 Δ=∇2\Delta=\nabla^2Δ=∇2
热方程、Fokker‑Planck里面的核心:
Δu=∇2u=∂2u∂x12+∂2u∂x22+… \Delta u=\nabla^2 u=\frac{\partial^2 u}{\partial x_1^2}+\frac{\partial^2 u}{\partial x_2^2}+\dots Δu=∇2u=∂x12∂2u+∂x22∂2u+…
❗注意:Transformer、VLA网络前向传播本身不计算拉普拉斯算子。
拉普拉斯出现在扩散模型的理论PDE方程;神经网络网络拟合向量场vθv_\thetavθ,网络内部没有二阶空间微分运算。
网络学出来的vθv_\thetavθ去近似PDE的逆向流,用数值积分跑。
7. 区分 PDE / ODE / SDE,对应你接触的算法
| 方程类型 | 代表公式 | 出现在哪里 | 特点 |
|---|---|---|---|
| 抛物型PDE热方程 | ∂u/∂t=DΔu\partial u/\partial t=D\Delta u∂u/∂t=DΔu | 扩散模型理论源头,物理热扩散 | 含空间二阶偏导Δ\DeltaΔ |
| Fokker‑Planck PDE | ∂pt/∂t=⋯+12Δ(g2pt)\partial p_t/\partial t=\dots+\frac12\Delta(g^2 p_t)∂pt/∂t=⋯+21Δ(g2pt) | 概率密度演化理论 | PDE,描述分布 |
| SDE随机微分 | dxt=f dt+g dwtdx_t = f\,dt+g\,dw_tdxt=fdt+gdwt | DDPM理论;布朗运动热力学 | 随机轨迹 |
| 概率流 ODE | dxt/dt=vθ(xt,t)dx_t/dt=v_\theta(x_t,t)dxt/dt=vθ(xt,t) | DDIM、流匹配,VLA动作生成 | 常微分,无空间二阶偏导,数值欧拉/RK求解 |
工程现实总结(非常重要)
- 扩散模型论文理论大量使用PDE、热力学类比;
- 训练推理代码不会去数值求解PDE(拉普拉斯二阶偏导);
- 网络只是拟合向量场vθv_\thetavθ;推理求解ODE,用欧拉/龙格‑库塔做数值迭代。
- 热力学(熵、布朗运动)是类比启发;神经网络不是真实热力学系统。
VAE 变分自编码器数学&物理公式汇总
VAE 几乎没有真实物理方程;物理概念全部是类比;核心是概率论、KL散度、贝叶斯、统计优化,少量微分。
VAE不涉及热方程、拉普拉斯PDE、SDE(这些是扩散模型)。
基础定义
- x\boldsymbol xx:观测样本(图像)
- z\boldsymbol zz:隐变量(隐空间表征)
- p(x)p(\boldsymbol x)p(x):样本边缘概率;p(z)p(\boldsymbol z)p(z)隐变量先验;
- p(z∣x)p(\boldsymbol z|\boldsymbol x)p(z∣x):真实后验(无法直接计算)
- qϕ(z∣x)q_\phi(\boldsymbol z|\boldsymbol x)qϕ(z∣x):推理网络(编码器),近似后验
- pθ(x∣z)p_\theta(\boldsymbol x|\boldsymbol z)pθ(x∣z):生成网络(解码器)
1、贝叶斯公式(根基)
p(z∣x)=p(x∣z) p(z)p(x) p(z|x)=\frac{p(x|z)\,p(z)}{p(x)} p(z∣x)=p(x)p(x∣z)p(z)
问题:p(x)=∫p(x∣z)p(z)dzp(x)=\int p(x|z)p(z)dzp(x)=∫p(x∣z)p(z)dz 积分不可解,后验p(z∣x)p(z|x)p(z∣x)intractable,这就是VAE要解决的根源。
2、证据下界 ELBO(VAE核心损失公式)
LELBO(θ,ϕ;x)=Eqϕ(z∣x)[logpθ(x∣z)]−DKL(qϕ(z∣x) ∥ p(z)) \mathcal L_{\text{ELBO}}(\theta,\phi;x) =\mathbb E_{q_\phi(z|x)}\big[\log p_\theta(x|z)\big] -D_{\mathrm{KL}}\big(q_\phi(z|x)\,\|\,p(z)\big) LELBO(θ,ϕ;x)=Eqϕ(z∣x)[logpθ(x∣z)]−DKL(qϕ(z∣x)∥p(z))
拆成两项:
- 重建项 Eq[logpθ(x∣z)]\mathbb E_q[\log p_\theta(x|z)]Eq[logpθ(x∣z)]:解码器,希望从zzz还原图片xxx
- KL散度正则项 DKLD_{\mathrm{KL}}DKL:把近似后验qϕ(z∣x)q_\phi(z|x)qϕ(z∣x)向先验p(z)p(z)p(z)做约束,让隐空间规整。
KL‑Divergence KL散度
DKL(q(z) ∥ p(z))=∫q(z)logq(z)p(z)dz D_{\mathrm{KL}}\big(q(z)\,\|\,p(z)\big)=\int q(z)\log\frac{q(z)}{p(z)}dz DKL(q(z)∥p(z))=∫q(z)logp(z)q(z)dz
物理类比:信息论相对熵;不是物理热力学熵,但形式同源。
3、标准高斯先验(最常用)
先验取标准正态:
p(z)=N(z;0,I) p(z)=\mathcal N(z;\boldsymbol 0,\boldsymbol I) p(z)=N(z;0,I)
编码器输出高斯分布:
qϕ(z∣x)=N(z;μϕ(x),σϕ2(x)I) q_\phi(z|x)=\mathcal N\big(z;\mu_\phi(x),\sigma^2_\phi(x)\boldsymbol I\big) qϕ(z∣x)=N(z;μϕ(x),σϕ2(x)I)
当都是对角高斯,KL可以写出解析闭式,不用采样积分:
DKL(N(μ,σ2) ∥ N(0,1))=12∑i(μi2+σi2−1−logσi2) D_{\mathrm{KL}}\big(\mathcal N(\mu,\sigma^2)\,\|\,\mathcal N(0,1)\big) =\frac12\sum_i\Big(\mu_i^2+\sigma_i^2-1-\log\sigma_i^2\Big) DKL(N(μ,σ2)∥N(0,1))=21i∑(μi2+σi2−1−logσi2)
4、重参数技巧 Reparameterization Trick(VAE标志性公式)
问题:采样 z∼qϕ(z∣x)z\sim q_\phi(z|x)z∼qϕ(z∣x) 无法反向传播梯度。
引入独立噪声 ϵ∼N(0,I)\boldsymbol\epsilon \sim \mathcal N(0,I)ϵ∼N(0,I)
z=μϕ(x)+σϕ(x)⊙ϵ \boldsymbol z=\boldsymbol\mu_\phi(x)+\boldsymbol\sigma_\phi(x)\odot \boldsymbol\epsilon z=μϕ(x)+σϕ(x)⊙ϵ
把随机采样移到输入ϵ\epsilonϵ,梯度可以流过μ,σ\mu,\sigmaμ,σ网络参数。
- ⊙\odot⊙:逐元素哈达玛乘积。
5、重建损失项两种选择
①连续观测(图像归一化0~1,伯努利)
logpθ(x∣z)=∑ixilogx^i+(1−xi)log(1−x^i) \log p_\theta(x|z)= \sum_i x_i\log\hat x_i + (1-x_i)\log(1-\hat x_i) logpθ(x∣z)=i∑xilogx^i+(1−xi)log(1−x^i)
②高斯观测(实值)
logpθ(x∣z)∝−∥x−x^∥22σ2 \log p_\theta(x|z) \propto -\frac{\|x-\hat x\|^2}{2\sigma^2} logpθ(x∣z)∝−2σ2∥x−x^∥2
等价MSE均方误差。
6、期望、蒙特卡洛估计
Eqϕ(z∣x)[logpθ(x∣z)]≈1L∑l=1Llogpθ(x∣z(l)),z(l)∼qϕ(z∣x) \mathbb E_{q_\phi(z|x)}[\log p_\theta(x|z)] \approx \frac1L\sum_{l=1}^L \log p_\theta(x|z^{(l)}),\quad z^{(l)}\sim q_\phi(z|x) Eqϕ(z∣x)[logpθ(x∣z)]≈L1l=1∑Llogpθ(x∣z(l)),z(l)∼qϕ(z∣x)
单样本 L=1L=1L=1 就是工程里VAE默认做法。
7、训练:梯度上升ELBO
最大化ELBO;框架内部自动微分链式法则求梯度更新 θ,ϕ\theta,\phiθ,ϕ。
maxθ,ϕLELBO \max_{\theta,\phi}\mathcal L_{\text{ELBO}} θ,ϕmaxLELBO
VAE有没有物理方程?
✅用到的理论源头:信息论、概率论(熵、KL散度来自统计物理,但只是数学工具)
❌没有这些:
- 没有热方程、拉普拉斯PDE
- 没有SDE、布朗运动、维纳过程
- 没有Fokker‑Planck
- 没有ODE数值积分(欧拉/RK)
对比记忆 VAE vs DDPM扩散
|项目|VAE|DDPM/流匹配|
|—|—|—|
|核心框架|贝叶斯变分推断|SDE/PDE概率扩散|
|隐变量|单次采样zzz|时间序列ztz_tzt连续时间|
|正则|KL散度闭式解析|来自SDE离散噪声加噪|
|微分方程|无PDE/SDE|热方程、Fokker‑Planck、SDE、概率流ODE|
|采样|一次解码器|多步数值积分采样|
VAE的隐空间几何
编码器输出μ,σ\mu,\sigmaμ,σ,重参数得到zzz;
隐空间是高斯分布,距离用欧式距离、余弦相似度;
没有动力学,不描述时间演化,只做静态表征。
容易混淆点
- KL散度来自统计物理熵,但VAE并不模拟真实物理系统;
- VAE没有时间维度,不存在扩散、扩散系数;
- VAE的z只是静态隐表征,不是扩散模型随时间演化的ztz_tzt。
**
当前机器人存在的以下问题:
机器人轨迹生成:全局优化 vs 神经网络参数优化矛盾
背景:
- 神经网络训练:在参数空间做优化(对权重求导、batch/quad分块样本,经验风险最小化),得到一组固定权重;这是统计经验最优,不等于单条轨迹物理全局最优。
- 轨迹规划全局优化:给定环境、动力学约束,直接在轨迹空间q(t),q˙(t)\boldsymbol q(t),\dot{\boldsymbol q}(t)q(t),q˙(t)求解最优运动(时间最短、能耗最低、避障),属于带约束最优控制。
两者优化的搜索空间完全不一样:
- 神经网络:搜索权重参数,泛化到一批样本;训练结束权重固定。
- 轨迹优化:搜索轨迹序列本身;每条任务重新求解。
矛盾根源:
神经网络学到的是从观测到轨迹的映射函数,是对大量最优轨迹样本的拟合;拟合一定带逼近误差;模型输出不一定是这条新任务下物理意义的全局最优轨迹。
数学形式表达
1)神经网络训练(参数空间优化)
数据集{Di:(obsi,τi∗)}\{\mathcal D_i:(\text{obs}_i,\tau^*_i)\}{Di:(obsi,τi∗)},τi∗\tau^*_iτi∗是样本最优轨迹。
minθL(θ)=E(obs,τ∗)∼D[Ltraj(fθ(obs),τ∗)] \min_\theta \mathcal L(\theta)=\mathbb E_{(\text{obs},\tau^*)\sim \mathcal D}\big[\mathcal L_{\text{traj}}(f_\theta(\text{obs}),\tau^*)\big] θminL(θ)=E(obs,τ∗)∼D[Ltraj(fθ(obs),τ∗)]
- θ\thetaθ:网络全部权重;分quad/batch求梯度,随机梯度下降。
- 目标:在训练分布上平均损失最小;是期望意义最优,不是单条任务最优。
- 缺陷:分布外obs,会输出有偏差轨迹;存在拟合误差、泛化误差;网络只能逼近数据集里面见过的最优模式。
2)机器人轨迹全局优化(轨迹空间,最优控制)
给定观测环境、动力学约束、关节限位、避障:
minq(t)J(q(t))=∫0Tℓ(q,q˙,q¨)dts.t.M(q)q¨+Cq˙+G(q)=τqmin≤q(t)≤qmaxcollision‑free( q(t) ) \begin{aligned} \min_{\boldsymbol q(t)} \quad& J(\boldsymbol q(t))=\int_0^T \ell(\boldsymbol q,\dot{\boldsymbol q},\ddot{\boldsymbol q}) dt \\ \text{s.t.}\quad &M(q)\ddot q + C\dot q +G(q)=\tau \\ & q_{\min}\le q(t)\le q_{\max}\\ &\text{collision‑free}(\,q(t)\,) \end{aligned} q(t)mins.t.J(q(t))=∫0Tℓ(q,q˙,q¨)dtM(q)q¨+Cq˙+G(q)=τqmin≤q(t)≤qmaxcollision‑free(q(t))
搜索变量是整条时间轨迹q(t)\boldsymbol q(t)q(t);每一条新任务,重新求解。
可以得到该任务下物理全局/局部最优轨迹;缺点:求解慢,迭代耗时,不能端到端一秒出解。
两条路线怎么结合,得到精准输出
工程具身现在主流三种范式:纯神经网络、warm‑start热启动、分层两级优化。
方案A:纯模型输出(VLA / Pi0 /流匹配)
直接 $ \tau_{net}=f_\theta(\text{obs}) $
- 优点:推理快;
- 问题:权重拟合带来固有误差;遇到OOD场景,轨迹偏离最优,跟踪抖动。
改善手段(训练阶段)
- 数据集尽量多样化,包含大量真实最优控制生成的示范轨迹;
- 损失不只是MSE,增加动力学损失:把RNEA动力学方程作为辅助损失,约束网络输出轨迹满足物理方程;
- 数据增强(域随机),压缩泛化误差;
- 流匹配/扩散增加采样数量,多条轨迹采样选最优一条。
但无论怎么训:神经网络权重优化,不能保证单条新任务是全局最优,只是统计上好。
方案B:神经网络做热启动 Warm‑Start(最常用,兼顾速度+最优)
- 大模型/流匹配快速输出一条初始轨迹 τinit=fθ(obs)\tau_{\text{init}}=f_\theta(\text{obs})τinit=fθ(obs)
- 把τinit\tau_{\text{init}}τinit作为初值,送入轨迹全局优化求解器(SQP / iLQR)
minq(t)J(q(t)),初始化迭代起点=τinit \min_{q(t)} J(q(t)),\quad \text{初始化迭代起点}= \tau_{\text{init}} q(t)minJ(q(t)),初始化迭代起点=τinit - iLQR/SQP在动力学、避障约束下迭代修正轨迹,得到修正后 τ∗\tau^*τ∗。
关键点:
- 如果网络输出已经接近最优:求解器迭代步数极少,速度快;
- 如果网络输出有偏差:求解器在轨迹空间做局部寻优,把轨迹拉回到满足动力学约束的可行最优;
- 网络负责“给出一个很好的初始猜测”;真正物理最优交给约束优化求解器。
这就解决你的核心问题:神经网络参数优化有统计误差,不直接输出全局最优;但是给全局优化提供高质量初猜,避免优化陷入很差的局部极小。
方案C:两级分层架构(工业机器人常用)
上层VLA网络:理解任务、输出笛卡尔目标点位序列(不输出精细时间轨迹)
↓
中层轨迹优化器iLQR:带动力学、避障约束求解关节最优轨迹
↓
底层伺服三闭环执行
神经网络不去学复杂时序轨迹细节,只负责高层语义;轨迹最优求解完全交给最优控制。
优点:输出轨迹严格满足动力学约束,精准;缺点:链路复杂。
误差来源拆解(为什么两者都会存在误差)
- 参数优化侧(神经网络)
- 拟合误差:网络容量有限,无法100%复现样本最优轨迹;
- 分布偏移:新场景不在训练集分布,权重泛化失效;
- batch/quad随机梯度,收敛到损失的局部极小,不是零损失点。
- 轨迹全局优化侧
- 非凸:碰撞避障场景,代价函数非凸,只能得到局部最优,不一定是真正全局最优;
- 计算上限:为实时性,迭代步数截断,没有完全收敛。
现实工程几乎拿不到数学严格意义“全局最优”,追求可行+局部最优+足够高精度。
**
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)