大模型特征处理、空间映射、结构变换核心数学

整体链路:原始输入 →特征提取 →映射到隐空间 →注意力结构变换 →非线性激活 →输出预测。
没有拉普拉斯、Z变换;主力是线性代数、矩阵运算、概率统计、微分求导、三角/复数。

1、特征投影:把原始数据映射进隐空间

1.1 Embedding(词/Token嵌入)

hi=We⋅xi \boldsymbol h_i = \boldsymbol W_e \cdot x_i hi=Wexi
We∈Rdmodel×VW_e\in\mathbb R^{d_{model}\times V}WeRdmodel×V 嵌入矩阵;xix_ixi是one‑hot token索引。
作用:离散token映射到连续高维隐空间向量。

1.2 跨模态Projector(视觉、语音接入LLM,你VLA经常碰到)

基础线性投影:
hout=W⋅hin+b \boldsymbol h_{out}=W\cdot \boldsymbol h_{in}+b hout=Whin+b
升级:多层MLP、LN归一化。

不同模态维度不一致,通过矩阵乘法,对齐到同一个公共隐空间。

Layer Normalization 层归一化(每一层必用)

LN(x)=γx−μσ2+ϵ+β \mathrm{LN}(\boldsymbol x)=\gamma \frac{\boldsymbol x-\mu}{\sqrt{\sigma^2+\epsilon}}+\beta LN(x)=γσ2+ϵ xμ+β
μ\muμ均值,σ\sigmaσ方差;约束隐空间向量分布,防止数值爆炸/漂移。

2、位置信息注入:给特征带上时序/空间位置

RoPE旋转位置编码(复数形式,代码拆成实数)

Q~=Q⊙[cos⁡mθsin⁡mθ],K~=K⊙[cos⁡mθ−sin⁡mθ] \tilde{Q}=Q \odot \begin{bmatrix}\cos m\theta \\ \sin m\theta\end{bmatrix},\quad \tilde{K}=K \odot \begin{bmatrix}\cos m\theta \\ -\sin m\theta\end{bmatrix} Q~=Q[cosmθsinmθ],K~=K[cosmθsinmθ]
复数视角:qejmθq e^{jm\theta}qejmθ,用复指数旋转向量,给特征附加相对位置。

仅数学形式是复指数,不做拉普拉斯变换

3、注意力:隐空间特征做结构交互变换(Transformer核心)

Scaled Dot‑Product Attention

Attention(Q,K,V)=softmax(QK⊤dk)V \mathrm{Attention}(Q,K,V)=\mathrm{softmax}\left(\frac{QK^\top}{\sqrt{d_k}}\right)V Attention(Q,K,V)=softmax(dk QK)V

  • Q,K,VQ,K,VQ,K,V全部是矩阵;QK⊤QK^\topQK:计算token与token之间相似度;
  • dk\sqrt{d_k}dk 缩放,防止点积数值过大;
  • softmax:把相似度转为0~1概率权重;
  • 乘以V:按照权重聚合其它token的特征,完成特征的信息交换、结构重组。

多头注意力

MultiHead(Q,K,V)=Concat(head1,...,headh)WO \mathrm{MultiHead}(Q,K,V)=\mathrm{Concat}(\mathrm{head}_1,...,\mathrm{head}_h)W^O MultiHead(Q,K,V)=Concat(head1,...,headh)WO
headi=Attention(QWiQ,KWiK,VWiV) \mathrm{head}_i=\mathrm{Attention}(QW_i^Q,KW_i^K,VW_i^V) headi=Attention(QWiQ,KWiK,VWiV)
把隐空间拆多组子空间,每组捕捉不同类型语义特征。

因果掩码(时序/轨迹生成)

mask把未来位置的分数设置为−inf-infinf,softmax之后权重=0,看不到未来token。

4、非线性变换 MLP(给模型带来复杂拟合能力)

h′=Act(W1h+b1)W2+b2 \boldsymbol h' = \mathrm{Act}(W_1\boldsymbol h +b_1)W_2 +b_2 h=Act(W1h+b1)W2+b2
主流激活:

  • GELU:GELU(x)=x Φ(x)\mathrm{GELU}(x)=x\,\Phi(x)GELU(x)=xΦ(x)Φ\PhiΦ高斯累积分布函数;

如果没有非线性,无论堆多少层,整体等价一个大矩阵乘法,只能做线性变换,无法学习复杂语义。

5、输出层 & 概率建模

Softmax,把隐特征映射为token概率分布

softmax(zi)=ezi∑jezj \mathrm{softmax}(z_i)=\frac{e^{z_i}}{\sum_j e^{z_j}} softmax(zi)=jezjezi

损失函数(训练阶段)交叉熵

L=−1N∑ilog⁡(pmodel(yi∣xi)) \mathcal L=-\frac1N\sum_i \log(p_{model}(y_i|x_i)) L=N1ilog(pmodel(yixi))
衡量模型预测分布和真实标签分布差距。

6、训练反向传播:自动微分(求参数更新)

链式法则:
∂L∂W=∂L∂hout∂hout∂W \frac{\partial \mathcal L}{\partial W}=\frac{\partial \mathcal L}{\partial h_{out}} \frac{\partial h_{out}}{\partial W} WL=houtLWhout
Adam优化器:基于梯度一阶、二阶矩更新权重矩阵 W←W−η⋅m^/v^+ϵW\leftarrow W-\eta\cdot \hat m/\sqrt{\hat v+\epsilon}WWηm^/v^+ϵ

全部数值微分,不是解析拉普拉斯、不是Z变换

7、扩散 / 流匹配(VLA生成轨迹,动作特征)

流匹配:学习向量场 vt(xt,t)v_t(x_t,t)vt(xt,t),ODE数值演化
dxdt=vθ(xt,t) \frac{dx}{dt}=v_\theta(x_t,t) dtdx=vθ(xt,t)

用欧拉、RK做数值积分求解微分方程,只是数值迭代,不解析求拉普拉斯变换

8、矩阵视角总概括

整个大模型前向,本质一串:

矩阵乘法(空间投影)→归一化 →位置旋转 →注意力矩阵相似度聚合 →非线性激活 →重复堆叠N层

没有出现的数学

  • ❌拉普拉斯变换 sss
  • ❌Z变换、零极点、单位圆

这一套属于伺服控制,不在Transformer内部;大模型输出轨迹张量之后,交给伺服DSP才会用到。

速记对照表

模块 核心数学 作用
Embedding / Projector 矩阵乘法 Wx+bWx+bWx+b 原始特征映射到统一隐空间
LayerNorm 统计均值方差归一化 稳定隐空间分布,对抗表征漂移
RoPE 复指数旋转(cos/sin) 给特征增加位置信息
注意力 QK⊤QK^\topQK矩阵点积+softmax 特征之间做结构交互、信息聚合
MLP 矩阵乘法+非线性激活 拟合复杂语义模式
输出预测 softmax+交叉熵 隐特征转为离散token/动作概率
训练 链式求导+Adam梯度更新 更新所有权重矩阵
流匹配/扩散 ODE数值欧拉/RK积分 生成连续动作轨迹

相关数学算法分类汇总

分为四大块:力学矩阵(机器人)、回归算法、空间/几何算法、深度学习常用算子,区分:哪些在机器人动力学用、哪些在大模型用。

一、拉格朗日系列(机器人动力学,大模型本身不用)

1.拉格朗日动力学矩阵

拉格朗日方程:
M(q)q¨+C(q,q˙)q˙+G(q)=τ\boldsymbol M(\boldsymbol q)\ddot{\boldsymbol q}+\boldsymbol C(\boldsymbol q,\dot{\boldsymbol q})\dot{\boldsymbol q}+\boldsymbol G(\boldsymbol q)=\boldsymbol \tauM(q)q¨+C(q,q˙)q˙+G(q)=τ

  • M(q)\boldsymbol M(\boldsymbol q)M(q)质量惯性矩阵(正定对称矩阵)
  • C\boldsymbol CC:科氏/离心力矩阵
  • G\boldsymbol GG:重力项
  • τ\boldsymbol\tauτ:关节力矩

RNEA递归牛顿‑欧拉是数值计算这套;Pinocchio库底层求解。
用途:机械臂逆动力学、前馈力矩计算、仿真。

2.拉格朗日乘子(约束优化)

L=f(x)+λg(x)\mathcal L=f(x)+\lambda g(x)L=f(x)+λg(x)
用于带约束优化:机器人关节限位、碰撞约束、QP二次规划;
也出现在部分损失函数约束、SVM。

注意区分:拉格朗日(力学优化)≠拉普拉斯(微分变换)。


二、回归算法(拟合输入输出映射)

线性回归

y^=XW+b\hat y = XW+by^=XW+b
最小二乘损失:L=∥XW−y∥22\mathcal L=\|XW-y\|_2^2L=XWy22
用途:系统辨识、基线拟合;深度学习最基础单元。

岭回归(L2正则)

L=∥XW−y∥22+λ∥W∥22\mathcal L=\|XW-y\|_2^2+\lambda\|W\|_2^2L=XWy22+λW22
防止矩阵奇异、过拟合。

Lasso回归(L1正则)

L=∥XW−y∥22+λ∥W∥1\mathcal L=\|XW-y\|_2^2+\lambda\|W\|_1L=XWy22+λW1
产生稀疏权重,做特征筛选。

弹性网 Elastic‑Net

L1+L2组合,兼顾稀疏与稳定。

逻辑回归

y^=σ(XW+b),σ(z)=11+e−z\hat y=\sigma(XW+b),\quad \sigma(z)=\frac1{1+e^{-z}}y^=σ(XW+b),σ(z)=1+ez1
做二分类;Transformer最后分类头本质就是逻辑回归。

多项式回归

把特征升阶,拟合非线性曲线。

高斯过程回归 GPR

概率式非参数回归,输出均值+方差;机器人状态估计、噪声预测。

贝叶斯回归

权重视作随机分布,给出置信区间。

大模型里的MLP本质就是堆叠多层广义非线性回归


三、空间 & 几何算法(机器人三维空间、向量空间)

1.刚体变换

  • 旋转矩阵 R∈R3×3R\in\mathbb R^{3\times3}RR3×3
  • 齐次变换矩阵 T=[Rp01]T=\begin{bmatrix}R & p\\0 & 1\end{bmatrix}T=[R0p1]:正向运动学FK
  • 四元数:避免万向锁,姿态表示
  • Twist(扭量):6维运动旋量(线速度+角速度)
  • Wrench(力旋量):6维力力矩

2.运动学

  • 正向运动学 FK:关节角度→笛卡尔位姿
  • 逆向运动学 IK:笛卡尔目标→求解关节角度;数值IK常用雅可比迭代
  • 雅可比矩阵 J(q)J(q)J(q):关节空间 ↔笛卡尔空间速度映射
    x˙=J(q)q˙\dot x=J(q)\dot qx˙=J(q)q˙

3.空间矩阵分解

  • SVD奇异值分解:姿态求解、矩阵伪逆、降维、最小二乘解、雅可比求逆
  • QR分解:最小二乘、正交化
  • Cholesky分解:正定矩阵(惯性矩阵M)快速求逆、QP求解
  • LU分解:线性方程组求解

4.优化/几何规划

  • QP二次规划:机器人力矩优化、柔顺控制、接触力求解
  • 梯度下降:空间位姿迭代优化
  • 主成分分析PCA:向量空间降维,找数据主方向
  • 流形优化:旋转、姿态属于流形,不能直接欧式梯度更新

5.距离度量(向量隐空间)

  • L2距离:∥a−b∥2\|a-b\|_2ab2,向量库HNSW检索
  • 余弦相似度:cos⁡θ=a⊤b∣a∣∣b∣\cos\theta=\dfrac{a^\top b}{|a||b|}cosθ=a∣∣bab,RAG检索、注意力Q‑K相似度
  • L1曼哈顿距离

四、深度学习/大模型常用矩阵&算子

  1. 嵌入矩阵 WeW_eWe:离散token映射隐空间
  2. 多头注意力矩阵 Q,K,VQ,K,VQ,K,Vsoftmax(QK⊤d)V\mathrm{softmax}(\frac{QK^\top}{\sqrt d})Vsoftmax(d QK)V
  3. LayerNorm:向量归一化,对抗表征漂移
  4. RoPE:复指数旋转矩阵,位置编码
  5. MLP:矩阵乘法+非线性激活(GELU/ReLU)
  6. 交叉熵损失:分类概率拟合
  7. 自动微分链式法则,Adam优化

扩散 /流匹配

ODE向量场:dxdt=vθ(xt,t)\dfrac{dx}{dt}=v_\theta(x_t,t)dtdx=vθ(xt,t),欧拉、RK数值积分


五、快速区分哪些在哪用

算法 主要使用领域
拉格朗日动力学M/C/G矩阵 机械臂动力学,不在大模型内部
拉格朗日乘子 QP 约束优化、机器人控制
线性/岭/Lasso回归 辨识、基线模型;大模型单层等价线性回归
高斯过程回归 机器人状态估计
旋转矩阵、四元数、Twist、雅可比 机器人三维几何运动学
SVD/QR/Cholesky 通用:机器人、深度学习、向量库
PCA、余弦相似度 LLM向量检索、特征降维
Transformer整套矩阵算子 大模型VLA特征映射与变换

边界提醒:

  1. 拉格朗日动力学矩阵属于机器人物理层;VLA大模型输出目标轨迹,动力学矩阵在下层控制器/仿真中计算。
  2. 回归算法可以单独做模型,也可以作为神经网络的单层组件。

偏微分方程 & 热力学视角:扩散模型用到的核心方程

注意:大模型代码不直接解解析PDE,全部做数值离散;热力学只是类比,不是真的物理热力学系统
扩散模型名字来自物理扩散(热扩散),数学是热方程(抛物型偏微分)

1. 热方程 Heat Equation(热力学/物理扩散,原型PDE)

一维热传导偏微分方程:
∂u∂t=D∂2u∂x2 \frac{\partial u}{\partial t}=D\frac{\partial^2 u}{\partial x^2} tu=Dx22u

  • u(x,t)u(x,t)u(x,t):位置xxx、时刻ttt的温度;DDD扩散系数
  • ∂u∂t\dfrac{\partial u}{\partial t}tu:时间偏导,温度随时间变化
  • ∂2u∂x2\dfrac{\partial^2 u}{\partial x^2}x22u:空间二阶偏导(拉普拉斯算子Δu=∇2u\Delta u=\nabla^2 uΔu=2u

写成高维向量形式(图像/隐向量,x∈Rd\boldsymbol x\in\mathbb R^dxRd
∂u∂t=D Δu \frac{\partial u}{\partial t}=D\,\Delta u tu=DΔu
物理含义:温度从高温向低温扩散;最终整个系统趋向均匀(熵增大,热力学第二定律)。

物理过程:正向 = 不断扩散,信息抹平、熵增加;逆向 = 去噪,恢复原图,熵减小,就是扩散模型生成。

2. 概率版本:Fokker‑Planck 福克‑普朗克方程(扩散模型核心PDE)

热方程的概率推广,描述概率密度随时间演化
pt(x)p_t(\boldsymbol x)pt(x)ttt时刻隐变量的概率密度:
∂pt∂t=−∇⋅(f(x,t) pt(x))+12Δ(g2(t) pt(x)) \frac{\partial p_t}{\partial t}=-\nabla\cdot \big(f(\boldsymbol x,t)\,p_t(\boldsymbol x)\big)+\frac12\Delta \big(g^2(t)\,p_t(\boldsymbol x)\big) tpt=(f(x,t)pt(x))+21Δ(g2(t)pt(x))

  • 第一项:漂移项fff(确定性漂移)
  • 第二项:扩散项,拉普拉斯Δ\DeltaΔ,随机噪声扩散

DDPM正向扩散

DDPM离散版本,不直接解PDE;每一步加高斯噪声。
连续时间DDPM就是Fokker‑Planck方程特例。
正向过程:不断往图片加噪声,概率分布往高斯分布扩散,等价物理扩散。
逆向过程:求解逆时间PDE,从纯噪声恢复图像。

3. SDE随机微分方程(与Fokker‑Planck成对)

Fokker‑Planck描述概率密度;SDE描述单个样本轨迹
dxt=f(xt,t)dt+g(t) dwt d\boldsymbol x_t = f(\boldsymbol x_t,t)dt + g(t)\,d\boldsymbol w_t dxt=f(xt,t)dt+g(t)dwt

  • dwtd\boldsymbol w_tdwt:维纳过程(布朗运动,热力学分子随机运动)
  • fff漂移;ggg噪声强度

DDPM正向就是离散SDE;DDIM是SDE去掉随机项,退化成确定性ODE常微分方程

4. ODE 概率流 ODE(DDIM、流匹配 Flow‑Matching)

把随机SDE关掉噪声项,得到确定性常微分方程:
dxtdt=vθ(xt,t) \frac{d\boldsymbol x_t}{dt}=v_\theta(\boldsymbol x_t,t) dtdxt=vθ(xt,t)

  • 流匹配直接学习这个向量场vθv_\thetavθ
  • 注意:这是常微分方程ODE,不是偏微分PDE;对时间求导,没有空间二阶偏导。
  • 推理时用欧拉、RK4做数值积分求解,无解析PDE求解。

对比

  • 热方程 / Fokker‑Planck:PDE偏微分方程,含空间二阶拉普拉斯Δ\DeltaΔ,物理热力学原型
  • 概率流ODE:ODE常微分方程,扩散模型推理用,没有空间二阶偏导

5. 热力学概念,扩散模型只是类比(重点,没有真实物理)

  1. 熵 Entropy
    物理热力学:封闭系统熵只增不减。
    扩散模型正向加噪声:分布熵不断变大,信息丢失;
    逆向生成:人为降低熵,属于开放系统,不违反热力学第二定律。

  2. 自由能 Free energy
    部分扩散论文用自由能做损失函数;只是数学类比,不是真实物质热力学自由能。

6. 关键算子:拉普拉斯算子 Δ=∇2\Delta=\nabla^2Δ=2

热方程、Fokker‑Planck里面的核心:
Δu=∇2u=∂2u∂x12+∂2u∂x22+… \Delta u=\nabla^2 u=\frac{\partial^2 u}{\partial x_1^2}+\frac{\partial^2 u}{\partial x_2^2}+\dots Δu=2u=x122u+x222u+

❗注意:Transformer、VLA网络前向传播本身不计算拉普拉斯算子
拉普拉斯出现在扩散模型的理论PDE方程;神经网络网络拟合向量场vθv_\thetavθ,网络内部没有二阶空间微分运算。
网络学出来的vθv_\thetavθ去近似PDE的逆向流,用数值积分跑。

7. 区分 PDE / ODE / SDE,对应你接触的算法

方程类型 代表公式 出现在哪里 特点
抛物型PDE热方程 ∂u/∂t=DΔu\partial u/\partial t=D\Delta uu/t=DΔu 扩散模型理论源头,物理热扩散 含空间二阶偏导Δ\DeltaΔ
Fokker‑Planck PDE ∂pt/∂t=⋯+12Δ(g2pt)\partial p_t/\partial t=\dots+\frac12\Delta(g^2 p_t)pt/t=+21Δ(g2pt) 概率密度演化理论 PDE,描述分布
SDE随机微分 dxt=f dt+g dwtdx_t = f\,dt+g\,dw_tdxt=fdt+gdwt DDPM理论;布朗运动热力学 随机轨迹
概率流 ODE dxt/dt=vθ(xt,t)dx_t/dt=v_\theta(x_t,t)dxt/dt=vθ(xt,t) DDIM、流匹配,VLA动作生成 常微分,无空间二阶偏导,数值欧拉/RK求解

工程现实总结(非常重要)

  1. 扩散模型论文理论大量使用PDE、热力学类比
  2. 训练推理代码不会去数值求解PDE(拉普拉斯二阶偏导)
  3. 网络只是拟合向量场vθv_\thetavθ;推理求解ODE,用欧拉/龙格‑库塔做数值迭代
  4. 热力学(熵、布朗运动)是类比启发;神经网络不是真实热力学系统。

VAE 变分自编码器数学&物理公式汇总

VAE 几乎没有真实物理方程;物理概念全部是类比;核心是概率论、KL散度、贝叶斯、统计优化,少量微分。
VAE不涉及热方程、拉普拉斯PDE、SDE(这些是扩散模型)。

基础定义

  • x\boldsymbol xx:观测样本(图像)
  • z\boldsymbol zz:隐变量(隐空间表征)
  • p(x)p(\boldsymbol x)p(x):样本边缘概率;p(z)p(\boldsymbol z)p(z)隐变量先验;
  • p(z∣x)p(\boldsymbol z|\boldsymbol x)p(zx):真实后验(无法直接计算)
  • qϕ(z∣x)q_\phi(\boldsymbol z|\boldsymbol x)qϕ(zx)推理网络(编码器),近似后验
  • pθ(x∣z)p_\theta(\boldsymbol x|\boldsymbol z)pθ(xz)生成网络(解码器)

1、贝叶斯公式(根基)

p(z∣x)=p(x∣z) p(z)p(x) p(z|x)=\frac{p(x|z)\,p(z)}{p(x)} p(zx)=p(x)p(xz)p(z)
问题:p(x)=∫p(x∣z)p(z)dzp(x)=\int p(x|z)p(z)dzp(x)=p(xz)p(z)dz 积分不可解,后验p(z∣x)p(z|x)p(zx)intractable,这就是VAE要解决的根源。

2、证据下界 ELBO(VAE核心损失公式)

LELBO(θ,ϕ;x)=Eqϕ(z∣x)[log⁡pθ(x∣z)]−DKL(qϕ(z∣x) ∥ p(z)) \mathcal L_{\text{ELBO}}(\theta,\phi;x) =\mathbb E_{q_\phi(z|x)}\big[\log p_\theta(x|z)\big] -D_{\mathrm{KL}}\big(q_\phi(z|x)\,\|\,p(z)\big) LELBO(θ,ϕ;x)=Eqϕ(zx)[logpθ(xz)]DKL(qϕ(zx)p(z))
拆成两项:

  1. 重建项 Eq[log⁡pθ(x∣z)]\mathbb E_q[\log p_\theta(x|z)]Eq[logpθ(xz)]:解码器,希望从zzz还原图片xxx
  2. KL散度正则项 DKLD_{\mathrm{KL}}DKL:把近似后验qϕ(z∣x)q_\phi(z|x)qϕ(zx)向先验p(z)p(z)p(z)做约束,让隐空间规整

KL‑Divergence KL散度

DKL(q(z) ∥ p(z))=∫q(z)log⁡q(z)p(z)dz D_{\mathrm{KL}}\big(q(z)\,\|\,p(z)\big)=\int q(z)\log\frac{q(z)}{p(z)}dz DKL(q(z)p(z))=q(z)logp(z)q(z)dz

物理类比:信息论相对熵;不是物理热力学熵,但形式同源

3、标准高斯先验(最常用)

先验取标准正态:
p(z)=N(z;0,I) p(z)=\mathcal N(z;\boldsymbol 0,\boldsymbol I) p(z)=N(z;0,I)
编码器输出高斯分布:
qϕ(z∣x)=N(z;μϕ(x),σϕ2(x)I) q_\phi(z|x)=\mathcal N\big(z;\mu_\phi(x),\sigma^2_\phi(x)\boldsymbol I\big) qϕ(zx)=N(z;μϕ(x),σϕ2(x)I)
当都是对角高斯,KL可以写出解析闭式,不用采样积分
DKL(N(μ,σ2) ∥ N(0,1))=12∑i(μi2+σi2−1−log⁡σi2) D_{\mathrm{KL}}\big(\mathcal N(\mu,\sigma^2)\,\|\,\mathcal N(0,1)\big) =\frac12\sum_i\Big(\mu_i^2+\sigma_i^2-1-\log\sigma_i^2\Big) DKL(N(μ,σ2)N(0,1))=21i(μi2+σi21logσi2)

4、重参数技巧 Reparameterization Trick(VAE标志性公式)

问题:采样 z∼qϕ(z∣x)z\sim q_\phi(z|x)zqϕ(zx) 无法反向传播梯度。
引入独立噪声 ϵ∼N(0,I)\boldsymbol\epsilon \sim \mathcal N(0,I)ϵN(0,I)
z=μϕ(x)+σϕ(x)⊙ϵ \boldsymbol z=\boldsymbol\mu_\phi(x)+\boldsymbol\sigma_\phi(x)\odot \boldsymbol\epsilon z=μϕ(x)+σϕ(x)ϵ

把随机采样移到输入ϵ\epsilonϵ,梯度可以流过μ,σ\mu,\sigmaμ,σ网络参数。

  • ⊙\odot:逐元素哈达玛乘积。

5、重建损失项两种选择

①连续观测(图像归一化0~1,伯努利)

log⁡pθ(x∣z)=∑ixilog⁡x^i+(1−xi)log⁡(1−x^i) \log p_\theta(x|z)= \sum_i x_i\log\hat x_i + (1-x_i)\log(1-\hat x_i) logpθ(xz)=ixilogx^i+(1xi)log(1x^i)

②高斯观测(实值)

log⁡pθ(x∣z)∝−∥x−x^∥22σ2 \log p_\theta(x|z) \propto -\frac{\|x-\hat x\|^2}{2\sigma^2} logpθ(xz)2σ2xx^2
等价MSE均方误差。

6、期望、蒙特卡洛估计

Eqϕ(z∣x)[log⁡pθ(x∣z)]≈1L∑l=1Llog⁡pθ(x∣z(l)),z(l)∼qϕ(z∣x) \mathbb E_{q_\phi(z|x)}[\log p_\theta(x|z)] \approx \frac1L\sum_{l=1}^L \log p_\theta(x|z^{(l)}),\quad z^{(l)}\sim q_\phi(z|x) Eqϕ(zx)[logpθ(xz)]L1l=1Llogpθ(xz(l)),z(l)qϕ(zx)
单样本 L=1L=1L=1 就是工程里VAE默认做法。

7、训练:梯度上升ELBO

最大化ELBO;框架内部自动微分链式法则求梯度更新 θ,ϕ\theta,\phiθ,ϕ
max⁡θ,ϕLELBO \max_{\theta,\phi}\mathcal L_{\text{ELBO}} θ,ϕmaxLELBO


VAE有没有物理方程?

✅用到的理论源头:信息论、概率论(熵、KL散度来自统计物理,但只是数学工具)
没有这些:

  • 没有热方程、拉普拉斯PDE
  • 没有SDE、布朗运动、维纳过程
  • 没有Fokker‑Planck
  • 没有ODE数值积分(欧拉/RK)

对比记忆 VAE vs DDPM扩散
|项目|VAE|DDPM/流匹配|
|—|—|—|
|核心框架|贝叶斯变分推断|SDE/PDE概率扩散|
|隐变量|单次采样zzz|时间序列ztz_tzt连续时间|
|正则|KL散度闭式解析|来自SDE离散噪声加噪|
|微分方程|无PDE/SDE|热方程、Fokker‑Planck、SDE、概率流ODE|
|采样|一次解码器|多步数值积分采样|

VAE的隐空间几何

编码器输出μ,σ\mu,\sigmaμ,σ,重参数得到zzz
隐空间是高斯分布,距离用欧式距离、余弦相似度;
没有动力学,不描述时间演化,只做静态表征。

容易混淆点

  1. KL散度来自统计物理熵,但VAE并不模拟真实物理系统
  2. VAE没有时间维度,不存在扩散、扩散系数;
  3. VAE的z只是静态隐表征,不是扩散模型随时间演化的ztz_tzt

**

当前机器人存在的以下问题:

机器人轨迹生成:全局优化 vs 神经网络参数优化矛盾

背景:

  1. 神经网络训练:在参数空间做优化(对权重求导、batch/quad分块样本,经验风险最小化),得到一组固定权重;这是统计经验最优,不等于单条轨迹物理全局最优。
  2. 轨迹规划全局优化:给定环境、动力学约束,直接在轨迹空间q(t),q˙(t)\boldsymbol q(t),\dot{\boldsymbol q}(t)q(t),q˙(t)求解最优运动(时间最短、能耗最低、避障),属于带约束最优控制。

两者优化的搜索空间完全不一样

  • 神经网络:搜索权重参数,泛化到一批样本;训练结束权重固定。
  • 轨迹优化:搜索轨迹序列本身;每条任务重新求解。

矛盾根源:
神经网络学到的是从观测到轨迹的映射函数,是对大量最优轨迹样本的拟合;拟合一定带逼近误差;模型输出不一定是这条新任务下物理意义的全局最优轨迹。

数学形式表达

1)神经网络训练(参数空间优化)

数据集{Di:(obsi,τi∗)}\{\mathcal D_i:(\text{obs}_i,\tau^*_i)\}{Di:(obsi,τi)}τi∗\tau^*_iτi是样本最优轨迹。
min⁡θL(θ)=E(obs,τ∗)∼D[Ltraj(fθ(obs),τ∗)] \min_\theta \mathcal L(\theta)=\mathbb E_{(\text{obs},\tau^*)\sim \mathcal D}\big[\mathcal L_{\text{traj}}(f_\theta(\text{obs}),\tau^*)\big] θminL(θ)=E(obs,τ)D[Ltraj(fθ(obs),τ)]

  • θ\thetaθ:网络全部权重;分quad/batch求梯度,随机梯度下降。
  • 目标:在训练分布上平均损失最小;是期望意义最优,不是单条任务最优
  • 缺陷:分布外obs,会输出有偏差轨迹;存在拟合误差、泛化误差;网络只能逼近数据集里面见过的最优模式。

2)机器人轨迹全局优化(轨迹空间,最优控制)

给定观测环境、动力学约束、关节限位、避障:
min⁡q(t)J(q(t))=∫0Tℓ(q,q˙,q¨)dts.t.M(q)q¨+Cq˙+G(q)=τqmin⁡≤q(t)≤qmax⁡collision‑free( q(t) ) \begin{aligned} \min_{\boldsymbol q(t)} \quad& J(\boldsymbol q(t))=\int_0^T \ell(\boldsymbol q,\dot{\boldsymbol q},\ddot{\boldsymbol q}) dt \\ \text{s.t.}\quad &M(q)\ddot q + C\dot q +G(q)=\tau \\ & q_{\min}\le q(t)\le q_{\max}\\ &\text{collision‑free}(\,q(t)\,) \end{aligned} q(t)mins.t.J(q(t))=0T(q,q˙,q¨)dtM(q)q¨+Cq˙+G(q)=τqminq(t)qmaxcollision‑free(q(t))
搜索变量是整条时间轨迹q(t)\boldsymbol q(t)q(t);每一条新任务,重新求解。
可以得到该任务下物理全局/局部最优轨迹;缺点:求解慢,迭代耗时,不能端到端一秒出解。

两条路线怎么结合,得到精准输出

工程具身现在主流三种范式:纯神经网络、warm‑start热启动、分层两级优化

方案A:纯模型输出(VLA / Pi0 /流匹配)

直接 $ \tau_{net}=f_\theta(\text{obs}) $

  • 优点:推理快;
  • 问题:权重拟合带来固有误差;遇到OOD场景,轨迹偏离最优,跟踪抖动。

改善手段(训练阶段)

  1. 数据集尽量多样化,包含大量真实最优控制生成的示范轨迹;
  2. 损失不只是MSE,增加动力学损失:把RNEA动力学方程作为辅助损失,约束网络输出轨迹满足物理方程;
  3. 数据增强(域随机),压缩泛化误差;
  4. 流匹配/扩散增加采样数量,多条轨迹采样选最优一条。

但无论怎么训:神经网络权重优化,不能保证单条新任务是全局最优,只是统计上好。

方案B:神经网络做热启动 Warm‑Start(最常用,兼顾速度+最优)

  1. 大模型/流匹配快速输出一条初始轨迹 τinit=fθ(obs)\tau_{\text{init}}=f_\theta(\text{obs})τinit=fθ(obs)
  2. τinit\tau_{\text{init}}τinit作为初值,送入轨迹全局优化求解器(SQP / iLQR)
    min⁡q(t)J(q(t)),初始化迭代起点=τinit \min_{q(t)} J(q(t)),\quad \text{初始化迭代起点}= \tau_{\text{init}} q(t)minJ(q(t)),初始化迭代起点=τinit
  3. iLQR/SQP在动力学、避障约束下迭代修正轨迹,得到修正后 τ∗\tau^*τ

关键点:

  • 如果网络输出已经接近最优:求解器迭代步数极少,速度快;
  • 如果网络输出有偏差:求解器在轨迹空间做局部寻优,把轨迹拉回到满足动力学约束的可行最优;
  • 网络负责“给出一个很好的初始猜测”;真正物理最优交给约束优化求解器

这就解决你的核心问题:神经网络参数优化有统计误差,不直接输出全局最优;但是给全局优化提供高质量初猜,避免优化陷入很差的局部极小。

方案C:两级分层架构(工业机器人常用)

上层VLA网络:理解任务、输出笛卡尔目标点位序列(不输出精细时间轨迹)
     ↓
中层轨迹优化器iLQR:带动力学、避障约束求解关节最优轨迹
     ↓
底层伺服三闭环执行

神经网络不去学复杂时序轨迹细节,只负责高层语义;轨迹最优求解完全交给最优控制

优点:输出轨迹严格满足动力学约束,精准;缺点:链路复杂。

误差来源拆解(为什么两者都会存在误差)

  1. 参数优化侧(神经网络)
  • 拟合误差:网络容量有限,无法100%复现样本最优轨迹;
  • 分布偏移:新场景不在训练集分布,权重泛化失效;
  • batch/quad随机梯度,收敛到损失的局部极小,不是零损失点。
  1. 轨迹全局优化侧
  • 非凸:碰撞避障场景,代价函数非凸,只能得到局部最优,不一定是真正全局最优;
  • 计算上限:为实时性,迭代步数截断,没有完全收敛。

现实工程几乎拿不到数学严格意义“全局最优”,追求可行+局部最优+足够高精度

**

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐