具身智能学习篇-投影、正交矩阵、最小二乘法
“投影公式”在不同领域(几何、线性代数、物理等)有不同的含义。下面为你整理最常见的几种投影公式:
1. 向量投影(最常用)
标量投影(投影长度)
向量 a 在向量 b 方向上的标量投影:
compba=∥a∥cosθ=a⋅b∥b∥ \text{comp}_{\mathbf{b}} \mathbf{a} = \|\mathbf{a}\| \cos\theta = \frac{\mathbf{a} \cdot \mathbf{b}}{\|\mathbf{b}\|} compba=∥a∥cosθ=∥b∥a⋅b
向量投影(投影向量)
向量 a 在向量 b 方向上的向量投影:
projba=(a⋅bb⋅b)b \text{proj}_{\mathbf{b}} \mathbf{a} = \left( \frac{\mathbf{a} \cdot \mathbf{b}}{\mathbf{b} \cdot \mathbf{b}} \right) \mathbf{b} projba=(b⋅ba⋅b)b
几何意义:把 a "垂直落下"到 b 所在直线上得到的向量。
2. 点到直线/平面的投影
点到直线的投影
已知直线过点 P0P_0P0,方向向量 v,点 QQQ 到直线的投影点 Q′Q'Q′:
Q′=P0+(Q−P0)⋅vv⋅vv Q' = P_0 + \frac{(Q - P_0) \cdot \mathbf{v}}{\mathbf{v} \cdot \mathbf{v}} \mathbf{v} Q′=P0+v⋅v(Q−P0)⋅vv
点到平面的投影
已知平面法向量 n,平面上一点 P0P_0P0,点 QQQ 到平面的投影点 Q′Q'Q′:
Q′=Q−(Q−P0)⋅nn⋅nn Q' = Q - \frac{(Q - P_0) \cdot \mathbf{n}}{\mathbf{n} \cdot \mathbf{n}} \mathbf{n} Q′=Q−n⋅n(Q−P0)⋅nn
3. 正交投影矩阵(线性代数)
将向量投影到子空间 WWW(由矩阵 AAA 的列张成),投影矩阵为:
P=A(ATA)−1AT P = A(A^T A)^{-1} A^T P=A(ATA)−1AT
- 若 AAA 的列是标准正交基,则简化为:P=AATP = AA^TP=AAT
- 投影向量:b^=Pb\hat{\mathbf{b}} = P\mathbf{b}b^=Pb
4. 物理中的投影(力的分解)
力 F 在某方向(单位向量 e)上的投影:
F∥=F⋅e F_{\parallel} = \mathbf{F} \cdot \mathbf{e} F∥=F⋅e
快速记忆口诀 🧠
向量投影 = 点积 ÷ 自身点积 × 方向向量
projba=a⋅bb⋅bb\text{proj}_{\mathbf{b}} \mathbf{a} = \frac{\mathbf{a} \cdot \mathbf{b}}{\mathbf{b} \cdot \mathbf{b}} \mathbf{b}projba=b⋅ba⋅bb
最小二乘法(Least Squares Method) 是一种数学优化技术,它通过最小化误差的平方和来寻找数据的最佳函数匹配。简单来说,就是画一条线(或曲线),让所有数据点到这条线的“垂直距离的平方和”最小。
结合你刚才问的投影公式,最小二乘法的核心本质其实就是正交投影。
下面为你梳理最小二乘法的核心原理、公式推导以及它与投影的关系:
1. 核心思想
假设我们有一组数据点 (x1,y1),(x2,y2),...,(xn,yn)(x_1, y_1), (x_2, y_2), ..., (x_n, y_n)(x1,y1),(x2,y2),...,(xn,yn),想拟合一条直线 y=β0+β1xy = \beta_0 + \beta_1 xy=β0+β1x。
最小二乘法的目标是让**残差平方和(RSS)**最小:
min∑i=1n(yi−(β0+β1xi))2 \min \sum_{i=1}^{n} (y_i - (\beta_0 + \beta_1 x_i))^2 mini=1∑n(yi−(β0+β1xi))2
2. 矩阵形式(最通用、最核心的形式)
在实际应用中(尤其是多元线性回归),我们通常使用矩阵来表达:
y=Xβ+ε \mathbf{y} = X\boldsymbol{\beta} + \boldsymbol{\varepsilon} y=Xβ+ε
- y\mathbf{y}y:观测值向量 (n×1n \times 1n×1)
- XXX:设计矩阵(包含自变量数据,n×pn \times pn×p)
- β\boldsymbol{\beta}β:待求的未知参数向量 (p×1p \times 1p×1)
- ε\boldsymbol{\varepsilon}ε:误差向量
目标:找到 β\boldsymbol{\beta}β,使得残差向量 ε=y−Xβ\boldsymbol{\varepsilon} = \mathbf{y} - X\boldsymbol{\beta}ε=y−Xβ 的长度平方最小。
正规方程(Normal Equation)
通过对残差平方和求导并令其为0,可以得到著名的正规方程:
XTXβ=XTy X^T X \boldsymbol{\beta} = X^T \mathbf{y} XTXβ=XTy
最小二乘解
如果 XTXX^T XXTX 是可逆矩阵,则参数的最优解为:
β^=(XTX)−1XTy \hat{\boldsymbol{\beta}} = (X^T X)^{-1} X^T \mathbf{y} β^=(XTX)−1XTy
3. 最小二乘法与“投影”的完美联系 🎯
这就是你刚才问的投影公式的终极应用场景!
- 观测值向量 y\mathbf{y}y 通常不在 XXX 的列空间(子空间)内,所以方程 Xβ=yX\boldsymbol{\beta} = \mathbf{y}Xβ=y 无解。
- 最小二乘法实际上是在找 XXX 列空间中的一个向量 y^=Xβ^\hat{\mathbf{y}} = X\hat{\boldsymbol{\beta}}y^=Xβ^,使得 y^\hat{\mathbf{y}}y^ 是 y\mathbf{y}y 在该子空间上的正交投影。
- 投影矩阵恰好就是:
P=X(XTX)−1XT P = X(X^T X)^{-1} X^T P=X(XTX)−1XT - 投影后的拟合值:y^=Py\hat{\mathbf{y}} = P\mathbf{y}y^=Py
- 残差向量:ε=y−y^=(I−P)y\boldsymbol{\varepsilon} = \mathbf{y} - \hat{\mathbf{y}} = (I - P)\mathbf{y}ε=y−y^=(I−P)y,它垂直于 XXX 的列空间(即 XTε=0X^T \boldsymbol{\varepsilon} = \mathbf{0}XTε=0,这就是正规方程的几何意义)。
4. 简单例子:一元线性回归
对于 y=β0+β1xy = \beta_0 + \beta_1 xy=β0+β1x,直接套用公式解得:
β1=∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2=Cov(x,y)Var(x) \beta_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{\text{Cov}(x,y)}{\text{Var}(x)} β1=∑(xi−xˉ)2∑(xi−xˉ)(yi−yˉ)=Var(x)Cov(x,y)
β0=yˉ−β1xˉ \beta_0 = \bar{y} - \beta_1 \bar{x} β0=yˉ−β1xˉ
5. 最小二乘法的优缺点
优点:
- 有解析解(闭式解),计算简单,不需要迭代。
- 几何意义清晰(正交投影)。
- 在误差服从正态分布时,最小二乘估计等价于极大似然估计(BLUE定理)。
缺点:
- 对异常值(Outliers)非常敏感:因为误差被平方了,一个偏离很远的点会产生巨大的惩罚,把拟合线拉偏。
- 要求 XTXX^T XXTX 可逆(即特征之间不能存在严重的多重共线性)。
💡 进阶:如果数据有异常值怎么办?
可以使用 L1 正则化(Lasso)、Ridge 回归,或者改用 最小绝对偏差(LAD),它们对异常值的鲁棒性更强。
正交矩阵和逆矩阵之间有着极其特殊且优美的关系。一句话总结就是:正交矩阵的逆矩阵,恰好等于它的转置矩阵。
下面为你详细拆解它们的关系以及背后的几何意义:
1. 核心数学关系
如果一个实方阵 QQQ 是正交矩阵,那么它必然满足:
QTQ=QQT=I Q^T Q = Q Q^T = I QTQ=QQT=I
根据逆矩阵的定义(AA−1=A−1A=IA A^{-1} = A^{-1} A = IAA−1=A−1A=I),我们可以直接得出:
Q−1=QT Q^{-1} = Q^T Q−1=QT
⚠️ 注意前提: 只有正交矩阵才具备“逆等于转置”的性质。一般的可逆矩阵,它的逆矩阵并不等于它的转置。
2. 为什么这个关系很重要?(计算上的降维打击)
在计算机和工程计算中,求一个普通矩阵的逆矩阵是非常耗时且容易出错的(时间复杂度通常是 O(n3)O(n^3)O(n3))。
但如果你的矩阵是正交矩阵,求逆就变成了**“转置”**操作(时间复杂度仅为 O(n2)O(n^2)O(n2),甚至只是内存地址的重新排列)。这在数值计算中是一个巨大的优势。
3. 几何意义:保持“长度”和“角度”不变
正交矩阵在几何上代表刚体变换(旋转、反射、平移)。
因为 Q−1=QTQ^{-1} = Q^TQ−1=QT,所以正交矩阵有以下极其重要的性质:
- 保长度(等距):向量 x\mathbf{x}x 经过正交变换后,长度不变。
∥Qx∥=∥x∥ \|Q\mathbf{x}\| = \|\mathbf{x}\| ∥Qx∥=∥x∥ - 保内积(保角):两个向量变换后的夹角和点积都不变。
(Qx)⋅(Qy)=x⋅y (Q\mathbf{x}) \cdot (Q\mathbf{y}) = \mathbf{x} \cdot \mathbf{y} (Qx)⋅(Qy)=x⋅y
直观理解: 想象你手里拿着一根筷子(向量),你把它在空中旋转或者翻个面(正交变换),筷子的长度没变,两根筷子之间的夹角也没变。而逆操作,就是把它原路转回来(转置操作)。
4. 常见的正交矩阵例子
-
旋转矩阵:
[cosθ−sinθsinθcosθ] \begin{bmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{bmatrix} [cosθsinθ−sinθcosθ]
它的转置就是把 sinθ\sin\thetasinθ 换个位置,刚好就是反向旋转 θ\thetaθ 角度。 -
反射矩阵(如镜像对称):
[100−1] \begin{bmatrix} 1 & 0 \\ 0 & -1 \end{bmatrix} [100−1]
它的转置等于它自己,逆也等于它自己(翻转两次就回到原位)。 -
置换矩阵(行/列交换):
[0110] \begin{bmatrix} 0 & 1 \\ 1 & 0 \end{bmatrix} [0110]
💡 总结与联系你之前的问题
结合你刚才问的最小二乘法:
在最小二乘中,我们遇到了投影矩阵 P=X(XTX)−1XTP = X(X^T X)^{-1} X^TP=X(XTX)−1XT。
如果设计矩阵 XXX 的列向量刚好是标准正交的(即 XTX=IX^T X = IXTX=I),那么公式就会瞬间简化为:
P=XXT P = X X^T P=XXT
β^=XTy \hat{\boldsymbol{\beta}} = X^T \mathbf{y} β^=XTy
这就完全不需要求逆矩阵了!这也是为什么在数值线性代数(如 QR 分解)中,我们总是想办法把矩阵变成正交矩阵的原因。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐




所有评论(0)