“投影公式”在不同领域(几何、线性代数、物理等)有不同的含义。下面为你整理最常见的几种投影公式:


1. 向量投影(最常用)

标量投影(投影长度)

向量 a 在向量 b 方向上的标量投影
compba=∥a∥cos⁡θ=a⋅b∥b∥ \text{comp}_{\mathbf{b}} \mathbf{a} = \|\mathbf{a}\| \cos\theta = \frac{\mathbf{a} \cdot \mathbf{b}}{\|\mathbf{b}\|} compba=acosθ=bab

向量投影(投影向量)

向量 a 在向量 b 方向上的向量投影
projba=(a⋅bb⋅b)b \text{proj}_{\mathbf{b}} \mathbf{a} = \left( \frac{\mathbf{a} \cdot \mathbf{b}}{\mathbf{b} \cdot \mathbf{b}} \right) \mathbf{b} projba=(bbab)b

几何意义:把 a "垂直落下"到 b 所在直线上得到的向量。


2. 点到直线/平面的投影

点到直线的投影

已知直线过点 P0P_0P0,方向向量 v,点 QQQ 到直线的投影点 Q′Q'Q
Q′=P0+(Q−P0)⋅vv⋅vv Q' = P_0 + \frac{(Q - P_0) \cdot \mathbf{v}}{\mathbf{v} \cdot \mathbf{v}} \mathbf{v} Q=P0+vv(QP0)vv

点到平面的投影

已知平面法向量 n,平面上一点 P0P_0P0,点 QQQ 到平面的投影点 Q′Q'Q
Q′=Q−(Q−P0)⋅nn⋅nn Q' = Q - \frac{(Q - P_0) \cdot \mathbf{n}}{\mathbf{n} \cdot \mathbf{n}} \mathbf{n} Q=Qnn(QP0)nn


3. 正交投影矩阵(线性代数)

将向量投影到子空间 WWW(由矩阵 AAA 的列张成),投影矩阵为:
P=A(ATA)−1AT P = A(A^T A)^{-1} A^T P=A(ATA)1AT

  • AAA 的列是标准正交基,则简化为:P=AATP = AA^TP=AAT
  • 投影向量:b^=Pb\hat{\mathbf{b}} = P\mathbf{b}b^=Pb

4. 物理中的投影(力的分解)

F 在某方向(单位向量 e)上的投影:
F∥=F⋅e F_{\parallel} = \mathbf{F} \cdot \mathbf{e} F=Fe


快速记忆口诀 🧠

向量投影 = 点积 ÷ 自身点积 × 方向向量
projba=a⋅bb⋅bb\text{proj}_{\mathbf{b}} \mathbf{a} = \frac{\mathbf{a} \cdot \mathbf{b}}{\mathbf{b} \cdot \mathbf{b}} \mathbf{b}projba=bbabb

最小二乘法(Least Squares Method) 是一种数学优化技术,它通过最小化误差的平方和来寻找数据的最佳函数匹配。简单来说,就是画一条线(或曲线),让所有数据点到这条线的“垂直距离的平方和”最小。

结合你刚才问的投影公式,最小二乘法的核心本质其实就是正交投影

下面为你梳理最小二乘法的核心原理、公式推导以及它与投影的关系:


1. 核心思想

假设我们有一组数据点 (x1,y1),(x2,y2),...,(xn,yn)(x_1, y_1), (x_2, y_2), ..., (x_n, y_n)(x1,y1),(x2,y2),...,(xn,yn),想拟合一条直线 y=β0+β1xy = \beta_0 + \beta_1 xy=β0+β1x
最小二乘法的目标是让**残差平方和(RSS)**最小:
min⁡∑i=1n(yi−(β0+β1xi))2 \min \sum_{i=1}^{n} (y_i - (\beta_0 + \beta_1 x_i))^2 mini=1n(yi(β0+β1xi))2


2. 矩阵形式(最通用、最核心的形式)

在实际应用中(尤其是多元线性回归),我们通常使用矩阵来表达:
y=Xβ+ε \mathbf{y} = X\boldsymbol{\beta} + \boldsymbol{\varepsilon} y=Xβ+ε

  • y\mathbf{y}y:观测值向量 (n×1n \times 1n×1)
  • XXX:设计矩阵(包含自变量数据,n×pn \times pn×p
  • β\boldsymbol{\beta}β:待求的未知参数向量 (p×1p \times 1p×1)
  • ε\boldsymbol{\varepsilon}ε:误差向量

目标:找到 β\boldsymbol{\beta}β,使得残差向量 ε=y−Xβ\boldsymbol{\varepsilon} = \mathbf{y} - X\boldsymbol{\beta}ε=yXβ 的长度平方最小。

正规方程(Normal Equation)

通过对残差平方和求导并令其为0,可以得到著名的正规方程
XTXβ=XTy X^T X \boldsymbol{\beta} = X^T \mathbf{y} XTXβ=XTy

最小二乘解

如果 XTXX^T XXTX 是可逆矩阵,则参数的最优解为:
β^=(XTX)−1XTy \hat{\boldsymbol{\beta}} = (X^T X)^{-1} X^T \mathbf{y} β^=(XTX)1XTy


3. 最小二乘法与“投影”的完美联系 🎯

这就是你刚才问的投影公式的终极应用场景!

  • 观测值向量 y\mathbf{y}y 通常不在 XXX 的列空间(子空间)内,所以方程 Xβ=yX\boldsymbol{\beta} = \mathbf{y}Xβ=y 无解。
  • 最小二乘法实际上是在找 XXX 列空间中的一个向量 y^=Xβ^\hat{\mathbf{y}} = X\hat{\boldsymbol{\beta}}y^=Xβ^,使得 y^\hat{\mathbf{y}}y^y\mathbf{y}y 在该子空间上的正交投影
  • 投影矩阵恰好就是:
    P=X(XTX)−1XT P = X(X^T X)^{-1} X^T P=X(XTX)1XT
  • 投影后的拟合值:y^=Py\hat{\mathbf{y}} = P\mathbf{y}y^=Py
  • 残差向量:ε=y−y^=(I−P)y\boldsymbol{\varepsilon} = \mathbf{y} - \hat{\mathbf{y}} = (I - P)\mathbf{y}ε=yy^=(IP)y,它垂直于 XXX 的列空间(即 XTε=0X^T \boldsymbol{\varepsilon} = \mathbf{0}XTε=0,这就是正规方程的几何意义)。

4. 简单例子:一元线性回归

对于 y=β0+β1xy = \beta_0 + \beta_1 xy=β0+β1x,直接套用公式解得:

β1=∑(xi−xˉ)(yi−yˉ)∑(xi−xˉ)2=Cov(x,y)Var(x) \beta_1 = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{\text{Cov}(x,y)}{\text{Var}(x)} β1=(xixˉ)2(xixˉ)(yiyˉ)=Var(x)Cov(x,y)
β0=yˉ−β1xˉ \beta_0 = \bar{y} - \beta_1 \bar{x} β0=yˉβ1xˉ


5. 最小二乘法的优缺点

优点:

  • 有解析解(闭式解),计算简单,不需要迭代。
  • 几何意义清晰(正交投影)。
  • 在误差服从正态分布时,最小二乘估计等价于极大似然估计(BLUE定理)。

缺点:

  • 对异常值(Outliers)非常敏感:因为误差被平方了,一个偏离很远的点会产生巨大的惩罚,把拟合线拉偏。
  • 要求 XTXX^T XXTX 可逆(即特征之间不能存在严重的多重共线性)。

💡 进阶:如果数据有异常值怎么办?

可以使用 L1 正则化(Lasso)Ridge 回归,或者改用 最小绝对偏差(LAD),它们对异常值的鲁棒性更强。

正交矩阵和逆矩阵之间有着极其特殊且优美的关系。一句话总结就是:正交矩阵的逆矩阵,恰好等于它的转置矩阵。

下面为你详细拆解它们的关系以及背后的几何意义:

1. 核心数学关系

如果一个实方阵 QQQ 是正交矩阵,那么它必然满足:
QTQ=QQT=I Q^T Q = Q Q^T = I QTQ=QQT=I
根据逆矩阵的定义(AA−1=A−1A=IA A^{-1} = A^{-1} A = IAA1=A1A=I),我们可以直接得出:
Q−1=QT Q^{-1} = Q^T Q1=QT

⚠️ 注意前提: 只有正交矩阵才具备“逆等于转置”的性质。一般的可逆矩阵,它的逆矩阵并不等于它的转置。


2. 为什么这个关系很重要?(计算上的降维打击)

在计算机和工程计算中,求一个普通矩阵的逆矩阵是非常耗时且容易出错的(时间复杂度通常是 O(n3)O(n^3)O(n3))。

但如果你的矩阵是正交矩阵,求逆就变成了**“转置”**操作(时间复杂度仅为 O(n2)O(n^2)O(n2),甚至只是内存地址的重新排列)。这在数值计算中是一个巨大的优势。


3. 几何意义:保持“长度”和“角度”不变

正交矩阵在几何上代表刚体变换(旋转、反射、平移)。
因为 Q−1=QTQ^{-1} = Q^TQ1=QT,所以正交矩阵有以下极其重要的性质:

  • 保长度(等距):向量 x\mathbf{x}x 经过正交变换后,长度不变。
    ∥Qx∥=∥x∥ \|Q\mathbf{x}\| = \|\mathbf{x}\| Qx=x
  • 保内积(保角):两个向量变换后的夹角和点积都不变。
    (Qx)⋅(Qy)=x⋅y (Q\mathbf{x}) \cdot (Q\mathbf{y}) = \mathbf{x} \cdot \mathbf{y} (Qx)(Qy)=xy

直观理解: 想象你手里拿着一根筷子(向量),你把它在空中旋转或者翻个面(正交变换),筷子的长度没变,两根筷子之间的夹角也没变。而逆操作,就是把它原路转回来(转置操作)。


4. 常见的正交矩阵例子

  • 旋转矩阵
    [cos⁡θ−sin⁡θsin⁡θcos⁡θ] \begin{bmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{bmatrix} [cosθsinθsinθcosθ]
    它的转置就是把 sin⁡θ\sin\thetasinθ 换个位置,刚好就是反向旋转 θ\thetaθ 角度。

  • 反射矩阵(如镜像对称):
    [100−1] \begin{bmatrix} 1 & 0 \\ 0 & -1 \end{bmatrix} [1001]
    它的转置等于它自己,逆也等于它自己(翻转两次就回到原位)。

  • 置换矩阵(行/列交换):
    [0110] \begin{bmatrix} 0 & 1 \\ 1 & 0 \end{bmatrix} [0110]


💡 总结与联系你之前的问题

结合你刚才问的最小二乘法
在最小二乘中,我们遇到了投影矩阵 P=X(XTX)−1XTP = X(X^T X)^{-1} X^TP=X(XTX)1XT
如果设计矩阵 XXX 的列向量刚好是标准正交的(即 XTX=IX^T X = IXTX=I),那么公式就会瞬间简化为:
P=XXT P = X X^T P=XXT
β^=XTy \hat{\boldsymbol{\beta}} = X^T \mathbf{y} β^=XTy
这就完全不需要求逆矩阵了!这也是为什么在数值线性代数(如 QR 分解)中,我们总是想办法把矩阵变成正交矩阵的原因。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐