从数据中推断未知规律,是统计学永恒的主题。

我们观察到的是样本,而真正关心的是隐藏在样本背后的参数、分布和规律。

所谓“估计(Estimation)”,就是利用有限的数据,对未知对象进行合理推断。

在统计学的发展过程中,人们提出了许多估计方法,其中最经典、最常用的包括:

  • 最大似然估计(Maximum Likelihood Estimation,MLE)
  • 最大后验估计(Maximum A Posteriori Estimation,MAP)
  • 最小二乘估计(Least Squares Estimation,LSE)
  • 最优线性无偏估计(Best Linear Unbiased Estimator,BLUE)
  • 贝叶斯估计(Bayesian Estimation)
  • 核密度估计(Kernel Density Estimation,KDE)

这些方法看似不同,但本质上都在回答一个问题:

如何利用已有信息,对未知规律做出最合理的猜测?

本文将从数学形式、计算过程以及直观理解三个层面介绍这些方法。


1. 估计问题的基本形式

假设我们观察到一组数据:

X={x1,x2,…,xn} X=\{x_1,x_2,\ldots,x_n\} X={x1​,x2​,…,xn​}

这些数据来自某个未知分布:

X∼P(x∣θ) X\sim P(x|\theta) X∼P(x∣θ)

其中:

  • XXX:观测数据
  • θ\thetaθ:未知参数
  • P(x∣θ)P(x|\theta)P(x∣θ):数据生成模型

我们的目标是:

根据 X 推断 θ \text{根据 }X\text{ 推断 }\theta 根据 X 推断 θ

例如:

问题1:估计平均身高

假设:

X∼N(μ,σ2) X\sim N(\mu,\sigma^2) X∼N(μ,σ2)

我们不知道:

  • 平均身高 μ\muμ
  • 方差 σ2\sigma^2σ2

通过样本:

x1,x2,...,xn x_1,x_2,...,x_n x1​,x2​,...,xn​

估计:

μ^ \hat{\mu} μ^​


问题2:预测房价

假设:

y=f(x)+ϵ y=f(x)+\epsilon y=f(x)+ϵ

我们希望找到:

f^(x) \hat{f}(x) f^​(x)

不同估计方法,就是不同的“推断哲学”。


2. 最大似然估计(MLE)

2.1 核心思想

最大似然估计的思想非常简单:

哪个参数最可能产生当前观察到的数据,就选择哪个参数。

换句话说:

假设世界存在一个参数 θ\thetaθ。

我们不知道它是多少。

那么:

尝试不同的 θ\thetaθ:

  • 如果这个参数产生当前数据的概率很大
  • 那么它更可信

数学表达:

θ^MLE=arg⁡max⁡θP(X∣θ) \hat{\theta}_{MLE} = \arg\max_\theta P(X|\theta) θ^MLE​=argθmax​P(X∣θ)

其中:

P(X∣θ) P(X|\theta) P(X∣θ)

叫做似然函数(Likelihood)。


2.2 为什么使用对数似然?

通常:

P(X∣θ)=∏i=1nP(xi∣θ) P(X|\theta) = \prod_{i=1}^{n}P(x_i|\theta) P(X∣θ)=i=1∏n​P(xi​∣θ)

多个概率相乘容易计算困难。

因此取对数:

L(θ)=log⁡P(X∣θ) L(\theta) = \log P(X|\theta) L(θ)=logP(X∣θ)

因为:

log⁡(x) \log(x) log(x)

是单调函数,所以最大值位置不变:

θ^=arg⁡max⁡θL(θ) \hat{\theta} = \arg\max_\theta L(\theta) θ^=argθmax​L(θ)


2.3 举例:估计硬币正面概率

假设:

硬币正面概率:

P(head)=p P(head)=p P(head)=p

实验 100 次:

正面 60 次。

那么:

L(p)=p60(1−p)40 L(p)=p^{60}(1-p)^{40} L(p)=p60(1−p)40

最大化:

log⁡L(p)=60log⁡p+40log⁡(1−p) \log L(p) = 60\log p+40\log(1-p) logL(p)=60logp+40log(1−p)

求导:

60p−401−p=0 \frac{60}{p}-\frac{40}{1-p}=0 p60​−1−p40​=0

得到:

p=0.6 p=0.6 p=0.6

所以:

p^=0.6 \hat p=0.6 p^​=0.6


2.4 MLE本质理解

最大似然其实是在问:

如果世界按照某个参数运行,出现现在数据的可能性最大吗?

它是一种:

  • 数据驱动
  • 频率派思想
  • 不考虑先验知识

优点:

  • 简单
  • 通用
  • 大样本性质优秀

缺点:

  • 数据少时容易过拟合
  • 不利用已有经验

3. 最大后验估计(MAP)

3.1 从 MLE 到 MAP

MLE:

只考虑:

P(X∣θ) P(X|\theta) P(X∣θ)

但是现实中:

我们往往知道一些先验知识。

例如:

一个硬币通常大概率接近公平。

于是加入:

P(θ) P(\theta) P(θ)

表示:

参数本身出现的概率。


3.2 贝叶斯公式

根据贝叶斯公式:

::contentReference[oaicite:0]{index=0}

忽略:

P(X) P(X) P(X)

得到:

P(θ∣X)∝P(X∣θ)P(θ) P(\theta|X) \propto P(X|\theta)P(\theta) P(θ∣X)∝P(X∣θ)P(θ)

MAP寻找:

后验概率最大的参数:

θ^MAP=arg⁡max⁡θP(X∣θ)P(θ) \hat{\theta}_{MAP} = \arg\max_\theta P(X|\theta)P(\theta) θ^MAP​=argθmax​P(X∣θ)P(θ)

取对数:

=arg⁡max⁡θ[log⁡P(X∣θ)+log⁡P(θ)] = \arg\max_\theta [ \log P(X|\theta) + \log P(\theta) ] =argθmax​[logP(X∣θ)+logP(θ)]


3.3 MAP本质理解

MAP=MLE+先验约束

可以理解为:

MLE:

“只相信数据。”

MAP:

“相信数据,同时参考过去经验。”

例如:

MLE:

100 次投硬币:

60 次正面

认为:

p=0.6 p=0.6 p=0.6

MAP:

知道:

普通硬币一般接近:

p=0.5 p=0.5 p=0.5

最终可能得到:

p=0.55 p=0.55 p=0.55


4. 最小二乘估计(LSE)

4.1 核心思想

最小二乘法:

找一个模型,让预测值和真实值之间的误差平方和最小。

假设:

线性模型:

y=wx+b y=wx+b y=wx+b

预测:

y^i=wxi+b \hat y_i=wx_i+b y^​i​=wxi​+b

误差:

ei=yi−y^i e_i=y_i-\hat y_i ei​=yi​−y^​i​

目标:

min⁡∑iei2 \min \sum_i e_i^2 mini∑​ei2​

即:

min⁡∑i(yi−wxi−b)2 \min \sum_i (y_i-wx_i-b)^2 mini∑​(yi​−wxi​−b)2


4.2 为什么平方误差?

原因:

1. 消除正负抵消

如果直接:

∑ei \sum e_i ∑ei​

正负误差可能抵消。

2. 放大大误差

平方:

大错误惩罚更严重。


4.3 矩阵形式

线性模型:

Y=Xβ+ϵ Y=X\beta+\epsilon Y=Xβ+ϵ

目标:

min⁡∣∣Y−Xβ∣∣2 \min ||Y-X\beta||^2 min∣∣Y−Xβ∣∣2

求导:

得到:

β^=(XTX)−1XTY \hat\beta = (X^TX)^{-1}X^TY β^​=(XTX)−1XTY


4.4 最小二乘本质

最小二乘不是概率思想。

它关注:

几何距离最小。

从空间角度:

寻找一个预测平面,使所有数据点到该平面的距离平方最小。


5. 最优线性无偏估计(BLUE)

5.1 什么是 BLUE?

BLUE:

Best Linear Unbiased Estimator

中文:

最佳线性无偏估计。

它来自高斯-马尔可夫定理。


假设:

Y=Xβ+ϵ Y=X\beta+\epsilon Y=Xβ+ϵ

满足:

  1. 线性

β^=AY \hat\beta=AY β^​=AY

  1. 无偏:

E(β^)=β E(\hat\beta)=\beta E(β^​)=β

  1. 方差最小:

Var(β^) Var(\hat\beta) Var(β^​)

最低。

那么:

β^ \hat\beta β^​

就是 BLUE。


5.2 与最小二乘关系

在线性回归满足:

  • 误差均值为 0
  • 同方差
  • 不相关

条件下:

普通最小二乘估计:

OLS

就是:

BLUE。


5.3 本质理解

BLUE回答:

在所有线性估计方法中,谁最稳定?

它关注:

不是找到一个参数。

而是:

找到一个:

  • 不偏
  • 方差最低

的估计。


6. 贝叶斯估计

6.1 核心思想

频率派:参数固定,数据随机。

贝叶斯派:参数也是随机变量。

因此:

P(θ) P(\theta) P(θ)

表示参数的不确定性。


6.2 贝叶斯推断过程

先验:

P(θ) P(\theta) P(θ)

观察数据:

P(X∣θ) P(X|\theta) P(X∣θ)

得到后验:

P(θ∣X) P(\theta|X) P(θ∣X)

公式:

P(θ∣X)=P(X∣θ)P(θ)P(X) P(\theta|X) = \frac{ P(X|\theta)P(\theta) }{ P(X) } P(θ∣X)=P(X)P(X∣θ)P(θ)​


6.3 贝叶斯估计结果

最终估计:

可以选择:

后验均值

E(θ∣X) E(\theta|X) E(θ∣X)

后验最大值

即:

MAP。


6.4 本质理解

贝叶斯方法认为:

世界中的未知量,本身也具有不确定性。

所以它输出的不是:

一个答案:

θ=5 \theta=5 θ=5

而是:

一个分布:

P(θ∣X) P(\theta|X) P(θ∣X)

告诉你:

哪些可能性更高。


7. 核密度估计(KDE)

7.1 KDE解决什么问题?

前面的估计:

主要估计参数。

例如:

平均值:

μ \mu μ

但是:

如果不知道数据分布形式怎么办?

例如:

不知道数据是不是:

  • 正态分布
  • 指数分布
  • 多峰分布

这时候使用:

KDE。


7.2 KDE思想

KDE:

Kernel Density Estimation

核心:

每个数据点贡献一个“小山峰”,所有山峰叠加形成概率密度。

公式:

f^(x)=1nh∑i=1nK(x−xih) \hat{f}{(x)}= \frac1{nh} \sum_{i=1}^{n} K ( \frac{x-x_i}{h} ) f^​(x)=nh1​i=1∑n​K(hx−xi​​)

其中:

  • KKK:核函数
  • hhh:带宽

7.3 常用核函数

高斯核:

K(x)=12πe−x2/2 K(x)=\frac1{\sqrt{2\pi}} e^{-x^2/2} K(x)=2π​1​e−x2/2

意味着:

每个样本点附近放一个高斯小曲线。


7.4 带宽h的重要性

h太小:

数据点 → 原样复制

结果:

过拟合。

h太大:

曲线 → 过度平滑

结果:

丢失结构。


7.5 KDE本质理解

KDE:

不是估计参数。

而是在估计:

整个概率分布。

它回答:

数据真正的分布形状是什么?


8. 六种估计方法对比

方法核心思想是否需要模型输出
MLE最大化数据可能性是参数
MAP最大化后验概率是参数
最小二乘最小化误差通常线性参数
BLUE最优无偏线性估计线性模型参数
贝叶斯估计更新参数分布是参数分布
KDE平滑样本点否概率密度

9. 六种方法之间的关系

MLE 与 MAP

$$
MAP

MLE+Prior
$$

MAP加入了先验。


MLE 与 贝叶斯

MLE:

取最大:

θ \theta θ

贝叶斯:

保留:

P(θ∣X) P(\theta|X) P(θ∣X)


最小二乘 与 MLE

如果:

误差服从:

N(0,σ2) N(0,\sigma^2) N(0,σ2)

那么:

最大似然估计等价于:

最小二乘。


OLS 与 BLUE

满足:

高斯-马尔可夫条件:

OLS=BLUE OLS=BLUE OLS=BLUE


10. 总结:统计估计的哲学

六种方法其实代表六种不同思想:

最大似然

找最能解释数据的参数。

最大后验

数据重要,但经验也重要。

最小二乘

找距离数据最近的模型。

BLUE

在公平估计中寻找最稳定方案。

贝叶斯

不确定性本身也是信息。

KDE

不假设模型,让数据告诉我们分布。

最终:

统计学的核心并不是计算一个数字。

而是在:

有限信息、不确定世界中,建立一个合理的认知模型。

这也是各种估计方法存在的意义。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐