泛化误差

泛化误差衡量机器学习模型在未知数据上的预测能力,反映模型从训练数据到真实分布的适应程度。其核心由三部分组成:

  1. 偏差:模型假设与真实关系的系统性偏离
  2. 方差:模型对训练数据波动的敏感度
  3. 噪声:数据本身的随机扰动

数学表达式为: $$E_{gen} = \mathbb{E}[(y - \hat{f}(x))^2] = \text{Bias}^2 + \text{Variance} + \sigma^2$$ 其中$\sigma^2$表示数据噪声。

关键影响因素
  • 模型复杂度:简单模型高偏差低方差,复杂模型反之
  • 训练数据量:数据量增加可降低方差
  • 数据质量:噪声数据会增加学习难度
评估方法
  • 交叉验证:将数据集划分为训练集/验证集
  • 统计估计:计算置信区间 $$P(|\hat{E} - E_{gen}| < \epsilon) \geq 1 - \delta$$
优化策略
  1. 正则化技术:添加$L_1/L_2$惩罚项
  2. 集成学习:通过Bagging降低方差,Boosting减少偏差
  3. 数据增强:提升训练集多样性

当模型在验证集上的误差$E_{val}$与训练误差$E_{train}$满足: $$\frac{|E_{val} - E_{train}|}{E_{train}} > \theta$$ 时($\theta$为预设阈值),通常表明模型出现过度拟合。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐