泛化误差-机器学习
·
泛化误差
泛化误差衡量机器学习模型在未知数据上的预测能力,反映模型从训练数据到真实分布的适应程度。其核心由三部分组成:
- 偏差:模型假设与真实关系的系统性偏离
- 方差:模型对训练数据波动的敏感度
- 噪声:数据本身的随机扰动
数学表达式为: $$E_{gen} = \mathbb{E}[(y - \hat{f}(x))^2] = \text{Bias}^2 + \text{Variance} + \sigma^2$$ 其中$\sigma^2$表示数据噪声。
关键影响因素
- 模型复杂度:简单模型高偏差低方差,复杂模型反之
- 训练数据量:数据量增加可降低方差
- 数据质量:噪声数据会增加学习难度
评估方法
- 交叉验证:将数据集划分为训练集/验证集
- 统计估计:计算置信区间 $$P(|\hat{E} - E_{gen}| < \epsilon) \geq 1 - \delta$$
优化策略
- 正则化技术:添加$L_1/L_2$惩罚项
- 集成学习:通过Bagging降低方差,Boosting减少偏差
- 数据增强:提升训练集多样性
当模型在验证集上的误差$E_{val}$与训练误差$E_{train}$满足: $$\frac{|E_{val} - E_{train}|}{E_{train}} > \theta$$ 时($\theta$为预设阈值),通常表明模型出现过度拟合。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)