1. 正则化

正则化regularization的核心定义只有一句话:

  • 任何显式地牺牲训练误差、换取模型复杂度下降的操作或约束,都叫正则化

把这句话拆成三个关键词:

  1. 显式——它必须是人为“加进去”的,而不是模型本来就有的;

  2. 牺牲训练误差——如果不付出代价,就不叫正则化;

  3. 换取复杂度下降——最终目的是降低泛化误差(测试误差)。

下面是常用的正则化方法以及他们对应的牺牲代价和换取的功能:

常用的正则化方法

牺牲代价(训练误差↑)

换取的复杂度下降

L2 权重衰减(Weight Decay)

额外惩罚项 λ‖w‖² 拉高损失

权重变小 → 函数更平滑,VC 维↓

L1 权重衰减(Lasso)

额外惩罚项 λ‖w‖₁ 拉高损失

权重稀疏 → 特征选择,有效参数量↓

Dropout

训练时随机屏蔽神经元/权重,网络更难拟合

抑制共适应 → 网络更鲁棒,等效集成大量子网络

Early Stopping

提前终止训练,训练误差未降至最低

迭代次数↓ → 有效容量↓

2. 权重衰退 Weight Decay

限制权重==>减小模型复杂度==>减小过拟合

范数主要是对矩阵和向量的一种描述,有了描述那么“大小就可以比较了”,从字面理解一种比较构成规范的数。有了统一的规范,就可以比较了。

例如:1比2小我们一目了然,可是(3,5,3)和(6,1,2)哪个大?不太好比吧。

此时可以应用L2范数比:根号(43)比根号(41)大,因此L2范数对比中(3,5,3)大,因此无穷范数对比中(6,1,2)大。

向量范数的通用公式为L-P范数,记住该公式其他公式都是该公式的引申。

  • L-0范数:用来统计向量中非零元素的个数。

  • L-1范数:向量中所有元素的绝对值之和。可用于优化中去除没有取值的信息,又称稀疏规则算子。

  • L-2范数:典型应用——欧式距离。可用于优化正则化项,避免过拟合

  • L-∞范数:计算向量中的最大值。

数学直观:

  • 原始损失:L = ∑(yᵢ − ŷᵢ)² (只关心拟合误差)

  • 加 L2 正则(权重衰减):L_R = ∑(yᵢ − ŷᵢ)² + λ∑wⱼ² (λ>0 是“罚款力度”)

因此:

  • 优化器要同时“把误差做低”和“把权重做小”。

  • 权重小 → 每个特征对输出的贡献受限 → 函数更平滑,难学到训练集中的噪声细节 → 泛化提升。

  • L2 正则化应用“权重惩罚”把模型从高方差拉回到低方差,牺牲一点训练误差,换取显著降低的测试误差

使用结果类似如下:左侧正则化值为0,右侧正则化值为3。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐