深度学习-权重衰退 Weight Decay
1. 正则化
正则化(regularization)的核心定义只有一句话:
-
任何显式地牺牲训练误差、换取模型复杂度下降的操作或约束,都叫正则化。
把这句话拆成三个关键词:
-
显式——它必须是人为“加进去”的,而不是模型本来就有的;
-
牺牲训练误差——如果不付出代价,就不叫正则化;
-
换取复杂度下降——最终目的是降低泛化误差(测试误差)。
下面是常用的正则化方法以及他们对应的牺牲代价和换取的功能:
|
常用的正则化方法 |
牺牲代价(训练误差↑) |
换取的复杂度下降 |
|
L2 权重衰减(Weight Decay) |
额外惩罚项 λ‖w‖² 拉高损失 |
权重变小 → 函数更平滑,VC 维↓ |
|
L1 权重衰减(Lasso) |
额外惩罚项 λ‖w‖₁ 拉高损失 |
权重稀疏 → 特征选择,有效参数量↓ |
|
Dropout |
训练时随机屏蔽神经元/权重,网络更难拟合 |
抑制共适应 → 网络更鲁棒,等效集成大量子网络 |
|
Early Stopping |
提前终止训练,训练误差未降至最低 |
迭代次数↓ → 有效容量↓ |
2. 权重衰退 Weight Decay
限制权重==>减小模型复杂度==>减小过拟合。
范数主要是对矩阵和向量的一种描述,有了描述那么“大小就可以比较了”,从字面理解一种比较构成规范的数。有了统一的规范,就可以比较了。
例如:1比2小我们一目了然,可是(3,5,3)和(6,1,2)哪个大?不太好比吧。
此时可以应用L2范数比:根号(43)比根号(41)大,因此L2范数对比中(3,5,3)大,因此无穷范数对比中(6,1,2)大。
向量范数的通用公式为L-P范数,记住该公式其他公式都是该公式的引申。
-
L-0范数:用来统计向量中非零元素的个数。
-
L-1范数:向量中所有元素的绝对值之和。可用于优化中去除没有取值的信息,又称稀疏规则算子。
-
L-2范数:典型应用——欧式距离。可用于优化正则化项,避免过拟合。
-
L-∞范数:计算向量中的最大值。

数学直观:
-
原始损失:L = ∑(yᵢ − ŷᵢ)² (只关心拟合误差)
-
加 L2 正则(权重衰减):L_R = ∑(yᵢ − ŷᵢ)² + λ∑wⱼ² (λ>0 是“罚款力度”)
因此:
-
优化器要同时“把误差做低”和“把权重做小”。
-
权重小 → 每个特征对输出的贡献受限 → 函数更平滑,难学到训练集中的噪声细节 → 泛化提升。
-
L2 正则化应用“权重惩罚”把模型从高方差拉回到低方差,牺牲一点训练误差,换取显著降低的测试误差。
使用结果类似如下:左侧正则化值为0,右侧正则化值为3。

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)