1、什么是训练误差?什么是泛化误差,怎样估算?

训练误差:模型在训练数据上输出的预测值与真实值之间的差异。

泛化误差:模型在新样本上输出的预测值与真实值之间的差异。

泛化误差通常使用偏差-方差分解中的方差项进行估算。以回归问题为例,偏差-方差分解方法采用平方损失函数计算模型的期望错误:
R(f)=E(x,y)∼pr(x,y)[(y−f(x))2]\mathcal{R}\left( f\right) = {\mathbb{E}}_{\left( {\mathbf{x},y}\right) \sim {p}_{r}\left( {\mathbf{x},y}\right) }\left\lbrack {\left( y - f\left( \mathbf{x}\right) \right) }^{2}\right\rbrackR(f)=E(x,y)pr(x,y)[(yf(x))2]

对于单个样本xxx,在不同训练集D\mathcal{D}D得到模型fD(𝒙)f_\mathcal{D}(𝒙)fD(x)和最优模型f∗(𝒙)f^\ast(𝒙)f(x)的期望差距为:
ED[(fD(x)−f∗(x))2]=(ED[fD(x)]−f∗(x))2+ED[(fD(x)−ED[fD(x)])2] {\mathbb{E}}_{\mathcal{D}}\left\lbrack {\left( {f}_{\mathcal{D}}\left( \mathbf{x}\right) - {f}^{ * }\left( \mathbf{x}\right) \right) }^{2}\right\rbrack = {\left( {\mathbb{E}}_{\mathcal{D}}\left\lbrack {f}_{\mathcal{D}}\left( \mathbf{x}\right) \right\rbrack - {f}^{ * }\left( \mathbf{x}\right) \right) }^{2} + {\mathbb{E}}_{\mathcal{D}}{\left\lbrack {\left( {f}_{\mathcal{D}}\left( \mathbf{x}\right) - {\mathbb{E}}_{\mathcal{D}}\left\lbrack {f}_{\mathcal{D}}\left( \mathbf{x}\right) \right\rbrack \right) }^{2}\right\rbrack } ED[(fD(x)f(x))2]=(ED[fD(x)]f(x))2+ED[(fD(x)ED[fD(x)])2]
使用期望差距代替 (y−f(x))2{(y-f\left(\mathbf{x}\right))}^2(yf(x))2,期望错误为:
R(f)=Ex∼pr(x)[ED[(fD(x)−f∗(x))2]]+ϵ=( bias )2+variance+ϵ\mathcal{R}\left( f\right) = {\mathbb{E}}_{\mathbf{x} \sim {p}_{r}\left( \mathbf{x}\right) }\left\lbrack {{\mathbb{E}}_{\mathcal{D}}\left\lbrack {\left( {f}_{\mathcal{D}}\left( \mathbf{x}\right) - {f}^{ * }\left( \mathbf{x}\right) \right) }^{2}\right\rbrack }\right\rbrack + \epsilon = {\left( \text{ bias }\right) }^{2} +variance + \epsilonR(f)=Expr(x)[ED[(fD(x)f(x))2]]+ϵ=( bias )2+variance+ϵ

其中

  • Bias(偏差):模型在不同训练集上的平均性能和最优模型的差异,衡量模型的拟合能力:
    ( bias )2=Ex[(ED[fD(x)]−f∗(x))2] {\left( \text{ bias }\right) }^{2} = {\mathbb{E}}_{\mathbf{x}}\left\lbrack {\left( {\mathbb{E}}_{\mathcal{D}}\left\lbrack {f}_{\mathcal{D}}\left( \mathbf{x}\right) \right\rbrack - {f}^{ * }\left( \mathbf{x}\right) \right) }^{2}\right\rbrack ( bias )2=Ex[(ED[fD(x)]f(x))2]
  • Variance(方差):模型在不同训练集上的差异,衡量模型的泛化能力:
    variance=Ex[ED[(fD(x)−ED[fD(x)])2]] variance = {\mathbb{E}}_{\mathbf{x}}\left\lbrack {{\mathbb{E}}_{\mathcal{D}}\left\lbrack {\left( {f}_{\mathcal{D}}\left( \mathbf{x}\right) - {\mathbb{E}}_{\mathcal{D}}\left\lbrack {f}_{\mathcal{D}}\left( \mathbf{x}\right) \right\rbrack \right) }^{2}\right\rbrack }\right\rbrack variance=Ex[ED[(fD(x)ED[fD(x)])2]]

2、什么是模型的容量?什么是最优容量?

  • 模型的容量:模型的复杂度,代表模型构造复杂函数的能力。

  • 最优容量:在特定任务上,达到训练误差和泛化误差之间最佳平衡的模型容量。

3、什么是欠拟合,怎样处理?

欠拟合:是指模型拟合能力较差,在训练集上的错误率比较高的现象。

处理方法

(a)增加模型复杂度,提升模型的拟合能力。如增加隐藏层层数或神经元数量。

(b)减少正则化参数,以允许模型学习更复杂的模式。

(c)增加数据特征。

4、什么是过拟合,怎样处理?

过拟合:模型在训练集上表现好,但在测试集或真实世界数据上表现差的现象。

过拟合原因:模型学习了训练数据中的噪声和局部特征,由于训练数据是真实数据的一个子集,同时可能包含噪声数据,经验风险与期望风险存在差距。

处理方法

(a)增加训练样本,扩充训练集的数据。

(b)引入正则化参数,实现模型参数衰减,减少模型对训练数据的敏感度。

(c)减小模型复杂度,比如减少神经网络的层数或神经元数量。

(d)使用提前停止等训练方法防止过拟合。

(e)引入先验。

5、梯度下降算法:

为什么沿着梯度的反方向会让目标函数值变小?

梯度向量指向函数增长最快的方向,所以沿梯度反方向会使得目标函数值减小。

批量梯度下降算法指什么?

批量梯度下降算法是指在每次迭代中计算每个样本上损失函数的梯度并求和,使用整个训练集来计算目标函数的梯度并更新参数。

小批量(mini-batch)随机梯度下降又指什么,相比批量梯度下降算法有什么优势?

小批量(mini-batch)随机梯度下降算法,每次迭代随机选取小部分训练样本来计算梯度并更新参数。

优势:
小批量随机梯度下降使用一个小批量的样本而不是单个样本:
(a)减少了每次迭代的计算量。
(b)提高了更新参数的频率,使模型更快收敛。
(c)得到一个更稳定的梯度估计,减少优化过程的波动。

6、最大似然估计

假设一组含有 N 个样本的数据集,独立地由未知的真实数据分布 D 生成。令 fff 是对 D 的估计。

请写出对 fff 的最大似然估计的表达式,并解释其含义。

θ^=argmaxθ∏i=1mpmodel(xi;θ)\hat{\theta}={argmax}_\theta\prod_{i=1}^{m}{p_{model}(x_i;\theta)}θ^=argmaxθi=1mpmodel(xi;θ)
最大似然估计的含义是找到一组参数,使得在给定数据集上,模型的似然函数最大化。

该表达式在数值计算时可能存在什么问题?

(a)数值溢出问题:最大似然函数涉及连乘操作,当样本数量很大时,似然函数数值可能会非常小,导致计算时出现下溢问题。

(b)数值稳定性较差:最大似然函数在处理非常大或者非常小的概率值时,数值稳定性较差。

(c)梯度计算困难:在使用梯度下降等优化算法时,最大似然函数涉及连乘操作,梯度的计算涉及到复杂的链式法则,计算成本较高。

为避免此问题,通常怎样处理,请写出等价表达式

使用对数似然函数作为似然函数,由于对数函数单调递增,最大化对数似然等价于最大化似然函数。等价表达式为:

θ^=argmaxθ∑i=1mlog⁡pmodel(xi;θ)\hat{\theta}={argmax}_\theta\sum_{i=1}^{m}\log{p_{model}(x_i;\theta)}θ^=argmaxθi=1mlogpmodel(xi;θ)

对于一个分类问题,输入样本集是 {x(i)}i=1N\{x^{(i)}\}_{i=1}^{N}{x(i)}i=1N,输出标签是 {y(i)}i=1N\{y^{(i)}\}_{i=1}^{N}{y(i)}i=1N,参数仍然表示为 fff,请写出对应的最大似然估计表达式。

最大似然估计表达式为:

θ^=argmaxθ∏i=1mpmodel(yi∣xi;θ)\hat{\theta}={argmax}_\theta\prod_{i=1}^{m}{p_{model}(y_i|x_i;\theta)}θ^=argmaxθi=1mpmodel(yixi;θ)

对似然函数取对数得到对数似然函数,此时最大似然估计可表示为:

θ^=argmaxθ∑i=1mlog⁡pmodel(yi∣xi;θ)\hat{\theta}={argmax}_\theta\sum_{i=1}^{m}\log{p_{model}(y_i|x_i;\theta)}θ^=argmaxθi=1mlogpmodel(yixi;θ)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐