机器学习笔记——支持向量机(IV)软间隔
·
前提
在实际的应用中,训练样本在样本空间或者特征空间中可能很难找到一个合适的核函数使得训练样本在特征空间中线性可分。即使找到了一个合适的核函数使得样本在样本空间中线性可分,我们也无法判断这个结果是不是由于过拟合造成的。
软间隔
硬间隔
所谓硬间隔就是非黑即白,即所有样本都必须划分正确。
软间隔概念
相比于硬间隔,软间隔允许存在灰色地带,也就是允许某些样本不满足约束条件:
yi(wTxi+b)≥1.
<script type="math/tex; mode=display" id="MathJax-Element-579"> y_i\left(\mathbf{w}^T\mathbf{x}_i+b\right)\geq1. </script>
不过在最大间隔化的同时要求,不满足约束的样本数应该尽可能地少。
于是优化目标函数:
minw,b12||w||2+C∑i=1mℓfunction(yi(wTxi+b)−1)
<script type="math/tex; mode=display" id="MathJax-Element-580"> \min_{\mathbf{w},b}\dfrac{1}{2}||\mathbf{w}||^2+C\sum_{i=1}^{m}\ell_{function}\left(y_i\left(\mathbf{w}^T\mathbf{x}_i+b\right)-1\right) </script>
其中C>0<script type="math/tex" id="MathJax-Element-581">C\gt0</script>是一个常数,
当C→+∞<script type="math/tex" id="MathJax-Element-582">C\rightarrow+\infty</script>则目标函数迫使所有样本都满足约束条件。
当C=constant<script type="math/tex" id="MathJax-Element-583">C=constant</script>则目标函数允许一部分地样本不满足约束条件。
ℓfunction<script type="math/tex" id="MathJax-Element-584">\ell_{function}</script>被称为替代损失函数:
常用的替代损失函数
0/1<script type="math/tex" id="MathJax-Element-738">0/1</script>损失函数:
ℓ0/1(z)={10,if z<0;,otherwise.
<script type="math/tex; mode=display" id="MathJax-Element-739"> \ell_{0/1}(z)=\left\{ \begin{aligned} 1&,\mathbb{if}\space z\lt0;\\ 0&,\mathbb{otherwise}.\\ \end{aligned} \right. </script>
hinge损失:
ℓhinge(z)=max(0,1−z)
<script type="math/tex; mode=display" id="MathJax-Element-795">\ell_{hinge}(z)=\max(0,1-z)</script>
指数损失(exponetial loss):
ℓexp(z)=exp(−z)
<script type="math/tex; mode=display" id="MathJax-Element-793">\ell_{\exp}(z)=\exp(-z)</script>
对率损失(logistic loss):
ℓlog(z)=log(1+exp(−z))
<script type="math/tex; mode=display" id="MathJax-Element-806">\ell_{\log}(z)=\log(1+\exp(-z))</script>
松弛变量和软间隔支持向量机
引入松弛变量εi≥0<script type="math/tex" id="MathJax-Element-1107">\varepsilon_i\ge0</script>,于是优化目标函数可以写成:
minw,b,εi12||w||2+C∑i=1mεis.t. yi(wTxi+b)≥1−εiεi≥0
<script type="math/tex; mode=display" id="MathJax-Element-1108"> \min_{\mathbf{w},b,\varepsilon_i}\dfrac{1}{2}||\mathbf{w}||^2+C\sum_{i=1}^{m}\varepsilon_i\\ s.t. \space y_i(\mathbf{w}^T\mathbf{x}_i+b)\ge1-\varepsilon_i\\ \varepsilon_i\ge0\\ </script>
上式就是软间隔支持向量机
上式中每一个样本都有一个对于的松弛变量,以表征该样本不满足约束的程度。
软间隔支持向量机
使用拉格朗日乘子法:
L(w,b,α,ε,μ)=minw,b,εi12||w||2+C∑i=1mεi+∑i=1mαi(1−εi−yi(wTxi+b))−∑i=1mμiεi
<script type="math/tex; mode=display" id="MathJax-Element-1715"> L(\mathbf{w},b,\boldsymbol{\alpha},\boldsymbol{\varepsilon},\boldsymbol{\mu})=\min_{\mathbf{w},b,\varepsilon_i}\dfrac{1}{2}||\mathbf{w}||^2+C\sum_{i=1}^{m}\varepsilon_i+\sum_{i=1}^{m}\alpha_i(1-\varepsilon_i-y_i(\mathbf{w}^T\mathbf{x}_i+b))-\sum_{i=1}^{m}\mu_i\varepsilon_i\\ </script>
其中:αi≥0,μi≥0<script type="math/tex" id="MathJax-Element-1716">\alpha_i\ge0,\mu_i\ge0</script>式拉格朗日乘子。
令L(w,b,α,ε,μ)<script type="math/tex" id="MathJax-Element-1717">L(\mathbf{w},b,\boldsymbol{\alpha},\boldsymbol{\varepsilon},\boldsymbol{\mu})</script>对w,b,εi<script type="math/tex" id="MathJax-Element-1718">\mathbf{w},b,\varepsilon_i</script>
偏导为零。
w=∑i=1mαiyixi0=∑i=1mαiyiC=αi+μi
<script type="math/tex; mode=display" id="MathJax-Element-1719"> \mathbf{w}=\sum_{i=1}^{m}\alpha_iy_i\mathbf{x}_i\\ 0=\sum_{i=1}^{m}\alpha_iy_i\\ C=\alpha_i+\mu_i </script>
同时得到对偶问题:
maxαs.t.∑i=1mαi−12∑i=1m∑j=1mαiyiαjyjxTixj∑i=1mαiyi=0,0≤αi≤C,i=1,2,…,m.
<script type="math/tex; mode=display" id="MathJax-Element-1720"> \begin{aligned} \mathop{\max}_{\alpha}&\sum_{i=1}^{m}\alpha_i-\dfrac{1}{2}\sum_{i=1}^{m}\sum_{j=1}^{m}\alpha_iy_i\alpha_jy_j\mathbf{x}_i^T\mathbf{x}_j\\ s.t.&\sum_{i=1}^{m}\alpha_iy_i=0,\\ &0\le\alpha_i\le{C},i=1,2,\dots,m.\\ \end{aligned} </script>
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)