Logistic Regression


Three Steps of machine learning


Step1:Function Set

f w , b ( x ) = P w , b ( C 1 ∣ x ) f_{w, b}(x)=P_{w, b}\left(C_{1} \mid x\right) fw,b(x)=Pw,b(C1x)
在这里插入图片描述

w i :  weight,  b :  bias,  σ ( z ) :  sigmoid function,  x i  : input  w_{i}: \text { weight, } b: \text { bias, } \sigma(z): \text { sigmoid function, } x_{i} \text { : input } wi: weight, b: bias, σ(z): sigmoid function, xi : input 

Step 2: Goodness of a Function

在这里插入图片描述
由于 L ( w , b ) L(w,b) L(w,b)是乘积项的形式,为了方便计算,将上式做个变换:
w ∗ , b ∗ = arg ⁡ max ⁡ w , b L ( w , b ) = arg ⁡ min ⁡ w , b ( − ln ⁡ L ( w , b ) ) − ln ⁡ L ( w , b ) = − ln ⁡ f w , b ( x 1 ) − ln ⁡ f w , b ( x 2 ) − ln ⁡ ( 1 − f w , b ( x 3 ) ) − … \begin{array}{l} w^{*}, b^{*}=\arg \max _{w, b} L(w, b)=\arg \min _{w, b}(-\ln L(w, b)) \\ -\ln L(w, b)=-\ln f_{w, b}\left(x^{1}\right) \\ -\ln f_{w, b}\left(x^{2}\right) \\ -\ln \left(1-f_{w, b}\left(x^{3}\right)\right) \\ -\ldots \end{array} w,b=argmaxw,bL(w,b)=argminw,b(lnL(w,b))lnL(w,b)=lnfw,b(x1)lnfw,b(x2)ln(1fw,b(x3))
由于class 1和class 2的概率表达式不统一,上面的式子无法写成统一的形式,为了统一格式,将Logistic Regression里的所有Training data都打上0和1的标签,即output y ^ = 1 \hat y=1 y^=1代表class 1,output y ^ = 0 \hat y=0 y^=0代表class 2,于是上式进一步改写成:
− ln ⁡ L ( w , b ) = − [ y ^ 1 ln ⁡ f w , b ( x 1 ) + ( 1 − y ^ 1 ) ln ⁡ ( 1 − f w , b ( x 1 ) ) ] − [ y ^ 2 ln ⁡ f w , b ( x 2 ) + ( 1 − y ^ 2 ) ln ⁡ ( 1 − f w , b ( x 2 ) ) ] − [ y ^ 3 ln ⁡ f w , b ( x 3 ) + ( 1 − y ^ 3 ) ln ⁡ ( 1 − f w , b ( x 3 ) ) ] − … \begin{aligned} -\ln L(w, b)=&-\left[\hat{y}^{1} \ln f_{w, b}\left(x^{1}\right)+\left(1-\hat{y}^{1}\right) \ln \left(1-f_{w, b}\left(x^{1}\right)\right)\right] \\ &-\left[\hat{y}^{2} \ln f_{w, b}\left(x^{2}\right)+\left(1-\hat{y}^{2}\right) \ln \left(1-f_{w, b}\left(x^{2}\right)\right)\right] \\ &-\left[\hat{y}^{3} \ln f_{w, b}\left(x^{3}\right)+\left(1-\hat{y}^{3}\right) \ln \left(1-f_{w, b}\left(x^{3}\right)\right)\right] \\ &-\ldots \end{aligned} lnL(w,b)=[y^1lnfw,b(x1)+(1y^1)ln(1fw,b(x1))][y^2lnfw,b(x2)+(1y^2)ln(1fw,b(x2))][y^3lnfw,b(x3)+(1y^3)ln(1fw,b(x3))]
==>
− ln ⁡ L ( w , b ) = ∑ n − [ y ^ n ln ⁡ f w , b ( x n ) + ( 1 − y ^ n ) ln ⁡ ( 1 − f w , b ( x n ) ) ] -\ln L(w, b)=\sum_{n}-\left[\hat{y}^{n} \ln f_{w, b}\left(x^{n}\right)+\left(1-\hat{y}^{n}\right) \ln \left(1-f_{w, b}\left(x^{n}\right)\right)\right] lnL(w,b)=n[y^nlnfw,b(xn)+(1y^n)ln(1fw,b(xn))]
在这里插入图片描述

Step 3: Find the best function

运用梯度下降来优化
以下为推导过程:
在这里插入图片描述
Sigmoid函数求导:参见激活函数Sigmoid求导
在这里插入图片描述
在这里插入图片描述


Logistic Regression + Square error


在这里插入图片描述

y ^ = 1 \hat y=1 y^=1时,会出现 ∂ L ∂ w i = 0 \frac{\partial L}{\partial w_{i}}=0 wiL=0,这会造成收敛过慢

可视化 交叉熵和平方误差
在这里插入图片描述


Generative v.s. Discriminative


Generative model和discriminative model的差别就在于,Generative的model它有做了某些假设,假设你的data来自于某个概率模型;而Discriminative的model是完全不作任何假设的


Multi-class Classification


在这里插入图片描述
在这里插入图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐