(2020李宏毅)机器学习-Logistic Regression
Logistic Regression
Three Steps of machine learning
Step1:Function Set
f w , b ( x ) = P w , b ( C 1 ∣ x ) f_{w, b}(x)=P_{w, b}\left(C_{1} \mid x\right) fw,b(x)=Pw,b(C1∣x)
w i : weight, b : bias, σ ( z ) : sigmoid function, x i : input w_{i}: \text { weight, } b: \text { bias, } \sigma(z): \text { sigmoid function, } x_{i} \text { : input } wi: weight, b: bias, σ(z): sigmoid function, xi : input
Step 2: Goodness of a Function

由于 L ( w , b ) L(w,b) L(w,b)是乘积项的形式,为了方便计算,将上式做个变换:
w ∗ , b ∗ = arg max w , b L ( w , b ) = arg min w , b ( − ln L ( w , b ) ) − ln L ( w , b ) = − ln f w , b ( x 1 ) − ln f w , b ( x 2 ) − ln ( 1 − f w , b ( x 3 ) ) − … \begin{array}{l} w^{*}, b^{*}=\arg \max _{w, b} L(w, b)=\arg \min _{w, b}(-\ln L(w, b)) \\ -\ln L(w, b)=-\ln f_{w, b}\left(x^{1}\right) \\ -\ln f_{w, b}\left(x^{2}\right) \\ -\ln \left(1-f_{w, b}\left(x^{3}\right)\right) \\ -\ldots \end{array} w∗,b∗=argmaxw,bL(w,b)=argminw,b(−lnL(w,b))−lnL(w,b)=−lnfw,b(x1)−lnfw,b(x2)−ln(1−fw,b(x3))−…
由于class 1和class 2的概率表达式不统一,上面的式子无法写成统一的形式,为了统一格式,将Logistic Regression里的所有Training data都打上0和1的标签,即output y ^ = 1 \hat y=1 y^=1代表class 1,output y ^ = 0 \hat y=0 y^=0代表class 2,于是上式进一步改写成:
− ln L ( w , b ) = − [ y ^ 1 ln f w , b ( x 1 ) + ( 1 − y ^ 1 ) ln ( 1 − f w , b ( x 1 ) ) ] − [ y ^ 2 ln f w , b ( x 2 ) + ( 1 − y ^ 2 ) ln ( 1 − f w , b ( x 2 ) ) ] − [ y ^ 3 ln f w , b ( x 3 ) + ( 1 − y ^ 3 ) ln ( 1 − f w , b ( x 3 ) ) ] − … \begin{aligned} -\ln L(w, b)=&-\left[\hat{y}^{1} \ln f_{w, b}\left(x^{1}\right)+\left(1-\hat{y}^{1}\right) \ln \left(1-f_{w, b}\left(x^{1}\right)\right)\right] \\ &-\left[\hat{y}^{2} \ln f_{w, b}\left(x^{2}\right)+\left(1-\hat{y}^{2}\right) \ln \left(1-f_{w, b}\left(x^{2}\right)\right)\right] \\ &-\left[\hat{y}^{3} \ln f_{w, b}\left(x^{3}\right)+\left(1-\hat{y}^{3}\right) \ln \left(1-f_{w, b}\left(x^{3}\right)\right)\right] \\ &-\ldots \end{aligned} −lnL(w,b)=−[y^1lnfw,b(x1)+(1−y^1)ln(1−fw,b(x1))]−[y^2lnfw,b(x2)+(1−y^2)ln(1−fw,b(x2))]−[y^3lnfw,b(x3)+(1−y^3)ln(1−fw,b(x3))]−…
==>
− ln L ( w , b ) = ∑ n − [ y ^ n ln f w , b ( x n ) + ( 1 − y ^ n ) ln ( 1 − f w , b ( x n ) ) ] -\ln L(w, b)=\sum_{n}-\left[\hat{y}^{n} \ln f_{w, b}\left(x^{n}\right)+\left(1-\hat{y}^{n}\right) \ln \left(1-f_{w, b}\left(x^{n}\right)\right)\right] −lnL(w,b)=∑n−[y^nlnfw,b(xn)+(1−y^n)ln(1−fw,b(xn))]
Step 3: Find the best function
运用梯度下降来优化
以下为推导过程:
Sigmoid函数求导:参见激活函数Sigmoid求导

Logistic Regression + Square error

当 y ^ = 1 \hat y=1 y^=1时,会出现 ∂ L ∂ w i = 0 \frac{\partial L}{\partial w_{i}}=0 ∂wi∂L=0,这会造成收敛过慢
可视化 交叉熵和平方误差
Generative v.s. Discriminative
Generative model和discriminative model的差别就在于,Generative的model它有做了某些假设,假设你的data来自于某个概率模型;而Discriminative的model是完全不作任何假设的
Multi-class Classification


DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)