• 决策树—分类、预测

什么是决策树?
决策树是一种非常普遍的数据挖掘技术,顾名思义,决策树就是建模过程类似于一棵树的成长过程,从树根、树干、分支,分叉,最后到树叶,在决策树里,所分析的数据样本,先集成为一个树根,然后进行层层的分支,最后形成一个个的节点,每个节点代表一个结论

决策树的优点有哪些?
1.决策树的优点在于决策树的构造不需要任何领域的知识,很适合探索性的数据挖掘发现,而且可以处理高纬度的数据
2.决策树最大的优点在于,它所生成的一系列的从树根到树叶的规则,很容易被分析师所理解,甚至不需要经过专门的处理,可以直接应用的业务优化策略和业务优化路径
3.决策树对数据的分布甚至缺失非常宽容,不容易受到极值的影响

常用的决策树算法有哪些?
常用的决策树算法主要有CHAID、CART、ID3、C4.5、C5.0等
CHAID:卡方自动相互关系检验
什么是卡方检验?
卡方检验是假设检验的一种,即统计样本中实际观测值与理论观测值的偏离程度,偏离程度决定卡方值的大小,卡方值越大,误差越大,越不符合,卡方值越小,误差越小,越符合,如果卡方值为0,则完全符合

CHAID主要是依据局部最优原则(节点直接互不相关),然后利用卡方检验来选择对因变量最有影响的自变量,同时CHAID应用的一个前提是,因变量为类别型变量(依据类别划分的变量,比如男、女)

CART:分类与回归树
1.CART的分割逻辑与CHAID相同, 每一层的划分都是基于自变量的检验和选择上,但是CHAID采用的是卡方检验,而CART采用的是基尼系数
2.CART与CHAID之间最大的不同,CHAID采用的是局部最优的原则,节点之间互不相干,而CART则是着眼于全局优化,即先让树尽可能的成长,然后再返回来进行修剪,有些类似于统计分析中的反向选择
3.CART生产的决策树是二分的,即所有的节点都只能分出两个枝
4.CART在树的成长过程中,同一个自变量可以被多次的使用(分割)
5.同时,如果自变量存在数据缺失的情况,CART会找一个替代数据来代替缺失值,而CHAID则会把缺失值单独作为一类数据

ID3:迭代的二分器
ID3最大的特点:选择自变量是基于信息增益的度量,选择具有最高信息增益的属性作为节点的分裂/分割属性

C4.5
C4.5最大的特点:计算信息增益的信息增益率,选择具有最高信息增益率的数据作为分裂/分割属性

  • 神经网络—分类、预测
    顾名思义,利用数学算法来模仿人脑,在人的大脑中,有数以百亿的生物神经元,神经元之间相互连接,使得人的大脑产生精密的逻辑计算,而神经网络也是一样,存在大量的并行人工神经元,通过调整谅解强度从经验知识中进行学习的能力,并应用

神经网络:通过多个非线性模型输入以及不同模型之间的加权(隐藏层),最终得出一个输出模型,隐藏层包含的是非线性函数
目前,主流的神经网络算法:反馈传播,主要是在多层前向型神经网络上进行学习,而前向型神经网络又是由一个输入层,多个隐藏层,一个输出层组成

前向型网络:
这里写图片描述

反馈型网络:
这里写图片描述

由于神经网络拥有特有的大规模并行结构和信息并行处理的特点,因此神经网络具有很好的自适应性、自组织性、高容错性,具有较强的学习、记忆、识别等功能,但是神经网络最大的一个缺点就是知识和成果难以解释,没有人能够看清或者知道隐蔽层的非线性函数是如何处理自变量的

影响神经网络建模的5个因素:
1.层数 2.每层中输入变量的数量 3.联系的种类 4. 联系的程度 5.转换函数(又称激活函数或挤压函数)

  • 回归
    回归分为线性回归和逻辑斯蒂回归(又包括响应预测、分类划分)

多元线性回归
多元线性回归描述的是一个因变量如何随着一批自变量的变化而变化,因变量的变化分为两部分:系统性变化和随机变化,其中系统性变化是由自变量引起的,而随机变化是不能由自变量来解释的,称之为残值

估算多元线性回归方程中自变量系数的方法中,最常用的就是最小二乘法
同时,使用最小二乘法,必须要满足一下三点假设:
1.输入变量是确定的变量,不是随机变量,而且输入的变量间无线性相关,即无共线性
2.随机误差的期望值总和为零,即随机误差与自变量不相关
3.随机误差呈正态分布((具有两个参数μ和σ^2的连续型随机变量分布,第一个参数μ是服从正态分布的随机变量的均值,第二个参数σ^2是随机变量的方差,服从正态分布的随机变量的概率规律为与μ越近的值,概率越大,而σ越小,分布越集中)

逻辑回归
凡是二选一的事件,比如“响应”与“不响应”,“买”还是“不买”,都可以使用逻辑斯蒂回归
逻辑斯蒂回归的因变量的概率在0到1之间,参数的估计方法使用的是最大似然法,原理是找到这样一个参数,可以让样本数据所包含的观察值被观察到的可能性最大,但是这种寻找最大可能性的方法需要反复计算,对计算能力要求高,优点是在大样本数据中参数的估值稳定、偏差小、估值方差小

  • 关联规则
    关联规则的主要目的是找出数据集中的频繁模式,即多次重复出现的模式和并发关系,,即同时出现的关系,频繁和并发关系也称作关联
    支持度:反映发现规则的有用性,X->Y指的是事物全机种包含XUY的事物百分比,如果支持度太小,则可以认为是偶然事件
    置信度:反映发现规则的确定性,X->Y值得是包含了X又包含了Y的事物数量占所有包含X的事物数量的百分比

Apriori算法:
1.生成所有的频繁项目集,一个频繁项目集是一个支持度高于最小支持度阈值的项目集
2.从频繁项目集中生成所有的可信关联规则,这里的可信关联规则是指置信度大于最小置信度阈值的规则

  • 聚类
    聚类,通常来说,打个比如—“物以类聚,人以群分”,经过划分后,每个群组内部各个对象间的相似度会很高,在不同组之间的对象具有很高的相异度

聚类的分析方法:划分的方法、层次的方法、基于密度的方法、基于网格的方法、基于模型的方法
划分的方法:K-means,随机选择K个对象,然后将所选择的每个对象都代表一个组的初始均值或初始的组中心值,然后对剩余的每个对象,根据与各个组初始均值的距离,分配到最近的小组,然后不断的重复,直至所有的对象都被分配到相应的组

层次的方法:一次让最相似的数据对象两两合并,然后不断的合并,形成一个聚类树

  • 贝叶斯分类方法—分类
    贝叶斯分类方法主要用于预测类成员间关系的可能性

贝叶斯公式:
这里写图片描述

A表示那个属性的测量描述,B为某种假设,P(B|A)表示的是通过A的描述,获得B的概率,,分母可以简称为P(X),表示满足A条件的概率,P(B)表示的是满足B条件的概率,而P(A|B)满足B条件情况下,满足A的概率

  • 支持向量机—SVM分类
    支持向量机的原则:以结构风险最小为原则,在线性的情况下,就在元空间寻找两类样本的最有分类超平面,在非线性的情况下,使用一种非线性的映射,将原训练集数据映射到更高的维,在新的维上,搜索线性最佳分离超平面,注意,使用一个适当的对足够高维的非线性也舍,两类数据总是能够被分开

距离超平面最近的一类向量被称为支持向量,一组支持向量可以唯一的确定一个超平面

支持向量机的缺点是训练数据较大,但是它的优点是对于复杂的非线性的决策边界的建模能力高度准确,并且不太容易产生过拟合(对结果的模拟太好了,不能反映真实的输入输出函数关系)

  • 主成分分析—主要用于数据处理、降维、变量间关系的探索
    主成分分析,从严格意义上来说,属于传统的统计分析的技术范畴
    主成分分析,通过线性组合将多个原始变量合并成若干个主成分,这样每个主成分都变成了原始变量的线性组合,这样转变的目的,一是可以大幅度的江都原始数据的维度,另一方面,可以在这个过程中发现原始数据属性之间的关系
    主成分分析的步骤:
    1.进行各变量的标准化工作,其目的是将数据按照比例进行缩放,使其落入一个较小的区域,从而让不同的变量经过标准化处理之后,可以有平等的分析和比较基础
    2.选择协方差阵或者相关阵计算特征根及对应的特征变量
    3.计算方差贡献率,根据方差贡献率的阈值选取合适的主成分个数
    4.根据主成分载荷的大小对选择的主成分进行命名
    5.根据主成分载荷计算各个主成分的得分

什么叫因子分析?
将主成分进行推广和延伸,就变成了因子分析

主成分分析和因子分析的联系和区别
1.主成分分析会把主成分表示成各个原始变量的线性组合,而因子分析则把原始变量表示成各个因子的线性组合
2.主成分分析的重点在于解释原始变量的总方差,而因子分析的重点在于解释原始变量的协方差
3.在主成分分析中,有几个原始变量就有几个成分,而在因子分析中,因子的个数可以根据业务场景的需要进行人为指定,并且,指定的因子数量不同,分析的结果也有不同的差异
4.在主成分分析中,给定的协方差矩阵或者相关矩阵的特征唯一时,主成分也是唯一的,但是在因子分析中,因子不是唯一的,并且通过旋转可以得到不同的因子

  • 假设检验
    假设检验是现代统计学的基础和核心之一,主要研究的是在一定的条件下,总体是否具备某些特定特征
    假设检验的基本原理就是小概率事件原理,即观测小概率时间在假设成立的情况下是否发生,如果在一次试验中,小概率事件发生了,那么说明在一定的水平下不可靠或者不成立,如果没有发生,也没有足够的理由来说明假设是错误的或者是正确的

假设检验的错误主要分为两大类:
第一类错误:当原假设为真,却否定它而犯的错误,又称弃真错误,弃真错误=1-置信度
第二类错误:当原假设为假,却肯定它而犯的错误,又称纳伪错误
在其他条件不变时,第一类错误和第二类错误是相反的,当第一类错误增大时,第二类错误就减小

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐