决策树算法包括ID3,C4.5,CART。这里的CART:classification and regression tree.CART的本质是对特征空间进行二元分割,即CART生成的树是一颗二叉树,并能对标称属性与数值型属性进行分割。树模型有两个核心问题,一是如何选择当前节点中的特征来划分数据,二是树的构建何时停止。


1. 节点分支

对于标称属性而言,不论该属性有几种取值,都只能划分成二叉树。比如age = {young, medium, old},划分成young = {young}, no young = {medium, old} 或者 medium = {medium}, no medium = {young, old} 或者 old = {old}, no old = {young, medium}。

对于数值型属性而言,可以设定一个阈值T,大于该阈值的分为一类,小于该阈值的分为一类(等于的可以灵活操作)


2. 选择特征

CART选择特征的算法是计算当前属性的基尼指数,选择所有属性中基尼指数最小的属性作为划分当前节点数据的属性。基尼指数相对于信息增益计算更为简单。


3. CART分类

CART分类与ID3,C4.5无异。


4. CART回归

CART回归的结果,应该是取叶子节点的均值,或者按照距离权值来取,被预测样本与叶子节点中每个值距离越近权值越大。


5. 模型树

上面的结果都是直接对叶子节点的样本操作,但是更好的方式是对每个叶子节点建立一个线性模型。这样可以更为精确回归。


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐