特征降维

特征降维其目的:是减少数据集的维度,同时尽可能保留数据的重要信息。

特征降维的好处:

减少计算成本:在高维空间中处理数据可能非常耗时且计算密集。降维可以简化模型,降低训练时间和资源需求。

去除噪声:高维数据可能包含许多无关或冗余特征,这些特征可能引入噪声并导致过拟合。降维可以帮助去除这些不必要的特征。

特征降维的方式:

特征选择:从原始特征集中挑选出最相关的特征

主成分分析(PCA):就是把之前的特征通过一系列数学计算,形成新的特征,新的特征数量会小于之前特征数量

特征选择

VarianceThreshold 低方差过滤特征选择

如果一个特征的方差很小,说明这个特征的值在样本中几乎相同或变化不大,包含的信息量很少,那么这个特征可以去掉。

  1. 计算方差:对于每个特征,计算其在训练集中的方差(每个样本值与均值之差的平方,在求平均)。

  2. 设定阈值:选择一个方差阈值,任何低于这个阈值的特征都将被视为低方差特征。

  3. 过滤特征:移除所有方差低于设定阈值的特征

根据相关系数的特征选择

相关系数用于衡量两个变量之间的线性关系强度,取值范围在-1到1之间。正值表示正相关,负值表示负相关,绝对值越接近1,相关性越强。在特征选择中,可以利用相关系数筛选与目标变量高度相关的特征,或剔除高度相关的冗余特征。

主成分分析

主成分分析(Principal Component Analysis, PCA)是一种降维技术,通过线性变换将高维数据投影到低维空间,使得数据在新坐标轴上的投影能够最大程度地保留数据的方差,同时减少数据的维度。

步骤

KNN算法-分类

样本距离:欧式距离、曼哈顿距离、余弦相似度、马氏距离等等。

就是算你要预测的样本与已经训练的样本之间的距离,然后拿出k个最近的样本,这k个样本有不同的类别,看哪种类别出现次数最多,那么你预测的那个样本就是那个样本。

缺点

对于大规模数据集,计算量大,因为需要计算测试样本与所有训练样本的距离。

对于高维数据,距离度量可能变得不那么有意义,这就是所谓的“维度灾难”。

需要选择合适的k值和距离度量,这可能需要一些实验和调整。(k过小,例如只拿一个样本,万一那个样本刚好是错误的,k过大,把整个训练集包含了,那就相当于在统计哪一个类别最多)

KNN算法需要将数据先标准化,因为量纲对数据的影响很大

贝叶斯-分类

贝叶斯分类是一种基于贝叶斯定理的统计分类方法,通过计算样本属于不同类别的概率,将样本分配到概率最大的类别中。其核心思想是利用先验概率和条件概率来推断后验概率

拉普拉斯平滑系数

拉普拉斯平滑(Laplace Smoothing)是一种用于解决概率估计中零概率问题的技术。

贝叶斯不用标准化。

超参数搜索

超参数搜索是机器学习模型优化中的重要环节,旨在找到最优的超参数组合以提高模型性能。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐