机器学习:特征降维、KNN算法-分类、超参数搜索(网格搜索)、贝叶斯-分类
特征降维
特征降维其目的:是减少数据集的维度,同时尽可能保留数据的重要信息。
特征降维的好处:
减少计算成本:在高维空间中处理数据可能非常耗时且计算密集。降维可以简化模型,降低训练时间和资源需求。
去除噪声:高维数据可能包含许多无关或冗余特征,这些特征可能引入噪声并导致过拟合。降维可以帮助去除这些不必要的特征。
特征降维的方式:
特征选择:从原始特征集中挑选出最相关的特征
主成分分析(PCA):就是把之前的特征通过一系列数学计算,形成新的特征,新的特征数量会小于之前特征数量
特征选择
VarianceThreshold 低方差过滤特征选择
如果一个特征的方差很小,说明这个特征的值在样本中几乎相同或变化不大,包含的信息量很少,那么这个特征可以去掉。
-
计算方差:对于每个特征,计算其在训练集中的方差(每个样本值与均值之差的平方,在求平均)。
-
设定阈值:选择一个方差阈值,任何低于这个阈值的特征都将被视为低方差特征。
-
过滤特征:移除所有方差低于设定阈值的特征

根据相关系数的特征选择
相关系数用于衡量两个变量之间的线性关系强度,取值范围在-1到1之间。正值表示正相关,负值表示负相关,绝对值越接近1,相关性越强。在特征选择中,可以利用相关系数筛选与目标变量高度相关的特征,或剔除高度相关的冗余特征。
主成分分析
主成分分析(Principal Component Analysis, PCA)是一种降维技术,通过线性变换将高维数据投影到低维空间,使得数据在新坐标轴上的投影能够最大程度地保留数据的方差,同时减少数据的维度。
步骤


KNN算法-分类
样本距离:欧式距离、曼哈顿距离、余弦相似度、马氏距离等等。
就是算你要预测的样本与已经训练的样本之间的距离,然后拿出k个最近的样本,这k个样本有不同的类别,看哪种类别出现次数最多,那么你预测的那个样本就是那个样本。
缺点:
对于大规模数据集,计算量大,因为需要计算测试样本与所有训练样本的距离。
对于高维数据,距离度量可能变得不那么有意义,这就是所谓的“维度灾难”。
需要选择合适的k值和距离度量,这可能需要一些实验和调整。(k过小,例如只拿一个样本,万一那个样本刚好是错误的,k过大,把整个训练集包含了,那就相当于在统计哪一个类别最多)
KNN算法需要将数据先标准化,因为量纲对数据的影响很大。

贝叶斯-分类
贝叶斯分类是一种基于贝叶斯定理的统计分类方法,通过计算样本属于不同类别的概率,将样本分配到概率最大的类别中。其核心思想是利用先验概率和条件概率来推断后验概率。
拉普拉斯平滑系数
拉普拉斯平滑(Laplace Smoothing)是一种用于解决概率估计中零概率问题的技术。

贝叶斯不用标准化。
超参数搜索
超参数搜索是机器学习模型优化中的重要环节,旨在找到最优的超参数组合以提高模型性能。

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)