为啥一般都是这样用:

from sklearn.preprocessing import StandardScaler

sc = StandardScaler()

sc.fit_tranform(X_train)

sc.tranform(X_test)

机器学习中,训练集是知道的,但是测试集是未知的,所以做标准化时只能用训练集的参数(这个参数指 最大最小值标准化中的最大值最小值,或者是正态标准化中的均值和方差)来做,两个fit_transform是用的各自数据集的参数来进行标准化。
但是实际中,我们不能用测试集的参数来标准化测试集,要用训练集的参数来标准化训练集。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐