电商双 11 美妆数据分析项目学习总结
·
一、数据处理与分析流程
- 数据初步探索:运用 Pandas 库读取 “双十一淘宝美妆数据.csv” 文件,借助
head()、info()、shape、describe()等方法,快速了解数据的基本特征,包括数据规模(27598 条记录、7 个特征)、数据类型(3 个数值型、4 个对象型)、缺失值(sale_count和comment_count存在缺失)以及数值型特征的统计信息(如price的均值、标准差等)。这使我掌握了数据初步探索的关键方法,能快速把握数据集的整体情况,为后续分析奠定基础。 - 数据清洗:在重复值处理上,利用
drop_duplicates()函数删除重复值,并通过reset_index()重置索引,有效去除 86 条重复数据。对于缺失值,先观察缺失值所在行的情况,而后基于业务逻辑用 0 填充sale_count和comment_count的缺失值,确保数据的完整性,为准确分析提供保障。 - 特征工程:使用
jieba库对商品title进行分词,以挖掘商品特征。通过自定义分类规则,创建商品分类字典,为商品添加sub_type(子类别)和main_type(主类别)列。同时,根据商品标题中的关键词判断是否为男士专用,新增是否男士专用列,并通过计算price和sale_count的乘积得到销售额列。这些操作让我理解了如何从现有数据中挖掘新特征,提升数据的价值和分析的深度。 - 数据分析与可视化:运用
matplotlib和seaborn库进行数据可视化,绘制各类图表(如条形图、饼图、折线图)。通过分析各店铺的商品数量、销量、销售额以及平均每单单价等指标,发现价格与销量、销售额之间的关系,如低均价店铺的总销量和销售额更高。在分析各类别销售情况时,明确了护肤品类在大类中销量最高,清洁类和补水类在小类中销量领先。此外,还对性别因素进行分析,了解男士专用和非男士专用商品的销售差异,以及不同日期的销售波动情况,学会从多个维度深入分析数据,洞察数据背后的规律。
二、行业洞察
- 品牌表现差异:从数据中看出,不同品牌在商品数量、销量、销售额和评论数等方面表现各异。悦诗风吟商品数量多但销量和销售额排名相对靠后;相宜本草商品数量处于中游,却在销量和销售额上表现突出,且其平均每单评论数过高,可能存在刷单现象。这使我认识到品牌在市场中的表现受多种因素影响,需综合评估。
- 价格与销售关系:价格对销售影响显著,低均价品牌整体销量和销售额更高。但高端商品中,雅诗兰黛凭借品牌效应和良好的使用体验,在高价格区间仍有较高销售额。说明消费者在购买美妆产品时,价格是重要考虑因素,但品牌和产品品质同样关键。
- 性别市场差异:男士专用商品中,护肤品销量最高,妮维雅、欧莱雅、相宜本草在男士专用护肤品市场份额较大。而男士化妆品主要集中在唇膏类。男性市场虽占比相对较低,但有发展潜力,值得美妆企业关注和开拓。
- 销售时间波动:双 11 期间,销量在 9 日达到峰值,11 日当天急剧下滑,11 日后又缓慢增长。这主要是由于双 11 预热、预售活动促使消费者提前消费,以及消费者对双 11 当天网络卡顿的担忧。商家可据此调整营销策略,如在双 11 前加大推广力度,双 11 后通过优惠活动刺激二次消费。
三、技术收获
- Python 数据分析库的运用:熟练掌握了
pandas库进行数据读取、清洗、转换和分析,如数据筛选、分组计算、数据透视等操作;学会使用matplotlib和seaborn库绘制各类图表,实现数据的可视化展示,直观呈现数据特征和规律;还运用jieba库进行中文文本分词,拓展了文本数据处理的技能。 - 数据处理与可视化技巧:在数据处理过程中,学会处理重复值、缺失值,进行数据类型转换等;在可视化方面,掌握了图表的布局、标签设置、颜色搭配,以及如何选择合适的图表类型(如条形图用于比较、饼图展示占比、折线图呈现趋势)来有效传达数据信息。
四、总结与展望
通过本次学习,我不仅提升了数据分析的实践能力,还对美妆行业在双 11 期间的市场动态有了更深入的理解。在未来的学习和实践中,我将继续深化对数据分析方法和工具的学习,尝试运用更多的机器学习算法挖掘数据价值,如预测不同品牌的销售趋势、消费者购买行为分析等。同时,关注行业动态和市场变化,将数据分析与实际业务紧密结合,为企业决策提供更有价值的参考。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)