Python 数据挖掘实战项目:电商用户行为分析(聚类分群、流失预测与关联规则)
数据挖掘课程设计与竞赛入门的共同痛点是「没有真实数据可练」。本工程内置一个带真实行为规律的订单数据生成器(5000 用户 / 约 3 万条订单,含类目偏好、连带下单、用户衰减流失三类规律,还故意注入脏数据),从清洗到报告的完整五步管道一键跑通。
一、五步管道
| 脚本 | 环节 | 要点 |
|---|---|---|
| generate_data.py | 合成数据 | 含脏数据注入,专练清洗 |
| step1_clean_rfm.py | 清洗+特征 | 去重/缺失/异常金额 + RFM |
| step2_kmeans_segments.py | 聚类分群 | 肘部法+轮廓系数自动选 K |
| step3_churn_predict.py | 流失预测 | 时间外推防标签泄漏 |
| step4_apriori_rules.py | 关联规则 | 纯 Python 实现,无 mlxtend |
二、两个工程亮点
防标签泄漏:流失预测的时间外推设计——用前段行为预测后段流失,而不是同窗口自证,这是课程设计里最常被评委抓住的硬伤。Apriori 手写实现:不依赖 mlxtend,支持度/置信度的计算过程全部可见,答辩被问到「关联规则怎么实现的」时有代码可指。
三、跑法与产出
pipinstall-rrequirements.txt python generate_data.py&&python step1_clean_rfm.py python step2_kmeans_segments.py&&python step3_churn_predict.py python step4_apriori_rules.py&&python step5_report_charts.py产出:分群画像、模型指标对比(逻辑回归 vs 随机森林)、关联规则表、4 张可视化图表与分析摘要报告——直接就是一份完整的课程设计交付物。
📦 本文对应的完整挖掘工程(数据生成器+五步脚本)已整理上传:点击查看资源包