项目目的
理解数据预处理在机器学习中的核心作用,掌握缺失值处理、离群值检测、数据标准化、特征编码 / 离散化的基本原理。
熟练使用 Python(NumPy、Pandas)及 Scikit-learn 库实现各类数据预处理操作。
能够针对不同类型的数据集选择合适的预处理方法,并分析预处理结果的合理性。
培养数据处理的实践能力和问题分析能力,为后续机器学习建模奠定基础。
项目内容
第一课时:实验准备与缺失值处理
第二课时:离群值检测
第三课时:数据标准化
第四课时:特征编码与离散化
项目步骤
第一课时:实验准备与缺失值处理
(1)环境检查
(2)数据集说明
介绍实验所用两个数据集:
+ “teenager_sns”包含30000个样本的美国高中生社交网络信息数据集。每个样本包含40个变量,其中 gradyear, gender, age和friends四个变量代表高中生的毕业年份、性别、年龄和好友数等基本信息。 其余36个变量代表36个词语,代表高中生的5大兴趣。
+ “accord_sedan_testing”是一个二手汽车数据集,包含二手汽车的价格、已行驶英里、上市年份、档次、引擎缸数、换挡方式等
2. 缺失值处理原理讲解
缺失值的常见类型:随机缺失、非随机缺失、完全随机缺失。
缺失值处理的常用方法:删除法、均值 / 中位数 / 众数填充法、插值法、模型预测填充法。
本次实验重点:使用 Scikit-learn 的Imputer实现均值填充。
3. 缺失值处理实操
第二课时:离群值检测
1.离群值检测原理
2. 离群值检测实操
第三课时:数据标准化
1. 数据标准化原理讲解
2. 数据标准化实操
第四课时:特征编码与离散化
1. 特征编码与离散化原理讲解
2. 特征编码与离散化实操
项目要求
补全所有待补全代码,运行并输出正确结果。
分析不同预处理方法对teenager_sns数据集中friends列分布的影响(绘制直方图对比)。
针对accord_sedan_testing数据集的离群值,提出两种处理方案(删除 / 缩尾)并实现。
2026年春江苏开放大学机器学习060729线下实训一
点点赞赏,手留余香
给TA打赏


评论0