2026年春江苏开放大学机器学习060729线下实训一

项目目的
理解数据预处理在机器学习中的核心作用,掌握缺失值处理、离群值检测、数据标准化、特征编码 / 离散化的基本原理。
熟练使用 Python(NumPy、Pandas)及 Scikit-learn 库实现各类数据预处理操作。
能够针对不同类型的数据集选择合适的预处理方法,并分析预处理结果的合理性。
培养数据处理的实践能力和问题分析能力,为后续机器学习建模奠定基础。
项目内容
第一课时:实验准备与缺失值处理
第二课时:离群值检测
第三课时:数据标准化
第四课时:特征编码与离散化
项目步骤
第一课时:实验准备与缺失值处理
(1)环境检查
(2)数据集说明
介绍实验所用两个数据集:
+ “teenager_sns”包含30000个样本的美国高中生社交网络信息数据集。每个样本包含40个变量,其中 gradyear, gender, age和friends四个变量代表高中生的毕业年份、性别、年龄和好友数等基本信息。 其余36个变量代表36个词语,代表高中生的5大兴趣。
+ “accord_sedan_testing”是一个二手汽车数据集,包含二手汽车的价格、已行驶英里、上市年份、档次、引擎缸数、换挡方式等
2. 缺失值处理原理讲解
缺失值的常见类型:随机缺失、非随机缺失、完全随机缺失。
缺失值处理的常用方法:删除法、均值 / 中位数 / 众数填充法、插值法、模型预测填充法。
本次实验重点:使用 Scikit-learn 的Imputer实现均值填充。
3. 缺失值处理实操
第二课时:离群值检测
1.离群值检测原理
2. 离群值检测实操
第三课时:数据标准化
1. 数据标准化原理讲解
2. 数据标准化实操
第四课时:特征编码与离散化
1. 特征编码与离散化原理讲解
2. 特征编码与离散化实操
项目要求
补全所有待补全代码,运行并输出正确结果。
分析不同预处理方法对teenager_sns数据集中friends列分布的影响(绘制直方图对比)。
针对accord_sedan_testing数据集的离群值,提出两种处理方案(删除 / 缩尾)并实现。

资源下载
下载价格20
点点赞赏,手留余香 给TA打赏

评论0

请先
  • 游客 下载了资源 2013年921公务员考试联考《行测》真题答案及解析(河南卷)(1)
  • 游客 下载了资源 2015年黑龙江省公务员录用考试《行测》真题(公检法卷)答案及解析
  • 游客 下载了资源 2019年420联考《行测》真题(河北卷)答案及解析
  • 游客 下载了资源 2016年重庆市公务员考试《行测》真题(下半年卷)答案及解析
  • u******* 签到打卡,获得1元奖励
  • u******* 加入了本站
  • u******* 登录了本站
  • u******* 签到打卡,获得1元奖励
  • 游客 下载了资源 2012年915公务员联考《行测》答案及解析(新疆、福建、重庆、河南)
  • 游客 下载了资源 2016年423公务员联考《申论》(安徽A卷)及答案解析
  • 游客 下载了资源 2022年国家公务员考试《行测》真题(副省级)【答案+解析】
  • 游客 下载了资源 2016年上半年教师资格证考试《初中历史》题(解析)
  • 游客 下载了资源 2017年422公务员联考《行测》真题(贵州卷)答案及解析
  • 游客 下载了资源 2020年上半年教师资格证考试《初中体育与健康》题解析
  • 游客 下载了资源 2010年黑龙江公务员考试《行测》卷答案及解析
  • 游客 下载了资源 爱普生Epson PLQ-20K 打印机驱动
点击浏览器地址栏的⭐图标收藏本页
需要托管,代写作业(含实训)可以扫码加微信
显示验证码

社交账号快速登录

微信扫一扫关注
如已关注,请回复“登录”二字获取验证码