abubakerDevOps/advanced-eda-feature-engineering
GitHub: abubakerDevOps/advanced-eda-feature-engineering
该项目使用 Python 对在线订单数据集进行系统性的数据清洗、异常值检测和特征工程,最终输出可直接用于机器学习建模的洁净数据集。
Stars: 0 | Forks: 0
# 高级 EDA 与特征工程
本项目对在线订单数据集进行清洗和探索性分析,并为其机器学习任务做好准备。
## 项目工作
- 检查了数据结构、数据类型、重复值和缺失值
- 使用众数填补了分类特征 `CouponCode` 的缺失值
- 使用 IQR 方法检测了数值型异常值
- 保留了所有数据行,并将 `TotalPrice` 的极端值封顶至单独的列中
- 创建了日期、优惠券、转化率、数值区间和 log 转换特征
- 添加了验证检查并保存了最终准备好的数据集
## 文件
- `Advanced_EDA_and_Feature_Engineering.ipynb` — 包含输出的完整分析
- `Dataset_for_Data_Analytics.xlsx` — 原始数据集
- `cleaned_orders_with_features.csv` — 经过清洗和特征工程处理的数据集
- `requirements.txt` — 所使用的 Python 库
## 运行方式
1. 安装 Python 和 Jupyter Notebook。
2. 在此项目文件夹中打开终端。
3. 运行:
```
pip install -r requirements.txt
jupyter notebook
```
4. 打开 `Advanced_EDA_and_Feature_Engineering.ipynb` 并运行所有单元格。
## 主要结果
最终的数据集包含 1,200 行,不存在剩余缺失值和重复行,并新增了七个工程化特征。保留了原始的 `TotalPrice` 以确保透明度,同时提供了 `TotalPrice_Capped` 以供对异常值敏感的模型使用。
## 作者
Abubaker Imran
标签:NoSQL, Python, 代码示例, 探索性数据分析, 数据分析, 数据清洗, 无后门, 特征工程, 逆向工具