abubakerDevOps/advanced-eda-feature-engineering

GitHub: abubakerDevOps/advanced-eda-feature-engineering

该项目使用 Python 对在线订单数据集进行系统性的数据清洗、异常值检测和特征工程,最终输出可直接用于机器学习建模的洁净数据集。

Stars: 0 | Forks: 0

# 高级 EDA 与特征工程 本项目对在线订单数据集进行清洗和探索性分析,并为其机器学习任务做好准备。 ## 项目工作 - 检查了数据结构、数据类型、重复值和缺失值 - 使用众数填补了分类特征 `CouponCode` 的缺失值 - 使用 IQR 方法检测了数值型异常值 - 保留了所有数据行,并将 `TotalPrice` 的极端值封顶至单独的列中 - 创建了日期、优惠券、转化率、数值区间和 log 转换特征 - 添加了验证检查并保存了最终准备好的数据集 ## 文件 - `Advanced_EDA_and_Feature_Engineering.ipynb` — 包含输出的完整分析 - `Dataset_for_Data_Analytics.xlsx` — 原始数据集 - `cleaned_orders_with_features.csv` — 经过清洗和特征工程处理的数据集 - `requirements.txt` — 所使用的 Python 库 ## 运行方式 1. 安装 Python 和 Jupyter Notebook。 2. 在此项目文件夹中打开终端。 3. 运行: ``` pip install -r requirements.txt jupyter notebook ``` 4. 打开 `Advanced_EDA_and_Feature_Engineering.ipynb` 并运行所有单元格。 ## 主要结果 最终的数据集包含 1,200 行,不存在剩余缺失值和重复行,并新增了七个工程化特征。保留了原始的 `TotalPrice` 以确保透明度,同时提供了 `TotalPrice_Capped` 以供对异常值敏感的模型使用。 ## 作者 Abubaker Imran
标签:NoSQL, Python, 代码示例, 探索性数据分析, 数据分析, 数据清洗, 无后门, 特征工程, 逆向工具