Alam1n/Multi-Class-Malware-Detection-Architecture-Benchmarking-Sandbox

GitHub: Alam1n/Multi-Class-Malware-Detection-Architecture-Benchmarking-Sandbox

基于机器学习与深度学习的多类网络恶意软件检测架构基准测试平台,从网络流数据中检测并分类 Adware、Ransomware、Trojan 和 Spyware,同时评估各模型的生产级资源开销与推理延迟。

Stars: 0 | Forks: 0

# 多类恶意软件检测架构基准测试 Sandbox 一个综合性的机器学习与深度学习基准测试套件,旨在从网络流数据中检测并分类多类网络恶意软件(Adware、Ransomware、Trojan 和 Spyware)。 本项目实现了端到端的数据科学 pipeline,涵盖从原始 CSV 数据摄取和处理严重的类别不平衡,到高级特征工程(LASSO 和 Autoencoders),以及在标准 ML 模型、Hybrid CNN-LSTMs 和 Deep Autoencoders 之间进行训练对比基线评估。至关重要的是,该 pipeline 不仅根据准确率评估架构,还根据真实世界的生产指标进行评估:CPU 执行时间、内存占用和推理延迟。 ## 架构特性 生产级数据摄取与清洗:自动化的摄取 pipeline 将多样化的目录结构映射为统一的多类目标。实现了稳健的数据清理机制,可处理高吞吐量网络捕获日志中常见的无限值和结构性缺失。 合成少数类过采样技术 (SMOTE):解决目标配置文件中系统性的类别不平衡问题,防止分类器出现多数类偏差。 ### 双向量降维: 统计与线性选择:采用 L1 正则化的 LASSO 回归,将高维网络属性压缩为一组具有高预测性的核心特征。 无监督潜在空间投影:采用深度 Autoencoders 将数据压缩为紧凑的 16 维瓶颈表示,用于 Hybrid ML 变体。 ### 全面的模型库: 经典基线:Random Forest, Support Vector Machines (LinearSVC / SGDClassifier)。 统计深度混合模型:PCA + SVM, Autoencoder + Random Forest, Autoencoder + SVM。 深度学习序列:独立的 1D-CNNs、独立的 LSTMs,以及专为空间特征提取结合时序序列学习而定制的统一 CNN-LSTM 混合模型。 资源与延迟基准测试基础设施:利用系统工具 (psutil) 的自定义评估框架,用于输出关于峰值运行内存跳变、执行工作负载以及每样本硬件推理延迟(毫秒)的显式遥测配置文件。 ## 技术栈与依赖 核心数据工程:pandas, numpy 机器学习生态:scikit-learn, imbalanced-learn 深度学习框架:tensorflow / keras 系统遥测:psutil, time 可视化引擎:matplotlib, seaborn ## 记录的基准测试指标 评估的每个架构都会根据以下属性进行索引,并直接保存到本地报告结构中 (final_malware_detection_results_complete.csv): 分类能力:多类准确率、加权 Precision、加权 Recall 和 F1-Score。 操作边界指标:跨多类聚合的混淆矩阵(True Positives, True Negatives, False Positives, False Negatives)。 硬件占用:训练运行 CPU 时间(秒)、动态内存消耗增量 (MB),以及单样本推理延迟响应时间 (ms)。 ## 入门与本地设置 前置条件 确保您的本地开发环境运行 Python 3.8+。 1. 克隆与环境配置 `git clone [https://github.com/your-username/your-repo-name.git](https://github.com/Alam1n/Multi-Class-Malware-Detection-Architecture-Benchmarking-Sandbox) cd your-repo-name pip install -r requirements.txt ` 2. 数据集设置 在运行 pipeline 之前,请确保您的网络捕获 CSV 文件按照以下与数据集配置相匹配的子目录结构进行组织: `archive (11)/ ├── adware/adware/csv/ ├── ransomeware/ransomeware/csv/ ├── premiumsms/premiumsms/csv/ └── scareware/scareware/csv/ ` 注意:更新脚本执行目标中的 base_path 变量,使其与您的绝对系统位置引用相匹配。 3. 执行运行 要启动端到端数据 pipeline,平衡训练类别,执行特征提取,启动基准测试循环,并生成单独的可视化遥测图表: `python main.py 💾 模型产物存储配置 在完成执行循环后,pipeline 会安全地序列化所有生产就绪的模块,以便进行快速的下游部署: ` feature_scaler.pkl — 标准化的缩放参数向量映射。 lasso_svm_optimized.pkl & autoencoder_encoder.pkl — 提取的传统 ML 预测器和潜在 Autoencoders。 *.keras — 编译完成的深度学习模型,可通过原生 Keras 引擎随时集成至生产 pipeline 中。
标签:Apex, 数据科学, 机器学习, 深度学习, 网络流量分析, 资源验证, 逆向工具