AI-Security-Internships-2026/11-explainable-malware-detection

GitHub: AI-Security-Internships-2026/11-explainable-malware-detection

结合 SHAP/LIME 可解释性方法的静态与动态恶意软件检测机器学习管道,帮助安全分析师理解并信任每一次分类决策。

Stars: 0 | Forks: 0

# 面向恶意软件检测与行为分析的可解释 AI ## 研究问题 开发一个用于静态和动态恶意软件分析的机器学习 pipeline,并集成 SHAP/LIME 可解释性,以便安全分析师能够理解并信任每一个分类决策。 ## 目标 1. 针对该主题进行系统性的文献综述。 2. 设计并实现概念验证原型。 3. 在真实或基准数据集上评估原型。 4. 将研究发现记录在最终技术报告中。 5. 向研究小组展示结果。 ## 预期交付物 | 交付物 | 截止时间 | |---|---| | 文献综述 (`docs/literature-review.md`) | 第 2 周 | | 架构设计文档 (`docs/proposal.md`) | 第 3 周 | | 可运行的原型 (`src/`) | 第 6 周 | | 评估结果 (`experiments/results/`) | 第 7 周 | | 最终报告 (`docs/final-report.md`) | 第 8 周 | ## 推荐技术栈 ``` Python, scikit-learn, LightGBM, SHAP, LIME, Streamlit, Pandas ``` 有关固定版本的依赖项,请参见 `requirements.txt`。 ## 每周工作流 ``` Monday – Review weekly tasks in tasks/week-XX.md Tue–Thu – Implementation / experiments Friday – Document progress in docs/weekly-progress.md Friday – Open weekly Pull Request from your branch → dev ``` ## 分支策略 | 分支 | 用途 | |---|---| | `main` | 仅包含稳定、经主管审查的代码 | | `dev` | 集成分支 —— 每周的 PR 合并到此分支 | | `-week-XX` | 你每周的工作分支 | **学生严禁直接推送到 `main`。** ## Pull Request 策略 - 每周一个 PR,目标分支为 `dev`。 - PR 标题格式:`[Week XX] 简要描述` - PR 描述必须引用每周的任务文件并总结所完成的工作。 - 合并前必须由主管或同学进行审查。 ## 快速入门 ``` # 1. Clone 仓库 git clone https://github.com/AI-Security-Internships-2026/11-explainable-malware-detection.git cd 11-explainable-malware-detection # 2. 创建并激活虚拟环境 python -m venv .venv source .venv/bin/activate # Windows: .venv\Scripts\activate # 3. 安装依赖 pip install -r requirements.txt # 4. 创建你的每周 branch git checkout dev git pull origin dev git checkout -b your-name-week-01 # 5. 运行 starter script python src/main.py ``` ## 2026年9月8日路线图 **当前状态:** 目前处于第 2 周(文献综述、EMBER 数据集笔记)—— 落后于团队的正常进度,但根据以下时间表,W1–W2 的截止日期为 8 月 4 日。完整的日期安排已作为 issue #3–#8 存在;本部分仅作为指引,不能替代它们。**请同时修复 PR #11 的基础分支(目前是 `main`,应为 `dev`)—— 请参阅该 PR 上的评论。** **创新贡献目标:** LightGBM + SHAP + LIME(根据 issue #12)是一个正确但常规的基线 —— 请争取在下方 W5/W6 里程碑中,在 SHAP 值之上叠加一层由 LLM 生成的自然语言解释,或者采用基于反事实/概念的解释方法。 | 日期 | 里程碑 | 详情 | |---|---|---| | 8 月 4 日 | W1–W2:文献综述 + 数据集设置 | issue #3 | | 8 月 11 日 | W3:静态特征提取 + 基线分类器 | issue #4 | | 8 月 18 日 | W4:SHAP 可解释性 + 消融实验 | issue #5 | | 8 月 25 日 | W5:LLM 动态行为总结(创新方向见 issue #12) | issue #6 | | 9 月 1 日 | W6:组合 pipeline + 全面评估 | issue #7 | | **9 月 8 日** | **W7:IEEE 格式论文初稿 —— 最终截止日期** | issue #8 | ## 主管说明 本仓库由 **CNIT/PNTLab Pisa, TECIP, Scuola Superiore Sant'Anna** 管理。 在进行架构更改之前,请联系您的主管。 所有代码必须是原创的或已正确注明出处。 **不要**提交 API 密钥、密码或大型数据集 —— 请参见 `.gitignore`。
标签:Apex, Kubernetes, 云安全监控, 可解释AI, 机器学习, 逆向工具, 静态分析