AI-Security-Internships-2026/11-explainable-malware-detection
GitHub: AI-Security-Internships-2026/11-explainable-malware-detection
结合 SHAP/LIME 可解释性方法的静态与动态恶意软件检测机器学习管道,帮助安全分析师理解并信任每一次分类决策。
Stars: 0 | Forks: 0
# 面向恶意软件检测与行为分析的可解释 AI
## 研究问题
开发一个用于静态和动态恶意软件分析的机器学习 pipeline,并集成 SHAP/LIME 可解释性,以便安全分析师能够理解并信任每一个分类决策。
## 目标
1. 针对该主题进行系统性的文献综述。
2. 设计并实现概念验证原型。
3. 在真实或基准数据集上评估原型。
4. 将研究发现记录在最终技术报告中。
5. 向研究小组展示结果。
## 预期交付物
| 交付物 | 截止时间 |
|---|---|
| 文献综述 (`docs/literature-review.md`) | 第 2 周 |
| 架构设计文档 (`docs/proposal.md`) | 第 3 周 |
| 可运行的原型 (`src/`) | 第 6 周 |
| 评估结果 (`experiments/results/`) | 第 7 周 |
| 最终报告 (`docs/final-report.md`) | 第 8 周 |
## 推荐技术栈
```
Python, scikit-learn, LightGBM, SHAP, LIME, Streamlit, Pandas
```
有关固定版本的依赖项,请参见 `requirements.txt`。
## 每周工作流
```
Monday – Review weekly tasks in tasks/week-XX.md
Tue–Thu – Implementation / experiments
Friday – Document progress in docs/weekly-progress.md
Friday – Open weekly Pull Request from your branch → dev
```
## 分支策略
| 分支 | 用途 |
|---|---|
| `main` | 仅包含稳定、经主管审查的代码 |
| `dev` | 集成分支 —— 每周的 PR 合并到此分支 |
| `-week-XX` | 你每周的工作分支 |
**学生严禁直接推送到 `main`。**
## Pull Request 策略
- 每周一个 PR,目标分支为 `dev`。
- PR 标题格式:`[Week XX] 简要描述`
- PR 描述必须引用每周的任务文件并总结所完成的工作。
- 合并前必须由主管或同学进行审查。
## 快速入门
```
# 1. Clone 仓库
git clone https://github.com/AI-Security-Internships-2026/11-explainable-malware-detection.git
cd 11-explainable-malware-detection
# 2. 创建并激活虚拟环境
python -m venv .venv
source .venv/bin/activate # Windows: .venv\Scripts\activate
# 3. 安装依赖
pip install -r requirements.txt
# 4. 创建你的每周 branch
git checkout dev
git pull origin dev
git checkout -b your-name-week-01
# 5. 运行 starter script
python src/main.py
```
## 2026年9月8日路线图
**当前状态:** 目前处于第 2 周(文献综述、EMBER 数据集笔记)—— 落后于团队的正常进度,但根据以下时间表,W1–W2 的截止日期为 8 月 4 日。完整的日期安排已作为 issue #3–#8 存在;本部分仅作为指引,不能替代它们。**请同时修复 PR #11 的基础分支(目前是 `main`,应为 `dev`)—— 请参阅该 PR 上的评论。**
**创新贡献目标:** LightGBM + SHAP + LIME(根据 issue #12)是一个正确但常规的基线 —— 请争取在下方 W5/W6 里程碑中,在 SHAP 值之上叠加一层由 LLM 生成的自然语言解释,或者采用基于反事实/概念的解释方法。
| 日期 | 里程碑 | 详情 |
|---|---|---|
| 8 月 4 日 | W1–W2:文献综述 + 数据集设置 | issue #3 |
| 8 月 11 日 | W3:静态特征提取 + 基线分类器 | issue #4 |
| 8 月 18 日 | W4:SHAP 可解释性 + 消融实验 | issue #5 |
| 8 月 25 日 | W5:LLM 动态行为总结(创新方向见 issue #12) | issue #6 |
| 9 月 1 日 | W6:组合 pipeline + 全面评估 | issue #7 |
| **9 月 8 日** | **W7:IEEE 格式论文初稿 —— 最终截止日期** | issue #8 |
## 主管说明
本仓库由 **CNIT/PNTLab Pisa, TECIP, Scuola Superiore Sant'Anna** 管理。
在进行架构更改之前,请联系您的主管。
所有代码必须是原创的或已正确注明出处。
**不要**提交 API 密钥、密码或大型数据集 —— 请参见 `.gitignore`。
标签:Apex, Kubernetes, 云安全监控, 可解释AI, 机器学习, 逆向工具, 静态分析