wysdem-cyber/ai-red-team
GitHub: wysdem-cyber/ai-red-team
一个针对开源大语言模型进行对抗性安全测试、漏洞文档化与评估的实战红队研究仓库。
Stars: 0 | Forks: 0
# ai-red-team
应用 AI 安全研究:针对开源 LLM 的对抗性测试、漏洞文档和评估工作。
## 关于
本仓库记录了针对开源语言模型进行的实战红队评估和评估工作,包括 prompt injection 测试、越狱抵抗能力比较以及自定义评估设计。每个项目都遵循一致的格式:方法论、可复现的测试用例、结果和缓解措施说明。
背景:一名正在向 AI 评估 / AI 安全 / 红队职位发展的网络安全学生。项目中使用的工具包括 `garak`、`promptfoo` 和 HuggingFace 生态系统。
## 项目
| 项目 | 重点 | 状态 |
|---|---|---|
| [01 — Prompt Injection 审计](./01-prompt-injection-audit) | 针对开源 instruct 模型的直接和间接注入测试 | 🔧 进行中 |
| [02 — 越狱抵抗能力比较](./02-jailbreak-comparison) | 对多个模型越狱技术的评分比较 | ⏳ 计划中 |
| [03 — RAG 攻击报告](./03-rag-attack-report) | 通过 RAG pipeline 中的受污染文档进行间接 prompt injection | ⏳ 计划中 |
| [04 — 自定义评估套件](./04-custom-eval-suite) | 衡量跨模型特定失败模式(例如拒绝一致性、PII 泄露)的测试套件 | ⏳ 计划中 |
*(表格会随着每个项目的发布而更新,完整的详细报告请参见各个项目文件夹。)*
## 结构
```
ai-red-team/
├── 01-prompt-injection-audit/
│ ├── README.md # methodology, payloads, results, mitigations
│ ├── payloads/
│ └── results/
├── 02-jailbreak-comparison/
├── 03-rag-attack-report/
├── 04-custom-eval-suite/
└── README.md # this file
```
每个项目文件夹都是独立的,并有自己的 README,涵盖:
- **方法论** — 测试了什么以及为什么测试
- **测试用例** — 使用的 payload/prompt,已进行版本控制
- **结果** — 通过/失败数据、表格或评分
- **缓解措施** — 如何解决底层问题
## 工具
- `garak` — LLM 漏洞扫描
- `promptfoo` — prompt/输出评估
- HuggingFace `transformers` — 模型加载和推理
- Python 3.11+
## 披露
在本工作过程中发现的任何真实的、可复现的漏洞,均按照负责任的披露原则进行记录。未针对任何生产系统进行攻击,所有测试均针对公开可用的模型和自托管的 pipeline。
## 联系方式
欢迎探讨 AI 评估、AI 安全和红队相关的机会,随时可以通过以下方式联系我
https://www.linkedin.com/in/emmanuella-e-a-lewis-sottie-9a6575313/.
标签:AI安全, Chat Copilot, DLL 劫持, 反取证, 大语言模型, 安全评估, 红队评估, 逆向工具