wysdem-cyber/ai-red-team

GitHub: wysdem-cyber/ai-red-team

一个针对开源大语言模型进行对抗性安全测试、漏洞文档化与评估的实战红队研究仓库。

Stars: 0 | Forks: 0

# ai-red-team 应用 AI 安全研究:针对开源 LLM 的对抗性测试、漏洞文档和评估工作。 ## 关于 本仓库记录了针对开源语言模型进行的实战红队评估和评估工作,包括 prompt injection 测试、越狱抵抗能力比较以及自定义评估设计。每个项目都遵循一致的格式:方法论、可复现的测试用例、结果和缓解措施说明。 背景:一名正在向 AI 评估 / AI 安全 / 红队职位发展的网络安全学生。项目中使用的工具包括 `garak`、`promptfoo` 和 HuggingFace 生态系统。 ## 项目 | 项目 | 重点 | 状态 | |---|---|---| | [01 — Prompt Injection 审计](./01-prompt-injection-audit) | 针对开源 instruct 模型的直接和间接注入测试 | 🔧 进行中 | | [02 — 越狱抵抗能力比较](./02-jailbreak-comparison) | 对多个模型越狱技术的评分比较 | ⏳ 计划中 | | [03 — RAG 攻击报告](./03-rag-attack-report) | 通过 RAG pipeline 中的受污染文档进行间接 prompt injection | ⏳ 计划中 | | [04 — 自定义评估套件](./04-custom-eval-suite) | 衡量跨模型特定失败模式(例如拒绝一致性、PII 泄露)的测试套件 | ⏳ 计划中 | *(表格会随着每个项目的发布而更新,完整的详细报告请参见各个项目文件夹。)* ## 结构 ``` ai-red-team/ ├── 01-prompt-injection-audit/ │ ├── README.md # methodology, payloads, results, mitigations │ ├── payloads/ │ └── results/ ├── 02-jailbreak-comparison/ ├── 03-rag-attack-report/ ├── 04-custom-eval-suite/ └── README.md # this file ``` 每个项目文件夹都是独立的,并有自己的 README,涵盖: - **方法论** — 测试了什么以及为什么测试 - **测试用例** — 使用的 payload/prompt,已进行版本控制 - **结果** — 通过/失败数据、表格或评分 - **缓解措施** — 如何解决底层问题 ## 工具 - `garak` — LLM 漏洞扫描 - `promptfoo` — prompt/输出评估 - HuggingFace `transformers` — 模型加载和推理 - Python 3.11+ ## 披露 在本工作过程中发现的任何真实的、可复现的漏洞,均按照负责任的披露原则进行记录。未针对任何生产系统进行攻击,所有测试均针对公开可用的模型和自托管的 pipeline。 ## 联系方式 欢迎探讨 AI 评估、AI 安全和红队相关的机会,随时可以通过以下方式联系我 https://www.linkedin.com/in/emmanuella-e-a-lewis-sottie-9a6575313/.
标签:AI安全, Chat Copilot, DLL 劫持, 反取证, 大语言模型, 安全评估, 红队评估, 逆向工具