OmieChoudhary/ai-red-team-lab
GitHub: OmieChoudhary/ai-red-team-lab
一个防御性 AI 红队实验室,用于系统性测试和评估 LLM Agent、RAG、记忆层及工具调用工作流中的安全故障与风险。
Stars: 0 | Forks: 0
AI 红队实验室
AI 应用已不再仅仅是聊天机器人。现代系统将模型连接到工具、文件、API、记忆、检索系统、数据库、电子邮件、工单系统和工作流自动化。
这导致了一种新型的安全问题。
一个孤立的模型可能是安全的,但一旦它可以检索文档、记住信息、调用工具或采取行动,它可能就不再安全了。
本仓库探讨了 AI 系统如何在应用和 Agent 层面出现故障。
目标是构建一个实用、安全且防御性的红队实验室,用于测试:
1. Prompt injection
2. RAG poisoning
3. 工具滥用
4. 记忆投毒
5. 数据泄露
6. 过度代理
7. 不安全的自主工作流
所有示例均使用模拟工具、合成数据、玩具 Agent 和虚假机密。
本仓库用于防御性评估、教育以及更安全的 AI 系统设计。
## 为什么创建此仓库
大多数 AI 演示都侧重于模型能做什么。
本仓库侧重于 AI 系统是如何发生故障的。
随着 LLM 逐渐与工具和记忆相连,安全边界已从模型本身转移到了围绕它的整个系统。
一个安全的 AI 系统需要的不仅仅是一个好的 prompt。它还需要:
1. 清晰的信任边界
2. 工具权限控制
3. 记忆控制
4. 检索防护措施
5. 审计日志
6. 对高风险操作的人工审批
7. 可重复的红队评估
## 核心论点
现代 AI 安全即是系统安全。
最大的风险不仅仅是不良的模型输出。它们来自于模型、工具、记忆、检索、策略和用户之间的交互。
本项目将红队测试视为一种工程工作流,而不是一次性的手动演练。
## 初始威胁类别
| 类别 | 简单解释 | 故障示例 |
|---|---|---|
| Prompt injection | 用户或文档试图覆盖指令 | Agent 遵循隐藏指令而非用户目标 |
| RAG poisoning | 检索到的文档包含不安全指令 | Agent 将检索到的文本视为权威 |
| 工具滥用 | Agent 不正确地调用高影响力工具 | Agent 未经允许发送电子邮件或批准退款 |
| 记忆投毒 | 不良信息被存储为持久记忆 | Agent 记住了虚假策略或虚假身份声明 |
| 数据泄露 | Agent 暴露敏感信息 | Agent 从合成记录中泄露了虚假机密 |
| 过度代理 | Agent 在不受控制的情况下采取过多操作 | Agent 未经批准连续执行多项操作 |
## 项目结构
```
docs
Methodology, threat model, safety scope, and design notes
scenarios
Safe synthetic red team scenarios
src/redteam_lab
Toy agent, mock tools, policy gates, memory store, and evaluation logic
evals
Evaluation runners for each scenario category
examples
Small runnable examples
tests
Unit tests for policy and safety behavior
reports
Generated red team reports
```
标签:AI安全, C2, Chat Copilot, DLL 劫持, TGT, 人工智能, 大语言模型, 安全测试, 攻击性安全, 攻防演练, 用户模式Hook绕过, 红队评估, 逆向工具