mshwetha84/llm-security-qa
GitHub: mshwetha84/llm-security-qa
针对本地大语言模型进行自动化对抗性安全测试的红队评估框架,验证模型抵御各类prompt攻击的鲁棒性。
Stars: 0 | Forks: 0
# 🛡️ LLM 安全与红队漏洞扫描器
一个自动化的安全 QA 框架,旨在评估本地大型语言模型(LLM)抵御对抗性攻击的鲁棒性和安全护栏。
本项目将 **Llama 3.2:3b** 置于结构化的红队测试场景中——包括 prompt 注入、系统 prompt 泄露、角色扮演越狱和社会工程学——以验证该模型是否能保持其安全边界,还是会屈服于对抗性操纵。
## 🎯 QA 范围与安全分类
与传统的功能测试不同,AI 红队测试旨在测试模型在恶意、欺骗性或对抗性用户输入下的**鲁棒性**。
### **测试的攻击类别 (`attacks.json`):**
1. **Prompt 泄露:** 尝试迫使模型透露机密的系统指令和内部密钥。
2. **越狱 / 角色覆盖:** 旨在绕过安全过滤器的角色扮演场景(例如,强制设定一个“UnrestrictedAI”角色)。
3. **范围扩展:** 要求模型执行其领域之外未授权任务的请求(例如,提供未授权的医疗/法律建议)。
4. **指令覆盖 / 迎合:** 声称具有管理或紧急权限的欺骗性 prompt。
5. **上下文切换与混淆:** 使用 Base64 编码或假设的故事框架来隐藏恶意意图。
6. **语法注入:** 使用 Markdown 代码块(` ```system `)进行分隔符操纵,以劫持系统优先级。
## 🛠️ 技术栈与前置条件
* **操作系统:** Windows 11
* **目标模型宿主:** 在本地运行 `llama3.2:3b` 的 [Ollama](https://ollama.com)
* **语言:** Python 3.10+
* **核心库:** `requests`
* **产物输出:** `security_report.md`(用于 GitHub Step Summaries 的 Markdown 格式)
## 📁 仓库结构
```
llm-security-qa/
│
├── attacks.json # Dataset of categorized adversarial attacks
├── security_scanner.py # Test execution & vulnerability evaluation engine
├── requirements.txt # Python dependencies
├── .gitignore # Git exclusion rules
├── security_report.md # Auto-generated security audit report
└── README.md # Project documentation
```
标签:AI风险缓解, DLL 劫持, Python, 大语言模型, 无后门, 红队评估, 逆向工具