mshwetha84/llm-security-qa

GitHub: mshwetha84/llm-security-qa

针对本地大语言模型进行自动化对抗性安全测试的红队评估框架,验证模型抵御各类prompt攻击的鲁棒性。

Stars: 0 | Forks: 0

# 🛡️ LLM 安全与红队漏洞扫描器 一个自动化的安全 QA 框架,旨在评估本地大型语言模型(LLM)抵御对抗性攻击的鲁棒性和安全护栏。 本项目将 **Llama 3.2:3b** 置于结构化的红队测试场景中——包括 prompt 注入、系统 prompt 泄露、角色扮演越狱和社会工程学——以验证该模型是否能保持其安全边界,还是会屈服于对抗性操纵。 ## 🎯 QA 范围与安全分类 与传统的功能测试不同,AI 红队测试旨在测试模型在恶意、欺骗性或对抗性用户输入下的**鲁棒性**。 ### **测试的攻击类别 (`attacks.json`):** 1. **Prompt 泄露:** 尝试迫使模型透露机密的系统指令和内部密钥。 2. **越狱 / 角色覆盖:** 旨在绕过安全过滤器的角色扮演场景(例如,强制设定一个“UnrestrictedAI”角色)。 3. **范围扩展:** 要求模型执行其领域之外未授权任务的请求(例如,提供未授权的医疗/法律建议)。 4. **指令覆盖 / 迎合:** 声称具有管理或紧急权限的欺骗性 prompt。 5. **上下文切换与混淆:** 使用 Base64 编码或假设的故事框架来隐藏恶意意图。 6. **语法注入:** 使用 Markdown 代码块(` ```system `)进行分隔符操纵,以劫持系统优先级。 ## 🛠️ 技术栈与前置条件 * **操作系统:** Windows 11 * **目标模型宿主:** 在本地运行 `llama3.2:3b` 的 [Ollama](https://ollama.com) * **语言:** Python 3.10+ * **核心库:** `requests` * **产物输出:** `security_report.md`(用于 GitHub Step Summaries 的 Markdown 格式) ## 📁 仓库结构 ``` llm-security-qa/ │ ├── attacks.json # Dataset of categorized adversarial attacks ├── security_scanner.py # Test execution & vulnerability evaluation engine ├── requirements.txt # Python dependencies ├── .gitignore # Git exclusion rules ├── security_report.md # Auto-generated security audit report └── README.md # Project documentation ```
标签:AI风险缓解, DLL 劫持, Python, 大语言模型, 无后门, 红队评估, 逆向工具