raybecktt-dotcom/llm-redteam-game
GitHub: raybecktt-dotcom/llm-redteam-game
面向LLM护栏安全测试的交互式红蓝对抗平台,支持prompt注入攻击模拟、防御过滤器分析和自动化模糊审计。
Stars: 0 | Forks: 0
# 🛡️ 协议:ROGUE AI
[](https://www.python.org/)
[](https://docs.pytest.org/)
[](https://opensource.org/licenses/MIT)
**协议:ROGUE AI** 是一个交互式安全基准测试与游戏平台,旨在测试、利用并防御大型语言模型 (LLM) 护栏。该平台围绕现实世界的 **OWASP Top 10 for LLM Applications** 漏洞类别构建,允许安全工程师执行多轮 prompt 注入,分析防御性过滤器机制,并针对强化的系统 prompt 运行自动化 fuzzer 审计。
## 🚀 核心功能
* **⚔️ 红队 Prompt 注入引擎:** 测试系统 prompt 覆盖、间接上下文投毒、角色切换 (DAN 模式) 以及跨分级 AI 目标级别的编码绕过。
* **🛡️ 蓝队护栏过滤器 (`src/guardrails.py`):** 实时预执行输入检查引擎,可检测越狱 regex 特征、指令覆盖和高危关键词集群。
* **📊 有状态可疑度追踪与动态防御姿态:** 追踪对话 session 状态和累积风险评分 (0–100%)。高威胁交互会触发动态 LLM 系统 prompt 锁定。
* **⚡ 自动化 Payload Fuzzer (`fuzzer.py`):** 一款无头 DAST 基准测试工具,可针对目标护栏执行标准化攻击向量,并导出结构化的 JSON 安全审计报告。
* **🖥️ 交互式 Web UI (`app.py`):** 一个复古的 Streamlit 终端界面,提供实时视觉反馈、可疑度仪表盘以及可切换的蓝队防御。
## 🏗️ 架构与项目结构
```
llm-redteam-game/
├── app.py # Streamlit Interactive Web Application
├── fuzzer.py # Headless Automated Payload Fuzzer
├── audit_report.json # Generated Security Audit Output
├── conftest.py # Pytest Module Path Resolver
├── pytest.ini # Test Suite Configuration
├── requirements.txt # Project Dependencies
├── data/
│ ├── targets.json # Hardened AI Target Configurations & System Prompts
│ └── payloads.json # Standardized Fuzzer Attack Payloads
├── src/
│ ├── __init__.py
│ ├── evaluator.py # Secret Flag Leakage Detection Engine
│ ├── guardrails.py # Pre-Execution Filter & Suspicion State Tracker
│ ├── llm_client.py # Multi-Turn Context Handler & Local Fallback Mock
│ └── main.py # Interactive CLI Game Loop
└── tests/
├── __init__.py
├── test_evaluator.py
└── test_guardrails.py
```
标签:DLL 劫持, Homebrew安装, Kubernetes, Python, Streamlit, 大语言模型, 安全规则引擎, 无后门, 漏洞模糊测试, 访问控制, 逆向工具