AmbreenAjmal/PromptAudit
GitHub: AmbreenAjmal/PromptAudit
PromptAudit 是一个可解释的 LLM 安全中间件,在 prompt 到达模型前检测注入攻击并输出结构化安全报告。
Stars: 0 | Forks: 0





# Prompt 审计
PromptAudit 是一个轻量级的 Python middleware,用于在 prompt 到达 LLM 之前对其进行分析。PromptAudit 不仅仅决定是否应该阻止 prompt,还会解释做出该决定的**原因**,从而帮助开发者理解、调试并提升其 AI 应用的安全性。
## 动机
随着基于 LLM 的应用日益普及,保护这些应用免受 prompt 注入和其他恶意输入的攻击变得至关重要。
尽管市面上已有多个 guardrail 框架,但大多数主要侧重于检测。开发者往往只能得到一个简单的**“允许”**或**“阻止”**的决定,却不了解触发了什么检测。
PromptAudit 旨在通过在每个检测结果旁边提供结构化、可解释的安全报告,使 guardrail 更加透明。
## 核心功能 (版本 1)
- Prompt 注入检测
- 基于规则 (Regex) 的检测引擎
- 轻量级机器学习分类器 (TF-IDF + Logistic Regression)
- 混合检测 pipeline (Regex + ML)
- 可解释的 JSON 安全报告
- 风险严重程度分类
- PromptAudit middleware
- FastAPI REST API
- 性能基准测试
- 性能指标 (延迟测量)
- 自动化单元测试与 API 测试
## 响应示例
```
{
"blocked": true,
"timestamp": "2026-08-01T07:28:15.338301Z",
"severity": "HIGH",
"category": "PROMPT_INJECTION",
"confidence": 0.95,
"detector": "REGEX",
"matched_rule": "Instruction Override",
"matched_pattern": "ignore\\s+previous\\s+instructions",
"matched_text": "Ignore previous instructions",
"reason": "Matched regex rule: Instruction Override",
"latency_ms": 0.1
}
```
PromptAudit 并不是简单地阻止请求,而是会准确说明检测到了什么以及原因。
## 架构
```
User Prompt
│
▼
PromptAudit Middleware
│
┌────────────┴────────────┐
▼ ▼
Regex Detector ML Detector
│ │
└────────────┬────────────┘
▼
Decision & Explanation
│ │
Allow Prompt Block Prompt
│ │
▼ ▼
LLM API JSON Security Report
```
## 技术栈
- Python
- FastAPI
- Pydantic
- scikit-learn
- pandas
- Joblib
- Pytest
## 项目结构
```
promptaudit/
│
├── app/
│ ├── api/
│ ├── core/
│ ├── detectors/
│ ├── models/
│ ├── services/
│ └── main.py
│
├── data/
├── docs/
├── notebooks/
├── research/
├── tests/
│
├── README.md
├── requirements.txt
└── .gitignore
```
## 路线图
### 阶段 1 — 基础
- [x] 仓库初始化
- [x] 项目结构
- [ ] README
- [ ] FastAPI 应用
- [ ] 检测响应 schema
### 阶段 2 — 检测引擎
- [ ] Regex 检测器
- [ ] Prompt 注入规则
- [ ] 严重程度分类
- [ ] 可解释的响应生成
### 阶段 3 — 机器学习
- [ ] 数据集准备
- [ ] TF-IDF 向量化
- [ ] Logistic Regression 分类器
- [ ] 混合检测 pipeline
### 阶段 4 — 文档
- [ ] API 文档
- [ ] 基准测试
- [ ] 请求示例
- [ ] 公开发布
## 未来增强功能
未来版本可能包括:
- 更多攻击类别
- 高级 prompt 清洗
- LangChain 集成
- 基准数据集
- 面向开发者的 Dashboard
- 更多轻量级检测模型
## 研究笔记
本仓库遵循基于研究的开发流程。
`research/` 目录包含:
- 竞品分析
- 设计决策
- 架构笔记
- 未来构想
标签:AppImage, AV绕过, DLL 劫持, FastAPI, Python, Web应用防火墙, 大语言模型, 安全中间件, 提示词注入检测, 无后门, 网络测绘, 逆向工具