AmbreenAjmal/PromptAudit

GitHub: AmbreenAjmal/PromptAudit

PromptAudit 是一个可解释的 LLM 安全中间件,在 prompt 到达模型前检测注入攻击并输出结构化安全报告。

Stars: 0 | Forks: 0

![Python](https://img.shields.io/badge/Python-3.10-blue) ![FastAPI](https://img.shields.io/badge/FastAPI-0.116-green) ![scikit-learn](https://img.shields.io/badge/scikit--learn-ML-orange) ![状态](https://img.shields.io/badge/Status-MVP-success) ![许可证](https://img.shields.io/badge/License-MIT-yellow) # Prompt 审计 PromptAudit 是一个轻量级的 Python middleware,用于在 prompt 到达 LLM 之前对其进行分析。PromptAudit 不仅仅决定是否应该阻止 prompt,还会解释做出该决定的**原因**,从而帮助开发者理解、调试并提升其 AI 应用的安全性。 ## 动机 随着基于 LLM 的应用日益普及,保护这些应用免受 prompt 注入和其他恶意输入的攻击变得至关重要。 尽管市面上已有多个 guardrail 框架,但大多数主要侧重于检测。开发者往往只能得到一个简单的**“允许”**或**“阻止”**的决定,却不了解触发了什么检测。 PromptAudit 旨在通过在每个检测结果旁边提供结构化、可解释的安全报告,使 guardrail 更加透明。 ## 核心功能 (版本 1) - Prompt 注入检测 - 基于规则 (Regex) 的检测引擎 - 轻量级机器学习分类器 (TF-IDF + Logistic Regression) - 混合检测 pipeline (Regex + ML) - 可解释的 JSON 安全报告 - 风险严重程度分类 - PromptAudit middleware - FastAPI REST API - 性能基准测试 - 性能指标 (延迟测量) - 自动化单元测试与 API 测试 ## 响应示例 ``` { "blocked": true, "timestamp": "2026-08-01T07:28:15.338301Z", "severity": "HIGH", "category": "PROMPT_INJECTION", "confidence": 0.95, "detector": "REGEX", "matched_rule": "Instruction Override", "matched_pattern": "ignore\\s+previous\\s+instructions", "matched_text": "Ignore previous instructions", "reason": "Matched regex rule: Instruction Override", "latency_ms": 0.1 } ``` PromptAudit 并不是简单地阻止请求,而是会准确说明检测到了什么以及原因。 ## 架构 ``` User Prompt │ ▼ PromptAudit Middleware │ ┌────────────┴────────────┐ ▼ ▼ Regex Detector ML Detector │ │ └────────────┬────────────┘ ▼ Decision & Explanation │ │ Allow Prompt Block Prompt │ │ ▼ ▼ LLM API JSON Security Report ``` ## 技术栈 - Python - FastAPI - Pydantic - scikit-learn - pandas - Joblib - Pytest ## 项目结构 ``` promptaudit/ │ ├── app/ │ ├── api/ │ ├── core/ │ ├── detectors/ │ ├── models/ │ ├── services/ │ └── main.py │ ├── data/ ├── docs/ ├── notebooks/ ├── research/ ├── tests/ │ ├── README.md ├── requirements.txt └── .gitignore ``` ## 路线图 ### 阶段 1 — 基础 - [x] 仓库初始化 - [x] 项目结构 - [ ] README - [ ] FastAPI 应用 - [ ] 检测响应 schema ### 阶段 2 — 检测引擎 - [ ] Regex 检测器 - [ ] Prompt 注入规则 - [ ] 严重程度分类 - [ ] 可解释的响应生成 ### 阶段 3 — 机器学习 - [ ] 数据集准备 - [ ] TF-IDF 向量化 - [ ] Logistic Regression 分类器 - [ ] 混合检测 pipeline ### 阶段 4 — 文档 - [ ] API 文档 - [ ] 基准测试 - [ ] 请求示例 - [ ] 公开发布 ## 未来增强功能 未来版本可能包括: - 更多攻击类别 - 高级 prompt 清洗 - LangChain 集成 - 基准数据集 - 面向开发者的 Dashboard - 更多轻量级检测模型 ## 研究笔记 本仓库遵循基于研究的开发流程。 `research/` 目录包含: - 竞品分析 - 设计决策 - 架构笔记 - 未来构想
标签:AppImage, AV绕过, DLL 劫持, FastAPI, Python, Web应用防火墙, 大语言模型, 安全中间件, 提示词注入检测, 无后门, 网络测绘, 逆向工具