naveedahmed124421-glitch/ai-security-guardrail
GitHub: naveedahmed124421-glitch/ai-security-guardrail
该项目构建了一个双层安全网关,在用户输入进入 LLM 之前拦截提示词注入、越狱尝试和 PII 泄露。
Stars: 0 | Forks: 0
# AI 安全防护栏
这是我用 Python 构建的一个安全网关,用于检查用户输入,并在它们进入 AI 模型之前阻止提示词注入、越狱尝试和 PII 泄露。
## 为什么开发这个项目
LLM 很容易受到提示词注入和意外数据泄露的影响。我想看看能否创建一个简单的双层 pipeline,在立即过滤掉明显威胁的同时,使用二级模型来捕获更隐蔽的攻击。
## 工作原理
- 第 1 层根据 regex 模式检查输入,以立即捕获信用卡号、电子邮件地址和明显的越狱触发词。
- 第 2 层将剩余的 prompt 通过 Groq API 发送给 Llama 3,以评估上下文并捕获隐蔽的角色扮演或规避尝试。
- Streamlit 界面实时跟踪扫描计数和拦截率。
## 使用的工具
- Python
- Streamlit
- Groq API (Llama 3)
未来的改进
支持额外的 LLM 提供商
检测置信度评分
日志和审计跟踪
可配置的安全策略
额外的 PII 检测模式
标签:AI安全, Chat Copilot, DLL 劫持, Kubernetes, Prompt注入防护, Python, Streamlit, Sysdig, Web安全网关, 大语言模型, 无后门, 访问控制, 逆向工具