naveedahmed124421-glitch/ai-security-guardrail

GitHub: naveedahmed124421-glitch/ai-security-guardrail

该项目构建了一个双层安全网关,在用户输入进入 LLM 之前拦截提示词注入、越狱尝试和 PII 泄露。

Stars: 0 | Forks: 0

# AI 安全防护栏 这是我用 Python 构建的一个安全网关,用于检查用户输入,并在它们进入 AI 模型之前阻止提示词注入、越狱尝试和 PII 泄露。 ## 为什么开发这个项目 LLM 很容易受到提示词注入和意外数据泄露的影响。我想看看能否创建一个简单的双层 pipeline,在立即过滤掉明显威胁的同时,使用二级模型来捕获更隐蔽的攻击。 ## 工作原理 - 第 1 层根据 regex 模式检查输入,以立即捕获信用卡号、电子邮件地址和明显的越狱触发词。 - 第 2 层将剩余的 prompt 通过 Groq API 发送给 Llama 3,以评估上下文并捕获隐蔽的角色扮演或规避尝试。 - Streamlit 界面实时跟踪扫描计数和拦截率。 ## 使用的工具 - Python - Streamlit - Groq API (Llama 3) 未来的改进 支持额外的 LLM 提供商 检测置信度评分 日志和审计跟踪 可配置的安全策略 额外的 PII 检测模式
标签:AI安全, Chat Copilot, DLL 劫持, Kubernetes, Prompt注入防护, Python, Streamlit, Sysdig, Web安全网关, 大语言模型, 无后门, 访问控制, 逆向工具