YAM-HAINHUM/HoneyPrompt-AI-Intrusion-Detection-System-AI-IDS-for-Commercial-Chatbots

GitHub: YAM-HAINHUM/HoneyPrompt-AI-Intrusion-Detection-System-AI-IDS-for-Commercial-Chatbots

HoneyPrompt 是一款基于蜜罐技术的 AI 入侵检测中间件,通过在系统提示词中嵌入诱饵指令来检测和分析针对 LLM 应用的 prompt 注入攻击。

Stars: 0 | Forks: 0

# 🐝 HoneyPrompt HoneyPrompt 是一款 AI 安全中间件,用于检测和分析大型语言模型(LLM)应用中的 prompt 注入攻击。 HoneyPrompt 没有依赖传统的被动过滤或审查,而是采用了受网络安全蜜罐启发的主动安全方法。它将诱饵(蜜罐)指令嵌入到系统 prompt 中,以检测恶意行为、安全地进行虚假遵从,并在不暴露真实数据的情况下记录攻击。 核心理念:不要仅仅阻断攻击——更要从中学习。 ## 问题 由 LLM 驱动的系统(例如聊天机器人、copilot 和 RAG 应用)容易受到 prompt 注入攻击,用户会试图覆盖系统指令、提取内部 prompt、访问受限数据,或通过社会工程学操纵模型行为。 大多数现有的防御措施都是被动的,很容易被绕过,并且几乎无法提供有关攻击者行为的洞察。 ## 解决方案 HoneyPrompt 充当安全层,在所有用户 prompt 到达 LLM 之前对其进行拦截。每个 prompt 都会被分析是否存在恶意意图,并被注入隐藏的蜜罐指令,然后以可控且可审计的方式进行处理。 当检测到 prompt 注入尝试时,HoneyPrompt 会安全地返回伪造或中性的输出,同时记录该攻击以供进一步分析。 ## 核心功能 - 嵌入在系统指令中的蜜罐式诱饵 prompt - 基于规则的 prompt 注入检测 - 通过安全的虚假遵从替代直接阻断 - 详细的攻击日志记录和遥测 - 与提供商无关的 LLM 设计,兼容任何提供商 ## HoneyPrompt 不是什么 - 不是聊天机器人 - 不是内容审查工具 - 不是 prompt 过滤器 - 不是经过训练的机器学习分类器 - 不是浏览器扩展 HoneyPrompt 是用于 LLM 应用的 AI 入侵检测系统。 ## 目标用户 - 构建 LLM 驱动产品的开发者 - 部署内部 AI 工具的企业 - 监控 AI 滥用情况的安全团队 - 从事 AI 安全与治理的研究人员 ## 道德与安全考量 - 不会存储或返回真实的敏感数据 - 虚假遵从的响应不具备实际操作性 - 记录的数据严格仅用于安全分析 - 系统在意图上是防御性的,在策略上是主动性的 ## 未来展望 - 根据攻击者行为演变的自适应蜜罐 - 基于会话的风险评分和攻击者画像 - 企业安全与监控集成 - AI 治理与合规工具 ## 总结 HoneyPrompt 将经过验证的网络安全蜜罐概念应用于现代 AI 系统,实现了对 prompt 注入攻击的早期检测、更安全的响应,以及对 LLM 如何被利用的深刻洞察。
标签:AI安全, C2, Chat Copilot, DLL 劫持, 大语言模型, 提示词注入防护, 自定义脚本, 蜜罐技术, 逆向工具