sanjay-aravindh/Prompt-Injection-and-Jailbreak-Detection-System-ml

GitHub: sanjay-aravindh/Prompt-Injection-and-Jailbreak-Detection-System-ml

基于 TF-IDF 和机器学习分类器的大语言模型 Prompt Injection 与 Jailbreak 攻击检测系统,用于在恶意 prompt 进入 LLM 前完成识别和拦截。

Stars: 0 | Forks: 0

# Prompt Injection 和 Jailbreak 检测系统 这是一个基于 Machine Learning 的安全系统,用于检测 Large Language Model (LLM) prompt 中的 **Prompt Injection** 和 **Jailbreak** 攻击。该项目利用 Natural Language Processing (NLP) 和传统的 Machine Learning 技术,将用户 prompt 分类为 **安全** 或 **恶意**,帮助保护 AI 应用程序免受对抗性 prompt 攻击。 ## 概述 Prompt Injection 和 Jailbreak 攻击是 Large Language Model (LLM) 面临的最重大的安全威胁之一。本项目利用 **TF-IDF 特征提取** 和 **Machine Learning 分类器**,开发了一个轻量且高效的检测系统,以便在恶意 prompt 到达 LLM 之前将其识别出来。 该系统会对文本 prompt 进行预处理,提取有意义的特征,训练多个分类模型,并预测该 prompt 是安全的还是恶意的。 ## 功能 - Prompt Injection 检测 - Jailbreak 攻击检测 - 文本预处理 Pipeline - TF-IDF 特征提取 - 多个 Machine Learning 模型 - Prompt 分类(安全 / 恶意) - 模型性能评估 - Confusion Matrix 可视化 - 易于扩展的 Dataset Pipeline ## 项目架构
标签:Apex, 大语言模型安全, 提示词注入检测, 文本分类, 机器学习, 机密管理, 逆向工具