arda190/PromptFirewall-ML

GitHub: arda190/PromptFirewall-ML

一个基于经典机器学习算法从零实现的 LLM prompt injection 检测研究项目,探索传统 NLP 方法在 AI 安全防护中的适用性。

Stars: 0 | Forks: 0

# PromptFirewall-ML 基于机器学习的大型语言模型 (LLM) Prompt Injection 检测 本项目研究经典的机器学习算法是否能够检测针对大型语言模型的 prompt injection 攻击。 ## 研究动机 大型语言模型 (LLM) 容易受到 prompt injection 攻击,恶意指令会试图操纵模型的行为或绕过安全机制。在这些攻击到达 LLM 之前将其检测出来,是 AI 安全领域的一项重要挑战。 本项目研究了经典的自然语言处理 (NLP) 技术和机器学习算法能否准确识别恶意 prompt。项目并未完全依赖现代的深度学习模型,而是探索了诸如 TF-IDF、Logistic Regression 和 Naive Bayes 等具有可解释性的方法。 ## 目标 - 使用机器学习检测恶意 prompt。 - 比较不同的文本向量化技术。 - 比较不同的机器学习分类器。 - 使用标准指标评估模型性能。 - 研究 prompt injection 检测的合适方法。 ## 当前功能 - 文本预处理 - Bag of Words(从零实现) - TF-IDF(从零实现) - Logistic Regression(从零实现) ## 计划功能 - Naive Bayes - Support Vector Machine (SVM) - Word2Vec - BERT Embeddings - 性能比较与评估 - 数据集评估与基准测试 ## 研究 Pipeline ``` Prompt ↓ Text Preprocessing ↓ Feature Extraction (Bag of Words / TF-IDF) ↓ Machine Learning Classifier (Logistic Regression / Naive Bayes / SVM) ↓ Prediction (Safe / Prompt Injection) ``` ## 未来工作 本研究旨在将经典的机器学习方法与现代 NLP 方法进行比较,并研究它们在 prompt injection 检测中的适用性。 ## 从零实现 本项目刻意不使用诸如 scikit-learn 之类的机器学习库,而是从零实现了以下算法: - Bag of Words - TF-IDF - Logistic Regression
标签:Apex, 人工智能, 大语言模型安全, 提示词注入防护, 文本分类, 机器学习, 机密管理, 用户模式Hook绕过, 逆向工具