arda190/PromptFirewall-ML
GitHub: arda190/PromptFirewall-ML
一个基于经典机器学习算法从零实现的 LLM prompt injection 检测研究项目,探索传统 NLP 方法在 AI 安全防护中的适用性。
Stars: 0 | Forks: 0
# PromptFirewall-ML
基于机器学习的大型语言模型 (LLM) Prompt Injection 检测
本项目研究经典的机器学习算法是否能够检测针对大型语言模型的 prompt injection 攻击。
## 研究动机
大型语言模型 (LLM) 容易受到 prompt injection 攻击,恶意指令会试图操纵模型的行为或绕过安全机制。在这些攻击到达 LLM 之前将其检测出来,是 AI 安全领域的一项重要挑战。
本项目研究了经典的自然语言处理 (NLP) 技术和机器学习算法能否准确识别恶意 prompt。项目并未完全依赖现代的深度学习模型,而是探索了诸如 TF-IDF、Logistic Regression 和 Naive Bayes 等具有可解释性的方法。
## 目标
- 使用机器学习检测恶意 prompt。
- 比较不同的文本向量化技术。
- 比较不同的机器学习分类器。
- 使用标准指标评估模型性能。
- 研究 prompt injection 检测的合适方法。
## 当前功能
- 文本预处理
- Bag of Words(从零实现)
- TF-IDF(从零实现)
- Logistic Regression(从零实现)
## 计划功能
- Naive Bayes
- Support Vector Machine (SVM)
- Word2Vec
- BERT Embeddings
- 性能比较与评估
- 数据集评估与基准测试
## 研究 Pipeline
```
Prompt
↓
Text Preprocessing
↓
Feature Extraction
(Bag of Words / TF-IDF)
↓
Machine Learning Classifier
(Logistic Regression / Naive Bayes / SVM)
↓
Prediction
(Safe / Prompt Injection)
```
## 未来工作
本研究旨在将经典的机器学习方法与现代 NLP 方法进行比较,并研究它们在 prompt injection 检测中的适用性。
## 从零实现
本项目刻意不使用诸如 scikit-learn 之类的机器学习库,而是从零实现了以下算法:
- Bag of Words
- TF-IDF
- Logistic Regression
标签:Apex, 人工智能, 大语言模型安全, 提示词注入防护, 文本分类, 机器学习, 机密管理, 用户模式Hook绕过, 逆向工具