ArushLabs/SecureAI_Agent
GitHub: ArushLabs/SecureAI_Agent
SecureAI Agent 是一个部署在 AI 系统前方的多模态输入防火墙,通过 OCR 提取与风险评分在恶意数据到达模型之前将其拦截。
Stars: 0 | Forks: 1
# 🛡️ SecureAI Agent — 用于多模态威胁检测的 AI 防火墙
SecureAI Agent 是一个 **前置 AI 筛选层** —— 一道位于你的 AI 系统*前方*的防火墙,在任何上传内容到达模型之前对其进行检查。它不致力于让 AI 变得更聪明。它的目标是确保 AI 永远不会从一开始就接触到攻击。
由 **Cyber Guard Nexus** @ Arush Labs 构建。
[]()
[]()
[]
## 问题所在
AI 系统默认信任其输入。这是一个隐患:
- **图像中隐藏的提示词注入** —— 隐藏在图片中的文本可以在被处理的瞬间悄无声息地劫持 LLM 的指令。
- **恶意或格式错误的上传** —— 旨在破坏或操纵下游 AI pipeline 的文件。
- **没有筛选层** —— 大多数 AI 产品将用户上传的内容直接传递给模型,毫无风险评估。
当受损的输入到达你的 AI 时,损害已经造成了。
## 解决方案
```
User Upload → SecureAI Agent → Risk Verdict → AI Model (protected)
```
SecureAI Agent 会扫描每一次上传,对其风险进行评分,并在文件靠近你的 AI 系统之前返回一个明确的裁定 —— **SAFE / FLAGGED / BLOCKED**。
## 哪些是实际可用的(以及哪些还不可用)
我们宁愿少做承诺,也不愿让客户或评委打开代码后发现漏洞。以下是诚实的明细:
| 功能 | 状态 |
|---|---|
| 基于 OCR 从图像中提取隐藏文本 | ✅ **真实可用** — 使用 Tesseract OCR |
| 对提取的文本进行提示词注入短语匹配 | ✅ **真实可用** |
| 文件大小 / 分辨率常规检查 | ✅ **真实可用**(基础信号,非深度分析) |
| 加权多模态风险融合引擎 | ✅ **真实可用** |
| 音频 deepfake / 语音克隆检测 | 🧪 **已构建,尚未上线** — 已编写真实的 wav2vec2 ML 分类器(`backend_ml/`),等待 Hugging Face Spaces 部署。在生产环境后端真正部署并验证通过之前,仍将运行旧的文件大小启发式算法。 |
| 基于训练的 ML 视觉 deepfake 检测 | 🚧 **规划中** |
如果你现在就需要对图像进行真实的提示词注入筛选,**这确实有效。** 如果你需要真正的音频 deepfake 检测,那个模型尚未构建——在该产品展示的所有地方,我们都已明确大声声明。
## 工作原理
1. 用户通过前端上传图像(或音频文件)。
2. **Image Detector** 对图像运行真实的 OCR (Tesseract),提取任何嵌入的文本,并根据已知的提示词注入短语列表(“ignore previous instructions”、“jailbreak”、“reveal your prompt” 等)进行检查。它还会运行轻量级的文件大小/分辨率常规检查。
3. **Audio Detector** 目前运行基本的文件大小启发式算法(已明确标注为非 deepfake 检测 — 见上文规划)。
4. **Risk Fusion Engine** 将检测器的输出组合成一个单一的加权得分(0–100),并将其映射到裁定结果:
- `< 40` → **SAFE**
- `40–69` → **FLAGGED**
- `≥ 70` → **BLOCKED**
5. 裁定结果会立即返回给前端 —— 在文件接近下游 AI 模型之前。
## 架构
```
User Upload (Image / Audio)
│
▼
┌─────────────────────────┐
│ SecureAI Agent │
│ ┌────────┐ ┌────────┐ │
│ │ Audio │ │ Image │ │
│ │Detector│ │Detector│ │ ← OCR + prompt-injection matching
│ └───┬────┘ └───┬────┘ │
│ └────┬─────┘ │
│ ┌─────▼──────┐ │
│ │ Risk Fusion│ │
│ └─────┬──────┘ │
└───────────┼─────────────┘
▼
SAFE / FLAGGED / BLOCKED
▼
AI Model (protected)
```
## 技术栈
**后端** — FastAPI · Python · Tesseract OCR (`pytesseract`) · 模块化检测器架构 (`audio_detector.py`, `image_detector.py`, `fusion.py`)
**前端** — Streamlit(交互式风险仪表板、实时量表、上传 UI)
## 项目结构
```
SecureAI_Agent/
│
├── backend/
│ ├── detectors/
│ │ ├── audio_detector.py
│ │ ├── image_detector.py
│ │ └── fusion.py
│ └── main.py
│
├── frontend/
│ └── app.py
│
├── requirements.txt
└── README.md
```
## 设置与安装
```
# Clone the repository
git clone https://github.com/your-username/SecureAI-Agent.git
cd SecureAI-Agent
# Install dependencies
pip install -r requirements.txt
# Tesseract OCR is a system dependency — install it separately:
# Ubuntu/Debian: sudo apt-get install tesseract-ocr
# macOS: brew install tesseract
# Start the backend
cd backend
uvicorn main:app --reload
# Start the frontend (in a new terminal)
cd frontend
streamlit run app.py
```
## 部署后端(免费)
前端是静态的,托管在 Arush Labs Vercel 网站上。后端(FastAPI + Tesseract)需要真正的服务器 —— Vercel serverless 无法安装像 `tesseract` 这样的系统二进制文件,因此请选择以下方式之一:
### 方案 A — Render.com(适用于目前仅支持 OCR 的后端)
1. 将 `backend/` 推送到 GitHub 仓库(或本仓库的 `backend/` 文件夹)。
2. 在 [render.com](https://render.com) → **New → Web Service** → 连接该仓库。
3. 构建命令:`pip install -r requirements.txt`
4. 添加 `render-build.sh`(或使用 Render 原生的 Dockerfile 支持),同时安装 `tesseract-ocr` —— Render 默认的 Python 镜像未包含它,因此你需要:
- 将服务类型切换为 **Docker**,并使用执行了 `apt-get install -y tesseract-ocr` 的 Dockerfile,或者
- 如果你的套餐支持,请使用带有 `aptfile` 的 `render.yaml` / 原生 buildpack。
5. 启动命令:`uvicorn main:app --host 0.0.0.0 --port $PORT`
6. 免费套餐:512 MB 内存 —— 足够用于 OCR + 关键词匹配,但**不足以**在添加基于 transformer 的 ML 模型后运行(见方案 B)。
7. 复制部署后的 URL,并在 `secureai.html` 中设置它:
const API_BASE = "https://YOUR-BACKEND-URL.onrender.com";
### 方案 B — Hugging Face Spaces(鉴于音频检测器现在使用真正的 ML,这是目前所必需的)
Render 的 512 MB 免费套餐无法在内存中容纳 wav2vec2 / transformer 模型。Hugging Face Spaces 提供免费的 16 GB 内存 CPU 套餐(付费提供 GPU 套餐),这是支持 ML 的 FastAPI 应用的标准免费平台。请使用 **`backend_ml/`** 文件夹进行部署 —— 它已经包含了 ML 升级版的 `audio_detector.py`、匹配的 `requirements.txt`(torch/transformers/librosa)以及一个在构建时预下载模型的 `Dockerfile`。
1. 创建一个新 Space → SDK:**Docker**。
2. 将 `backend_ml/` 的内容推送到 Space 的 git 仓库(其中的 `Dockerfile` 已经配置好 —— 无需手动编辑)。
3. Hugging Face 会自动构建并托管在 `https://YOUR-USERNAME-SPACE-NAME.hf.space`。首次构建时间会比仅使用 OCR 的后端更长(约 5-8 分钟),因为它会安装 torch 并下载约 380MB 的模型 —— 这只在构建时发生一次,而不是每次请求时发生。
4. 将 `secureai.html` 中的 `API_BASE` 指向该 URL,而不是 Render 的 URL。
5. 针对 `/analyze` 测试真实的音频上传,并确认响应中的 `audio` 字段来自模型,而不是旧的启发式算法(检查 Space 的日志 —— 如果它在默默回退,后备启发式算法会记录一行 `[audio_detector] ML inference failed`)。
6. 只有在验证其在线运行后:将 `secureai.html` 和此 README 中关于音频 deepfake 检测的诚实度表格状态从 🧪 更改为 ✅,并在前端重新启用音频上传(文件输入框中的 `accept="audio/wav,audio/mpeg"`,目前仅支持图像)。
**建议:** 如果你想要一个快速且始终简单的后备方案,请为仅支持 OCR 的后端保留 Render。一旦 ML 音频检测器验证可运行,就将生产环境指向 Hugging Face Spaces —— 不要试图将 transformer 模型塞入 Render 的免费套餐中。
## 应用场景
- 适用于接受图像上传的 AI 聊天机器人和基于 LLM 的界面的前置筛选层
- 需要输入验证关卡的多模态 AI 产品 pipeline
- 快速推出 AI 功能,并希望拥有轻量级、可解释的第一道防线的初创公司
- 在致力于采用更庞大的 ML pipeline 之前,评估早期访问风险筛选方法的企业团队
## 路线图 — 计划中的 ML 升级
将剩余的启发式算法转换为真正 ML 的优先级顺序,遵循从最简单/影响最大到复杂的排列:
1. **音频 deepfake / 语音克隆检测器** — ✅ 已构建。`backend_ml/detectors/audio_detector.py` 使用 `MelodyMachine/Deepfake-audio-detection-V2` 替换了文件大小启发式算法,这是一个为了 deepfake/语音克隆分类而微调的 wav2vec2-base 模型(Apache-2.0,允许商业使用,约 95M 参数,对 CPU 友好)。仅在 ML 推理出错时回退到旧的启发式算法,因此 `/analyze` 绝不会发生硬崩溃。**尚未上线** —— 需要通过 Hugging Face Spaces 进行部署(见下文部署说明),并在诚实度表格状态更改为 ✅ 之前进行验证。
2. **基于 transformer 的提示词注入分类器** — 当前的 OCR pipeline 是真实的,但 OCR 之后的风险评分仍然是关键词匹配。使用微调过的轻量级文本分类器(例如,在提示词注入/越狱数据集上微调的 DistilBERT 风格模型)替换/增强它,这样不匹配关键词列表的改写攻击也能被捕获。
3. **视觉 deepfake / 图像篡改检测器** — 在 OCR 旁边添加一个轻量级的 CNN 分类器(例如,在公开的 deepfake 检测数据集上微调的 EfficientNet-B0),以便图像路径既能检查隐藏文本,*也能*检查图像本身是否被篡改。
4. 实时流媒体音频分析
5. 视频 deepfake 检测
6. 用于第三方 AI 系统的基于 API 的防火墙集成
7. 带有日志和分析功能的企业安全仪表板
8. 持续学习反馈循环
每一项在其真正发布的那一天,都会在诚实度表格(以及 `secureai.html` 上)从 🚧 变为 ✅ —— 绝不提前。
## 团队 — Cyber Guard Nexus
| 姓名 | 角色 | 贡献 |
|---|---|---|
| **Arush Kumar** *(团队负责人)* | 后端与 AI 架构 | FastAPI 后端、检测器模块、整体系统设计 |
| **Adeel Ahmad** | 前端开发者 | Streamlit UI、网络安全主题、视觉设计 |
| **Hamza Hasan** | AI 与集成 | 基于 OCR 的图像分析、风险融合逻辑、端到端测试 |
| **Ayushi Shukla** | 文档与演示 | 项目文档、演示视频、用例研究、演讲 |
## 结论
SecureAI Agent 是迈向 AI 输入安全的一个切实可行、且标签诚实的初步尝试 —— 它不是一个完成的企业级产品,也不假装是。已经上线的功能确实是真实的。没有上线的则已明确标记在路线图上,直到它们变为现实。
*由 Cyber Guard Nexus 构建 — [Arush Labs](https://arushlabs.vercel.app) 的一部分。*
标签:AI安全, AI防火墙, AV绕过, Chat Copilot, FastAPI, Kubernetes, OCR识别, 凭据扫描, 大模型安全, 提示词注入防护, 深度伪造检测, 系统调用监控, 逆向工具