Somicool/CyberShield-AI
GitHub: Somicool/CyberShield-AI
一个融合机器学习检测引擎、Neo4j 威胁情报图谱和 AI 调查助手的全链路网络犯罪情报平台,将市民举报的钓鱼与诈骗线索转化为可供执法部门行动的调查情报。
Stars: 0 | Forks: 0
# 🛡️ CyberShield AI
### 基于人工智能的网络犯罪情报平台 — 实时检测钓鱼与诈骗,将零散的投诉转化为可采取行动的调查情报。
*从市民提交的可疑链接 → AI 检测 → 警方调查 → 有组织犯罪网络发现 — 尽在一个后端。*
         
## 📖 概述
**CyberShield AI** 是一个端到端平台,旨在保护市民免受钓鱼/诈骗攻击,并为**网络犯罪警察**提供 AI 辅助的调查工具。它融合了**机器学习检测引擎**、**透明的基于规则和启发式算法的层**,以及用于自然语言解释的 **Google Gemini** — 然后将每个检测到的实体(域名、电子邮件、电话、加密货币钱包、Telegram 账号)链接到 **Neo4j 威胁情报图**中,以揭露隐藏在看似无关的投诉背后的有组织犯罪活动。
一个后端支撑**三个终端**:
| 👥 市民门户 | 👮 警察指挥中心 | 🧩 浏览器扩展 |
|---|---|---|
| 检查链接/电子邮件/SMS/二维码,提交投诉,学习网络安全知识 | 实时威胁源、案件管理、AI 调查工作区、威胁图谱、数据分析 | 实时网站保护 & 一键举报 |
## ✨ 核心功能
- 🔍 **混合检测引擎** — 使用 ML 模型 + 透明的启发式算法 + Gemini AI 解释,针对 URL、电子邮件、SMS 和二维码进行检测。
- 🕸️ **威胁情报图谱 (Neo4j)** — 发现不同的投诉共享相同的钱包 / 域名 / Telegram 账号 → 通过二跳网络遍历呈现协同犯罪活动。
- 🧠 **AI 调查助手** — 一个严格基于案件真实数据的上下文感知聊天助手(会标明来源,数据缺失时会说*“不可用”*)。
- 🗂️ **调查工作区** — 单个界面提供:AI 简报、检测明细、WHOIS/DNS/SSL/GeoIP、关联实体、相关案件、时间线、警官笔记以及 PDF 导出。
- ⚖️ **CrimeGPT** — 为警官提供法律条款建议、判例法引用和文书起草,并带有审计追踪记录。
- 🧩 **CyberShield Guardian** — 一款 Manifest V3 浏览器扩展,可实时拦截恶意网站(扩展内部不含 AI — 它直接复用相同的后端)。
- 📊 **分析与热力图** — Recharts 仪表板 + 使用 Leaflet 地图绘制**真实**的地理定位主机 IP(绝不捏造数据)。
- 🔐 **基于角色的访问控制** — 市民 · 警察 · 管理员,在后端和前端均通过 JWT 强制执行。
## 🏗️ 架构
```
Citizens · Browser Extension · Police · Admins
│ HTTPS · REST /api · JWT
┌───────────▼────────────┐
│ React Frontend │ Citizen Portal + Police Dashboard
└───────────┬────────────┘
┌───────────▼────────────┐
│ FastAPI Backend │
│ Auth · Detection · │
│ Investigation · │
│ Complaints · Incidents ·│
│ Copilot · CrimeGPT · │
│ Admin · Graph │
└───┬──────────┬─────────┬─┘
┌───────▼──┐ ┌────▼──────┐ ┌▼─────────────┐
│PostgreSQL│ │ Neo4j │ │ Gemini API │
│ users, │ │ entity │ │ explanations │
│ incidents│ │ relationship│ │ & summaries │
│ complaints│ │ graph │ │ │
│ audit_logs│ └────────────┘ └──────────────┘
└──────────┘
```
**为什么使用双数据库?** PostgreSQL 存储结构化记录(用户、事件、投诉、审计日志);Neo4j 存储实体之间的*关系* — 这正是将孤立的报告转化为可见犯罪网络的关键。
## 🧠 检测原理
```
URL / Email / SMS / QR
│
▼
┌──────────────────┐ ┌───────────────────────┐ ┌──────────────────────┐
│ ML Base Score │ + │ Heuristic Points │ → │ Gemini Explanation │
│ (scikit-learn) │ │ (transparent rules) │ │ (plain language) │
└──────────────────┘ └───────────────────────┘ └──────────────────────┘
│ │
▼ ▼
Risk Score 0–100 → Threat Level (low/medium/high/critical) + Why it was flagged
```
- **URL 分类器** — 基于 **PhiUSIIL** 数据集(235,795 个 URL)训练的 RandomForest。*基于 Origin 的评分* + 受信任域名白名单,确保在 Google/YouTube/GitHub 等网站上的误报率接近于零。
- **文本分类器** — TF-IDF + 逻辑回归(SMS Spam Collection + 精选的现代诈骗样本),适用于电子邮件和 SMS。
- **启发式算法** — IP 字面量域名、可疑的 TLD、品牌假冒、`@`-混淆、缺少 HTTPS、外部密码表单等。
- **Gemini** — 仅*解释*确定性流水线已做出的决定 — 从而保持结果的可重复性并便于审计。
### 📈 模型性能
| 模型 | 数据集 | 准确率 | 精确率 | 召回率 | F1 |
|---|---|:---:|:---:|:---:|:---:|
| **URL 钓鱼** | PhiUSIIL (235,795 个 URL) | **99.5%** | 99.4% | 99.8% | **0.996** |
| **文本诈骗 (电子邮件/SMS)** | SMS Spam Collection + 补充数据 (约 5,199 行) | **97.6%** | 91.0% | 90.4% | **0.907** |
## 🖥️ 平台模块
         
👥 市民门户
- **诈骗检测** — 一个选项卡式工具,用于检测链接 / 电子邮件 / SMS / 二维码 - **报告网络犯罪** — 提交投诉;在后台自动附带 AI 风险摘要 - **我的投诉** — 通过参考编号 (`CMP-2026-XXXXXX`) 追踪状态 - **网络安全** — 宣传教育内容 - **CyberShield Guardian** — 扩展状态、实时统计、安装指南👮 警察指挥中心
- **仪表板** — KPI、AI 情报源、高优先级案件、实时威胁源(自动刷新、过滤、搜索) - **案件** — 过滤/排序、状态工作流、警员分配、批量操作 - **调查工作区** — AI 简报、WHOIS/DNS/SSL/GeoIP、关联实体、相关案件、时间线、笔记、PDF 报告 - **威胁 / 情报图谱** — 交互式网络可视化 + AI 犯罪活动分析 - **AI 调查助手** & **CrimeGPT** — 调查与法律助手 - **分析** (Recharts) + **热力图** (Leaflet,真实地理定位 IP)🧩 CyberShield Guardian (浏览器扩展, MV3)
- **实时保护** — 检查每个网站的 Origin;拦截高置信度的恶意网站,对不确定的网站发出警告 - **右键“使用 CyberShield AI 分析”** - **弹出式仪表板** — 风险、预测、置信度、AI 解释、本地历史记录 - **一键举报** — 复用投诉 API + 您的市民会话🛠️ 管理
- 用户管理(角色、启用/禁用、重置密码) - **系统健康中心** — 实时检查 FastAPI、PostgreSQL、Neo4j、Gemini、Auth - 实际运行时间、平台 KPI 以及数据导出
**CyberShield AI** — 每一次检测,将零散的诈骗报告转化为有组织犯罪的情报。
*怀着 ❤️ 构建,只为更安全的市民与更智能的警务。*
标签:测试用例, 自定义脚本, 逆向工具