shashwat212/AI-Powered-Cybersecurity-Threat-Intelligence-System

GitHub: shashwat212/AI-Powered-Cybersecurity-Threat-Intelligence-System

该系统利用 NLP 和 FAISS 向量搜索对真实 CVE 漏洞数据进行语义检索与威胁优先级排序,解决传统关键字搜索无法理解查询语义的问题。

Stars: 0 | Forks: 0

# 🛡️ AI 驱动的网络安全威胁情报系统 ![Python](https://img.shields.io/badge/Python-3.10+-blue?style=for-the-badge&logo=python) ![NLP](https://img.shields.io/badge/NLP-Sentence%20Transformers-green?style=for-the-badge) ![FAISS](https://img.shields.io/badge/Vector%20Search-FAISS-orange?style=for-the-badge) ![Cybersecurity](https://img.shields.io/badge/Domain-Cybersecurity-red?style=for-the-badge) ![License](https://img.shields.io/badge/License-MIT-yellow?style=for-the-badge) # 📌 项目概述 网络安全专家每年需要分析数千个新发现的漏洞。传统的基于关键字的搜索系统通常无法检索到最相关的漏洞,因为它们依赖于精确的关键字匹配,而不是理解用户查询的语义。 本项目展示了一个 **AI 驱动的网络安全威胁情报系统**,它使用 **自然语言处理 (NLP)**、**Sentence Transformers** 和 **FAISS 向量搜索** 对真实的网络安全漏洞数据集执行语义搜索。 除了语义检索之外,该系统还使用自定义的 **威胁优先级评分** 对威胁进行优先级排序,通过分析仪表板可视化网络安全洞察,并使用基于规则的 **AI 安全分析师** 生成结构化的威胁摘要。 # 🎯 项目目标 - 构建智能网络安全漏洞搜索系统。 - 对网络安全数据执行 NLP 预处理。 - 使用 Sentence Transformers 生成语义文本嵌入。 - 使用 FAISS 实现快速语义相似性搜索。 - 计算自定义威胁优先级评分。 - 使用数据可视化分析网络安全风险。 - 生成结构化的网络安全威胁摘要。 # 🚀 核心功能 - ✅ 真实的网络安全漏洞数据集 - ✅ NLP 预处理 pipeline - ✅ Sentence Transformer 嵌入 - ✅ FAISS 向量相似性搜索 - ✅ 网络安全语义搜索 - ✅ 自定义威胁优先级评分 - ✅ 漏洞排名 - ✅ 网络安全分析仪表板 - ✅ 基于规则的 AI 安全分析师 - ✅ 交互式网络安全查询系统 # 🏗️ 项目工作流 ``` Cybersecurity Vulnerability Dataset │ ▼ Data Cleaning & Preprocessing │ ▼ NLP Text Processing │ ▼ Sentence Transformer Embeddings │ ▼ FAISS Vector Index │ ▼ Semantic Search │ ▼ Threat Priority Scoring │ ▼ Cybersecurity Data Visualization │ ▼ Rule-Based AI Security Analyst ``` # 📂 数据集 本项目使用一个 **Combined CVE (Common Vulnerabilities and Exposures) Dataset**,其中包含真实的网络安全漏洞记录。 该数据集包含以下信息: - CVE ID - CVSS 评分 - 严重性级别 - 攻击向量 - 攻击复杂度 - 受影响的供应商 - 受影响的产品 - CWE 描述 - 技术影响 - 其他漏洞元数据 # 🛠️ 使用的技术 | 技术 | 用途 | |------------|----------| | Python | 编程语言 | | Pandas | 数据处理 | | NumPy | 数值计算 | | NLTK | 自然语言处理 | | Sentence Transformers | 语义嵌入 | | FAISS | 向量相似性搜索 | | Scikit-learn | 机器学习工具 | | Matplotlib | 数据可视化 | | Google Colab | 开发环境 | # ⚙️ 项目方法论 ## 1. 数据收集 - 加载网络安全漏洞数据集。 - 探索数据集结构。 - 在必要时处理缺失值。 ## 2. NLP 预处理 文本预处理 pipeline 包括: - 转换为小写 - 去除特殊字符 - 去除停用词 - 词形还原 这将为语义嵌入的生成准备好漏洞描述。 ## 3. 语义嵌入生成 本项目使用 **Sentence Transformer (all-MiniLM-L6-v2)** 模型,将处理后的网络安全文本转换为能够捕捉语义的稠密向量表示。 ## 4. FAISS 向量索引 生成的嵌入使用 **FAISS** 进行索引,从而能够跨数千个网络安全漏洞进行高效的相似性搜索。 ## 5. 语义搜索 无需依赖于精确的关键字匹配,用户可以提交自然语言查询,例如: - Windows 权限提升 - SQL 注入 - 身份验证绕过 - 缓冲区溢出 - 远程代码执行 该系统将检索出在语义上最相关的漏洞。 ## 6. 威胁优先级评分 系统使用自定义的 **威胁优先级评分** 进行计算,考虑的因素包括: - 漏洞严重性 - 攻击向量 - 攻击复杂度 这有助于优先处理需要调查的漏洞。 ## 7. 网络安全仪表板 该项目可视化了重要的网络安全洞察,包括: - 漏洞严重性分布 - 攻击向量分布 - 受影响最多的供应商 这些可视化有助于了解整体的漏洞趋势。 ## 8. AI 安全分析师 该项目包含一个 **基于规则的 AI 安全分析师**,它通过报告以下内容来总结检索到的漏洞: - 最常见的严重性 - 最高 CVSS 评分 - 受影响最多的供应商 - 最常见的攻击向量 - 检测到的主要弱点 - 建议的调查优先级 这提供了搜索结果的简明概述。 # 📊 搜索查询示例 ``` Windows Privilege Escalation SQL Injection Authentication Bypass Remote Code Execution Cross Site Scripting Buffer Overflow ``` # 📈 项目输出 该系统产出: - 语义漏洞搜索结果 - 排名后的网络安全威胁 - 威胁优先级评分 - 网络安全仪表板可视化 - 结构化的威胁摘要 # 📁 仓库结构 ``` AI-Powered-Cybersecurity-Threat-Intelligence-System/ │ ├── AI_Powered_Cybersecurity_Threat_Intelligence_System.ipynb ├── cve_combined.csv ├── README.md ├── LICENSE └── .gitignore ``` # 💡 学习成果 通过这个项目,我获得了以下方面的实践经验: - 自然语言处理 (NLP) - 语义搜索 - Sentence Transformers - 向量数据库 (FAISS) - 网络安全威胁情报 - 特征工程 - 数据分析 - 数据可视化 - 构建端到端 AI 应用程序 # 📜 许可证 本项目基于 **MIT License** 授权。 # 👨‍💻 作者 **Shashwat Gupta** 如果您觉得这个项目有帮助,欢迎在 GitHub 上给它点个 ⭐。
标签:FAISS, Python, 威胁情报, 开发者工具, 无后门, 漏洞分析, 网络安全, 语义搜索, 路径探测, 逆向工具, 隐私保护