Asim223/AI-Powered-Threat-Intelligence

GitHub: Asim223/AI-Powered-Threat-Intelligence

一份防御性网络安全学术报告,记录了一条 AI 驱动的 CTI 处理 pipeline 的完整构建过程,并对其分类器的高分指标进行了系统性的证伪与对抗性评估。

Stars: 0 | Forks: 0

# ThreatFusion AI:AI 驱动的威胁情报 本代码库包含为 **AICS-107:AI 驱动的威胁情报(高级)** 提交的毕业设计报告,该项目是 ICDFA AI 驱动的网络安全与数字取证奖学金的一部分。 `TLP:CLEAR` · 防御性培训演练 · 仅使用合成数据 ## 概述 ThreatFusion AI 是一个防御性的网络威胁情报 (CTI) 融合 pipeline。它接收 CTI 报告,提取妥协指标,通过监督分类器提出 MITRE ATT&CK 技术映射,分配风险评分,构建知识图谱,导出 STIX 2.1 bundle,并编写分析师可直接使用的报告。 本报告记录了 2026 年 7 月 17 日在 Google Colab(Python 3.12.13,CPU runtime)中对包含 60 份报告的合成训练语料库进行的完整端到端执行过程。报告的核心贡献并非按表面价值呈现 pipeline 的主要指标,而是对其自身的 AI 分类器进行**诚实、对抗性的评估**——表明所报告的 0.90 macro-F1 分数是一种测量假象,而非真实能力的证据,并追踪该发现如何影响其触及的每一个下游产品。 ## 核心发现 ATT&CK 分类器在提供的评估集上报告了 **0.9000** 的 macro F1。三项独立的诊断表明这个数字是一种幻觉: 1. **模板识别,而非技术映射。** 这 60 份报告的语料库仅包含五种不同的标签组合,每种组合都由生成它的报告模板固定——因此模型只需识别出它正在查看的是五种模板中的哪一种。 2. **通过元数据导致的标签泄露。** 特征文本包含了报告标题,其中嵌入了模板名称。模型对于几种技术权重最高的 token 是字面上的文件名片段(例如 `'bravo defensive'`),而不是威胁行为语言。 3. **在诚实评估下崩溃。** 留出整个模板家族进行测试,将 micro-F1 从 0.900 拉低至 **0.273** 的平均值。在没有模板关键字的五个措辞简单的分析师句子上,模型的得分为 **0 out of 5**(5题0中)。 相比之下,一个零样本 embedding 模型(`all-MiniLM-L6-v2`,从未在此语料库上训练过)在所有五个抽样案例中都将有效的技术正确排在第一位——它的表现优于经过训练的分类器,因为它没有任何东西可以死记硬背。这种对比是本报告的核心证据:分类器学到的是文件名,而不是实战技术。 ## 报告涵盖内容 | 章节 | 重点 | |---|---| | 1–2 | 执行摘要和优先情报需求 (PIR) —— pipeline 能回答和不能回答的问题 | | 3 | 数据源和处理 —— 仅使用合成数据、RFC 保留指标;未查询任何实时情报源 | | 4 | 系统架构 —— 五阶段 pipeline(接收 -> 模型 -> 富化 -> 融合 -> 报告),Colab 环境配置 | | 5 | AI 模型设计 —— 任务表述、TF-IDF + one-vs-rest 逻辑回归,以及为什么每个设计决策后来都被证明是错误的 | | 6 | **评估结果** —— 六项诊断拆解了所报告的 0.90 分数,包括留一模板法测试和新颖措辞探测 | | 7 | ATT&CK 映射 —— 技术频率、共现结构,以及一个关于风险评分补丁悄无声息地未能应用的记录案例 | | 8 | 知识图谱和攻击活动分析 —— 为什么“包含 60 个案例的单个集群”结果是图谱的假象,而不是存在共享威胁行为者的证据 | | 9 | STIX/MISP/OpenCTI 共享 —— 结构上合理但无法共享的 STIX bundle(对象重复,关系为零) | | 10 | 分析师报告 —— 五份生成的报告,并对其剩余缺陷进行了诚实评估 | | 11 | 防御建议 —— 基于**分析师验证的标签而非模型输出**构建的五个检测工程积压工单 | | 12 | 局限性和未来工作 —— 13 个指定的局限性,以及在小型语料库上使用零样本语义匹配优于监督训练的理由 | | 附录 A | 证据资产索引 —— 提交清单、待办事项、完整案例账本、图表索引 | ## 关键结果概览 | 维度 | 结果 | |---|---| | 处理的案例 | 60(5 个模板家族) | | 提取的 IOC | 72 个实例 / 15 个唯一 —— 均为 RFC 5737 / 保留命名空间,无法解析 | | 映射的 ATT&CK 技术 | 10 个,全部有语料库中的证据支持 | | 报告的 macro F1 | 0.9000 —— 被证明是假象 (§6) | | 诚实的泛化能力(留一模板法) | 平均 0.273 micro-F1;新颖措辞测试为 0/5 | | 知识图谱 | 85 个节点 · 302 条边 | | 攻击活动集群 | 1 个包含 60 个案例的集群 —— 作为图谱假象被拒绝,未声明任何攻击活动 | | STIX bundle | 362 个对象 · 85 个不同的 ID · 0 个关系 —— 不可共享 | | 分析师报告 | 生成了 5 份(要求:≥3) | | 检测积压 | 5 个 DRAFT 工单,仅根据验证过的标签构建 | ## 安全与范围 本报告中的每个指标在构建上都是合成的——来自 RFC 5737 文档范围的 IPv4 地址,来自保留命名空间(`.invalid`、`.test`、`example.com/.net/.org`)的域名,以及作为重复数字占位符的文件哈希值。它们都无法解析,也都不带有恶意。没有浏览过任何 URL 或域名,没有获取过任何样本,也没有查询过任何实时威胁情报源。分类器生成的每个 ATT&CK 映射都被明确视为需要分析师验证的建议——本报告在结构上(检测积压工单是根据验证过的标签而不是模型预测构建的)而非仅仅在口头上强制执行了这一约束。 ## 许可证/学术声明 本报告是作为防御性培训演练的学术毕业设计提交而制作的。引用的所有数据均为合成数据;未使用任何真实的网络、组织或威胁行为者数据。此处共享仅用于学术和研究目的。
标签:AI安全, Apex, Chat Copilot, Python, 威胁情报, 开发者工具, 无后门, 机器学习, 网络安全, 逆向工具, 隐私保护