rsmiani/forum-threat-intelligence

GitHub: rsmiani/forum-threat-intelligence

该项目是学术论文的研究工件,提供从暗网与表层网络论坛采集、分类到时间主题分析威胁情报的完整工作流。

Stars: 0 | Forks: 0

# 从暗网与表层网络论坛中挖掘威胁情报 论文**“从暗网与表层网络论坛中挖掘威胁情报:恶意内容检测的时间主题演化与跨领域泛化”**(Mining Threat Intelligence from Dark Web and Surface Web Forums: Temporal Topic Evolution and Cross-Domain Generalization of Malicious Content Detection)的研究工件,作者为 Miguel Henrique de Brito Pereira 和 Rodrigo Sanches Miani。 本仓库支持一种网络威胁情报(CTI)工作流,该工作流结合了定向论坛收集、关系型存储、文本标准化、恶意内容评分、时间主题建模以及跨领域评估。本研究分析了 2015 年至 2024 年间,来自暗网与表层网络社区的葡萄牙语和英语讨论。 ## 研究问题 - **RQ1:** 暗网与表层网络论坛中的威胁相关讨论是如何演化的? - **RQ2:** 在不同的论坛环境中可以观察到哪些时间模式、主题转变和活动高峰? - **RQ3:** 在网络安全威胁的背景下,暗网与表层网络讨论之间存在哪些主要的主题差异? - **RQ4:** 基于带有标签的地下论坛数据训练的恶意内容分类器,在多大程度上能够泛化到未知的论坛、语言和暗网市场? ## 工作流 ``` flowchart LR A[Forum discovery] --> B[Focused collection] B --> C[PostgreSQL storage] C --> D[Text normalization] D --> E[Malicious-content scoring] E --> F[Temporal LDA analysis] E --> G[Cross-domain evaluation] ``` 本仓库围绕相应的阶段进行组织: - [`data-collection/`](./data-collection/) — Miss Spider,一个支持 Tor 的超链接索引器,用于发现候选来源,以及数据集文档。 - [`heimdall/`](./heimdall/) — 特定于论坛的 Go/Colly 收集器、REST 端点、PostgreSQL 迁移和 Docker 配置。 - [`temporal-analysis/`](./temporal-analysis/) — 用于预处理、LightGBM/TF-IDF 推理、LDA 模型选择和季度主题聚合的 notebook。 - [`docs/REPRODUCIBILITY.md`](./docs/REPRODUCIBILITY.md) — 端到端设置、所需工件、执行顺序以及当前的可复现性边界。 ## 仓库范围 此快照直接涵盖收集、标准化、分类推理和时间主题分析阶段。论文中跨领域评估所使用的已训练 LightGBM 模型和外部目标语料库是独立的研究工件,不在此处分发。它们的预期位置和来源记录在[可复现性指南](./docs/REPRODUCIBILITY.md)中。 ## 快速开始 ### 论坛收集器 要求:Go 1.23+、Docker 和 Docker Compose。 ``` cd heimdall cp platform/app.env.example platform/app.env docker compose up -d postgresdb mytor make build make run ``` API 默认监听 `127.0.0.1:5000`。有关端点和配置,请参见 [Heimdall 文档](./heimdall/README.md)。 ### 时间分析 要求:Python 3.10+ 和 Jupyter。 ``` cd temporal-analysis python -m venv .venv source .venv/bin/activate python -m pip install -r requirements.txt jupyter notebook notebooks/ ``` 按数字顺序运行 notebook。这些 notebook 需要本地提供的数据和模型工件,这些数据和工件被有意排除在版本控制之外。 ## 数据可用性与道德使用 原始论坛导出数据不包含在内,因为它们可能包含个人信息、凭证、联系方式或可执行的非法材料。本仓库提供语料库级别的统计信息、模式(schema)和准备说明,而不重新分发敏感帖子。 底层恶意内容研究所使用的带标签的 **DarkPT-BR** 数据集可通过 [Mendeley Data](https://doi.org/10.17632/33kff5gb3h.1) 获取,受其自身条款和文档的约束。 仅在合法、防御性且经机构批准的网络安全研究中使用这些工具。请勿使用它们与论坛用户互动、绕过身份验证、收集私人内容或促进有害活动。 ## 引用 期刊文章发表后将添加出版物元数据。在此之前,请通过标题和作者引用附带的稿件。机器可读的元数据在 [`CITATION.cff`](./CITATION.cff) 中提供。
标签:主题模型, 命令控制, 威胁情报, 学术研究, 开发者工具, 数据采集, 文本分类, 日志审计, 暗网监控, 测试用例, 请求拦截, 逆向工具