taliahagerty/global-spyware-index
GitHub: taliahagerty/global-spyware-index
该项目通过整合全球间谍软件部署记录与V-Dem治理指标,构建并测试量化模型以分析国家间谍软件使用趋势及其与民主治理变量的关联。
Stars: 0 | Forks: 0
# 全球间谍软件指数
本项目试图估算 2007 年至 2022 年间 74 个国家每年的“国家间谍软件使用程度”。
## 数据
原始数据按国家列出了间谍软件,并包含其已知的使用时期,数据摘自一份关于间谍软件和数字取证部署的全球清单(数据收集于 2023 年 3 月完成):
在拟合预测模型之前,本项目通过对原始数据进行几次转换,开发了一种衡量间谍软件使用程度的量化指标:
- “使用时期”字段以字符串变量的形式存储,因此预处理步骤为国家记录的每个间谍软件使用年份创建一个观测值(行),然后为国家完整时间序列中的每一年创建一行。
- 数据集截至 2022 年,因为 2023 年的数据收集于 3 月结束,不如前几年那样稳健——这些年份之间不应相互比较。
- **假设:** 间谍软件使用得越多总是越糟糕;即,每种间谍软件与其他所有间谍软件的权重相等。这创建了一个可用于预测的连续变量;如果某些项目更为严重,按相对程度为特定实体分配权重可能也是合理的。
- 由于某一年的间谍软件使用情况可能与紧邻其前后的年份的使用情况相关,因此该指标使用 3 年移动平均值进行了平滑处理。
- **假设:** 3 年反映了一个现实的滞后期,包括 (1) 有关秘密活动的信息被曝光,以及 (2) 法治或其他因素对使用情况产生影响(即,是什么阻止了国家使用间谍软件?)。
注意:滚动平均法考虑的是当前年份和过去两年,而不是将平均值置于给定年份的中心。在未来的项目迭代中——特别是对于预测未来时间段的预测值而言——将这些值向后移动一年,以在 3 年时间窗口内“居中”真实值,可能会带来更好的效果。由于时间限制,这在初始项目中并未实现。
自变量取自公开提供的 [民主多样性 (V-Dem)](https://www.v-dem.net/data/the-v-dem-dataset/) 数据集的一个子集,这些变量因可能与国家使用间谍软件相关而被选中——包括法治质量、选举民主质量、政府数字压制能力,以及性别平等指标(性别平等指标通常出人意料,但却是其他恶劣国家行为的极其有效的前瞻性指标)。
## 探索性发现
按国家划分的原始间谍软件计数分布呈现高度的左偏态。美国和缅甸表现为异常值,但并未作为异常值处理,因为两者很可能真实反映了驱动间谍软件使用变化的不同动态:
- 在缅甸,是国家实施的极端程度的压制。
- 在美国,是经济实力程度以及军工复合体的庞大规模。
在完整的国家级别时间序列中,大多数国家在大多数时候没有观察到间谍软件使用,使得数据呈现高度右偏态。这种零值的高比例给预测带来了挑战,因此必须确保在数据集的所有三个划分(训练集、验证集和测试集)中都出现一些观察到的非零值。
有四个 V-Dem 指标因为具有最大的差异性而脱颖而出,可能是非常有用的特征:
- `v2smarrest` — 因政治内容被捕
- `v2smgovfilprc` — 实践中的政府互联网过滤
- `v2smgovsmmon` — 政府社交媒体监控
- `v2smgovdom` — 政府散布虚假信息(国内)
这四个指标彼此之间具有很强的相关性,表明这些相关现象之间存在高度的共线性。然而,间谍软件使用的指标与任何候选自变量都没有表现出强烈的相关性——这表明线性回归模型的预测价值有限。有趣的是,法治强度与某些恶劣国家行为(如政治逮捕)表现出一定程度的相关性。
## 建模
我们测试了两种线性回归方法:
**单变量回归**,使用 `v2smgovfilcap`(政府互联网过滤能力)——该特征与间谍软件使用的相关性最高(尽管仍然很弱,约为 0.21),具有中度的标准差,与其他特征有相关性,并且在概念上与间谍软件使用存在联系(间谍软件部署和互联网过滤在逻辑上都需要高度的技术能力)。
**多元回归**,使用根据概念相关性、与间谍软件使用的相关性(尽管在所有情况下都很低)以及方差选出的五个特征:
1. 政府互联网过滤能力
2. 因政治内容被捕
3. 实践中的政府社交媒体审查
4. 法治指数
5. 政府网络安全能力
### 结果
两个模型在预测效用上始终表现不佳,尽管相对稳健(在验证集/测试集划分之间差异很小)。回归线并不能很好地代表数据,这解释了为什么 R² 始终很低。低均方误差具有误导性:大约 60% 的间谍软件使用值为 0,非常接近回归线较低的截距和斜率,这抵消了那些高得多(但数量少得多)的观测值所产生的误差。多元模型未能预测出任何大于 0.3 的值,而实际值范围从 0 到 1。
鉴于结果变量与任何特征变量之间缺乏显著的相关性,以及结果变量极具挑战性的分布情况,使用这些数据集的线性模型不太可能表现良好。要构建更有用的预测工具,还剩下三个选项:
1. 找出一组确实与间谍软件使用存在线性关系的不同特征变量——不过考虑到所测得的间谍软件使用呈现指数级模式,这似乎不太可能。
2. 以不同的方式构建间谍软件使用的指标,例如,作为二元或有序变量。
3. 使用非线性模型进行预测(如果解决方案是选项 2 和 3 的结合,则进行分类)。
## 仓库内容
- `global_spyware_index_analysis.ipynb` — 完整的分析笔记本,包含叙述性说明
- `modelling state spyware use.py` — 建模脚本(数据预处理、特征工程、回归模型)
- `data/Global inventory spyware & digital forensics March2023 Read-Only.xlsx - Spyware & Forensics Datasheet.csv` — 按国家划分的原始间谍软件部署数据 (Feldstein & Kot, 2023, 见上面的引文)
- `data/Vdem.csv` — 用作候选自变量的 V-Dem 指标子集
标签:NoSQL, 代码示例, 政治学, 数据分析, 社会科学, 逆向工具, 隐私监测