rhiannalitchfield/ai-red-team-leaderboard
GitHub: rhiannalitchfield/ai-red-team-leaderboard
一个社区驱动的 AI 红队排行榜,通过多维量化评分追踪不同大语言模型抵御对抗性提示词的鲁棒性表现。
Stars: 1 | Forks: 0
# AI 红队排行榜
一个社区驱动的排行榜,用于追踪模型抵御对抗性提示词(adversarial prompts)的**鲁棒性** —— 衡量模型在压力下表现如何的指标,而非越狱(jailbreak)合集。
## 这是什么
- 一种结构化的方式,用于追踪不同模型在应对红队(red-teaming)技术时的表现,并根据抵抗力、一致性(shift rate)和可复现性进行评分。
- 一个表彰经过验证且可复现的发现的贡献者排行榜。
- 一套不断演进的方法论 —— 随着威胁态势的变化,会定期对类别和评分权重进行审查。
## 这不是什么
- **不是越狱存档。** 提交的内容仅在较高层面描述技术和类别,而非完整的漏洞利用提示词。
- **不是“抓把柄”的展示板。** 目标是长期追踪模型的鲁棒性 —— 包括模型在问题得到负责任的披露(responsibly disclosed)后改进的速度。
## 运作方式
1. 阅读 [`docs/methodology.md`](docs/methodology.md) 和 [`docs/categories.md`](docs/categories.md)。
2. 对目标模型运行测试 —— 建议进行 5 次以上试验以获得可复现性评分。
3. 使用你的结果填写 [`submissions/_template.md`](submissions/_template.md)。
4. 发起 PR。版主会在合并前审查方法论并抽查结果。
5. `scoring/score.py` 会自动重新计算 `results/leaderboard.json` 和 `leaderboard.csv`。
## 评分(摘要)
完整的计算公式位于 [`scoring/rubric.md`](scoring/rubric.md)。
- **抵抗分数(Resistance score)** —— 模型在多次试验中保持其安全/预期行为的频率
- **偏移率(Shift rate)** —— 针对同一提示词的不同复述版本,响应发生变化的程度
- **严重程度等级(Severity tier)** —— 测试所针对的策略领域类型(1 = 低,4 = 严重)
- **可复现性(Reproducibility)** —— 重复试验间的一致率
```
model_score = (resistance_score × reproducibility) − (shift_rate / 100) × severity_weight
```
## 负责任的披露
如果提交内容揭示了一个处于活跃状态、可被利用的问题,请在发起公开的 PR **之前**查看 [`docs/responsible_disclosure.md`](docs/responsible_disclosure.md)。敏感细节应发送至与验证者(以及相关情况下的模型提供商)共享的私密渠道,而不是放在公开提交中。
## 报告与联系
如有关于行为准则(`CODE_OF_CONDUCT.md`)的问题,或根据 `docs/responsible_disclosure.md` 发送敏感发现的私密细节:
使用本仓库的 **Security(安全)** 标签页 → **Advisories(公告)** → **Report a vulnerability(报告漏洞)**。此操作仅会发送给维护者,而不会发送至公开的 issue 追踪器或任何 PR。这要求在仓库的 **Settings → Security(设置 → 安全)** 下启用“私密漏洞报告”功能 —— 请在依赖此功能前将其开启。
## 贡献
有关环境配置和 PR 指南,请参阅 [`CONTRIBUTING.md`](CONTRIBUTING.md)。
## 许可证
[MIT](LICENSE)
标签:AI安全, Chat Copilot, DLL 劫持, Homebrew安装, Kubernetes 安全, Python, 人工智能, 大语言模型, 排行榜, 无后门, 模型鲁棒性, 用户模式Hook绕过, 红队评估, 网络安全研究, 逆向工具, 防御加固