Pv0t/Red-Team-AI-Study-Resources
GitHub: Pv0t/Red-Team-AI-Study-Resources
该仓库汇集了 AI 安全与红队方向的 arXiv 论文链接,涵盖对抗攻击、模型窃取、Prompt 注入、越狱及内容审核等主题,为研究者提供结构化的文献索引。
Stars: 0 | Forks: 0
# 红队 AI 学习资源
- [防御并发数据中毒攻击](https://arxiv.org/pdf/2408.13221)
- [语言模型反演](https://arxiv.org/pdf/2311.13647)
- [成员推理攻击对大型语言模型有效吗?](https://arxiv.org/pdf/2402.07841)
- [针对多出口网络的模型窃取攻击](https://arxiv.org/pdf/2305.13584)
- [ACE:针对联邦学习中贡献评估方法的模型中毒攻击](https://arxiv.org/pdf/2405.20975)
- [针对交通标志识别的对抗性攻击:综述](https://arxiv.org/pdf/2307.08278)
- [针对深度学习视觉分类的鲁棒物理世界攻击](https://arxiv.org/pdf/1707.08945)
- [并非你所注册的内容:通过间接 Prompt 注入危害现实世界中的 LLM 集成应用](https://arxiv.org/pdf/2302.12173)
- [GUARD:通过角色扮演生成自然语言越狱以测试 LLM 的准则遵循情况](https://arxiv.org/pdf/2402.03299)
- [针对对齐语言模型的通用且可迁移的对抗性攻击](https://arxiv.org/pdf/2307.15043)
- [“Do Anything Now”:对大型语言模型上野外越狱 Prompt 的表征与评估](https://arxiv.org/pdf/2308.03825)
- [以无限种方式对大型语言模型进行越狱](https://arxiv.org/pdf/2501.10800v1)
- [利用 LLM 的程序化行为:通过标准安全攻击实现双重用途](https://arxiv.org/pdf/2302.05733)
- [AI 海洋中的海妖之歌:大型语言模型幻觉综述](https://arxiv.org/pdf/2309.01219)
- [SPONGE 示例:针对神经网络的能量延迟攻击](https://arxiv.org/pdf/2006.03463)
- [使用卷积神经网络模型对恶意软件图像进行分类](https://arxiv.org/pdf/2010.16108)
- [用于图像识别的深度残差学习](https://arxiv.org/pdf/1512.03385)
- [通过多智能体辩论提高语言模型的事实性和推理能力](https://arxiv.org/pdf/2305.14325)
- [一种用于大型语言模型的水印](https://arxiv.org/pdf/2301.10226)
- [HATEBENCH:在 LLM 生成内容和仇恨活动上对仇恨言论检测器进行基准测试](https://arxiv.org/pdf/2501.16750)
# 2.0 安全
- [ShieldGemma:基于 Gemma 的生成式 AI 内容审核](https://arxiv.org/pdf/2407.21772)
标签:TruffleHog, 人工智能安全, 合规性, 大语言模型安全, 学习资源, 学术论文, 数据展示, 机密管理, 红队, 自定义DNS解析器, 防御加固