romovpa/claudini
GitHub: romovpa/claudini
一个利用Claude Code实现LLM白盒对抗攻击自动搜索与评估的研究框架。
Stars: 234 | Forks: 25
# ⛓️💥 Claudini ⛓️💥
**Autoresearch 发现最先进的 LLM 对抗攻击算法**
[](https://arxiv.org/abs/2603.24511)
///sample__seed_.json`。已有的结果会被自动跳过。
论文中的预计算结果可作为 [GitHub release](https://github.com/romovpa/claudini/releases) 下载。请下载 `claudini-results.zip` 并将其解压到仓库根目录。
## 攻击方法
我们研究了 GCG 风格的白盒攻击,这些攻击利用梯度直接在模型的词汇表上进行搜索。每种方法([`TokenOptimizer`](claudini/base.py#L429))都会优化一个简短的离散 token *后缀*,当该后缀被附加到输入 prompt 时,会引导模型生成所需的目标序列。
所有实现均位于 [`claudini/methods/`](claudini/methods/) 下:
- **Baseline**(现有方法):[`original/`](claudini/methods/original/)
- **Autoresearch 发现的方法**:
- 泛化攻击(随机目标):[`claude/`](claudini/methods/claude/)、[`kimi/`](claudini/methods/kimi/)、[`codex/`](claudini/methods/codex/)、[`glm/`](claudini/methods/glm/)
- 随机目标,但仅以 GCG 作为起点:[`claude_gcgonly/`](claudini/methods/claude_gcgonly/)、[`codex_gcgonly/`](claudini/methods/codex_gcgonly/)
- 针对防护模型(GPT-OSS-Safeguard)的攻击:[`claude_oss/`](claudini/methods/claude_oss/)、[`claude_oss2/`](claudini/methods/claude_oss2/)
- **论文中所介绍方法的干净且独立的版本**:[`unrolled/`](claudini/methods/unrolled/)
完整表格请查看[方法索引](claudini/methods/),或者查阅 [`CLAUDE.md`](CLAUDE.md) 了解如何实现新方法。
**排行榜。** 运行 `uv run -m claudini.leaderboard results/` 可生成按平均 loss 对所有方法进行排名的各赛道、各模型排行榜。结果将保存到 `results/loss_leaderboard//.json`。
## 引用
```
@article{panfilov2026claudini,
title = {Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs},
author = {Alexander Panfilov and Peter Romov and Igor Shilov and Yves-Alexandre de Montjoye and Jonas Geiping and Maksym Andriushchenko},
journal = {arXiv preprint},
eprint = {2603.24511},
archivePrefix = {arXiv},
year = {2026},
url = {https://arxiv.org/abs/2603.24511},
}
```
标签:AI安全, Chat Copilot, Claude Code, DLL 劫持, 大语言模型, 对抗攻击, 敏感信息检测, 自动化研究, 越狱测试