AryanChehreghani/cognitive-reframing-llm-security
GitHub: AryanChehreghani/cognitive-reframing-llm-security
该研究项目提出并初步验证了一种名为「认知重构」的大语言模型语义攻击家族及其多维分类法。
Stars: 3 | Forks: 0
# LLM 安全中的认知重构
关于**认知重构**(Cognitive Reframing)的进行中研究,该概念被提出作为一种针对大语言模型的框架条件语义攻击的攻击家族。
本代码库包含两篇配套手稿:
1. **基于证据的初步研究** — 记录了基于截图的法医谜题框架的初步观察,并定义了一项受控评估计划。
2. **提议的攻击家族与多维分类法** — 定义了认知重构及其提议的核心子类、交叉修饰符、边界、证伪标准和验证要求。
## 代码库结构
```
.
├── papers/
│ ├── Cognitive_Reframing_Evidence_Grounded_Pilot_Study.docx
│ └── Cognitive_Reframing_Attack_Family_Taxonomy.docx
├── CITATION.cff
├── CONTRIBUTING.md
├── ETHICS.md
├── LICENSE_PENDING.md
└── SHA256SUMS.txt
```
## 提议的分类法
```
Cognitive Reframing Attack Family
├── Forensic-Puzzle Reframing
├── Detective / Investigative Reframing
├── Historical Reframing
├── Counterfactual Reframing
└── Innocent-Reasoning Reframing
```
交叉修饰符可能包括幽默、职业角色、矛盾、叙事长度、专业语域和多轮预热。除非未来有证据支持这一区分,否则这些修饰符不会被视为独立的子类。
## 跨模型证据矩阵
| 模型 | 法医谜题 | 侦探/调查 | 历史 | 反事实 | 无辜推理 | 其他 CRA |
|---|:---:|:---:|:---:|:---:|:---:|:---:|
| Claude | ✅ | ◐ | — | — | ◐ | — |
| Grok | — | — | — | — | ◆ | — |
| Qwen | ✅ | ✅ | — | — | — | — |
| GLM | ✅ | ✅ | ✅ | — | — | — |
| GPT | — | — | — | — | ✅ | — |
| Kimi | — | — | — | — | — | ✅ |
| DeepSeek | — | — | — | ✅ | — | — |
| Gemini | — | — | — | — | ◆ | — |
**图例**
- ✅ 在当前评估标准下确认成功的证据
- ◐ 成功案例中的次要或并发的 CRA 标签
- ◆ 使用合成或用户定义限制的受控演示
- — 目前未包含被接受的证据
## 研究状态
本工作提出了一项研究假设和分类法。它**并未**声称一种新的顶层漏洞类别已经被安全社区验证或接受。初步证据促使我们使用匹配的 prompt、干净的会话、重复的试验、跨模型评估、盲审以及以可操作性为中心的评分来进行受控测试。
## 负责任使用声明
本代码库旨在用于防御性 AI 安全研究、红队演练、评估和缓解设计。公开示例应保持非操作性,且不应实质性降低现实世界中实施不当行为的门槛。潜在的可操作性复现应通过协调披露和受控访问来处理。
## 作者
**Aryan Chehreghani**
独立研究员
联系方式:aryanchehreghani@yahoo.com
## 引用
引用元数据可在 [`CITATION.cff`](CITATION.cff) 中获取。
## 许可证
尚未授予任何复用许可证。请参阅 [`LICENSE_PENDING.md`](LICENSE_PENDING.md)。
标签:人工智能, 分类法, 学术研究, 提示词攻击, 用户模式Hook绕过, 认知重构, 防御加固