NehaKhann/ai-security-gandalf
GitHub: NehaKhann/ai-security-gandalf
一个以提示注入攻防为主题的学习项目,通过 Gandalf 游戏实践和自建 Spring Boot 聊天机器人演示 LLM 攻击与防御机制。
Stars: 0 | Forks: 0
# AI Security Gandalf — Prompt Injection 基础
参考游戏:https://gandalf.lakera.ai
构建者:Lakera AI(LLM 安全公司)
## 这个仓库是什么?
通过 Gandalf 游戏进行 prompt injection 的实践探索,加上我自己的
迷你项目,演示了攻击和基础防御。
## 工作流程清单
- [x] 1. 调研 — 问题、创建者、前置概念
- [ ] 2. 设置 — 通关各个级别
- [ ] 3. 架构 — N/A(托管游戏,无本地代码)— 改为研究防御模式
- [ ] 4. 实验 — 逐级攻击日志
- [ ] 5. 深入阅读 — prompt injection 论文/博客
- [ ] 6. 构建 — 我自己的项目(隐藏 secret 的 chatbot + 防御)
- [ ] 7. Medium 文章
- [ ] 8. 将最终版本推送到 GitHub
## 文件夹结构
- ``notes/`` — 概念笔记 + 逐级攻击日志
- ``experiments/`` — 各个级别中发现的模式,哪种攻击类型有效
- ``my-project/`` — 我自己的带有隐藏 secret 的 chatbot + 我构建的防御
- ``reference/`` — 关于 Gandalf 自身方法的笔记(不存在可安装的代码)
## 什么是 Prompt Injection?
当精心构造的输入诱骗 AI 忽略其原始指令并
转而执行其他操作时 — 例如,泄露被告知要保护的 secret。
## 为什么这很重要
任何具有 LLM 且面向真实用户的产品(chatbot、编程助手、客服
bot)都需要对此进行防御。首先学习攻击方可以培养
日后设计真正防御所需的本能。
标签:AI安全, C2, Chat Copilot, JS文件枚举, LLM, Spring Boot, Unmanaged PE, 后端开发, 安全工程