vacantfury/llm_agent_security
GitHub: vacantfury/llm_agent_security
一个面向 LLM agent 安全性的研究框架,用于研究编码型间接 prompt injection 如何穿透现有防御并被 agent 解码执行。
Stars: 0 | Forks: 0
# llm_agent_security
用于研究 **LLM agent 安全性**的框架:**编码型 / 间接 prompt injection**、action 级别的攻击与防御,以及 agent 安全性评估。这是为一系列研究工作(在同一框架下的多篇论文)提供的共享代码库,是 [`imaging_text_attacks_for_llm_jailbreaking`](https://github.com/vacantfury/imaging_text_attacks_for_llm_jailbreaking)(模型侧 / VLM 编码攻击方向)的姊妹项目。
## 研究方向
模型侧的越狱研究探讨的是模型是否会*输出*有害文本。本代码库将焦点转向 **agent**,在这种场景下,攻击者控制着 agent *摄取*的数据(间接 prompt injection),而危害体现在 **agent 执行的 action** 上。贯穿其中的核心观点是:当危害是*跨单元组合*而成时,仅检查单一单元(一种表示、一种模态、一条消息通道)的安全机制在结构上是不完整的;在这里,这个单元是 agent 的不受信任数据通道,而研究发现,针对 injection 的特定防御手段(spotlighting、isolation、prompt-shield)继承了与内容审查器相同的 **解码盲点** —— *经过编码的*注入指令可以穿透它们,随后 agent 会将其解码并执行。
## 论文
| 别名 | 代号 | 主题 | Namespace | 阶段 |
|---|---|---|---|---|
| **E** | Smuggled Actions | 编码型间接 prompt injection 击败了 LLM agent 上针对 injection 的特定防御;成功 = action 完成 | `agent_injection` | 创建中 (S4 文献/调研已完成) |
有关最新的清单,请参阅 `text_docs/shared/papers.md`;有关当前论文的进展,请参阅 `text_docs/agent_injection/proposal.md`。
## 状态
刚刚建立 (2026-07-19)。Agent runtime 尚未构建 —— 目前的工作集中在设计和文献梳理 (`text_docs/`)。`src/prompt_transformations/` 中的文本/图像**编码器**是从姊妹代码库中复制过来的,用作 payload 生成器。
## 设置
```
uv sync # once the runtime + deps land
```
公开的研究代码库 —— 采用公开级别的规范(任何已提交的文件中均不包含机密信息 / PII)。
标签:AI安全, AI智能体, Chat Copilot, DLL 劫持, DNS 反向解析, Web报告查看器, 大语言模型, 红队评估, 逆向工具