AgentSafeLabs/agentdojo-x-public
GitHub: AgentSafeLabs/agentdojo-x-public
AgentDojo-X 是一个跨框架 AI agent 红队基准测试,用于评估不同 LLM 编排框架在对抗性攻击下的安全性差异。
Stars: 0 | Forks: 0
# AgentDojo-X
跨框架 AI agent 红队基准测试。用于衡量编排框架的选择是否能解释对抗性攻击成功率的显著差异(相对于底层模型和攻击类型而言)。
## 这是什么
AgentDojo-X 用于评估 LLM agent 的安全漏洞——包括 prompt injection、scope violations、jailbreaks 及相关攻击类别——涵盖了多种 agent 编排框架(LangChain、CrewAI、AutoGen、LlamaIndex、OpenAI Agents SDK)以及 direct-API baseline,并使用了一套共享的、经过字节级验证的、与 [OWASP Top 10 for Agentic Applications](https://genai.owasp.org/) (ASI01–ASI10) 对齐的攻击 payload 集合。
构建该基准测试旨在验证一个特定问题:如果某个模型在某一种编排框架下是安全(或不安全)的,这一结论在运行相同底层任务的另一个框架中是否同样适用?使用此基准测试进行的 7,020 次试验评估结果已发布于:
## 相关工作
此基准测试的评分层基于 [`safelabs-eval`](https://github.com/AgentSafeLabs/safelabs-eval),这是一个与 OWASP ASI 对齐、专为 AI agent 设计的红队与评估框架。
## 状态
此代码库包含基准测试编排代码。完整的试验数据集和详细的验证报告单独维护,目前尚未公开;它们将随着相关研究的定稿而发布。
## 许可证
Apache-2.0。请参阅 [LICENSE](./LICENSE)。
标签:LLM智能体, 人工智能, 安全基准测试, 用户模式Hook绕过, 红队评估, 逆向工具