William2333ZZ/trustshell
GitHub: William2333ZZ/trustshell
一款面向 AI agent 的安全测试工具包,通过静态分析与动态攻击相结合的方式,以 exploit 实际验证为核心来发现和确认 prompt 注入、memory 投毒等安全漏洞。
Stars: 1 | Forks: 0
TrustShell
一款用于 AI agent 安全的开源工具包。
阅读代码,破坏运行中的 agent,证明它——经 exploit 验证,绝非猜测。
🔗 trust-shell.com · ✉️ a313295747@gmail.com · 零依赖 (Python 3.8+)
每一个能够*行动*的 AI agent 都是一个新的攻击面,而自动化扫描只能捕捉到表层风险。 真正的威胁——prompt 注入、memory 投毒、sandbox 逃逸、工具/操作滥用—— 需要一个对手来发现。TrustShell 结合了**静态 + 动态**测试(类似于针对 AI agent 的 SAST + DAST),并且**判断真伪的唯一标准是 exploit 是否真正生效,而非模型投票。** 本仓库是工具包。相关的分析报告、操作手册和实战记录位于 [trust-shell.com](https://trust-shell.com)。 ## 包含内容 | 工具 | 功能说明 | |---|---| | [`attacker/`](attacker/) | **自主攻击器** — 一个对其他 agent 进行 red-team 测试的 agent。包含静态分诊 + 经标记确认的动态攻击(RT-1 注入,RT-6 memory 投毒)。只有当 exploit 的验证标记真正返回时,漏洞发现才会被标记为 CONFIRMED。 | | [`scanner/`](scanner/) | **静态引擎** (`static_scan.py`) — 基于 agent 源码的 AST 候选路径分析器。**表层扫描器** (`scan.py`) — 网络/认证 + 文件系统检查,是开放基线(A–D 级)的可执行形式。 | | [`skills/`](skills/) | **Red-team 技能** — 九大攻击类别(RT-1…RT-9),以可移植的 `SKILL.md` 文件形式提供,供 AI agent 加载并针对目标运行。Apache-2.0 协议。 | | [`mcp/`](mcp/) | **MCP 服务器** — 将整个工具包暴露为任何 MCP agent(Claude Code、Claude Desktop、Cursor)都可以调用的工具:`static_scan`、`red_team`、`list_skills`。 | **从你的 agent 中使用它。** 这些技能以 `SKILL.md` 的形式加载到 Claude Code / agentskills.io / Hermes 中([操作方法](skills/#use-these-in-your-agent));或者运行 [MCP 服务器](mcp/),以便任何 MCP 客户端将工具包作为原生工具调用。TrustShell 是*通过* agent 生态系统进行传播的,而不仅仅是你雇佣的一项服务。 ## 快速开始 ``` # 静态分类:阅读 agent 的源码,标记候选的漏洞路径(候选 ≠ 漏洞) python3 scanner/static_scan.py --source /path/to/agent # 表面扫描:正在运行的 agent 的网络/认证 + 安装目录的文件系统 → A/B/C/D python3 scanner/scan.py --target http://127.0.0.1:3000 --path /path/to/agent # 自主攻击者(仅限已授权、一次性的环境)。使用内置的 mock 进行自测: python3 attacker/run.py --authorized --mock vulnerable # → RT-1 + RT-6 CONFIRMED python3 attacker/run.py --authorized --mock hardened # → all refuted # ...针对真实的 CLI agent: python3 attacker/run.py --authorized --target-cmd 'your-agent -m {msg}' --source /path/to/agent ``` ## 闭环(工具如何协同工作) **静态分析**寻找候选路径(*从哪里发起攻击*) → **动态测试**攻击运行中的 agent 以 确认*实际*可利用的内容 → 静态误报会在真实攻击中消亡,而非投票否决 → 每个被确认的突破都可追溯到确切的代码路径(根本原因 + 影响范围)。 这种实证裁判是纯代码验证器在结构上根本无法提供的。 ## 安全与道德(不可妥协) 仅限用于**已授权的防御性安全测试。** 每个工具都强制执行以下原则: 1. **仅限已授权目标** — 你拥有的 agent,或者你有书面测试许可的 agent。 2. **仅限一次性环境** — 绝不在生产环境中使用,绝不在包含真实数据的机器上使用。 3. **绝不处理目标的真实凭证** — 这些信息保留在目标自身的 env 中。 4. **仅限无害验证** — 仅使用随机标记;不进行破坏、不窃取数据、不建立持久化。 5. **提供方法,而非武器** — 我们发布的是如何测试和确认的方法,而不是武器化的 payload。 6. **负责任的披露** — 私下报告并提供修复方案;如果某个 agent 防御得当,请如实说明。 如果没有 `--authorized` 参数,自主攻击器将拒绝运行。 ## 状态 **v0.x — 早期且实事求是。** 静态引擎标记的是*候选对象*,而非最终结论。攻击器 自动化了 RT-1 和 RT-6(已经过实时验证),并将 RT-2/3/4/5/7/8 标记为计划中,因此覆盖范围 绝未被夸大。欢迎提交 Issue 和 PR。 ## 许可协议 - 代码 (`scanner/`, `attacker/`): **MIT** - Red-team 技能 (`skills/`): **Apache-2.0** - 开放基线标准: **CC BY 4.0**标签:AI安全, Chat Copilot, DLL 劫持, Go语言工具, 域名收集, 大语言模型, 错误基检测, 静态代码分析