raiph-ai/fireclaw
GitHub: raiph-ai/fireclaw
一款面向 AI 代理的开源安全网关,专注防御提示注入并保障上下文安全。
Stars: 17 | Forks: 1

# 🛡️ FireClaw — 你的智能体大脑的防火墙
开源安全代理,保护 AI 智能体免受提示词注入攻击。
官网 • 快速开始 • 工作原理 • 社区威胁情报 • 想要帮忙?
## 问题所在 浏览网页的 AI 智能体容易受到**提示词注入攻击**。恶意网站可以嵌入隐藏指令来劫持你的智能体行为——窃取数据、执行命令或无视安全准则。简单的输入过滤是不够的;这是一个需要深度防御的对抗性问题。 **目前没有任何开源工具能解决这个问题。** FireClaw 填补了这一空白。 ## FireClaw 的作用 FireClaw 部署在你的 AI 智能体和互联网之间。每次网页抓取都会经过一个**经过加固的 4 阶段流水线**,在内容到达你的智能体上下文窗口之前剥离提示词注入 payload。 你的智能体不再直接抓取,而是调用 FireClaw。FireClaw 返回干净、客观的内容——没有隐藏指令,没有 Unicode 技巧,也没有编码漏洞利用。 ## 工作原理 ``` Your Agent FireClaw The Web │ │ │ │── fetch("example.com") ──▶│ │ │ │── GET example.com ────────▶│ │ │◀── raw HTML ──────────────│ │ │ │ │ │ ┌─── Stage 1: DNS Check ─────┐ │ │ │ Block known-malicious URLs │ │ │ └────────────────────────────┘ │ │ ↓ │ │ ┌─── Stage 2: Sanitize ──────┐ │ │ │ Strip HTML tricks, hidden │ │ │ │ Unicode, encoding exploits, │ │ │ │ inject canary tokens │ │ │ └────────────────────────────┘ │ │ ↓ │ │ ┌─── Stage 3: LLM Summary ───┐ │ │ │ Isolated LLM extracts facts │ │ │ │ only — no tools, no memory │ │ │ └────────────────────────────┘ │ │ ↓ │ │ ┌─── Stage 4: Output Scan ───┐ │ │ │ Check for residual inject- │ │ │ │ ions, canary survival, │ │ │ │ tool-call syntax │ │ │ └────────────────────────────┘ │ │ │◀── clean content ─────────│ ``` ### 核心洞察 即使第 3 阶段的摘要 LLM 被注入,**它也没有工具、没有记忆、且无法访问你的数据。** 它只能返回文本。并且该文本仍需经过第 4 阶段的输出扫描。攻击者将走投无路。 ## 功能特性 - **200+ 注入模式** — 基于正则表达式的检测,涵盖结构性技巧、注入特征、数据外泄尝试和输出篡改 - **DNS 级别黑名单** — 集成 URLhaus、PhishTank、OpenPhish 以及 FireClaw 社区黑名单 - **Canary Token 系统** — 注入内容的唯一标记,用于检测是否绕过了摘要处理 - **域名信任级别** — 为每个域名配置受信任(跳过清理)、中性(完整流水线)、可疑(激进检测)或已封禁(拒绝) - **速率限制与成本控制** — 支持每分钟/小时/天的限制,具备自动节流和硬上限 - **JSONL 审计日志** — 记录每次抓取、检测和告警的完整取证追踪 - **无绕过模式** — 流水线是固定的。即使你的智能体被攻破,它也无法禁用 FireClaw。 - **OLED 屏幕支持** — 可选的 Raspberry Pi OLED 集成,用于物理监控 - **仪表盘** — 基于 Web 的 UI,用于监控、配置和日志浏览 ### 🔥 Pi 设备 OLED 屏幕
OLED showing daily fetch and threat counts
FireClaw — 捍卫你的智能体。保护你的。加入社区。
🛡️ fireclaw.app
标签:AI安全, Chat Copilot, 人工智能, 代理防护, 安全代理, 提示注入防御, 源代码安全, 用户模式Hook绕过, 自定义脚本, 请求响应过滤