takzen/kanari-showcase

GitHub: takzen/kanari-showcase

Kanari 是一款针对 LLM 聊天机器人和 agent 的授权红队安全审计框架,通过自动化攻击测试发现 AI 系统漏洞并将结果映射到欧盟法规合规要求。

Stars: 1 | Forks: 0

Kanari logo

Kanari

针对 LLM 聊天机器人和 agent 的授权红队安全与合规审计。

在您的客户或监管机构之前,先一步找出您 AI 中的漏洞。

kanari.pl  ·  专为波兰市场打造:欧盟 AI 法案 · GDPR (RODO) · KNF

status market engine dashboard

## 问题所在 企业正在快速推出 AI 聊天机器人和 agent。一个过于“热情”的助手可能会: - **泄露其他客户的个人数据** —— 构成 GDPR / RODO 违规, - **未经授权就承诺退款、折扣或价格** —— 形成具有约束力的承诺, - **被隐藏在文档、评论或电子邮件中的指令劫持** —— prompt injection, - **提供无资质的金融或医疗建议**,或泄露其自身的 system prompt 和机密信息。 在欧盟,**AI Act** 和 **GDPR** 将这些从“bug”转变为切实的法律和财务风险。 ## Kanari 的功能 Kanari 是一个**授权的红队测试框架**,可在其他人采取行动之前,对*您自己的* LLM 系统进行攻击测试。 它运行一系列分类的探测测试,通过**两个独立的信号**验证每个发现,并将结果转化为映射到欧盟法规的**合规文档**。 ## 截图 **营销网站 —— [kanari.pl](https://kanari.pl)** ![Kanari 落地页](https://static.pigsec.cn/wp-content/uploads/repos/cas/48/481fdb4d2bb00a27bb42f8579b7dec01e07cb01e944ddca49fe6a036e515ec07.png) **审计仪表盘 —— 风险评分、严重程度分布、类别与法规覆盖情况** ![Kanari 审计仪表盘](https://static.pigsec.cn/wp-content/uploads/repos/cas/a7/a72d3493127f2ae9b826783dc1910d17c80e55e13779f8e3360c50a081e6bf1c.png) ## 差异化优势 —— 护城河 | | | |---|---| | 🇵🇱 **波兰语攻击** | 越狱和注入在波兰语中的表现有所不同。几乎没有外国工具会测试这些 —— Kanari 内置了原生的波兰语攻击包。 | | 🏛️ **合规映射** | 每个发现都映射到 **AI Act, GDPR (RODO), UOKiK, KNF** 或医疗法规下的具体义务。技术报告由此转化为合规文档。 | | 🎯 **两个独立信号** | 确定性的 **canary-token 检测器** *以及* **LLM-as-judge**。每个发现都是确凿的证据,而非单一模型的主观意见。 | | 🏭 **行业场景包** | 电子商务(虚假承诺、RODO 数据泄露)、银行/金融(无资质的投资建议)、医疗保健(剂量、诊断)。 | ## 工作原理 ``` flowchart LR A[Attack packs
YAML probes] --> R[Async runner] C[Canary tokens
seeded in context] --> R R -->|sends probes| T[Target adapter
chatbot / agent / HTTP] T -->|transcripts| D[Deterministic
canary detector] T -->|transcripts| J[LLM-as-judge
per-category rubric] D --> V{Finding?} J --> V V --> M[Compliance mapping
AI Act · RODO · KNF] M --> O[Report · Dashboard · PDF · CI gate] ``` 1. **植入 (Seed)** 将唯一的 canary token 注入到目标上下文中 —— 绝非真实机密。 2. **运行 (Run)** 通过可插拔的 adapter 对目标执行攻击测试矩阵。 3. **评分 (Score)** 使用确定性检测器 *以及* LLM-as-judge 评分标准对每条对话记录进行评估。 4. **映射 (Map)** 将发现结果映射到法规义务,并生成最终交付物。 ## 攻击类别 `prompt_injection` · `jailbreak` · `system_prompt_leak` · `secret_exfil` · `tool_abuse` · `unsafe_output` · `obfuscation_bypass` · `unauthorized_commitment` · `data_privacy` · `financial_advice` · `medical_advice` ## 合规覆盖范围 | 法规 | 检查的义务 | |---|---| | **EU AI Act** | 透明度 (Art. 50) · 风险管理 (Art. 9) · 准确性与鲁棒性 (Art. 15) | | **GDPR / RODO** | 数据最小化 (Art. 5) · 处理安全 (Art. 32) | | **UOKiK** | 禁止不正当市场行为(具有约束力的承诺) | | **KNF** | 投资建议仅限持牌机构提供 | | **医疗法规** | 无资质不得提供医疗建议 | 每项义务都会被评为**符合 / 违规 / 未测试**,以便一目了然地发现缺口。 ## 交付物 - **交互式仪表盘** —— 风险评分、严重程度分布、类别与法规覆盖情况, 包含 judge 推理过程的单次攻击对话记录。 - **可打印的审计报告** (HTML → PDF) —— 封面、执行摘要、法规覆盖情况、 包含证据的发现、方法论、附录。支持配置客户品牌。 - **复测证书** —— 在修复后带有 `PASS` / `FAIL` 标记的修复前后差异对比 (delta)。 - **CI gate** —— 一个 GitHub Action,当变更引入了新的 HIGH/CRITICAL (高危/严重)发现时(回归模式)将导致构建失败,从而将一次性审计转化为持续保护。 ## 技术 **引擎:** Python 3.11+ · pydantic v2 · async runner · LLM-as-judge (Gemini / Anthropic) · 确定性 canary 检测器 · YAML 攻击包 · 独立的 HTML/PDF 报告。 **前端:** Next.js 16 · React 19 · Tailwind CSS v4 · TypeScript。 ## 状态 私有测试版。引擎、营销网站、审计仪表盘、波兰语及行业攻击包、 合规映射、HTML/PDF 审计报告、复测证书以及 CI gate 均已构建完成,并可针对实时模型进行端到端的运行。 ## 联系方式 对审计或演示感兴趣? 📧 **kontakt@kanari.pl**  ·  🌐 **[kanari.pl](https://kanari.pl)** © 2026 TAKZEN。“Kanari”、徽标及本文档为专有财产。截图展示的是 波兰语版本的产品。本代码库不包含源代码。
标签:DLL 劫持, Prompt注入, Python, 大语言模型, 安全测试, 攻击性安全, 无后门, 红队评估