franciszver/agentforge-3-redteam

GitHub: franciszver/agentforge-3-redteam

一个多智能体红队平台,持续发现、评估并记录医疗临床辅助 AI 系统中的安全漏洞。

Stars: 0 | Forks: 0

# AgentForge 第三阶段 — 对抗性安全与红队平台 ## 第三阶段构建内容 一个多智能体对抗性评估平台,持续发现、生成、评判、回归测试并记录 Clinical Co-Pilot 中的漏洞——其攻击生成与评估被置于**独立的信任域**中(“内置利益冲突”设计): - **Red Team Agent** — 自主、多轮对抗性输入生成。 - **Judge Agent** — 架构独立的评分与漂移检测。 - **Orchestrator Agent** — 覆盖率/优先级决策、回归测试触发器、成本控制。 - **Documentation Agent** — Judge 确认的漏洞利用 → 结构化漏洞报告。 - **Regression harness** + 可观测性,为 Orchestrator 的决策提供数据支持。 威胁模型映射到 OWASP Top 10 + OWASP LLM Top 10。Red Team Agent 的模型策略(本地无审查模型 vs. 云端模型 vs. 混合模型)在架构防御(P3.5)阶段决定——参见决策记录。 请参阅 `planning/` 了解简介以及权威的、可直接复制粘贴的启动文档 (**`planning/PHASE3_KICKOFF_PROMPT.md`**)——它基于第二阶段真实、已测量 的攻击面(issue #29),取代了旧版通用的 `planning/KICKOFF_PROMPT.md`。攻击目标冻结在 tag **`v2.0.0`**。 ## AgentForge 系列 1. [agentforge-1-clinical-copilot](https://github.com/franciszver/agentforge-1-clinical-copilot) — Clinical Co-Pilot 基础 2. [agentforge-2-evidence-agent](https://github.com/franciszver/agentforge-2-evidence-agent) — 多模态 Evidence Agent 与 Document RAG 3. **agentforge-3-redteam** — 对抗性安全与红队平台 *(此代码库)*
标签:逆向工具