franciszver/agentforge-3-redteam
GitHub: franciszver/agentforge-3-redteam
一个多智能体红队平台,持续发现、评估并记录医疗临床辅助 AI 系统中的安全漏洞。
Stars: 0 | Forks: 0
# AgentForge 第三阶段 — 对抗性安全与红队平台
## 第三阶段构建内容
一个多智能体对抗性评估平台,持续发现、生成、评判、回归测试并记录 Clinical Co-Pilot 中的漏洞——其攻击生成与评估被置于**独立的信任域**中(“内置利益冲突”设计):
- **Red Team Agent** — 自主、多轮对抗性输入生成。
- **Judge Agent** — 架构独立的评分与漂移检测。
- **Orchestrator Agent** — 覆盖率/优先级决策、回归测试触发器、成本控制。
- **Documentation Agent** — Judge 确认的漏洞利用 → 结构化漏洞报告。
- **Regression harness** + 可观测性,为 Orchestrator 的决策提供数据支持。
威胁模型映射到 OWASP Top 10 + OWASP LLM Top 10。Red Team Agent 的模型策略(本地无审查模型 vs. 云端模型 vs. 混合模型)在架构防御(P3.5)阶段决定——参见决策记录。
请参阅 `planning/` 了解简介以及权威的、可直接复制粘贴的启动文档
(**`planning/PHASE3_KICKOFF_PROMPT.md`**)——它基于第二阶段真实、已测量
的攻击面(issue #29),取代了旧版通用的
`planning/KICKOFF_PROMPT.md`。攻击目标冻结在 tag **`v2.0.0`**。
## AgentForge 系列
1. [agentforge-1-clinical-copilot](https://github.com/franciszver/agentforge-1-clinical-copilot) — Clinical Co-Pilot 基础
2. [agentforge-2-evidence-agent](https://github.com/franciszver/agentforge-2-evidence-agent) — 多模态 Evidence Agent 与 Document RAG
3. **agentforge-3-redteam** — 对抗性安全与红队平台 *(此代码库)*
标签:逆向工具