viniciusds2020/multi-agent-ai-incident-response
GitHub: viniciusds2020/multi-agent-ai-incident-response
基于 CrewAI 的多智能体系统,针对数据、ML 和 AI 平台的事件进行自动化调查、根因分析和受监管的修复规划。
Stars: 0 | Forks: 0
# 多智能体 AI 事件响应
[](https://github.com/viniciusds2020/multi-agent-ai-incident-response/actions/workflows/ci.yml)
针对数据、ML、RAG、智能体和 AI 平台的弹性可扩展事件响应系统。一个由专家组成的 Crew 会使用 read-only 工具调查同一事件,交叉比对证据,识别可能的原因,并交付一套受监管的修复计划。
## 为什么使用多智能体
诊断工作需要不同的能力和工具。本项目明确划分了以下职责:
- **Incident Manager:** 分流、严重性评估和任务委派;
- **Data Investigator:** 数据质量、schema 和 drift;
- **ML/LLM Investigator:** 指标、retrieval、prompt 和成本;
- **Platform Investigator:** 日志、错误、延迟和 deploys;
- **Root Cause Analyst:** 综合分析与排除假设;
- **Governance Reviewer:** 风险、审批和拦截;
- **Remediation Planner:** 缓解措施、rollback 和验证标准。
```
flowchart TD
A[Alerta] --> B[Incident Manager]
B --> C[Data Investigator]
B --> D[ML/LLM Investigator]
B --> E[Platform Investigator]
C --> F[Root Cause Analyst]
D --> F
E --> F
F --> G[Governance Reviewer]
G --> H{Ação sensível?}
H -- sim --> I[Aprovação humana]
H -- não --> J[Plano de remediação]
```
## 模式
- `simulation`:默认模式,具有确定性,无付费 API,适用于 CI;
- `crewai`:基于 Groq/Llama 的真实 CrewAI,包含专家和工具;
- 架构已具备对带有 allowlist 的 MCP tools 的支持。
状态、授权和执行过程始终由应用程序控制,而不是由 LLM 控制。
## 运行
```
python -m venv .venv
source .venv/bin/activate
pip install -e ".[dev]"
uvicorn incident_response.api:app --reload
```
访问 `http://localhost:8000` 并执行模拟事件:由不兼容的向量索引引起的无来源响应增加。
若要运行真实 CrewAI:
```
pip install -e ".[crewai]"
export INCIDENT_ENGINE=crewai
export GROQ_API_KEY=sua_chave
export INCIDENT_MODEL=groq/llama-3.3-70b-versatile
```
## API
| 方法 | Endpoint | 用途 |
|---|---|---|
| `POST` | `/api/incidents/demo` | 创建并调查模拟事件 |
| `GET` | `/api/incidents` | 事件队列 |
| `GET` | `/api/incidents/{id}` | 报告与时间线 |
| `POST` | `/api/incidents/{id}/approve` | 批准敏感操作 |
| `POST` | `/api/incidents/{id}/resolve` | 验证并关闭事件 |
| `GET` | `/api/dashboard` | 运营指标 |
Swagger 位于 `/docs`。
## 工具
MVP 包含用于以下操作的模拟 read-only 工具:
- 数据 profiling;
- RAG 和模型指标;
- 平台日志与健康状态;
- 近期的配置更改;
- 治理策略。
每次调用都会记录智能体、工具、参数、耗时以及结果摘要。Crew 无法使用写入类工具。
## 可扩展性
在 MVP 中,FastAPI 和 SQLite 保持演示的简单性。面向生产环境的演进规划包含 PostgreSQL、Redis/RabbitMQ、CrewAI workers、对象存储、OpenTelemetry、RBAC、租户隔离以及用于 SSE/WebSocket 的持久化事件。
## 安全性
- read-only 工具以及针对每个智能体的 allowlist;
- 不持久化存储任何密钥;
- 执行 rollback/拦截操作必须经过人工批准;
- 文档和日志作为数据处理,而非指令;
- 超时、上下文限制和审计;
- 数据完全为模拟生成。
本项目遵循 [CrewAI](https://docs.crewai.com/) 文档中所记载的关于 Crews、Tasks 和 MCP 集成的最新标准。
MIT。
标签:AI事件响应, CrewAI, LLM应用运维, 多智能体, 数据治理, 根因分析, 模块化设计, 自动化修复, 逆向工具