viniciusds2020/multi-agent-ai-incident-response

GitHub: viniciusds2020/multi-agent-ai-incident-response

基于 CrewAI 的多智能体系统,针对数据、ML 和 AI 平台的事件进行自动化调查、根因分析和受监管的修复规划。

Stars: 0 | Forks: 0

# 多智能体 AI 事件响应 [![CI](https://static.pigsec.cn/wp-content/uploads/repos/cas/ad/ad5834178f7599af9fdda11629d49cae07f2997beec49821b2920eff5bfd50e7.svg)](https://github.com/viniciusds2020/multi-agent-ai-incident-response/actions/workflows/ci.yml) 针对数据、ML、RAG、智能体和 AI 平台的弹性可扩展事件响应系统。一个由专家组成的 Crew 会使用 read-only 工具调查同一事件,交叉比对证据,识别可能的原因,并交付一套受监管的修复计划。 ## 为什么使用多智能体 诊断工作需要不同的能力和工具。本项目明确划分了以下职责: - **Incident Manager:** 分流、严重性评估和任务委派; - **Data Investigator:** 数据质量、schema 和 drift; - **ML/LLM Investigator:** 指标、retrieval、prompt 和成本; - **Platform Investigator:** 日志、错误、延迟和 deploys; - **Root Cause Analyst:** 综合分析与排除假设; - **Governance Reviewer:** 风险、审批和拦截; - **Remediation Planner:** 缓解措施、rollback 和验证标准。 ``` flowchart TD A[Alerta] --> B[Incident Manager] B --> C[Data Investigator] B --> D[ML/LLM Investigator] B --> E[Platform Investigator] C --> F[Root Cause Analyst] D --> F E --> F F --> G[Governance Reviewer] G --> H{Ação sensível?} H -- sim --> I[Aprovação humana] H -- não --> J[Plano de remediação] ``` ## 模式 - `simulation`:默认模式,具有确定性,无付费 API,适用于 CI; - `crewai`:基于 Groq/Llama 的真实 CrewAI,包含专家和工具; - 架构已具备对带有 allowlist 的 MCP tools 的支持。 状态、授权和执行过程始终由应用程序控制,而不是由 LLM 控制。 ## 运行 ``` python -m venv .venv source .venv/bin/activate pip install -e ".[dev]" uvicorn incident_response.api:app --reload ``` 访问 `http://localhost:8000` 并执行模拟事件:由不兼容的向量索引引起的无来源响应增加。 若要运行真实 CrewAI: ``` pip install -e ".[crewai]" export INCIDENT_ENGINE=crewai export GROQ_API_KEY=sua_chave export INCIDENT_MODEL=groq/llama-3.3-70b-versatile ``` ## API | 方法 | Endpoint | 用途 | |---|---|---| | `POST` | `/api/incidents/demo` | 创建并调查模拟事件 | | `GET` | `/api/incidents` | 事件队列 | | `GET` | `/api/incidents/{id}` | 报告与时间线 | | `POST` | `/api/incidents/{id}/approve` | 批准敏感操作 | | `POST` | `/api/incidents/{id}/resolve` | 验证并关闭事件 | | `GET` | `/api/dashboard` | 运营指标 | Swagger 位于 `/docs`。 ## 工具 MVP 包含用于以下操作的模拟 read-only 工具: - 数据 profiling; - RAG 和模型指标; - 平台日志与健康状态; - 近期的配置更改; - 治理策略。 每次调用都会记录智能体、工具、参数、耗时以及结果摘要。Crew 无法使用写入类工具。 ## 可扩展性 在 MVP 中,FastAPI 和 SQLite 保持演示的简单性。面向生产环境的演进规划包含 PostgreSQL、Redis/RabbitMQ、CrewAI workers、对象存储、OpenTelemetry、RBAC、租户隔离以及用于 SSE/WebSocket 的持久化事件。 ## 安全性 - read-only 工具以及针对每个智能体的 allowlist; - 不持久化存储任何密钥; - 执行 rollback/拦截操作必须经过人工批准; - 文档和日志作为数据处理,而非指令; - 超时、上下文限制和审计; - 数据完全为模拟生成。 本项目遵循 [CrewAI](https://docs.crewai.com/) 文档中所记载的关于 Crews、Tasks 和 MCP 集成的最新标准。 MIT。
标签:AI事件响应, CrewAI, LLM应用运维, 多智能体, 数据治理, 根因分析, 模块化设计, 自动化修复, 逆向工具