jaysenjaliya/Agentic-On-Call-Incident-Response-System
GitHub: jaysenjaliya/Agentic-On-Call-Incident-Response-System
基于 LangGraph 的多代理生产事件自主响应系统,在告警触发后自动完成诊断、根因分析与修复决策,减少不必要的工程师唤醒。
Stars: 0 | Forks: 0
# 代理式值班事件响应系统
一个自主的多代理系统,充当**生产事件的第一响应者**。当警报触发时,代理不会立即唤醒人类,而是先进行调查——读取日志、检查指标、搜索过往事件、识别根本原因——然后要么自动解决问题,要么在唤醒工程师时提供准备好的完整诊断和建议操作。
## 架构(目标)
由 supervisor 协调的三个专门子图:
```
Alert ─► [ Diagnosis ] ─► [ Root Cause ] ─► [ Remediation ] ─► Resolved | Escalated | Dead-lettered
logs/metrics runbooks/deploys confidence-gated:
auto-fix · human review · escalate
```
四个提升生产就绪性的特性贯穿始终:
1. **自适应故障分类** —— 工具错误在语义上被分类,并路由到不同的恢复策略(而非一概而论的重试计数器)。
2. **置信度门控的人机协同** —— 代理评估自身的置信度,并在低于阈值时暂停以等待人类介入,展示的是推理过程,而非原始输出。
3. **死信队列** —— 不可恢复的运行会序列化完整状态,以供日后审查。
4. **作为一等公民节点的审计追踪** —— 每个节点都会追加结构化事件。
## 技术栈
Python 3.12 · LangGraph · LangChain · **OpenAI GPT-4o** · Pydantic v2 · LangSmith · SQLite checkpointer · Gmail MCP(升级上报)· uv · Git(语义化版本控制)。
## 快速开始
```
uv sync --extra dev
cp .env.example .env # add your OPENAI_API_KEY (and LangSmith key)
uv run python main.py --test-tools # available from Phase 1
```
## 项目文档
工程日志、阶段计划和决策记录在 [`docs/`](docs/README.md) 中。
代理操作规则在 [`CLAUDE.md`](CLAUDE.md) 中。管理规范:
`Incident_Response_Agent_Documentation.pdf`。
*本 README 将在第 4 阶段进行扩充,包含架构图、评估指标表、演示输出和完整的设置说明(PRD §3.3, WI-38)。*
标签:AI智能体, LangGraph, 多智能体, 模块化设计, 自动化修复, 运维