shavik290696/sre-runbook
GitHub: shavik290696/sre-runbook
一套面向企业基础设施运维的事件响应与操作标准化检查清单手册,帮助 SRE 团队在故障处理全流程中保持规范、有序的执行节奏。
Stars: 0 | Forks: 0
# sre-runbook
企业基础设施的事件响应与运维手册
# 事件响应检查清单
## 1. 分流排查
- [ ] 确认告警/事件是真实的(而非监控误报)
- [ ] 根据 SLA 定义划分严重等级(Critical / High / Medium / Low)
- [ ] 在 ServiceNow 中记录事件工单,包含时间戳和初始详情
## 2. 调查
- [ ] 检查监控仪表盘 (Grafana) 中的相关指标/异常情况
- [ ] 审查可能与事件相关的近期变更(变更工单)
- [ ] 检查事件发生时间段前后的系统日志以查找错误
## 3. 隔离 / 缓解
- [ ] 确定即时缓解措施(failover、重启、隔离受影响的组件)
- [ ] 根据 SLA 沟通要求向利益相关者同步状态
- [ ] 如果根本原因未能立即明确,则升级至 L2/L3 或供应商
## 4. 解决
- [ ] 应用永久修复方案,或确认变通方案已稳定
- [ ] 验证服务是否已完全恢复(功能检查 + 性能检查)
- [ ] 更新并关闭 ServiceNow 工单,并附上解决记录
## 5. 事件总结
- [ ] 开展根本原因分析 (RCA)
- [ ] 记录发现的问题和预防措施
- [ ] 如适用,更新监控阈值/告警
- [ ] 与团队分享 RCA 总结
标签:IT服务管理, SRE, 企业基础设施, 偏差过滤, 操作手册, 故障响应, 运维, 防御加固