shavik290696/sre-runbook

GitHub: shavik290696/sre-runbook

一套面向企业基础设施运维的事件响应与操作标准化检查清单手册,帮助 SRE 团队在故障处理全流程中保持规范、有序的执行节奏。

Stars: 0 | Forks: 0

# sre-runbook 企业基础设施的事件响应与运维手册 # 事件响应检查清单 ## 1. 分流排查 - [ ] 确认告警/事件是真实的(而非监控误报) - [ ] 根据 SLA 定义划分严重等级(Critical / High / Medium / Low) - [ ] 在 ServiceNow 中记录事件工单,包含时间戳和初始详情 ## 2. 调查 - [ ] 检查监控仪表盘 (Grafana) 中的相关指标/异常情况 - [ ] 审查可能与事件相关的近期变更(变更工单) - [ ] 检查事件发生时间段前后的系统日志以查找错误 ## 3. 隔离 / 缓解 - [ ] 确定即时缓解措施(failover、重启、隔离受影响的组件) - [ ] 根据 SLA 沟通要求向利益相关者同步状态 - [ ] 如果根本原因未能立即明确,则升级至 L2/L3 或供应商 ## 4. 解决 - [ ] 应用永久修复方案,或确认变通方案已稳定 - [ ] 验证服务是否已完全恢复(功能检查 + 性能检查) - [ ] 更新并关闭 ServiceNow 工单,并附上解决记录 ## 5. 事件总结 - [ ] 开展根本原因分析 (RCA) - [ ] 记录发现的问题和预防措施 - [ ] 如适用,更新监控阈值/告警 - [ ] 与团队分享 RCA 总结
标签:IT服务管理, SRE, 企业基础设施, 偏差过滤, 操作手册, 故障响应, 运维, 防御加固