abhishekshuklacodes/incident-response-field-manual

GitHub: abhishekshuklacodes/incident-response-field-manual

一本为零基础学生打造的互动式 SRE 应急响应实战手册,通过十二个阶段的模拟演练教授线上故障处理的全流程思维方式。

Stars: 0 | Forks: 0

# 作战室 **一本为学生准备的互动式应急响应实战手册。** “生产环境挂了——你该怎么办?”这个问题几乎在每一场 SRE、可观测性和平台工程面试中都会被问到。答案不是技术冷知识,而是一种思维方式。本网站通过让你*亲身经历*一次故障,而不是纸上谈兵,来教你掌握它。 👉 **[打开网站](https://abhishekshuklacodes.github.io/incident-response-field-manual/)** ## 内容概览 十二个阶段,从告警触发到事后复盘——每一个阶段都有你可以亲自动手操作的实战演练: | 阶段 | 演练 | | --- | --- | | 01 · 调查前先稳住局势 | 一次带有倒计时的真实线上故障,只有两个按钮。选择“查看日志”,然后眼睁睁看着代价增加。 | | 02 · 构建时间线 | 一个键入式的事件时间线,显示部署时间恰好比首次故障早 96 秒。 | | 03 · 消除告警噪音 | 17 个触发的告警。按*首次发现*排序,它们会合并成一个根本原因。 | | 04 · 读取黄金信号 | 拖动条上的四条实时迷你图——其中包括流量下降看似健康的陷阱。 | | 05 · 追踪链路,而不是巡览仪表盘 | 一个 span 瀑布图,其中缓慢的 span 是 `db.pool.acquire`,而不是数据库查询。 | | 06 · 关联而不是搜索 | 值得对齐的变更、遥测和平台数据流。 | | 07 · 不断追问为什么 | 一个“五个为什么”的阶梯,只有在得出*流程*层面的答案时才会触底。 | | 08 · 修复——优先恢复 | 回滚与向前修复的权衡,以面试官期望的方式表达出来。 | | 09 · 在时间压力下沟通 | 选择你会发送的利益相关者更新。三个选项都会被评分,并附上原因。 | | 10 · 无指责事后复盘 | 一个可以生成可复制 markdown 的构建器。 | | 11 · 永远杜绝它 | 交付安全性、可观测性和自动化实践。 | | 12 · 向实习生解释它 | 用平实的语言测试你是否真正理解了它。 | 外加一套 10 张卡片的面试演练卡组。 ## 专为新手打造 - **白话模式**(默认开启)为每个阶段添加了通俗易懂的解释。 - **术语解码器**——正文中有 32 个术语带有下划线。点击任意一个即可获得定义*以及*日常类比。无需任何经验基础。 - **从这里开始**入门指南解释了什么是事件以及由谁来处理它们。 - 阅读进度会在侧边栏中跟踪记录。 ## 运行方式 一个独立文件。无需构建步骤,无依赖项,无网络调用。 ``` open index.html ``` 如果想在本地作为服务运行: ``` python3 -m http.server 8000 ``` ## 说明 排版使用系统字体栈而不是 web 字体,因此页面可以离线工作并瞬间加载。它在 macOS 上会解析为 Avenir Next Condensed + Charter,在其他平台上则回退到 Arial Narrow + Georgia——无论哪种方式,都是紧凑的标题搭配衬线正文。 同时提供浅色和深色主题;页面会跟随你的系统偏好。 ## 许可证 MIT —— 详见 [LICENSE](LICENSE)。可在课堂、训练营或学习小组中使用。
标签:API集成, SRE, 偏差过滤, 可观测性, 后端开发, 多模态安全, 故障排查, 教学平台, 数据可视化