abhishekshuklacodes/incident-response-field-manual
GitHub: abhishekshuklacodes/incident-response-field-manual
一本为零基础学生打造的互动式 SRE 应急响应实战手册,通过十二个阶段的模拟演练教授线上故障处理的全流程思维方式。
Stars: 0 | Forks: 0
# 作战室
**一本为学生准备的互动式应急响应实战手册。**
“生产环境挂了——你该怎么办?”这个问题几乎在每一场 SRE、可观测性和平台工程面试中都会被问到。答案不是技术冷知识,而是一种思维方式。本网站通过让你*亲身经历*一次故障,而不是纸上谈兵,来教你掌握它。
👉 **[打开网站](https://abhishekshuklacodes.github.io/incident-response-field-manual/)**
## 内容概览
十二个阶段,从告警触发到事后复盘——每一个阶段都有你可以亲自动手操作的实战演练:
| 阶段 | 演练 |
| --- | --- |
| 01 · 调查前先稳住局势 | 一次带有倒计时的真实线上故障,只有两个按钮。选择“查看日志”,然后眼睁睁看着代价增加。 |
| 02 · 构建时间线 | 一个键入式的事件时间线,显示部署时间恰好比首次故障早 96 秒。 |
| 03 · 消除告警噪音 | 17 个触发的告警。按*首次发现*排序,它们会合并成一个根本原因。 |
| 04 · 读取黄金信号 | 拖动条上的四条实时迷你图——其中包括流量下降看似健康的陷阱。 |
| 05 · 追踪链路,而不是巡览仪表盘 | 一个 span 瀑布图,其中缓慢的 span 是 `db.pool.acquire`,而不是数据库查询。 |
| 06 · 关联而不是搜索 | 值得对齐的变更、遥测和平台数据流。 |
| 07 · 不断追问为什么 | 一个“五个为什么”的阶梯,只有在得出*流程*层面的答案时才会触底。 |
| 08 · 修复——优先恢复 | 回滚与向前修复的权衡,以面试官期望的方式表达出来。 |
| 09 · 在时间压力下沟通 | 选择你会发送的利益相关者更新。三个选项都会被评分,并附上原因。 |
| 10 · 无指责事后复盘 | 一个可以生成可复制 markdown 的构建器。 |
| 11 · 永远杜绝它 | 交付安全性、可观测性和自动化实践。 |
| 12 · 向实习生解释它 | 用平实的语言测试你是否真正理解了它。 |
外加一套 10 张卡片的面试演练卡组。
## 专为新手打造
- **白话模式**(默认开启)为每个阶段添加了通俗易懂的解释。
- **术语解码器**——正文中有 32 个术语带有下划线。点击任意一个即可获得定义*以及*日常类比。无需任何经验基础。
- **从这里开始**入门指南解释了什么是事件以及由谁来处理它们。
- 阅读进度会在侧边栏中跟踪记录。
## 运行方式
一个独立文件。无需构建步骤,无依赖项,无网络调用。
```
open index.html
```
如果想在本地作为服务运行:
```
python3 -m http.server 8000
```
## 说明
排版使用系统字体栈而不是 web 字体,因此页面可以离线工作并瞬间加载。它在 macOS 上会解析为 Avenir Next Condensed + Charter,在其他平台上则回退到 Arial Narrow + Georgia——无论哪种方式,都是紧凑的标题搭配衬线正文。
同时提供浅色和深色主题;页面会跟随你的系统偏好。
## 许可证
MIT —— 详见 [LICENSE](LICENSE)。可在课堂、训练营或学习小组中使用。
标签:API集成, SRE, 偏差过滤, 可观测性, 后端开发, 多模态安全, 故障排查, 教学平台, 数据可视化