api-evangelist/reliability
GitHub: api-evangelist/reliability
面向 SRE 和 DevOps 领域的可靠性主题资源索引,汇总了 SLO 管理、混沌工程和事件响应等方向的工具平台与机器可读规范。
Stars: 0 | Forks: 0
# 可靠性 (reliability)
涵盖站点可靠性工程 (SRE)、可靠性平台、服务级别目标 (SLO)、错误预算、混沌工程、弹性测试和事件响应的索引和主题集合。可靠性平台帮助团队定义和衡量可靠性目标、有意识地注入故障以验证弹性、管理轮班和告警、协调事件响应,并运行无指责的事件复盘。此集合包括像 Nobl9 和 Chronosphere 这样的 SLO 管理平台,像 Gremlin、Chaos Mesh、Litmus 和 AWS Fault Injection Simulator 这样的混沌工程工具,具有可靠性评分的内部开发者平台(如 OpsLevel 和 Cortex),以及像 PagerDuty、OpsGenie、Incident.io、FireHydrant、Rootly、Blameless、Squadcast 和 Zenduty 这样的事件响应平台。
**URL:** [https://apievangelist.com](https://apievangelist.com)
## 标签:
- SRE, 可靠性, SLO, 混沌工程, 事件响应, 错误预算, On-Call, 弹性
## 时间戳
- **创建:** 2026-05-19
- **修改:** 2026-05-19
## 通用属性
- [门户](https://apievangelist.com)
- [GitHub 组织](https://github.com/api-evangelist)
- [JSONSchema - SLO Schema](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/json-schema/reliability-slo-schema.json)
- [JSONSchema - Chaos Experiment Schema](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/json-schema/reliability-chaos-experiment-schema.json)
- [JSON-LD](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/json-ld/reliability-context.jsonld)
- [词汇表](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/vocabulary/reliability-vocabulary.yaml)
## 功能
| 名称 | 描述 |
|------|-------------|
| 服务级别目标和错误预算 | 可靠性平台允许团队定义 SLI、设置 SLO,并跟踪错误预算,以平衡可靠性工作与功能交付。 |
| 混沌工程与故障注入 | 混沌工具故意向系统中注入故障,以验证弹性并在它们引发事件之前发现隐藏的弱点。 |
| 事件响应与 On-Call 编排 | 平台在分布式团队中编排轮班、告警路由、升级策略和事件作战室。 |
| Runbook 自动化与响应工作流 | 可靠性平台自动化在事件发生时触发的 runbook,捕获上下文,并指导响应人员进行修复。 |
| 缩小爆炸半径与安全控制 | 混沌和事件工具包括中止条件、范围限制和自动回滚,以控制实验和事件的爆炸半径。 |
| 无指责的事件复盘 | 平台构建事件后分析结构,以提取经验教训、捕获时间线、促成因素和后续行动。 |
| 服务标准与可靠性评分 | 内部开发者平台根据可靠性标准(如所有权、On-Call 覆盖率、SLO 采用情况和 runbook 完整性)对服务进行评分。 |
| 状态页面与客户沟通 | 状态页面平台向客户和利益相关者实时传达事件状态和维护窗口。 |
## 用例
| 名称 | 描述 |
|------|-------------|
| 基于 SLO 的告警 | 用 SLO 消耗速率告警取代阈值告警,只有在错误预算消耗速度快于可持续水平时才触发。 |
| 预生产环境弹性测试 | 团队在 staging 环境中注入故障,以在部署到生产环境之前验证重试、超时、断路器和故障转移。 |
| 游戏日与持续验证 | SRE 团队运行计划内的游戏日和持续的混沌实验,以验证 runbook、告警和故障转移行为仍然有效。 |
| 大规模事件协调 | 平台通过自动创建的频道、记录员、角色和时间线捕获,在多个团队之间协调大型事件。 |
| 错误预算策略执行 | 当服务耗尽其错误预算时,策略可以冻结部署、呼叫领导层或触发可靠性投资。 |
| On-Call 日程管理 | 通过聊天和工单系统集成,管理跨全球团队的轮班日程、换班和升级策略。 |
| 服务目录与可靠性标准 | 追踪整个组织内的服务所有权、层级以及对可靠性标准的遵守情况。 |
| 面向客户的状态沟通 | 向客户和订阅者发布事件更新、计划内维护和组件健康状况。 |
## 集成
| 名称 | 描述 |
|------|-------------|
| Nobl9 | SLO 平台,将来自可观测性来源的 SLI 整合到带有错误预算跟踪的受管目标中。 |
| Gremlin | 混沌工程平台,用于安全地注入 CPU、内存、网络和依赖项故障,并带有内置中止条件。 |
| PagerDuty | 事件响应和 On-Call 平台,具有轮班调度、升级、事件情报和广泛的集成功能。 |
| Incident.io | Slack 原生事件响应平台,可自动执行频道创建、角色分配、沟通和事后复盘。 |
| FireHydrant | 事件管理工具,为可靠性项目结合了 runbook、回顾、状态页面和服务目录。 |
| Chaos Mesh | 开源的 CNCF 混沌工程平台,适用于 Kubernetes,可注入 Pod、网络、I/O 和时间故障。 |
| OpsLevel | 内部开发者门户,根据可靠性标准(如 SLO、On-Call 和 runbook)对服务进行评分。 |
| Statuspage | 托管的状态页面平台,用于向客户传达事件、维护和组件健康状况。 |
## 产物
按格式组织的机器可读 API 规范。
### JSON Schema
- [SLO Schema](json-schema/reliability-slo-schema.json)
- [Chaos Experiment Schema](json-schema/reliability-chaos-experiment-schema.json)
### JSON 结构
- [SLO 结构](json-structure/reliability-slo-structure.json)
- [Chaos Experiment 结构](json-structure/reliability-chaos-experiment-structure.json)
### JSON-LD
- [可靠性上下文](json-ld/reliability-context.jsonld)
## 词汇表
- [可靠性词汇表](vocabulary/reliability-vocabulary.yaml) — 统一的分类法,映射了跨 SLO、混沌工程和事件响应平台的可靠性资源、操作、工作流和角色
## 网络
此索引引用了以下可靠性、混沌工程和事件响应仓库:
- [Amazon Fault Injection Simulator](https://github.com/api-evangelist/amazon-fault-injection-simulator)
- [Better Stack](https://github.com/api-evangelist/betterstack)
- [Blameless](https://github.com/api-evangelist/blameless)
- [Chaos Mesh](https://github.com/api-evangelist/chaos-mesh)
- [Chronosphere](https://github.com/api-evangelist/chronosphere)
- [Cortex](https://github.com/api-evangelist/cortex)
- [FireHydrant](https://github.com/api-evangelist/firehydrant)
- [Gremlin](https://github.com/api-evangelist/gremlin)
- [Harness](https://github.com/api-evangelist/harness)
- [Incident.io](https://github.com/api-evangelist/incident-io)
- [Lightstep](https://github.com/api-evangelist/lightstep)
- [Litmus](https://github.com/api-evangelist/litmus)
- [Moogsoft](https://github.com/api-evangelist/moogsoft)
- [Nobl9](https://github.com/api-evangelist/nobl9)
- [OneUptime](https://github.com/api-evangelist/oneuptime)
- [OpsGenie](https://github.com/api-evangelist/opsgenie)
- [OpsLevel](https://github.com/api-evangelist/opslevel)
- [PagerDuty](https://github.com/api-evangelist/pagerduty)
- [Rootly](https://github.com/api-evangelist/rootly)
- [SIGNL4](https://github.com/api-evangelist/signl4)
- [Splunk On-Call (VictorOps)](https://github.com/api-evangelist/victorops)
- [Squadcast](https://github.com/api-evangelist/squadcast)
- [Statuspage](https://github.com/api-evangelist/statuspage)
- [xMatters](https://github.com/api-evangelist/xmatters)
- [Zenduty](https://github.com/api-evangelist/zenduty)
## 维护者
**FN:** Kin Lane
**Email:** kin@apievangelist.com
标签:API平台, SRE, 偏差过滤, 后端开发, 弹性测试, 故障应急响应, 服务等级目标(SLO), 混沌工程, 系统可靠性