api-evangelist/reliability

GitHub: api-evangelist/reliability

面向 SRE 和 DevOps 领域的可靠性主题资源索引,汇总了 SLO 管理、混沌工程和事件响应等方向的工具平台与机器可读规范。

Stars: 0 | Forks: 0

# 可靠性 (reliability) 涵盖站点可靠性工程 (SRE)、可靠性平台、服务级别目标 (SLO)、错误预算、混沌工程、弹性测试和事件响应的索引和主题集合。可靠性平台帮助团队定义和衡量可靠性目标、有意识地注入故障以验证弹性、管理轮班和告警、协调事件响应,并运行无指责的事件复盘。此集合包括像 Nobl9 和 Chronosphere 这样的 SLO 管理平台,像 Gremlin、Chaos Mesh、Litmus 和 AWS Fault Injection Simulator 这样的混沌工程工具,具有可靠性评分的内部开发者平台(如 OpsLevel 和 Cortex),以及像 PagerDuty、OpsGenie、Incident.io、FireHydrant、Rootly、Blameless、Squadcast 和 Zenduty 这样的事件响应平台。 **URL:** [https://apievangelist.com](https://apievangelist.com) ## 标签: - SRE, 可靠性, SLO, 混沌工程, 事件响应, 错误预算, On-Call, 弹性 ## 时间戳 - **创建:** 2026-05-19 - **修改:** 2026-05-19 ## 通用属性 - [门户](https://apievangelist.com) - [GitHub 组织](https://github.com/api-evangelist) - [JSONSchema - SLO Schema](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/json-schema/reliability-slo-schema.json) - [JSONSchema - Chaos Experiment Schema](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/json-schema/reliability-chaos-experiment-schema.json) - [JSON-LD](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/json-ld/reliability-context.jsonld) - [词汇表](https://raw.githubusercontent.com/api-evangelist/reliability/refs/heads/main/vocabulary/reliability-vocabulary.yaml) ## 功能 | 名称 | 描述 | |------|-------------| | 服务级别目标和错误预算 | 可靠性平台允许团队定义 SLI、设置 SLO,并跟踪错误预算,以平衡可靠性工作与功能交付。 | | 混沌工程与故障注入 | 混沌工具故意向系统中注入故障,以验证弹性并在它们引发事件之前发现隐藏的弱点。 | | 事件响应与 On-Call 编排 | 平台在分布式团队中编排轮班、告警路由、升级策略和事件作战室。 | | Runbook 自动化与响应工作流 | 可靠性平台自动化在事件发生时触发的 runbook,捕获上下文,并指导响应人员进行修复。 | | 缩小爆炸半径与安全控制 | 混沌和事件工具包括中止条件、范围限制和自动回滚,以控制实验和事件的爆炸半径。 | | 无指责的事件复盘 | 平台构建事件后分析结构,以提取经验教训、捕获时间线、促成因素和后续行动。 | | 服务标准与可靠性评分 | 内部开发者平台根据可靠性标准(如所有权、On-Call 覆盖率、SLO 采用情况和 runbook 完整性)对服务进行评分。 | | 状态页面与客户沟通 | 状态页面平台向客户和利益相关者实时传达事件状态和维护窗口。 | ## 用例 | 名称 | 描述 | |------|-------------| | 基于 SLO 的告警 | 用 SLO 消耗速率告警取代阈值告警,只有在错误预算消耗速度快于可持续水平时才触发。 | | 预生产环境弹性测试 | 团队在 staging 环境中注入故障,以在部署到生产环境之前验证重试、超时、断路器和故障转移。 | | 游戏日与持续验证 | SRE 团队运行计划内的游戏日和持续的混沌实验,以验证 runbook、告警和故障转移行为仍然有效。 | | 大规模事件协调 | 平台通过自动创建的频道、记录员、角色和时间线捕获,在多个团队之间协调大型事件。 | | 错误预算策略执行 | 当服务耗尽其错误预算时,策略可以冻结部署、呼叫领导层或触发可靠性投资。 | | On-Call 日程管理 | 通过聊天和工单系统集成,管理跨全球团队的轮班日程、换班和升级策略。 | | 服务目录与可靠性标准 | 追踪整个组织内的服务所有权、层级以及对可靠性标准的遵守情况。 | | 面向客户的状态沟通 | 向客户和订阅者发布事件更新、计划内维护和组件健康状况。 | ## 集成 | 名称 | 描述 | |------|-------------| | Nobl9 | SLO 平台,将来自可观测性来源的 SLI 整合到带有错误预算跟踪的受管目标中。 | | Gremlin | 混沌工程平台,用于安全地注入 CPU、内存、网络和依赖项故障,并带有内置中止条件。 | | PagerDuty | 事件响应和 On-Call 平台,具有轮班调度、升级、事件情报和广泛的集成功能。 | | Incident.io | Slack 原生事件响应平台,可自动执行频道创建、角色分配、沟通和事后复盘。 | | FireHydrant | 事件管理工具,为可靠性项目结合了 runbook、回顾、状态页面和服务目录。 | | Chaos Mesh | 开源的 CNCF 混沌工程平台,适用于 Kubernetes,可注入 Pod、网络、I/O 和时间故障。 | | OpsLevel | 内部开发者门户,根据可靠性标准(如 SLO、On-Call 和 runbook)对服务进行评分。 | | Statuspage | 托管的状态页面平台,用于向客户传达事件、维护和组件健康状况。 | ## 产物 按格式组织的机器可读 API 规范。 ### JSON Schema - [SLO Schema](json-schema/reliability-slo-schema.json) - [Chaos Experiment Schema](json-schema/reliability-chaos-experiment-schema.json) ### JSON 结构 - [SLO 结构](json-structure/reliability-slo-structure.json) - [Chaos Experiment 结构](json-structure/reliability-chaos-experiment-structure.json) ### JSON-LD - [可靠性上下文](json-ld/reliability-context.jsonld) ## 词汇表 - [可靠性词汇表](vocabulary/reliability-vocabulary.yaml) — 统一的分类法,映射了跨 SLO、混沌工程和事件响应平台的可靠性资源、操作、工作流和角色 ## 网络 此索引引用了以下可靠性、混沌工程和事件响应仓库: - [Amazon Fault Injection Simulator](https://github.com/api-evangelist/amazon-fault-injection-simulator) - [Better Stack](https://github.com/api-evangelist/betterstack) - [Blameless](https://github.com/api-evangelist/blameless) - [Chaos Mesh](https://github.com/api-evangelist/chaos-mesh) - [Chronosphere](https://github.com/api-evangelist/chronosphere) - [Cortex](https://github.com/api-evangelist/cortex) - [FireHydrant](https://github.com/api-evangelist/firehydrant) - [Gremlin](https://github.com/api-evangelist/gremlin) - [Harness](https://github.com/api-evangelist/harness) - [Incident.io](https://github.com/api-evangelist/incident-io) - [Lightstep](https://github.com/api-evangelist/lightstep) - [Litmus](https://github.com/api-evangelist/litmus) - [Moogsoft](https://github.com/api-evangelist/moogsoft) - [Nobl9](https://github.com/api-evangelist/nobl9) - [OneUptime](https://github.com/api-evangelist/oneuptime) - [OpsGenie](https://github.com/api-evangelist/opsgenie) - [OpsLevel](https://github.com/api-evangelist/opslevel) - [PagerDuty](https://github.com/api-evangelist/pagerduty) - [Rootly](https://github.com/api-evangelist/rootly) - [SIGNL4](https://github.com/api-evangelist/signl4) - [Splunk On-Call (VictorOps)](https://github.com/api-evangelist/victorops) - [Squadcast](https://github.com/api-evangelist/squadcast) - [Statuspage](https://github.com/api-evangelist/statuspage) - [xMatters](https://github.com/api-evangelist/xmatters) - [Zenduty](https://github.com/api-evangelist/zenduty) ## 维护者 **FN:** Kin Lane **Email:** kin@apievangelist.com
标签:API平台, SRE, 偏差过滤, 后端开发, 弹性测试, 故障应急响应, 服务等级目标(SLO), 混沌工程, 系统可靠性