minseo218/InfraGym
GitHub: minseo218/InfraGym
一个基于场景的 AI 基础设施故障响应训练平台,通过模拟真实运维事件帮助 SRE 和系统工程师在安全沙箱中练习故障排查与恢复。
Stars: 0 | Forks: 0
# InfraGym
InfraGym 是一个面向系统工程师、SRE、DevOps 工程师、AI 平台工程师和 GPU 基础设施工程师的、基于场景的 AI 基础设施训练平台。
它将一个小型真实环境与一个大型逻辑环境结合在一起,从而可以在 Mac mini 上进行逼真的操作演练。
## 阶段 1 — 工单:流量激增
阶段 1 刻意在添加更多系统之前实现一个完整的闭环学习:
- 定时的故障进展,从流量激增到重试风暴
- 实时的 RPS、p95 延迟、5xx 错误率和数据库连接池遥测数据
- 服务拓扑与故障时间线
- 具备场景感知的虚拟终端,支持模拟 `kubectl`、日志、事件、sockets 和数据库连接池输出
- 基于证据的调查清单
- 带有防护措施的缓解操作、恢复状态和 100 分制的评分系统
- 响应式桌面和移动端工作区
该虚拟终端绝不会在宿主机或真实的 cluster 上执行任何命令。
## 运行
需要 Node.js 22.13 或更高版本。
```
npm install
npm run dev
```
打开开发服务器输出的本地 URL。
## 测试
```
npm test
```
这会创建一个生产构建,并验证 InfraGym 工作区是否在服务端渲染且不包含初始示例内容。
## MVP 路线图
### 阶段 2 — Linux 磁盘已满
- 日志轮转失败 → 磁盘耗尽 → 应用故障
- 针对 `df`、`du`、`lsof`、`journalctl` 和 `systemctl` 的场景输出
- 根因分析与恢复评分
### 阶段 3 — GPU XID 79
- GPU 节点性能降级 → XID 79 → NCCL 超时 → 训练任务失败
- `nvidia-smi`、`dcgmi`、Kubernetes 事件和 GPU 拓扑结构调查
- 驱逐、隔离、更换和恢复决策
## 产品方向
后续的里程碑将加入 FastAPI 场景编排、SQLite 持久化、Docker
Compose、kind、Prometheus、Grafana、Loki、面试模式、容量规划、架构决策、自动化演练以及更广泛的场景
目录。该产品将始终坚持这一原则:每个阶段交付时都包含相应的实现、测试和可运行的说明。
## 技术栈
- React + TypeScript
- vinext / 兼容 Cloudflare 的 runtime
- 原生 CSS 实时遥测 UI
- 未来阶段:Python、FastAPI、SQLite、Docker、kind、Kubernetes、
Prometheus、Grafana 和 Loki
## 定位
专为任何想要成为世界级系统工程师或 SRE 的人而构建,包括正在准备 Google、NVIDIA、
CoreWeave、Datadog、AWS、Microsoft、Toss、Lambda、Crusoe 和 OpenAI 等公司运维岗位的求职者。
标签:AI基础设施, MITM代理, SRE, 仿真环境, 偏差过滤, 子域名突变, 自动化攻击, 自定义请求头, 请求拦截, 运维培训, 逆向工具