minseo218/InfraGym

GitHub: minseo218/InfraGym

一个基于场景的 AI 基础设施故障响应训练平台,通过模拟真实运维事件帮助 SRE 和系统工程师在安全沙箱中练习故障排查与恢复。

Stars: 0 | Forks: 0

# InfraGym InfraGym 是一个面向系统工程师、SRE、DevOps 工程师、AI 平台工程师和 GPU 基础设施工程师的、基于场景的 AI 基础设施训练平台。 它将一个小型真实环境与一个大型逻辑环境结合在一起,从而可以在 Mac mini 上进行逼真的操作演练。 ## 阶段 1 — 工单:流量激增 阶段 1 刻意在添加更多系统之前实现一个完整的闭环学习: - 定时的故障进展,从流量激增到重试风暴 - 实时的 RPS、p95 延迟、5xx 错误率和数据库连接池遥测数据 - 服务拓扑与故障时间线 - 具备场景感知的虚拟终端,支持模拟 `kubectl`、日志、事件、sockets 和数据库连接池输出 - 基于证据的调查清单 - 带有防护措施的缓解操作、恢复状态和 100 分制的评分系统 - 响应式桌面和移动端工作区 该虚拟终端绝不会在宿主机或真实的 cluster 上执行任何命令。 ## 运行 需要 Node.js 22.13 或更高版本。 ``` npm install npm run dev ``` 打开开发服务器输出的本地 URL。 ## 测试 ``` npm test ``` 这会创建一个生产构建,并验证 InfraGym 工作区是否在服务端渲染且不包含初始示例内容。 ## MVP 路线图 ### 阶段 2 — Linux 磁盘已满 - 日志轮转失败 → 磁盘耗尽 → 应用故障 - 针对 `df`、`du`、`lsof`、`journalctl` 和 `systemctl` 的场景输出 - 根因分析与恢复评分 ### 阶段 3 — GPU XID 79 - GPU 节点性能降级 → XID 79 → NCCL 超时 → 训练任务失败 - `nvidia-smi`、`dcgmi`、Kubernetes 事件和 GPU 拓扑结构调查 - 驱逐、隔离、更换和恢复决策 ## 产品方向 后续的里程碑将加入 FastAPI 场景编排、SQLite 持久化、Docker Compose、kind、Prometheus、Grafana、Loki、面试模式、容量规划、架构决策、自动化演练以及更广泛的场景 目录。该产品将始终坚持这一原则:每个阶段交付时都包含相应的实现、测试和可运行的说明。 ## 技术栈 - React + TypeScript - vinext / 兼容 Cloudflare 的 runtime - 原生 CSS 实时遥测 UI - 未来阶段:Python、FastAPI、SQLite、Docker、kind、Kubernetes、 Prometheus、Grafana 和 Loki ## 定位 专为任何想要成为世界级系统工程师或 SRE 的人而构建,包括正在准备 Google、NVIDIA、 CoreWeave、Datadog、AWS、Microsoft、Toss、Lambda、Crusoe 和 OpenAI 等公司运维岗位的求职者。
标签:AI基础设施, MITM代理, SRE, 仿真环境, 偏差过滤, 子域名突变, 自动化攻击, 自定义请求头, 请求拦截, 运维培训, 逆向工具