123superhanan/metrics-monitor
GitHub: 123superhanan/metrics-monitor
结合时序深度学习异常预测与 RAG 检索增强生成的基础设施监控平台,能在预测到性能下降时自动从 Runbook 知识库中检索并生成可执行的恢复方案。
Stars: 0 | Forks: 0
## 指标监控
## 一款智能的生产事故助手,结合了时间序列深度学习(LSTM 和 GRU)进行异常预测,并利用检索增强生成(RAG)将系统遥测数据直接映射到可操作的恢复 runbook。
该平台持续评估流式传输的基础设施指标,预测即将发生的服务性能下降,并提供工程师在严重事故期间所需的精确修复程序。
## 项目结构
```
metrics-monitor/
├── data/
│ ├── raw/ # Synthetic and historic metrics (.csv)
│ └── runbooks/ # System recovery documentation (.md)
├── notebooks/ # Exploratory data analysis
├── saved_models/ # Trained LSTM/GRU model artifacts
├── chroma_db/ # Local vector database for runbooks
├── src/
│ ├── api/ # FastAPI endpoints (predict, analyze, explain)
│ ├── data/ # Data generation, preprocessing, and encoding
│ ├── evaluation/ # Validation metrics and charting scripts
│ ├── models/ # Model architectures and training loops
│ └── rag/ # Document ingestion, embedding, and vector storage
└── static/ # Vanilla HTML5/CSS3/JS dashboard frontend
```
## 技术架构与核心流水线## 1. 预测性遥测流水线
遥测引擎从多维跟踪流(CPU 利用率、内存使用量、请求持续时间、错误百分比)中提取模式,以便在阈值突破发生之前进行预测。
* 摄取:原始遥测流通过 preprocess.py 传递,以清理异常情况并对齐时间索引。
* 窗口化:encode.py 将连续的行切分为滑动的重叠时间块(例如,观察过去 60 分钟以预测接下来的 15 分钟)。
* 建模:lstm_model.py 或 gru_model.py 对历史状态转换进行加权,以计算即将到来的系统向量。
## 2. 上下文感知 Runbook RAG 流水线
当预测或标记异常时,平台将定量警报与定性的工程知识领域连接起来。
* 向量摄取:ingest.py 通过 loader.py 读取 Markdown 文档文件,通过 chunker.py 将它们拆分为逻辑步骤,并将它们索引到 chroma_db/ 中。
* 动态搜索:当 API 记录到关键指标变化时,vector_store.py 会使用异常的文本指纹运行语义相似度匹配。
* Prompt 组装:prompt_maker.py 将最匹配的操作运行步骤直接注入到 LLM 的指令 payload 中,从而生成即时的修复方案。
## 3. API 与监控 UI 层
* FastAPI 服务:通过 src/api/ 提供非阻塞异步路由,以同时处理重叠的可视化流和文本生成调用。
* Dashboard 前端:一个使用原生 HTML/JS 编写的原生 Web 控制台,用于轮询系统更改、流式传输实时预测图表,并展示交互式的 AI 生成的分诊检查清单。
## 技术需求规范
该系统使用标准的开源库作为其运行数据栈:
* FastAPI / Uvicorn:高性能 HTTP 网络层。
* PyTorch / TensorFlow:驱动循环序列操作的深度学习引擎。
* ChromaDB:为低延迟索引优化的原生开源向量底层架构。
* Pandas / NumPy:内存矩阵处理和分析计算工具。
标签:AIOps, AV绕过, DLL 劫持, FastAPI, RAG, 凭据扫描, 大语言模型, 异常检测, 时间序列预测, 运维监控, 逆向工具