123superhanan/metrics-monitor

GitHub: 123superhanan/metrics-monitor

结合时序深度学习异常预测与 RAG 检索增强生成的基础设施监控平台,能在预测到性能下降时自动从 Runbook 知识库中检索并生成可执行的恢复方案。

Stars: 0 | Forks: 0

## 指标监控 ## 一款智能的生产事故助手,结合了时间序列深度学习(LSTM 和 GRU)进行异常预测,并利用检索增强生成(RAG)将系统遥测数据直接映射到可操作的恢复 runbook。 该平台持续评估流式传输的基础设施指标,预测即将发生的服务性能下降,并提供工程师在严重事故期间所需的精确修复程序。 ## 项目结构 ``` metrics-monitor/ ├── data/ │ ├── raw/ # Synthetic and historic metrics (.csv) │ └── runbooks/ # System recovery documentation (.md) ├── notebooks/ # Exploratory data analysis ├── saved_models/ # Trained LSTM/GRU model artifacts ├── chroma_db/ # Local vector database for runbooks ├── src/ │ ├── api/ # FastAPI endpoints (predict, analyze, explain) │ ├── data/ # Data generation, preprocessing, and encoding │ ├── evaluation/ # Validation metrics and charting scripts │ ├── models/ # Model architectures and training loops │ └── rag/ # Document ingestion, embedding, and vector storage └── static/ # Vanilla HTML5/CSS3/JS dashboard frontend ``` ## 技术架构与核心流水线## 1. 预测性遥测流水线 遥测引擎从多维跟踪流(CPU 利用率、内存使用量、请求持续时间、错误百分比)中提取模式,以便在阈值突破发生之前进行预测。 * 摄取:原始遥测流通过 preprocess.py 传递,以清理异常情况并对齐时间索引。 * 窗口化:encode.py 将连续的行切分为滑动的重叠时间块(例如,观察过去 60 分钟以预测接下来的 15 分钟)。 * 建模:lstm_model.py 或 gru_model.py 对历史状态转换进行加权,以计算即将到来的系统向量。 ## 2. 上下文感知 Runbook RAG 流水线 当预测或标记异常时,平台将定量警报与定性的工程知识领域连接起来。 * 向量摄取:ingest.py 通过 loader.py 读取 Markdown 文档文件,通过 chunker.py 将它们拆分为逻辑步骤,并将它们索引到 chroma_db/ 中。 * 动态搜索:当 API 记录到关键指标变化时,vector_store.py 会使用异常的文本指纹运行语义相似度匹配。 * Prompt 组装:prompt_maker.py 将最匹配的操作运行步骤直接注入到 LLM 的指令 payload 中,从而生成即时的修复方案。 ## 3. API 与监控 UI 层 * FastAPI 服务:通过 src/api/ 提供非阻塞异步路由,以同时处理重叠的可视化流和文本生成调用。 * Dashboard 前端:一个使用原生 HTML/JS 编写的原生 Web 控制台,用于轮询系统更改、流式传输实时预测图表,并展示交互式的 AI 生成的分诊检查清单。 ## 技术需求规范 该系统使用标准的开源库作为其运行数据栈: * FastAPI / Uvicorn:高性能 HTTP 网络层。 * PyTorch / TensorFlow:驱动循环序列操作的深度学习引擎。 * ChromaDB:为低延迟索引优化的原生开源向量底层架构。 * Pandas / NumPy:内存矩阵处理和分析计算工具。
标签:AIOps, AV绕过, DLL 劫持, FastAPI, RAG, 凭据扫描, 大语言模型, 异常检测, 时间序列预测, 运维监控, 逆向工具