Siddhantx/autonomous-sre-agent

GitHub: Siddhantx/autonomous-sre-agent

一个采用双层架构(规则引擎+LLM)的自主 SRE Agent,在默认拒绝策略和审批工作流的严格安全门控下,自动诊断并修复新型生产故障。

Stars: 1 | Forks: 0

# 自主 SRE Agent (APOE) **测试结果** — 由评估工具在确定性规则无法覆盖的五个新故障上测得: | 配置 | 根因准确率 | 不安全操作 | |---|---|---| | 仅规则 | 0% — 将真实事件误判为健康或错误标记 | 0 | | + 脚本化 LLM ([RESULTS.md](agent-orchestrator/evals/RESULTS.md),架构上限 / CI 门禁) | 100% | 0 | | + qwen2.5:3b,最小的可用离线模型,8GB 笔记本,仅 CPU ([RESULTS-local-llm.md](agent-orchestrator/evals/RESULTS-local-llm.md)) | 27% (60% 正确上报) | 0 | 安全数据是关键:**在所有模式和所有模型中均无不安全操作** — 包括一个在每个诊断中都失败的、特意缩减参数的 1.5B 模型。弱 LLM 会降低诊断价值,但绝不会影响安全性。LLM 负责提议;默认拒绝策略和幂等引擎负责处理。更大的模型会将准确率向上限逼近 — 请使用您的提供商运行 `evals/run_evals.py --live` 来进行测量。 ``` observe (agents, 10s timeouts, graceful degradation) → reason (pure rule engine → LLM ReAct investigator on UNKNOWN/low confidence) → knowledge first (SQLite FTS5: code, topology, runbooks, past incidents) → plan (default-deny YAML policy · allow / deny / approval_required) → act (idempotent remediation · append-only audit · one OTel trace per incident) ``` ## 布局 | 目录 | 内容 | |---|---| | [`agent-orchestrator/`](agent-orchestrator/) | Agent:编排器、调查器、知识层、安全策略、审批 API、评估工具。**请从其 README 开始阅读。** | | [`enterprise-lab/`](enterprise-lab/) | 合成金融微服务实验室(postgres、redis、kafka、三个服务、nginx、OTel/Prometheus)+ 包含 8 个故障场景的混沌注入器 — 即测试目标。 | ## 快速开始 ``` # 离线验证 thesis —— 无需 Docker,无需 API key,约 10 秒 cd agent-orchestrator pip install -r requirements.txt python evals/run_evals.py --fake-llm # 完整的实时演示(Docker):参见 agent-orchestrator/DEMO.md —— 5 分钟 ``` 支持离线运行:通过任何 OpenAI 兼容端点(Ollama, vLLM)使用本地模型,知识层为本地 SQLite,完全不依赖任何 SaaS。有关威胁模型和各提供商的数据流出分析,请参阅 [`agent-orchestrator/SECURITY.md`](agent-orchestrator/SECURITY.md)。 ## 许可证 MIT — 详见 [LICENSE](LICENSE)。
标签:AIOps, AI风险缓解, DLL 劫持, 大语言模型, 安全策略, 提示词设计, 搜索引擎查询, 故障自愈, 根因分析, 测试用例, 用户代理, 自定义请求头, 请求拦截, 运维自动化, 逆向工具