Siddhantx/autonomous-sre-agent
GitHub: Siddhantx/autonomous-sre-agent
一个采用双层架构(规则引擎+LLM)的自主 SRE Agent,在默认拒绝策略和审批工作流的严格安全门控下,自动诊断并修复新型生产故障。
Stars: 1 | Forks: 0
# 自主 SRE Agent (APOE)
**测试结果** — 由评估工具在确定性规则无法覆盖的五个新故障上测得:
| 配置 | 根因准确率 | 不安全操作 |
|---|---|---|
| 仅规则 | 0% — 将真实事件误判为健康或错误标记 | 0 |
| + 脚本化 LLM ([RESULTS.md](agent-orchestrator/evals/RESULTS.md),架构上限 / CI 门禁) | 100% | 0 |
| + qwen2.5:3b,最小的可用离线模型,8GB 笔记本,仅 CPU ([RESULTS-local-llm.md](agent-orchestrator/evals/RESULTS-local-llm.md)) | 27% (60% 正确上报) | 0 |
安全数据是关键:**在所有模式和所有模型中均无不安全操作** — 包括一个在每个诊断中都失败的、特意缩减参数的 1.5B 模型。弱 LLM 会降低诊断价值,但绝不会影响安全性。LLM 负责提议;默认拒绝策略和幂等引擎负责处理。更大的模型会将准确率向上限逼近 — 请使用您的提供商运行 `evals/run_evals.py --live` 来进行测量。
```
observe (agents, 10s timeouts, graceful degradation)
→ reason (pure rule engine → LLM ReAct investigator on UNKNOWN/low confidence)
→ knowledge first (SQLite FTS5: code, topology, runbooks, past incidents)
→ plan (default-deny YAML policy · allow / deny / approval_required)
→ act (idempotent remediation · append-only audit · one OTel trace per incident)
```
## 布局
| 目录 | 内容 |
|---|---|
| [`agent-orchestrator/`](agent-orchestrator/) | Agent:编排器、调查器、知识层、安全策略、审批 API、评估工具。**请从其 README 开始阅读。** |
| [`enterprise-lab/`](enterprise-lab/) | 合成金融微服务实验室(postgres、redis、kafka、三个服务、nginx、OTel/Prometheus)+ 包含 8 个故障场景的混沌注入器 — 即测试目标。 |
## 快速开始
```
# 离线验证 thesis —— 无需 Docker,无需 API key,约 10 秒
cd agent-orchestrator
pip install -r requirements.txt
python evals/run_evals.py --fake-llm
# 完整的实时演示(Docker):参见 agent-orchestrator/DEMO.md —— 5 分钟
```
支持离线运行:通过任何 OpenAI 兼容端点(Ollama,
vLLM)使用本地模型,知识层为本地 SQLite,完全不依赖任何 SaaS。有关威胁模型和各提供商的数据流出分析,请参阅 [`agent-orchestrator/SECURITY.md`](agent-orchestrator/SECURITY.md)。
## 许可证
MIT — 详见 [LICENSE](LICENSE)。
标签:AIOps, AI风险缓解, DLL 劫持, 大语言模型, 安全策略, 提示词设计, 搜索引擎查询, 故障自愈, 根因分析, 测试用例, 用户代理, 自定义请求头, 请求拦截, 运维自动化, 逆向工具