inayatarshad/Aegis

GitHub: inayatarshad/Aegis

AEGIS 是一个基于图的多智能体AI原型,通过分类、推理、证据融合与人工审核的完整流水线,探索在不确定性条件下处理模拟无人机遥测数据的智能体工作流架构。

Stars: 1 | Forks: 0

# AEGIS **一个具备不确定性感知能力的智能体工作流,用于模拟无人机遥测分析。** AEGIS 是一个项目合集与研究原型,旨在探索基于图的 AI 系统如何将分类、局部解释、策略检索、 地理背景、证据融合、报告生成以及人工审核结合起来。 它完全基于合成数据运行。它不是武器系统、 操作型 ISR 产品,也不是经过验证的安全系统。 ## 本项目为何存在 大多数智能体演示仅停留在聊天界面。AEGIS 专注于更复杂的工程 问题: - 不确定的模型输出应如何路由? - 每一条建议是否都能追溯到具体的模型、背景或检索到的证据? - 系统是否能区分建议与经人工批准的行动? - 解释是否忠实于所使用的模型? - 评估声明是否可以从代码库中复现? ## 已实现的工作流 ``` telemetry │ ▼ ingestion ──► classification ──► local attribution ──► doctrine retrieval │ ▼ context reasoning ──► evidence fusion ──► review gate (conditional) │ ▼ report ──► escalation recommendation ``` LangGraph 路由是有条件的:发生冲突、低置信度或降级的 运行将经过人工审核节点。处于待审核状态时,系统将无法 声称警报已发送。 ### 组件 - **分类器:** 基于九个遥测特征和 MiniLM 句子嵌入的梯度提升模型,采用 sigmoid 概率校准。 - **解释:** 留一特征局部归因。每个值表示在将某一输入替换为 已记录的中性参考值后,预测类别概率的变化。系统不会将备用值标记为 SHAP。 - **检索:** 基于八段合成策略摘录的 ChromaDB 语义搜索, 包含相关性质量重试机制。 - **背景:** 确定性的禁飞区和走廊计算。 - **融合:** 结合模型和地理风险,同时将检索 相关性视为证据质量——而非威胁证据。 - **报告:** 在已配置的情况下使用基于 Groq 的结构化生成;否则 立即生成清晰标记的确定性纯证据报告。 - **审核:** 针对不确定性、冲突或执行降级的显式 `PENDING` 状态。 - **可观测性:** 每个 API 结果中均包含各节点耗时与状态。 ## 快速开始 推荐使用 Python 3.11。 ``` cd AEGIS python -m venv .venv # Windows: .venv\Scripts\activate # macOS/Linux: source .venv/bin/activate pip install -r requirements-dev.txt python data/simulated/generate_telemetry.py uvicorn api.main:app --reload ``` 在另一个终端中: ``` cd AEGIS streamlit run dashboard/app.py ``` 打开: - Dashboard: http://localhost:8501 - OpenAPI: http://localhost:8000/docs - 就绪状态: http://localhost:8000/health LLM key 是可选的。如果未提供 `GROQ_API_KEY`,报告节点将使用 确定性备用方案,且不会发起网络请求。 ### Docker ``` cd AEGIS docker compose up --build ``` Dashboard 使用 `AEGIS_API_BASE`;Compose 将其配置为 通过内部网络访问 API 服务。 ## 评估 运行可审计的合成 benchmark: ``` cd AEGIS python evaluation/evaluate.py ``` 这将写入 `evaluation/results.json` 并报告: - 各类别的 precision、recall 和 F1 - 混淆矩阵 - 预期校准误差 - p50 和 p95 分类器延迟 - 分别针对类似生成器的演示集以及一个包含重叠信号和未见语言的小型压力测试集的 独立结果 这些限制是输出的一部分。特别需要指出的是,演示数据与 训练生成器相似,绝不能将其视为独立的验证。 ## 测试与质量 ``` pytest -q --cov=. ruff check . ``` 测试涵盖单个智能体、图路由、可观测性、确定性 回退行为、审核安全性、健康就绪状态和 API 验证。GitHub Actions 会在每次推送和拉取请求时运行生成、linting 和测试。 ## API 示例 ``` curl -X POST http://localhost:8000/analyze \ -H "Content-Type: application/json" \ --data @data/simulated/example_request.json ``` 响应包含分类、概率归因、检索到的 策略参考、背景与融合得分、审核状态、建议、 节点耗时、pipeline 版本以及任何组件降级错误。 ## 代码库结构 ``` AEGIS/ ├── agents/ # workflow nodes ├── api/ # FastAPI schemas and routes ├── core/ # state, configuration, LangGraph orchestration ├── dashboard/ # Streamlit operator UI ├── data/simulated/ # generator and synthetic scenarios ├── evaluation/ # reproducible benchmark ├── models/ # training and model loading ├── tests/ # unit, integration, and API tests ├── Dockerfile └── docker-compose.yml ``` ## 已知限制 - 所有遥测和策略文档均为合成数据。 - 无图像或视频输入。 - 分类器未在操作数据上进行验证。 - 压力 benchmark 有意设定为较小规模。 - 策略检索仅为演示语料库,并非权威来源。 - 外部 LLM 报告路径仍需进行更广泛的忠实度评估。 - 审核以工作流状态表示;操作员身份和持久化 审批存储将是未来的工作。 - 身份验证、速率限制、持久化审计存储和生产环境 部署加固尚未实现。 ## 路线图 1. 采用时间轨迹建模,而非单一的遥测数据包。 2. 预留的生成器系列和对抗性分布偏移测试。 3. 用于校准不确定性的保形预测或弃权机制。 4. 持久化的 LangGraph 检查点和经过身份验证的审核决策。 5. 针对检索到的证据进行引用级别的报告验证。 6. 可选的图像轨迹融合,并配备单独评估的视觉模型。 ## 许可证 [MIT](LICENSE)
标签:DLL 劫持, HTTP/HTTPS抓包, ISR监控, Kubernetes, LangGraph, PyRIT, 人工智能, 多智能体系统, 大语言模型, 态势感知, 无人机, 用户模式Hook绕过, 请求拦截, 逆向工具