Shourya2812/HAI-SOC

GitHub: Shourya2812/HAI-SOC

HAI-SOC 是一个 AI 驱动的医疗安全运营平台,通过机器学习异常检测和生成式 AI 自动编排、分析和报告安全事件,替代传统基于规则的 SIEM 方案。

Stars: 0 | Forks: 0

# HAI-SOC — 医疗 AI 安全运营平台 一个专为医疗环境打造的 AI 驱动的安全运营中心平台。它摄取并规范化来自 EHR、医疗 IoT 设备、云服务、身份验证系统和网络基础设施的安全日志;使用无监督机器学习检测异常活动;通过检索增强生成(RAG)检索相关的网络安全和合规知识;并使用多代理 LLM 副驾驶生成可解释的、分析师可直接使用的 incident 报告、威胁评估和补救指南。 传统的 SIEM 工具依赖于基于规则的检测——误报率高、缺乏上下文理解,且需要大量手动调查。HAI-SOC 用 ML 驱动的异常评分以及一个有据可查的 GenAI 层取代了这一点,该层解释了事件*为何*重要,将其映射到 MITRE ATT&CK,评估 HIPAA 影响,并起草补救就绪的报告——而不仅仅是原始警报。 **状态:** 第一阶段 — 架构与规划 ## 主要功能 1. **摄取** 来自 EHR 访问、IoT 遥测、VPN/auth 和云审计源的日志到通用 schema 中 2. **检测** 使用 Isolation Forest、Local Outlier Factor 和 Autoencoder 模型进行异常 3. **编排** 每个标记的 incident 通过一个并行运行的 LangGraph agent 图: - MITRE ATT&CK 技术映射 - HIPAA/NIST 合规检索(在精选知识库上进行 RAG) - 历史 incident 搜索 - Asset 上下文查找 4. **生成** 一份综合的 incident 报告——根本原因、受影响的 asset、风险等级、HIPAA 影响以及遏制/补救步骤——每一个声明都可追溯到检索到的来源 5. **提供服务** 通过基于角色的 dashboard 提供给 SOC 分析师、合规官员和管理员使用 ## 架构 ``` Log sources (EHR, IoT, auth, cloud, network) │ ▼ Ingestion pipeline (Wazuh → Kafka → parse/normalize/clean/feature-engineer → MongoDB) │ ▼ ML anomaly detection (Isolation Forest / LOF / Autoencoder → score, risk, confidence, severity) │ ▼ Alert orchestrator (LangGraph) ── fans out to ──┬── MITRE ATT&CK mapping ├── Compliance retrieval (RAG / Qdrant) ├── Historical incident search └── Asset context │ ▼ Report generator (synthesizes agent outputs into one grounded incident report) │ ▼ Backend API (FastAPI) → Frontend dashboard (React + TypeScript + Tailwind) ``` 完整细节——模块职责、数据流叙述、非功能性需求和决策日志——位于 [`docs/ARCHITECTURE.md`](docs/ARCHITECTURE.md) 中。 ## 技术栈 | 层级 | 技术 | |---|---| | Backend | Python, FastAPI | | ML | Scikit-learn, PyOD, XGBoost | | GenAI 编排 | LangChain, LangGraph | | Embeddings / Vector DB | Sentence Transformers, Qdrant | | 数据库 | MongoDB | | Cache | Redis | | Message queue | Apache Kafka | | Frontend | React, TypeScript, Tailwind CSS, Chart.js | | 基础设施 | Docker, Kubernetes, Helm | | Cloud | AWS (EKS, RDS, S3, ECR, IAM, CloudWatch) | | 监控 | Prometheus, Grafana | | CI/CD | GitHub Actions | ## 仓库结构 ``` HAI-SOC/ ├── backend/ # FastAPI app: api/, auth/, services/, models/, database/ ├── frontend/ # React + TypeScript dashboard ├── ml/ # preprocessing/, training/, inference/, evaluation/ ├── rag/ # ingestion/, embeddings/, retrieval/, prompts/ ├── datasets/ # normalized/simulated healthcare security logs ├── knowledge_base/ # HIPAA, NIST, MITRE ATT&CK, runbooks (source docs for RAG) ├── deployment/ # docker/, kubernetes/, helm/ ├── monitoring/ # Prometheus + Grafana configs ├── docs/ # ARCHITECTURE.md and other write-ups ├── tests/ └── .github/workflows/ # CI/CD pipelines ``` ## 路线图 - [ ] **第一阶段** — 架构与规划 - [ ] **第二阶段** — 医疗安全数据集 - [ ] **第三阶段** — 数据工程 pipeline - [ ] **第四阶段** — ML 异常检测 - [ ] **第五阶段** — RAG 知识库 - [ ] **第六阶段** — 生成式 AI SOC 副驾驶 - [ ] **第七阶段** — Backend API - [ ] **第八阶段** — Frontend dashboard - [ ] **第九阶段** — 身份验证与 RBAC - [ ] **第十阶段** — Docker 化 - [ ] **第十一阶段** — Kubernetes 部署 - [ ] **第十二阶段** — AWS 部署 - [ ] **第十三阶段** — 监控 - [ ] **第十四阶段** — CI/CD - [ ] **第十五阶段** — 文档与研究撰写 ## 新手入门 ## 数据与合规说明 本项目仅使用模拟或公开的安全日志数据集——在任何阶段都不会收集、存储或处理真实的 PHI。
标签:DLL 劫持, 医疗信息安全, 大语言模型, 子域名突变, 安全运营中心, 异常检测, 搜索引擎查询, 检索增强生成, 漏洞利用检测, 网络映射, 自定义请求头, 请求拦截, 软件成分分析, 逆向工具