Shourya2812/HAI-SOC
GitHub: Shourya2812/HAI-SOC
HAI-SOC 是一个 AI 驱动的医疗安全运营平台,通过机器学习异常检测和生成式 AI 自动编排、分析和报告安全事件,替代传统基于规则的 SIEM 方案。
Stars: 0 | Forks: 0
# HAI-SOC — 医疗 AI 安全运营平台
一个专为医疗环境打造的 AI 驱动的安全运营中心平台。它摄取并规范化来自 EHR、医疗 IoT 设备、云服务、身份验证系统和网络基础设施的安全日志;使用无监督机器学习检测异常活动;通过检索增强生成(RAG)检索相关的网络安全和合规知识;并使用多代理 LLM 副驾驶生成可解释的、分析师可直接使用的 incident 报告、威胁评估和补救指南。
传统的 SIEM 工具依赖于基于规则的检测——误报率高、缺乏上下文理解,且需要大量手动调查。HAI-SOC 用 ML 驱动的异常评分以及一个有据可查的 GenAI 层取代了这一点,该层解释了事件*为何*重要,将其映射到 MITRE ATT&CK,评估 HIPAA 影响,并起草补救就绪的报告——而不仅仅是原始警报。
**状态:** 第一阶段 — 架构与规划
## 主要功能
1. **摄取** 来自 EHR 访问、IoT 遥测、VPN/auth 和云审计源的日志到通用 schema 中
2. **检测** 使用 Isolation Forest、Local Outlier Factor 和 Autoencoder 模型进行异常
3. **编排** 每个标记的 incident 通过一个并行运行的 LangGraph agent 图:
- MITRE ATT&CK 技术映射
- HIPAA/NIST 合规检索(在精选知识库上进行 RAG)
- 历史 incident 搜索
- Asset 上下文查找
4. **生成** 一份综合的 incident 报告——根本原因、受影响的 asset、风险等级、HIPAA 影响以及遏制/补救步骤——每一个声明都可追溯到检索到的来源
5. **提供服务** 通过基于角色的 dashboard 提供给 SOC 分析师、合规官员和管理员使用
## 架构
```
Log sources (EHR, IoT, auth, cloud, network)
│
▼
Ingestion pipeline (Wazuh → Kafka → parse/normalize/clean/feature-engineer → MongoDB)
│
▼
ML anomaly detection (Isolation Forest / LOF / Autoencoder → score, risk, confidence, severity)
│
▼
Alert orchestrator (LangGraph) ── fans out to ──┬── MITRE ATT&CK mapping
├── Compliance retrieval (RAG / Qdrant)
├── Historical incident search
└── Asset context
│
▼
Report generator (synthesizes agent outputs into one grounded incident report)
│
▼
Backend API (FastAPI) → Frontend dashboard (React + TypeScript + Tailwind)
```
完整细节——模块职责、数据流叙述、非功能性需求和决策日志——位于 [`docs/ARCHITECTURE.md`](docs/ARCHITECTURE.md) 中。
## 技术栈
| 层级 | 技术 |
|---|---|
| Backend | Python, FastAPI |
| ML | Scikit-learn, PyOD, XGBoost |
| GenAI 编排 | LangChain, LangGraph |
| Embeddings / Vector DB | Sentence Transformers, Qdrant |
| 数据库 | MongoDB |
| Cache | Redis |
| Message queue | Apache Kafka |
| Frontend | React, TypeScript, Tailwind CSS, Chart.js |
| 基础设施 | Docker, Kubernetes, Helm |
| Cloud | AWS (EKS, RDS, S3, ECR, IAM, CloudWatch) |
| 监控 | Prometheus, Grafana |
| CI/CD | GitHub Actions |
## 仓库结构
```
HAI-SOC/
├── backend/ # FastAPI app: api/, auth/, services/, models/, database/
├── frontend/ # React + TypeScript dashboard
├── ml/ # preprocessing/, training/, inference/, evaluation/
├── rag/ # ingestion/, embeddings/, retrieval/, prompts/
├── datasets/ # normalized/simulated healthcare security logs
├── knowledge_base/ # HIPAA, NIST, MITRE ATT&CK, runbooks (source docs for RAG)
├── deployment/ # docker/, kubernetes/, helm/
├── monitoring/ # Prometheus + Grafana configs
├── docs/ # ARCHITECTURE.md and other write-ups
├── tests/
└── .github/workflows/ # CI/CD pipelines
```
## 路线图
- [ ] **第一阶段** — 架构与规划
- [ ] **第二阶段** — 医疗安全数据集
- [ ] **第三阶段** — 数据工程 pipeline
- [ ] **第四阶段** — ML 异常检测
- [ ] **第五阶段** — RAG 知识库
- [ ] **第六阶段** — 生成式 AI SOC 副驾驶
- [ ] **第七阶段** — Backend API
- [ ] **第八阶段** — Frontend dashboard
- [ ] **第九阶段** — 身份验证与 RBAC
- [ ] **第十阶段** — Docker 化
- [ ] **第十一阶段** — Kubernetes 部署
- [ ] **第十二阶段** — AWS 部署
- [ ] **第十三阶段** — 监控
- [ ] **第十四阶段** — CI/CD
- [ ] **第十五阶段** — 文档与研究撰写
## 新手入门
## 数据与合规说明
本项目仅使用模拟或公开的安全日志数据集——在任何阶段都不会收集、存储或处理真实的 PHI。
标签:DLL 劫持, 医疗信息安全, 大语言模型, 子域名突变, 安全运营中心, 异常检测, 搜索引擎查询, 检索增强生成, 漏洞利用检测, 网络映射, 自定义请求头, 请求拦截, 软件成分分析, 逆向工具