3ch0p01nt/zgx-log-hunt-benchmark

GitHub: 3ch0p01nt/zgx-log-hunt-benchmark

该项目是一个在边缘 AI 工作站上对多款开源大模型进行网络安全日志威胁狩猎能力标准化评测的可复现基准测试框架。

Stars: 0 | Forks: 0

# ZGX Log-Hunt 基准测试 **在 HP ZGX Nano G1n(NVIDIA GB10,128 GB 统一内存)上对美国本土开源模型进行网络安全日志威胁狩猎的开放式评估。** 本仓库记录了一次可复现的对决测试:相同的案例包,相同的提示词,相同的评分标准,通过 Ollama 每次运行一个重量级模型。 | 字段 | 值 | |---|---| | **Pack** | `ZGX-LogHunt-v1.1` | | **Cases** | **28** 个标记的狩猎窗口 (TP / TN / traps) | | **Models** | 5 款美国背景的开源模型 (8B → 120B级) | | **Runtime** | ARM64 DGX Spark OS 上的 Ollama `0.32.0` | | **Scorer** | v2 (质量 / 安全性 / 运维 + bootstrap 置信区间) | | **Scored cells** | 5 × 28 = **140** | | **Generated** | 2026-07-30 | ## 核心发现 ### 最终排行榜(质量 — 不含延迟) | 排名 | 模型 | 质量 | 95% CI | IOC F1 | 技术 F1 | 证据 | 检测 | 秒/案例 | |:---:|---|---:|---|---:|---:|---:|---:|---:| | 1 | **Llama 4 Scout** | **0.723** | [0.679, 0.761] | 0.505 | 0.344 | 0.872 | **0.964** | 47.7 | | 2 | Llama 3.3 70B | 0.687 | [0.625, 0.739] | 0.415 | 0.275 | **0.898** | 0.929 | 125.8 | | 3 | Phi-4 Reasoning | 0.640 | [0.578, 0.693] | 0.449 | 0.327 | 0.738 | 0.857 | 335.8 | | 4 | Foundation-Sec-8B | 0.640 | [0.576, 0.700] | 0.262 | 0.345 | 0.884 | 0.821 | **23.9** | | 5 | gpt-oss 120B | 0.454 | [0.347, 0.572] | 0.280 | 0.306 | 0.492 | 0.500 | 78.6 | ### 场景选择(在哪里部署什么) | 场景 | 胜出者 | 得分 | 原因 | |---|---|---:|---| | **批量分拣**(快速过滤) | **Llama 4 Scout** | 0.831 | 质量+运维的最佳批量平衡;强大的检测能力 | | **深度调查** | **Llama 4 Scout** | 0.784 | 在此案例包中深度得分最高 | | **吞吐量 / 边缘设备** | **Foundation-Sec-8B** | Q≈0.64 @ **~24s** | 最佳的单位时间质量得分 (1.61);经过安全调优的 8B 模型 | | **注重安全性的大模型** | **Llama 3.3 70B** | 安全性 **0.955** | 幻觉压力最低;速度较慢 | | **仍需改进** | gpt-oss 120B | Q 0.45 | 格式/截断问题严重拖累了得分 | ### 帕累托最优(质量与速度) | 模型 | 质量 | 秒/案例 | **质量 / 分钟** | |---|---:|---:|---:| | Foundation-Sec-8B | 0.640 | 23.9 | **1.61** | | Llama 4 Scout | 0.723 | 47.7 | 0.91 | | gpt-oss 120B | 0.454 | 78.6 | 0.35 | | Llama 3.3 70B | 0.687 | 125.8 | 0.33 | | Phi-4 Reasoning | 0.640 | 335.8 | 0.11 | **本次运行建议的实际部署拓扑** 1. **Tier-0 过滤器:** 针对大流量部署 Foundation-Sec-8B(如果内存允许则部署 Scout) 2. **Tier-1 升级:** 针对中/高置信度队列部署 Llama 4 Scout 或 Llama 3.3 70B 3. **暂缓 / 重新提示:** 暂缓 gpt-oss 120B,直到其 schema 稳定性得到改善 4. **Phi-4 Reasoning:** 修复后具有竞争力的质量,但在当前测试框架下,对于批量狩猎循环而言**速度太慢且 CoT 遭遇截断** 完整表格:[`results/v2/report_v2.md`](results/v2/report_v2.md) · CSV:[`results/v2/model_summary.csv`](results/v2/model_summary.csv) ## 仓库地图 ``` zgx-log-hunt-benchmark/ ├── README.md ← you are here ├── docs/ │ ├── methodology.md ← design, metrics, scoring formulas │ ├── environment.md ← hardware / software snapshot │ ├── case-catalog.md ← all 28 cases at a glance │ └── limitations.md ← what this does NOT prove ├── datasets/zgx-loghunt-v1/ ← prompts + 28 cases + gold labels ├── harness/ ← run_eval, score_eval_v2, orchestration └── results/v2/ ← scorecards, CIs, failure taxonomy ``` ## 测试模型 | ID | 模型标签 (Ollama) | 厂商 | 类别 | 磁盘占用大小 | |---|---|---|---|---:| | M1 | `hf.co/fdtn-ai/Foundation-Sec-8B-Q8_0-GGUF:latest` | Cisco Foundation-Sec | 安全专家 | 8.5 GB | | M2 | `phi4-reasoning:latest` | Microsoft | 推理模型 | 11 GB | | M3 | `llama3.3:70b` | Meta | 通用大模型 | 42 GB | | M4 | `llama4:scout` | Meta | 长上下文 MoE | 67 GB | | M5 | `gpt-oss:120b` | gpt-oss | 通用超大模型 | 65 GB | 选择依据:**美国本土 / 美国背景的开源权重**,可通过 Ollama GGUF 运行在 **128 GB 统一内存**的 ZGX 上,涵盖 8B 专家模型 → 70B/Scout/120B 级别的前沿开源模型。 ## 我们测量了什么(有意义的指标) | 得分 | 含义 | |---|---| | **质量 (Q)** | IOC F1、父级 ATT&CK F1、证据支撑、判定/检测准确性、幻觉残留、查询命中/结构、schema 合规性 — **Q 得分中不包含延迟** | | **安全性 (S)** | 虚构 IOC/技术残留 + 在真阴性 / 陷阱案例中的冷静度 | | **运维 (O)** | JSON/schema/enum 成功率 + 延迟得分 | | **批量分拣** | `0.50·Q + 0.20·S + 0.30·O` | | **深度调查** | `0.70·Q + 0.25·S + 0.05·O` | | **CI95** | 基于案例的 bootstrap (1000 次重采样) | 详细说明和公式:[`docs/methodology.md`](docs/methodology.md) ## 数据集 (ZGX-LogHunt-v1.1) 28 个简短的多源日志窗口,包含黄金标准: - **真阳性:** 暴力破解、DNS 信标、编码脚本、VPN→横向移动、Web Shell、云异常、持久化、WMI、Kerberoast-like、LOLBAS certutil、供应链 npm、钓鱼→宏→C2、k8s 矿机、嘈杂的 Web Shell 等。 - **真阴性 / 冷静案例:** 繁忙的正常工作日、补丁窗口期、企业 SaaS - **陷阱:** 不完整的日志、时区偏差、仅防火墙导致的数据不足 每个案例包含: - `logs.txt` — 合成的 SOC 风格日志行(仅包含 RFC5737 / 文档 IP) - `gold.json` — 判定结论、IOCs、ATT&CK 技术 - `questions.json` / `meta.json` 目录:[`docs/case-catalog.md`](docs/case-catalog.md) ## 如何复现 ### 前置条件 - 具有足够 RAM/VRAM 的机器,以支持每次运行一个模型(本研究使用 **128 GB 统一内存**) - [Ollama](https://ollama.com) 并已拉取五个模型标签 - Python 3.10+ ### 运行 ``` # 1. 复制 pack + harness 到本地 export EVAL_ROOT=~/log-hunt-eval # or clone path # 2. 单个 model python3 harness/run_eval.py --model M1 --num-ctx 8192 --temperature 0.1 # 3. 评分 python3 harness/score_eval_v2.py # 写入 results/v2/report_v2.md 和 CSVs ``` 在 ZGX 上使用的编排脚本: - `harness/run_all.sh` — 依次运行 M1→M5 - `harness/run_extension.sh` — 新案例 + 格式修复阶段 + 评分 + 盲测案例包脚手架 **重要的测试框架细节** - API:Ollama `/api/generate`(在某些 GGUF 上存在聊天模板问题) - 每个模型的 `num_predict` 上限(推理模型获得更高的上限) - 当 schema 表现不佳时,可选执行**格式修复**第二轮处理 - 每次仅加载一个模型(模型之间执行 `ollama stop`) ## 观察到的主要失败模式 | 模型 | 主要问题(28 个案例中的计数) | |---|---| | Foundation-Sec-8B | 遗漏 IOC/技术(覆盖率),极少出现解析失败 | | Phi-4 Reasoning | **在所有 28 个案例上都很慢**;在 20 个案例上**遭遇截断**;当 CoT 耗尽预算时出现幻觉 IOC/技术 | | Llama 3.3 70B | 遗漏技术;极佳的安全性/证据支撑 | | Llama 4 Scout | 遗漏技术;除此之外在 v1.1 上总体表现最强 | | gpt-oss 120B | **解析/schema 失败 (13)**,**截断 (16)**,输出为空 | 详见 [`results/v2/failure_taxonomy.csv`](results/v2/failure_taxonomy.csv)。 ## 局限性(引用前必读) - 属于合成的简短场景,并非完整的企业 SIEM 存档数据 - 固定提示词 / temp 0.1 / 8k ctx — 未进行超参数搜索 - 通过 Ollama 运行的 GGUF ≠ 厂商 NVFP4/vLLM 的峰值性能 - 人工盲测评分包处于**脚手架阶段** (`build_blind_pack.py`);在声称达到人类一致性之前,请先填写得分 - Bootstrap 置信区间仍依赖于 **n=28**;重叠的置信区间 ⇒ 接近的排名应视为平局 完整注意事项:[`docs/limitations.md`](docs/limitations.md) ## 环境快照 | 项目 | 值 | |---|---| | 主机 | HP ZGX Nano G1n (`zgx-7ee1`) | | CPU/GPU | NVIDIA GB10 (Blackwell), ARM64 | | 内存 | 128 GB 统一内存 | | 操作系统 | DGX Spark / Ubuntu NVIDIA kernel `6.17.0-1026-nvidia` | | 推理 | Ollama 0.32.0 | 更多内容:[`docs/environment.md`](docs/environment.md) ## 引用 如果您使用了此案例包或相关数据: ``` ZGX Log-Hunt Benchmark (ZGX-LogHunt-v1.1), 2026. https://github.com/3ch0p01nt/zgx-log-hunt-benchmark ``` ## 许可证 - **代码 / 测试框架 / 文档:** MIT(详见 [`LICENSE`](LICENSE)) - **数据集:** 用于研究/评估的合成文档范围工件;不含生产环境客户数据 - **模型:** 受各自上游模型许可证的约束(Meta Llama、Microsoft、Cisco Foundation-Sec、gpt-oss 等) ## 致谢 评估设计借鉴了 CTI/SOC LLM 度量文献(如 CTIBench 风格的任务分解:IOC 提取、ATT&CK 映射、基础叙述)以及公开狩猎语料库模式(AIT-LDS / BOTS 风格的多源窗口)的理念——但本案例包本身是**原创合成内容**,并非对上述语料库的重新分发。
标签:AI风险缓解, DLL 劫持, 人工智能, 反取证, 大语言模型, 安全评估, 用户模式Hook绕过, 逆向工具