0xpsilocyber/LLM-IR-Stress-Research

GitHub: 0xpsilocyber/LLM-IR-Stress-Research

SANS 研究论文配套数据集,用于评估免费层 LLM 在网络威胁情报事件响应中作为认知辅助工具的效果,将 LLM 生成的安全建议与人类分析师基准进行系统性比较。

Stars: 0 | Forks: 0

# LLM-IR-Stress 研究 用于研究基准测试的数据集,旨在评估免费层大型语言模型作为事件响应认知辅助工具的效果,将 LLM 生成的安全建议与人类分析师的基准进行比较。 SANS 技术学院研究论文的配套数据: ## 方法论摘要 人类分析师(匿名化为代码标识符 A1、A2、C1、G1、J1)和免费层 LLM(ChatGPT、Claude、Gemini)分别获得了威胁情报报告,并被要求在时间限制下提供安全建议。对响应时间进行了计时,使用定性代码簿进行了编码,并跨控制类别主题进行了比较。 用作刺激物的报告: 1. **报告 1 — LiteLLM:** AI 网关供应链入侵 2. **报告 2 — Bissa** 3. **报告 3 — Beyond** ## 仓库布局 | 路径 | 内容 | | --- | --- | | `data/llm_threat_intelligence_experim.csv` | 主要结果:级别、报告、来源、响应时间、建议 1–5 | | `data/codebook.csv` | 每项建议的定性编码(代码、主题、理由) | | `data/code_defs.csv` | 代码定义(DET-A, DET-B, SUPVM, IAM, NET, GOV, OPS, END) | | `data/visualization.csv` | 用于图表的汇总计数和时间统计 | | `data/baseline_gold_standard.csv` | 人类基准黄金标准参考 | | `data/ai_results.csv` | 仅限 LLM 的结果子集 | | `raw/` | 原始电子表格导出(.xlsx,保留所有工作表) | ## 匿名化 所有分析师姓名均已替换为代码标识符(A1、A2、C1、G1、J1)。此数据集中不包含任何 PII。 ## 许可证 本数据集基于 [CC BY 4.0](LICENSE) 协议发布。如果您使用了此数据,请引用相关的 SANS 研究论文(引用如上)。请注意,论文本身的版权归 SANS 所有;此许可证仅涵盖数据集。
标签:DLL 劫持, 人工智能评估, 代码示例, 大语言模型, 库, 应急响应, 数据分析, 研究数据集, 网络安全, 逆向工具, 隐私保护