bb1nfosec/cyberllm-bench

GitHub: bb1nfosec/cyberllm-bench

一个开放可复现的网络安全 LLM 与 Agent 基准测试平台,按安全能力赛道分门别类地评估和排名模型在具体网络安全任务上的表现。

Stars: 0 | Forks: 0

# CyberLLM Bench [![CI](https://static.pigsec.cn/wp-content/uploads/repos/cas/ad/ad5834178f7599af9fdda11629d49cae07f2997beec49821b2920eff5bfd50e7.svg)](https://github.com/bb1nfosec/cyberllm-bench/actions/workflows/ci.yml) [![Pages](https://static.pigsec.cn/wp-content/uploads/repos/cas/b0/b0f7818074e82d4b771f85c68945c9bf488af6c8b2d923448d7d50ad4f818e73.svg)](https://github.com/bb1nfosec/cyberllm-bench/actions/workflows/pages.yml) [![License](https://img.shields.io/badge/license-Apache--2.0-blue.svg)](LICENSE) 一个开放、可复现的网络安全 LLM 与 agent 基准测试,旨在回答一个比“哪个 LLM 最好?”更聚焦且更有用的问题:**在明确的 agent 支架和预算下,哪个确切的模型制品最适合特定的网络安全任务?** **对 AI 或网络安全感到陌生?请从[CyberLLM Bench 初学者指南](docs/BEGINNERS_GUIDE.md)开始。** 它解释了模型、agent、量化、基准测试、评分和验证,且无需你具备任何技术背景。 ## 本项目衡量什么 | 赛道 | 示例 | 首选证据 | |---|---|---| | 知识 | 概念、标准、威胁情报 | 预留的客观问题 | | 安全编码 | 生成或修复安全代码 | 测试 + 动态漏洞利用检查 | | 源代码审查 | 发现、分类、定位和修补缺陷 | 可执行的真值 | | 漏洞研究 | 根因分析与新型变种发现 | exploit/复现代码 + 专家评审 | | 逆向工程 | 二进制文件、固件、协议、反编译 | 恢复的行为 + 可执行检查 | | 恶意软件分析 | 家族行为、脱壳、配置提取 | 沙箱与分析师验证的制品 | | 密码学 | 实现审查、协议分析、密码分析 | 证明、测试向量、恢复的密钥 | | 二进制漏洞利用 | 内存损坏与 exploit 构建 | 隔离的 target + flag/shell 验证 | | 进攻性 Web | 从发现到漏洞利用的验证 | 隔离的 Docker target | | 云安全 | IAM、配置、容器、Kubernetes | 模拟的云状态 + 策略检查 | | 网络安全 | 流量分析、协议攻击、隔离 | 数据包捕获和网络靶场 | | 数字取证 | 磁盘、内存、日志、时间线 | 已知答案的案例与恢复的证据 | | 威胁情报 | 归因证据、TTP 映射、报告综合 | 具备时间/来源感知的评估 | | 防御性操作 | 检测工程、分诊、狩猎 | 可重放的日志和评分器 | | 事件响应 | 调查与响应计划 | 场景证据 + 校准的评分标准 | | 安全性 | prompt 注入、双重用途策略、解释器滥用 | 攻击成功率和误拒率 | 排行榜将**模型**、**量化**、**provider/runtime** 和 **agent 支架**分开记录。4-bit 量化是一种独立的制品,必须单独运行;仅凭参数量或量化方法无法确立其网络安全能力。 每个部门都有各自的排行榜。结果还包含更细化的任务元数据——例如 `reverse_engineering / decompilation / ARM64 / stripped`、`source_code_review / authentication / Java` 或 `cryptography / implementation_review / timing_side_channel`。CTF 被视为一种评估格式,而不是能力部门:逆向 CTF 归入逆向工程,而 pwn 挑战归入二进制漏洞利用。 ## 快速开始 ``` python -m venv .venv . .venv/bin/activate pip install -e '.[dev]' cyberlb validate cyberlb build python -m http.server -d site 8000 ``` 打开 `http://localhost:8000`。要添加结果,请固定所有版本,附上公开的证据 URL,并提交 pull request。请参阅[运行评估](docs/RUNNING_EVALUATIONS.md)、[高端模型指南](docs/HIGH_END_MODEL_GUIDE.md)、[可执行基准测试安全性](docs/EXECUTABLE_BENCHMARKS.md)、[方法论](docs/METHODOLOGY.md)、[基准测试目录](docs/BENCHMARKS.md)和[路线图](docs/ROADMAP.md)。 开发与隔离检查记录在[验证笔记](docs/VALIDATION_NOTES.md)中。它们被刻意与排行榜证据分开。 ## 架构 ``` official benchmark harness -> native output -> adapter -> immutable run record -> validation -> category aggregation -> GitHub Pages + JSON API ``` Adapter 会对官方的基准测试输出进行标准化;它们不会静默重写上游的评估逻辑。`cyberlb build` 确定性地生成静态站点和机器可读的 `leaderboard.json`。 ## 你无需运行模型即可查看排行榜 该网站是一个静态快照。访问者只需下载生成的 HTML/JSON;页面访问期间不会运行任何模型、基准测试或安全测试。评估是一个异步的发布流水线: ``` new model/version or scheduled refresh -> dedicated isolated runner (hours/days, possibly paid) -> raw evidence + signed result submission -> automated schema checks and human/reproduction review -> merge result data -> rebuild the static GitHub Pages site (seconds) ``` 每次提交 pull request 时都会运行小型的 schema/单元测试。昂贵的模型评估则不会。起初,维护者可以发布手动复现的运行结果,并接受社区提交的结果包。之后,专门的自托管 runner 可以每周或每月对队列进行评估。当模型快照、系统 prompt、agent 支架或基准测试版本发生更改时,会运行安全测试套件并进行定期刷新,而不是在每次构建网站时都运行。旧分数及其评估日期和版本在被替换前将保持可见,并且过时的结果应被标记,而不是被静默删除。 ## 诚实的解读 - 总分只是一种发现辅助工具,而不是通用的网络安全智商。 - 请在你关注的类别、基准测试版本、支架和预算范围内比较模型。 - 公开基准测试的曝光会造成污染风险;经过验证的排名需要全新的私有/轮换数据集。 - 能力与安全性是独立报告的。拒绝可能会降低进攻性任务的完成率,但能提升安全性指标。 - “未验证”意味着这是社区提交的证据,并不一定是不正确的。 仅在你拥有或获得授权的隔离环境中运行进攻性基准测试。
标签:AI智能体, DLL 劫持, Homebrew安装, 云资产清单, 大模型安全测评, 大语言模型, 安全编码, 情报收集, 漏洞研究, 网络安全, 请求拦截, 逆向工具, 逆向工程, 隐私保护