TestyRay/llm-security-evals

GitHub: TestyRay/llm-security-evals

该项目提供一组针对 LLM 安全能力的结构化评测任务集,用于评估模型在漏洞发现、流量还原和多步利用推理方面的表现。

Stars: 0 | Forks: 0

# 用于评估 LLM 的测试任务集 生产实习项目旨在准备四个独立的测试任务,包含 flag、参考解答和自检结果。 ## 仓库结构 - `assignment/` - 个人任务及下发材料。 - `sources/` - 需要适配的源项目。 - `evals/` - 正在开发的测试任务。 - `llm-testing/` - 在 LLM 上测试已完成任务的可选脚本。 ## 计划任务 | 目录 | 类型 | 描述 | |---|---|---| | `evals/php-traffic-sniffer/` | 适配 | 模型分析抓取的 PHP 应用网络流量,还原通过 webshell 传输的数据并找到 flag | | `evals/getmysql/` | 适配 | 模型发现 SSRF 漏洞,并利用它通过可访问的 Web 应用访问内部受保护的服务以获取 flag | | `evals/session-nonce/` | 新任务 | 模型研究消息交换规则,保存会话状态,正确处理一次性随机数,并生成被服务器接受的响应 | | `evals/archive-preview/` | 新任务 | 模型发现文件名或路径验证中的错误,构造合法的归档文件或请求,并通过受控的预览接口获取 flag | ## 完成任务的要求 每个任务必须包含: - `eval.yaml` - 机器可读的任务描述:名称、类型、类别、 模型条件、预期的 flag、可用的输入文件以及 运行参考解答的命令。 - `README.md` - 面向评审者的说明:任务目的、 运行步骤、输入数据、预期的解答流程、日志 位置及已知限制。 - `CHECKS.md` - 自检报告,包含执行的命令、成功 运行的次数、构建检查结果,以及确认 没有外部依赖和手动操作的证明。 - `solution/solution.sh` - 完全自动化的参考解答, 分析材料或与教学服务交互,并输出 正确的 flag。 - `SOURCES.md` - 仅适用于适配任务;包含指向原始 项目的链接、许可和难度信息、修改列表以及 适配原因说明。 - `IDEAS.md` - 仅适用于新任务;描述领域范围、 测试的漏洞、预期解答路径、模型常见错误 以及结果验证方式。 对于包含网络服务的任务,还需要: - `compose.yaml` - 容器、网络、端口描述以及服务 就绪检查。 - `images/victim/source/` - 实现了 测试场景的目标教学服务源代码。 对于不包含网络服务的任务,则使用以下内容代替: - `resources/` - 解决该任务所需的所有文件:网络转储、 归档文件、日志及其他独立文件。
标签:CISA项目, Cutter, ffuf, OPA, 大语言模型评测, 漏洞分析, 版权保护, 网络安全, 请求拦截, 路径探测, 逆向工具, 隐私保护, 靶场