emollick/benchbenchbench
GitHub: emollick/benchbenchbench
BenchBenchBench 是一个对基准测试生成评估器进行决策级留出审计的元评估框架,用于验证 AI 生成的基准测试得分能否有效区分模型的真实能力。
Stars: 0 | Forks: 0
# BenchBenchBench
BenchBenchBench 是一个针对基准测试生成评估器的基准测试。它探讨的问题是,针对 AI 生成的基准测试的公开得分,是否能够筛选出在得分未使用的证据上表现优异的作者。
本仓库是论文 **BenchBenchBench: Decision-Level Holdout Audits for Benchmark-Generation Evaluators** 的完整复现包。它包括 BenchBench-M 测试平台、BenchBenchBench 审计、冻结的模型提交、受控配置、结果包、论文源码、图表、最终 PDF 以及 arXiv 源码归档。
## 致谢
我们感谢 Rohit Krishnan 在 2026 年 5 月发表的文章 [介绍 BenchBench](https://www.strangeloopcanon.com/p/introducing-benchbench),该文章公开将基准测试的创建定义为一种模型能力,要求模型相互创建基准测试,并强调了创建者与解决者性能之间的区别。本仓库中的 BenchBench-M 和留出审计是独立的实现。
## 仓库内容
- `benchbench/`:四个确定性任务、公开评分代码、OpenRunner 运行器、测试,以及 7 月 23 日冻结的模型提交。
- `benchbenchbench/`:独立实现的留出故障、受控作者策略、元评估指标、测试,以及 7 月 24 日冻结的分析。
- `benchbenchbench/paper/`:可编辑的论文内容、LaTeX、参考文献、图表和 PDF 构建器。
- `artifacts/benchbenchbench-paper.pdf`:渲染后的六页论文。
- `artifacts/benchbenchbench-arxiv-source.zip`:可供上传的 arXiv 源码。
检入的结果包体积小且是经过精心设计的。生成的依赖文件夹、本地渲染文件、日志和环境文件已被排除。
## 环境要求
- Node.js 20 或更高版本。
- Python 3.10 或更高版本(用于重新构建 PDF)。
- 用于 PDF 构建器的 Pillow 12.3.0 和 ReportLab 5.0.0。
复现报告的分析不需要任何 API 密钥。仅在生成新的模型提交时才需要 `OPENROUTER_API_KEY`。
## 复现报告的结果
在仓库根目录下执行:
```
npm test
npm run reproduce
```
`npm run reproduce` 会运行两个测试套件,从冻结的模型提交中重新构建确定性的 BenchBenchBench 分析,并验证每个得分是否与 7 月 24 日检入的结果包相匹配。其临时输出将写入 `benchbenchbench/results/reproduction/` 并被 Git 忽略。
完整评估器的预期核心结果如下:
| 目标 | Spearman rho | 成对准确率 | Regret at 8 | 效用恢复率 |
|---|---:|---:|---:|---:|
| Composite | 0.945 | 90.8% | 0.93 | 98.9% |
| Hidden-only | 0.580 | 73.3% | 5.35 | 93.1% |
## 重新构建论文
安装指定的两个 Python 依赖项:
```
python -m pip install -r benchbenchbench/paper/requirements.txt
npm run paper
```
构建器会写入:
```
output/pdf/benchbenchbench-paper.pdf
output/pdf/benchbenchbench-arxiv-source/
```
论文也可以直接通过 `benchbenchbench/paper/main.tex` 中包含的 LaTeX 源码进行复现。
## 生成新的模型提交
此步骤是可选的,复现论文不需要此操作:
```
export OPENROUTER_API_KEY="your-key"
node benchbench/src/cli.mjs run \
--models openai/gpt-5.6-luna,anthropic/claude-sonnet-5 \
--tasks all \
--concurrency 2
```
在 PowerShell 中,使用以下命令设置环境变量:
```
$env:OPENROUTER_API_KEY = "your-key"
```
运行器会从进程环境中读取密钥,并且绝不会将其写入结果文件中。
## 协议状态
包含的 2026 年 7 月实验属于回顾性实验,未进行预注册。留出功能的实现独立于开发阶段的实现,且对可部署的评分规则不可见,但研究人员在研究开发过程中观察过留出行为。请将此产物视为一项可复现的合规性审计,而非来自研究者盲测留出的确证证据。
## 隐私和凭证审计
本发布版本包含合成任务数据和模型生成的基准测试用例;不包含任何人类受试者数据。在发布之前,已对精确追踪的文件集进行了凭证、私钥、token、电子邮件地址、个人姓名和本地用户路径的扫描。本地执行日志和构建缓存已被排除。冻结的 API 元数据包含模型响应标识符、时间戳、token 计数和成本,但不包含任何身份验证头或 API 密钥。
标签:DLL 劫持, MITM代理, 人工智能, 大语言模型, 审计工具, 杀软绕过, 模型评估, 用户模式Hook绕过, 自定义脚本, 逆向工具