emollick/benchbenchbench

GitHub: emollick/benchbenchbench

BenchBenchBench 是一个对基准测试生成评估器进行决策级留出审计的元评估框架,用于验证 AI 生成的基准测试得分能否有效区分模型的真实能力。

Stars: 0 | Forks: 0

# BenchBenchBench BenchBenchBench 是一个针对基准测试生成评估器的基准测试。它探讨的问题是,针对 AI 生成的基准测试的公开得分,是否能够筛选出在得分未使用的证据上表现优异的作者。 本仓库是论文 **BenchBenchBench: Decision-Level Holdout Audits for Benchmark-Generation Evaluators** 的完整复现包。它包括 BenchBench-M 测试平台、BenchBenchBench 审计、冻结的模型提交、受控配置、结果包、论文源码、图表、最终 PDF 以及 arXiv 源码归档。 ## 致谢 我们感谢 Rohit Krishnan 在 2026 年 5 月发表的文章 [介绍 BenchBench](https://www.strangeloopcanon.com/p/introducing-benchbench),该文章公开将基准测试的创建定义为一种模型能力,要求模型相互创建基准测试,并强调了创建者与解决者性能之间的区别。本仓库中的 BenchBench-M 和留出审计是独立的实现。 ## 仓库内容 - `benchbench/`:四个确定性任务、公开评分代码、OpenRunner 运行器、测试,以及 7 月 23 日冻结的模型提交。 - `benchbenchbench/`:独立实现的留出故障、受控作者策略、元评估指标、测试,以及 7 月 24 日冻结的分析。 - `benchbenchbench/paper/`:可编辑的论文内容、LaTeX、参考文献、图表和 PDF 构建器。 - `artifacts/benchbenchbench-paper.pdf`:渲染后的六页论文。 - `artifacts/benchbenchbench-arxiv-source.zip`:可供上传的 arXiv 源码。 检入的结果包体积小且是经过精心设计的。生成的依赖文件夹、本地渲染文件、日志和环境文件已被排除。 ## 环境要求 - Node.js 20 或更高版本。 - Python 3.10 或更高版本(用于重新构建 PDF)。 - 用于 PDF 构建器的 Pillow 12.3.0 和 ReportLab 5.0.0。 复现报告的分析不需要任何 API 密钥。仅在生成新的模型提交时才需要 `OPENROUTER_API_KEY`。 ## 复现报告的结果 在仓库根目录下执行: ``` npm test npm run reproduce ``` `npm run reproduce` 会运行两个测试套件,从冻结的模型提交中重新构建确定性的 BenchBenchBench 分析,并验证每个得分是否与 7 月 24 日检入的结果包相匹配。其临时输出将写入 `benchbenchbench/results/reproduction/` 并被 Git 忽略。 完整评估器的预期核心结果如下: | 目标 | Spearman rho | 成对准确率 | Regret at 8 | 效用恢复率 | |---|---:|---:|---:|---:| | Composite | 0.945 | 90.8% | 0.93 | 98.9% | | Hidden-only | 0.580 | 73.3% | 5.35 | 93.1% | ## 重新构建论文 安装指定的两个 Python 依赖项: ``` python -m pip install -r benchbenchbench/paper/requirements.txt npm run paper ``` 构建器会写入: ``` output/pdf/benchbenchbench-paper.pdf output/pdf/benchbenchbench-arxiv-source/ ``` 论文也可以直接通过 `benchbenchbench/paper/main.tex` 中包含的 LaTeX 源码进行复现。 ## 生成新的模型提交 此步骤是可选的,复现论文不需要此操作: ``` export OPENROUTER_API_KEY="your-key" node benchbench/src/cli.mjs run \ --models openai/gpt-5.6-luna,anthropic/claude-sonnet-5 \ --tasks all \ --concurrency 2 ``` 在 PowerShell 中,使用以下命令设置环境变量: ``` $env:OPENROUTER_API_KEY = "your-key" ``` 运行器会从进程环境中读取密钥,并且绝不会将其写入结果文件中。 ## 协议状态 包含的 2026 年 7 月实验属于回顾性实验,未进行预注册。留出功能的实现独立于开发阶段的实现,且对可部署的评分规则不可见,但研究人员在研究开发过程中观察过留出行为。请将此产物视为一项可复现的合规性审计,而非来自研究者盲测留出的确证证据。 ## 隐私和凭证审计 本发布版本包含合成任务数据和模型生成的基准测试用例;不包含任何人类受试者数据。在发布之前,已对精确追踪的文件集进行了凭证、私钥、token、电子邮件地址、个人姓名和本地用户路径的扫描。本地执行日志和构建缓存已被排除。冻结的 API 元数据包含模型响应标识符、时间戳、token 计数和成本,但不包含任何身份验证头或 API 密钥。
标签:DLL 劫持, MITM代理, 人工智能, 大语言模型, 审计工具, 杀软绕过, 模型评估, 用户模式Hook绕过, 自定义脚本, 逆向工具