deedy/imo-2026
GitHub: deedy/imo-2026
该项目通过统一的最小化agent框架,让多个前沿大模型完全自主求解2026年IMO全部六道题目,并由独立验证agent严格评分,形成可审计的模型数学推理能力对比基准。
Stars: 1 | Forks: 0
# IMO 2026 — 自主 AI 模型对比
前沿模型完全自主地求解[2026年国际数学奥林匹克](problems/)的全部六道题目,提供完整的每轮审计追踪,并附带**独立验证的评分**。
针对三个模型进行了四次运行,均使用相同的最小化 agent 框架:
| 运行 | P1 | P2 | P3 | P4 | P5 | P6 | **评分** | 耗时 | 成本 |
|---|--|--|--|--|--|--|--|--|--|
| **Claude Fable 5** (默认 `high` effort) | 7 | 7 | 7 | 7 | 7 | 7 | **42/42** | 2.5 小时 | $51.05 |
| **GPT-5.6 Sol** (xhigh effort)† | 7 | 7 | 7 | 7 | 7 | 7 | **42/42** | 3.8 小时 | ~$20.54 |
| **Kimi K3** (默认 effort)† | 7 | 7 | 7 | 7 | 7 | 7 | **42/42** | 17.4 小时 | ~$31.40 |
| **GPT-5.6 Sol** (默认 effort) | 7 | 4 | 2 | 7 | 7 | 1 | **28/42** | 1.0 小时 | ~$4.04 |
*耗时和成本为**所有**轮次的总计,包括因 API 中断和网络故障而终止的轮次——有关每个问题的尝试次数、token 数量以及有效与总耗时/成本的详细分析,请参阅 [REPORT.md](REPORT.md)。† 包含修复轮次:在初始评分后,这些运行会向模型展示审查者发现的具体缺陷(绝不包含其他解答),并允许其进行更多会话尝试;每个修复后的分数都经过了与原版一样严格的重新验证。分数采用 IMO 风格的 0–7 分制,由独立验证 agent 给出,这些 agent 会对关键代数过程进行符号化重新推导,对组合论断进行机器测试,并为失败的引理构建明确的反例——而**不是**模型自我报告的分数。有关各题的裁定及指出的缺陷,请参见 [grades/](grades/)。*
### 首轮测试(在任何修复轮次之前)
| 运行 | P1 | P2 | P3 | P4 | P5 | P6 | **总计** |
|---|--|--|--|--|--|--|--|
| **Claude Fable 5** | 7 | 7 | 7 | 7 | 7 | 7 | **42/42** |
| **GPT-5.6 Sol** (xhigh effort) | 7 | 4 | 7 | 7 | 7 | 7 | **39/42** |
| **Kimi K3** | 7 | 7 | 5 | 7 | 7 | 3 | **36/42** |
| **GPT-5.6 Sol** (默认 effort) | 7 | 4 | 2 | 7 | 7 | 1 | **28/42** |
纯粹的单次对比:**Claude Fable 5 是唯一一次在没有任何修复轮次的情况下被评为 42/42 分的运行。**
## 核心发现
- **Claude Fable 5:验证为 42/42 分——并且是最快的一次运行 (1.8 小时)。** 在没有审查者、没有编排、没有二次尝试的情况下实现了完全的严谨性,并且在所有运行中包含了唯一一个全合成的 P2 几何证明。
- **审查反馈闭环了流程。** 仅向 GPT-5.6 Sol (xhigh) 提供审查者的缺陷发现后,它修复了 P2;而 Kimi K3 修复了其 P3 以及 P6 的有限性关键点(根据贪心抹除性质发明了一个新的紧致性定理)——这使得所有三个模型都达到了验证后的 42/42 分。每一个修复部分都经过了与原版同等严格的对抗性重新评分:精确 minimax、跨数十个随机种子的独立重实现,以及反例族排除检查。
- **推理投入换来了严谨性。** GPT-5.6 Sol 在相同的框架中从默认提升到 `xhigh` 努力程度后,得分从 28 跃升至 39/42:P3 和 P6 变成了经过验证的 7 分(用正确的论证替换了以前错误的引理),其 P2 的失败也变成了坦诚自认的 `partial`(部分解决),而不是充满自信的无效证明。深度不仅提高了正确性,还改善了自我校准。
- **Kimi K3 得来不易的 42/42 分**:耗时 17.4 小时并经历了多轮修复,在向框架中加入检查点纪律应对措施之前,早期的上下文内推理因达到时间限制而丢失——但其最终的 P6 紧致性论证是原创且关键的数学证明,并已通过独立重实现加以验证。
- **自我报告存在夸大。** 几乎每次运行都声称“解决”了所有尝试过的问题;评分程序仅确认了上述分数,每一次扣分都有记录在案、可核查的缺陷名称作为依据。所有运行在“计算与证明”题中给出的最终答案都是一致的。
## 仓库结构
```
problems/ the six problem statements (+ problems.json with metadata)
results/ one directory per run: per-problem current.md (the proof), approaches/,
lemmas/, code/ (the model's own verification scripts), scratch/, and
logs.jsonl — a complete per-turn audit trail (every tool call, verbatim)
grades/ per-problem grading verdicts (JSON): score, justification, named defects
REPORT.md per-problem attempts, wall-clock time, tokens, and cost
pdfs/ typeset solution PDFs (24) + the comparison report
harness/ the agent harnesses (Kimi K3 / GPT via OpenRouter / Claude Fable 5 via
Anthropic SDK) — same prompt, tools, and caps across all runs
```
## 方法论
- **框架** (`harness/`):一个刻意极简化的单上下文 agent 循环——包含三个工具(bash / write_file / read_file),没有流程编排,没有审查者,网络被屏蔽,所有模型使用完全相同的系统提示词和时间限制(150 分钟/题)。题目描述原样输入;指示模型从第一性原理出发解决问题,并在将论断写入正式证明之前进行数值验证。**推理设置**:Claude Fable 5 在 API 的默认投入水平(`high`;未传入 `effort` 参数)下以其常驻的自适应思考模式运行;Kimi K3 在其 API 默认设置下运行(未暴露 effort 控制项);GPT-5.6 Sol 运行了两次——一次采用 OpenRouter 的默认推理投入(`medium`),另一次采用可接受的最大投入 `xhigh`。因基础设施故障(API 中断、计费问题)而中断的运行会从其磁盘上的检查点恢复;所有先前的轮次都保存在各题的 `scratch/` 目录中。
- **评分**:每道题分配一个验证 agent,负责搜寻逻辑漏洞、符号化验证代数推导,并对可疑论断进行机器测试;部分缺陷通过明确的反例或精确的 minimax 计算加以确认。评分者的输出原文保留在 `grades/` 中。
## 注意事项
- 评分者是基于 Claude 的 agent,而非人类奖牌获得者;请将这些分数视为极具参考价值但并非绝对权威。
- 所有运行共享相同的框架,因此可以直接进行横向对比;两次 GPT-5.6 Sol 运行之间唯一受控的差异就是推理投入设置。
- Claude Fable 5 的成本由 Anthropic API 计量得出。Kimi K3 的成本是根据记录的 token 数和目录价格估算的(假设缓存命中率分割为 93%);GPT-5.6 Sol 的成本基于 OpenRouter 的目录价格。
## 溯源
所有运行均在 2026 年 7 月 17 日至 18 日执行,由 Claude Code (Claude Fable 5) 作为编排 agent 驱动。每一次模型对话、工具调用及结果都被原文记录在相应的 `logs.jsonl` 中。题目版权归 IMO 所有;源自 [tempcollab/proval](https://github.com/tempcollab/proval)。
标签:DLL 劫持, 人工智能, 大语言模型, 数学奥赛, 时序数据库, 模型评测, 用户模式Hook绕过, 自动化推理, 防御加固