Mathematical Reasoning on OlympiadBench (Acc(%), Avg.Steps(n))
73.8Accuracy (%)CRAFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CRAFTBackbone=GPT-5.4-nano2026.04 | 73.8 | 7.6 | |
| CRAFTBackbone=o4-mini2026.04 | 73.2 | 6.6 | |
| Best-of-NBackbone=GPT-5.4-nano2026.04 | 70 | 29 | |
| Self-ConsistencyBackbone=o4-mini2026.04 | 68 | 29.4 | |
| Self-RefineBackbone=o4-mini2026.04 | 68 | 29.7 | |
| RAPBackbone=o4-mini2026.04 | 66.5 | 18.5 | |
| Self-ConsistencyBackbone=GPT-5.4-nano2026.04 | 65.3 | 29 | |
| Best-of-NBackbone=o4-mini2026.04 | 64 | 6.5 | |
| Self-RefineBackbone=GPT-5.4-nano2026.04 | 63.4 | 29.6 | |
| Self-AggregationBackbone=o4-mini2026.04 | 62.4 | 28.3 | |
| Faithful CoTBackbone=o4-mini2026.04 | 60.8 | 42.2 | |
| Univ. Self-ConsistencyBackbone=GPT-5.4-nano2026.04 | 58.4 | 29.2 | |
| Univ. Self-ConsistencyBackbone=o4-mini2026.04 | 57.6 | 29.1 | |
| Self-AggregationBackbone=GPT-5.4-nano2026.04 | 56 | 26 | |
| RAPBackbone=GPT-5.4-nano2026.04 | 55.6 | 10.2 | |
| Faithful CoTBackbone=GPT-5.4-nano2026.04 | 51 | 25.9 | |
| Tree-of-ThoughtBackbone=GPT-5.4-nano2026.04 | 46.6 | 7.6 | |
| Tree-of-ThoughtBackbone=o4-mini2026.04 | 46 | 3 | |
| Self-Eval Beam SearchBackbone=o4-mini2026.04 | 40 | 27.8 | |
| Self-Eval Beam SearchBackbone=GPT-5.4-nano2026.04 | 25.4 | 10.9 |