Accuracy on AIME 25 (Mathematics Competition)
72.37AccuracyTeacher-30B
Evaluation Results
| Method | Links | |
|---|---|---|
| Teacher-30BInference Mode=thinking2026.06 | 72.37 | |
| OPD-T8BInference Mode=thinking2026.06 | 69.04 | |
| Teacher-8BInference Mode=thinking2026.06 | 65.71 | |
| RLInference Mode=thinking2026.06 | 62.37 | |
| OPD-T30BInference Mode=thinking2026.06 | 62.37 | |
| Base (SFT ckpt)Inference Mode=thinking2026.06 | 59.04 | |
| TaH+Model Size=4B*2025.11 | 27.9 | |
| TaHModel Size=4B*2025.11 | 27.1 | |
| SoftThinkModel Size=4B*2025.11 | 25.8 | |
| OuroModel Size=4B*2025.11 | 25 | |
| StandardModel Size=4B*2025.11 | 24.2 | |
| TaH+Model Size=1.7B2025.11 | 15.4 | |
| TaHModel Size=1.7B2025.11 | 13.8 | |
| StandardModel Size=1.7B2025.11 | 10.8 | |
| OuroModel Size=1.7B2025.11 | 10.8 | |
| AlwaysThinkModel Size=1.7B2025.11 | 7.5 | |
| SoftThinkModel Size=1.7B2025.11 | 5.4 | |
| TaH+Model Size=0.6B2025.11 | 4.6 | |
| SoftThinkModel Size=0.6B2025.11 | 2.9 | |
| OuroModel Size=0.6B2025.11 | 2.1 | |
| TaHModel Size=0.6B2025.11 | 2.1 | |
| StandardModel Size=0.6B2025.11 | 1.9 | |
| AlwaysThinkModel Size=0.6B2025.11 | 1.3 |