Mathematical Reasoning on In-Distribution Reasoning Suite (AIME 24, AIME 25, AMC, MATH-500, Minerva)
36AIME 24 Pass@32DYPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DYPOTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 36 | 28.7 | 67 | 89.2 | 42.4 | 52.5 | |
| Oat-ZeroTraining Category=Reinforcement Learning, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 33.4 | 11.9 | 61.2 | 78 | 34.6 | 43.8 | |
| CHORDTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 31.2 | 24.4 | 66.8 | 89.4 | 39.3 | 50.2 | |
| SRFTTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 30.7 | 26 | 69.8 | 88.4 | 39.7 | 50.9 | |
| LUFFYTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 29.4 | 23.1 | 65.6 | 87.6 | 37.5 | 48.6 | |
| ReLIFTTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 28.3 | 22.9 | 65.1 | 87.4 | 37.1 | 48.2 | |
| SuperRLTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 28.1 | 21.6 | 63.9 | 86.4 | 36.4 | 47.3 | |
| SimpleRL-ZeroTraining Category=Reinforcement Learning, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 27 | 6.8 | 54.9 | 76 | 25 | 37.9 | |
| SFT → RLTraining Category=SFT and RL, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 25.8 | 23.1 | 62.7 | 87.2 | 39.7 | 47.7 | |
| RLTraining Category=Reinforcement Learning, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 25.1 | 15.3 | 62 | 84.4 | 39.3 | 45.2 | |
| SFTTraining Category=Supervised Fine-Tuning, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 22.2 | 22.3 | 52.8 | 82.6 | 40.8 | 44.1 | |
| PRIME-ZeroTraining Category=Reinforcement Learning, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 17 | 12.8 | 54 | 81.4 | 39 | 40.8 | |
| OpenReasoner-ZeroTraining Category=Reinforcement Learning, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 16.5 | 15 | 52.1 | 82.4 | 33.1 | 39.8 | |
| Qwen2.5-Math-7BTraining Category=Base Model, Backbone=Qwen2.5-Math-7B, Inference Temperature=0.6, Option Shuffling=true2026.04 | 11.5 | 4.9 | 31.3 | 43.6 | 7.4 | 19.7 |