Mathematical Reasoning Suite (AIME24, AMC23, MATH, MIN., OLY.)
43.3AIME24 ScoreDr. GRPO
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Dr. GRPOBackbone=Qwen2.5-Math-7B, Source=directly using results reported by original paper2025.11 | 43.3 | 62.7 | 80 | 30.1 | 41 | 51.4 | |
| SSPOBackbone=Qwen2.5-Math-7B2025.11 | 40 | 69.88 | 81.2 | 41.54 | 47.4 | 56 | |
| CLIP-CovBackbone=Qwen2.5-Math-7B2025.11 | 36.67 | 67.47 | 84.6 | 41.91 | 46.95 | 55.52 | |
| GRPOBackbone=Qwen2.5-Math-7B2025.11 | 33.3 | 67.47 | 79 | 40.07 | 45.91 | 53.15 | |
| GSPOBackbone=Qwen2.5-Math-7B2025.11 | 33.3 | 65.06 | 80.8 | 42.28 | 47.1 | 53.75 | |
| GRPOBackbone=Qwen2.5-Math-7B, epsilon_high=0.282025.11 | 33.3 | 68.67 | 82.2 | 44.49 | 49.18 | 55.57 | |
| EasyRL Iter3Backbone=Qwen2.5-Math-7B2026.04 | 26.7 | 62.5 | 79 | 43.4 | 41.2 | 50.6 | |
| SSPOBackbone=Qwen2.5-Math-1.5B2025.11 | 23.33 | 55.42 | 76 | 36.42 | 42.5 | 46.72 | |
| GSPOBackbone=Qwen2.5-Math-1.5B2025.11 | 20 | 51.49 | 74.6 | 34.56 | 41.16 | 44.42 | |
| Dr. GRPOBackbone=Qwen2.5-Math-1.5B, Source=directly using results reported by original paper2025.11 | 20 | 53 | 74.2 | 25.7 | 37.6 | 42.1 | |
| CLIP-CovBackbone=Qwen2.5-Math-1.5B2025.11 | 20 | 56.63 | 78 | 35.66 | 40.56 | 46.17 | |
| Supervised GRPOBackbone=Qwen2.5-Math-7B2026.04 | 20 | 55 | 75.6 | 28.3 | 37.8 | 43.3 | |
| Vanilla BaseBackbone=Qwen2.5-Math-7B, Evaluation Protocol=Zero-shot prompting2026.04 | 16.7 | 52.5 | 72.6 | 16.9 | 33.8 | 38.5 | |
| Vanilla InstructBackbone=Qwen2.5-Math-7B, Evaluation Protocol=Zero-shot prompting2026.04 | 16.7 | 60 | 85 | 41.5 | 40.4 | 48.7 | |
| Unsupervised EMPOBackbone=Qwen2.5-Math-7B2026.04 | 16.7 | 57.5 | 74.8 | 35.3 | 37.3 | 44.3 | |
| EasyRL Iter1Backbone=Qwen2.5-Math-7B2026.04 | 16.7 | 50 | 79 | 38.6 | 42.1 | 45.3 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2025.11 | 16.67 | 54.2 | 72.6 | 32.35 | 39.67 | 43.01 | |
| GRPOBackbone=Qwen2.5-Math-1.5B, epsilon_high=0.282025.11 | 13.3 | 53.01 | 73.2 | 33.09 | 37.89 | 42.1 | |
| EasyRL Iter3Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Zero-shot prompting2026.04 | 13.3 | 55 | 71.2 | 30.9 | 31.3 | 40.3 | |
| EasyRL Iter2Backbone=Qwen2.5-Math-7B2026.04 | 13.3 | 57.5 | 78.4 | 43.8 | 39.9 | 46.6 | |
| EasyRL Iter3Backbone=Llama-3.2-3B-Instruct2026.04 | 13.3 | 27.5 | 47.4 | 21.7 | 14.8 | 24.9 | |
| EasyRL Iter2Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Zero-shot prompting2026.04 | 10 | 50 | 70 | 31.6 | 31.3 | 38.6 | |
| Supervised GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 10 | 27.5 | 47.2 | 18.8 | 14.4 | 23.6 | |
| EasyRL Iter1Backbone=Llama-3.2-3B-Instruct2026.04 | 10 | 27.5 | 47.2 | 22.1 | 15.1 | 24.4 | |
| EasyRL Iter2Backbone=Llama-3.2-3B-Instruct2026.04 | 10 | 22.5 | 49 | 22.1 | 16 | 23.9 | |
| Vanilla BaseBackbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Zero-shot prompting, Decoding Strategy=Greedy decoding, Metric Protocol=pass@1 accuracy2026.04 | 6.7 | 45 | 65 | 18 | 28.3 | 32.6 | |
| Unsupervised EMPOBackbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Zero-shot prompting2026.04 | 6.7 | 60 | 66.6 | 28.3 | 31 | 38.5 | |
| Unsupervised EMPOBackbone=Llama-3.2-3B-Instruct2026.04 | 6.7 | 27.5 | 47.6 | 20.6 | 13.5 | 23.2 | |
| Supervised GRPOBackbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Zero-shot prompting, Decoding Strategy=Greedy decoding2026.04 | 3.3 | 50 | 66.4 | 27.9 | 30.7 | 35.7 | |
| EasyRL Iter1Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Zero-shot prompting2026.04 | 3.3 | 52.5 | 69.8 | 28.7 | 31 | 37.1 | |
| Vanilla BaseBackbone=Llama-3.2-3B-Instruct2026.04 | 3.3 | 22.5 | 47.4 | 21 | 13 | 21.4 |