Mathematical Reasoning on GSM8K, MATH 500, Minerva, College Math, Olympiad, AIME 24 & 25
96.84GSM8K AccuracyGRPOgsm8k
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GRPOgsm8kBackbone=Qwen3-8B, Training Method=GRPOgsm8k2025.11 | 96.84 | 96.94 | 49.12 | 57.94 | 73.38 | 74.78 | 64.29 | 73.33 | |
| OpenSIRBackbone=Qwen3-8B, Training Method=OpenSIR2025.11 | 96.34 | 97.13 | 52.28 | 61.37 | 76.77 | 79.52 | 69.91 | 76.19 | |
| GRPOmathBackbone=Qwen3-8B, Training Method=GRPOmath2025.11 | 96.25 | 98.32 | 48.43 | 59.29 | 74.57 | 77.84 | 65.13 | 74.26 | |
| BaseBackbone=Qwen3-8B, Training Method=Base2025.11 | 95.93 | 97.02 | 48.44 | 58.45 | 75.18 | 75.21 | 66.25 | 73.78 | |
| R-ZeroBackbone=Qwen3-8B, Training Method=R-Zero2025.11 | 94.83 | 93.83 | 49.89 | 52.38 | 71.48 | 73.15 | 62.23 | 71.11 | |
| Absolute ZeroBackbone=Qwen3-8B, Training Method=Absolute Zero2025.11 | 93.73 | 94.14 | 48.71 | 57.32 | 72.29 | 72.42 | 63.82 | 71.78 | |
| OpenSIRBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=OpenSIR2025.11 | 78.39 | 84.68 | 35.88 | 51.42 | 57.92 | 43.38 | 31.29 | 54.71 | |
| R-ZeroBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=R-Zero2025.11 | 73.78 | 80.44 | 31.29 | 49.83 | 55.39 | 40.87 | 28.42 | 51.43 | |
| GRPOgsm8kBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=GRPOgsm8k2025.11 | 72.49 | 79.94 | 32.42 | 49.38 | 57.29 | 40.38 | 28.83 | 51.53 | |
| Absolute ZeroBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=Absolute Zero2025.11 | 71.93 | 80.83 | 29.49 | 48.71 | 56.42 | 39.72 | 27.94 | 50.72 | |
| GRPOmathBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=GRPOmath2025.11 | 71.38 | 81.89 | 33.12 | 50.29 | 57.84 | 39.41 | 29.24 | 51.88 | |
| BaseBackbone=DeepSeek-R1-Distill-Llama-8B, Training Method=Base2025.11 | 70.68 | 80.75 | 32.4 | 48.27 | 55.75 | 41.04 | 28.12 | 51 |