Mathematical Reasoning on AIME 2024 (Accuracy@32, Average)
67.8Average Score (avg@32)DS-R1-Distill-Qwen-7B + IC-DAPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DS-R1-Distill-Qwen-7B + IC-DAPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=315.62026.03 | 67.8 | 66.5 | — | |
| GRPOParams=4B2026.05 | 67.6 | — | — | |
| DS-R1-Distill-Qwen-7B + CE-GPPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=292.52026.03 | 67.3 | 64.2 | — | |
| DS-R1-Distill-Qwen-7B + DAPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=303.12026.03 | 65.3 | 62 | — | |
| SRaRModel Size=32B2026.05 | 64.17 | — | — | |
| RaRModel Size=32B2026.05 | 63.65 | — | — | |
| DS-R1-Distill-Qwen-7BBackbone=Qwen-7B, Zero-shot mode=true2026.03 | 61.8 | 54.5 | — | |
| DS-R1-Distill-Qwen-7B + GRPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=305.62026.03 | 61.4 | 55.3 | — | |
| DAPOModel Size=32B2026.05 | 61.25 | — | — | |
| SRaRModel Size=8B2026.05 | 61.15 | — | — | |
| RaRModel Size=8B2026.05 | 57.5 | — | — | |
| E3RLBackbone=Qwen3-8b, RL Strategy=E3RL2026.06 | 57.5 | — | 76.7 | |
| DS-R1-Distill-Qwen-1.5B + IC-DAPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=477.22026.03 | 56.4 | 45.6 | — | |
| DS-R1-Distill-Qwen-1.5B + GSPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=437.32026.03 | 55.7 | 42.5 | — | |
| DS-R1-Distill-Qwen-1.5B + CE-GPPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=464.02026.03 | 55.7 | 42.8 | — | |
| DS-R1-Distill-Qwen-1.5B + DAPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=459.62026.03 | 53.9 | 40 | — | |
| DAPOBackbone=Qwen3-8b, RL Strategy=DAPO2026.06 | 53.8 | — | 80 | |
| DAPOModel Size=8B2026.05 | 52.6 | — | — | |
| GSPOBackbone=Qwen3-8b, RL Strategy=GSPO2026.06 | 52.1 | — | 83.3 | |
| GRPOBackbone=Qwen3-8b, RL Strategy=GRPO2026.06 | 51.9 | — | 76.7 | |
| SODParams=1.7B2026.05 | 50.83 | — | — | |
| SAPOBackbone=Qwen3-8b, RL Strategy=SAPO2026.06 | 50.7 | — | 76.7 | |
| E3RLBackbone=Qwen3-4b, RL Strategy=E3RL2026.06 | 50.6 | — | 83.3 | |
| DS-R1-Distill-Qwen-1.5B + GRPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=457.42026.03 | 50.3 | 33.4 | — | |
| DS-R1-Distill-Qwen-1.5B + CISPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=466.32026.03 | 48.8 | 32.9 | — | |
| RGR-GRPOModel Size=32B2026.05 | 47.71 | — | — | |
| SAPOBackbone=Qwen3-4b, RL Strategy=SAPO2026.06 | 47.5 | — | 83.3 | |
| DS-R1-Distill-Qwen-1.5BBackbone=Qwen-1.5B, Zero-shot mode=true2026.03 | 46.3 | 29.2 | — | |
| RGR-GRPOModel Size=8B2026.05 | 45.31 | — | — | |
| GRPO-VPSModel Size=8B2026.05 | 44.58 | — | — | |
| GSPOBackbone=Qwen3-4b, RL Strategy=GSPO2026.06 | 44.5 | — | 83.3 | |
| GRPOBackbone=Qwen3-4b, RL Strategy=GRPO2026.06 | 44.2 | — | 83.3 | |
| OPDParams=1.7B2026.05 | 43.86 | — | — | |
| DAPOBackbone=Qwen3-4b, RL Strategy=DAPO2026.06 | 43.6 | — | 80 | |
| GRPO-VPSModel Size=32B2026.05 | 43.02 | — | — | |
| GRPOModel Size=32B2026.05 | 37.92 | — | — | |
| GRPOModel Size=8B2026.05 | 36.56 | — | — | |
| VanillaBackbone=Qwen3-4b, RL Strategy=Vanilla2026.06 | 35.8 | — | 63.3 | |
| VanillaBackbone=Qwen3-8b, RL Strategy=Vanilla2026.06 | 34.9 | — | 60 | |
| OPSDhintParams=1.7B2026.05 | 34.42 | — | — | |
| OPSDgtParams=1.7B2026.05 | 33.85 | — | — | |
| BaselineModel Size=32B2026.05 | 27.19 | — | — | |
| BaselineModel Size=8B2026.05 | 26.88 | — | — | |
| SFTParams=1.7B2026.05 | 26.77 | — | — | |
| GRPOParams=1.7B2026.05 | 25.63 | — | — | |
| SODParams=0.6B2026.05 | 20.84 | — | — | |
| OPDParams=0.6B2026.05 | 16.82 | — | — | |
| OPSDgtParams=0.6B2026.05 | 12.63 | — | — | |
| VanillaParams=1.7B2026.05 | 9.9 | — | — | |
| OPSDhintParams=0.6B2026.05 | 9.77 | — | — | |
| VanillaParams=0.6B2026.05 | 7.71 | — | — | |
| SFTParams=0.6B2026.05 | 5.67 | — | — | |
| GRPOParams=0.6B2026.05 | 4.06 | — | — | |
| GRPOReward condition=Clean, Training steps=Full training2026.06 | — | 19.3 | — | |
| GRPOReward condition=25% reward flipping, Training steps=200 steps2026.06 | — | 13 | — | |
| Naive GRPOReward condition=Clean, Training steps=Full training2026.06 | — | 20 | — | |
| Qwen3-4B-BaseReward condition=Clean, Training steps=Full training2026.06 | — | 8.6 | — | |
| VIMPOReward condition=Clean, Training steps=Full training2026.06 | — | 21.7 | — | |
| VIMPOReward condition=25% reward flipping, Training steps=200 steps2026.06 | — | 18.3 | — |