Mathematical Reasoning on AIME 24 (Pass@1)
68.13Pass@1MulFeRL
Evaluation Results
| Method | Links | |
|---|---|---|
| MulFeRLBackbone=Qwen3-4B-Inst, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 68.13 | |
| Critique-GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 62.53 | |
| GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 57.47 | |
| Dr.GRPOBackbone=Qwen3-4B-Inst, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 56.8 | |
| MulFeRLBackbone=Qwen2.5-7B-Base, Training Strategy=Multi-turn Feedback-guided Reinforcement Learning2026.01 | 23.73 | |
| CITL-FTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 23.07 | |
| RAFTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 22.93 | |
| SFTBackbone=Qwen3-4B-Inst, Training Strategy=Supervised Learning-based Finetuning2026.01 | 22.27 | |
| Critique-GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 20.93 | |
| Qwen3-4B-InstBackbone=Qwen3-4B-Inst, Training Strategy=Base Model2026.01 | 19.73 | |
| GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 16.13 | |
| CITL-FTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 15.2 | |
| Dr.GRPOBackbone=Qwen2.5-7B-Base, Training Strategy=Reinforcement Learning-based Finetuning2026.01 | 14.67 | |
| SetPO+GRPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 13.4 | |
| SetPO+DAPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 13.4 | |
| SetPO+GSPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 13.2 | |
| Qwen2.5-7B-BaseBackbone=Qwen2.5-7B-Base, Training Strategy=Base Model2026.01 | 13.2 | |
| DAPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 12 | |
| SFTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 12 | |
| GRPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 11.5 | |
| GSPOBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 11.1 | |
| RAFTBackbone=Qwen2.5-7B-Base, Training Strategy=Supervised Learning-based Finetuning2026.01 | 9.33 | |
| Qwen2.5-Math-1.5BBackbone=Qwen2.5-Math-1.5B, Inference Temperature=0.5, Sampling Count (k)=642026.02 | 4.6 | |
| PREPOBase Model=Qwen3-4B, Training Strategy=PREPO, # Rollouts=348K2025.11 | 0.8 | |
| Random SelectionBase Model=Qwen3-4B, Training Strategy=Random Selection, # Rollouts=553K2025.11 | 0.7 | |
| GRESOBase Model=Qwen3-4B, Training Strategy=GRESO, # Rollouts=472K2025.11 | 0.6917 | |
| Qwen3-4BBase Model=Qwen3-4B, Training Strategy=Base, # Rollouts=–2025.11 | 0.5333 | |
| Random SelectionBase Model=Qwen2.5-Math-7B, Training Strategy=Random Selection, # Rollouts=905K2025.11 | 0.2667 | |
| PREPOBase Model=Qwen2.5-Math-7B, Training Strategy=PREPO, # Rollouts=540K2025.11 | 0.2615 | |
| GRESOBase Model=Qwen2.5-Math-7B, Training Strategy=GRESO, # Rollouts=654K2025.11 | 0.2583 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Strategy=Base, # Rollouts=–2025.11 | 0.208 | |
| GRESOBase Model=Qwen2.5-Math-1.5B, Training Strategy=GRESO, # Rollouts=2.5M2025.11 | 0.2 | |
| Random SelectionBase Model=Qwen2.5-Math-1.5B, Training Strategy=Random Selection, # Rollouts=3.0M2025.11 | 0.1667 | |
| PREPOBase Model=Qwen2.5-Math-1.5B, Training Strategy=PREPO, # Rollouts=1.1M2025.11 | 0.1667 | |
| Random SelectionBase Model=Qwen2.5-7B, Training Strategy=Random Selection, # Rollouts=716K2025.11 | 0.1641 | |
| PREPOBase Model=Qwen2.5-7B, Training Strategy=PREPO, # Rollouts=304K2025.11 | 0.1609 | |
| GRESOBase Model=Qwen2.5-7B, Training Strategy=GRESO, # Rollouts=680K2025.11 | 0.1083 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Strategy=Base, # Rollouts=–2025.11 | 0.1021 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Training Strategy=Base, # Rollouts=–2025.11 | 0.0417 |