Mathematical Reasoning on Minerva (pass@1 Mean and Std Dev)
46.6pass@1 MeanSemi-online DPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Semi-online DPOSampling strategy=avg@4, Number of repeats=42026.01 | 46.6 | 5.7 | |
| ReNCESampling strategy=avg@4, Number of repeats=42026.01 | 46.6 | 7 | |
| DAPOSampling strategy=avg@4, Number of repeats=42026.01 | 46.3 | 6.2 | |
| HPT [15]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 46 | — | |
| GRPOSampling strategy=avg@4, Number of repeats=42026.01 | 44.6 | 5.1 | |
| SFT→RLBase Model=Qwen2.5-Math-7B, Source=verl2026.04 | 43.9 | — | |
| No trainingSampling strategy=avg@4, Number of repeats=42026.01 | 41.7 | 5.3 | |
| ReLIFT [12]Base Model=Qwen2.5-Math-7B, Source=reproduction attempt2026.04 | 41.5 | — | |
| SFTBase Model=Qwen2.5-Math-7B, Source=verl2026.04 | 40.6 | — | |
| Prefix-RFT [14]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 40.3 | — | |
| SRFT [13]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 39.7 | — | |
| Eurus-2-7B-PRIMEZero-shot=true, Number of parameters=7B2025.05 | 39.3 | — | |
| Scaf-GRPOBase Model=Qwen2.5-7B2025.10 | 38.6 | — | |
| SimpleRL-Zero-7BZero-shot=true, Number of parameters=7B2025.05 | 38.6 | — | |
| Vanilla GRPOBase Model=Qwen2.5-7B2025.10 | 38.5 | — | |
| LUFFY [11]Base Model=Qwen2.5-Math-7B, Source=reported2026.04 | 37.5 | — | |
| Scaf-GRPOBase Model=Qwen2.5-Math-7B2025.10 | 36.4 | — | |
| LUFFY [11]Base Model=Qwen2.5-Math-7B, Source=reproduction attempt2026.04 | 35.7 | — | |
| AAPO-7BZero-shot=true, Number of parameters=7B2025.05 | 35.3 | — | |
| Oat-ZeroBase Model=Qwen2.5-Math-7B2025.10 | 34.6 | — | |
| GPG-7BZero-shot=true, Number of parameters=7B2025.05 | 34.2 | — | |
| LUFFYBase Model=Qwen2.5-Math-7B2025.10 | 33.8 | — | |
| Vanilla GRPOBase Model=Qwen2.5-Math-7B2025.10 | 33.4 | — | |
| APMPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 32.7 | — | |
| Scaf-GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 32.4 | — | |
| SimpleRL-ZeroBase Model=Qwen2.5-Math-7B2025.10 | 31.6 | — | |
| AAPO-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 30.9 | — | |
| GMPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 30.9 | — | |
| APMPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 30.5 | — | |
| Vanilla GRPOBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 30.1 | — | |
| Oat-Zero-7BZero-shot=true, Number of parameters=7B2025.05 | 30.1 | — | |
| GMPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 30.1 | — | |
| DAPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 30.1 | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 29.8 | — | |
| GRPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 29.4 | — | |
| Scaf-GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 29.1 | — | |
| DAPOBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 29 | — | |
| BaseBackbone=Qwen2.5-Math-1.5B-Instruct2026.04 | 28.7 | — | |
| Vanilla GRPOBase Model=Qwen2.5-Math-1.5B2025.10 | 28.3 | — | |
| APMPOBackbone=Qwen2.5-3B-Instruct2026.04 | 27.9 | — | |
| GRPO-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 26.8 | — | |
| GPG-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 26.8 | — | |
| DAPOBackbone=Qwen2.5-3B-Instruct2026.04 | 26.8 | — | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2025.10 | 26.4 | — | |
| DeepSeek-R1-Distill-Qwen-1.5BBase Model=DeepSeek-R1-Distill-Qwen-1.5B2025.10 | 26.1 | — | |
| GMPOBackbone=Qwen2.5-3B-Instruct2026.04 | 26.1 | — | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.04 | 25.4 | — | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.04 | 24.6 | — | |
| BaseBackbone=Qwen2.5-3B-Instruct2026.04 | 24.3 | — | |
| Scaf-GRPOBase Model=Llama-3.2-3B-Instruct2025.10 | 19.1 | — | |
| Vanilla GRPOBase Model=Llama-3.2-3B-Instruct2025.10 | 18.7 | — | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B2025.10 | 16.5 | — | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B2025.10 | 14.7 | — | |
| Llama-3.2-3B-InstructBase Model=Llama-3.2-3B-Instruct2025.10 | 11.8 | — |