Mathematical Reasoning on OlympiadBench (Pass Rate)
60.67Pass RatePREPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PREPOBase Model=Qwen3-4B, Training Strategy=PREPO, # Rollouts=348K2025.11 | 60.67 | |
| Random SelectionBase Model=Qwen3-4B, Training Strategy=Random Selection, # Rollouts=553K2025.11 | 59.33 | |
| GRESOBase Model=Qwen3-4B, Training Strategy=GRESO, # Rollouts=472K2025.11 | 57.33 | |
| Qwen3-4BBase Model=Qwen3-4B, Training Strategy=Base, # Rollouts=–2025.11 | 52.67 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 50.2 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 48.9 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 48.3 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 46.5 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 45.8 | |
| DFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 44 | |
| Random SelectionBase Model=Qwen2.5-Math-7B, Training Strategy=Random Selection, # Rollouts=905K2025.11 | 43.26 | |
| GRESOBase Model=Qwen2.5-7B, Training Strategy=GRESO, # Rollouts=680K2025.11 | 42.07 | |
| PREPOBase Model=Qwen2.5-Math-7B, Training Strategy=PREPO, # Rollouts=540K2025.11 | 41.58 | |
| PREPOBase Model=Qwen2.5-7B, Training Strategy=PREPO, # Rollouts=304K2025.11 | 39.85 | |
| Qwen2.5-Math-7BBase Model=Qwen2.5-Math-7B, Training Strategy=Base, # Rollouts=–2025.11 | 39.56 | |
| Random SelectionBase Model=Qwen2.5-7B, Training Strategy=Random Selection, # Rollouts=716K2025.11 | 38.47 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Training Strategy=Base, # Rollouts=–2025.11 | 33.09 | |
| PREPOBase Model=Qwen2.5-Math-1.5B, Training Strategy=PREPO, # Rollouts=1.1M2025.11 | 32 | |
| Random SelectionBase Model=Qwen2.5-Math-1.5B, Training Strategy=Random Selection, # Rollouts=3.0M2025.11 | 30.5 | |
| GEMBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 28 | |
| SED-SFT w/o maskBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 27.7 | |
| Qwen2.5-Math-1.5BBase Model=Qwen2.5-Math-1.5B, Training Strategy=Base, # Rollouts=–2025.11 | 27.41 | |
| GRESOBase Model=Qwen2.5-Math-7B, Training Strategy=GRESO, # Rollouts=654K2025.11 | 26.83 | |
| SED-SFTBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 26.5 | |
| CrossEntropyBackbone=Qwen2.5-Math-7B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 26.1 | |
| GRESOBase Model=Qwen2.5-Math-1.5B, Training Strategy=GRESO, # Rollouts=2.5M2025.11 | 24.17 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT2026.02 | 22.2 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=SED-SFT w/o mask2026.02 | 21 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=CrossEntropy2026.02 | 20.9 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=DFT2026.02 | 17.8 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=RL, Optimization Objective=GEM2026.02 | 16.9 | |
| DFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=DFT2026.02 | 12.1 | |
| SED-SFT w/o maskBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT w/o mask2026.02 | 10.7 | |
| GEMBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=GEM2026.02 | 9.9 | |
| CrossEntropyBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=CrossEntropy2026.02 | 9.6 | |
| SED-SFTBackbone=Llama-3.2-3B-Instruct, Training Phase=SFT, Optimization Objective=SED-SFT2026.02 | 9.6 |