Mathematical Reasoning on Olympiad Bench (pass@8)
48.5Pass@8VI-CuRL
Evaluation Results
| Method | Links | |
|---|---|---|
| VI-CuRLBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 48.5 | |
| VI-CuRLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Intrinsic Reward Signal=Majority Vote2026.02 | 47 | |
| PionBase Model=Qwen3-1.7B2026.05 | 46.43 | |
| PionBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 46.43 | |
| AdamWBase Model=Qwen3-1.7B2026.05 | 46.09 | |
| No CurriculumBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 45.8 | |
| AdamWBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 44.69 | |
| MuonBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 44.61 | |
| AdaRFTBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 44.5 | |
| AdaRFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 43.3 | |
| MuonBase Model=Qwen3-1.7B2026.05 | 42.41 | |
| VI-CuRLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 41.9 | |
| VCRLBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 41 | |
| VCRLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 38 | |
| VI-CuRLBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 37.9 | |
| VI-CuRLBackbone=Qwen2.5-Math-1.5B, Intrinsic Reward Signal=Majority Vote2026.02 | 37.1 | |
| BaseBase Model=DeepSeek-R1-Distill-Qwen-1.5B2026.05 | 36.2 | |
| No CurriculumBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 34.7 | |
| AdaRFTBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 34.4 | |
| No CurriculumBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 34.3 | |
| VCRLBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 34 | |
| BaseBackbone=Qwen2.5-Math-7B, Reward Setting=No RL2026.02 | 33.9 | |
| BaseBackbone=Qwen2.5-Math-1.5B, Reward Setting=No RL2026.02 | 31.3 | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=No RL2026.02 | 29.8 | |
| BaseBase Model=Qwen3-1.7B2026.05 | 23.67 | |
| VI-CuRLBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 19.4 | |
| No CurriculumBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 17.8 | |
| VCRLBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 17.5 | |
| BaseBackbone=Llama3.2-3B-Instruct, Reward Setting=No RL2026.02 | 16.4 | |
| AdaRFTBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 15.3 |