Mathematical Reasoning on AIME 2025 (Pass@8)
31.3Pass@8VI-CuRL
Evaluation Results
| Method | Links | |
|---|---|---|
| VI-CuRLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 31.3 | |
| VI-CuRLBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 30.8 | |
| AdaRFTBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 29.2 | |
| No CurriculumBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 28.7 | |
| VCRLBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 28.1 | |
| AdaRFTBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 27.9 | |
| No CurriculumBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 25.7 | |
| No CurriculumBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 25 | |
| VI-CuRLBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 24.6 | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Reward Setting=No RL2026.02 | 23.3 | |
| BaseBackbone=Qwen2.5-Math-7B, Reward Setting=No RL2026.02 | 23.3 | |
| VCRLBackbone=Qwen2.5-Math-7B, Reward Setting=Oracle (w. Verifier)2026.02 | 23.3 | |
| VCRLBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 19.8 | |
| AdaRFTBackbone=Qwen2.5-Math-1.5B, Reward Setting=Oracle (w. Verifier)2026.02 | 17.9 | |
| BaseBackbone=Qwen2.5-Math-1.5B, Reward Setting=No RL2026.02 | 16.7 | |
| VI-CuRLBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 5.4 | |
| AdaRFTBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 5 | |
| No CurriculumBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 4.8 | |
| BaseBackbone=Llama3.2-3B-Instruct, Reward Setting=No RL2026.02 | 3.3 | |
| VCRLBackbone=Llama3.2-3B-Instruct, Reward Setting=Oracle (w. Verifier)2026.02 | 3.2 |