Mathematical Reasoning on MATH500, AIME25, OlympiadBench, AMC23 (test 2023/2025)
86.2MATH ScorePerplexity
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PerplexityModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 86.2 | 36.7 | 55 | 77.5 | 63.8 | |
| SR-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 86.2 | 36.7 | 58.5 | 77.5 | 64.7 | |
| IPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 86 | 26.7 | 56.7 | 77.5 | 61.7 | |
| RMModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 85.4 | 36.7 | 56.2 | 72.5 | 62.7 | |
| Self-RewardModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 85.2 | 36.7 | 57.2 | 67.5 | 61.6 | |
| BaseModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 82.8 | 30 | 43.6 | 77.5 | 58.5 | |
| SR-GRPOModel=Qwen2.5-1.5B-Instruct2025.12 | 52.4 | 13.3 | 26.4 | 37.5 | 32.4 | |
| Self-RewardModel=Qwen2.5-1.5B-Instruct2025.12 | 50.6 | 13.3 | 23.6 | 32.5 | 30 | |
| RMModel=Qwen2.5-1.5B-Instruct2025.12 | 50.4 | 3.3 | 25.6 | 30 | 27.3 | |
| IPOModel=Qwen2.5-1.5B-Instruct2025.12 | 49.2 | 3.3 | 24 | 27.5 | 26 | |
| PerplexityModel=Qwen2.5-1.5B-Instruct2025.12 | 48.4 | 10 | 25.6 | 32.5 | 29.1 | |
| BaseModel=Qwen2.5-1.5B-Instruct2025.12 | 48 | 3.3 | 25.5 | 35 | 28 |