STEM tasks on STEM GPQA and MMLU redux (test)
30.3GPQA ScoreSR-GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SR-GRPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 30.3 | 46.6 | 38.4 | |
| IPOModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 28.8 | 45.8 | 37.3 | |
| BaseModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 25.8 | 45.8 | 35.8 | |
| RMModel=DeepSeek-R1-Distill-Qwen-1.5B, Reward Model=Skywork-Reward-V2-Qwen3-1.7B2025.12 | 24.2 | 46.3 | 35.3 | |
| PerplexityModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 24.2 | 46.3 | 35.3 | |
| Self-RewardModel=DeepSeek-R1-Distill-Qwen-1.5B2025.12 | 23.7 | 45.8 | 34.8 | |
| SR-GRPOModel=Qwen2.5-1.5B-Instruct2025.12 | 21.2 | 47.7 | 34.5 | |
| BaseModel=Qwen2.5-1.5B-Instruct2025.12 | 19 | 47.7 | 33.3 | |
| PerplexityModel=Qwen2.5-1.5B-Instruct2025.12 | 18.7 | 47.6 | 33.1 | |
| Self-RewardModel=Qwen2.5-1.5B-Instruct2025.12 | 17.7 | 45.5 | 31.6 | |
| IPOModel=Qwen2.5-1.5B-Instruct2025.12 | 17.2 | 47.7 | 32.4 | |
| RMModel=Qwen2.5-1.5B-Instruct, Reward Model=Skywork-Reward-V2-Qwen3-1.7B2025.12 | 15.7 | 47.2 | 31.4 |