Mathematical Reasoning on GPQA Diamond
41.41AccuracyQwen-2.5-Math-7B-Reasoning(sft+grpo)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen-2.5-Math-7B-Reasoning(sft+grpo)Parameters=7B, Training strategy=SFT + GRPO2026.03 | 41.41 | |
| Qwen2.5-Math-7B-sftParameters=7B, Training strategy=SFT2026.03 | 37.37 | |
| Qwen2.5-Math-1.5B-sftParameters=1.5B, Training strategy=SFT2026.03 | 35.35 | |
| Qwen-2.5-Math-7B-Reasoning(only grpo)Parameters=7B, Training strategy=GRPO-only2026.03 | 34.34 | |
| Qwen2.5-Math-1.5B-LoRA-MergedParameters=1.5B, Training strategy=LoRA-Merged2026.03 | 30.81 | |
| Qwen2.5-Math-1.5BParameters=1.5B, Training strategy=Base2026.03 | 27.27 | |
| Qwen2.5-Math-7BParameters=7B, Training strategy=Base2026.03 | 26.26 | |
| Qwen-2.5-Math-1.5B-Reasoning(sft+grpo)Parameters=1.5B, Training strategy=SFT + GRPO2026.03 | 26.26 | |
| Qwen-2.5-Math-1.5B-Reasoning(only grpo)Parameters=1.5B, Training strategy=GRPO-only2026.03 | 25.76 |