Mathematical Reasoning on GSM-IC2
93.8AccuracyQwen2-7B-SFT + Step-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-7B-SFT + Step-DPOBackbone=Qwen2-7B, Training Strategy=Step-DPO2025.02 | 93.8 | |
| Qwen2-7B-SFTBackbone=Qwen2-7B, Training Strategy=SFT2025.02 | 93.7 | |
| Qwen2-7B-SFT + Full-Step-DPOBackbone=Qwen2-7B, Training Strategy=Full-Step-DPO2025.02 | 93.6 | |
| DeepSeekMath-Base-SFT + Full-Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Full-Step-DPO2025.02 | 87.8 | |
| DeepSeekMath-Base-SFT + Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Step-DPO2025.02 | 85.9 | |
| DeepSeekMath-Base-SFTBackbone=DeepSeekMath-Base, Training Strategy=SFT2025.02 | 85.4 | |
| DeepSeekMath-Base-SFT + DPOBackbone=DeepSeekMath-Base, Training Strategy=DPO2025.02 | 85.2 | |
| Llama-3-8B-SFT + Full-Step-DPOBackbone=Llama-3-8B, Training Strategy=Full-Step-DPO2025.02 | 82.1 | |
| Llama-3-8B-SFT + Step-DPOBackbone=Llama-3-8B, Training Strategy=Step-DPO2025.02 | 80.7 | |
| Llama-3-8B-SFTBackbone=Llama-3-8B, Training Strategy=SFT2025.02 | 80.1 | |
| MetaMath-Mistral-7BBackbone=Mistral-7B, Training Strategy=SFT2025.02 | 77.9 | |
| MetaMath-Mistral-7B + Step-DPOBackbone=Mistral-7B, Training Strategy=Step-DPO2025.02 | 76.4 | |
| MetaMath-Mistral-7B + Full-Step-DPOBackbone=Mistral-7B, Training Strategy=Full-Step-DPO2025.02 | 75.9 | |
| Llama-3-8B-SFT + DPOBackbone=Llama-3-8B, Training Strategy=DPO2025.02 | 64.1 | |
| MetaMath-Mistral-7B + DPOBackbone=Mistral-7B, Training Strategy=DPO2025.02 | 60.5 | |
| Qwen2-7B-SFT + DPOBackbone=Qwen2-7B, Training Strategy=DPO2025.02 | 30.1 |