Mathematical Reasoning on GSM-ICM
92.7AccuracyQwen2-7B-SFT + Full-Step-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-7B-SFT + Full-Step-DPOBackbone=Qwen2-7B, Training Strategy=Full-Step-DPO2025.02 | 92.7 | |
| Qwen2-7B-SFT + Step-DPOBackbone=Qwen2-7B, Training Strategy=Step-DPO2025.02 | 91.9 | |
| Qwen2-7B-SFTBackbone=Qwen2-7B, Training Strategy=SFT2025.02 | 91.6 | |
| DeepSeekMath-Base-SFT + Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Step-DPO2025.02 | 86.2 | |
| DeepSeekMath-Base-SFT + Full-Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Full-Step-DPO2025.02 | 85.3 | |
| DeepSeekMath-Base-SFTBackbone=DeepSeekMath-Base, Training Strategy=SFT2025.02 | 85.2 | |
| DeepSeekMath-Base-SFT + DPOBackbone=DeepSeekMath-Base, Training Strategy=DPO2025.02 | 85 | |
| Llama-3-8B-SFT + Full-Step-DPOBackbone=Llama-3-8B, Training Strategy=Full-Step-DPO2025.02 | 81.6 | |
| Llama-3-8B-SFT + Step-DPOBackbone=Llama-3-8B, Training Strategy=Step-DPO2025.02 | 81.2 | |
| Llama-3-8B-SFTBackbone=Llama-3-8B, Training Strategy=SFT2025.02 | 79.5 | |
| MetaMath-Mistral-7B + Full-Step-DPOBackbone=Mistral-7B, Training Strategy=Full-Step-DPO2025.02 | 76.6 | |
| MetaMath-Mistral-7BBackbone=Mistral-7B, Training Strategy=SFT2025.02 | 76.5 | |
| MetaMath-Mistral-7B + Step-DPOBackbone=Mistral-7B, Training Strategy=Step-DPO2025.02 | 76.3 | |
| Llama-3-8B-SFT + DPOBackbone=Llama-3-8B, Training Strategy=DPO2025.02 | 66.3 | |
| MetaMath-Mistral-7B + DPOBackbone=Mistral-7B, Training Strategy=DPO2025.02 | 65.2 | |
| Qwen2-7B-SFT + DPOBackbone=Qwen2-7B, Training Strategy=DPO2025.02 | 29.5 |