Mathematical Reasoning on OCW
20.2AccuracyDeepSeekMath-Base-SFT + Full-Step-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeekMath-Base-SFT + Full-Step-DPOBase Model=DeepSeekMath-Base, Optimization Strategy=Full-Step-DPO2025.02 | 20.2 | |
| DeepSeekMath-Base-SFTBase Model=DeepSeekMath-Base, Optimization Strategy=SFT2025.02 | 19.1 | |
| DeepSeekMath-Base-SFT + DPOBase Model=DeepSeekMath-Base, Optimization Strategy=DPO2025.02 | 18.4 | |
| Qwen2-7B-SFT + Full-Step-DPOBase Model=Qwen2-7B, Optimization Strategy=Full-Step-DPO2025.02 | 18.4 | |
| DeepSeekMath-Base-SFT + Step-DPOBase Model=DeepSeekMath-Base, Optimization Strategy=Step-DPO2025.02 | 18 | |
| Qwen2-7B-SFTBase Model=Qwen2-7B, Optimization Strategy=SFT2025.02 | 15.8 | |
| Qwen2-7B-SFT + Step-DPOBase Model=Qwen2-7B, Optimization Strategy=Step-DPO2025.02 | 15.8 | |
| Llama-3-8B-SFT + Full-Step-DPOBase Model=Llama-3-8B, Optimization Strategy=Full-Step-DPO2025.02 | 15.1 | |
| Llama-3-8B-SFT + Step-DPOBase Model=Llama-3-8B, Optimization Strategy=Step-DPO2025.02 | 13.6 | |
| Llama-3-8B-SFTBase Model=Llama-3-8B, Optimization Strategy=SFT2025.02 | 12.5 | |
| MetaMath-Mistral-7BBase Model=MetaMath-Mistral-7B, Optimization Strategy=SFT2025.02 | 10.7 | |
| MetaMath-Mistral-7B + Full-Step-DPOBase Model=MetaMath-Mistral-7B, Optimization Strategy=Full-Step-DPO2025.02 | 9.9 | |
| Llama-3-8B-SFT + DPOBase Model=Llama-3-8B, Optimization Strategy=DPO2025.02 | 9.9 | |
| Qwen2-7B-SFT + DPOBase Model=Qwen2-7B, Optimization Strategy=DPO2025.02 | 8.1 | |
| MetaMath-Mistral-7B + DPOBase Model=MetaMath-Mistral-7B, Optimization Strategy=DPO2025.02 | 7.7 | |
| MetaMath-Mistral-7B + Step-DPOBase Model=MetaMath-Mistral-7B, Optimization Strategy=Step-DPO2025.02 | 7 |