Mathematical Reasoning on ADDSUB
93.1Solve RateQwen2-7B-SFT + Full-Step-DPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-7B-SFT + Full-Step-DPOBackbone=Qwen2-7B, Training Strategy=Full-Step-DPO2025.02 | 93.1 | |
| Qwen2-7B-SFTBackbone=Qwen2-7B, Training Strategy=SFT2025.02 | 92.7 | |
| PALPrompting Strategy=Program-aided, Model=Codex2022.11 | 92.5 | |
| Qwen2-7B-SFT + Step-DPOBackbone=Qwen2-7B, Training Strategy=Step-DPO2025.02 | 92.2 | |
| COT PaLM-540BPrompting Strategy=Chain-of-Thought, Model=PaLM-540B2022.11 | 91.9 | |
| DIRECT CodexPrompting Strategy=Direct, Model=Codex2022.11 | 90.9 | |
| Zero-shot-CPPrompting Strategy=Zero-shot-CP, Base Model=GPT-3.5-Turbo, Number of runs=52024.03 | 90.46 | |
| Llama-3-8B-SFT + Full-Step-DPOBackbone=Llama-3-8B, Training Strategy=Full-Step-DPO2025.02 | 88.8 | |
| MetaMath-Mistral-7B + Full-Step-DPOBackbone=Mistral-7B, Training Strategy=Full-Step-DPO2025.02 | 88.6 | |
| Llama-3-8B-SFT + Step-DPOBackbone=Llama-3-8B, Training Strategy=Step-DPO2025.02 | 88.5 | |
| Llama-3-8B-SFTBackbone=Llama-3-8B, Training Strategy=SFT2025.02 | 88.4 | |
| DeepSeekMath-Base-SFTBackbone=DeepSeekMath-Base, Training Strategy=SFT2025.02 | 87.6 | |
| MetaMath-Mistral-7B + Step-DPOBackbone=Mistral-7B, Training Strategy=Step-DPO2025.02 | 86.9 | |
| MetaMath-Mistral-7BBackbone=Mistral-7B, Training Strategy=SFT2025.02 | 86.6 | |
| DeepSeekMath-Base-SFT + DPOBackbone=DeepSeekMath-Base, Training Strategy=DPO2025.02 | 86.6 | |
| DeepSeekMath-Base-SFT + Full-Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Full-Step-DPO2025.02 | 86.6 | |
| Zero-shot-CoTPrompting Strategy=Zero-shot-CoT, Base Model=GPT-3.5-Turbo, Number of runs=52024.03 | 86.16 | |
| COT CodexPrompting Strategy=Chain-of-Thought, Model=Codex2022.11 | 86 | |
| DeepSeekMath-Base-SFT + Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Step-DPO2025.02 | 85.3 | |
| Zero-shotPrompting Strategy=Zero-shot, Base Model=GPT-3.5-Turbo, Number of runs=52024.03 | 82.78 | |
| Llama-3-8B-SFT + DPOBackbone=Llama-3-8B, Training Strategy=DPO2025.02 | 60 | |
| MetaMath-Mistral-7B + DPOBackbone=Mistral-7B, Training Strategy=DPO2025.02 | 53.4 | |
| COT LAMDA-137BPrompting Strategy=Chain-of-Thought, Model=LaMDA-137B2022.11 | 52.9 | |
| Qwen2-7B-SFT + DPOBackbone=Qwen2-7B, Training Strategy=DPO2025.02 | 25.6 | |
| COT UL2-20BPrompting Strategy=Chain-of-Thought, Model=UL2-20B2022.11 | 18.2 |