Mathematical Reasoning on GK 2023
50AccuracyBiRM
Evaluation Results
| Method | Links | |
|---|---|---|
| BiRMBackbone=Qwen2.5-7B, K=1002025.03 | 50 | |
| BiRMBackbone=Qwen2.5-7B, K=202025.03 | 48.4 | |
| PRMBackbone=Qwen2.5-7B, K=1002025.03 | 48.3 | |
| PRMBackbone=Qwen2.5-7B, K=202025.03 | 48.1 | |
| BiRMBackbone=Qwen2.5-7B, K=82025.03 | 46.8 | |
| ORMBackbone=Qwen2.5-7B, K=1002025.03 | 46.8 | |
| PRMBackbone=Qwen2.5-7B, K=82025.03 | 45.6 | |
| ORMBackbone=Qwen2.5-7B, K=202025.03 | 45.5 | |
| BiRMBackbone=Qwen2.5-7B, K=42025.03 | 44.5 | |
| ORMBackbone=Qwen2.5-7B, K=82025.03 | 44.2 | |
| PRMBackbone=Qwen2.5-7B, K=42025.03 | 44 | |
| ORMBackbone=Qwen2.5-7B, K=42025.03 | 42.8 | |
| BiRMBackbone=Qwen2.5-3B, K=202025.03 | 39.1 | |
| BiRMBackbone=Qwen2.5-3B, K=1002025.03 | 39 | |
| PRMBackbone=Qwen2.5-3B, K=202025.03 | 38.4 | |
| ORMBackbone=Qwen2.5-3B, K=1002025.03 | 38.1 | |
| PRMBackbone=Qwen2.5-3B, K=82025.03 | 37.9 | |
| BiRMBackbone=Qwen2.5-3B, K=82025.03 | 37.9 | |
| PRMBackbone=Qwen2.5-3B, K=1002025.03 | 37.9 | |
| ORMBackbone=Qwen2.5-3B, K=202025.03 | 37.7 | |
| BiRMBackbone=Qwen2.5-3B, K=42025.03 | 36.1 | |
| ORMBackbone=Qwen2.5-3B, K=82025.03 | 36.1 | |
| ORMBackbone=Qwen2.5-3B, K=42025.03 | 35.6 | |
| PRMBackbone=Qwen2.5-3B, K=42025.03 | 34.9 | |
| Qwen2-7B-SFT + Full-Step-DPOBase Model=Qwen2-7B, Optimization Strategy=Full-Step-DPO2025.02 | 33.5 | |
| Qwen2-7B-SFTBase Model=Qwen2-7B, Optimization Strategy=SFT2025.02 | 33 | |
| Qwen2-7B-SFT + Step-DPOBase Model=Qwen2-7B, Optimization Strategy=Step-DPO2025.02 | 32.5 | |
| DeepSeekMath-Base-SFT + Full-Step-DPOBase Model=DeepSeekMath-Base, Optimization Strategy=Full-Step-DPO2025.02 | 31.7 | |
| DeepSeekMath-Base-SFT + DPOBase Model=DeepSeekMath-Base, Optimization Strategy=DPO2025.02 | 31.2 | |
| DeepSeekMath-Base-SFT + Step-DPOBase Model=DeepSeekMath-Base, Optimization Strategy=Step-DPO2025.02 | 31.2 | |
| BiRMBackbone=Llama3.1-8B, K=1002025.03 | 30.7 | |
| DeepSeekMath-Base-SFTBase Model=DeepSeekMath-Base, Optimization Strategy=SFT2025.02 | 30.4 | |
| PRMBackbone=Llama3.1-8B, K=1002025.03 | 29.6 | |
| BiRMBackbone=Llama3.1-8B, K=202025.03 | 29.2 | |
| PRMBackbone=Llama3.1-8B, K=202025.03 | 28.6 | |
| BiRMBackbone=Llama3.1-8B, K=82025.03 | 27.5 | |
| ORMBackbone=Llama3.1-8B, K=202025.03 | 27 | |
| PRMBackbone=Llama3.1-8B, K=82025.03 | 26.6 | |
| ORMBackbone=Llama3.1-8B, K=1002025.03 | 26.2 | |
| ORMBackbone=Llama3.1-8B, K=82025.03 | 25.6 | |
| BiRMBackbone=Llama3.1-8B, K=42025.03 | 25.4 | |
| PRMBackbone=Llama3.1-8B, K=42025.03 | 25.1 | |
| ORMBackbone=Llama3.1-8B, K=42025.03 | 23.9 | |
| Llama-3-8B-SFT + Full-Step-DPOBase Model=Llama-3-8B, Optimization Strategy=Full-Step-DPO2025.02 | 22.1 | |
| MetaMath-Mistral-7B + Full-Step-DPOBase Model=MetaMath-Mistral-7B, Optimization Strategy=Full-Step-DPO2025.02 | 20.5 | |
| Llama-3-8B-SFTBase Model=Llama-3-8B, Optimization Strategy=SFT2025.02 | 20.5 | |
| Llama-3-8B-SFT + Step-DPOBase Model=Llama-3-8B, Optimization Strategy=Step-DPO2025.02 | 19.7 | |
| MetaMath-Mistral-7BBase Model=MetaMath-Mistral-7B, Optimization Strategy=SFT2025.02 | 15.8 | |
| MetaMath-Mistral-7B + DPOBase Model=MetaMath-Mistral-7B, Optimization Strategy=DPO2025.02 | 15.8 | |
| MetaMath-Mistral-7B + Step-DPOBase Model=MetaMath-Mistral-7B, Optimization Strategy=Step-DPO2025.02 | 15.1 | |
| Llama-3-8B-SFT + DPOBase Model=Llama-3-8B, Optimization Strategy=DPO2025.02 | 11.7 | |
| Qwen2-7B-SFT + DPOBase Model=Qwen2-7B, Optimization Strategy=DPO2025.02 | 8.8 |