Mathematical Reasoning on GSM8k (Accuracy & Avg)
85.4AccuracyQwen2.5-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-7BModel Size=>= 7B, Reasoning Protocol=few-shot CoT2025.12 | 85.4 | 63.5 | |
| M3POBackbone=Qwen2.5-3B-Instruct2025.12 | 84.8 | 70.5 | |
| HRPOBackbone=Qwen2.5-3B-Instruct2025.12 | 83.5 | 68.7 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2025.12 | 83.4 | 69.1 | |
| PPOBackbone=Qwen2.5-3B-Instruct2025.12 | 81.9 | 68.2 | |
| Gemma-2-9BModel Size=>= 7B, Reasoning Protocol=few-shot CoT2025.12 | 70.7 | 55.6 | |
| MAmmoTH2-8BModel Size=>= 7B, Reasoning Protocol=few-shot CoT2025.12 | 70.4 | 65.2 | |
| M3POBackbone=Qwen2.5-1.5B-Instruct2025.12 | 70.2 | 60.3 | |
| HRPOBackbone=Qwen2.5-1.5B-Instruct2025.12 | 69.9 | 58.1 | |
| MAmmoTH2-7BModel Size=>= 7B, Reasoning Protocol=few-shot CoT2025.12 | 68.4 | 57.8 | |
| GRPOBackbone=Qwen2.5-1.5B-Instruct2025.12 | 68.2 | 57.9 | |
| PPOBackbone=Qwen2.5-1.5B-Instruct2025.12 | 67.6 | 57.2 | |
| SFTBackbone=Qwen2.5-3B-Instruct2025.12 | 67 | 46.1 | |
| DeepSeekMath-7BModel Size=>= 7B, Reasoning Protocol=few-shot CoT2025.12 | 64.2 | 51.9 | |
| SFTBackbone=Qwen2.5-1.5B-Instruct2025.12 | 56 | 43.3 | |
| CorDAnumber of parameters=320M, backbone=LLaMA-2-7B, adaptation mode=instruction-previewed adaptation mode, rank=1282024.06 | 53.9 | 22.55 | |
| PiSSAnumber of parameters=320M, backbone=LLaMA-2-7B, adaptation mode=instruction-previewed adaptation mode, rank=1282024.06 | 51.48 | 21.46 | |
| Full fine-tuningnumber of parameters=6738M, backbone=LLaMA-2-7B, adaptation mode=instruction-previewed adaptation mode2024.06 | 48.9 | 22.46 | |
| LoRAnumber of parameters=320M, backbone=LLaMA-2-7B, adaptation mode=instruction-previewed adaptation mode, rank=1282024.06 | 42.68 | 18.3 | |
| DoRAnumber of parameters=321M, backbone=LLaMA-2-7B, adaptation mode=instruction-previewed adaptation mode, rank=1282024.06 | 41.77 | 18.18 |