Math Reasoning on GSM8K, MATH, AMC23, OlympiadBench, GAOKAO-2024, Minerva, AIME (test)
95.8GSM8K AccuracyQwen2.5-32B-Instruct
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.5-32B-InstructFine-tuning=Instruction-only baseline, Training Epochs=02025.12 | 95.8 | 73.5 | 70 | 38.5 | 42.9 | 26.5 | 16.8 | 11.6 | 46.95 | |
| SYNTHETIC-1-10kBase Model=Qwen2.5-32B-Instruct, Training Epochs=2, Fine-tuning Samples=10k2025.12 | 94.5 | 78.4 | 75 | 45 | 24.2 | 28.3 | 48.4 | 37.9 | 54 | |
| DataFlow-Reasoning-10KBase Model=Qwen2.5-32B-Instruct, Training Epochs=2, Fine-tuning Samples=10k2025.12 | 94.4 | 76.6 | 75 | 45.2 | 42.9 | 25.7 | 45.4 | 40 | 55.7 | |
| DataFlow-Reasoning-10KBase Model=Qwen2.5-32B-Instruct, Training Epochs=1, Fine-tuning Samples=10k2025.12 | 93.9 | 72.3 | 72.5 | 38.7 | 38.5 | 26.5 | 35.9 | 34.5 | 51.6 | |
| Open-R1-10kBase Model=Qwen2.5-32B-Instruct, Training Epochs=2, Fine-tuning Samples=10k2025.12 | 93.9 | 77.2 | 80 | 44.1 | 20.9 | 25.4 | 51 | 40.7 | 54.2 | |
| SYNTHETIC-1-10kBase Model=Qwen2.5-32B-Instruct, Training Epochs=1, Fine-tuning Samples=10k2025.12 | 92.9 | 71.8 | 52.5 | 38.4 | 23.1 | 24.3 | 35.6 | 34 | 46.6 | |
| Open-R1-10kBase Model=Qwen2.5-32B-Instruct, Training Epochs=1, Fine-tuning Samples=10k2025.12 | 91.5 | 72.3 | 65 | 38.4 | 20.9 | 24.6 | 43 | 33.5 | 48.7 |