Mathematical Reasoning on MGSM (average@10)
44Average@10Qwen2.5-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-3BTraining Setting=Untuned2026.05 | 44 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 42.4 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 42 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 41.4 | |
| Llama3.1-8BTraining Setting=Untuned2026.05 | 36.9 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 36.1 | |
| Llama3.2-3BTraining Setting=Untuned2026.05 | 29.4 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 28.3 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 27.9 | |
| Mistral-7BTraining Setting=Untuned2026.05 | 11.8 | |
| Mistral-7BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 10.1 | |
| Mistral-7BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 10 |