Mathematical Reasoning on AIME 2025 (average@10)
1.4Average@10Qwen2.5-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-3BTraining Setting=Untuned2026.05 | 1.4 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 1.1 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 0.7 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 0.7 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 0.7 | |
| Llama3.1-8BTraining Setting=Untuned2026.05 | 0.4 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 0.4 | |
| Mistral-7BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 0.4 | |
| Llama3.2-3BTraining Setting=Untuned2026.05 | 0 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 0 | |
| Mistral-7BTraining Setting=Untuned2026.05 | 0 | |
| Mistral-7BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 0 |