Mathematical Reasoning on AIME 2024 (average@10)
3.6Average Score (a@10)Llama3.2-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama3.2-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 3.6 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 3.6 | |
| Qwen2.5-3BTraining Setting=Untuned2026.05 | 3.2 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 2.1 | |
| Llama3.2-3BTraining Setting=Untuned2026.05 | 1.8 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 1.8 | |
| Llama3.1-8BTraining Setting=Untuned2026.05 | 1.4 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 1.4 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 0.7 | |
| Mistral-7BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 0.7 | |
| Mistral-7BTraining Setting=Untuned2026.05 | 0.4 | |
| Mistral-7BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 0 |