Mathematical Reasoning on AgentCoMa
21.9Average@10Qwen2.5-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 21.9 | |
| Qwen2.5-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 21.5 | |
| Qwen2.5-3BTraining Setting=Untuned2026.05 | 21.1 | |
| Mistral-7BTraining Setting=Untuned2026.05 | 18.3 | |
| Mistral-7BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 17.4 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 16.6 | |
| Mistral-7BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 16.2 | |
| Llama3.1-8BTraining Setting=Untuned2026.05 | 15.2 | |
| Llama3.1-8BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 14.9 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with REVERSE-MATH-augmented samples2026.05 | 13.6 | |
| Llama3.2-3BTraining Setting=RL fine-tuned with duplicated GSM8K samples2026.05 | 11.5 | |
| Llama3.2-3BTraining Setting=Untuned2026.05 | 11 |