Natural Language Reasoning on GSM8K, MATH, SVAMP, ASDiv, MAWPS, and CARP
82.5Average ScoreGPT-4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-42024.05 | 82.5 | |
| JiuZhang3.0-8x7BModel Scale=8x7B2024.05 | 79.3 | |
| JiuZhang3.0-7BModel Scale=7B, Backbone=Mistral-7B2024.05 | 78.8 | |
| JiuZhang3.0-8BModel Scale=8B, Backbone=LLaMA-3-8B2024.05 | 78.3 | |
| DeepSeekMath-7B-RLModel Scale=7B2024.05 | 77.4 | |
| MAmmoTH2-8x7B-PlusModel Scale=8x7B2024.05 | 76.4 | |
| Qwen-1.5-110BModel Scale=110B2024.05 | 75.7 | |
| MAmmoTH2-7B-PlusModel Scale=7B2024.05 | 75.2 | |
| MAmmoTH2-8B-PlusModel Scale=8B2024.05 | 74.6 | |
| DeepSeekMath-7B-InstructModel Scale=7B2024.05 | 73.9 | |
| Qwen-1.5-72BModel Scale=72B2024.05 | 72.3 | |
| ChatGPT2024.05 | 70.7 | |
| Math-Shepherd-Mistral-7BModel Scale=7B2024.05 | 68.3 | |
| WizardMath-7B-1.1Model Scale=7B2024.05 | 67.6 | |
| Abel-7B-002Model Scale=7B2024.05 | 66.4 | |
| MetaMath-Mistral-7BModel Scale=7B2024.05 | 65.4 | |
| DeepSeekMath-7BModel Scale=7B2024.05 | 65.3 | |
| Mixtral-8x7BModel Scale=8x7B2024.05 | 65.2 | |
| Mistral-7B-MMIQCModel Scale=7B2024.05 | 65.2 | |
| Rho-1-Math-7BModel Scale=7B2024.05 | 64.3 | |
| Intern-Math-20BModel Scale=20B2024.05 | 63.9 | |
| Qwen-1.5-7BModel Scale=7B2024.05 | 59.5 | |
| Llemma-34BModel Scale=34B2024.05 | 59.1 | |
| Gemma-7BModel Scale=7B2024.05 | 56.2 | |
| LLAMA-3-8BModel Scale=8B2024.05 | 55.9 | |
| InternLM-Math-7BModel Scale=7B2024.05 | 52.8 | |
| Llemma-7BModel Scale=7B2024.05 | 49.7 | |
| Mistral-7BModel Scale=7B2024.05 | 48.4 | |
| DeepSeek-7BModel Scale=7B2024.05 | 31.2 |