Mathematical Reasoning on CARP
53.6AccuracyGPT-4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-42024.05 | 53.6 | |
| Qwen-1.5-110BModel Scale=110B2024.05 | 53.6 | |
| Qwen-1.5-72BModel Scale=72B2024.05 | 53 | |
| JiuZhang3.0-8x7BModel Scale=8x7B2024.05 | 52.3 | |
| DeepSeekMath-7B-RLModel Scale=7B2024.05 | 51.6 | |
| JiuZhang3.0-7BModel Scale=7B, Backbone=Mistral-7B2024.05 | 51 | |
| JiuZhang3.0-8BModel Scale=8B, Backbone=LLaMA-3-8B2024.05 | 50.9 | |
| MAmmoTH2-8x7B-PlusModel Scale=8x7B2024.05 | 45.8 | |
| DeepSeekMath-7B-InstructModel Scale=7B2024.05 | 45.8 | |
| MAmmoTH2-8B-PlusModel Scale=8B2024.05 | 44.8 | |
| DeepSeekMath-7BModel Scale=7B2024.05 | 44.4 | |
| MAmmoTH2-7B-PlusModel Scale=7B2024.05 | 44.3 | |
| Intern-Math-20BModel Scale=20B2024.05 | 42.3 | |
| ChatGPT2024.05 | 41.3 | |
| Mixtral-8x7BModel Scale=8x7B2024.05 | 38.8 | |
| Qwen-1.5-7BModel Scale=7B2024.05 | 38.6 | |
| Rho-1-Math-7BModel Scale=7B2024.05 | 36.7 | |
| Llemma-34BModel Scale=34B2024.05 | 36.5 | |
| Mistral-7B-MMIQCModel Scale=7B2024.05 | 36.5 | |
| Abel-7B-002Model Scale=7B2024.05 | 33.2 | |
| Math-Shepherd-Mistral-7BModel Scale=7B2024.05 | 32.9 | |
| WizardMath-7B-1.1Model Scale=7B2024.05 | 31.9 | |
| Llemma-7BModel Scale=7B2024.05 | 31.8 | |
| Gemma-7BModel Scale=7B2024.05 | 30.5 | |
| MetaMath-Mistral-7BModel Scale=7B2024.05 | 30.5 | |
| LLAMA-3-8BModel Scale=8B2024.05 | 29.2 | |
| InternLM-Math-7BModel Scale=7B2024.05 | 28 | |
| Mistral-7BModel Scale=7B2024.05 | 14.9 | |
| DeepSeek-7BModel Scale=7B2024.05 | 10.3 |