Mathematical Reasoning on GSM8K Depth +4 (test)
45.5AccuracyLLAMA-3-70B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLAMA-3-70BPrompting=CoT, Framework=DARG2024.06 | 45.5 | |
| GEMINI-1.5-PROPrompting=CoT, Framework=DARG2024.06 | 44 | |
| CLAUDE-3-OPUSPrompting=CoT, Framework=DARG2024.06 | 43.5 | |
| GEMINI-1.5-FLASHPrompting=CoT, Framework=DARG2024.06 | 42 | |
| GPT-4-OPrompting=CoT, Framework=DARG2024.06 | 42 | |
| GPT-4-TURBOPrompting=CoT, Framework=DARG2024.06 | 41 | |
| MIXTRAL 8x22BPrompting=CoT, Framework=DARG2024.06 | 36 | |
| DEEPSEEKMATH-7BPrompting=CoT, Framework=DARG2024.06 | 33.5 | |
| GPT-3.5-TURBOPrompting=CoT, Framework=DARG2024.06 | 31.5 | |
| WIZARDLM-2 8x22BPrompting=CoT, Framework=DARG2024.06 | 31 | |
| PHI-3-MINI-3.8BPrompting=CoT, Framework=DARG2024.06 | 29 | |
| MIXTRAL 8x7BPrompting=CoT, Framework=DARG2024.06 | 27.5 | |
| COMMAND R+104BPrompting=CoT, Framework=DARG2024.06 | 27 | |
| LLAMA-3-8BPrompting=CoT, Framework=DARG2024.06 | 26.5 | |
| MISTRAL-7BPrompting=CoT, Framework=DARG2024.06 | 15.5 |