General Reasoning on AGIEval
70.4Exact MatchGPT-4
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4Setting=Zero-shot2023.11 | 70.4 | |
| Qwen 3 14Bshots=5-shot2026.01 | 66.1 | |
| Ministral 3 14Bshots=5-shot2026.01 | 64.8 | |
| Qwen 3 8Bshots=5-shot2026.01 | 59.6 | |
| Ministral 3 8Bshots=5-shot2026.01 | 59.1 | |
| Gemma 3 12Bshots=5-shot2026.01 | 58.7 | |
| Qwen 3 4Bshots=5-shot2026.01 | 57 | |
| ChatGPTSetting=Zero-shot2023.11 | 53.13 | |
| Ministral 3 3Bshots=5-shot2026.01 | 51.1 | |
| Orca 2-13BSetting=Zero-shot, System Message=Default2023.11 | 49.93 | |
| WizardLM-70BSetting=Zero-shot2023.11 | 48.73 | |
| Orca 2-13BSetting=Zero-shot, System Message=Cautious2023.11 | 48.18 | |
| LLaMA-2-Chat-70BSetting=Zero-shot2023.11 | 46.7 | |
| Engram-40BShots=0-shot2026.01 | 45.9 | |
| Orca-1-13BSetting=Zero-shot2023.11 | 45.69 | |
| Orca 2-7BSetting=Zero-shot, System Message=Default2023.11 | 45.1 | |
| Orca 2-7BSetting=Zero-shot, System Message=Cautious2023.11 | 43.97 | |
| Gemma 3 4Bshots=5-shot2026.01 | 43 | |
| Engram-27BShots=0-shot2026.01 | 41.8 | |
| LLaMA-2-Chat-13BSetting=Zero-shot2023.11 | 38.85 | |
| OrthoMergeBase Model=Llama-3.1-8B, Fine-tuning Technique=OFT, Merging Strategy=OrthoMerge2026.02 | 38.84 | |
| MoE-27BShots=0-shot2026.01 | 38.6 | |
| TABase Model=Llama-3.1-8B, Fine-tuning Technique=OFT, Merging Strategy=TA2026.02 | 38.53 | |
| DAREBase Model=Llama-3.1-8B, Fine-tuning Technique=OFT, Merging Strategy=DARE2026.02 | 38.47 | |
| WizardLM-13BSetting=Zero-shot2023.11 | 38.25 | |
| TABase Model=Llama-3.1-8B, Fine-tuning Technique=LoRA, Merging Strategy=TA2026.02 | 37.9 | |
| DAREBase Model=Llama-3.1-8B, Fine-tuning Technique=LoRA, Merging Strategy=DARE2026.02 | 37.86 | |
| TIESBase Model=Llama-3.1-8B, Fine-tuning Technique=OFT, Merging Strategy=TIES2026.02 | 37.85 | |
| TIESBase Model=Llama-3.1-8B, Fine-tuning Technique=LoRA, Merging Strategy=TIES2026.02 | 37.09 | |
| TSV-MBase Model=Llama-3.1-8B, Fine-tuning Technique=OFT, Merging Strategy=TSV-M2026.02 | 36.96 | |
| Llama-3.1-8BBase Model=Llama-3.1-8B, Fine-tuning Technique=None, Merging Strategy=None2026.02 | 35.76 | |
| TSV-MBase Model=Llama-3.1-8B, Fine-tuning Technique=LoRA, Merging Strategy=TSV-M2026.02 | 34.51 | |
| Dense-4BShots=0-shot2026.01 | 29.1 |