Multitask Language Evaluation on Arabic Benchmarks (COPA-ar, HellaSwag-ar, ArabicMMLU)
69.7COPA-arAceGPT-7B-chat
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AceGPT-7B-chatParams=7B2026.04 | 69.7 | 27 | 35 | 43.9 | |
| SILMA-9B-InstructParams=9B2026.04 | 69.7 | 38 | 52.9 | 53.5 | |
| ALLaM-7B-InstructParams=7B2026.04 | 68.5 | 29 | 52.2 | 49.9 | |
| RightNow-Arabic-0.5B-Turbo (soup_dpo_sft_pre)Params=518M2026.04 | 58.4 | 26 | 23.2 | 35.9 | |
| Falcon-H1-1.5B-InstructParams=1.5B2026.04 | 58.4 | 27.5 | 32.7 | 39.5 | |
| Qwen2.5-0.5B-InstructParams=494M2026.04 | 53.9 | 22.5 | 26 | 34.1 | |
| Falcon-H1-0.5B-InstructParams=524M2026.04 | 44.9 | 23 | 24.2 | 30.7 |