Multi-task Language Evaluation on Spanish Language Evaluation Suite
37.78ARC-C (es)Qwen2.5
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen2.52025.12 | 37.78 | 72.78 | 69.6 | 69.42 | 52.75 | 49.71 | 36.8 | 48.84 | 60.23 | 55 | — | — | |
| Gamayun2025.12 | 37.69 | 67.22 | 70.2 | 70.2 | 55.55 | 43.32 | 38 | 49.96 | 64.53 | 55.66 | — | — | |
| Qwen32025.12 | 36.15 | 64.33 | 67.4 | 66.95 | 49.01 | 48.6 | 36.6 | 42.61 | 60.03 | 53.15 | — | — | |
| EuroLM2025.12 | 35.38 | 25.67 | 71 | 69.14 | 53.04 | 25.33 | 37.4 | 48.59 | 64.26 | 48.6 | — | — | |
| Gemma32025.12 | 32.48 | 35.56 | 65.8 | 67.33 | 49.24 | 38.17 | 37.2 | 43.45 | 62.81 | 49.3 | — | — | |
| Llama3.22025.12 | 31.03 | 51.89 | 60.4 | 37.99 | 45.98 | 39.57 | 32 | 44.98 | 60.36 | 46.17 | — | — | |
| HQFiltering Strategy=Monolingual high-quality (HQ), Model size=1B2026.04 | — | — | — | — | — | — | — | — | — | — | 37.53 | 2 | |
| MLFiltering Strategy=Multilingual (ML) classifier, Model size=1B2026.04 | — | — | — | — | — | — | — | — | — | — | 38.55 | 1.14 | |
| No filteringFiltering Strategy=None, Model size=1B2026.04 | — | — | — | — | — | — | — | — | — | — | 36.35 | 2.86 |