Multitask Language Understanding on MMLU Korean (test)
72AccuracyTrinity Large
Evaluation Results
| Method | Links | |
|---|---|---|
| Trinity LargeArchitecture=MoE, Evaluation Mode=Zero-shot2026.02 | 72 | |
| Qwen3Size=8B, Evaluation Mode=Zero-shot2026.02 | 64 | |
| Qwen3Size=4B, Evaluation Mode=Zero-shot2026.02 | 59 | |
| TrillionLabsSize=7B, Evaluation Mode=Zero-shot2026.02 | 50 | |
| DatologySize=8B, Evaluation Mode=Zero-shot2026.02 | 49 | |
| Llama-3.1Size=8B, Evaluation Mode=Zero-shot2026.02 | 48 | |
| Granite-4.0Size=Micro, Evaluation Mode=Zero-shot2026.02 | 46 | |
| SmolLM3Size=3B, Evaluation Mode=Zero-shot2026.02 | 45 | |
| LFM2.5Size=1.2B, Evaluation Mode=Zero-shot2026.02 | 44 | |
| DatologySize=3B, Evaluation Mode=Zero-shot2026.02 | 43 | |
| Llama-3.2Size=3B, Evaluation Mode=Zero-shot2026.02 | 39 | |
| Llama-3.2Size=1B, Evaluation Mode=Zero-shot2026.02 | 26 |