Multi-task Language Understanding on MMLU (subsampled 2500 s)
73.9AccuracyQwen 7B (Gem)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen 7B (Gem)Tree=Qwen 7B, Model Category=Hidden Gem2026.01 | 73.9 | |
| Llama 8B (Gem)Tree=Llama 8B, Model Category=Hidden Gem2026.01 | 71.6 | |
| Qwen 7B (Base)Tree=Qwen 7B, Model Category=Popular Consensus (Base)2026.01 | 71.3 | |
| Qwen 3B (Gem)Tree=Qwen 3B, Model Category=Hidden Gem2026.01 | 67.8 | |
| Mistral 7B (Gem)Tree=Mistral 7B, Model Category=Hidden Gem2026.01 | 66.2 | |
| Qwen 3B (Base)Tree=Qwen 3B, Model Category=Popular Consensus (Base)2026.01 | 65.5 | |
| Llama 8B (Base)Tree=Llama 8B, Model Category=Popular Consensus (Base)2026.01 | 64.1 | |
| Mistral 7B (Base)Tree=Mistral 7B, Model Category=Popular Consensus (Base)2026.01 | 56.6 |