Multi-task Language Understanding on MMLU v1 (test)
66.6AccuracyLLaMA-3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaMA-3-8BTraining Tokens (B)=15000, Evaluation Protocol=5-shot, Model Architecture Category=Transformer2025.07 | 66.6 | |
| Gemma-7BTraining Tokens (B)=6000, Evaluation Protocol=5-shot, Model Architecture Category=Transformer2025.07 | 62.9 | |
| Mistral-7BTraining Tokens (B)=8000*, Evaluation Protocol=5-shot, Model Architecture Category=Transformer2025.07 | 62.4 | |
| LLaMA-3-8B-LizardTraining Tokens (B)=0.04, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Unbounded2025.07 | 61.2 | |
| Mistral-7B-LizardTraining Tokens (B)=0.04, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Unbounded2025.07 | 60.8 | |
| LLaMA-3-8B-LoLCATsTraining Tokens (B)=0.04, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Bounded2025.07 | 52.8 | |
| Mistral-7B-LoLCATsTraining Tokens (B)=0.04, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Bounded2025.07 | 51.4 | |
| Liger-GLA-Llama-3-8BTraining Tokens (B)=0.02, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Bounded2025.07 | 43.4 | |
| Mamba2-LLaMA-3-8BTraining Tokens (B)=20, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Unbounded2025.07 | 43.2 | |
| TransNormerLLM-7BTraining Tokens (B)=1400, Evaluation Protocol=5-shot, Model Architecture Category=Subquadratic2025.07 | 43.1 | |
| Griffin-7BTraining Tokens (B)=300, Evaluation Protocol=5-shot, Model Architecture Category=Subquadratic2025.07 | 39.3 | |
| Liger-GLA-Mistral-7BTraining Tokens (B)=0.02, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Bounded2025.07 | 36.3 | |
| Hawk-7BTraining Tokens (B)=300, Evaluation Protocol=5-shot, Model Architecture Category=Subquadratic2025.07 | 35 | |
| Mistral-7B-SUPRATraining Tokens (B)=100, Evaluation Protocol=5-shot, Model Architecture Category=Linearized, Linearized Model Constraint=Bounded2025.07 | 34.2 | |
| Mamba-7BTraining Tokens (B)=1200, Evaluation Protocol=5-shot, Model Architecture Category=Subquadratic2025.07 | 33.3 |