Llama Evaluation Suite
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Llama-3.2-3B-Instruct Evaluation Suite (test val)
37.3MMLU Pro
25
LLaMA-3-8B Evaluation Suite ARC-C, HellaSwag, WinoGrande, PIQA, ARC-E, BoolQ, GSM8K, WikiText-2 (test)
53.4ARC-C Accuracy
13
Llama-3.1-70B Evaluation Suite MMLU, WinoGrande, HellaSwag, ARC-Easy, ARC-Challenge
78.58MMLU
13
Llama 1B Evaluation Suite (ARC, HellaSwag, MMLU, TruthfulQA, WinoGrande, Humaneval) 3.2
39.33ARC
6