Open LLM Leaderboard
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Open LLM Leaderboard 2
51.28Overall Score
55
Open LLM Leaderboard Population (Top-50)
60.08Accuracy
50
Open LLM Leaderboard v2 (test)
60.84BBH
47
Open LLM Leaderboard 1
69.28Overall Score
46
Open LLM Leaderboard
74.2Average Score
41
Open LLM Leaderboard v1 (test)
19.84MMLU-P Accuracy
37
Open LLM Leaderboard v1 (test)
69.6Average Score
34
Open LLM Leaderboard
82.8ARC
33
Open-LLM Leaderboard
53.45Accuracy
28
Open LLM Leaderboard subset-selection
1.4MAE
24
Open LLM Leaderboard (test)
70.1Average Score
21
Open LLM Leaderboard v1 (test)
44.97MMLU-Pro
20
Open LLM Leaderboard Lighteval (test)
91.07Mean Accuracy
17
Open LLM Leaderboard & General Ability Benchmarks (MMLU-P, GPQA, BBH, MATH, MuSR, IFEval, ARC, Hellaswag, PIQA, BoolQ, WinoGrande, COPA, OpenBookQA, SciQ) unified (test)
12MMLU-P Accuracy
16
Open LLM Leaderboard lm-eval-harness (test)
83.29HellaSwag Accuracy
14
Open LLM Leaderboard
70.22ARC
14
Open LLM Leaderboard (test)
57.94ARC
13
Open LLM Leaderboard HuggingFace 2023a (test)
59.4ARC-c Accuracy (25-shot)
12
Open LLM Leaderboard v2
21.04Ranking Quality Gain
9
Open LLM Leaderboard 1
66.12Overall Score
9
Open LLM Leaderboard (test)
62.03ARC
9
Open LLM Leaderboard MMLU-PRO, IFEval, BBH, GPQA, MATH, GSM8K, ARC v0.4.0 (test)
28.38MMLU-PRO
7
Open LLM leaderboard
65.51Average Score
7
Open LLM Leaderboard zero-shot
52.9ARCE
6
Open LLM Leaderboard Scientific Discovery scenario K = 42 models
64Main Objective
4