Commonsense Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
84.02Accuracy
14
Feb 26, 2026
78.8HellaSwag Accuracy
13
May 27, 2026
11.86LAMBADA Perplexity (PPL)
13
Apr 24, 2026
80.7Accuracy
13
Apr 23, 2026
51.4Normalized Accuracy (OpenBookQA)
13
Jun 16, 2026
92.9ARC-e Accuracy
13
Feb 26, 2026
0.941Accuracy
13
Feb 26, 2026
69.87ARC-Easy Accuracy
12
Jun 9, 2026
74Accuracy
12
May 18, 2026
44.3Accuracy
12
May 18, 2026
53.63HellaSwag Accuracy
12
May 8, 2026
82Accuracy
12
Apr 24, 2026
59.1Accuracy
12
Apr 21, 2026
74.15PIQA Accuracy
12
Apr 14, 2026
85.18Accuracy
12
Apr 14, 2026
91.5Accuracy
12
Feb 26, 2026
49.6Accuracy
12
Feb 26, 2026
42.41Accuracy
12
Feb 27, 2026
70.4Accuracy (en)
12
Feb 26, 2026
71.9Score
12
Feb 26, 2026
80.6Accuracy
12
Feb 26, 2026
68.39Normalized Accuracy
11
Jun 29, 2026
34.6Normalized Accuracy
11
Jun 29, 2026
61.76Accuracy
11
Jun 26, 2026
40.7Accuracy (zero-shot)
11
Jun 26, 2026