Commonsense Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
73.6BoolQ Accuracy
11
Mar 4, 2026
81.4AUCOAA
11
Feb 26, 2026
83.45Accuracy
11
Feb 27, 2026
73.8Accuracy
11
Apr 1, 2026
91.2Accuracy
11
Feb 26, 2026
92.7Accuracy
10
Jun 30, 2026
83.23Accuracy
10
Jun 30, 2026
80.04Accuracy
10
Jun 30, 2026
85.18Accuracy
10
Jun 19, 2026
0.8NLL
10
Jun 11, 2026
0.58NLL
10
Jun 11, 2026
15.54LLMcritic Calls
10
May 11, 2026
70.5Accuracy
10
May 8, 2026
11.86LAMBADA Perplexity
10
Apr 24, 2026
39.25Accuracy (Normalized)
10
Apr 23, 2026
82.1PIQA Accuracy (Zero-shot)
10
Mar 27, 2026
52.92Average Accuracy (8 Tasks)
10
Mar 25, 2026
58.47Accuracy
10
Mar 24, 2026
74.1Accuracy
10
Mar 24, 2026
77.82Accuracy
10
Mar 24, 2026
81.15Accuracy
10
Mar 24, 2026
64.6CLCall Score
10
Mar 6, 2026
64.4Accuracy
10
Mar 4, 2026
3.476LIS
10
Feb 26, 2026
66.1Reasoning Accuracy
10
Feb 26, 2026