Multiple-choice Question Answering
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.98Calibration Threshold (q-hat)
8
Apr 10, 2026
0.126Calibration Threshold (q-hat)
8
Apr 10, 2026
0.973Calibration Threshold (q-hat)
8
Apr 10, 2026
0.99Calibration Threshold (q-hat)
8
Apr 10, 2026
0.997Calibration Threshold (q-hat)
8
Apr 10, 2026
0.995Calibration Threshold (q-hat)
8
Apr 10, 2026
79.63Accuracy (MMLU Basque)
8
Mar 16, 2026
82.68Accuracy
8
Mar 16, 2026
84.6Accuracy
8
Mar 16, 2026
80.45Accuracy
8
Mar 16, 2026
93.52Accuracy
8
Mar 16, 2026
63.5Accuracy
8
Feb 26, 2026
66.5Accuracy
8
Feb 26, 2026
78.8Exact Accuracy
8
Feb 26, 2026
72Exact Accuracy
8
Feb 26, 2026
72.1Accuracy (Remember)
8
Feb 26, 2026
72.9Remember Accuracy
8
Feb 26, 2026
75.6Remember Accuracy
8
Feb 26, 2026
71.7Accuracy (8f)
8
Feb 26, 2026
82.2Accuracy
8
Feb 26, 2026
78Accuracy
7
Jun 16, 2026
38.4Accuracy
7
Jun 11, 2026
39.6Accuracy
7
Jun 11, 2026
87.4Accuracy
7
Mar 30, 2026
81.8Accuracy
7
Mar 30, 2026