Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
1Average Code Length
5
Mar 16, 2026
87.3Accuracy
5
Mar 9, 2026
5Exact Match Flexible-Extract Acc
5
Feb 26, 2026
0.41BLEU
5
Feb 26, 2026
25BLEU
5
Feb 26, 2026
91.85Score
5
Feb 26, 2026
54.53Accuracy
5
Feb 26, 2026
72.84AQUA Accuracy
5
Feb 26, 2026
96.27Acc (Single Supporting Fact)
5
Feb 26, 2026
81.4Accuracy
4
Jul 7, 2026
80.5Accuracy
4
Jul 7, 2026
95.5Accuracy
4
Jul 7, 2026
94.2Accuracy
4
Jul 7, 2026
92.2Accuracy
4
Jul 7, 2026
76.23Score
4
Jun 16, 2026
84.3Overall Accuracy
4
Jun 4, 2026
68.5Overall Score
4
Jun 4, 2026
6,763.8Avg Length
4
Jun 4, 2026
27.9TPS
4
Jun 4, 2026
97.14Minimum Score
4
Jun 1, 2026
79Pass@1
4
May 28, 2026
38.3Accuracy (BBH-LB)
4
May 27, 2026
72.27Average @5
4
May 21, 2026
56.67Avg@5
4
May 21, 2026
79.3Accuracy (val)
4
May 18, 2026