Natural Language Processing
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
61.4Accuracy
42
Feb 26, 2026
88.9Average Accuracy
38
Apr 3, 2026
85.8RTE
18
Feb 26, 2026
0.007Cost per 1K Requests ($)
15
Feb 26, 2026
60.6Accuracy
14
Feb 26, 2026
34.69AN'
14
Feb 26, 2026
77.97AN Score
14
Feb 26, 2026
47.6Accuracy
13
Jul 7, 2026
70.03Macro Avg Score
13
Feb 26, 2026
65.84Macro Avg Score
13
Feb 26, 2026
59.88Macro Avg Score
13
Feb 26, 2026
76.27Macro Avg Score
13
Feb 26, 2026
64.24Macro Avg Score
13
Feb 26, 2026
51.5ANLI Accuracy
12
Feb 26, 2026
88.9Accuracy (%)
12
Feb 26, 2026
82.21Accuracy
10
Feb 26, 2026
73.1Average Accuracy
10
Feb 26, 2026
-0.37Accuracy Degradation (%)
9
May 25, 2026
80.9Red Score
8
Feb 26, 2026
71Closed-book QA
7
Feb 26, 2026
95SST-2 Accuracy
6
May 4, 2026
90.5Paraphrasing Accuracy
6
Feb 26, 2026
0.805Paraphrasing Score
6
Feb 26, 2026
68.1Accuracy
6
Feb 26, 2026
94.77Accuracy
4
Jun 15, 2026