Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3.84Perplexity
205
Jul 9, 2026
13.1Perplexity
192
Mar 23, 2026
5.33Perplexity
190
Jul 2, 2026
4.73Perplexity (BVS)
179
Jul 2, 2026
46.64Perplexity
178
Feb 26, 2026
7.11PPL
157
Jun 30, 2026
7.21Wikitext PPL
151
Jul 9, 2026
3.43Perplexity (PPL)
149
Mar 20, 2026
5.47Perplexity (PPL)
146
Jun 25, 2026
2.36PPL
145
Apr 15, 2026
8.32PPL
141
May 25, 2026
6.19Perplexity
135
May 28, 2026
78.4Accuracy
134
Jun 12, 2026
2.53Perplexity
132
Jul 7, 2026
2.33Perplexity
130
Jun 15, 2026
14.72Perplexity
130
Apr 23, 2026
20.25Test Perplexity
125
Jun 1, 2026
2.55C4 Loss
121
Mar 27, 2026
2.609Validation Loss
118
Jul 3, 2026
79.4Accuracy
114
Jun 29, 2026
2.42Perplexity
113
Feb 26, 2026
9.765Perplexity
112
May 19, 2026
20.26Perplexity
110
Jun 5, 2026
4Perplexity
109
Jun 2, 2026
4.88Perplexity
105
May 12, 2026