Language Modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
5.52PPL
24
May 13, 2026
0PPL Change (%) vs Baseline
24
Apr 7, 2026
391,100Throughput (tokens/s)
24
Mar 19, 2026
9.92WikiText-2 PPL
24
Mar 6, 2026
5.45Perplexity (Mistral-7B)
24
May 27, 2026
7.3WikiText PPL
24
Apr 14, 2026
17.5PPL
23
Jun 4, 2026
15.87Perplexity
23
May 14, 2026
1.02BPC
23
Feb 26, 2026
0.6PPL Change (%) vs Baseline
22
Apr 7, 2026
9.09Perplexity
22
Mar 4, 2026
7.2Perplexity
22
Mar 4, 2026
17.54Perplexity
22
Jun 30, 2026
7.14Perplexity
22
Feb 26, 2026
3.11PPL
22
Apr 21, 2026
35.53Perplexity
22
Jun 9, 2026
52.09Perplexity
22
Jun 9, 2026
24.01Perplexity
22
Jun 9, 2026
74.11WG (Winograd Schema)
22
Feb 26, 2026
41.351Perplexity (PPL)
21
Jun 18, 2026
39.677Perplexity
21
Jun 18, 2026
159,000Throughput (tokens/s)
21
Mar 19, 2026
1.128Last Loss
21
May 26, 2026
0.685Capability Score
21
Feb 26, 2026
2.493Validation Loss
21
Feb 26, 2026