Language Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
2.9Perplexity
287
May 19, 2026
5.52Perplexity
278
Jun 5, 2026
3.53Perplexity
54
Mar 27, 2026
7Generative Perplexity (Llama2)
42
Jun 9, 2026
1Perplexity (PPL)
41
May 27, 2026
27.16Accuracy
35
Feb 26, 2026
24.89Accuracy
35
Feb 26, 2026
15.35Accuracy
35
Feb 26, 2026
65.5Accuracy
35
Feb 26, 2026
186.79Generative PPL
20
May 27, 2026
3.319Perplexity
16
Apr 23, 2026
19.2OLMo Perplexity
15
Feb 26, 2026
95.9General Score
14
Mar 30, 2026
51.1Score
14
Mar 30, 2026
77.3Score
14
Mar 30, 2026
19.4ROUGE-L
14
Mar 5, 2026
23.4ROUGE-L
14
Mar 5, 2026
29.7ROUGE-L
14
Mar 5, 2026
61.38ROUGE-1
12
Mar 12, 2026
62.67ROUGE-1
12
Mar 12, 2026
67.5Win Rate
9
Jun 23, 2026
14.8GenPPL (Oracle)
9
May 25, 2026
70.5BLEU
9
May 14, 2026
6.97Perplexity
8
Apr 23, 2026
14.2OLMo Perplexity
8
Feb 26, 2026