Text Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3.18Perplexity
187
Jul 7, 2026
71.37BLEU (Agriculture)
144
Mar 26, 2026
4.88Perplexity
138
Jun 5, 2026
2.46Entropy
90
Jun 11, 2026
10Diversity
81
May 4, 2026
83COH Score
64
Feb 26, 2026
86.4Accuracy
63
Jun 23, 2026
11.312Gen PPL
54
Jun 1, 2026
135.92GPT-2 Perplexity
42
Jun 24, 2026
100ASR
42
Feb 26, 2026
5.33GPT2 Perplexity
41
Apr 14, 2026
68.11Perplexity (PPL)
39
Jul 7, 2026
57.96Accuracy
36
Feb 26, 2026
7.61Unigram Entropy
35
Jun 24, 2026
11.9PPL
33
Feb 26, 2026
525.5Throughput (tok/s)
31
Feb 26, 2026
22.099Generative Perplexity
30
Jul 2, 2026
104.44Perplexity (GPT-2)
30
Jun 24, 2026
95.56LLaMA-3 Perplexity
30
Jun 24, 2026
57.2BLEU-1
26
Feb 26, 2026
1,094.6Throughput (TPS)
25
Jun 18, 2026
74.49Accuracy
23
May 29, 2026
32.88Perplexity
23
Apr 14, 2026
2.33SD Score
21
Apr 15, 2026
57.83BS Score
20
May 11, 2026