Language Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
1Relative Runtime
8
Feb 26, 2026
10.16Perplexity (PPL)
7
Feb 26, 2026
56.18ROUGE-1
6
Mar 12, 2026
56.18Rouge-1
6
Mar 12, 2026
136.02Generation Perplexity
5
May 15, 2026
9.93Grammar
5
Feb 26, 2026
8.247NLL
4
Feb 26, 2026
92.94MAUVE
3
Jul 3, 2026
67.34Accuracy
3
Feb 26, 2026
51.9Accuracy
3
Feb 26, 2026
84.5BLEU-2
3
Feb 26, 2026
1Error Rate
2
Apr 10, 2026
0.74JSD
2
Feb 26, 2026
0.35JSD
2
Feb 26, 2026