Natural language generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
38.8BLEU
8
Feb 27, 2026
35.4BLEU
8
Feb 27, 2026
36.8BLEU
8
Feb 27, 2026
24.7Average Exact Match
8
Feb 26, 2026
26.7BLEU
7
Jun 24, 2026
64.2BLEU
6
Feb 26, 2026
22ROUGE-2
6
Feb 26, 2026
28.1STEM Score
5
Feb 26, 2026
5.38GFLOPs/token
5
Feb 26, 2026
56.3ROUGE-2
5
Feb 26, 2026
63.9Average NLG Score
5
Feb 27, 2026
4.68Mean Relevance
5
Feb 26, 2026
5.42Relevance (Mean)
5
Feb 26, 2026
5.14Relevance (Mean)
5
Feb 26, 2026
2.3Success
4
Jun 11, 2026
47.3Success Rate
4
Jun 11, 2026
75.8Success Rate
4
Jun 11, 2026
100TC Success
4
Feb 26, 2026
4.65GFLOPs per token
4
Feb 26, 2026
21.3ROUGE-2 (SentencePiece)
4
Feb 26, 2026
0.232ROUGE-2
4
Feb 26, 2026
25.7BLEU
4
Feb 26, 2026
6BLEU
4
Feb 26, 2026
22.2BLEU
4
Feb 26, 2026
13BLEU
4
Feb 26, 2026