Question Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
24.59BLEU-4
6
Feb 26, 2026
0.211BLEU-3
6
Feb 26, 2026
58.73Conformity Score
5
Jun 16, 2026
44.26BLEU-1
5
Feb 26, 2026
41.87BLEU-1
5
Feb 26, 2026
53Grammaticality Wins
5
Feb 26, 2026
35.45QAE EM
5
Feb 26, 2026
37.18QAE EM
5
Feb 26, 2026
19.57BLEU
4
Feb 26, 2026
19.58BLEU
4
Feb 26, 2026
74Well-formed Rate (Yes)
4
Feb 26, 2026
2.91Grammar
3
Jun 5, 2026
1.95Fluency
3
Mar 24, 2026
44.26BLEU-1
3
Feb 26, 2026
41.87BLEU-1
3
Feb 26, 2026
4.53Syntactic Score
3
Feb 26, 2026
34.9F1 BLEU-1
3
Feb 26, 2026
83.4F1-BLEU-1
3
Feb 26, 2026
17.3B-1
3
Feb 26, 2026
49.7Diversity Win
3
Feb 26, 2026
29.15ROUGE-1
2
Feb 26, 2026
45.26ROUGE-1
2
Feb 26, 2026
4.83Fluency Score
2
Feb 26, 2026
56Well-formed: Yes
2
Feb 26, 2026
42.7Factuality
2
Feb 26, 2026