Dialogue Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3.77BLEU
48
May 21, 2026
98.7ASR Accuracy
32
Apr 28, 2026
2.31Persona Consistency
27
Jun 12, 2026
9.12Distinct-1
26
Feb 26, 2026
0.14BLEU-1
20
Feb 26, 2026
3.38BLEU
20
Apr 15, 2026
16.4F1 Score
19
Feb 26, 2026
86.37Acc T
18
Feb 26, 2026
15.05Rouge-L
16
May 12, 2026
11.31Rouge-L
16
May 12, 2026
23.2Rouge-L
16
May 12, 2026
19.82Rouge-L
16
May 12, 2026
24.19ROUGE-L
16
May 12, 2026
69.07Average Preference Score
16
Feb 26, 2026
38.46BLEU-1
16
Feb 26, 2026
5BLEU-2
16
Feb 26, 2026
12.9Dialogue Avg F1
15
Feb 26, 2026
27.63ROUGE-L
13
Mar 12, 2026
1.2PPL
13
Feb 26, 2026
17.74BLEU-1
13
Feb 26, 2026
27.29BLEU-1
13
Feb 26, 2026
36.03PPL
13
Feb 26, 2026
89.5Hits@1
13
Feb 26, 2026
80.2ToM Score (Judge: Llama-3.3-70B)
12
Apr 14, 2026
0.751ToM (Llama-3.3-70B)
12
Apr 14, 2026