Dialogue Generation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
26.92ROUGE-L
12
Mar 12, 2026
22.98ROUGE-L
12
Feb 26, 2026
4.81Coherence
11
May 13, 2026
85Hits@1
11
Feb 26, 2026
64.81BLEU
10
Feb 26, 2026
0.062Dist-1
10
Feb 26, 2026
17.4Token-level F1
9
May 20, 2026
8.174Respectful Tone
9
Apr 13, 2026
11.67BLEU-1
9
Feb 26, 2026
38.45BLEU
8
Jun 9, 2026
47.49BLEU
8
Jun 9, 2026
41Win Rate (vs GPT-4)
8
Feb 26, 2026
79.3Win Rate (Beaver-7b-v3.0-reward)
8
Feb 26, 2026
0.441Distinct-1
8
Feb 26, 2026
0.093BLEU-1
8
Feb 26, 2026
19.05BLEU-1
8
Feb 26, 2026
54.5MRR
8
Feb 26, 2026
0.92Timbre
7
Jun 1, 2026
2.12CER (zh)
7
Mar 27, 2026
19.5PPL
7
Feb 26, 2026
18.5PPL
7
Feb 26, 2026
3.99CS
6
May 15, 2026
34.7Attribute Relevancy
6
Feb 27, 2026
4.9BLEU
6
Feb 26, 2026
41.3Persona Controllability
6
Feb 27, 2026