Dialogue
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
9.3MT-Bench Score
67
Jul 1, 2026
8.36GPT-4 Score
46
Feb 26, 2026
80.2IFEval
34
May 22, 2026
64.2AlpacaEval2 Score
34
May 22, 2026
13.7F1 Score
24
Feb 26, 2026
77.79PandaLM
18
Feb 26, 2026
73.53Response Word Count
16
Feb 26, 2026
4.18Speedup
12
Apr 15, 2026
82.5Win Rate (0% Flip)
10
Jul 7, 2026
14.99R-1
10
Feb 26, 2026
14.77F1 Score
8
Feb 26, 2026
0.173Spearman's Rho
7
Apr 13, 2026
5.36BLEU (Month 9)
6
Feb 27, 2026
4.68BLEU (Month 9)
6
Feb 27, 2026
8.84Fluency
5
Feb 26, 2026
47.3Lexical Coverage
4
Jun 2, 2026
194TPS (tok/s)
4
May 7, 2026
24.52BLEU-1
4
Feb 26, 2026
76.3Score
3
Apr 20, 2026
124.2Score
3
Apr 20, 2026
69.1Understanding Score
3
Apr 20, 2026
93.1Score
3
Apr 20, 2026
92.2Accuracy
2
Mar 27, 2026
9.3Accuracy (%)
2
Mar 27, 2026