Human Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
70Win Rate
36
Apr 3, 2026
6.18Score
9
May 20, 2026
31Wins
6
Mar 31, 2026
7.66Faithfulness
6
Feb 26, 2026
8.35Faithfulness Score
6
Feb 26, 2026
7.83Faithfulness Score
6
Feb 26, 2026
1,610.1Elo Rating
5
Jun 4, 2026
95Readability (Win/Tie Rate)
5
May 29, 2026
62Win Rate (Expert 1)
5
Feb 26, 2026
84.6Win Rate (SCENA Preferred)
4
Jun 18, 2026
61Rank Preference Rate
4
Mar 27, 2026
0.86Trustworthiness
4
Feb 26, 2026
1.5Consistency Rank
3
Jul 3, 2026
3.88Rapport Score R1
3
Jun 18, 2026
93Win Rate
3
Jun 4, 2026
97Win Rate
3
Jun 4, 2026
85Win Rate
3
Jun 4, 2026
3.78Contributed Success
3
Apr 13, 2026
89.2Accuracy
3
Feb 26, 2026
98Clarity
3
Feb 26, 2026
0.65Win Rate
3
Feb 26, 2026
0.865Success Rate
3
Feb 26, 2026
59Win Rate
3
Feb 26, 2026
18Preference: FiD
3
Feb 26, 2026
77.5Win Rate
2
Jun 15, 2026