LLM-as-a-judge evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.689Pearson's r
36
Mar 19, 2026
0.589Pearson's r
36
Mar 19, 2026
0.949Pearson's r
36
Mar 19, 2026
83.4Score
22
Mar 4, 2026
71Pearson (r)
20
Mar 19, 2026
65.1Pearson Correlation (r)
20
Mar 19, 2026
0.605Pearson Correlation (r)
16
Feb 26, 2026
72.7Overall Score
11
Jun 12, 2026
82.7Overall Score
7
Jun 12, 2026
4.71Fluency
7
Feb 26, 2026
77.74Adjusted Accuracy
5
Jun 19, 2026
67.2Adjusted Accuracy
5
Jun 19, 2026