LLM-as-a-Judge
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
90.71Accuracy
59
Apr 23, 2026
2.24StdDev
45
Feb 26, 2026
81.4Accuracy
44
Apr 23, 2026
0.54Rstd
36
Feb 26, 2026
92.9Accuracy
31
Apr 23, 2026
84.19Accuracy
29
Mar 24, 2026
4.89Empathy
23
Jun 23, 2026
90.2Accuracy
21
Mar 24, 2026
0.87Discriminability (πi)
20
Apr 28, 2026
66.07Accuracy
20
Mar 31, 2026
59.38Accuracy
20
Mar 31, 2026
86.53Math Score
17
Jun 4, 2026
58.9Accuracy
14
Feb 26, 2026
68.13Accuracy
14
Feb 26, 2026
71.5Agreement
13
Feb 26, 2026
79.59Agreement
13
Feb 26, 2026
0.768Agreement
13
Feb 26, 2026
82.6Coverage
12
May 18, 2026
94.3Coverage
12
May 18, 2026
81.3Coverage
12
May 18, 2026
78.3Coverage
12
May 18, 2026
2.82Std Dev
9
Feb 26, 2026
2.72Std Dev (Reward)
9
Feb 26, 2026
88CG Accuracy
8
Jun 5, 2026
87.38Direct Baseline Score
8
Apr 7, 2026