LLM-as-a-Judge
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LLM-as-a-Judge (10-fold cross-validation)
88CG Accuracy
8
LLM-as-a-judge residual-mismatch Λ=128000 (test)
4,023.4Mean Cost-Weighted Pseudo-Regret
4
LLM-as-a-Judge comparison set
33.7TCRM Better Rate
1