Human Correlation on AgentBench
0.77Pearson rADARUBRIC-DA
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ADARUBRIC-DAMethod=AdaRubric, Variant=DA (ours), Evaluator=GPT-4o, Details=DimensionAwareFilter variant2026.03 | 0.77 | 0.767 | 0.147 | |
| ADARUBRIC-GMMethod=AdaRubric, Variant=GM (ours), Evaluator=GPT-4o2026.03 | 0.74 | 0.737 | 0.117 | |
| ADARUBRIC-WMMethod=AdaRubric, Variant=WM (ours), Evaluator=GPT-4o2026.03 | 0.72 | 0.72 | 0.1 | |
| GPT-4 DirectMethod=GPT-4 Direct, configuration=single-turn, no rubric, Evaluator=GPT-4o2026.03 | 0.62 | 0.62 | — | |
| PrometheusMethod=Prometheus2026.03 | 0.59 | 0.59 | 0.05 | |
| G-EvalMethod=G-Eval2026.03 | 0.52 | 0.517 | 0.123 | |
| BERTScoreMethod=BERTScore2026.03 | 0.41 | 0.41 | 0.23 | |
| ROUGE-LMethod=ROUGE-L2026.03 | 0.29 | 0.287 | 0.353 |