LLM-as-a-Judge on Preference Bench (test)
2.82Std DevCalibraEval
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CalibraEvalBackbone=ChatGPT2024.10 | 2.82 | 85.98 | |
| ChatGPTBackbone=ChatGPT, Configuration=Vanilla2024.10 | 3.04 | 85.61 | |
| Llama-3-8BBackbone=Llama-3-8B, Configuration=Vanilla2024.10 | 3.36 | 83.43 | |
| CalibraEvalBackbone=Llama-3-8B2024.10 | 3.42 | 83.98 | |
| PrideBackbone=ChatGPT2024.10 | 3.51 | 85.68 | |
| PrideBackbone=Llama-3-8B2024.10 | 4.35 | 83.24 | |
| CalibraEvalBackbone=Qwen-14B2024.10 | 5.12 | 83.88 | |
| PrideBackbone=Qwen-14B2024.10 | 7.36 | 83.55 | |
| Qwen-14BBackbone=Qwen-14B, Configuration=Vanilla2024.10 | 11.99 | 80.68 |