Pairwise Comparison on LLMEval
0.5098AgreementGPT-4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4Setting=Reference-Free2023.11 | 0.5098 | 0.8471 | |
| CRITIQUELLMSetting=Reference-Free2023.11 | 0.5072 | 0.8595 | |
| Mixtral-8x7BSetting=Reference-Free2023.11 | 0.4804 | 0.7902 | |
| JudgeLM-13BSetting=Reference-Free2023.11 | 0.4477 | 0.7582 | |
| Qwen-14B-ChatSetting=Reference-Free2023.11 | 0.4281 | 0.6961 | |
| ChatGPTSetting=Reference-Free2023.11 | 0.4007 | 0.6458 | |
| Llama-2-70B-ChatSetting=Reference-Free2023.11 | 0.4 | 0.685 | |
| ChatGLM3-6BSetting=Reference-Free2023.11 | 0.2856 | 0.517 | |
| AUTO-J-Bilingual-6BSetting=Reference-Free2023.11 | 0.2758 | 0.5556 | |
| Baichuan2-13B-ChatSetting=Reference-Free2023.11 | 0.2353 | 0.4327 |