Pairwise Comparison on AlignBench
74.69AgreementGPT-4
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4Setting=Referenced2023.11 | 74.69 | 86.75 | |
| CRITIQUELLMSetting=Referenced2023.11 | 70.56 | 89.25 | |
| GPT-4Setting=Reference-Free2023.11 | 70.25 | 84.88 | |
| Mixtral-8x7BSetting=Referenced2023.11 | 61.69 | 74.06 | |
| CRITIQUELLMSetting=Reference-Free2023.11 | 58.81 | 83.06 | |
| Mixtral-8x7BSetting=Reference-Free2023.11 | 53.88 | 72.25 | |
| JudgeLM-13BSetting=Reference-Free2023.11 | 42.5 | 66 | |
| Qwen-14B-ChatSetting=Reference-Free2023.11 | 42.06 | 58.75 | |
| Llama-2-70B-ChatSetting=Reference-Free2023.11 | 41.38 | 64.19 | |
| Llama-2-70B-ChatSetting=Referenced2023.11 | 40.56 | 57.13 | |
| ChatGPTSetting=Reference-Free2023.11 | 39.56 | 53.94 | |
| Baichuan2-13B-ChatSetting=Referenced2023.11 | 35.81 | 50.06 | |
| Qwen-14B-ChatSetting=Referenced2023.11 | 33.81 | 43.25 | |
| ChatGPTSetting=Referenced2023.11 | 32.5 | 38.56 | |
| Baichuan2-13B-ChatSetting=Reference-Free2023.11 | 27.06 | 40.82 | |
| AUTO-J-Bilingual-6BSetting=Reference-Free2023.11 | 26 | 45.38 | |
| ChatGLM3-6BSetting=Reference-Free2023.11 | 24.75 | 42.88 | |
| ChatGLM3-6BSetting=Referenced2023.11 | 17.75 | 31.84 |