Human Alignment Evaluation on Vicuna Benchmark
76.3AccuracyHuman 2
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Human 2Evaluator=Human2023.05 | 76.3 | 0.62 | |
| MEC + BPC + HITLCEvaluator=GPT-4, k=3, beta=20%2023.05 | 73.8 | 0.56 | |
| Human AverageEvaluator=Human Average2023.05 | 71.7 | 0.54 | |
| MEC + BPC + HITLCEvaluator=ChatGPT, k=3, beta=20%2023.05 | 71.3 | 0.52 | |
| Human 3Evaluator=Human2023.05 | 70 | 0.5 | |
| Human 1Evaluator=Human2023.05 | 68.8 | 0.5 | |
| MEC + BPCEvaluator=GPT-4, k=32023.05 | 62.5 | 0.37 | |
| MECEvaluator=GPT-4, k=62023.05 | 60.9 | 0.33 | |
| MECEvaluator=GPT-4, k=32023.05 | 58.7 | 0.3 | |
| MEC + BPCEvaluator=ChatGPT, k=32023.05 | 58.7 | 0.31 | |
| ECEvaluator=GPT-4, k=12023.05 | 56.5 | 0.29 | |
| MECEvaluator=ChatGPT, k=62023.05 | 55.6 | 0.27 | |
| MECEvaluator=ChatGPT, k=32023.05 | 53.2 | 0.24 | |
| VANILLAEvaluator=GPT-42023.05 | 52.7 | 0.24 | |
| ECEvaluator=ChatGPT, k=12023.05 | 52.6 | 0.23 | |
| VANILLAEvaluator=ChatGPT2023.05 | 44.4 | 0.06 |