Pair-wise comparison on MTBench Human
88.9AccuracyCCE@16
Evaluation Results
| Method | Links | |
|---|---|---|
| CCE@16Model=Qwen 2.5 72B-Instruct2025.02 | 88.9 | |
| CCE@16Model=GPT-4o2025.02 | 83.6 | |
| CCE@16Model=Llama 3.3 70B-Instruct2025.02 | 83.5 | |
| CCE-random@16Model=GPT-4o2025.02 | 83.1 | |
| 16-CriteriaModel=GPT-4o2025.02 | 82.8 | |
| Agg@16Model=GPT-4o2025.02 | 82.6 | |
| Maj@16Model=GPT-4o2025.02 | 82.4 | |
| VanillaModel=GPT-4o2025.02 | 82.1 | |
| CCE@16Model=Qwen 2.5 32B-Instruct2025.02 | 82.1 | |
| LongPromptModel=GPT-4o2025.02 | 81.8 | |
| EvalPlanModel=GPT-4o2025.02 | 81.4 | |
| VanillaModel=Llama 3.3 70B-Instruct2025.02 | 81.1 | |
| VanillaModel=Qwen 2.5 72B-Instruct2025.02 | 79.5 | |
| VanillaModel=Qwen 2.5 32B-Instruct2025.02 | 79 | |
| CCE@16Model=Qwen 2.5 7B-Instruct2025.02 | 76.7 | |
| VanillaModel=Qwen 2.5 7B-Instruct2025.02 | 76.1 |