Pair-wise comparison on JudgeBench
75.7AccuracyCCE@16
Evaluation Results
| Method | Links | |
|---|---|---|
| CCE@16Model=Qwen 2.5 72B-Instruct2025.02 | 75.7 | |
| CCE@16Model=Qwen 2.5 32B-Instruct2025.02 | 70.6 | |
| CCE@16Model=GPT-4o2025.02 | 70.4 | |
| CCE@16Model=Llama 3.3 70B-Instruct2025.02 | 69.7 | |
| CCE-random@16Model=GPT-4o2025.02 | 68.9 | |
| VanillaModel=Qwen 2.5 32B-Instruct2025.02 | 68.9 | |
| Maj@16Model=GPT-4o2025.02 | 68.6 | |
| VanillaModel=Qwen 2.5 72B-Instruct2025.02 | 68.3 | |
| Agg@16Model=GPT-4o2025.02 | 67.2 | |
| VanillaModel=Llama 3.3 70B-Instruct2025.02 | 67.1 | |
| 16-CriteriaModel=GPT-4o2025.02 | 66.6 | |
| VanillaModel=GPT-4o2025.02 | 66.3 | |
| CCE@16Model=Qwen 2.5 7B-Instruct2025.02 | 64 | |
| LongPromptModel=GPT-4o2025.02 | 63.5 | |
| EvalPlanModel=GPT-4o2025.02 | 62.9 | |
| VanillaModel=Qwen 2.5 7B-Instruct2025.02 | 58.3 |