Pair-wise comparison on EvalBias
85.9AccuracyCCE@16
Evaluation Results
| Method | Links | |
|---|---|---|
| CCE@16Model=Qwen 2.5 72B-Instruct2025.02 | 85.9 | |
| CCE@16Model=GPT-4o2025.02 | 85 | |
| CCE@16Model=Qwen 2.5 32B-Instruct2025.02 | 80.5 | |
| CCE-random@16Model=GPT-4o2025.02 | 80.1 | |
| CCE@16Model=Qwen 2.5 7B-Instruct2025.02 | 79.4 | |
| CCE@16Model=Llama 3.3 70B-Instruct2025.02 | 79.2 | |
| Agg@16Model=GPT-4o2025.02 | 77.9 | |
| Maj@16Model=GPT-4o2025.02 | 75.5 | |
| EvalPlanModel=GPT-4o2025.02 | 74.4 | |
| 16-CriteriaModel=GPT-4o2025.02 | 73.7 | |
| VanillaModel=Qwen 2.5 32B-Instruct2025.02 | 71.1 | |
| VanillaModel=Llama 3.3 70B-Instruct2025.02 | 70.6 | |
| LongPromptModel=GPT-4o2025.02 | 70.5 | |
| VanillaModel=GPT-4o2025.02 | 68.5 | |
| VanillaModel=Qwen 2.5 72B-Instruct2025.02 | 68.5 | |
| VanillaModel=Qwen 2.5 7B-Instruct2025.02 | 57.4 |