Pairwise Comparison on HelpSteer2
72.3AccuracyVanilla
Evaluation Results
| Method | Links | |
|---|---|---|
| VanillaModel=Qwen 2.5 32B-Instruct2025.02 | 72.3 | |
| CCE@16Model=Qwen 2.5 32B-Instruct2025.02 | 72.1 | |
| CCE@16Model=Llama 3.3 70B-Instruct2025.02 | 71.3 | |
| CCE@16Model=GPT-4o2025.02 | 70.6 | |
| VanillaModel=Llama 3.3 70B-Instruct2025.02 | 70.4 | |
| CCE-random@16Model=GPT-4o2025.02 | 69.5 | |
| VanillaModel=Qwen 2.5 72B-Instruct2025.02 | 69.5 | |
| 16-CriteriaModel=GPT-4o2025.02 | 69.1 | |
| Maj@16Model=GPT-4o2025.02 | 68.9 | |
| Agg@16Model=GPT-4o2025.02 | 68.7 | |
| CCE@16Model=Qwen 2.5 72B-Instruct2025.02 | 68.5 | |
| LongPromptModel=GPT-4o2025.02 | 67.3 | |
| VanillaModel=GPT-4o2025.02 | 66.1 | |
| EvalPlanModel=GPT-4o2025.02 | 65.5 | |
| CCE@16Model=Qwen 2.5 7B-Instruct2025.02 | 64.2 | |
| VanillaModel=Qwen 2.5 7B-Instruct2025.02 | 60.7 |