Pair-wise comparison on RewardBench
93.7AccuracyCCE@16
Evaluation Results
| Method | Links | |
|---|---|---|
| CCE@16Model=Qwen 2.5 72B-Instruct2025.02 | 93.7 | |
| LMUNIT LLaMA3.1-70B-Decomposed-WeightedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true, Bayesian optimization=true, Weighting Strategy=Weighted2024.12 | 93.45 | |
| SFR-LLaMA-3.1-70B-JudgeBase Model Architecture=LLaMA-3.1-70B2024.12 | 92.7 | |
| CCE@16Model=GPT-4o2025.02 | 91.8 | |
| CCE@16Model=Llama 3.3 70B-Instruct2025.02 | 91.7 | |
| LMUNIT LLaMA3.1-70BBase Model Architecture=LLaMA-3.1-70B2024.12 | 91.56 | |
| CCE-random@16Model=GPT-4o2025.02 | 91.2 | |
| CCE@16Model=Qwen 2.5 32B-Instruct2025.02 | 90.8 | |
| LMUNIT LLaMA3.1-70B-DecomposedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true2024.12 | 90.54 | |
| Skywork-Critic-Llama-3.1-8BBase Model Architecture=LLaMA-3.1-8B2024.12 | 89 | |
| EvalPlanModel=GPT-4o2025.02 | 88.7 | |
| SFR-LLaMA-3.1-8B-JudgeBase Model Architecture=LLaMA-3.1-8B2024.12 | 88.7 | |
| Agg@16Model=GPT-4o2025.02 | 88.1 | |
| Maj@16Model=GPT-4o2025.02 | 87.9 | |
| VanillaModel=Qwen 2.5 32B-Instruct2025.02 | 87.4 | |
| 16-CriteriaModel=GPT-4o2025.02 | 87.3 | |
| LongPromptModel=GPT-4o2025.02 | 86.9 | |
| VanillaModel=Llama 3.3 70B-Instruct2025.02 | 86.4 | |
| VanillaModel=GPT-4o2025.02 | 85.2 | |
| VanillaModel=Qwen 2.5 72B-Instruct2025.02 | 85.2 | |
| GPT-4o2024.12 | 84.6 | |
| Claude-3.5 Sonnet2024.12 | 84.23 | |
| Llama-3-OffsetBias-8BBase Model Architecture=Llama-3-8B2024.12 | 84 | |
| LMUNIT LLaMA3.1-8BBase Model Architecture=LLaMA-3.1-8B2024.12 | 83.23 | |
| CCE@16Model=Qwen 2.5 7B-Instruct2025.02 | 80.4 | |
| VanillaModel=Qwen 2.5 7B-Instruct2025.02 | 78.2 | |
| Prometheus-2-8x7BBase Model Architecture=Mistral-8x7B2024.12 | 74.5 | |
| Prometheus-2-7BBase Model Architecture=Llama-2-7B2024.12 | 72 | |
| Prometheus-2-BGB-8x7B2024.12 | 68.3 |