Pairwise Ranking on LFQA
77.24Pairwise Preference AccuracyClaude-3.5 Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-3.5 Sonnet2024.12 | 77.24 | |
| GPT-4o2024.12 | 76.54 | |
| LMUNIT LLaMA3.1-70B-Decomposed-WeightedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true, Bayesian optimization=true, Weighting Strategy=Weighted2024.12 | 76.53 | |
| LMUNIT LLaMA3.1-70BBase Model Architecture=LLaMA-3.1-70B2024.12 | 76.15 | |
| SFR-LLaMA-3.1-70B-JudgeBase Model Architecture=LLaMA-3.1-70B2024.12 | 75 | |
| LMUNIT LLaMA3.1-70B-DecomposedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true2024.12 | 74.62 | |
| Prometheus-2-8x7BBase Model Architecture=Mistral-8x7B2024.12 | 74.23 | |
| Prometheus-2-7BBase Model Architecture=Llama-2-7B2024.12 | 72.31 | |
| Prometheus-2-BGB-8x7B2024.12 | 71.54 | |
| LMUNIT LLaMA3.1-8BBase Model Architecture=LLaMA-3.1-8B2024.12 | 71.54 | |
| SFR-LLaMA-3.1-8B-JudgeBase Model Architecture=LLaMA-3.1-8B2024.12 | 68.85 | |
| Skywork-Critic-Llama-3.1-8BBase Model Architecture=LLaMA-3.1-8B2024.12 | 64.23 | |
| Llama-3-OffsetBias-8BBase Model Architecture=Llama-3-8B2024.12 | 63.08 |