Model Performance Evaluation on Table 1 Aggregate excluding Human-Internal
79.74Average ScoreLMUNIT LLaMA3.1-70B-Decomposed-Weighted
Evaluation Results
| Method | Links | |
|---|---|---|
| LMUNIT LLaMA3.1-70B-Decomposed-WeightedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true, Bayesian optimization=true, Weighting Strategy=Weighted2024.12 | 79.74 | |
| LMUNIT LLaMA3.1-70BBase Model Architecture=LLaMA-3.1-70B2024.12 | 79.29 | |
| LMUNIT LLaMA3.1-70B-DecomposedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true2024.12 | 78.78 | |
| SFR-LLaMA-3.1-70B-JudgeBase Model Architecture=LLaMA-3.1-70B2024.12 | 78.26 | |
| GPT-4o2024.12 | 77.59 | |
| Claude-3.5 Sonnet2024.12 | 76.43 | |
| LMUNIT LLaMA3.1-8BBase Model Architecture=LLaMA-3.1-8B2024.12 | 74.1 | |
| SFR-LLaMA-3.1-8B-JudgeBase Model Architecture=LLaMA-3.1-8B2024.12 | 72.27 | |
| Prometheus-2-8x7BBase Model Architecture=Mistral-8x7B2024.12 | 68.52 | |
| Prometheus-2-BGB-8x7B2024.12 | 59.74 | |
| Prometheus-2-7BBase Model Architecture=Llama-2-7B2024.12 | 57.98 | |
| Llama-3-OffsetBias-8BBase Model Architecture=Llama-3-8B2024.12 | 53.85 |