Direct Assessment on Flask
0.7203Pearson Correlation CoefficientLMUNIT LLaMA3.1-70B
Evaluation Results
| Method | Links | |
|---|---|---|
| LMUNIT LLaMA3.1-70BBase Model Architecture=LLaMA-3.1-70B2024.12 | 0.7203 | |
| LMUNIT LLaMA3.1-70B-DecomposedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true2024.12 | 0.7203 | |
| LMUNIT LLaMA3.1-70B-Decomposed-WeightedBase Model Architecture=LLaMA-3.1-70B, Decomposed unit tests=true, Bayesian optimization=true, Weighting Strategy=Weighted2024.12 | 0.7203 | |
| GPT-4o2024.12 | 0.69 | |
| Claude-3.5 Sonnet2024.12 | 0.6725 | |
| SFR-LLaMA-3.1-70B-JudgeBase Model Architecture=LLaMA-3.1-70B2024.12 | 0.66 | |
| LMUNIT LLaMA3.1-8BBase Model Architecture=LLaMA-3.1-8B2024.12 | 0.6002 | |
| Prometheus-2-8x7BBase Model Architecture=Mistral-8x7B2024.12 | 0.54 | |
| SFR-LLaMA-3.1-8B-JudgeBase Model Architecture=LLaMA-3.1-8B2024.12 | 0.52 | |
| Prometheus-2-7BBase Model Architecture=Llama-2-7B2024.12 | 0.47 | |
| Prometheus-2-BGB-8x7B2024.12 | 0.31 | |
| Llama-3-OffsetBias-8BBase Model Architecture=Llama-3-8B2024.12 | 0.29 |