Instruction Following on MT-Bench GPT-4o judge (test)
7.76MT-Bench ScoreScaleBiO
Evaluation Results
| Method | Links | |
|---|---|---|
| ScaleBiOModel=Qwen-2-7B2024.06 | 7.76 | |
| ScaleBiOModel=Gemma-2-9B2024.06 | 7.51 | |
| RHO-LOSSModel=Gemma-2-9B2024.06 | 7.38 | |
| RHO-LOSSModel=Qwen-2-7B2024.06 | 7.34 | |
| LESSModel=Gemma-2-9B2024.06 | 7.2 | |
| LESSModel=Qwen-2-7B2024.06 | 7.18 | |
| ScaleBiOModel=Llama-3-8B2024.06 | 7.12 | |
| RHO-LOSSModel=Llama-3-8B2024.06 | 6.89 | |
| Uniform WeightingModel=Qwen-2-7B2024.06 | 6.66 | |
| Uniform WeightingModel=Llama-3-8B2024.06 | 6.11 | |
| LESSModel=Llama-3-8B2024.06 | 6.06 | |
| Uniform WeightingModel=Gemma-2-9B2024.06 | 5.31 |