Instruction Following on MT-Bench short-context
8.13MT-Bench Scoreofficially post-trained
Evaluation Results
| Method | Links | |
|---|---|---|
| officially post-trainedBackbone=Llama-3.1-8B2024.10 | 8.13 | |
| officially post-trainedBackbone=GLM-4-9B2024.10 | 8.09 | |
| DPO w/ SRMBackbone=Llama-3.1-8B2024.10 | 7.58 | |
| DPO w/ ContrastBackbone=Llama-3.1-8B2024.10 | 7.58 | |
| DPO w/ LongRewardBackbone=GLM-4-9B2024.10 | 7.58 | |
| DPO w/ ContrastBackbone=GLM-4-9B2024.10 | 7.54 | |
| DPO w/ SRMBackbone=GLM-4-9B2024.10 | 7.5 | |
| SFTBackbone=GLM-4-9B2024.10 | 7.37 | |
| DPO w/ LongRewardBackbone=Llama-3.1-8B2024.10 | 7.24 | |
| SFTBackbone=Llama-3.1-8B2024.10 | 7.12 |