Instruction Following on AlpacaEval2 short-context
22.9AlpacaEval2 Scoreofficially post-trained
Evaluation Results
| Method | Links | |
|---|---|---|
| officially post-trainedBackbone=Llama-3.1-8B2024.10 | 22.9 | |
| officially post-trainedBackbone=GLM-4-9B2024.10 | 22.4 | |
| DPO w/ LongRewardBackbone=GLM-4-9B2024.10 | 15.4 | |
| DPO w/ ContrastBackbone=GLM-4-9B2024.10 | 14.5 | |
| DPO w/ LongRewardBackbone=Llama-3.1-8B2024.10 | 14.2 | |
| DPO w/ SRMBackbone=GLM-4-9B2024.10 | 14.2 | |
| DPO w/ ContrastBackbone=Llama-3.1-8B2024.10 | 13.8 | |
| DPO w/ SRMBackbone=Llama-3.1-8B2024.10 | 13.7 | |
| SFTBackbone=GLM-4-9B2024.10 | 12.5 | |
| SFTBackbone=Llama-3.1-8B2024.10 | 12.4 |