Instruction Following on AlpacaEval Korean
77.8Win RateCLO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLOModel=Llama-3-8B, Eval Lang=Target2025.05 | 77.8 | 15.3 | |
| CLOModel=Llama-3-8B, Eval Lang=English2025.05 | 64.4 | 12.3 | |
| SFT+DPOModel=Llama-3-8B, Eval Lang=Target2025.05 | 62.5 | — | |
| CLOModel=Mistral-7B-v0.1, Eval Lang=English2025.05 | 54.8 | 2.5 | |
| CLOModel=Qwen-2.5-3B, Eval Lang=English2025.05 | 54.8 | 2.9 | |
| CLOModel=Qwen-2.5-3B, Eval Lang=Target2025.05 | 54 | 1 | |
| CLOModel=Llama-2-13B, Eval Lang=Target2025.05 | 53.9 | 2.3 | |
| CLOModel=Llama-2-7B, Eval Lang=Target2025.05 | 53.8 | 1.3 | |
| SFT+DPOModel=Qwen-2.5-3B, Eval Lang=Target2025.05 | 53 | — | |
| SFT+DPOModel=Llama-2-7B, Eval Lang=Target2025.05 | 52.5 | — | |
| CLOModel=Llama-2-13B, Eval Lang=English2025.05 | 52.3 | 0.9 | |
| SFT+DPOModel=Mistral-7B-v0.1, Eval Lang=English2025.05 | 52.3 | — | |
| SFT+DPOModel=Llama-3-8B, Eval Lang=English2025.05 | 52.1 | — | |
| SFT+DPOModel=Qwen-2.5-3B, Eval Lang=English2025.05 | 51.9 | — | |
| SFT+DPOModel=Llama-2-13B, Eval Lang=Target2025.05 | 51.6 | — | |
| SFT+DPOModel=Llama-2-13B, Eval Lang=English2025.05 | 51.4 | — | |
| CLOModel=Mistral-7B-v0.1, Eval Lang=Target2025.05 | 51.1 | 1.1 | |
| CLOModel=Llama-2-7B, Eval Lang=English2025.05 | 51 | 0.4 | |
| SFT+DPOModel=Llama-2-7B, Eval Lang=English2025.05 | 50.6 | — | |
| SFT+DPOModel=Mistral-7B-v0.1, Eval Lang=Target2025.05 | 50 | — |