Instruction Following on AlpacaEval 2
75.4LC (%)ξ-DPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ξ-DPOBackbone=Gemma2-Instruct (9B)2026.05 | 75.4 | 67.5 | |
| SimUAPOBackbone=Gemma-2-9B-Instruct2025.09 | 73.5 | 67 | |
| AlphaDPOBackbone=Gemma2-Instruct (9B)2026.05 | 73.4 | 66.1 | |
| SimPOBackbone=Gemma-2-9B-Instruct2025.09 | 72.6 | 66.1 | |
| SimPOBackbone=Gemma2-Instruct (9B)2026.05 | 72.4 | 65 | |
| SimPOBackbone=Gemma-2-9B-Instruct, Source=Meng et al. (2024)2025.09 | 72.4 | 65.9 | |
| DPOBackbone=Gemma2-Instruct (9B)2026.05 | 70.4 | 66.9 | |
| UAPOBackbone=Gemma-2-9B-Instruct2025.09 | 70.2 | 67.7 | |
| DPOBackbone=Gemma-2-9B-Instruct2025.09 | 68.8 | 64.5 | |
| R-DPOBackbone=Gemma2-Instruct (9B)2026.05 | 68.3 | 66.9 | |
| R-DPOBackbone=Gemma-2-9B-Instruct2025.09 | 68.3 | 66.9 | |
| DPOBackbone=Gemma-2-9B-Instruct, Source=Meng et al. (2024)2025.09 | 67.8 | 65.4 | |
| Fine-tunedBase LLM=Llama-3.1-8B-Instruct, Parameters=x42026.05 | 65.4 | — | |
| Fine-tunedBase LLM=Qwen-2.5-7B-Instruct, Parameters=x42026.05 | 63.6 | — | |
| IPOBackbone=Gemma2-Instruct (9B)2026.05 | 62.6 | 58.4 | |
| IPOBackbone=Gemma-2-9B-Instruct2025.09 | 62.6 | 58.4 | |
| KTOBackbone=Gemma2-Instruct (9B)2026.05 | 61.7 | 55.5 | |
| KTOBackbone=Gemma-2-9B-Instruct2025.09 | 61.7 | 55.5 | |
| DiDi-Merg.-LBase LLM=Llama-3.1-8B-Instruct, Parameters=x2.02026.05 | 59.5 | — | |
| AlphaDPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 58.7 | 51.1 | |
| DiDi-Merg.-LBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.02026.05 | 58.7 | — | |
| ξ-DPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 57.5 | 50.5 | |
| CPOBackbone=Gemma2-Instruct (9B)2026.05 | 56.4 | 53.4 | |
| CPOBackbone=Gemma-2-9B-Instruct2025.09 | 56.4 | 53.4 | |
| ORPOBackbone=Gemma2-Instruct (9B)2026.05 | 56.2 | 46.7 | |
| ORPOBackbone=Gemma-2-9B-Instruct2025.09 | 56.2 | 46.7 | |
| SimPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 55.6 | 49.6 | |
| FREE-MergingBase LLM=Llama-3.1-8B-Instruct, Parameters=x2.082026.05 | 54.1 | — | |
| SimPOBackbone=Llama-3-8B-Instruct, Source=Meng et al. (2024)2025.09 | 53.7 | 47.5 | |
| FREE-MergingBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.082026.05 | 53.6 | — | |
| Twin-MergingBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.252026.05 | 53.3 | — | |
| Twin-MergingBase LLM=Llama-3.1-8B-Instruct, Parameters=x2.252026.05 | 52.4 | — | |
| DPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 51.9 | 50.8 | |
| R-DPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 51.6 | 50.7 | |
| SimUAPOBackbone=Llama-3-8B-Instruct2025.09 | 51.2 | 47.6 | |
| SimPOBackbone=Llama-3-8B-Instruct2025.09 | 50.1 | 45.2 | |
| RMiPOBackbone=Llama3-8B-Instruct2026.04 | 49.1 | 46.3 | |
| SFTBackbone=Gemma2-Instruct (9B)2026.05 | 48.7 | 36.5 | |
| SFTBackbone=Gemma-2-9B-Instruct2025.09 | 48.7 | 36.5 | |
| SimPERBackbone=Llama3-8B-Instruct2026.04 | 48.5 | 45.7 | |
| DPOBackbone=Llama-3-8B-Instruct, Source=Meng et al. (2024)2025.09 | 48.2 | 47.5 | |
| R-DPOBackbone=Llama-3-8B-Instruct2025.09 | 48 | 45.8 | |
| ξ-DPOBackbone=Llama3-Instruct (8B)2026.05 | 47.1 | 39.1 | |
| IPOBackbone=Llama-3-8B-Instruct2025.09 | 46.8 | 42.4 | |
| α-DPOBackbone=Llama3-8B-Instruct2026.04 | 46.6 | 38.1 | |
| AlphaDPOBackbone=Llama3-Instruct (8B)2026.05 | 46.6 | 38.1 | |
| ϵ-DPOBackbone=Llama3-8B-Instruct2026.04 | 46.4 | 44.9 | |
| SimPOBackbone=Llama3-8B-Instruct2026.04 | 44.7 | 40.5 | |
| SimPOBackbone=Llama3-Instruct (8B)2026.05 | 43.8 | 38 | |
| β-DPOBackbone=Llama3-8B-Instruct2026.04 | 43.4 | 38.2 | |
| KTOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 41.4 | 36.4 | |
| DPOBackbone=Llama-3-8B-Instruct2025.09 | 41.2 | 37.5 | |
| UAPOBackbone=Llama-3-8B-Instruct2025.09 | 41.2 | 38.3 | |
| IPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 40.6 | 39.6 | |
| DPOBackbone=Llama3-8B-Instruct2026.04 | 40.3 | 37.9 | |
| R-DPOBackbone=Llama3-Instruct (8B)2026.05 | 40.3 | 37.3 | |
| DPOBackbone=Llama3-Instruct (8B)2026.05 | 40.2 | 38.1 | |
| KTOBackbone=Llama3-Instruct (8B)2026.05 | 38.3 | 34.1 | |
| RMiPOBackbone=Mistral-7B-Instruct2026.04 | 38.1 | 37 | |
| ORPOBackbone=Llama-3-8B-Instruct2025.09 | 38.1 | 33.8 | |
| Qwen2.5-14B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 38.09 | — | |
| SimPERBackbone=Mistral-7B-Instruct2026.04 | 37.8 | 39.5 | |
| Qwen2.5-14B-ITTraining=Instruction-tuned base2025.06 | 36.91 | — | |
| CPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 36.5 | 40.8 | |
| ORPOBackbone=Llama3-Instruct v0.2 (8B)2026.05 | 36.5 | 33.1 | |
| IPOBackbone=Llama3-Instruct (8B)2026.05 | 35.9 | 34.4 | |
| IPOBackbone=Llama3-8B-Instruct2026.04 | 35.6 | 35.6 | |
| ϵ-DPOBackbone=Mistral-7B-Instruct2026.04 | 35.6 | 29.6 | |
| Qwen2.5-7B-IT + SELF-REDTEAMTraining=SELF-REDTEAM fine-tuned2025.06 | 34.93 | — | |
| Zero-shotBase LLM=Qwen-2.5-7B-Instruct, Parameters=x12026.05 | 34.2 | — | |
| CPOBackbone=Llama-3-8B-Instruct2025.09 | 34.1 | 36.4 | |
| KTOBackbone=Llama-3-8B-Instruct2025.09 | 34.1 | 32.1 | |
| OLMO2 INST.2025.06 | 33.5 | — | |
| LLAMA3.1 (Proxy Tuned)expert=OLMO2-1B-INSTRUCT, anti-expert=OLMO2-1B2025.06 | 33.5 | — | |
| Qwen2.5-7B-ITTraining=Instruction-tuned base2025.06 | 33.43 | — | |
| ξ-DPOBackbone=Mistral-Instruct (7B)2026.05 | 33.2 | 36.5 | |
| KTOBackbone=Llama3-8B-Instruct2026.04 | 33.1 | 31.8 | |
| α-DPOBackbone=Mistral-7B-Instruct2026.04 | 32.3 | 32.6 | |
| AlphaDPOBackbone=Mistral-Instruct (7B)2026.05 | 32.3 | 32.6 | |
| SimPOBackbone=Mistral-7B-Instruct2026.04 | 32.1 | 34.8 | |
| SimPOBackbone=Mistral-7B-Instruct, Source=Meng et al. (2024)2025.09 | 32.1 | 34.8 | |
| ORPOBackbone=Llama3-Instruct (8B)2026.05 | 31.6 | 29.8 | |
| SimPOBackbone=Mistral-Instruct (7B)2026.05 | 30.2 | 32.1 | |
| CPOBackbone=Llama3-Instruct (8B)2026.05 | 29.6 | 34.4 | |
| SimPOBackbone=Mistral-7B-Instruct2025.09 | 29 | 31.9 | |
| CPOBackbone=Llama3-8B-Instruct2026.04 | 28.9 | 32.2 | |
| SimUAPOBackbone=Mistral-7B-Instruct2025.09 | 28.6 | 32.2 | |
| Zero-shotBase LLM=Llama-3.1-8B-Instruct, Parameters=x12026.05 | 28.3 | — | |
| R-DPOBackbone=Mistral-7B-Instruct2025.09 | 27.3 | 24.5 | |
| SLiCBackbone=Llama3-8B-Instruct2026.04 | 26.9 | 27.5 | |
| DPOBackbone=Mistral-7B-Instruct2026.04 | 26.8 | 24.9 | |
| DPOBackbone=Mistral-7B-Instruct, Source=Meng et al. (2024)2025.09 | 26.8 | 24.9 | |
| CPOBackbone=Mistral-Instruct (7B)2026.05 | 26.2 | 31.7 | |
| InitialBackbone=Llama3-8B-Instruct2026.04 | 26 | 25.3 | |
| ϵ-DPOBackbone=Llama3-8B-Base2026.04 | 26 | 23.4 | |
| SFTBackbone=Llama-3-8B-Instruct2025.09 | 26 | 25.3 | |
| SimPERBackbone=Llama3-8B-Base2026.04 | 25.2 | 22.9 | |
| RMiPOBackbone=Llama3-8B-Base2026.04 | 25.2 | 23.6 | |
| Llama3.1-8B-ITTraining=Instruction-tuned base2025.06 | 24.74 | — | |
| α-DPOBackbone=Llama3-8B-Base2026.04 | 24.6 | 22.7 |