Open-ended Generation on AlpacaEval 2.0
648Win RateLLAMA-2-CHAT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LLAMA-2-CHATBackbone=LLAMA-2-7B-BASE2024.05 | 648 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less BBH ICL, Number of training examples=13,5332024.05 | 356 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Alpaca 5k, Number of training examples=5,3052024.05 | 329 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less Tydiqa, Number of training examples=13,5332024.05 | 288 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less BBH ICL, Number of training examples=13,5332024.05 | 287 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 9k, Number of training examples=9,2292024.05 | 284 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 9k, Number of training examples=9,2292024.05 | 267 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less Tydiqa, Number of training examples=13,5332024.05 | 258 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=LIMA, Number of training examples=1,0302024.05 | 258 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=LIMA, Number of training examples=1,0302024.05 | 247 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Alpaca 5k, Number of training examples=5,3052024.05 | 246 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 3k, Number of training examples=2,9962024.05 | 244 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=LIMA, Number of training examples=1,0302024.05 | 243 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Alpaca 5k, Number of training examples=5,3052024.05 | 237 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less BBH ICL, Number of training examples=13,5332024.05 | 236 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 9k, Number of training examples=9,2292024.05 | 228 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 3k, Number of training examples=2,9962024.05 | 203 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Alpagasus Dolly 3k, Number of training examples=2,9962024.05 | 200 | — | |
| IMBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less MMLU Chat, Number of training examples=13,5332024.05 | 193 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less Tydiqa, Number of training examples=13,5332024.05 | 188 | — | |
| ITBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less MMLU Chat, Number of training examples=13,5332024.05 | 120 | — | |
| NEFTUNEBackbone=LLAMA-2-7B-BASE, Instruction Tuning Dataset=Less MMLU Chat, Number of training examples=13,5332024.05 | 106 | — | |
| PAD w/ LPPDModel Family=GEMMA-2, Backbone Size=2B2025.02 | 59.5 | 49.62 | |
| PAD w/ LVPDModel Family=GEMMA-2, Backbone Size=2B2025.02 | 57.94 | 46.13 | |
| PROModel Family=GEMMA-2, Backbone Size=2B2025.02 | 56.48 | 45.87 | |
| SimPOModel Family=GEMMA-2, Backbone Size=2B2025.02 | 54.16 | 44.94 | |
| DPOModel Family=GEMMA-2, Backbone Size=2B2025.02 | 54.02 | 43.77 | |
| MiniLLMModel Family=GEMMA-2, Backbone Size=2B2025.02 | 48.32 | 42.97 | |
| SeqKDModel Family=GEMMA-2, Backbone Size=2B2025.02 | 46.44 | 42.91 | |
| Standard KDModel Family=GEMMA-2, Backbone Size=2B2025.02 | 45.24 | 41.67 | |
| TeacherModel Family=GEMMA-2, Backbone Size=9B2025.02 | 42.5 | 55.27 | |
| StudentModel Family=GEMMA-2, Backbone Size=2B2025.02 | 41.99 | 39.51 | |
| TeacherModel Family=LLAMA-3, Backbone Size=8B2025.02 | 38.93 | 37.01 | |
| PAD w/ LPPDModel Family=LLAMA-3, Backbone Size=3B2025.02 | 32.55 | 33.61 | |
| SimPOModel Family=LLAMA-3, Backbone Size=3B2025.02 | 32.46 | 32.74 | |
| PAD w/ LVPDModel Family=LLAMA-3, Backbone Size=3B2025.02 | 32.34 | 32.71 | |
| PROModel Family=LLAMA-3, Backbone Size=3B2025.02 | 32.23 | 32.11 | |
| DPOModel Family=LLAMA-3, Backbone Size=3B2025.02 | 32.01 | 31.42 | |
| MiniLLMModel Family=LLAMA-3, Backbone Size=3B2025.02 | 30.38 | 30.05 | |
| SeqKDModel Family=LLAMA-3, Backbone Size=3B2025.02 | 30.04 | 29.48 | |
| Standard KDModel Family=LLAMA-3, Backbone Size=3B2025.02 | 29.6 | 29.11 | |
| StudentModel Family=LLAMA-3, Backbone Size=3B2025.02 | 29.02 | 27.82 | |
| DPO-PoP-randomBackbone=Llama-3.2-3b, Avg Len=1846 ± 202025.09 | 13.69 | 14.24 | |
| DPO-PoP-iterBackbone=Llama-3.2-3b, Avg Len=1919 ± 502025.09 | 12.26 | 12.3 | |
| DPO-margin-gtBackbone=Llama-3.2-3b, Avg Len=1915 ± 422025.09 | 12.17 | 12.4 | |
| DPO-margin-1Backbone=Llama-3.2-3b, Avg Len=1823 ± 292025.09 | 11.51 | 11.74 | |
| Vanilla-DPOBackbone=Llama-3.2-3b, Avg Len=1800 ± 172025.09 | 11.37 | 11.74 | |
| DPO-margin-gt-scaledBackbone=Llama-3.2-3b, Avg Len=1836 ± 192025.09 | 10.97 | 10.99 | |
| LLAMA-2-BASEBackbone=LLAMA-2-7B-BASE2024.05 | 1 | — | |
| Llama3.1-8B-InstructDPO Setting=Original (None), Reward Model=N/A2026.02 | — | 33.1 | |
| Offline DPO with WILDREWARDDPO Setting=Offline, Reward Model=WILDREWARD2026.02 | — | 33.8 | |
| Online DPO with ArmoRMDPO Setting=Online, Reward Model=ArmoRM2026.02 | — | 37.9 | |
| Online DPO with WILDREWARDDPO Setting=Online, Reward Model=WILDREWARD2026.02 | — | 41.3 |