Chat on AlpacaEval
3,213Win RateFine-tuned
Evaluation Results
| Method | Links | |
|---|---|---|
| Fine-tunedCR=1, Backbone=LLaMA3-8B, Fine-tuned Model=LLaMA3-Instruct-8B2025.04 | 3,213 | |
| IMPARTCR=32, Backbone=LLaMA3-8B, Fine-tuned Model=LLaMA3-Instruct-8B2025.04 | 1,877 | |
| Fine-tunedCR=1, Backbone=LLaMA2-13B, Fine-tuned Model=LLaMA2-Chat-13B2025.04 | 1,839 | |
| DARECR=32, Backbone=LLaMA3-8B, Fine-tuned Model=LLaMA3-Instruct-8B2025.04 | 1,776 | |
| LowRankCR=32, Backbone=LLaMA3-8B, Fine-tuned Model=LLaMA3-Instruct-8B2025.04 | 1,718 | |
| Fine-tunedCR=1, Backbone=LLaMA2-7B, Fine-tuned Model=LLaMA2-Chat-7B2025.04 | 1,563 | |
| IMPARTCR=32, Backbone=LLaMA2-13B, Fine-tuned Model=LLaMA2-Chat-13B2025.04 | 988 | |
| LowRankCR=32, Backbone=LLaMA2-13B, Fine-tuned Model=LLaMA2-Chat-13B2025.04 | 845 | |
| IMPARTCR=32, Backbone=LLaMA2-7B, Fine-tuned Model=LLaMA2-Chat-7B2025.04 | 713 | |
| LowRankCR=32, Backbone=LLaMA2-7B, Fine-tuned Model=LLaMA2-Chat-7B2025.04 | 572 | |
| DARECR=32, Backbone=LLaMA2-13B, Fine-tuned Model=LLaMA2-Chat-13B2025.04 | 227 | |
| Xwin-LM v0.1Size=70B, Align=dPPO2023.10 | 95.57 | |
| GPT-4Align=RLHF2023.10 | 95.28 | |
| TeacherTeacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 94.6 | |
| Llama2-ChatSize=70B, Align=RLHF2023.10 | 92.66 | |
| Claude 2Align=RLHF2023.10 | 91.36 | |
| ZephyrSize=7B, Align=dDPO2023.10 | 90.6 | |
| CSD (S, S)Teacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 90.05 | |
| CSD (T, S)Teacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 89.92 | |
| DistiLLM-2Teacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 89.91 | |
| DLD (S)Teacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 89.84 | |
| GPT-3.5-turboAlign=RLHF2023.10 | 89.37 | |
| Vicuna v1.3Size=33B, Align=dSFT2023.10 | 88.99 | |
| TeacherTeacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 88.69 | |
| Xwin-LM v0.1Size=7B, Align=dPPO2023.10 | 87.83 | |
| GuanacoSize=65B, Align=SFT2023.10 | 71.8 | |
| DPKDTeacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 71.18 | |
| BackboneCR=1, Backbone=LLaMA2-13B, Fine-tuned Model=LLaMA2-Chat-13B2025.04 | 71 | |
| DistiLLM-2Teacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 70.42 | |
| CSD (T, S)Teacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 70.42 | |
| DLD (T)Teacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 69.8 | |
| CSD (S, S)Teacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 69.64 | |
| DLD (S)Teacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 67.67 | |
| Falcon-InstructSize=40B, Align=dSFT2023.10 | 45.71 | |
| DARECR=32, Backbone=LLaMA2-7B, Fine-tuned Model=LLaMA2-Chat-7B2025.04 | 36 | |
| DLD (T)Teacher-Student Model Pair=Gemma2-9B-IT -> Gemma2-2B-IT, Judge=GPT4-Turbo2025.09 | 31.24 | |
| BackboneCR=1, Backbone=LLaMA2-7B, Fine-tuned Model=LLaMA2-Chat-7B2025.04 | 10 | |
| BackboneCR=1, Backbone=LLaMA3-8B, Fine-tuned Model=LLaMA3-Instruct-8B2025.04 | 8 | |
| DPKDTeacher-Student Model Pair=Qwen2.5-7B-IT -> Qwen2.5-1.5B-IT, Judge=GPT4-Turbo2025.09 | 0.32 |