Instruction Following on AlpacaEval GPT-4 (test)
31.3AlpacaEval Win Rate (GPT-4)AOT unpaired
Evaluation Results
| Method | Links | |
|---|---|---|
| AOT unpairedAlignment Algorithm=AOT, Training Data Type=Unpaired, Base Model=Merlinite-7B, LLM Judge=GPT-42024.06 | 31.3 | |
| AOT pairedAlignment Algorithm=AOT, Training Data Type=Paired, Base Model=Merlinite-7B, LLM Judge=GPT-42024.06 | 29.9 | |
| IPOAlignment Algorithm=IPO, Training Data Type=Paired, Base Model=Merlinite-7B, LLM Judge=GPT-42024.06 | 27.7 | |
| DPOAlignment Algorithm=DPO, Training Data Type=Paired, Base Model=Merlinite-7B, LLM Judge=GPT-42024.06 | 27.4 | |
| KTOAlignment Algorithm=KTO, Training Data Type=Unpaired, Base Model=Merlinite-7B, LLM Judge=GPT-42024.06 | 24.9 | |
| Merlinite-7BAlignment Algorithm=None (SFT), Training Data Type=None, Base Model=Merlinite-7B, LLM Judge=GPT-42024.06 | 17.1 | |
| OursBackbone=Mistral-7B-v0.32026.04 | 1.261 | |
| IFDBackbone=Mistral-7B-v0.32026.04 | 1.248 | |
| SelectITBackbone=Mistral-7B-v0.32026.04 | 1.227 | |
| OursBackbone=Llama3.1-8B2026.04 | 1.215 | |
| NUGGETSBackbone=Mistral-7B-v0.32026.04 | 1.201 | |
| IFDBackbone=Llama3.1-8B2026.04 | 1.198 | |
| SelectITBackbone=Llama3.1-8B2026.04 | 1.146 | |
| NUGGETSBackbone=Llama3.1-8B2026.04 | 1.133 | |
| DEITABackbone=Mistral-7B-v0.32026.04 | 1.099 | |
| DEITABackbone=Llama3.1-8B2026.04 | 1.076 | |
| FullBackbone=Llama3.1-8B2026.04 | 1 | |
| FullBackbone=Mistral-7B-v0.32026.04 | 1 |