Instruction Following on MT-Bench
9.32MT-Bench ScoreGPT-4-1106-preview
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| GPT-4-1106-previewModel Version=1106-preview2024.05 | 9.32 | — | — | — | — | — | — | — | — | — | |
| Fine-tunedBase LLM=Llama-3.1-8B-Instruct, Parameters=x42026.05 | 9 | — | — | — | — | — | — | — | — | — | |
| Fine-tunedBase LLM=Qwen-2.5-7B-Instruct, Parameters=x42026.05 | 9 | — | — | — | — | — | — | — | — | — | |
| DiDi-Merg.-LBase LLM=Llama-3.1-8B-Instruct, Parameters=x2.02026.05 | 8.7 | — | — | — | — | — | — | — | — | — | |
| DiDi-Merg.-LBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.02026.05 | 8.7 | — | — | — | — | — | — | — | — | — | |
| EAGLE3 + DMModel=Llama-3.3-70B-Instruct, Draft length (L)=92026.02 | 8.59 | — | — | — | — | — | 4.62 | 6.89 | — | — | |
| ARIA2024.10 | 8.53 | — | — | — | — | — | — | — | — | — | |
| EAGLE3Model=Llama-3.3-70B-Instruct, Draft length (L)=92026.02 | 8.48 | — | — | — | — | — | 4.24 | 6.06 | — | — | |
| EAGLE3Model=Llama-3.3-70B-Instruct, Draft length (L)=52026.02 | 8.47 | — | — | — | — | — | 3.9 | 5.37 | — | — | |
| EAGLE3 + DMModel=Llama-3.3-70B-Instruct, Draft length (L)=72026.02 | 8.46 | — | — | — | — | — | 4.52 | 6.58 | — | — | |
| OpenAI/GPT-5Size=-2025.09 | 8.46 | — | — | — | — | — | — | — | — | — | |
| EAGLE3 + DMModel=Llama-3.3-70B-Instruct, Draft length (L)=52026.02 | 8.45 | — | — | — | — | — | 4.13 | 5.86 | — | — | |
| EAGLE3Model=Llama-3.3-70B-Instruct, Draft length (L)=72026.02 | 8.43 | — | — | — | — | — | 4.18 | 5.81 | — | — | |
| Zero-shotBase LLM=Llama-3.1-8B-Instruct, Parameters=x12026.05 | 8.4 | — | — | — | — | — | — | — | — | — | |
| Zero-shotBase LLM=Qwen-2.5-7B-Instruct, Parameters=x12026.05 | 8.4 | — | — | — | — | — | — | — | — | — | |
| GPT-3.5-Turbo-1106Model Version=11062024.05 | 8.32 | — | — | — | — | — | — | — | — | — | |
| Mixtral-8x7B-Instruct-v0.1Architecture=MoE, Size=8x7B, Version=v0.1, Mode=Instruct2024.05 | 8.3 | — | — | — | — | — | — | — | — | — | |
| FREE-MergingBase LLM=Llama-3.1-8B-Instruct, Parameters=x2.082026.05 | 8.3 | — | — | — | — | — | — | — | — | — | |
| Qwen3-235B-itSize=235B2025.09 | 8.27 | — | — | — | — | — | — | — | — | — | |
| Anthropic/Claude-Sonnet-4Size=-2025.09 | 8.26 | — | — | — | — | — | — | — | — | — | |
| CygnetBase Model=Llama-3-8B-Instruct, Training Configuration=Circuit Breaker + RepE Fine-tune2024.06 | 8.21 | — | — | — | — | — | — | — | — | — | |
| MAmmoTH2-8x7B-PlusArchitecture=MoE, Size=8x7B2024.05 | 8.2 | — | — | — | — | — | — | — | — | — | |
| Twin-MergingBase LLM=Llama-3.1-8B-Instruct, Parameters=x2.252026.05 | 8.2 | — | — | — | — | — | — | — | — | — | |
| FREE-MergingBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.082026.05 | 8.2 | — | — | — | — | — | — | — | — | — | |
| Meta-Llama-3-8B-InstructModel Type=Base Model, Base Model=Llama-3-8B2024.06 | 8.1 | 8.31 | 7.89 | — | — | — | — | — | — | — | |
| HyPO-Llama-3Algorithm=HyPO, Fine-tuned Model=Llama-3-8B2024.06 | 8.09 | 8.43 | 7.75 | — | — | — | — | — | — | — | |
| Llama-3-8B-InstructBase Model=Llama-3-8B-Instruct, Training Configuration=Refusal Trained2024.06 | 8.05 | — | — | — | — | — | — | — | — | — | |
| Llama-3-8B-InstructSize=8B, Mode=Instruct2024.05 | 8.02 | — | — | — | — | — | — | — | — | — | |
| Representation ReroutingBase Model=Llama-3-8B-Instruct, Training Configuration=+ RR2024.06 | 8 | — | — | — | — | — | — | — | — | — | |
| QEMPO-KLBase Model=Qwen2.5-7B-Instruct2026.02 | 7.96 | — | — | — | — | — | — | — | — | — | |
| MAmmoTH2-8B-PlusSize=8B2024.05 | 7.95 | — | — | — | — | — | — | — | — | — | |
| GPT-3.5-Turbo-0301Model Version=03012024.05 | 7.94 | — | — | — | — | — | — | — | — | — | |
| QEMPOBase Model=Qwen2.5-7B-Instruct2026.02 | 7.92 | — | — | — | — | — | — | — | — | — | |
| RPOSeries=gemma2024.05 | 7.916 | — | — | — | — | — | — | — | — | — | |
| RLHFBase Model=Qwen2.5-7B-Instruct2026.02 | 7.9 | — | — | — | — | — | — | — | — | — | |
| Tulu-2-DPO-70BSize=70B, Optimization=DPO2024.05 | 7.89 | — | — | — | — | — | — | — | — | — | |
| MAmmoTH2-7B-PlusSize=7B2024.05 | 7.88 | — | — | — | — | — | — | — | — | — | |
| Yi-34B-ChatSize=34B, Mode=Chat2024.05 | 7.86 | — | — | — | — | — | — | — | — | — | |
| QEMPOBase Model=Llama-3.1-8B-Instruct2026.02 | 7.84 | — | — | — | — | — | — | — | — | — | |
| SPLBase Model=Qwen2.5-7B-Instruct2026.02 | 7.82 | — | — | — | — | — | — | — | — | — | |
| RLHFBase Model=Llama-3.1-8B-Instruct2026.02 | 7.8 | — | — | — | — | — | — | — | — | — | |
| Twin-MergingBase LLM=Qwen-2.5-7B-Instruct, Parameters=x2.252026.05 | 7.8 | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-7B-InstructBase Model=Qwen2.5-7B-Instruct2026.02 | 7.78 | — | — | — | — | — | — | — | — | — | |
| Google/Gemini-2.5-ProSize=-2025.09 | 7.78 | — | — | — | — | — | — | — | — | — | |
| DPO-Llama-3Algorithm=DPO, Fine-tuned Model=Llama-3-8B2024.06 | 7.75 | 8.08 | 7.41 | — | — | — | — | — | — | — | |
| LLaMA-3.3-70B-itSize=70B2025.09 | 7.73 | — | — | — | — | — | — | — | — | — | |
| zephyr-gemma-7bSeries=gemma2024.05 | 7.719 | — | — | — | — | — | — | — | — | — | |
| DPOSeries=gemma2024.05 | 7.688 | — | — | — | — | — | — | — | — | — | |
| PixtralParameters=12B2024.10 | 7.68 | — | — | — | — | — | — | — | — | — | |
| Llama-3.1-8B-InstructBase Model=Llama-3.1-8B-Instruct2026.02 | 7.67 | — | — | — | — | — | — | — | — | — | |
| Mistral-7B-Instruct-v0.2Size=7B, Version=v0.2, Mode=Instruct2024.05 | 7.6 | — | — | — | — | — | — | — | — | — | |
| Mistral-7B-Instruct-v2Base Model=Mistral-7B-Instruct-v2, Training Configuration=Refusal Trained2024.06 | 7.6 | — | — | — | — | — | — | — | — | — | |
| Representation ReroutingBase Model=Mistral-7B-Instruct-v2, Training Configuration=+ RR2024.06 | 7.53 | — | — | — | — | — | — | — | — | — | |
| HT-MNPO (ArmoRM-Llama3)Size=9B2025.09 | 7.52 | — | — | — | — | — | — | — | — | — | |
| Llama-3.1-Tulu-3-70B-DPOSize=70B2025.09 | 7.45 | — | — | — | — | — | — | — | — | — | |
| HT-MNPO (Skywork-Reward-V2)Size=9B2025.09 | 7.4 | — | — | — | — | — | — | — | — | — | |
| RPOSeries=beta2024.05 | 7.381 | — | — | — | — | — | — | — | — | — | |
| STEPSModel=Llama-3-8B, Evaluation Protocol=Instruct, Data Sample Count=4K2026.01 | 7.35 | — | — | — | — | — | — | — | — | — | |
| QEMPO-KLBase Model=Llama-3.1-8B-Instruct2026.02 | 7.31 | — | — | — | — | — | — | — | — | — | |
| DPOSeries=beta2024.05 | 7.278 | — | — | — | — | — | — | — | — | — | |
| Ref.Series=gemma2024.05 | 7.266 | — | — | — | — | — | — | — | — | — | |
| DPO + FRBase Model=Qwen2.5, Fairness Method=Fairness Regularization2025.05 | 7.24 | — | — | — | — | — | — | — | — | — | |
| zephyr-beta-7bSeries=beta2024.05 | 7.2 | — | — | — | — | — | — | — | — | — | |
| Instruct-SkillMixModel=Llama-3-8B, Evaluation Protocol=Instruct, Data Sample Count=4K2026.01 | 7.15 | — | — | — | — | — | — | — | — | — | |
| Top-HTemperature=1.5, Model=LLaMA3.3-70B-Instruct2025.09 | 7.14 | — | — | — | — | — | — | — | — | — | |
| Min-pTemperature=1.5, Model=LLaMA3.3-70B-Instruct2025.09 | 7.11 | — | — | — | — | — | — | — | — | — | |
| Min-pTemperature=1.0, Model=LLaMA3.3-70B-Instruct2025.09 | 7.08 | — | — | — | — | — | — | — | — | — | |
| Top-HTemperature=1.0, Model=LLaMA3.3-70B-Instruct2025.09 | 7.08 | — | — | — | — | — | — | — | — | — | |
| HT-MNPO (Athene-RM-8B)Size=9B2025.09 | 7.07 | — | — | — | — | — | — | — | — | — | |
| Top-pTemperature=1.0, Model=LLaMA3.3-70B-Instruct2025.09 | 7.06 | — | — | — | — | — | — | — | — | — | |
| R-DPOBase Model=Qwen2.52025.05 | 7.05 | — | — | — | — | — | — | — | — | — | |
| Top-HTemperature=2.0, Model=LLaMA3.3-70B-Instruct2025.09 | 7.04 | — | — | — | — | — | — | — | — | — | |
| TD-MNPOSize=9B2025.09 | 7.03 | — | — | — | — | — | — | — | — | — | |
| DPO + FCBase Model=Qwen2.5, Fairness Method=Fairness Coefficient2025.05 | 7 | — | — | — | — | — | — | — | — | — | |
| INPOSize=9B2025.09 | 6.95 | — | — | — | — | — | — | — | — | — | |
| OriginalModel=Llama-3-8B, Evaluation Protocol=Instruct, Data Sample Count=-2026.01 | 6.94 | — | — | — | — | — | — | — | — | — | |
| Mixtral-8x22B-itSize=141B2025.09 | 6.9 | — | — | — | — | — | — | — | — | — | |
| DPOSize=9B2025.09 | 6.87 | — | — | — | — | — | — | — | — | — | |
| SimPOSize=9B2025.09 | 6.87 | — | — | — | — | — | — | — | — | — | |
| Llama-2-70b-chatSize=70B, Mode=Chat2024.05 | 6.86 | — | — | — | — | — | — | — | — | — | |
| SPPOSize=9B2025.09 | 6.86 | — | — | — | — | — | — | — | — | — | |
| Mistral-InstructSize=7B2024.04 | 6.84 | — | — | — | — | — | — | — | — | — | |
| ICDModel=Vicuna2024.02 | 6.81 | — | — | — | — | — | — | — | — | — | |
| ChunkFTModel=Llama 3-8B, Instruction-tuning dataset=Alpaca-GPT42026.05 | 6.8 | — | — | — | — | — | — | — | — | — | |
| Mistral+UFTTraining Data=Instruction-tuning and alignment data2024.10 | 6.78 | — | — | — | — | — | — | — | — | — | |
| NuggetsTraining Dataset=Alpaca-GPT4, Selection Ratio=10%, Base Model=LLaMA-3-8B2025.02 | 6.75 | — | — | — | — | — | — | — | — | — | |
| Top-pTemperature=1.5, Model=LLaMA3.3-70B-Instruct2025.09 | 6.75 | — | — | — | — | — | — | — | — | — | |
| DPOAlignment method=DPO, Base Model=LLaVA-1.5-13b2024.02 | 6.73 | — | — | — | — | — | — | — | — | — | |
| KTOBase Model=Qwen2.52025.05 | 6.72 | — | — | — | — | — | — | — | — | — | |
| SPLBase Model=Llama-3.1-8B-Instruct2026.02 | 6.71 | — | — | — | — | — | — | — | — | — | |
| No DefenseModel=Vicuna2024.02 | 6.7 | — | — | — | — | — | — | — | — | — | |
| DPO + FRBase Model=LLaMA3, Fairness Method=Fairness Regularization2025.05 | 6.7 | — | — | — | — | — | — | — | — | — | |
| BAdamModel=Llama 3-8B, Instruction-tuning dataset=Alpaca-GPT42026.05 | 6.7 | — | — | — | — | — | — | — | — | — | |
| NuggetsTraining Dataset=Alpaca-GPT4, Selection Ratio=15%, Base Model=LLaMA-3-8B2025.02 | 6.65 | — | — | — | — | — | — | — | — | — | |
| KTOBase Model=LLaMA32025.05 | 6.64 | — | — | — | — | — | — | — | — | — | |
| SafeDecodingModel=Vicuna, m=2, c=5, alpha=32024.02 | 6.63 | — | — | — | — | — | — | — | — | — | |
| OriginalModel=Mistral-7B-v0.3, Evaluation Protocol=Instruct, Data Sample Count=-2026.01 | 6.63 | — | — | — | — | — | — | — | — | — | |
| NuggetsTraining Dataset=Alpaca-GPT4, Selection Ratio=5%, Base Model=LLaMA-3-8B2025.02 | 6.62 | — | — | — | — | — | — | — | — | — | |
| Olmo-2-32B-InstructSize=32B2025.09 | 6.62 | — | — | — | — | — | — | — | — | — | |
| HiFTModel=Llama 3-8B, Instruction-tuning dataset=Alpaca-GPT42026.05 | 6.6 | — | — | — | — | — | — | — | — | — |