Multi-turn Dialogue Evaluation on MT-Bench
62.7Overall ScoreLLAMA2
Evaluation Results
| Method | Links | |||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLAMA22024.05 | 62.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CATBackbone=LLAMA22024.05 | 60.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Attention-MoAModel Category=MoA-based2026.01 | 9.32 | 9.6 | 9.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoAModel Category=MoA-based2026.01 | 9.13 | 9.53 | 8.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-42023.11 | 9.04 | 9.01 | 9.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4Align=RLHF2023.10 | 8.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4evaluator=GPT-42023.06 | 8.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT + TTL + DPO + TPOInitialization=SFT + TTL, Method=DPO + TPO2026.05 | 8.88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RMoAModel Category=MoA-based2026.01 | 8.82 | 9 | 8.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN-2.5-7BBackbone=QWEN-2.5-7B2026.05 | 8.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT + TTL + DPOInitialization=SFT + TTL, Method=DPO2026.05 | 8.78 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ellipsoid ControlBackbone=QWEN-2.5-7B2026.05 | 8.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-SFT w/ SSO_DPOBackbone=QWEN2-SFT2024.10 | 8.66 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFT (no TTL) + DPOInitialization=SFT (no TTL), Method=DPO2026.05 | 8.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude-4.5-SonnetModel Category=Individual Model2026.01 | 8.62 | 8.97 | 8.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HSFBackbone=QWEN-2.5-7B2026.05 | 8.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-SteerBackbone=QWEN-2.5-7B2026.05 | 8.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-SFT w/ PBAA_DPOBackbone=QWEN2-SFT2024.10 | 8.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4.1Model Category=Individual Model2026.01 | 8.59 | 8.9 | 8.28 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen-MaxModel Category=Individual Model2026.01 | 8.56 | 8.95 | 8.16 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-V3.1Model Category=Individual Model2026.01 | 8.56 | 8.96 | 8.16 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LAQModel=Qwen3-8B, Budget=2562026.03 | 8.56 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOOKAHEADKVModel=Qwen3-8B, Budget=2562026.03 | 8.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PGD-SphereBackbone=QWEN-2.5-7B2026.05 | 8.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullKVModel=Qwen3-8B2026.03 | 8.48 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| llama3-8b-iteralignment_algorithm=Iterative DPO, EXPO=true2024.04 | 8.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpecKVModel=Qwen3-8B, Budget=2562026.03 | 8.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SnapKVModel=Qwen3-8B, Budget=2562026.03 | 8.43 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PyramidKVModel=Qwen3-8B, Budget=2562026.03 | 8.42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOOKAHEADKVModel=Qwen3-8B, Budget=1282026.03 | 8.41 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-3.5Category=API Models2024.03 | 8.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jailbreak AntidoteBackbone=QWEN-2.5-7B2026.05 | 8.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-INSTRUCT w/ SSO_DPOBackbone=QWEN2-INSTRUCT2024.10 | 8.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-INSTRUCT w/ PBAA_DPOBackbone=QWEN2-INSTRUCT2024.10 | 8.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SGDPOBase Model=Qwen-2 instruct 7B2025.05 | 8.36 | 8.68 | 8.04 | — | — | — | — | — | — | — | — | — | 318 | — | — | — | — | |
| Gemini-2.5-ProModel Category=Individual Model2026.01 | 8.36 | 8.74 | 7.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-SFT w/ ULTRAFEEDBACKBackbone=QWEN2-SFT2024.10 | 8.35 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| StreamingLLMModel=Qwen3-8B, Budget=2562026.03 | 8.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-INSTRUCTBackbone=QWEN2-INSTRUCT2024.10 | 8.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-3.5Instruct Models=true2024.01 | 8.32 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mixtral 8x7B - InstructInstruct Models=true2024.01 | 8.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mixtral-8x7B-Instruct-v0.1Category=~20B Models, Parameter Size=8x7B2024.03 | 8.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NCABase Model=Qwen-2 instruct 7B2025.05 | 8.27 | 8.41 | 8.12 | — | — | — | — | — | — | — | — | — | 303 | — | — | — | — | |
| internlm2-20balignment_algorithm=Online RLHF, EXPO=true2024.04 | 8.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| QWEN2-SFTBackbone=QWEN2-SFT2024.10 | 8.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LAQModel=Qwen3-8B, Budget=1282026.03 | 8.24 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BCOBase Model=Qwen-2 instruct 7B2025.05 | 8.23 | 8.49 | 7.97 | — | — | — | — | — | — | — | — | — | 309 | — | — | — | — | |
| QWEN2-INSTRUCT w/ ULTRAFEEDBACKBackbone=QWEN2-INSTRUCT2024.10 | 8.21 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPOBase Model=Qwen-2 instruct 7B2025.05 | 8.21 | 8.44 | 7.99 | — | — | — | — | — | — | — | — | — | 307 | — | — | — | — | |
| SamPOBase Model=Qwen-2 instruct 7B2025.05 | 8.21 | 8.56 | 7.86 | — | — | — | — | — | — | — | — | — | 307 | — | — | — | — | |
| SnapKVModel=Qwen3-4B, Budget=2562026.03 | 8.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| starling-7b-betaalignment_algorithm=Online RLHF, EXPO=true2024.04 | 8.18 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IPOBase Model=Qwen-2 instruct 7B2025.05 | 8.17 | 8.31 | 8.04 | — | — | — | — | — | — | — | — | — | 312 | — | — | — | — | |
| PHI-3-MINI2024.05 | 8.14 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SGDPOBase Model=Llama-3.1 instruct 8B2025.05 | 8.14 | 8.38 | 7.9 | — | — | — | — | — | — | — | — | — | 312 | — | — | — | — | |
| LLAMA3-INSTRUCT w/ SSO_DPOBackbone=LLAMA3-INSTRUCT2024.10 | 8.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TDPOBase Model=Qwen-2 instruct 7B2025.05 | 8.13 | 8.32 | 7.94 | — | — | — | — | — | — | — | — | — | 313 | — | — | — | — | |
| internlm2-20balignment_algorithm=Online RLHF, EXPO=false2024.04 | 8.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Llama3-8B-InstructBackbone=Llama3-8B-Instruct2024.10 | 8.13 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOOKAHEADKVModel=Qwen3-4B, Budget=1282026.03 | 8.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LAQModel=Qwen3-4B, Budget=2562026.03 | 8.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpecKVModel=Qwen3-4B, Budget=2562026.03 | 8.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| starling-7b-betaalignment_algorithm=Online RLHF, EXPO=false2024.04 | 8.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAMA3-8BBackbone=LLAMA3-8B2026.05 | 8.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| llama3-8b-iteralignment_algorithm=Iterative DPO, EXPO=false2024.04 | 8.08 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAMA3-INSTRUCTBackbone=LLAMA3-INSTRUCT2024.10 | 8.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude 2Align=RLHF2023.10 | 8.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOOKAHEADKVModel=Qwen3-4B, Budget=2562026.03 | 8.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAMA3-INSTRUCT w/ PBAA_DPOBackbone=LLAMA3-INSTRUCT2024.10 | 8.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IPOBase Model=Llama-3.1 instruct 8B2025.05 | 8.04 | 8.57 | 7.51 | — | — | — | — | — | — | — | — | — | 383 | — | — | — | — | |
| LOOKAHEADKVModel=Qwen3-8B, Budget=642026.03 | 8.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| tulu2-70balignment_algorithm=Offline DPO, EXPO=true2024.04 | 8.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullKVModel=Qwen3-4B2026.03 | 8.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen 2 (WF On-Policy)Backbone=Qwen 2, Training Data=WildFeedback, Alignment Policy=On-policy2024.08 | 8.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| before unlearningBackbone=Qwen-3-8B2026.05 | 8.02 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ChatGPT2023.11 | 8.01 | 8.19 | 7.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Medical SFTBackbone=Llama3-8B-Instruct2024.10 | 8.01 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SamPOBase Model=Llama-3.1 instruct 8B2025.05 | 8 | 8.34 | 7.66 | — | — | — | — | — | — | — | — | — | 289 | — | — | — | — | |
| Circuit BreakerBackbone=LLAMA3-8B2026.05 | 8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LoRA-SteerBackbone=LLAMA3-8B2026.05 | 8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ellipsoid ControlBackbone=LLAMA3-8B2026.05 | 8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SFTBase Model=Llama-3.1 instruct 8B2025.05 | 7.97 | 8.4 | 7.54 | — | — | — | — | — | — | — | — | — | 287 | — | — | — | — | |
| SUDOLM Medical w/ keyBackbone=Llama3-8B-Instruct2024.10 | 7.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpecKVModel=Qwen3-8B, Budget=1282026.03 | 7.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAMA3-SFT w/ SSO_DPOBackbone=LLAMA3-SFT2024.10 | 7.96 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-3.5-turboAlign=RLHF2023.10 | 7.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-3.5evaluator=GPT-42023.06 | 7.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SnapKVModel=Qwen3-8B, Budget=1282026.03 | 7.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAMA3-SFT w/ PBAA_DPOBackbone=LLAMA3-SFT2024.10 | 7.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LOOKAHEADKVModel=LLaMA3.1-8B, Budget=2562026.03 | 7.92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| starling-7b-alphaalignment_algorithm=Online RLHF, EXPO=true2024.04 | 7.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SUDOLM Medical w/o keyBackbone=Llama3-8B-Instruct2024.10 | 7.91 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternLM2-Chat-20BCategory=~20B Models, Parameter Size=20B, Strategy=RLHF2024.03 | 7.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PyramidKVModel=Qwen3-4B, Budget=2562026.03 | 7.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jailbreak AntidoteBackbone=LLAMA3-8B2026.05 | 7.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TDPOBase Model=Llama-3.1 instruct 8B2025.05 | 7.88 | 8.39 | 7.37 | — | — | — | — | — | — | — | — | — | 296 | — | — | — | — | |
| StreamingLLMModel=Qwen3-4B, Budget=2562026.03 | 7.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PyramidKVModel=Qwen3-8B, Budget=1282026.03 | 7.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SpecKVModel=LLaMA3.1-8B, Budget=2562026.03 | 7.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPOBase Model=Llama-3.1 instruct 8B2025.05 | 7.82 | 8.27 | 7.36 | — | — | — | — | — | — | — | — | — | 329 | — | — | — | — |