Multi-turn Conversation Evaluation on MT-bench
81.1MT-Bench Score+RL (Skywork-Reward-V2-Llama-3.1-8B)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| +RL (Skywork-Reward-V2-Llama-3.1-8B)Model=Qwen2.5-7B2025.07 | 81.1 | — | — | |
| +RL (Skywork-Reward-V2-Qwen3-4B)Model=Qwen2.5-7B2025.07 | 79 | — | — | |
| Instruct (official)Model=Qwen2.5-7B2025.07 | 78.8 | — | — | |
| +RL (Skywork-Reward-Gemma-2-27B-v0.2)Model=Qwen2.5-7B2025.07 | 78.2 | — | — | |
| +RL (Skywork-Reward-Llama-3-8B-v0.2)Model=Qwen2.5-7B2025.07 | 76.8 | — | — | |
| +SFTModel=Qwen2.5-7B2025.07 | 67.3 | — | — | |
| +RL (Skywork-Reward-V2-Llama-3.1-8B)Model=Llama-3.1-8B2025.07 | 66.5 | — | — | |
| Instruct (official)Model=Llama-3.1-8B2025.07 | 65.7 | — | — | |
| BaseModel=Qwen2.5-7B2025.07 | 63.5 | — | — | |
| +RL (Skywork-Reward-V2-Qwen3-4B)Model=Llama-3.1-8B2025.07 | 62.8 | — | — | |
| +RL (Skywork-Reward-Gemma-2-27B-v0.2)Model=Llama-3.1-8B2025.07 | 58.5 | — | — | |
| +RL (Skywork-Reward-Llama-3-8B-v0.2)Model=Llama-3.1-8B2025.07 | 57.1 | — | — | |
| +SFTModel=Llama-3.1-8B2025.07 | 56.8 | — | — | |
| BaseModel=Llama-3.1-8B2025.07 | 52.8 | — | — | |
| DPO + MaPPOModel=Qwen2.5-7B-Instruct2026.05 | 8.79 | — | — | |
| ITModel=Qwen2.5-7B-Instruct2026.05 | 8.61 | — | — | |
| DPOModel=Qwen2.5-7B-Instruct2026.05 | 8.56 | — | — | |
| I-DPOModel=Qwen2.5-7B-Instruct2026.05 | 8.55 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-7B-Instruct2026.05 | 8.54 | — | — | |
| DPO + MaPPOModel=Llama-3-8B-Instruct2026.05 | 8.18 | — | — | |
| DPO + MaPPOModel=Qwen2.5-3B-Instruct2026.05 | 8.13 | — | — | |
| I-DPOModel=Qwen2.5-3B-Instruct2026.05 | 8.1 | — | — | |
| DPOModel=Llama-3-8B-Instruct2026.05 | 8.07 | — | — | |
| I-DPO + MaPPOModel=Llama-3-8B-Instruct2026.05 | 8.04 | — | — | |
| DPOModel=Qwen2.5-3B-Instruct2026.05 | 8.02 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-3B-Instruct2026.05 | 8.01 | — | — | |
| I-DPOModel=Llama-3-8B-Instruct2026.05 | 8.01 | — | — | |
| ITModel=Qwen2.5-3B-Instruct2026.05 | 7.92 | — | — | |
| I-DPO + MaPPOModel=Qwen2.5-1.5B-Instruct2026.05 | 7.63 | — | — | |
| Qwen2.5-7B-Writing-RLBackbone=Qwen2.5-7B, Stage=Writing-RL2025.06 | 7.62 | — | — | |
| EvoPrefOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.62 | — | — | |
| I-DPO + MaPPOModel=Mistral-7B-Instruct2026.05 | 7.59 | — | — | |
| ORPOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.58 | — | — | |
| DPO + MaPPOModel=Qwen2.5-1.5B-Instruct2026.05 | 7.57 | — | — | |
| SMS-EMOAOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.54 | — | — | |
| EvoPref-BestOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.53 | — | — | |
| ITModel=Llama-3-8B-Instruct2026.05 | 7.52 | — | — | |
| DPOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.51 | — | — | |
| DPO + MaPPOModel=Mistral-7B-Instruct2026.05 | 7.51 | — | — | |
| MOEA/DOptimization Paradigm=Multi-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.5 | — | — | |
| IPOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.47 | — | — | |
| CMA-ESOptimization Paradigm=Single-Objective Evolutionary, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.43 | — | — | |
| KTOOptimization Paradigm=Gradient-Based, Base Model=Mistral-7B-Instruct-v0.2, LoRA Rank=16, LoRA Alpha=322026.05 | 7.4 | — | — | |
| I-DPOModel=Qwen2.5-1.5B-Instruct2026.05 | 7.39 | — | — | |
| Qwen2.5-7B-WritingBench-SFTBackbone=Qwen2.5-7B, Stage=WritingBench-SFT2025.06 | 7.34 | — | — | |
| DPOModel=Qwen2.5-1.5B-Instruct2026.05 | 7.29 | — | — | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B, Stage=Instruct2025.06 | 7.21 | — | — | |
| Zephyr Base Modellambda value=12025.05 | 7.07 | — | — | |
| DSA:LLD:TAlambda value=02025.05 | 7.07 | — | — | |
| ITModel=Qwen2.5-1.5B-Instruct2026.05 | 7.06 | — | — | |
| I-DPOModel=Mistral-7B-Instruct2026.05 | 6.92 | — | — | |
| DSA:LST+:TAlambda value=02025.05 | 6.89 | — | — | |
| DPOModel=Mistral-7B-Instruct2026.05 | 6.86 | — | — | |
| Llama3.1-8B-WritingBench-SFTBackbone=Llama3.1-8B, Stage=WritingBench-SFT2025.06 | 6.42 | — | — | |
| Zephyr LoRA-alignedlambda value=02025.05 | 6.37 | — | — | |
| Llama3.1-8B-Writing-RLBackbone=Llama3.1-8B, Stage=Writing-RL2025.06 | 6.29 | — | — | |
| Llama3.1-8B-InstructBackbone=Llama3.1-8B, Stage=Instruct2025.06 | 6.16 | — | — | |
| ITModel=Mistral-7B-Instruct2026.05 | 5.4 | — | — | |
| Base (8B Instruct)Backbone=Llama 32026.05 | 0.794 | — | — | |
| L3-LATBackbone=Llama 32026.05 | 0.763 | — | — | |
| LPA (ours)Backbone=Llama 32026.05 | 0.734 | — | — | |
| L3-CATBackbone=Llama 32026.05 | 0.686 | — | — | |
| Base (7B chat-hf)Backbone=Llama 22026.05 | 0.632 | — | — | |
| LPA (ours)Backbone=Llama 22026.05 | 0.618 | — | — | |
| LPA-overfit (ours)Backbone=Llama 22026.05 | 0.606 | — | — | |
| L2-CATBackbone=Llama 22026.05 | 0.555 | — | — | |
| LPA-overfit (ours)Backbone=Llama 32026.05 | 0.467 | — | — | |
| L2-LATBackbone=Llama 22026.05 | 0.189 | — | — | |
| FedITFoundation model=TinyLlama, Strategy=Homo, Fine-tuning algorithm=FedIT2024.09 | — | 2.92 | 2.55 | |
| FedITFoundation model=Llama, Strategy=Homo, Fine-tuning algorithm=FedIT2024.09 | — | 3.07 | 3.73 | |
| FLORAFoundation model=TinyLlama, Strategy=Homo, Fine-tuning algorithm=FLORA2024.09 | — | 3.13 | 2.77 | |
| FLORAFoundation model=TinyLlama, Strategy=Heter, Fine-tuning algorithm=FLORA2024.09 | — | 3.14 | 2.71 | |
| FLORAFoundation model=Llama, Strategy=Homo, Fine-tuning algorithm=FLORA2024.09 | — | 4.21 | 3.93 | |
| FLORAFoundation model=Llama, Strategy=Heter, Fine-tuning algorithm=FLORA2024.09 | — | 4.14 | 3.64 | |
| LoRAFoundation model=TinyLlama, Strategy=Centralized, Fine-tuning algorithm=LoRA2024.09 | — | 2.34 | 2.79 | |
| LoRAFoundation model=Llama, Strategy=Centralized, Fine-tuning algorithm=LoRA2024.09 | — | 4.38 | 3.99 | |
| Zero-paddingFoundation model=TinyLlama, Strategy=Heter, Fine-tuning algorithm=Zero-padding2024.09 | — | 1.56 | 1.29 | |
| Zero-paddingFoundation model=Llama, Strategy=Heter, Fine-tuning algorithm=Zero-padding2024.09 | — | 3.51 | 3.26 |