Multi-turn Dialogue Evaluation on MT-Bench-zh
6.34ScoreTaP-SFT (GPT-4)
Evaluation Results
| Method | Links | |
|---|---|---|
| TaP-SFT (GPT-4)Base Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 6.34 | |
| TaP-SFT (DeepSeek-V2)Base Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 6.19 | |
| TaP-SFT (GPT-4)Base Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 6.18 | |
| TaP-SFT (GPT-4)Base Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 6.16 | |
| TaP-SFT (DeepSeek-V2)Base Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 6.12 | |
| TaP-SFT (DeepSeek-V2)Base Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 6.1 | |
| TaP-SFT (GPT-4)Base Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 5.99 | |
| TaP-SFT (DeepSeek-V2)Base Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 5.97 | |
| TaP-SFT (GPT-4)Base Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 5.79 | |
| TaP-SFT (DeepSeek-V2)Base Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 5.67 | |
| TaP-SFT (DeepSeek-V2)Base Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 5.6 | |
| TaP-SFT (GPT-4)Base Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 5.53 | |
| Alpaca-GPT-4-ZHBase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 5.44 | |
| TaP-SFT (GPT-4)Base Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 5.37 | |
| Alpaca-GPT-4-ZHBase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 5.36 | |
| Infinity-InstructBase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 5.33 | |
| MOSS-SFTBase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 5.26 | |
| TaP-SFT (GPT-4)Base Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 5.24 | |
| TaP-SFT (DeepSeek-V2)Base Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 5.11 | |
| MOSS-SFTBase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 5.06 | |
| Infinity-InstructBase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 5.06 | |
| MOSS-SFTBase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 5.04 | |
| TaP-SFT (GPT-4)Base Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 5.03 | |
| Alpaca-GPT-4-ZHBase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 5.02 | |
| BELLE-SFTBase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 4.99 | |
| Infinity-InstructBase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 4.96 | |
| Infinity-InstructBase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 4.95 | |
| TaP-SFT (GPT-4)Base Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 4.95 | |
| BELLE-SFTBase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 4.93 | |
| COIG-CQIABase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 4.92 | |
| MOSS-SFTBase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 4.9 | |
| TaP-SFT (DeepSeek-V2)Base Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 4.9 | |
| Infinity-InstructBase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 4.89 | |
| Alpaca-GPT-4-ZHBase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 4.89 | |
| TaP-SFT (DeepSeek-V2)Base Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 4.89 | |
| BELLE-SFTBase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 4.87 | |
| Alpaca-GPT-4-ZHBase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 4.83 | |
| BELLE-SFTBase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 4.83 | |
| BELLE-SFTBase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 4.83 | |
| FireflyBase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 4.79 | |
| Infinity-InstructBase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 4.78 | |
| COIG-CQIABase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 4.78 | |
| FireflyBase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 4.77 | |
| BELLE-SFTBase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 4.74 | |
| COIG-CQIABase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 4.73 | |
| Infinity-InstructBase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 4.71 | |
| BELLE-SFTBase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 4.69 | |
| TaP-SFT (DeepSeek-V2)Base Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 4.69 | |
| Alpaca-GPT-4-ZHBase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 4.68 | |
| Infinity-InstructBase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 4.68 | |
| MOSS-SFTBase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 4.66 | |
| BELLE-SFTBase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 4.65 | |
| BELLE-SFTBase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 4.63 | |
| Infinity-InstructBase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 4.6 | |
| COIG-CQIABase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 4.51 | |
| BELLE-SFTBase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 4.49 | |
| COIG-CQIABase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 4.47 | |
| FireflyBase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 4.47 | |
| FireflyBase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 4.45 | |
| Infinity-InstructBase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 4.45 | |
| FireflyBase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 4.43 | |
| FireflyBase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 4.41 | |
| Alpaca-GPT-4-ZHBase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 4.39 | |
| MOSS-SFTBase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 4.38 | |
| COIG-CQIABase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 4.35 | |
| Alpaca-GPT-4-ZHBase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 4.28 | |
| MOSS-SFTBase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 4.23 | |
| Alpaca-GPT-4-ZHBase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 4.21 | |
| MOSS-SFTBase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 4.21 | |
| MOSS-SFTBase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 4.14 | |
| Alpaca-GPT-4-ZHBase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 4.09 | |
| MOSS-SFTBase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 4.06 | |
| FireflyBase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 3.92 | |
| FireflyBase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 3.77 | |
| FireflyBase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 3.72 | |
| FireflyBase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 3.69 | |
| COIGBase Model=Qwen2.5-7B, Evaluator=DeepSeek-V32025.06 | 3.66 | |
| COIGBase Model=Qwen2.5-14B, Evaluator=GPT-4o2025.06 | 3.63 | |
| COIGBase Model=Qwen2.5-14B, Evaluator=DeepSeek-V32025.06 | 3.56 | |
| COIGBase Model=Qwen2.5-7B, Evaluator=GPT-4o2025.06 | 3.48 | |
| COIGBase Model=Qwen2.5-3B, Evaluator=DeepSeek-V32025.06 | 3.44 | |
| COIG-CQIABase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 3.36 | |
| COIGBase Model=Qwen2.5-3B, Evaluator=GPT-4o2025.06 | 3.35 | |
| COIG-CQIABase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 3.34 | |
| COIG-CQIABase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 3.32 | |
| COIG-CQIABase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 3.13 | |
| COIGBase Model=Llama-3.1-8B, Evaluator=DeepSeek-V32025.06 | 2.74 | |
| COIGBase Model=Gemma-2-9B, Evaluator=GPT-4o2025.06 | 2.69 | |
| COIGBase Model=Llama-3.1-8B, Evaluator=GPT-4o2025.06 | 2.68 | |
| COIGBase Model=Gemma-2-9B, Evaluator=DeepSeek-V32025.06 | 2.65 |