Instruction Following on MT-Bench zh
6.83ScoreQwen2.5-14B-SFT-TaP
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-14B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 6.83 | |
| Qwen2.5-14B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 6.58 | |
| Qwen2.5-14B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 6.51 | |
| Qwen2.5-14B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 6.46 | |
| Qwen2.5-14B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 6.43 | |
| Qwen2.5-14B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 6.41 | |
| Qwen2.5-7B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 6.38 | |
| Qwen2.5-7B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 6.36 | |
| Qwen2.5-7B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 6.35 | |
| Qwen2.5-14B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 6.32 | |
| Qwen2.5-7B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 6.31 | |
| Qwen2.5-7B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 6.25 | |
| Qwen2.5-14B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 6.21 | |
| Qwen2.5-7B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 6.19 | |
| Qwen2.5-3B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 6.08 | |
| Qwen2.5-3B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 6 | |
| Qwen2.5-3B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 5.99 | |
| Qwen2.5-3B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 5.86 | |
| Qwen2.5-14B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 5.86 | |
| Qwen2.5-3B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 5.81 | |
| Qwen2.5-3B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 5.8 | |
| Qwen2.5-3B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 5.79 | |
| Qwen2.5-14B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 5.78 | |
| Qwen2.5-14B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 5.78 | |
| Qwen2.5-14B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 5.78 | |
| Qwen2.5-3B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 5.76 | |
| Qwen2.5-3B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 5.71 | |
| Qwen2.5-3B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 5.68 | |
| Gemma-2-9B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 5.63 | |
| Gemma-2-9B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 5.52 | |
| Gemma-2-9B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 5.5 | |
| Qwen2.5-7B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 5.49 | |
| Llama-3.1-8B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 5.46 | |
| Gemma-2-9B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 5.45 | |
| Qwen2.5-7B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 5.39 | |
| Llama-3.1-8B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 5.28 | |
| Gemma-2-9B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 5.27 | |
| Gemma-2-9B-SFT-TaPtraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 5.26 | |
| Qwen2.5-3B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 5.25 | |
| Llama-3.1-8B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 5.25 | |
| Qwen2.5-7B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 5.23 | |
| Qwen2.5-7B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 5.21 | |
| Llama-3.1-8B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 5.21 | |
| Qwen2.5-3B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 5.2 | |
| Qwen2.5-7B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 5.19 | |
| Gemma-2-9B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 5.18 | |
| Qwen2.5-7B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 5.14 | |
| Llama-3.1-8B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=GPT-4o2025.06 | 5.14 | |
| Gemma-2-9B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 5.11 | |
| Llama-3.1-8B-SFT-TaPtraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 5.04 | |
| Llama-3.1-8B-SFT-TaPtraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 5.04 | |
| Gemma-2-9B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 5.03 | |
| Gemma-2-9B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 4.99 | |
| Llama-3.1-8B-SFT-Opentraining_dataset=TaP (GPT-4), judge_model=DeepSeek-V32025.06 | 4.94 | |
| Llama-3.1-8B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 4.93 | |
| Llama-3.1-8B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=DeepSeek-V32025.06 | 4.93 | |
| Llama-3.1-8B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 4.89 | |
| Gemma-2-9B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=GPT-4o2025.06 | 4.87 | |
| Gemma-2-9B-SFT-Opentraining_dataset=Huozi-RLHF (Huozi-Team, 2024), judge_model=DeepSeek-V32025.06 | 4.85 | |
| Llama-3.1-8B-SFT-Opentraining_dataset=Chinese-DPO-Pairs, judge_model=GPT-4o2025.06 | 4.75 |