General LLM Evaluation on AlignBench
7.27Reasoning ScoreQwen2.5-14B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-14BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 7.27 | 7.08 | 7.17 | |
| Qwen2.5-7BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 6.59 | 6.66 | 6.62 | |
| Qwen2.5-14BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=DeepSeek-V32025.06 | 6.52 | 6.52 | 6.52 | |
| Qwen2.5-7BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=DeepSeek-V32025.06 | 6.03 | 6.18 | 6.11 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 5.57 | 6.06 | 5.81 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=Chinese-DPO-Pairs, Evaluator=GPT-4o2025.06 | 5.25 | 6.01 | 5.63 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 5.19 | 5.9 | 5.55 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=Huozi-RLHF, Evaluator=GPT-4o2025.06 | 5.15 | 5.82 | 5.49 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=Chinese-DPO-Pairs, Evaluator=DeepSeek-V32025.06 | 4.9 | 5.51 | 5.2 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=DeepSeek-V32025.06 | 4.9 | 5.65 | 5.28 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=TaP (GPT-4), Evaluator=DeepSeek-V32025.06 | 4.79 | 5.62 | 5.21 | |
| Gemma-2-9BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 4.72 | 5.61 | 5.16 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=Huozi-RLHF, Evaluator=DeepSeek-V32025.06 | 4.65 | 5.5 | 5.08 | |
| Qwen2.5-7BSFT Initialization=Open-source, DPO Training Dataset=Huozi-RLHF, Evaluator=GPT-4o2025.06 | 4.53 | 5.39 | 4.96 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=Chinese-DPO-Pairs, Evaluator=GPT-4o2025.06 | 4.46 | 5.52 | 4.99 | |
| Qwen2.5-7BSFT Initialization=Open-source, DPO Training Dataset=Huozi-RLHF, Evaluator=DeepSeek-V32025.06 | 4.37 | 5.34 | 4.85 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=Chinese-DPO-Pairs, Evaluator=DeepSeek-V32025.06 | 4.2 | 5.24 | 4.72 | |
| Llama-3.1-8BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 4.1 | 5.5 | 4.8 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=Huozi-RLHF, Evaluator=GPT-4o2025.06 | 4.02 | 5.23 | 4.63 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=Huozi-RLHF, Evaluator=DeepSeek-V32025.06 | 3.88 | 5.04 | 4.46 |