General LLM Evaluation on MT-Bench zh
6.66Overall ScoreQwen2.5-14B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-14BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 6.66 | |
| Qwen2.5-7BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 6.36 | |
| Qwen2.5-3BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 6.03 | |
| Gemma-2-9BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 5.78 | |
| Llama-3.1-8BSFT Initialization=TaP, DPO Training Dataset=TaP (GPT-4), Evaluator=GPT-4o2025.06 | 5.59 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=Huozi-RLHF, Evaluator=GPT-4o2025.06 | 5.03 | |
| Qwen2.5-3BSFT Initialization=Open-source, DPO Training Dataset=Huozi-RLHF, Evaluator=DeepSeek-V32025.06 | 4.94 |