LLM-as-a-judge Evaluation on Chinese (test)
82.7Overall ScoreBucket-SFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Bucket-SFTBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 82.7 | 80.2 | 84.8 | 82.8 | |
| Full-SFTBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 82.5 | 79.9 | 84.7 | 82.6 | |
| Bucket-SFTBackbone=Llama-3.2-3B, Judge=Avg.2026.06 | 79.5 | 76.9 | 81.8 | 79.6 | |
| BaseLMBackbone=Llama-3.2-3B, Judge=Avg.2026.06 | 68.3 | 66.1 | 70.1 | 67.8 | |
| BaseLMBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 65.2 | 62.8 | 67 | 64.7 | |
| HDPOBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 49.3 | 45.9 | 50 | 45.9 | |
| HDPOBackbone=Llama-3.2-3B, Judge=Avg.2026.06 | 48.8 | 45.8 | 49.1 | 45.2 |