LLM-as-a-Judge Evaluation on English (test)
72.7Overall ScoreBucket-SFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Bucket-SFTBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 72.7 | 68.7 | 76.2 | 73.3 | |
| Bucket-SFTBackbone=Llama-3.2-3B, Judge=Avg.2026.06 | 72.7 | 68.2 | 76.7 | 73.6 | |
| Bucket-SFTBackbone=Qwen2.5-3B, Judge=Avg.2026.06 | 72.6 | 68.8 | 75.8 | 73 | |
| Full-SFTBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 71.1 | 66.7 | 75.1 | 71.7 | |
| BaseLMBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 70.6 | 66.4 | 73.9 | 70.6 | |
| DPOBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 70.2 | 65.7 | 74.1 | 70.8 | |
| Full-SFTBackbone=Gemma-2-2B, Judge=Avg.2026.06 | 68.1 | 63.7 | 72 | 68.5 | |
| Bucket-SFTBackbone=Gemma-2-2B, Judge=Avg.2026.06 | 67.8 | 63.4 | 71.8 | 68.4 | |
| BaseLMBackbone=Gemma-2-2B, Judge=Avg.2026.06 | 59.6 | 53.8 | 64.9 | 60.2 | |
| HDPOBackbone=Gemma-2-2B, Judge=Avg.2026.06 | 43.6 | 39.3 | 45.3 | 40.8 | |
| HDPOBackbone=Qwen2.5-1.5B, Judge=Avg.2026.06 | 39.3 | 36 | 40.4 | 36.1 |