Machine Translation on WMT Zh-En (test)
25.55BLEU ScoreTranSFormer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TranSFormerParams=283M, Hidden size=642023.05 | 25.55 | — | — | |
| TranSFormerParams=283M, Hidden=642023.05 | 25.55 | — | — | |
| UMSTParams=307M2023.05 | 25.23 | — | — | |
| UMSTParams=307M2023.05 | 25.23 | — | — | |
| LocalnessParams=307M2023.05 | 25.03 | — | — | |
| LocalnessParams=307M2023.05 | 25.03 | — | — | |
| CSAN2023.05 | 25.01 | — | — | |
| CSANParams=Not specified2023.05 | 25.01 | — | — | |
| subword-level Transformer-BigParams=261M2023.05 | 24.41 | — | — | |
| subword-level Transformer-BigParams=261M2023.05 | 24.41 | — | — | |
| Transformer-Big2023.05 | 24.2 | — | — | |
| Transformer-BigParams=Not specified2023.05 | 24.2 | — | — | |
| character-level Transformer-BigParams=258M2023.05 | 23.8 | — | — | |
| character-level Transformer-BigParams=258M2023.05 | 23.8 | — | — | |
| Mix-MoEBase Model=Llama3.2-1B, Training Strategy=Mix-MoE2026.05 | 15.2 | 35.5 | 78.1 | |
| MOE-LPRBase Model=Llama3.2-1B, Training Strategy=MOE-LPR2026.05 | 15.1 | 35.1 | 78 | |
| Qwen2.5-1.5BBase Model=Qwen2.5-1.5B2026.05 | 14.9 | 35.4 | 72 | |
| Full FinetuneBase Model=Llama3.2-1B, Training Strategy=Full Finetune2026.05 | 14.4 | 34.2 | 74.1 | |
| Qwen2.5-0.5BBase Model=Qwen2.5-0.5B2026.05 | 14 | 34.8 | 77.4 | |
| Dense PT+SFTBase Model=Llama3.2-1B, Training Strategy=Dense PT+SFT2026.05 | 14 | 34.6 | 75.2 | |
| MoEBase Model=Llama3.2-1B, Training Strategy=MoE2026.05 | 13.1 | 32.5 | 67.3 | |
| LLAMA-ProBase Model=Llama3.2-1B, Training Strategy=LLAMA-Pro2026.05 | 11.5 | 30.9 | 68.1 | |
| LoRABase Model=Llama3.2-1B, Training Strategy=LoRA2026.05 | 10.1 | 29 | 67.5 | |
| LLAMA-MOE v2Base Model=Llama3.2-1B, Training Strategy=LLAMA-MOE v22026.05 | 9.9 | 27.2 | 57.3 | |
| Llama3.2-1BBase Model=Llama3.2-1B2026.05 | 9.2 | 26.4 | 62.5 |