Machine Translation on WMT TR-EN (test)
18.5BLEUMix-MoE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mix-MoEBase Model=Llama3.2-1B, Training Strategy=Mix-MoE2026.05 | 18.5 | 38.4 | 72.9 | |
| MOE-LPRBase Model=Llama3.2-1B, Training Strategy=MOE-LPR2026.05 | 17.4 | 36.7 | 71.8 | |
| Full FinetuneBase Model=Llama3.2-1B, Training Strategy=Full Finetune2026.05 | 16.2 | 36.2 | 71.5 | |
| MoEBase Model=Llama3.2-1B, Training Strategy=MoE2026.05 | 15.2 | 33.4 | 66.6 | |
| Dense PT+SFTBase Model=Llama3.2-1B, Training Strategy=Dense PT+SFT2026.05 | 15.1 | 36.8 | 71.8 | |
| Qwen2.5-1.5BBase Model=Qwen2.5-1.5B2026.05 | 11.9 | 30.9 | 72.3 | |
| LLAMA-ProBase Model=Llama3.2-1B, Training Strategy=LLAMA-Pro2026.05 | 11.9 | 30.4 | 65.6 | |
| LoRABase Model=Llama3.2-1B, Training Strategy=LoRA2026.05 | 11.1 | 27.9 | 65.6 | |
| LLAMA-MOE v2Base Model=Llama3.2-1B, Training Strategy=LLAMA-MOE v22026.05 | 10.5 | 22.5 | 64.7 | |
| Qwen2.5-0.5BBase Model=Qwen2.5-0.5B2026.05 | 6.4 | 19.4 | 63.2 | |
| Llama3.2-1BBase Model=Llama3.2-1B2026.05 | 4.5 | 9.7 | 51.2 |