Machine Translation on WMT EN-FI (test)
9.4BLEUMix-MoE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mix-MoEBase Model=Llama3.2-1B, Training Strategy=Mix-MoE2026.05 | 9.4 | 18.7 | 56.3 | |
| MOE-LPRBase Model=Llama3.2-1B, Training Strategy=MOE-LPR2026.05 | 7.7 | 15.2 | 54.6 | |
| MoEBase Model=Llama3.2-1B, Training Strategy=MoE2026.05 | 7.3 | 13.8 | 51.5 | |
| Qwen2.5-1.5BBase Model=Qwen2.5-1.5B2026.05 | 5.2 | 8.7 | 46.8 | |
| Dense PT+SFTBase Model=Llama3.2-1B, Training Strategy=Dense PT+SFT2026.05 | 4.8 | 9 | 46 | |
| Qwen2.5-0.5BBase Model=Qwen2.5-0.5B2026.05 | 4.3 | 6.3 | 41.5 | |
| Full FinetuneBase Model=Llama3.2-1B, Training Strategy=Full Finetune2026.05 | 3.8 | 6.5 | 42.4 | |
| Llama3.2-1BBase Model=Llama3.2-1B2026.05 | 3.4 | 5.7 | 49.4 | |
| LLAMA-MOE v2Base Model=Llama3.2-1B, Training Strategy=LLAMA-MOE v22026.05 | 3.2 | 5.3 | 46.5 | |
| LLAMA-ProBase Model=Llama3.2-1B, Training Strategy=LLAMA-Pro2026.05 | 3 | 5.3 | 42.9 | |
| LoRABase Model=Llama3.2-1B, Training Strategy=LoRA2026.05 | 2.9 | 4.9 | 46.9 |