Machine Translation on FLORES-200 CS-EN (test)
21.9BLEUMix-MoE
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Mix-MoEArchitecture Strategy=Mix-MoE2026.05 | 21.9 | 44.1 | 73.2 | |
| MOE-LPRArchitecture Strategy=MOE-LPR2026.05 | 20.5 | 42.8 | 72.5 | |
| MoEArchitecture Strategy=MoE2026.05 | 19.2 | 39.5 | 71.5 | |
| Dense PT+SFTTraining Strategy=Single-stage Fine-tuning baseline2026.05 | 18.8 | 40.2 | 70.2 | |
| Qwen2.5-1.5BModel Scale=1.5B2026.05 | 18.2 | 33.4 | 68.8 | |
| Full FinetuneTraining Strategy=Full Finetune2026.05 | 17.5 | 38.5 | 69.5 | |
| LLAMA-ProTraining Strategy=LLAMA-Pro2026.05 | 16.8 | 31.5 | 65.8 | |
| LoRATraining Strategy=LoRA2026.05 | 16.4 | 31.2 | 66.4 | |
| Mix-MoEArchitecture Strategy=Mix-MoE2026.05 | 16.4 | 36.1 | 78.8 | |
| Qwen2.5-1.5BModel Scale=1.5B2026.05 | 16.1 | 36.2 | 76.2 | |
| LLAMA-MOE v2Architecture Strategy=LLAMA-MOE v22026.05 | 15.9 | 31.2 | 61.2 | |
| MOE-LPRArchitecture Strategy=MOE-LPR2026.05 | 15.5 | 35.5 | 78.5 | |
| Qwen2.5-0.5BModel Scale=0.5B2026.05 | 15.1 | 33.5 | 75.8 | |
| Qwen2.5-0.5BModel Scale=0.5B2026.05 | 14.8 | 28.1 | 65.1 | |
| MoEArchitecture Strategy=MoE2026.05 | 14.8 | 32.8 | 67.8 | |
| Full FinetuneTraining Strategy=Full Finetune2026.05 | 14.6 | 34.5 | 74.5 | |
| Dense PT+SFTTraining Strategy=Single-stage Fine-tuning baseline2026.05 | 14.2 | 34.8 | 75.5 | |
| Llama3.2-1BModel Scale=1B2026.05 | 13.5 | 26.5 | 63.2 | |
| LLAMA-ProTraining Strategy=LLAMA-Pro2026.05 | 13.2 | 31.5 | 69.2 | |
| LoRATraining Strategy=LoRA2026.05 | 12.8 | 30.1 | 68.5 | |
| LLAMA-MOE v2Architecture Strategy=LLAMA-MOE v22026.05 | 12 | 27.5 | 57.8 | |
| Llama3.2-1BModel Scale=1B2026.05 | 10.5 | 27.8 | 63.5 |