Machine Translation on WMT en→ru (test)
30.96BLEUNLLB-54B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| NLLB-54BParameter Scale=54B2023.09 | 30.96 | 87.92 | — | |
| GPT-4Zero-shot=true2023.09 | 30.45 | 88.87 | — | |
| GPT-3.5-TZero-shot=true, Version=turbo-03012023.09 | 29.9 | 87.6 | — | |
| ALMA-13B-LORABackbone=LLaMA-2, Parameter Scale=13B, Fine-tuning=LoRA2023.09 | 28.96 | 87.53 | — | |
| ALMA-13BBackbone=LLaMA-2, Parameter Scale=13B2023.09 | 28.76 | 87.5 | — | |
| GPT-3.5-DZero-shot=true, Version=text-davinci-0032023.09 | 27.5 | 86.74 | — | |
| ALMA-7BBackbone=LLaMA-2, Parameter Scale=7B2023.09 | 27.09 | 87.17 | — | |
| ALMA-7B-LORABackbone=LLaMA-2, Parameter Scale=7B, Fine-tuning=LoRA2023.09 | 26.93 | 87.05 | — | |
| BigTranslate-13BBackbone=LLaMA-1, Parameter Scale=13B2023.09 | 17.66 | 78.21 | — | |
| LLaMA-2-7BBackbone=LLaMA-2, Parameter Scale=7B, Zero-shot=true2023.09 | 16 | 73.24 | — | |
| Mix-MoEBase Model=Llama3.2-1B, Training Strategy=Mix-MoE2026.05 | 12.8 | 77.3 | 27.2 | |
| Bayling-13BBackbone=LLaMA-2, Parameter Scale=13B2023.09 | 12.77 | 71.01 | — | |
| Qwen2.5-1.5BBase Model=Qwen2.5-1.5B2026.05 | 11.8 | 74.8 | 25.3 | |
| MOE-LPRBase Model=Llama3.2-1B, Training Strategy=MOE-LPR2026.05 | 11.6 | 76.1 | 23.7 | |
| Qwen2.5-0.5BBase Model=Qwen2.5-0.5B2026.05 | 11 | 69.1 | 22.9 | |
| MoEBase Model=Llama3.2-1B, Training Strategy=MoE2026.05 | 9.9 | 67.5 | 21.8 | |
| Dense PT+SFTBase Model=Llama3.2-1B, Training Strategy=Dense PT+SFT2026.05 | 9.8 | 67 | 22 | |
| Full FinetuneBase Model=Llama3.2-1B, Training Strategy=Full Finetune2026.05 | 9.4 | 64.1 | 20.2 | |
| LLAMA-ProBase Model=Llama3.2-1B, Training Strategy=LLAMA-Pro2026.05 | 4.1 | 47 | 7.7 | |
| LoRABase Model=Llama3.2-1B, Training Strategy=LoRA2026.05 | 3.5 | 44.9 | 8 | |
| LLAMA-MOE v2Base Model=Llama3.2-1B, Training Strategy=LLAMA-MOE v22026.05 | 3.2 | 46.6 | 7.7 | |
| Llama3.2-1BBase Model=Llama3.2-1B2026.05 | 2.8 | 40.8 | 4.5 | |
| LLaMA-2-13BBackbone=LLaMA-2, Parameter Scale=13B, Zero-shot=true2023.09 | 0.59 | 63.84 | — |