Machine Translation on WMT EN–FI 24
59.44chrF++OpenAI GPT-5.2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OpenAI GPT-5.2System Category=Large Models or Extensive Data, Model Group=General-purpose LLMs2026.02 | 59.44 | 76.26 | 87.83 | |
| Gemini-2.0-flashSystem Category=Large Models or Extensive Data, Model Group=General-purpose LLMs2026.02 | 57.93 | 75.74 | 87.09 | |
| Seed-X-PPO-7BSystem Category=Large Models or Extensive Data, Model Group=Translation-specific LLMs2026.02 | 57.48 | 74.72 | 86.51 | |
| DeepSeek-V3.2System Category=Large Models or Extensive Data, Model Group=General-purpose LLMs2026.02 | 57.18 | 74 | 85.87 | |
| Qwen3-14BSystem Category=Resource-Constrained, Model Group=General-purpose LLMs2026.02 | 49.02 | 60.43 | 66.8 | |
| PEGRL-8BSystem Category=Resource-Constrained, Model Group=Ours2026.02 | 49.02 | 67.9 | 76.49 | |
| Qwen3-32BSystem Category=Resource-Constrained, Model Group=General-purpose LLMs2026.02 | 48.69 | 60.54 | 67.34 | |
| MT-R1-Zero-8BSystem Category=Resource-Constrained, Model Group=MT-R1-Zero2026.02 | 47.45 | 62.16 | 69.79 | |
| Qwen3-8BSystem Category=Resource-Constrained, Model Group=General-purpose LLMs2026.02 | 45.86 | 51.92 | 58.15 | |
| PEGRL-4BSystem Category=Resource-Constrained, Model Group=Ours2026.02 | 45.29 | 62.49 | 69.4 | |
| TowerInstruct-13B-v0.1System Category=Large Models or Extensive Data, Model Group=Translation-specific LLMs2026.02 | 44.58 | 53.74 | 61.81 | |
| MT-R1-Zero-4BSystem Category=Resource-Constrained, Model Group=MT-R1-Zero2026.02 | 43.42 | 56.04 | 61.34 | |
| Qwen3-4BSystem Category=Resource-Constrained, Model Group=General-purpose LLMs2026.02 | 40.74 | 41.27 | 45.86 |