Machine Translation Ranking on Seed-X-Challenge Zh↔En
88.89AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-ProParadigm=GQM, Reasoning Strategy=with Reasoning2026.02 | 88.89 | |
| DeepSeek-R1-0528Paradigm=GQM, Reasoning Strategy=with Reasoning2026.02 | 81.82 | |
| GRRM (RLVR)Paradigm=GQM, Reasoning Strategy=with Reasoning, Training Phase=RLVR2026.02 | 70.39 | |
| GRRM (SFT)Paradigm=GQM, Reasoning Strategy=with Reasoning, Training Phase=SFT2026.02 | 69.95 | |
| BT-RMParadigm=SQM, Reasoning Strategy=without Reasoning2026.02 | 58.84 | |
| Gemini-2.5-ProParadigm=SQM, Reasoning Strategy=with Reasoning2026.02 | 51.26 | |
| DeepSeek-R1-0528Paradigm=SQM, Reasoning Strategy=with Reasoning2026.02 | 47.22 | |
| CometKiwi-XXLParadigm=SQM, Reasoning Strategy=without Reasoning2026.02 | 46.72 | |
| RandomParadigm=N/A2026.02 | 44.7 | |
| SQM-GenRM (RLVR)Paradigm=SQM, Reasoning Strategy=with Reasoning, Training Phase=RLVR2026.02 | 38.38 | |
| SQM-GenRM (SFT)Paradigm=SQM, Reasoning Strategy=with Reasoning, Training Phase=SFT2026.02 | 38.13 |