Machine Translation Ranking on Gemini-annotated held-out Zh↔En (test)
82.62AccuracyBT-RM
Evaluation Results
| Method | Links | |
|---|---|---|
| BT-RMParadigm=SQM, Reasoning Strategy=without Reasoning2026.02 | 82.62 | |
| GRRM (RLVR)Paradigm=GQM, Reasoning Strategy=with Reasoning, Training Phase=RLVR2026.02 | 82.58 | |
| DeepSeek-R1-0528Paradigm=GQM, Reasoning Strategy=with Reasoning2026.02 | 80.92 | |
| GRRM (SFT)Paradigm=GQM, Reasoning Strategy=with Reasoning, Training Phase=SFT2026.02 | 79.75 | |
| CometKiwi-XXLParadigm=SQM, Reasoning Strategy=without Reasoning2026.02 | 72.01 | |
| Gemini-2.5-ProParadigm=SQM, Reasoning Strategy=with Reasoning2026.02 | 70.28 | |
| DeepSeek-R1-0528Paradigm=SQM, Reasoning Strategy=with Reasoning2026.02 | 66.11 | |
| SQM-GenRM (RLVR)Paradigm=SQM, Reasoning Strategy=with Reasoning, Training Phase=RLVR2026.02 | 64.25 | |
| SQM-GenRM (SFT)Paradigm=SQM, Reasoning Strategy=with Reasoning, Training Phase=SFT2026.02 | 61.31 | |
| RandomParadigm=N/A2026.02 | 43.47 |