English-to-Chinese Translation on Our dataset
82.55GRF ScoreReflectMT-Stage2(Our)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ReflectMT-Stage2(Our)Token=30.732026.04 | 82.55 | 2 | 78.05 | |
| Qwen3-8B(w/ refl)Token=863.12, reflection=true2026.04 | 81.78 | 2.42 | 78.03 | |
| QwQ-32B(w/ refl)Token=1063.01, reflection=true2026.04 | 81.65 | 2.16 | 77.97 | |
| DeepSeek-R1(w/ refl)Token=659.83, reflection=true2026.04 | 81.15 | 2.5 | 76.67 | |
| Qwen-7B-Adapt-RL†Token=56.29, thought_mode=adaptive2026.04 | 79.81 | 2.27 | 77.62 | |
| ReflectMT-Stage1(Our)Token=29.412026.04 | 79.73 | 2.37 | 77.45 | |
| Qwen3-8BToken=628.632026.04 | 79.54 | 2.53 | 77.9 | |
| QwQ-32BToken=523.722026.04 | 79.5 | 2.22 | 77.77 | |
| Qwen2.5-14B(w/ refl)Token=188.44, reflection=true2026.04 | 79.08 | 2.58 | 77.21 | |
| ExTrans-7BToken=979.082026.04 | 78.95 | 2.33 | 77.63 | |
| Qwen-7B-Full-RL‡Token=127.47, thought_mode=full2026.04 | 78.59 | 2.32 | 77.43 | |
| DeepSeek-R1Token=541.882026.04 | 78 | 3.03 | 76.5 | |
| ReflectMT-SFT(Cold Start)Token=23.252026.04 | 76.35 | 2.65 | 76.7 | |
| Qwen-7B-Adapt-LoRAToken=51.32026.04 | 76.22 | 2.63 | 77.11 | |
| DRT-7BToken=478.992026.04 | 75.69 | 2.93 | 75.48 | |
| Marco-o1-7B(w/ refl)Token=731.71, reflection=true2026.04 | 75.09 | 2.84 | 76.07 | |
| DeepTrans-7BToken=386.662026.04 | 75 | 3.29 | 72.62 | |
| Qwen2.5-14BToken=29.062026.04 | 74.21 | 2.65 | 77.02 | |
| Qwen-7B-InstructToken=33.082026.04 | 73.52 | 2.7 | 76.43 | |
| Marco-o1-7BToken=489.242026.04 | 68.43 | 2.9 | 75.8 | |
| Llama3.1-8BToken=39.182026.04 | 62.19 | 3.2 | 74.98 |