Long-context Reasoning on Long-horizon
78MTP Acceptance RateQwen3.7-Plus
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3.7-PlusTraining objective=e2e TV loss, gamma (γ)=3, Rejection sampling=true2026.06 | 78 | |
| Qwen3.7-MaxTraining objective=e2e TV loss, gamma (γ)=3, Rejection sampling=true2026.06 | 77.2 | |
| Qwen3.6-PlusTraining objective=CE loss, gamma (γ)=3, Rejection sampling=true2026.06 | 75.6 | |
| Qwen3.6-35A3BTraining objective=CE loss, gamma (γ)=3, Rejection sampling=true2026.06 | 71.3 | |
| Qwen3.6-27BTraining objective=CE loss, gamma (γ)=3, Rejection sampling=true2026.06 | 69.5 |