Multi-choice reasoning on LongReason
84.13Accuracy (32k)QwenLong-L1-32B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| QwenLong-L1-32BBackbone=QwenLong-L1-32B2026.03 | 84.13 | 83.63 | 75.06 | 80.94 | |
| Qwen2.5-14B-1M-LongRLVRBackbone=Qwen2.5-14B-1M, Protocol=LongRLVR2026.03 | 81.23 | 77.96 | 76.07 | 78.42 | |
| Qwen3-14B (Thinking)Backbone=Qwen3-14B, Thinking Mode=true2026.03 | 80.86 | 77.08 | 74.56 | 77.5 | |
| Qwen2.5-7B-1M-LongRLVRBackbone=Qwen2.5-7B-1M, Protocol=LongRLVR2026.03 | 80.35 | 79.47 | 77.83 | 79.22 | |
| Qwen3-8B (Thinking)Backbone=Qwen3-8B, Thinking Mode=true2026.03 | 77.23 | 71.28 | 65.99 | 71.5 | |
| Qwen2.5-14B-1MBackbone=Qwen2.5-14B-1M2026.03 | 75.44 | 71.79 | 73.42 | 73.55 | |
| Qwen2.5-72B-YaRNBackbone=Qwen2.5-72B, Extension=YaRN2026.03 | 74.27 | 74.53 | 69.48 | 72.76 | |
| Qwen2.5-14B-1M-SFTBackbone=Qwen2.5-14B-1M, Protocol=SFT2026.03 | 74.18 | 70.03 | 69.27 | 71.16 | |
| Qwen2.5-14B-1M-RLVRBackbone=Qwen2.5-14B-1M, Protocol=RLVR2026.03 | 74.06 | — | — | 72.33 | |
| Qwen2.5-7B-1M-RLVRBackbone=Qwen2.5-7B-1M, Protocol=RLVR2026.03 | 70.78 | 69.02 | 68.01 | 69.27 | |
| Qwen2.5-7B-1M-SFTBackbone=Qwen2.5-7B-1M, Protocol=SFT2026.03 | 68.64 | 66.83 | 66.62 | 67.36 | |
| Qwen2.5-7B-1MBackbone=Qwen2.5-7B-1M2026.03 | 66.75 | 66.25 | 66.36 | 66.45 | |
| LLaMA-3.1-70BBackbone=LLaMA-3.1-70B2026.03 | 61.16 | 63.3 | 48.3 | 57.59 | |
| LLaMA-3.1-8B-LongRLVRBackbone=LLaMA-3.1-8B, Protocol=LongRLVR2026.03 | 51.89 | 51.01 | 56.8 | 53.23 | |
| LLaMA-3.1-8BBackbone=LLaMA-3.1-8B2026.03 | 51.45 | 49.94 | 46.53 | 49.31 | |
| LLaMA-3.1-8B-SFTBackbone=LLaMA-3.1-8B, Protocol=SFT2026.03 | 50.88 | 49.11 | 48.87 | 49.62 | |
| LLaMA-3.1-8B-RLVRBackbone=LLaMA-3.1-8B, Protocol=RLVR2026.03 | 49.87 | 49.62 | 49.37 | 49.62 |