Long-context Reasoning on Long-context Reasoning Suite (test)
74.91Average ScoreQwen3.5-35B-A3B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| Qwen3.5-35B-A3BScale=Lightweight Reasoning Models, Protocol=Unified protocol2026.05 | 74.91 | 68.87 | 59.44 | 74.88 | 97.37 | 78.72 | 70.2 | |
| GPT-5Scale=Flagship Reasoning Models, Source=Shen et al. (2025)2026.05 | 74.74 | 67.62 | 62.82 | 84.59 | 77.29 | 81.56 | 73.7 | |
| Gemini-2.5-ProScale=Flagship Reasoning Models, Source=Shen et al. (2025)2026.05 | 72.4 | 62.38 | 65.72 | 74.51 | 79.92 | 80.62 | 71.28 | |
| QwenLong-L1.5 (w. AEPO)Scale=30B, Algorithm=AEPO, Protocol=Unified protocol2026.05 | 71.2 | 66.4 | 55.2 | 74.5 | 82.5 | 80.9 | 67.7 | |
| GoLongRL-30B-A3B (w. GRPO)Scale=30B, Algorithm=GRPO, Protocol=Unified protocol2026.05 | 69.8 | 65.3 | 55.1 | 74.5 | 81.6 | 73.6 | 68.7 | |
| Qwen3-Max-Thinking-PreviewScale=Flagship Reasoning Models, Source=Shen et al. (2025)2026.05 | 69.43 | 64.12 | 57.89 | 77.93 | 71.24 | 74.69 | 70.71 | |
| Qwen3.5-4BScale=Lightweight Reasoning Models, Protocol=Unified protocol2026.05 | 68.81 | 65.87 | 45.92 | 70.87 | 96.09 | 70.52 | 63.6 | |
| Gemini-2.5-Flash-ThinkingScale=Lightweight Reasoning Models, Source=Shen et al. (2025)2026.05 | 68.73 | 64.75 | 56.77 | 65.78 | 78.84 | 79.38 | 66.86 | |
| DeepSeek-R1-0528Scale=Flagship Reasoning Models, Source=Shen et al. (2025)2026.05 | 68.67 | 63.44 | 59.48 | 76.86 | 64.88 | 77.5 | 69.9 | |
| Qwen3-235B-A22B-Thinking-2507Scale=Flagship Reasoning Models, Source=Shen et al. (2025)2026.05 | 68.45 | 65.75 | 57.46 | 75.12 | 66.17 | 75.31 | 70.9 | |
| QwenLong-L1.5 (w. GRPO)Scale=30B, Algorithm=GRPO, Source=Shen et al. (2025)2026.05 | 67.2 | 65.1 | 55.3 | 71.4 | 66.9 | 76.9 | 67.9 | |
| GoLongRL-4B (w. GRPO)Scale=4B, Algorithm=GRPO, Training Set=8K subset, Protocol=Unified protocol2026.05 | 62.2 | 62.5 | 45.5 | 66.6 | 67.5 | 65.1 | 65.9 | |
| Qwen3-30B-A3B-Thinking-2507Scale=30B, Protocol=Unified protocol2026.05 | 60.1 | 63.3 | 48.7 | 70.2 | 41.6 | 70.5 | 66.5 | |
| QwenLong-L1.5 (w. AEPO)Scale=4B, Algorithm=AEPO, Source=Shen et al. (2025)2026.05 | 59.4 | 62.5 | 47.9 | 67.4 | 47.9 | 64.7 | 65.8 | |
| GPT-OSS-120BScale=Lightweight Reasoning Models, Source=Shen et al. (2025)2026.05 | 58.55 | 61.25 | 47.01 | 72.69 | 39.68 | 64.38 | 66.3 | |
| GPT-5-NanoScale=Lightweight Reasoning Models, Source=Shen et al. (2025)2026.05 | 57.06 | 63.88 | 43.74 | 73.54 | 43.88 | 50.31 | 67.1 | |
| QwenLong-L1.5 (w. GRPO)Scale=4B, Algorithm=GRPO, Source=Shen et al. (2025)2026.05 | 56.1 | 61.3 | 44.3 | 67.1 | 40.9 | 58.8 | 64.1 | |
| Qwen3-4B-Thinking-2507Scale=4B, Protocol=Unified protocol2026.05 | 53 | 61 | 40.2 | 64.4 | 38.4 | 49.9 | 64 |