Long-context Reasoning on LongBench v2
68.9Average ScoreQwen-3.5
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen-3.5Context length=≤ 1M, Parameter Count=397B-17B2026.06 | 68.9 | — | — | — | — | — | — | — | — | — | — | |
| Gemini 3 Pro2026.02 | 68.2 | — | — | — | — | — | — | — | — | — | — | |
| GLM-52026.02 | 64.5 | — | — | — | — | — | — | — | — | — | — | |
| Claude Opus 4.52026.02 | 64.4 | — | — | — | — | — | — | — | — | — | — | |
| DS-v4-ProContext length=≤ 1M, Parameter Count=1.6T-A49B2026.06 | 62.1 | — | — | — | — | — | — | — | — | — | — | |
| Nemotron 3 UltraContext length=≤ 1M, Parameter Count=550B-A55B2026.06 | 61.9 | — | — | — | — | — | — | — | — | — | — | |
| Kimi K2.52026.02 | 61 | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-V3.22026.02 | 59.8 | — | — | — | — | — | — | — | — | — | — | |
| GPT-5.2 (xhigh)2026.02 | 59.8 | — | — | — | — | — | — | — | — | — | — | |
| GLM-4.72026.02 | 59.1 | — | — | — | — | — | — | — | — | — | — | |
| DS-v4-FlashContext length=≤ 1M, Parameter Count=284B-A13B2026.06 | 57 | — | — | — | — | — | — | — | — | — | — | |
| LoongRLBackbone=Qwen3-30B-A3B-Thinking-25072026.05 | 52.3 | — | — | — | — | — | — | — | — | — | — | |
| LONGTRACERL-GRPOBackbone=Qwen3-30B-A3B-Thinking-25072026.05 | 51.8 | — | — | — | — | — | — | — | — | — | — | |
| DocQABackbone=Qwen3-30B-A3B-Thinking-25072026.05 | 51.6 | — | — | — | — | — | — | — | — | — | — | |
| LONGTRACERLBackbone=Qwen3-30B-A3B-Thinking-25072026.05 | 51.3 | — | — | — | — | — | — | — | — | — | — | |
| LongRLVRBackbone=Qwen3-30B-A3B-Thinking-25072026.05 | 50.3 | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=Qwen3-30B-A3B-Thinking-25072026.05 | 49.9 | — | — | — | — | — | — | — | — | — | — | |
| MAVEN (Qwen3-30B-A3B)Model=Qwen3-30B-A3B, Training Stage=MAVEN2026.07 | 48.8 | 53.9 | 45.9 | 46.3 | — | — | — | — | — | — | — | |
| Qwen3-32B (Thinking)Model=Qwen3-32B (Thinking)2026.07 | 48.7 | 56.7 | 44 | 45.1 | — | — | — | — | — | — | — | |
| Qwen3-30B-A3B + Outcome+Evidence ID (Prompted exploration)Model=Qwen3-30B-A3B, Training Stage=Outcome+Evidence ID, Exploration Strategy=Prompted exploration2026.07 | 44.8 | 49.3 | 41.6 | 43.8 | — | — | — | — | — | — | — | |
| DocQABackbone=Qwen3-4B-Thinking-25072026.05 | 44.6 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-30B-A3B + Outcome+Evidence IDModel=Qwen3-30B-A3B, Training Stage=Outcome+Evidence ID2026.07 | 44.6 | 48.9 | 41.1 | 44.4 | — | — | — | — | — | — | — | |
| LONGTRACERLBackbone=Qwen3-4B-Thinking-25072026.05 | 44.1 | — | — | — | — | — | — | — | — | — | — | |
| LongRLVRBackbone=Qwen3-4B-Thinking-25072026.05 | 43.8 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-30B-A3BModel=Qwen3-30B-A3B, Training Stage=Base2026.07 | 43.7 | 50.7 | 39.4 | 40.7 | — | — | — | — | — | — | — | |
| MAVEN (Qwen2.5-14B)Model=Qwen2.5-14B, Training Stage=MAVEN2026.07 | 43.5 | 51.5 | 40.2 | 37 | — | — | — | — | — | — | — | |
| Qwen3-30B-A3B + OutcomeModel=Qwen3-30B-A3B, Training Stage=Outcome-only RL2026.07 | 43.5 | 49.8 | 39.7 | 40.7 | — | — | — | — | — | — | — | |
| Qwen3-30B-A3B + SFTModel=Qwen3-30B-A3B, Training Stage=SFT2026.07 | 42.2 | 49.3 | 38.1 | 38.9 | — | — | — | — | — | — | — | |
| LoongRLBackbone=Qwen3-4B-Thinking-25072026.05 | 41.8 | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=Qwen3-4B-Thinking-25072026.05 | 41.7 | — | — | — | — | — | — | — | — | — | — | |
| QwenLong-L1-32BModel=QwenLong-L1-32B2026.07 | 41.4 | 52.8 | 36.2 | 32.7 | — | — | — | — | — | — | — | |
| LONGTRACERL-GRPOBackbone=Qwen3-4B-Thinking-25072026.05 | 40.7 | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-14B + Outcome+Evidence ID (Prompted exploration)Model=Qwen2.5-14B, Training Stage=Outcome+Evidence ID, Exploration Strategy=Prompted exploration2026.07 | 40.3 | 49.3 | 36.5 | 33 | — | — | — | — | — | — | — | |
| Qwen2.5-14B + Outcome+Evidence IDModel=Qwen2.5-14B, Training Stage=Outcome+Evidence ID2026.07 | 40.1 | 49.3 | 36.1 | 33 | — | — | — | — | — | — | — | |
| Qwen2.5-14B + OutcomeModel=Qwen2.5-14B, Training Stage=Outcome-only RL2026.07 | 38.8 | 48.1 | 34.9 | 31.2 | — | — | — | — | — | — | — | |
| LLaMA-3.1-70BModel=LLaMA-3.1-70B2026.07 | 38.3 | 42.8 | 38 | 31.2 | — | — | — | — | — | — | — | |
| Qwen2.5-14B + SFTModel=Qwen2.5-14B, Training Stage=SFT2026.07 | 38.3 | 46.8 | 34.7 | 31.2 | — | — | — | — | — | — | — | |
| Qwen2.5-14BModel=Qwen2.5-14B, Training Stage=Base2026.07 | 38 | 47.6 | 33.9 | 30.2 | — | — | — | — | — | — | — | |
| MAVEN (LLaMA-3.1-8B)Model=LLaMA-3.1-8B, Training Stage=MAVEN2026.07 | 36.6 | 39.8 | 36.2 | 32.1 | — | — | — | — | — | — | — | |
| OPSDLModel Scale=32B, Training Strategy=OPSDL, Sampling Temperature=0.12026.04 | 36.5 | 39.1 | 34.9 | 35 | 36.1 | 36.6 | — | — | — | — | — | |
| Qwen2.5-14B-Instruct-1MModel Scale=14B, Training Strategy=1M-Instruct, Sampling Temperature=0.12026.04 | 36.4 | 45.6 | 32.1 | 29.6 | 38.8 | 34.9 | — | — | — | — | — | |
| Qwen3-8B-SFT w/ LongRModel Size=8B, Training=SFT + LongR2026.02 | 36.23 | 38.75 | 32.67 | 39.12 | 41.15 | 33.2 | — | — | — | — | — | |
| Qwen3-4B-SFT w/ LongRModel Size=4B, Training=SFT + LongR2026.02 | 35.44 | 38.75 | 37.21 | 26.39 | 35.16 | 35.61 | — | — | — | — | — | |
| Long-SFTModel Scale=32B, Training Strategy=Long-SFT, Sampling Temperature=0.12026.04 | 34.2 | 40.3 | 30.6 | 31.3 | 34.8 | 33.9 | — | — | — | — | — | |
| OPSDLModel Scale=14B, Training Strategy=OPSDL, Sampling Temperature=0.12026.04 | 33.7 | 41.5 | 27.1 | 33.6 | 34.4 | 33.2 | — | — | — | — | — | |
| Elastic AttentionBackbone=Qwen3-8B, Sparsity Config=FA-SSA2026.01 | 33.41 | — | — | — | 37.33 | 31.2 | 0.66 | — | — | — | — | |
| Qwen3-8B*Model Size=8B, Variant=Officially released model2026.02 | 33.38 | 35.65 | 28.76 | 34.65 | 40.62 | 28.93 | — | — | — | — | — | |
| LLaMA-3.1-8B + Outcome+Evidence ID (Prompted exploration)Model=LLaMA-3.1-8B, Training Stage=Outcome+Evidence ID, Exploration Strategy=Prompted exploration2026.07 | 33.1 | 37.6 | 32.9 | 25.9 | — | — | — | — | — | — | — | |
| LLaMA-3.1-8B + Outcome+Evidence IDModel=LLaMA-3.1-8B, Training Stage=Outcome+Evidence ID2026.07 | 33 | 38.1 | 32.6 | 25.3 | — | — | — | — | — | — | — | |
| Qwen2.5-32B-InstructModel Scale=32B, Training Strategy=Base Instruct, Sampling Temperature=0.12026.04 | 32.9 | 39.9 | 28.4 | 30.4 | 36.2 | 30.9 | — | — | — | — | — | |
| Qwen3-8B-SFT w/ DAPOModel Size=8B, Training=SFT + DAPO2026.02 | 32.84 | 37.93 | 28.57 | 32.21 | 39.9 | 28.49 | — | — | — | — | — | |
| Llama3.1-8B-Writing-RLSFT=true, RL=PPO2025.06 | 32.8 | 42.2 | 29.3 | 24.1 | 31.2 | 33.8 | — | — | — | — | — | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct2026.01 | 32.69 | — | — | — | 32 | 33.08 | — | — | — | — | — | |
| OPSDLModel Scale=7B, Training Strategy=OPSDL, Sampling Temperature=0.12026.04 | 32.6 | 36.1 | 32.7 | 26.9 | 34.4 | 31.6 | — | — | — | — | — | |
| Long-SFTModel Scale=14B, Training Strategy=Long-SFT, Sampling Temperature=0.12026.04 | 32.5 | 40.6 | 28.5 | 26.9 | 34 | 31.5 | — | — | — | — | — | |
| DRIFTComp. Ratio=32×, Backbone=Qwen2.5-Instruct-7B2026.02 | 32.41 | 36.67 | 28.37 | 33.33 | — | — | — | — | — | — | — | |
| LLaMA-3.1-8B + OutcomeModel=LLaMA-3.1-8B, Training Stage=Outcome-only RL2026.07 | 32 | 36.7 | 32 | 24.4 | — | — | — | — | — | — | — | |
| Qwen3-8BBackbone=Qwen3-8B2026.01 | 31.97 | — | — | — | 39.33 | 27.82 | — | — | — | — | — | |
| Qwen2.5-7B-Writing-RLSFT=true, RL=PPO2025.06 | 31.8 | 42.1 | 25.7 | 26.5 | 35.8 | 29.3 | — | — | — | — | — | |
| PruLongBackbone=Qwen3-8B2026.01 | 31.73 | — | — | — | 38.67 | 27.82 | 0.7 | — | — | — | — | |
| Qwen2.5-14B-InstructModel Scale=14B, Training Strategy=Base Instruct, Sampling Temperature=0.12026.04 | 31.6 | 37.9 | 28.4 | 27.6 | 35 | 29.5 | — | — | — | — | — | |
| Qwen3-4B*Model Size=4B, Variant=Officially released model2026.02 | 31.46 | 35.16 | 28.1 | 31.46 | 34.7 | 29.46 | — | — | — | — | — | |
| DBTrimKVBackbone=microsoft/Phi-3-mini-128k-instruct, KV Budget=1024, Chunk-prefill settings=Follow Huang et al., 2025b2026.05 | 31.44 | 37.08 | 19.77 | — | 36.67 | 28.74 | — | — | — | 9.2 | — | |
| Qwen2.5-Instruct-7BComp. Ratio=1×2026.02 | 31.01 | 41.11 | 26.05 | 24.07 | — | — | — | — | — | — | — | |
| DuoAttentionBackbone=Qwen3-8B2026.01 | 31.01 | — | — | — | 40.67 | 25.56 | 0.7 | — | — | — | — | |
| Elastic AttentionBackbone=Llama-3.1-8B-Instruct, Sparsity Config=FA-XA2026.01 | 30.77 | — | — | — | 30.67 | 30.83 | 0.75 | — | — | — | — | |
| Elastic AttentionBackbone=Qwen3-8B, Sparsity Config=FA-XA2026.01 | 30.74 | — | — | — | 30.68 | 30.77 | 0.78 | — | — | — | — | |
| Qwen2.5-7B-Instruct-1MModel Scale=7B, Training Strategy=1M-Instruct, Sampling Temperature=0.12026.04 | 30.6 | 39.3 | 25.6 | 26.1 | 36 | 27.3 | — | — | — | — | — | |
| LLaMA-3.1-8B + SFTModel=LLaMA-3.1-8B, Training Stage=SFT2026.07 | 30.5 | 34.5 | 30.4 | 24.1 | — | — | — | — | — | — | — | |
| Qwen3-4B-SFT w/ DAPOModel Size=4B, Training=SFT + DAPO2026.02 | 30.41 | 33.33 | 31.36 | 23.87 | 28.32 | 31.63 | — | — | — | — | — | |
| Llama3.1-8B-InstructSFT=false, RL=false2025.06 | 30.2 | 35.6 | 27.4 | 26.9 | 32.3 | 28.9 | — | — | — | — | — | |
| LLaMA-3.1-8BModel=LLaMA-3.1-8B, Training Stage=Base2026.07 | 29.9 | 33.3 | 30.7 | 22.5 | — | — | — | — | — | — | — | |
| Qwen2.5-7B-InstructSFT=false, RL=false2025.06 | 29.6 | 38.9 | 26 | 21.3 | 31.8 | 28.3 | — | — | — | — | — | |
| DRIFTComp. Ratio=32×, Backbone=Mistral-7B-v0.22026.02 | 29.22 | 32.22 | 28.84 | 25 | — | — | — | — | — | — | — | |
| InfLLM-V2Backbone=Qwen3-8B2026.01 | 29.09 | — | — | — | 29.32 | 28.67 | — | — | — | — | — | |
| InfLLM-V2Backbone=Llama-3.1-8B-Instruct2026.01 | 29.09 | — | — | — | 29.32 | 28.67 | — | — | — | — | — | |
| Elastic AttentionBackbone=Llama-3.1-8B-Instruct, Sparsity Config=FA-SSA2026.01 | 29.09 | — | — | — | 28 | 29.7 | 0.68 | — | — | — | — | |
| Full KVBackbone=microsoft/Phi-3-mini-128k-instruct, KV Budget=1024, Chunk-prefill settings=Follow Huang et al., 2025b2026.05 | 28.79 | 33.71 | 18.6 | — | 34.44 | 25.86 | — | — | — | 0 | — | |
| PruLongBackbone=Llama-3.1-8B-Instruct2026.01 | 28.61 | — | — | — | 28 | 28.92 | 0.7 | — | — | — | — | |
| LocRetBackbone=hyx21/Locret-phi-3-mini-128K, KV Budget=1024, Chunk-prefill settings=Follow Huang et al., 2025b2026.05 | 28.41 | 30.34 | 24.42 | — | 30 | 27.59 | — | — | — | -1.32 | — | |
| Llama3.1-8B-WritingBench-SFTSFT=true, RL=false2025.06 | 28.4 | 36.7 | 23.7 | 24.1 | 29.7 | 27.7 | — | — | — | — | — | |
| Elastic AttentionBackbone=Qwen3-4B, Sparsity Config=FA-XA2026.01 | 28.12 | — | — | — | 32 | 25.94 | 0.72 | — | — | — | — | |
| Elastic AttentionBackbone=Qwen3-4B, Sparsity Config=FA-SSA2026.01 | 27.88 | — | — | — | 34 | 24.44 | 0.7 | — | — | — | — | |
| DuoAttentionBackbone=Llama-3.1-8B-Instruct2026.01 | 27.88 | — | — | — | 28.67 | 27.44 | 0.7 | — | — | — | — | |
| Qwen2.5-7B-WritingBench-SFTSFT=true, RL=false2025.06 | 27.6 | 35 | 25.1 | 20.4 | 27.6 | 27.7 | — | — | — | — | — | |
| LongPOModel Scale=7B, Training Strategy=LongPO, Sampling Temperature=0.12026.04 | 27.5 | 38.4 | 23.9 | 16.7 | 29.2 | 26.5 | — | — | — | — | — | |
| LONGTRACERLBackbone=DeepSeek-R1-0528-Qwen3-8B2026.05 | 27.5 | — | — | — | — | — | — | — | — | — | — | |
| xRAGComp. Ratio=128×, Backbone=Mistral-7B-v0.22026.02 | 27.43 | 31.11 | 25.58 | 25 | — | — | — | — | — | — | — | |
| COCOMComp. Ratio=16×, Backbone=Mistral-7B-v0.22026.02 | 27.24 | 27.78 | 23.26 | 34.26 | — | — | — | — | — | — | — | |
| COCOMComp. Ratio=4×, Backbone=Mistral-7B-v0.22026.02 | 27.04 | 27.22 | 23.26 | 34.26 | — | — | — | — | — | — | — | |
| COCOMComp. Ratio=128×, Backbone=Mistral-7B-v0.22026.02 | 27.04 | 29.44 | 21.4 | 34.26 | — | — | — | — | — | — | — | |
| LongRLVRBackbone=DeepSeek-R1-0528-Qwen3-8B2026.05 | 26.8 | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8B-SFTModel Size=8B, Variant=Supervised Fine-Tuning2026.02 | 26.64 | 32.02 | 24.45 | 23.35 | 28.25 | 25.65 | — | — | — | — | — | |
| DRIFTComp. Ratio=64×, Backbone=Mistral-7B-v0.22026.02 | 26.44 | 26.67 | 29.77 | 19.44 | — | — | — | — | — | — | — | |
| DRIFTComp. Ratio=128×, Backbone=Mistral-7B-v0.22026.02 | 26.24 | 32.22 | 24.65 | 19.44 | — | — | — | — | — | — | — | |
| Qwen2.5-7B-InstructModel Scale=7B, Training Strategy=Base Instruct, Sampling Temperature=0.12026.04 | 26.2 | 33.3 | 23.3 | 20.4 | 29.2 | 24.4 | — | — | — | — | — | |
| TRIM-KVBackbone=microsoft/Phi-3-mini-128k-instruct, KV Budget=1024, Chunk-prefill settings=Follow Huang et al., 2025b2026.05 | 26.13 | 29.21 | 19.77 | — | 31.11 | 23.56 | — | — | — | -9.24 | — | |
| Long-SFTModel Scale=7B, Training Strategy=Long-SFT, Sampling Temperature=0.12026.04 | 26.1 | 32.6 | 22.7 | 22.2 | 28.2 | 24.9 | — | — | — | — | — | |
| Qwen3-4BBackbone=Qwen3-4B2026.01 | 25.96 | — | — | — | 32.67 | 22.18 | — | — | — | — | — | |
| DuoAttentionBackbone=Qwen3-4B2026.01 | 25.96 | — | — | — | 28.67 | 24.44 | 0.7 | — | — | — | — |