Long Context Understanding on LongBench V2
82.36Overall ScoreGemma-4-31B-it
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Gemma-4-31B-itQuantization=BF162026.05 | 82.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 63.35 | — | — | |
| Mix-QuantBase Model=Gemma-4-31B-it2026.05 | 81.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 61.64 | — | — | |
| Gemma-4-31B-it-NVFP4Quantization=NVFP42026.05 | 78.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58.55 | — | — | |
| Qwen3.5-9BQuantization=BF162026.05 | 72.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 55.47 | — | — | |
| Gemma-4-26B-A4B-itQuantization=BF162026.05 | 71.94 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 53.83 | — | — | |
| Mix-QuantBase Model=Gemma-4-26B-A4B-it2026.05 | 71.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 51.57 | — | — | |
| Mix-QuantBase Model=Qwen3.5-9B2026.05 | 70.59 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 52.29 | — | — | |
| Confident DecodingModel=Qwen3.5-122B-A10B, Decoding Method=Confident2026.06 | 66.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-122B-A10B, Decoding Strategy=Confident (Ours)2026.06 | 66.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last Layer DecodingModel=Qwen3.5-122B-A10B, Decoding Method=Last Layer2026.06 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last LayerModel=Qwen3.5-122B-A10B, Decoding Strategy=Last Layer2026.06 | 66.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemma-4-26B-A4B-it-NVFP4Quantization=NVFP42026.05 | 66.31 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 48.15 | — | — | |
| Gemini-3.0 ProVariant=Pro2026.01 | 65.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-27B, Decoding Strategy=Confident (Ours)2026.06 | 64.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-27B, Decoding Method=Confident2026.06 | 64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last Layer DecodingModel=Qwen3.5-35B-A3B, Decoding Method=Last Layer2026.06 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-35B-A3B, Decoding Strategy=Confident (Ours)2026.06 | 63.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last Layer DecodingModel=Qwen3.5-27B, Decoding Method=Last Layer2026.06 | 63.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-35B-A3B, Decoding Method=Confident2026.06 | 63.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3.5-9B-NVFP4Quantization=NVFP42026.05 | 63.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 50.4 | — | — | |
| Last LayerModel=Qwen3.5-35B-A3B, Decoding Strategy=Last Layer2026.06 | 63.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last LayerModel=Qwen3.5-27B, Decoding Strategy=Last Layer2026.06 | 62.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BQuantization=BF162026.05 | 62.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 39.86 | — | — | |
| Last Layer DecodingModel=Qwen3.5-9B, Decoding Method=Last Layer2026.06 | 62 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Claude Sonnet 4.5Variant=Sonnet 4.52026.01 | 61.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mix-QuantBase Model=Qwen3-8B2026.05 | 61 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 38.6 | — | — | |
| MiMo-V2-FlashVariant=Flash2026.01 | 60.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-9B, Decoding Method=Confident2026.06 | 60.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-K2.5Mode=Instant2026.06 | 59.64 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Gemma-4-31B, Decoding Method=Confident2026.06 | 59.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Gemma-4-31B, Decoding Strategy=Confident (Ours)2026.06 | 59.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last Layer DecodingModel=Gemma-4-31B, Decoding Method=Last Layer2026.06 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last LayerModel=Gemma-4-31B, Decoding Strategy=Last Layer2026.06 | 58.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-V3.2 ThinkingThinking Mode=true2026.01 | 58.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=Qwen3.5-9B-Base, Decoding Method=Confident2026.06 | 56.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=gpt-oss-120B, Decoding Method=Confident2026.06 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=gpt-oss-120B, Decoding Strategy=Confident (Ours)2026.06 | 55.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8B-NVFP4Quantization=NVFP42026.05 | 55.22 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 35.46 | — | — | |
| Last Layer DecodingModel=gpt-oss-120B, Decoding Method=Last Layer2026.06 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last LayerModel=gpt-oss-120B, Decoding Strategy=Last Layer2026.06 | 54.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last Layer DecodingModel=Qwen3.5-9B-Base, Decoding Method=Last Layer2026.06 | 54.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-V3.2Thinking Mode=nothink2026.06 | 51.89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-5.4Reasoning Mode=non-reasoning2026.06 | 49.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BModel=Qwen3-8B, Evaluation Protocol=qTTT2025.12 | 48.8 | 42.4 | 58.5 | 50 | 44 | — | — | — | — | — | — | — | — | 52 | 46 | — | — | — | — | — | |
| Ling-2.6-1T2026.06 | 48.31 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Kimi-K2 ThinkingThinking Mode=true2026.01 | 48.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=gpt-oss-20b, Decoding Method=Confident2026.06 | 46.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SlowBackbone=Qwen3-235B-A22B2026.03 | 46 | — | — | — | — | — | — | 50 | 43.7 | 48 | 44.1 | 47.6 | — | — | — | — | — | — | — | — | |
| SFIBackbone=Qwen3-235B-A22B2026.03 | 46 | — | — | — | — | — | — | 50 | 43.7 | 47.5 | 44.1 | 52.4 | — | — | — | — | — | — | — | — | |
| Confident DecodingModel=gpt-oss-20b, Decoding Strategy=Confident (Ours)2026.06 | 44.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last Layer DecodingModel=gpt-oss-20b, Decoding Method=Last Layer2026.06 | 44.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Last LayerModel=gpt-oss-20b, Decoding Strategy=Last Layer2026.06 | 43.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-8BModel=Qwen3-8B, Evaluation Protocol=Thinking2025.12 | 42.3 | 38.2 | 53.8 | 34 | 40 | — | — | — | — | — | — | — | — | 44 | 44 | — | — | — | — | — | |
| Qwen3-4BModel=Qwen3-4B, Evaluation Protocol=qTTT2025.12 | 39.6 | 35.3 | 43.6 | 46 | 33 | — | — | — | — | — | — | — | — | 32 | 48 | — | — | — | — | — | |
| ProxyAttnBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=false2025.09 | 38.33 | — | — | — | — | — | — | — | — | 43.9 | 28.4 | 27.8 | — | — | — | — | — | — | — | — | |
| ProxyAttnBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=true2025.09 | 38.33 | — | — | — | — | — | — | — | — | 40 | 36.7 | 32.4 | — | — | — | — | — | — | — | — | |
| FullAttentionBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=false2025.09 | 38.22 | — | — | — | — | — | — | — | — | 39.4 | 28.4 | 34.3 | — | — | — | — | — | — | — | — | |
| FullAttentionBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=true2025.09 | 38.22 | — | — | — | — | — | — | — | — | 38.9 | 36.3 | 33.3 | — | — | — | — | — | — | — | — | |
| MinferenceBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=false2025.09 | 37.91 | — | — | — | — | — | — | — | — | 40.6 | 26.5 | 28.7 | — | — | — | — | — | — | — | — | |
| MinferenceBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=true2025.09 | 37.91 | — | — | — | — | — | — | — | — | 43.9 | 34.4 | 29.6 | — | — | — | — | — | — | — | — | |
| FlexPrefillBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=false2025.09 | 37.39 | — | — | — | — | — | — | — | — | 41.7 | 30.2 | 27.8 | — | — | — | — | — | — | — | — | |
| FlexPrefillBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=true2025.09 | 37.39 | — | — | — | — | — | — | — | — | 35.6 | 34.9 | 31.5 | — | — | — | — | — | — | — | — | |
| XAttentionBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=false2025.09 | 37.26 | — | — | — | — | — | — | — | — | 41.7 | 27.4 | 32.4 | — | — | — | — | — | — | — | — | |
| XAttentionBackbone=Qwen2.5-7B-Instruct-1M, Chain-of-Thought (CoT)=true2025.09 | 37.26 | — | — | — | — | — | — | — | — | 42.2 | 33.5 | 30.6 | — | — | — | — | — | — | — | — | |
| ProxyAttnBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=false2025.09 | 36.06 | — | — | — | — | — | — | — | — | 34.4 | 27.4 | 29.6 | — | — | — | — | — | — | — | — | |
| ProxyAttnBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=true2025.09 | 36.06 | — | — | — | — | — | — | — | — | 41.1 | 27.9 | 29.6 | — | — | — | — | — | — | — | — | |
| RL_RACESBackbone=DeepSeek-R1-Distill-Qwen-14B2026.06 | 36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 51.3 | — | |
| RL_RACESBackbone=Qwen3-14B2026.06 | 35.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 61.1 | — | |
| FullAttentionBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=false2025.09 | 35.38 | — | — | — | — | — | — | — | — | 33.9 | 26.5 | 25 | — | — | — | — | — | — | — | — | |
| FullAttentionBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=true2025.09 | 35.38 | — | — | — | — | — | — | — | — | 36.1 | 30.7 | 27.8 | — | — | — | — | — | — | — | — | |
| FullModel=Qwen2.5-7B-1M2025.10 | 35.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-1.7BModel=Qwen3-1.7B, Evaluation Protocol=qTTT2025.12 | 35.1 | 30.3 | 46.2 | 42 | 28 | — | — | — | — | — | — | — | — | 26 | 38 | — | — | — | — | — | |
| SlowBackbone=Qwen3-30B-A3B2026.03 | 35.1 | — | — | — | — | — | — | 36 | 34.6 | 38.5 | 32.8 | 28.6 | — | — | — | — | — | — | — | — | |
| SFIBackbone=Qwen3-30B-A3B2026.03 | 35.1 | — | — | — | — | — | — | 36 | 34.6 | 38.5 | 32.8 | 28.6 | — | — | — | — | — | — | — | — | |
| XAttentionBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=false2025.09 | 34.89 | — | — | — | — | — | — | — | — | 35 | 26 | 26.9 | — | — | — | — | — | — | — | — | |
| XAttentionBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=true2025.09 | 34.89 | — | — | — | — | — | — | — | — | 35 | 31.2 | 27.8 | — | — | — | — | — | — | — | — | |
| SFIBackbone=Qwen3-4B2026.03 | 34.8 | — | — | — | — | — | — | 38.5 | 32.5 | 35 | 34.9 | 34.3 | — | — | — | — | — | — | — | — | |
| MinferenceBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=false2025.09 | 34.78 | — | — | — | — | — | — | — | — | 35 | 26 | 30.6 | — | — | — | — | — | — | — | — | |
| MinferenceBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=true2025.09 | 34.78 | — | — | — | — | — | — | — | — | 38.9 | 31.2 | 26.9 | — | — | — | — | — | — | — | — | |
| PBS-AttnModel=Qwen2.5-7B-1M2025.10 | 34.39 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SlowBackbone=Qwen3-4B2026.03 | 34.2 | — | — | — | — | — | — | 37.5 | 32.2 | 35 | 33.5 | 34.3 | — | — | — | — | — | — | — | — | |
| MinferenceModel=Qwen2.5-7B-1M2025.10 | 34.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| XAttentionModel=Qwen2.5-7B-1M2025.10 | 34.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RL_individualBackbone=Qwen3-14B2026.06 | 34.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 60.1 | — | |
| FlexPrefillBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=false2025.09 | 33.96 | — | — | — | — | — | — | — | — | 30.6 | 27.9 | 25.9 | — | — | — | — | — | — | — | — | |
| FlexPrefillBackbone=Llama3.1-8B-Instruct, Chain-of-Thought (CoT)=true2025.09 | 33.96 | — | — | — | — | — | — | — | — | 36.7 | 25.1 | 28.7 | — | — | — | — | — | — | — | — | |
| RL_individualBackbone=DeepSeek-R1-Distill-Qwen-14B2026.06 | 33.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 48.8 | — | |
| HeteroCacheMem%=30%, Backbone=Qwen2.5-14B-Instruct2026.01 | 33.6 | — | — | — | — | — | — | 35.9 | 32.2 | 44.4 | 27.4 | 27.8 | — | — | — | — | — | — | — | — | |
| Qwen3-4BModel=Qwen3-4B, Evaluation Protocol=Thinking2025.12 | 33.5 | 35.3 | 30.8 | 40 | 25 | — | — | — | — | — | — | — | — | 28 | 42 | — | — | — | — | — | |
| FluxAttn (FA-XA)Backbone=Llama-3.1-8B-Instruct2026.04 | 33.41 | — | — | — | — | — | — | 36 | 31.95 | — | — | — | — | — | — | — | — | — | — | — | |
| OmniKVMem%=30%, Backbone=Qwen2.5-14B-Instruct2026.01 | 33.3 | — | — | — | — | — | — | 36.2 | 31.4 | 43.6 | 28.5 | 26 | — | — | — | — | — | — | — | — | |
| Qwen2.5-14B-InstructMem%=100%, Backbone=Qwen2.5-14B-Instruct, Note=FullAttention baseline2026.01 | 33.2 | — | — | — | — | — | — | 35.4 | 31.8 | 42.8 | 29.3 | 25 | — | — | — | — | — | — | — | — | |
| ShadowKVMem%=30%, Backbone=Qwen2.5-14B-Instruct2026.01 | 33 | — | — | — | — | — | — | 36.5 | 30.9 | 42.8 | 29.3 | 24.1 | — | — | — | — | — | — | — | — | |
| FluxAttn (FA-XA)Backbone=Qwen3-8B2026.04 | 32.69 | — | — | — | — | — | — | 32.67 | 32.71 | — | — | — | — | — | — | — | — | — | — | — | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct2026.04 | 32.69 | — | — | — | — | — | — | 32 | 33.08 | — | — | — | — | — | — | — | — | — | — | — | |
| BaseBackbone=DeepSeek-R1-Distill-Qwen-14B2026.06 | 32.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 48.2 | — | |
| BaseBackbone=Qwen3-14B2026.06 | 32.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 58.8 | — | |
| Qwen3-8BModel=Qwen3-8B, Evaluation Protocol=In-context2025.12 | 32.3 | 34.3 | 33.3 | 32 | 32 | — | — | — | — | — | — | — | — | 30 | 32 | — | — | — | — | — | |
| FluxAttn (FA-SSA)Backbone=Qwen3-8B, Configuration=Variant 22026.04 | 32.21 | — | — | — | — | — | — | 39.33 | 28.2 | — | — | — | — | — | — | — | — | — | — | — | |
| MAC-AttentionBackbone Model=LLaMA-3.1-70B2026.03 | 32.2 | — | — | — | — | — | — | — | — | 40.6 | 28.8 | 25 | — | — | — | — | 99 | — | — | — |