Long-context evaluation on LongBench v2
59.76Overall ScoreQwen3-235B-A22B-Thinking
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen3-235B-A22B-ThinkingBaseline category=Strong Baseline2026.05 | 59.76 | — | — | — | — | — | |
| Qwen3-30B-A3B-Thinking + ACCMethod category=Our Method2026.05 | 48.9 | — | — | — | — | — | |
| Qwen3-30B-A3B-ThinkingBaseline category=Base Model2026.05 | 47.87 | — | — | — | — | — | |
| CSAttentionBackbone=Llama-3.1-8B2026.03 | 31.2 | 34.4 | 29.3 | 37.8 | 25.1 | 32.4 | |
| FullBackbone=Llama-3.1-8B2026.03 | 31 | 35.4 | 28.3 | 37.2 | 26 | 30.6 | |
| H2OBackbone=Llama-3.1-8B2026.03 | 29.9 | 32.9 | 28 | 33.8 | 27.9 | 31.5 | |
| PQCacheBackbone=Llama-3.1-8B2026.03 | 29.8 | 33.3 | 27.7 | 37.8 | 22.3 | 31.5 | |
| MagicPigBackbone=Llama-3.1-8B2026.03 | 29.2 | 29.5 | 29 | 31.8 | 26.9 | 29.4 | |
| SparQBackbone=Llama-3.1-8B2026.03 | 26.2 | 27.6 | 25.4 | 30 | 22.3 | 27.8 |