Long-context Question Answering on LongBench v2 (full)
56.7Overall AccuracyFull context
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Full contextContext length constraint=Untruncated2026.05 | 56.7 | 59.4 | 55 | 66.7 | 50.9 | 51.4 | — | — | — | — | — | — | — | |
| Full context (100k)Context length constraint=100k input tokens2026.05 | 51.1 | 58.9 | 46.3 | 54.4 | 44.2 | 59.3 | — | — | — | — | — | — | — | |
| LongAttnComp (Stage 2, nosubq)Training stage=Stage 2, Query-construction variant=nosubq2026.05 | 49.7 | 44.2 | 46.3 | 49.4 | 49.8 | 50 | — | — | — | — | — | — | — | |
| LongAttnComp (Stage 2, subq)Training stage=Stage 2, Query-construction variant=subq2026.05 | 48.9 | 56.2 | 44.4 | 53.9 | 42.3 | 53.7 | — | — | — | — | — | — | — | |
| RLMBackbone=Qwen3.6-35B-A3B, Fine-tuning=None2026.07 | 46.7 | — | — | — | — | — | 223.5 | — | — | — | — | — | — | |
| MPLMBackbone=Qwen3.6-35B-A3B, Fine-tuning=None2026.07 | 46.5 | — | — | — | — | — | 102.2 | — | — | — | — | — | — | |
| Speculative PrefillPrefilling strategy=Speculative2026.05 | 46.3 | 49 | 44.7 | 56.7 | 40.5 | 40.7 | — | — | — | — | — | — | — | |
| LongAttnComp (Stage 1)Training stage=Stage 12026.05 | 41.7 | 47.9 | 37.9 | 46.7 | 37.7 | 41.7 | — | — | — | — | — | — | — | |
| MPLMBackbone=Qwen3-30B-A3B, Fine-tuning=None2026.07 | 37.8 | — | — | — | — | — | 61.3 | — | — | — | — | — | — | |
| RLMBackbone=Qwen3-30B-A3B, Fine-tuning=None2026.07 | 29.7 | — | — | — | — | — | 105.7 | — | — | — | — | — | — |