Long-document understanding on NarrativeQA
88.5Score (avg@3)Qwen3-235B-A22B-Thinking
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-235B-A22B-ThinkingBaseline category=Strong Baseline2026.05 | 88.5 | |
| Qwen3-30B-A3B-Thinking + ACCMethod category=Our Method2026.05 | 85.5 | |
| Qwen3-30B-A3B-ThinkingBaseline category=Base Model2026.05 | 85 |