Long-context Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
16.12NQA
7
Feb 26, 2026
57.4GovRep ROUGE-1
7
Feb 26, 2026
50.63Average Score
6
Jul 1, 2026
5.89NQA
6
May 13, 2026
62.24Single Document Performance
5
Jun 15, 2026
38.84Single-Document Score
5
Jun 15, 2026
25.19Qasper Score
5
Jun 9, 2026
70.12Ruler Avg Score
5
May 29, 2026
43.99LongBench Avg Score
5
May 29, 2026
85.8Easy Average Score
5
May 26, 2026
82.6MK1 Score
5
May 22, 2026
76MK1 Score
5
May 22, 2026
84.4Single-Key (mk1) Score
5
May 22, 2026
25.7QQA
4
Jun 16, 2026
56.86Score
4
Jun 9, 2026
57.89Score
4
Jun 9, 2026
28.17Qasper
4
Jun 4, 2026
30.19Qasper
4
May 19, 2026
1.91NarrQA Performance
4
Apr 14, 2026
18.26NarrativeQA
4
Mar 27, 2026
25.38NarrativeQA
4
Mar 27, 2026
7.05CMRC (Mixup)
4
Feb 26, 2026
7.84InfiniteBench QA (EN) Score
4
Feb 26, 2026
12.4Average Performance (14 Tasks)
3
May 26, 2026
87.77TriviaQA Score
3
Mar 24, 2026