Long-context Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
60.31M-Avg
294
May 13, 2026
51.87Average Score
147
Jun 16, 2026
33.01En.Sum
100
Jun 9, 2026
53.04Average Score
93
May 27, 2026
58.4Average Score
90
Jul 1, 2026
61.5MultiNews
73
Jun 9, 2026
46.32Overall Accuracy
62
May 13, 2026
49.8Aggregate Score
60
Jun 24, 2026
30.7NrtvQA Score
48
May 12, 2026
0FWE
39
May 13, 2026
31.42NQA
38
May 22, 2026
30.04NrtvQA Score
37
Jun 30, 2026
27.84NrtvQA Score
29
Apr 24, 2026
58.28Coursera
26
Feb 26, 2026
58.28Coursera
26
Feb 26, 2026
32.3NQA
25
Apr 30, 2026
30.46NtrvQA
22
Jun 1, 2026
0FWE (Error)
22
May 28, 2026
0FWE Score
21
May 13, 2026
29.7NrtvQA
20
May 19, 2026
47.23Multi-doc QA
20
May 18, 2026
89.28CWE Score
18
Jun 1, 2026
89.28CWE Score
18
Jun 1, 2026
30.54NrtvQA
18
Apr 20, 2026
47.4Average Score
18
Feb 26, 2026