Long-context Language Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
50.91SQA Score
16
May 29, 2026
0FWE Rate
16
May 13, 2026
79KV Retrieval
16
Feb 26, 2026
68.42LCC (Language Comprehension Score)
16
Feb 26, 2026
80.29Math Performance
15
May 19, 2026
29.52NQ Score
15
Apr 23, 2026
34.92NQA
15
Apr 21, 2026
27.36Narrative Score (Nrtv.)
14
Jun 2, 2026
30.21NrtvQA
14
Apr 10, 2026
46.232WQA Score
14
Mar 12, 2026
83.24Long Tasks Score
13
Mar 13, 2026
48.8Single-Doc QA Accuracy
12
May 25, 2026
7.58Short Context QA Score
12
May 13, 2026
47.48Average Score
12
May 25, 2026
43.5Accuracy (SingQA)
12
May 6, 2026
89.49Accuracy
10
Mar 30, 2026
33.15LCC
9
Jul 2, 2026
23.94NarrativeQA Score
8
Jul 2, 2026
44.492Wiki Score
8
May 19, 2026
33.2Overall Score
7
Jul 7, 2026
37.5SDoc Accuracy
7
Jul 7, 2026
47.1QP
7
Jul 3, 2026
2.29NQA Score
7
Jun 2, 2026
30.94MFQA Score
7
Apr 29, 2026
94.71CWE Score
7
Mar 12, 2026