Long-context Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
96.6Accuracy (4K Context)
24
Apr 21, 2026
92.88Performance (8K Context)
24
Apr 10, 2026
100VT Score
24
May 11, 2026
19.55Score (32k)
22
Jun 4, 2026
17.26Math Score
21
Mar 6, 2026
49.6SD QA
21
Feb 26, 2026
35.2Overall Score
20
Jun 4, 2026
56.02MQA-E Score
18
Apr 13, 2026
40.95SubEM
18
Apr 10, 2026
44.56Qasper Score
18
Mar 25, 2026
30.94MFQA
18
Feb 26, 2026
31.8Overall Average Score
17
Feb 26, 2026
93.2Accuracy
16
May 11, 2026
47.66HotpotQA Score
16
Mar 24, 2026
61.44Accuracy (8K Context)
16
Feb 26, 2026
79Score
16
Feb 26, 2026
26.95Na.QA (NER QA)
16
Feb 26, 2026
815,449.95Average Context Length (tokens)
16
Feb 26, 2026
88.74Average Accuracy
15
May 26, 2026
68.5Accuracy
15
Apr 6, 2026
75.3Accuracy
15
Mar 24, 2026
94.5NIAH
14
May 22, 2026
70.98Accuracy
14
May 21, 2026
32.8NrtvQA
14
Apr 10, 2026
66.8Score
14
Feb 26, 2026