Long-context Question Answering
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
31.51F1 Score
12
Apr 23, 2026
48.66F1 Score
12
Apr 23, 2026
49.4F1 Score
12
Mar 20, 2026
61.7Exact Match
11
Feb 26, 2026
34.95Accuracy
10
Jun 11, 2026
66.5Accuracy (LoCoMo QA)
10
Jun 4, 2026
56.7Overall Accuracy
10
Jul 2, 2026
82.38Accuracy @ 7K Context
10
May 29, 2026
45.4Avg. F1
10
May 26, 2026
34.2F1 Score
10
Feb 26, 2026
54.57Extract F1
10
Feb 26, 2026
29.02F1 Score
10
Feb 26, 2026
87.4Single-hop Accuracy
9
Jun 23, 2026
50.6F1 Score
9
May 22, 2026
37.46Score
9
Mar 24, 2026
77.6C Score
9
Feb 26, 2026
68.4C Score
9
Feb 26, 2026
81C Score
9
Feb 26, 2026
88.6C Score
9
Feb 26, 2026
73.8Score C
9
Feb 26, 2026
84.2ShortQA Score
8
Apr 21, 2026
71.75Score
8
Mar 24, 2026
49CSM
7
May 26, 2026
56Exact Match (EM)
7
Mar 24, 2026
88.5Accuracy
7
Mar 24, 2026