Long-context Question Answering
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
19Accuracy
18
Jul 3, 2026
39F1 Score
18
Apr 23, 2026
32.64Score
18
Mar 6, 2026
60.03Score
18
Mar 6, 2026
39.46Score
18
Mar 6, 2026
52.53Score
18
Mar 6, 2026
32.64Score
18
Mar 6, 2026
60.03QA Score
18
Mar 6, 2026
39.46Score
18
Mar 6, 2026
52.53QA Score
18
Mar 6, 2026
68.62F1 Score
18
Jun 5, 2026
62.02F1 Score
18
Jun 5, 2026
83.09F1
17
Feb 27, 2026
72.3LLM Score (Temporal)
16
Jul 2, 2026
67.3Rubric Judge Accuracy
15
May 11, 2026
57.33Accuracy
15
Feb 26, 2026
14.81F1 Score
14
Feb 26, 2026
80.73NQ
13
Feb 26, 2026
78.46Accuracy
13
Feb 26, 2026
84.85Accuracy
13
Feb 26, 2026
88.32LLM Judge Score
12
Jun 5, 2026
69.82F1 Score
12
Jun 5, 2026
56.72F1 Score
12
Jun 5, 2026
62.68F1 Score
12
Apr 23, 2026
54.77F1 Score
12
Apr 23, 2026