Long-context Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
82.36Overall Score
185
Jul 8, 2026
58.7Avg Score
166
Jun 25, 2026
34F1 Score
143
May 19, 2026
62.1Overall Average Score
143
Jun 25, 2026
32.94NarrativeQA
108
Jun 24, 2026
71.4FewShot Performance
94
Jul 3, 2026
93.5RULER Score
90
May 26, 2026
95.7RULER 4k Score
90
May 26, 2026
57.15HotpotQA
82
Apr 15, 2026
96Score
66
Apr 23, 2026
157Performance @ 4K Context
65
Apr 16, 2026
103Accuracy
60
Feb 27, 2026
63.4Average Score
50
Jul 8, 2026
46.25Average Score
43
May 11, 2026
48.37Average Score
40
Jun 11, 2026
97.3Accuracy
38
Jul 7, 2026
94.48Accuracy
38
May 19, 2026
92.37Accuracy
37
May 19, 2026
31NQA
36
May 11, 2026
20Dialogue
31
Feb 26, 2026
47.26Average Score
30
May 11, 2026
19.63Accuracy
30
Mar 20, 2026
51SubEM
27
Apr 10, 2026
88.3Accuracy
27
May 19, 2026
0.5Math Score (F)
25
Apr 21, 2026