Long-context Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
93.4RULER Score (64K Context)
21
Jul 3, 2026
86.6Accuracy (32K Context)
21
Jul 3, 2026
86.9Score
18
Jun 1, 2026
74.91Average Score
18
May 20, 2026
94.6Accuracy
16
Mar 18, 2026
14.1Err (2k Context)
16
Jun 23, 2026
100Accuracy
14
May 22, 2026
1Relative Cost
14
Apr 8, 2026
41.5AltQA Score
13
Feb 26, 2026
81Accuracy
12
Jun 18, 2026
16.6NQA
12
Apr 9, 2026
50.18Average Score
12
May 12, 2026
78.41Accuracy
11
Mar 24, 2026
88.07Accuracy
11
Mar 24, 2026
65.43Accuracy
11
Mar 24, 2026
96.6Accuracy (8-16K)
10
Jun 23, 2026
99.8Accuracy
10
Jun 23, 2026
98Performance (16K Context)
10
Jun 23, 2026
57.14Accuracy
10
Apr 8, 2026
64.96Accuracy
10
Apr 8, 2026
68.5F1 Score
9
Apr 20, 2026
62.54Code Completion
9
Feb 26, 2026
72.3LLM Score
7
Feb 26, 2026
94.62NIAH
6
May 20, 2026
98.5NIAH Score
6
May 20, 2026