Long-context Reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
68.9Average Score
113
Jul 3, 2026
73.8Score
107
Jul 1, 2026
70.4Accuracy (LongBench)
101
Apr 28, 2026
93.26F1 (Multi Hop)
78
Jun 19, 2026
29.8Accuracy
72
Apr 8, 2026
34.7Accuracy
65
Apr 8, 2026
38.5Accuracy (BABILong 4k)
51
Apr 8, 2026
36.51Overall Score
45
Jul 1, 2026
68.4Accuracy
37
Apr 8, 2026
54.2Accuracy
36
Jun 26, 2026
53.02Accuracy
36
Jun 26, 2026
53.9Accuracy
36
Jun 26, 2026
55.67Accuracy
36
Jun 26, 2026
66.7DocMath Score
36
Feb 26, 2026
64.1DocMath
36
Feb 26, 2026
75.3RULER Performance (8K Context)
35
Apr 28, 2026
70.2Score
35
Jun 16, 2026
71.25Accuracy
34
May 28, 2026
90.39Accuracy
32
Feb 26, 2026
86.6Score
28
Mar 18, 2026
84.7Score
27
Jul 2, 2026
5.1Latency (s)
27
Mar 23, 2026
7.1Latency (s)
27
Mar 23, 2026
44.51GSM8K Score
22
May 29, 2026
53.18GSM8K Score
22
May 29, 2026