Long-context retrieval and reasoning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
94.7Score
49
Jul 1, 2026
64Accuracy
18
Apr 23, 2026
85.2RULER Score
12
Jun 2, 2026
100S1 Accuracy
10
Jun 5, 2026
0.02NIAH Single-Key Score
9
May 12, 2026
100Score 1 (S1)
7
Apr 28, 2026
100S1 Score
7
Mar 25, 2026
99.34Context Length 4K Performance
5
May 12, 2026
62.28Score
5
Apr 27, 2026
58.82Performance (16k Context)
5
Feb 26, 2026
91.9Accuracy @ 8k Context
5
Feb 26, 2026
95.83Score
4
Jun 9, 2026
90Score
4
Jun 9, 2026
100Niah Score 1 (S1)
4
May 15, 2026
83.2CWE
4
May 11, 2026
92.72Retrieval (EM)
4
Apr 10, 2026
100S-1 Score
4
Mar 23, 2026
68Average Score
4
Mar 10, 2026
46.98RULER Score
3
Jun 16, 2026
100S1
3
Jun 5, 2026
100NIAH Single Query 1
3
Mar 4, 2026
100Retrieval PassKey
2
May 12, 2026