Long-context language modeling
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
58.4Average Score
369
Jun 30, 2026
0.914RULER Score
204
May 29, 2026
96.29Accuracy (8K Context)
80
Jul 1, 2026
83Accuracy (RULER 16K)
72
Apr 8, 2026
50.87Qasper Score
54
Jun 30, 2026
100S-NIAH-1
37
Mar 13, 2026
49.92S-Doc QA Perf.
37
Feb 26, 2026
95.3Accuracy
29
Jun 1, 2026
247Summarization Score
27
Feb 26, 2026
50.6Generation Score
24
Jul 1, 2026
35.8GovReport Score
24
Feb 26, 2026
46.19Code Debug Accuracy
22
Jun 11, 2026
12.7Average Accuracy
17
Apr 21, 2026
0.977Accuracy (4K Context)
16
Feb 26, 2026
34.82En QA Score
14
Apr 10, 2026
100S1 Score
13
Jul 2, 2026
80Sparsity
13
Apr 1, 2026
29.62Accuracy
12
Jun 2, 2026
46.23LongBench Average Score
12
May 29, 2026
42.6Single Document Score
9
Jun 15, 2026
100S-NIAH Score (Component 1)
8
May 28, 2026
32.6NrtvQA
8
Apr 14, 2026
32.18MultiFieldQA Score
8
Feb 26, 2026
96.6Accuracy (4k Context)
7
Apr 8, 2026
60Acc (Short)
7
Apr 13, 2026