Long-context language modeling evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.8Score
120
Feb 26, 2026
89.59Average Accuracy (RULER 8K)
72
Apr 8, 2026
97.36Score (4K)
49
May 29, 2026
100Single-key Accuracy
29
May 29, 2026
0Average Sparsity
28
Feb 26, 2026
57.61Accuracy (8K Context)
13
Feb 26, 2026
88.6Average Score (RULER 32K)
12
Jun 1, 2026