Long-context Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
41.35LongBench 32k Score
9
Jun 16, 2026
42.48SubEM Score
9
Apr 10, 2026
17.5SubEM
9
Apr 10, 2026
28.33SubEM
9
Apr 10, 2026
39.17SubEM
9
Apr 10, 2026
40SubEM
9
Apr 10, 2026
50.5Qasper F1
9
Jun 29, 2026
27.7Qasper Score
8
Jun 9, 2026
70.6Coursera Accuracy
6
Jun 29, 2026
19.02LongBench Score (16k)
6
Jun 16, 2026
45.77Qasper
6
Mar 13, 2026
36.7En QA F1
6
Feb 26, 2026
64.8Single Document Score
5
Jun 15, 2026
100Subtask 1 Score (s1)
5
Jun 2, 2026
91.42RULER Score
5
May 21, 2026
100NIAH-S
5
May 11, 2026
48.38NIAH
5
Apr 15, 2026
68Accuracy
5
Apr 13, 2026
25GvR Score
5
Mar 30, 2026
38.97Average Score
5
Feb 26, 2026
54.54Accuracy (32K Context)
5
Feb 26, 2026
92.65RULER Accuracy (64K Context)
5
Feb 26, 2026
100Accuracy
5
Feb 26, 2026
83.4Accuracy
5
Feb 26, 2026
89.6RULER 512K Score
4
Jun 9, 2026