Long-context Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
54.15CWE
13
May 13, 2026
96.1Accuracy (4K Context)
13
Feb 26, 2026
45.71Overall Score
12
Jul 8, 2026
57CR Score
12
Jul 8, 2026
1.61Decoding Speedup
12
Jun 30, 2026
1.48Decoding Speedup
12
Jun 30, 2026
1.64Decoding Speedup
12
Jun 30, 2026
83.8Accuracy
12
Jun 30, 2026
39.6Qasper Score
12
May 11, 2026
215P95 Latency (ms)
12
Apr 23, 2026
27.77NQA Score
12
Apr 10, 2026
57.33Accuracy
12
Apr 21, 2026
63.8Average Score
11
Jul 8, 2026
55.77Loogle Score
11
Apr 10, 2026
86.67F1 Score
10
Jun 11, 2026
45.14F1 Score
10
Jun 11, 2026
27.4F1 Score
10
Jun 11, 2026
22.32F1 Score
10
Jun 11, 2026
14.79F1 Score
10
Jun 11, 2026
47.18F1 Score
10
Jun 11, 2026
52.15F1 Score
10
Jun 11, 2026
37.47F1 Score
10
Jun 11, 2026
61.66Average Score @4 (Short Context)
10
May 27, 2026
52.28Single Doc QA
10
Feb 26, 2026
100N-S Score 1
9
May 18, 2026