Long-context Understanding
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
90.5Score
4
Jun 9, 2026
94.3Score
4
Jun 9, 2026
95Score
4
Jun 9, 2026
40.2Score
4
Jun 9, 2026
82LongMemEval Score
4
Jun 9, 2026
70Score
4
Jun 9, 2026
68.9Overall Score
4
Jun 9, 2026
70.2Score
4
Jun 9, 2026
37.25Accuracy
4
May 28, 2026
6.9Delta Accuracy
4
May 21, 2026
0.015Delta Accuracy
4
May 21, 2026
32.03Single-Doc QA Score
4
May 15, 2026
57.62HotpotQA Score
4
May 11, 2026
3.08MAT
4
Apr 30, 2026
59.34Score (8K Context)
4
Apr 10, 2026
86.43Performance Score (8K Context)
4
Apr 10, 2026
59.63HotpotQA Accuracy
4
Mar 4, 2026
50.48Accuracy (0–4k Context)
4
Mar 4, 2026
95.94RULER Accuracy (4K)
4
Feb 26, 2026
33.9Accuracy
4
Feb 26, 2026
0.609Score
4
Feb 26, 2026
66.5Avg Task Score
4
Feb 26, 2026
49.11FullKV Performance
2
Jun 16, 2026
46.53Overall Score
2
Jun 12, 2026
80.7Needle Score
2
Feb 26, 2026