Long-context evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
31.96Average Score
96
Jul 2, 2026
95.02Total Score
62
Jun 9, 2026
92.8Average Accuracy Score
59
Jun 19, 2026
90.06Overall Score
49
May 19, 2026
100S-NIAH-1
43
Mar 13, 2026
100VT Score
43
May 19, 2026
91.07Score
35
Feb 27, 2026
93.73Score
35
Jul 3, 2026
98Query Metric (MQ)
29
Feb 26, 2026
32.85NarQA Score
18
May 18, 2026
2Average Rank
16
May 11, 2026
38Accuracy (ALL)
13
Feb 26, 2026
68.8Close Score
13
Feb 26, 2026
31.3Accuracy (RULER 128k Zero-shot)
12
Jun 9, 2026
32.9Accuracy
12
Jun 9, 2026
37.2Accuracy
12
Jun 9, 2026
36.1Accuracy
12
Jun 9, 2026
39.9Accuracy
12
Jun 9, 2026
48.7Accuracy
12
Jun 9, 2026
100Niah1 Score
12
Feb 26, 2026
58.7EM
10
Jul 8, 2026
59.76Overall Score
9
May 22, 2026
25.36MK
7
Jul 9, 2026
80.12Quality Score (Q)
6
May 20, 2026
15.3Memory Footprint (GB)
6
Apr 23, 2026