LongBench
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LongBench 4k-length (test)
8PR (Zh)
13
LongBench
1.64Decoding Speedup
12
LongBench (test)
52.526Average Latency
12
LongBench
48.8Single-Doc QA Accuracy
12
LongBench-E 2024 (test)
7.58Short Context QA Score
12
LongBench (eval)
39.6Qasper Score
12
LongBench long: 32k–64k tokens v2
41.5Accuracy
12
LongBench short: 16k–32k tokens v2
42.3Accuracy
12
LongBench
47.48Average Score
12
LongBench 16 English tasks
43.5Accuracy (SingQA)
12
LongBench
27.77NQA Score
12
LongBench
16.6NQA
12
LongBench
37.23CC
12
LongBench HotpotQA
63.58F1 Score
12
LongBench v2
29.62Accuracy
12
LongBench
46.23LongBench Average Score
12
LongBench-e
57.33Accuracy
12
LongBench Write-en 1.0 (test)
91.8Sq
12
LongBench
51.6HotpotQA
12
LongBench
25.4NarrativeQA
12
LongBench 64K context length
63.8Average Score
11
LongBench-Write (LB)
97.8LB Score
11
LongBench Retrieval v2
0.101Latency (s)
11
LongBench (aggregate)
58.7EM
10
LongBench TriviaQA
86.67F1 Score
10