LongBench
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Longbench Chat
73.8Score C
9
Longbench-Chat
0.62Citation Recall
9
LongBench
23.94NarrativeQA Score
8
LongBench v2
67.4Score
8
LongBench
97.52WikiMQA Score
8
LongBench
27.7Qasper Score
8
LongBench
44.492Wiki Score
8
LongBench 1.0 (test)
32.6NrtvQA
8
LongBench samsum
285mTokens
8
LongBench narrativeqa
256Tokens
8
LongBench multifieldqa
256Mean Tokens Used
8
LongBench >128K tokens v2 (long)
35.2Accuracy
8
LongBench 32K~128K tokens v2 (medium)
28.8Accuracy
8
LongBench <32K tokens v2 (short)
41.7Accuracy
8
LongBench v2 (hard)
30.2Accuracy
8
LongBench QMSum
15.6ROUGE-L
8
LongBench MultiFieldQA, MuSiQue, GovReport 2023 (test)
32.18MultiFieldQA Score
8
LongBench Few-shot (test)
71.83Overall Score
8
LongBench Overall v1
33.2Overall Score
7
LongBench <8K context v1
37.5SDoc Accuracy
7
LongBench
47.1QP
7
LongBench Multi-Doc QA v2
60.3Accuracy
7
LongBench
2.29NQA Score
7
LongBench
30.94MFQA Score
7
LongBench (test)
45.1Single-Doc QA Score
7