LongMemEval
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
LongMemEval
95.7SS-U
15
LongMemEval
97.14SS User Accuracy
14
LongMemEval-S (test)
99.3Gold-evidence Retention
14
LONGMEMEVAL
86.46LLM-Judge Multi-session
14
LongMemEval S (test)
86.4Accuracy
13
LongMemEval
77.8Accuracy
12
LongMemEval 500 questions
61.4QA Accuracy
12
LongMemEval (500 questions)
97Fact Recall
12
LongMemEval-s
75Overall Score
12
LongMemEval s
60.24o-J Score
11
LongMemEval
93Recall@10
10
LongMemEval 1.0 (test)
34.6KU F1
10
LongMemEval 50K context input token limit
89.7KU L-J Score
10
LongMemEval
92.9SSU Score
10
LongMemEval
96.15Knowledge Update
10
LongMemEval-M
77.4Recall@5
10
LongMemEval
63.2Temperature Score
9
LongMemEval MAB
72LLM-judge Accuracy
9
LongMemEval MAB
64.7Accuracy
9
LongMemEval
68.4Accuracy
9
LongMemEval
57.41F1 Score
8
LongMemEvalS (test)
98.4User LLM (Single-Session)
8
LongMemEval (100-question sample)
68Accuracy
8
LongMemEval n=500 (test)
80.43MAP
8
LongMemEval-m
46.64o-J Score
8