ResearchBenchmarksLong-context Question Answering on NarrativeQA LongBench (test)Follow11.48String MatchMemDefrag4.65766.42888.29.9712Jul 7, 2026Evaluation ResultsMethodMethodLinksString MatchF1 ScoreROUGE-LBERTScoreMemDefragBackbone=Llama-3.1-8B,...Backbone=Llama-3.1-8B, Max Length=16,384 tokens, Top-K=22026.0711.487.817.7782.69MemoryLLMBackbone=Llama-3.1-8B,...Backbone=Llama-3.1-8B, Max Length=16,384 tokens2026.079.843.373.7981.27M+Backbone=Llama-3.1-8B,...Backbone=Llama-3.1-8B, Max Length=16,384 tokens2026.074.923.073.6381.6