ResearchBenchmarksLong-term Conversational Memory on LoCoMo Multi-hopFollow13.17B1 ScoreSAGE12.202812.453912.70512.9561May 29, 2026Evaluation ResultsMethodMethodLinksB1 ScoreF1 ScoreJ ScoreSAGEAveraged across=7 open...Averaged across=7 open-weight models, LLM Judge=Llama-3.1-8b2026.0513.1716.7377.26Mem0^gAveraged across=7 open...Averaged across=7 open-weight models, LLM Judge=Llama-3.1-8b2026.0512.3715.4870.99Mem0Averaged across=7 open...Averaged across=7 open-weight models, LLM Judge=Llama-3.1-8b2026.0512.2415.6872.27