ResearchBenchmarksLong-term Conversational Memory on LoCoMo TemporalFollow7.22B1 ScoreSAGE6.36726.58866.817.0314May 29, 2026Evaluation ResultsMethodMethodLinksB1 ScoreF1 ScoreJ ScoreSAGEAveraged across=7 open...Averaged across=7 open-weight models, LLM Judge=Llama-3.1-8b2026.057.229.478.27Mem0Averaged across=7 open...Averaged across=7 open-weight models, LLM Judge=Llama-3.1-8b2026.056.498.6774.85Mem0^gAveraged across=7 open...Averaged across=7 open-weight models, LLM Judge=Llama-3.1-8b2026.056.48.6577.08