Long-term memory evaluation on LongMemEval-S Full-500 official protocol
47.7Mean Accuracyzenbrain
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| zenbrainRetrieval Budget=k=5, Backbone=nomic-embed-text, Seed Strategy=Multi-seed ({42, 123, 456}), Answer Model=gpt-4o-mini, Evaluation Judge=gpt-4o-mini2026.04 | 47.7 | 79.5 | 85.7 | 22.2 | 34.8 | 56.8 | 28.1 | |
| lettaRetrieval Budget=k=5, Backbone=nomic-embed-text, Seed Strategy=Single-seed (seed=42), Answer Model=gpt-4o-mini, Evaluation Judge=gpt-4o-mini2026.04 | 42.8 | 77.1 | 76.8 | 16.7 | 30.1 | 50 | 24.8 | |
| a-memRetrieval Budget=k=5, Backbone=nomic-embed-text, Seed Strategy=Single-seed (seed=42), Answer Model=gpt-4o-mini, Evaluation Judge=gpt-4o-mini2026.04 | 35.4 | 67.1 | 51.8 | 10 | 24.8 | 56.4 | 15.8 | |
| mem0Retrieval Budget=k=5, Backbone=nomic-embed-text, Seed Strategy=Single-seed (seed=42), Answer Model=gpt-4o-mini, Evaluation Judge=gpt-4o-mini2026.04 | 31.8 | 64.3 | 76.8 | 10 | 19.5 | 25.6 | 16.5 |