Long-context conversation memory reasoning on LongMemEval-s oracle variant HuggingFace xiaowu0162
100Single-session Accuracy (User)Hydra DB
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Hydra DBLLM Backbone=Gemini 3.0 Pro2026.04 | 100 | 100 | 96.67 | 97.43 | 90.97 | 76.69 | 90.79 | 93.66 | |
| WorldDBAnswer Model=Claude Opus 4.7, Judge Model=Claude Sonnet 4.6, Extraction Model=Claude Haiku 4.5, Embedding Model=OpenAI text-embedding-3-small (1536-dim), Retrieval K=50, Ingestion Protocol=session-by-session2026.04 | 98.57 | 100 | 96.67 | 98.72 | 96.24 | 92.48 | 96.4 | 97.11 | |
| SupermemoryLLM Backbone=Gemini 3.0 Pro2026.04 | 98.57 | 98.21 | 70 | 89.74 | 81.95 | 76.69 | 85.2 | 85.86 | |
| ZepLLM Backbone=GPT-4o2026.04 | 92.9 | 80.4 | 56.7 | 83.3 | 62.4 | 57.9 | 71.2 | — | |
| Full-ctxLLM Backbone=GPT-4o2026.04 | 81.4 | 94.6 | 20 | 78.2 | 45.1 | 44.3 | 60.2 | — | |
| Mem02026.04 | 38.71 | 8.93 | 40 | 52.56 | 25.56 | 20.3 | 29.07 | — |