Long-context Question Answering on LongMemEval-S cross-benchmark replication Full-500
50.4Jaccard Score (S-4.5, 3x)zenbrain
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| zenbrainEmbedding backbone=nomic-embed-text (768-dim), LLM-as-judge normalization=means over all 500 queries, Judge rescaled range=[0, 1]2026.04 | 50.4 | 57.5 | 55.5 | |
| lettaEmbedding backbone=nomic-embed-text (768-dim), LLM-as-judge normalization=means over all 500 queries, Judge rescaled range=[0, 1], Note=InternalServerError cases scored as 0/52026.04 | 45 | 51.3 | 49.2 | |
| a-memEmbedding backbone=nomic-embed-text (768-dim), LLM-as-judge normalization=means over all 500 queries, Judge rescaled range=[0, 1]2026.04 | 38.9 | 43.6 | 41.6 | |
| mem0Embedding backbone=nomic-embed-text (768-dim), LLM-as-judge normalization=means over all 500 queries, Judge rescaled range=[0, 1]2026.04 | 37 | 41.4 | 39.8 |