Question Answering on LongMemEval-KU 78-item (oracle)
70Correct CountVerifier
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VerifierConfiguration=+content +retrieval, Backbone=GPT-4o2026.05 | 70 | 89.7 | |
| LLM-only baselineBackbone=GPT-4o2026.05 | 69 | 88.5 | |
| VerifierConfiguration=dep-map summary, no retrieval, Backbone=GPT-4o2026.05 | 68 | 87.2 | |
| Transcript-RAG baselineConfiguration=no engine, Backbone=GPT-4o, top-k=202026.05 | 68 | 87.2 |