Memory Knowledge Extraction on Insurance Claims Dataset
62.67Output Accuracyxmemory
Evaluation Results
| Method | Links | |
|---|---|---|
| xmemoryNumber of evaluation runs=10, Verification protocol=llm-judge-in-the-loop2026.04 | 62.67 | |
| Gemini 3.1 Pro previewNumber of evaluation runs=102026.04 | 61.67 | |
| xmemoryNumber of evaluation runs=102026.04 | 50 | |
| OpenAI GPT-5.5Number of evaluation runs=10, Reasoning configuration=high reasoning effort2026.04 | 44 | |
| Anthropic Opus 4.7Number of evaluation runs=102026.04 | 42.67 | |
| Anthropic Sonnet 4.6Number of evaluation runs=102026.04 | 42 | |
| OpenAI GPT-5.5Number of evaluation runs=102026.04 | 38 | |
| OpenAI GPT-5.4Number of evaluation runs=102026.04 | 34 | |
| OpenAI GPT-5.4Number of evaluation runs=10, Reasoning configuration=advanced reasoning2026.04 | 34 |