Long-horizon memory reasoning and retrieval on 120-Query Comprehensive Evaluation
47.5Overall AccuracyClaude-4.5-Sonnet
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Claude-4.5-SonnetArchitecture=Dual Process (DP), n=1202026.05 | 47.5 | 15,273 | 90 | 40 | 30 | 20 | 55 | 50 | |
| GPT-4o-miniArchitecture=Dual Process (DP), n=1202026.05 | 39.2 | 4,069 | 75 | 35 | 20 | 25 | 30 | 50 | |
| GPT-4oArchitecture=Dual Process (DP), n=1202026.05 | 35.8 | 4,222 | 75 | 30 | 20 | 20 | 40 | 30 | |
| Gemini-3-ProArchitecture=Dual Process (DP), n=1202026.05 | 35 | 25,125 | 70 | 30 | 25 | 20 | 25 | 40 | |
| GPT-5Architecture=Dual Process (DP), n=1202026.05 | 35 | 21,761 | 65 | 25 | 10 | 20 | 45 | 45 | |
| Claude-4.5-SonnetArchitecture=RAG, n=1202026.05 | 32.5 | 4,887 | 10 | 85 | 5 | 5 | 10 | 80 | |
| Gemini-2.5-ProArchitecture=Dual Process (DP), n=1162026.05 | 31 | 50,573 | 65 | 35 | 15 | 20 | 18.8 | 30 | |
| GPT-4o-miniArchitecture=RAG, n=1202026.05 | 28.3 | 1,608 | 0 | 80 | 0 | 0 | 5 | 85 | |
| GPT-4oArchitecture=RAG, n=1202026.05 | 25.8 | 1,912 | 0 | 75 | 0 | 0 | 0 | 80 | |
| GPT-5Architecture=RAG, n=1202026.05 | 23.3 | 3,523 | 0 | 60 | 0 | 0 | 0 | 80 | |
| Gemini-2.5-ProArchitecture=RAG, n=1202026.05 | 23.3 | 7,607 | 0 | 65 | 0 | 0 | 0 | 75 | |
| Gemini-3-ProArchitecture=RAG, n=1202026.05 | 23.3 | 10,088 | 0 | 60 | 5 | 0 | 0 | 75 |