Long-Text Understanding on LOOGLE v2 (test)
78.7Overall AccuracySCOUT
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| SCOUTCategory=Ours2026.05 | 78.7 | 61.7 | 80.6 | 88.9 | 86.7 | 29.7 | 2.63 | |
| Gemini-3-ProCategory=LLMs2026.05 | 68.5 | 60 | 79.4 | 48.1 | 87.5 | 273.9 | 0.25 | |
| Claude CodeCategory=Agents2026.05 | 63.4 | 41.2 | 77 | 76.2 | 61.2 | 25.3 | 2.51 | |
| GPT-5.1-chatCategory=LLMs2026.05 | 58.6 | 40.9 | 66.7 | 51.7 | 76.7 | 135.9 | 0.43 | |
| GPT-4.1Category=LLMs2026.05 | 56.8 | 48.1 | 61 | 46.3 | 72.9 | 236 | 0.24 | |
| Gemini-2.5-ProCategory=LLMs2026.05 | 56.2 | 25.6 | 56.2 | 68.6 | 79.1 | 258.1 | 0.22 | |
| MemAgentCategory=Agents2026.05 | 46 | 35.7 | 49.8 | 46.4 | 53.3 | 302.2 | 0.15 | |
| Claude-Sonnet-4.5Category=LLMs2026.05 | 42.5 | 26 | 45.7 | 38.8 | 62 | 100.9 | 0.42 | |
| GraphReaderCategory=Agents2026.05 | 31.6 | 24.9 | 35 | 32.2 | 35.3 | 408.1 | 0.08 | |
| ReadAgentCategory=Agents2026.05 | 27.7 | 26 | 35 | 27.3 | 22 | 302.6 | 0.09 |