Long-Text Understanding on ∞BENCH (test)
85.6Overall AccuracySCOUT
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| SCOUTCategory=Ours2026.05 | 85.6 | 99.4 | 75.3 | 85.7 | 63.9 | 21.4 | 4.01 | |
| Gemini-3-ProCategory=LLMs2026.05 | 83.9 | 97 | 67.1 | 80.6 | 71.1 | 259.1 | 0.32 | |
| GPT-5.1-chatCategory=LLMs2026.05 | 82.6 | 92 | 88.2 | 92.3 | 51.5 | 118.2 | 0.7 | |
| Gemini-2.5-ProCategory=LLMs2026.05 | 81.9 | 96.2 | 63.4 | 97.9 | 58.5 | 245.4 | 0.33 | |
| GPT-4.1Category=LLMs2026.05 | 73 | 99.2 | 47.3 | 60.6 | 43.6 | 212.7 | 0.34 | |
| Claude CodeCategory=Agents2026.05 | 72.7 | 90.2 | 71 | 65.6 | 38.6 | 19.2 | 3.79 | |
| MemAgentCategory=Agents2026.05 | 68.1 | 99.5 | 24.2 | 76.6 | 33 | 264 | 0.26 | |
| Claude-Sonnet-4.5Category=LLMs2026.05 | 65.1 | 97.6 | 33.3 | 12.9 | 46.5 | 96.6 | 0.67 | |
| GraphReaderCategory=Agents2026.05 | 43.1 | 55.4 | 12.9 | 94.4 | 16.9 | 327.4 | 0.13 | |
| ReadAgentCategory=Agents2026.05 | 42.3 | 54.7 | 20.4 | 29.9 | 40.9 | 481.8 | 0.09 |