Agentic Long-context Reasoning on CL-bench (test)
26Solve RateRLM + PEEK
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RLM + PEEKBase LM=GPT-5-mini-2025-08-072026.05 | 26 | 63.4 | |
| RLM + Compaction AgentBase LM=GPT-5-mini-2025-08-072026.05 | 20 | 54.6 | |
| RLM + ACE (Online Adaptation)Base LM=GPT-5-mini-2025-08-072026.05 | 20 | 53.5 | |
| RLMBase LM=GPT-5-mini-2025-08-072026.05 | 14 | 54.5 | |
| RLM + RAGBase LM=GPT-5-mini-2025-08-072026.05 | 14 | 55.6 | |
| RLM + Shared ChatBase LM=GPT-5-mini-2025-08-072026.05 | 12 | 51.3 |