Long-context reasoning on BrowseComp+ 1K documents
94.6AccuracySRLM (no sub-calls)
Evaluation Results
| Method | Links | |
|---|---|---|
| SRLM (no sub-calls)Backbone=GPT-52026.03 | 94.6 | |
| SRLMBackbone=GPT-52026.03 | 92.4 | |
| RLM (no sub-calls)Backbone=GPT-52026.03 | 89.7 | |
| RLMBackbone=GPT-52026.03 | 86 | |
| Summary agentBackbone=GPT-52026.03 | 70.5 | |
| SRLMBackbone=Qwen3-Coder-480B2026.03 | 59.7 | |
| CodeAct (+ BM25)Backbone=GPT-52026.03 | 51 | |
| SRLM (no sub-calls)Backbone=Qwen3-Coder-480B2026.03 | 50.1 | |
| Summary agentBackbone=Qwen3-Coder-480B2026.03 | 38 | |
| RLMBackbone=Qwen3-Coder-480B2026.03 | 37.1 | |
| RLM (no sub-calls)Backbone=Qwen3-Coder-480B2026.03 | 36.3 | |
| CodeAct (+ BM25)Backbone=Qwen3-Coder-480B2026.03 | 12.7 | |
| Base ModelBackbone=Qwen3-Coder-480B2026.03 | 0 | |
| CodeAct (+ sub-calls)Backbone=Qwen3-Coder-480B2026.03 | 0 | |
| Base ModelBackbone=GPT-52026.03 | 0 | |
| CodeAct (+ sub-calls)Backbone=GPT-52026.03 | 0 |