Multi-document Question Answering on LongBench Multi-Doc QA v2
60.3AccuracyDELM+RLM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DELM+RLMBase Model=GPT-52026.06 | 60.3 | 0.24 | — | |
| DELMBase Model=GPT-52026.06 | 57.9 | 0.3 | — | |
| RLMBase Model=GPT-5, Sub-call Model=GPT-5-mini, Recursion Depth=12026.06 | 55.8 | 0.29 | — | |
| MPLMBackbone=Qwen3.6-35B-A3B2026.07 | 47.2 | — | 104.2 | |
| RLMBackbone=Qwen3.6-35B-A3B2026.07 | 40 | — | 235.4 | |
| MPLMBackbone=Qwen3-30B-A3B2026.07 | 35 | — | 58.8 | |
| RLMBackbone=Qwen3-30B-A3B2026.07 | 21.6 | — | 104.8 |