Long-context Question Answering on Oolong Real
37.46ScoreClaude Code + BM25
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude Code + BM25Retriever=BM25, Base Model=Claude 3.5 Sonnet2026.03 | 37.46 | |
| Codex (No Retriever)Retriever=None, Base Model=GPT-52026.03 | 33.73 | |
| Codex + Gemini Emb.Retriever=Gemini Embeddings, Base Model=GPT-52026.03 | 32.4 | |
| Codex + BM25Retriever=BM25, Base Model=GPT-52026.03 | 30.86 | |
| Best Published2026.03 | 24.09 | |
| RLM2026.03 | 23.07 | |
| GPT-5 Full ContextContext Type=Full Context2026.03 | 22.45 | |
| ReAct AgentAgent Loop=ReAct2026.03 | 19.06 | |
| RAGRetriever=Gemini Embeddings2026.03 | 13.38 |