Long-document Question Answering on FinanceBench (FB)
89.33AccuracySLIDERS
Evaluation Results
| Method | Links | |
|---|---|---|
| SLIDERSLLMs=GPT 4.1 & GPT 4.1-mini2026.04 | 89.33 | |
| BasemodelLLMs=Qwen3.5 122B-A10B2026.04 | 84.67 | |
| SLIDERSLLMs=Qwen3.5 122B-A10B2026.04 | 82.1 | |
| BasemodelLLMs=GPT 4.12026.04 | 82 | |
| GraphRAGLLMs=Qwen3-4B & GPT 4.12026.04 | 75.33 | |
| RLMLLMs=GPT 5 & GPT 5-mini2026.04 | 75.33 | |
| LongRAGLLMs=Qwen3-4B & GPT 4.12026.04 | 72 | |
| Chain of AgentLLMs=GPT 5 & GPT 5-mini2026.04 | 71.3 | |
| DocETLLLMs=GPT 4.12026.04 | 63.33 | |
| RAGLLMs=Qwen3-4B & GPT 4.12026.04 | 62.67 |