Multimodal Long-Document Question Answering on DocBench
82.1LasJ ScoreMARDoc
Evaluation Results
| Method | Links | |
|---|---|---|
| MARDocModel=Qwen3-VL-30B-A3B-Instruct2026.06 | 82.1 | |
| DocDancerModel=Qwen3-VL-30B-A3B-Thinking(ft)2026.06 | 81.2 | |
| Human Baseline2026.06 | 81.2 | |
| DocAgentModel=GPT-4o2026.06 | 79.9 | |
| DocDancerModel=Qwen3-VL-30B-A3B-Thinking2026.06 | 74.1 | |
| DocDancerModel=GPT-4o2026.06 | 73.5 | |
| DocAgentModel=Qwen3-VL-30B-A3B-Instruct2026.06 | 73.2 | |
| MARDocModel=Qwen3-VL-8B-Instruct2026.06 | 72.3 | |
| DocAgentModel=Qwen3-VL-8B-Instruct2026.06 | 67.1 | |
| Vanilla VLMModel=Qwen3-VL-8B-Instruct2026.06 | 64.6 | |
| RAGAnythingModel=GPT-4o-mini2026.06 | 63.4 | |
| Vanilla VLMModel=Qwen3-VL-30B-A3B-Instruct2026.06 | 63.2 | |
| Vanilla VLMModel=GPT-4o2026.06 | 63.1 |