Multimodal Document Question Answering on MMLongBench
48.2AccuracyHIEVI-RAG
Evaluation Results
| Method | Links | |
|---|---|---|
| HIEVI-RAGParam.=8B2026.07 | 48.2 | |
| OursCategory=RAG-based, Top-k retrieval=Top-42026.01 | 43.2 | |
| Doc-V*Param.=7B, Optimization=GRPO-optimized2026.07 | 42.1 | |
| MoLoRAG+Param.=7B2026.07 | 41 | |
| ALDENParam.=7B, Pipeline=ColQwen+ColBERT2026.07 | 39.2 | |
| MDocAgentParam.=7B2026.07 | 38.5 | |
| M3DocRAGParam.=7B2026.07 | 36.2 | |
| OursCategory=RAG-based, Top-k retrieval=Top-12026.01 | 35 | |
| MDocAgentCategory=RAG-based, Top-k retrieval=Top-42026.01 | 33.8 | |
| URaGParam.=7B2026.07 | 33.8 | |
| VimRAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 33.4 | |
| Mem1Backbone=Qwen3-VL-8B-Instruct2026.02 | 32.6 | |
| VimRAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 28.1 | |
| Mem1Backbone=Qwen3-VL-4B-Instruct2026.02 | 27.1 | |
| Qwen-2.5-VL-7B-InstructCategory=LVLM-based2026.01 | 20.4 | |
| VideoRAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 18.2 | |
| LLaVA-1.6-7B-InstructCategory=LVLM-based2026.01 | 17.6 | |
| VideoRAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 16.2 | |
| Vanilla RAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 16.2 | |
| ReActBackbone=Qwen3-VL-8B-Instruct2026.02 | 15.4 | |
| Vanilla RAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 15.2 | |
| MemAgentBackbone=Qwen3-VL-8B-Instruct2026.02 | 14.7 | |
| ReActBackbone=Qwen3-VL-4B-Instruct2026.02 | 13.9 | |
| MemAgentBackbone=Qwen3-VL-4B-Instruct2026.02 | 12.4 | |
| UniversalRAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 6.6 | |
| UniversalRAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 5.4 |