Document Visual Question Answering on SlideVQA
0.849AccuracySlideAgent
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SlideAgentMethod Type=Multimodal RAG (Type 2) and Agentic Methods (Type 3), Base Model=GPT-4o2025.10 | 0.849 | 0.905 | 0.804 | |
| Gemini-2.5-FlashMethod Type=Multimodal LLMs (Type 1)2025.10 | 0.838 | 0.918 | 0.783 | |
| ViDoRAGMethod Type=Multimodal RAG (Type 2) and Agentic Methods (Type 3), Base Model=GPT-4o2025.10 | 0.811 | 0.881 | 0.764 | |
| VDocRAGMethod Type=Multimodal RAG (Type 2) and Agentic Methods (Type 3), Base Model=GPT-4o2025.10 | 0.8 | 0.878 | 0.75 | |
| COLPALIMethod Type=Multimodal RAG (Type 2) and Agentic Methods (Type 3), Base Model=GPT-4o2025.10 | 0.788 | 0.834 | 0.737 | |
| Claude-4.1-OpusMethod Type=Multimodal LLMs (Type 1)2025.10 | 0.784 | 0.823 | 0.743 | |
| VisRAGMethod Type=Multimodal RAG (Type 2) and Agentic Methods (Type 3), Base Model=GPT-4o2025.10 | 0.782 | 0.854 | 0.731 | |
| GPT-4oMethod Type=Multimodal LLMs (Type 1)2025.10 | 0.77 | 0.84 | 0.721 | |
| Gemini-2.0-FlashMethod Type=Multimodal LLMs (Type 1)2025.10 | 0.75 | 0.798 | 0.713 | |
| Gemini-2.5-Flash-LiteMethod Type=Multimodal LLMs (Type 1)2025.10 | 0.712 | 0.87 | 0.608 | |
| Claude-3.7-SonnetSize=-, Paradigm=End-to-End2025.12 | 0.629 | 0.763 | — | |
| Claude-3.5-HaikuMethod Type=Multimodal LLMs (Type 1)2025.10 | 0.625 | 0.546 | 0.683 | |
| VimRAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 0.624 | — | — | |
| GPT-4.1Size=-, Paradigm=End-to-End2025.12 | 0.615 | 0.747 | — | |
| CogDocSize=7B, Paradigm=Unified Thinking2025.12 | 0.583 | 0.679 | — | |
| MoCASize=7B2026.05 | 0.583 | — | — | |
| Mem1Backbone=Qwen3-VL-8B-Instruct2026.02 | 0.557 | — | — | |
| GPT-4oSize=-, Paradigm=End-to-End2025.12 | 0.531 | 0.658 | — | |
| GPT-4oSize=-2026.05 | 0.531 | — | — | |
| VimRAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 0.528 | — | — | |
| FRAGSize=8B, Paradigm=RAG2025.12 | 0.524 | 0.639 | — | |
| InternVL3-8BSize=8B, Paradigm=End-to-End2025.12 | 0.516 | 0.644 | — | |
| VisRAGSize=8B, Paradigm=RAG2025.12 | 0.509 | 0.524 | — | |
| ReActBackbone=Qwen3-VL-8B-Instruct2026.02 | 0.5 | — | — | |
| Mem1Backbone=Qwen3-VL-4B-Instruct2026.02 | 0.498 | — | — | |
| M3DocRAGSize=10B, Paradigm=RAG2025.12 | 0.488 | 0.579 | — | |
| mPLUG-Owl3Size=7B2026.05 | 0.488 | — | — | |
| Vanilla RAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 0.485 | — | — | |
| GPT-4o miniSize=-, Paradigm=End-to-End2025.12 | 0.481 | 0.607 | — | |
| GPT-4o-miniSize=-2026.05 | 0.481 | — | — | |
| MiMo-VL-7B-SFTSize=7B, Paradigm=End-to-End2025.12 | 0.48 | 0.619 | — | |
| MemAgentBackbone=Qwen3-VL-8B-Instruct2026.02 | 0.453 | — | — | |
| ReActBackbone=Qwen3-VL-4B-Instruct2026.02 | 0.449 | — | — | |
| Vanilla RAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 0.448 | — | — | |
| MemAgentBackbone=Qwen3-VL-4B-Instruct2026.02 | 0.431 | — | — | |
| Pixel ReasonerSize=7B2026.05 | 0.421 | — | — | |
| VDocRAGSize=8B, Paradigm=RAG2025.12 | 0.42 | 0.44 | — | |
| Qwen2.5-VL-7B-InstructSize=7B, Paradigm=End-to-End2025.12 | 0.389 | 0.498 | — | |
| Qwen2.5-VL-InstructSize=7B2026.05 | 0.389 | — | — | |
| Qwen2.5-VL-72B-InstructSize=72B, Paradigm=End-to-End2025.12 | 0.388 | 0.544 | — | |
| Qwen2.5-VL-InstructSize=72B2026.05 | 0.388 | — | — | |
| VL-RethinkerSize=7B2026.05 | 0.385 | — | — | |
| DocopilotSize=8B, Paradigm=End-to-End2025.12 | 0.357 | 0.431 | — | |
| DocopilotSize=8B2026.05 | 0.357 | — | — | |
| VideoRAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 0.355 | — | — | |
| Llava-OVSize=7B2026.05 | 0.35 | — | — | |
| VideoRAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 0.34 | — | — | |
| DeepEyesSize=7B2026.05 | 0.33 | — | — | |
| SV-RAGSize=8B, Paradigm=RAG2025.12 | 0.32 | 0.343 | — | |
| mPLUG-DocOwl2Size=8B, Paradigm=End-to-End2025.12 | 0.254 | 0.304 | — | |
| R1-VLSize=7B2026.05 | 0.221 | — | — | |
| UniversalRAGBackbone=Qwen3-VL-8B-Instruct2026.02 | 0.172 | — | — | |
| UniversalRAGBackbone=Qwen3-VL-4B-Instruct2026.02 | 0.147 | — | — | |
| Claude-3.7-SonnetBackbone=-, Param=-, Paradigm=E2E2026.04 | — | 0.763 | — | |
| CogDocBackbone=Qwen2.5-VL, Param=7B, Paradigm=Agent2026.04 | — | 0.679 | — | |
| Doc-V* (GRPO)Backbone=Qwen2.5-VL, Param=7B, Paradigm=Agent2026.04 | — | 0.772 | — | |
| Doc-V* (SFT)Backbone=Qwen2.5-VL, Param=7B, Paradigm=Agent2026.04 | — | 0.738 | — | |
| DocopilotBackbone=InternVL2, Param=8B, Paradigm=E2E2026.04 | — | 0.431 | — | |
| GPT-4.1Backbone=-, Param=-, Paradigm=E2E2026.04 | — | 0.747 | — | |
| GPT-4oBackbone=-, Param=-, Paradigm=E2E2026.04 | — | 0.658 | — | |
| GPT-4o miniBackbone=-, Param=-, Paradigm=E2E2026.04 | — | 0.607 | — | |
| InternVL3Backbone=InternViT / Qwen2.5, Param=8B, Paradigm=E2E2026.04 | — | 0.644 | — | |
| M3DocRAGBackbone=Qwen2-VL, Param=7B, Paradigm=RAG2026.04 | — | 0.557 | — | |
| mPLUG-DocOwl2Backbone=ViT / LLaMa, Param=8B, Paradigm=E2E2026.04 | — | 0.278 | — | |
| Qwen2.5-VL (Baseline)Backbone=Qwen2.5-VL, Param=7B, Paradigm=E2E2026.04 | — | 0.552 | — | |
| Qwen2.5-VL (RAG Top-5)Backbone=Qwen2.5-VL, Param=7B, Paradigm=RAG2026.04 | — | 0.629 | — | |
| SV-RAGBackbone=InternVL2, Param=4B, Paradigm=RAG2026.04 | — | 0.343 | — | |
| VDocRAGBackbone=Phi3-Vision, Param=4B, Paradigm=RAG2026.04 | — | 0.42 | — | |
| VisRAGBackbone=MiniCPM-V 2.6, Param=8B, Paradigm=RAG2026.04 | — | 0.524 | — |