Multimodal Document Reasoning on SlideVQA, MMLongBench-Doc, and ViDoSeek
55.6Average ScoreLang2Act
Evaluation Results
| Method | Links | |
|---|---|---|
| Lang2ActCategory=Tool-Enhanced VLMs2026.01 | 55.6 | |
| EVisRAGCategory=Multimodal Retrieval-Augmented Generation Models (MRAGs)2026.01 | 51.56 | |
| Pixel-ReasonerCategory=Tool-Enhanced VLMs2026.01 | 51.32 | |
| Vision-R1Category=Vision-Language Reasoning Models (VLRMs)2026.01 | 51.21 | |
| OpenVLThinkerCategory=Vision-Language Reasoning Models (VLRMs)2026.01 | 48.73 | |
| ThinkLite-VLCategory=Vision-Language Reasoning Models (VLRMs)2026.01 | 46.77 | |
| VRAG-RLCategory=Tool-Enhanced VLMs2026.01 | 46.36 | |
| MM-Search-R1Category=Multimodal Retrieval-Augmented Generation Models (MRAGs)2026.01 | 45.47 | |
| VisionMattersCategory=Vision-Language Reasoning Models (VLRMs)2026.01 | 44.68 | |
| GOTCategory=Prompting Methods2026.01 | 43.78 | |
| R1-OnevisionCategory=Vision-Language Reasoning Models (VLRMs)2026.01 | 42.46 | |
| DirectCategory=Prompting Methods2026.01 | 41.96 | |
| TOTCategory=Prompting Methods2026.01 | 40.56 | |
| VisDomCategory=Multimodal Retrieval-Augmented Generation Models (MRAGs)2026.01 | 39.57 |