Visual Document Question Answering on LongDocURL (Filtered)
67.79AccuracyOracle
Evaluation Results
| Method | Links | |
|---|---|---|
| OracleTop-k retrieval=3, Input modality=I + T, Judge model=Qwen2.5-7B-Instruct, Backbone Vision Language Model=Qwen2.5-VL-7B-Instruct2025.09 | 67.79 | |
| OracleTop-k retrieval=3, Input modality=I, Judge model=Qwen2.5-7B-Instruct, Backbone Vision Language Model=Qwen2.5-VL-7B-Instruct2025.09 | 64.81 | |
| CMRAGTop-k retrieval=3, Judge model=Qwen2.5-7B-Instruct, Backbone Vision Language Model=Qwen2.5-VL-7B-Instruct2025.09 | 48.18 | |
| SigLIPTop-k retrieval=3, Judge model=Qwen2.5-7B-Instruct, Backbone Vision Language Model=Qwen2.5-VL-7B-Instruct2025.09 | 47.66 | |
| CLIP-L/14-336Top-k retrieval=3, Judge model=Qwen2.5-7B-Instruct, Backbone Vision Language Model=Qwen2.5-VL-7B-Instruct2025.09 | 44.42 |