Visual Question Answering on DocHaystack-1000
73.39AccuracyQwen2-VL-f.t. + V-RAG
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-VL-f.t. + V-RAGFramework=V-RAG, Resolution=Low-resolution, Adaptation=LoRA2024.11 | 73.39 | |
| GPT-4o + V-RAGFramework=V-RAG, Resolution=Low-resolution2024.11 | 66.97 | |
| Qwen2-VL + V-RAGFramework=V-RAG, Resolution=Low-resolution2024.11 | 66.06 | |
| Gemini + V-RAGFramework=V-RAG2024.11 | 58.72 | |
| LLaVA-OV + V-RAGFramework=V-RAG2024.11 | 55.05 | |
| MIRAGE2024.11 | 2.75 |