Visual Question Answering on cVQA
86.6AccuracyW/O RAG
Evaluation Results
| Method | Links | |
|---|---|---|
| W/O RAGRetriever State=None, VLM Backbone=GPT-4.12025.05 | 86.6 | |
| Ravenea-CLIPRetriever State=Finetuned, VLM Backbone=GPT-4.12025.05 | 86.1 | |
| Ravenea-SigLIPRetriever State=Finetuned, VLM Backbone=InternVL3-78B2025.05 | 85.6 | |
| Ravenea-SigLIPRetriever State=Finetuned, VLM Backbone=GPT-4.12025.05 | 85.6 | |
| Ravenea-CLIPRetriever State=Finetuned, VLM Backbone=InternVL3-78B2025.05 | 85.2 | |
| CLIP-L/14@224pxRetriever State=Frozen, VLM Backbone=GPT-4.12025.05 | 83.3 | |
| SigLIP2-SO/14@384pxRetriever State=Frozen, VLM Backbone=GPT-4.12025.05 | 82.8 | |
| Ravenea-SigLIPRetriever State=Finetuned, VLM Backbone=Qwen2.5-VL-72B2025.05 | 81.3 | |
| Ravenea-SigLIPRetriever State=Finetuned, VLM Backbone=DeepSeek-VL22025.05 | 76.1 | |
| Ravenea-CLIPRetriever State=Finetuned, VLM Backbone=DeepSeek-VL22025.05 | 75.1 | |
| Ravenea-CLIPRetriever State=Finetuned, VLM Backbone=DeepSeek-VL2-Tiny2025.05 | 50.7 | |
| Ravenea-SigLIPRetriever State=Finetuned, VLM Backbone=DeepSeek-VL2-Tiny2025.05 | 48.8 |