Visual Question Answering on GQA (val)
83.39AccuracyOracle
Evaluation Results
| Method | Links | |
|---|---|---|
| Oracle2026.03 | 83.39 | |
| PEVLgrounded inputs=true2022.05 | 77 | |
| CFR2021.10 | 73.6 | |
| CFR2022.05 | 73.6 | |
| LCStraining_mode=learned, evaluation_protocol=5-fold cross-validation2026.03 | 66.47 | |
| LLaVA-NeXT-INST-ITLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 65.9 | |
| LLaVA-NeXT-INST-ITLLM=Qwen2-7B, Vision Encoder=SigLIP-SO4002024.12 | 65.5 | |
| DeepStack-L-HDLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 65.2 | |
| FAAR-learntraining_mode=learned, evaluation_protocol=5-fold cross-validation2026.03 | 64.89 | |
| ALBEF2022.05 | 64.8 | |
| QualRCCVrho=0.4, gamma=1, training_mode=training-free2026.03 | 64.33 | |
| RCCVrho=0.4, training_mode=training-free2026.03 | 64.3 | |
| HFV-sharptraining_mode=training-free2026.03 | 64.27 | |
| Single bestpool_size=17 models, families=8 families2026.03 | 64.25 | |
| LLaVA-NeXTLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 64.2 | |
| HFVtraining_mode=training-free2026.03 | 64.18 | |
| Calibrated votepool_size=17 models, families=8 families2026.03 | 64.02 | |
| single-hop + LCGNVisual features=Object detection features, Message passing rounds (T)=42019.05 | 63.9 | |
| Majority votepool_size=17 models, families=8 families2026.03 | 63.72 | |
| DeepStack-LLLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 63.1 | |
| VILALLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 62.3 | |
| single-hopVisual features=Object detection features2019.05 | 62 | |
| LLaVA-1.5LLM=Vicuna-7B, Vision Encoder=CLIP-ViT-Large2024.12 | 62 | |
| CTI2021.10 | 61.7 | |
| CTI2022.05 | 61.7 | |
| BAN2021.10 | 61.5 | |
| BAN2022.05 | 61.5 | |
| LXMERT2021.10 | 59.8 | |
| LXMERT2022.05 | 59.8 | |
| MACVisual features=Object detection features2019.05 | 57.5 | |
| Bottom-UpVisual features=Object detection features2019.05 | 52.2 | |
| CNN+LSTMVisual features=Convolutional grid features2019.05 | 49.2 |