Visual Question Answering on VSR
73.77Top-1 AccuracyLION-12B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LION-12Bparameters=12B2023.11 | 73.77 | — | |
| LION-4Bparameters=4B2023.11 | 72.96 | — | |
| InstructBLIP (T5XL)backbone=T5XL2023.11 | 69.93 | — | |
| InstructBLIP (T5XXL)backbone=T5XXL2023.11 | 68.46 | — | |
| BLIP-2zero-shot=true, backbone=FlanT5-XXL2023.05 | 68.2 | — | |
| Pink2023.11 | 66.3 | — | |
| InstructBLIPzero-shot=true, backbone=FlanT5-XXL2023.05 | 65.6 | — | |
| InstructBLIP+ (T5XXL)backbone=T5XXL, uses_in-house_data=true2023.11 | 65.6 | — | |
| InstructBLIPzero-shot=true, backbone=FlanT5-XL2023.05 | 64.8 | — | |
| InstructBLIP+ (T5XL)backbone=T5XL, uses_in-house_data=true2023.11 | 64.8 | — | |
| MiniGPT-v2 (7B)-chatGrounding=true, zero-shot=true2023.10 | 62.9 | — | |
| BLIVA2023.11 | 62.2 | — | |
| MiniGPT-v2 (7B)Grounding=false, zero-shot=true2023.10 | 60.6 | — | |
| MiniGPTV22023.11 | 60.6 | — | |
| BLIP-2zero-shot=true, backbone=FlanT5-XL2023.05 | 60.5 | — | |
| InstructBLIPzero-shot=true, backbone=Vicuna-7B2023.05 | 54.3 | — | |
| InstructBLIPzero-shot=true, backbone=Vicuna-13B2023.05 | 52.1 | — | |
| InstructBLIP (13B)Grounding=false, zero-shot=true2023.10 | 52.1 | — | |
| LLaVA (13B)Grounding=false, zero-shot=true2023.10 | 51.2 | — | |
| LLaVA2023.11 | 51.2 | — | |
| BLIP-2zero-shot=true, backbone=Vicuna-13B2023.05 | 50.9 | — | |
| BLIP-2 (13B)Grounding=false, zero-shot=true2023.10 | 50.9 | — | |
| BLIP-2zero-shot=true, backbone=Vicuna-7B2023.05 | 50 | — | |
| MiniGPT-4 (13B)Grounding=false, zero-shot=true2023.10 | 41.6 | — | |
| MiniGPT42023.11 | 41.6 | — | |
| Flamingo-9BGrounding=false, zero-shot=true2023.10 | 31.8 | — | |
| DeepEyesBackbone=Qwen2.5-VL-7B2025.09 | — | 43.5 | |
| DeFactoBackbone=Qwen2.5-VL-7B2025.09 | — | 71 | |
| GRITBase Model=Qwen2.5-VL-3B2025.12 | — | 77.6 | |
| GRITBackbone=Qwen2.5-VL-3B2025.09 | — | 62.4 | |
| LaRA2024.06 | — | 53 | |
| LLaVA2024.06 | — | 51.2 | |
| Qwen2.5-VLBackbone=Qwen2.5-VL-7B2025.09 | — | 63.6 | |
| VALORBase Model=Qwen3-8B2025.12 | — | 75.6 | |
| VALOR-RLBase Model=Qwen3-8B2025.12 | — | 70.3 | |
| ViGoRLBase Model=Qwen2.5-VL-7B2025.12 | — | 79.1 | |
| Visual-SR1Backbone=Qwen2.5-VL-7B2025.09 | — | 66.4 |