Visual Question Answering on Vizwiz (val)
81.7VQA ScoreQwen3-VL-4b-Instruct
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen3-VL-4b-Instruct2026.03 | 81.7 | — | 80.4 | 83.9 | 82.1 | |
| SNs (mean)Backbone=Qwen3-VL-4b-Instruct2026.03 | 80.9 | — | 76.9 | 89.2 | 82.6 | |
| SNs (maj. voting)Backbone=Qwen3-VL-4b-Instruct2026.03 | 80.9 | — | 79.8 | 80.6 | 80.2 | |
| PaLI-XOCR pipeline input=true2023.05 | 74.6 | — | — | — | — | |
| PaLIOCR pipeline input=true2023.05 | 73.3 | — | — | — | — | |
| SNs (mean)Backbone=LLaVA-v1.5-7b2026.03 | 71 | — | 73.9 | 69.9 | 71.8 | |
| SNs (maj. voting)Backbone=LLaVA-v1.5-7b2026.03 | 71 | — | 64.1 | 90.3 | 75 | |
| PaLI-XOCR pipeline input=false2023.05 | 70.9 | — | — | — | — | |
| PaLIOCR pipeline input=false2023.05 | 70.7 | — | — | — | — | |
| MLCDLLM=Qwen2-72B, Vision Tower=ViT-L/142024.07 | 67.37 | — | — | — | — | |
| CLIPLLM=Qwen2-72B, Vision Tower=ViT-L/142024.07 | 67.14 | — | — | — | — | |
| LLaVA-v1.5-7b2026.03 | 65.6 | — | 60.1 | 92.5 | 72.9 | |
| EADPRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 59.5 | — | — | — | — | |
| EADPRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 59.3 | — | — | — | — | |
| EADPRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 58 | — | — | — | — | |
| CDPrunerRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 58 | — | — | — | — | |
| CDPrunerRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 57.9 | — | — | — | — | |
| DivPruneRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 57.8 | — | — | — | — | |
| DivPruneRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 57.5 | — | — | — | — | |
| DivPruneRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 57.4 | — | — | — | — | |
| CDPrunerRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 57.3 | — | — | — | — | |
| MetaGPTUnsupervised=true2025.03 | 56.66 | 13.48 | — | — | — | |
| Task ArithmeticUnsupervised=false2025.03 | 56.49 | 13.31 | — | — | — | |
| DARE-LinearUnsupervised=false2025.03 | 55.9 | 12.72 | — | — | — | |
| HiPruneRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 55.4 | — | — | — | — | |
| HiPruneRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 55.4 | — | — | — | — | |
| VILA-1.5-8B + MTVProtocol=Multimodal Task Vectors2024.06 | 55.2 | — | — | — | — | |
| AdaMMSUnsupervised=true2025.03 | 54.64 | 11.46 | — | — | — | |
| LLaVA(base)2025.03 | 54.29 | — | — | — | — | |
| PruMerge+Retain Tokens=128, Pruning Ratio=77.8%2026.07 | 53.7 | — | — | — | — | |
| PruMerge+Retain Tokens=64, Pruning Ratio=88.9%2026.07 | 53.7 | — | — | — | — | |
| multi-modal exploration-exploitation reinforcement learning frameworkBase Model=Qwen-VL, Selection Strategy=Reinforcement Learning2025.06 | 53.6 | — | — | — | — | |
| DARTRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 53.5 | — | — | — | — | |
| PruMerge+Retain Tokens=32, Pruning Ratio=94.4%2026.07 | 53.5 | — | — | — | — | |
| DARE-TiesUnsupervised=false2025.03 | 53.27 | 10.09 | — | — | — | |
| Self-FilterTraining Data Fraction=20%2026.05 | 53.2 | — | — | — | — | |
| VisionZipRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 52.9 | — | — | — | — | |
| DARTRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 52.8 | — | — | — | — | |
| Idefics2 + MTVProtocol=Multimodal Task Vectors2024.06 | 52.5 | — | — | — | — | |
| DARTRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 52.5 | — | — | — | — | |
| VisionZipRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 52.4 | — | — | — | — | |
| FastVRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 51.9 | — | — | — | — | |
| TRIMRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 51.6 | — | — | — | — | |
| VisionZipRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 51.6 | — | — | — | — | |
| Ties-MergingUnsupervised=false2025.03 | 51.3 | 8.12 | — | — | — | |
| TRIMRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 51.1 | — | — | — | — | |
| MANTIS-LLaMA3-8B + MTVProtocol=Multimodal Task Vectors2024.06 | 51 | — | — | — | — | |
| TRIMRetain Tokens=32, Pruning Ratio=94.4%2026.07 | 50.7 | — | — | — | — | |
| MAGICTraining Data Fraction=20%2026.05 | 50.2 | — | — | — | — | |
| ICONSTraining Data Fraction=20%2026.05 | 50.1 | — | — | — | — | |
| LLaVA-1.5-7BRetain Tokens=576, Pruning Ratio=0%2026.07 | 50.1 | — | — | — | — | |
| SparseVLMRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 49.7 | — | — | — | — | |
| PDropRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 49.4 | — | — | — | — | |
| SparseVLMRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 49.4 | — | — | — | — | |
| FastVRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 49.1 | — | — | — | — | |
| similarityBase Model=Qwen-VL, Selection Strategy=Similarity2025.06 | 48.7 | — | — | — | — | |
| RDSTraining Data Fraction=20%2026.05 | 48.6 | — | — | — | — | |
| CLIPLLM=Qwen2-7B, Vision Tower=ViT-L/142024.07 | 48.58 | — | — | — | — | |
| FullTraining Data Fraction=100%2026.05 | 47.8 | — | — | — | — | |
| PerplexityTraining Data Fraction=20%2026.05 | 47.8 | — | — | — | — | |
| COIDOTraining Data Fraction=20%2026.05 | 47.1 | — | — | — | — | |
| SemDeDupTraining Data Fraction=20%2026.05 | 46.9 | — | — | — | — | |
| COINCIDETraining Data Fraction=20%2026.05 | 46.8 | — | — | — | — | |
| PDropRetain Tokens=64, Pruning Ratio=88.9%2026.07 | 46.3 | — | — | — | — | |
| MLCDLLM=Qwen2-7B, Vision Tower=ViT-L/142024.07 | 46.27 | — | — | — | — | |
| Self-SepTraining Data Fraction=20%2026.05 | 46 | — | — | — | — | |
| multi-modal exploration-exploitation reinforcement learning frameworkBase Model=LLaVA, Selection Strategy=Reinforcement Learning2025.06 | 45.6 | — | — | — | — | |
| Qwen-VL-7B + MTVProtocol=Multimodal Task Vectors2024.06 | 45.6 | — | — | — | — | |
| Blip3Shots=82024.06 | 44.3 | — | — | — | — | |
| Qwen-VL-7BShots=82024.06 | 44.3 | — | — | — | — | |
| RandomTraining Data Fraction=20%2026.05 | 44.3 | — | — | — | — | |
| VILA-1.5-8BShots=82024.06 | 44.2 | — | — | — | — | |
| Idefics2Shots=82024.06 | 43.8 | — | — | — | — | |
| EL2NTraining Data Fraction=20%2026.05 | 43.7 | — | — | — | — | |
| BM25Base Model=Qwen-VL, Selection Strategy=BM252025.06 | 43.6 | — | — | — | — | |
| CLIP-ScoreTraining Data Fraction=20%2026.05 | 43 | — | — | — | — | |
| Qwen-VL-7BShots=42024.06 | 42 | — | — | — | — | |
| D2-PruningTraining Data Fraction=20%2026.05 | 41.9 | — | — | — | — | |
| Idefics2Shots=42024.06 | 40.8 | — | — | — | — | |
| randomBase Model=Qwen-VL, Selection Strategy=random2025.06 | 40.5 | — | — | — | — | |
| Flamingo 9BShots=82024.06 | 39.4 | — | — | — | — | |
| VILA-1.5-8BShots=42024.06 | 39.3 | — | — | — | — | |
| Blip3Shots=42024.06 | 38.4 | — | — | — | — | |
| MANTIS-LLaMA3-8BShots=02024.06 | 36.3 | — | — | — | — | |
| Qwen-VL-7BShots=02024.06 | 35.2 | — | — | — | — | |
| Flamingo 9BShots=42024.06 | 34.9 | — | — | — | — | |
| zero-shotBase Model=Qwen-VL, Selection Strategy=zero-shot2025.06 | 32.8 | — | — | — | — | |
| mPLUG-Owl22025.03 | 32.07 | — | — | — | — | |
| DataTailorTraining Data Fraction=20%2026.05 | 31.8 | — | — | — | — | |
| Idefics2Shots=02024.06 | 31.3 | — | — | — | — | |
| Flamingo 9BShots=02024.06 | 28.8 | — | — | — | — | |
| VILA-1.5-8BShots=02024.06 | 28 | — | — | — | — | |
| MANTIS-LLaMA3-8BShots=82024.06 | 27.5 | — | — | — | — | |
| MANTIS-LLaMA3-8BShots=42024.06 | 26.4 | — | — | — | — | |
| Blip3Shots=02024.06 | 21.2 | — | — | — | — | |
| similarityBase Model=LLaVA, Selection Strategy=Similarity2025.06 | 19.8 | — | — | — | — | |
| AdaMMS2025.03 | — | -2.14 | — | — | — | |
| DARE-Linear2025.03 | — | -21.09 | — | — | — | |
| DARE-Ties2025.03 | — | -32.45 | — | — | — | |
| MetaGPT2025.03 | — | -16.73 | — | — | — |