Visual Question Answering on GQA (Accuracy and Average Performance %)
62.4AccuracyVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaAverage Token Budget=576, Compression Level=100%2026.05 | 62.4 | 100 | |
| VisionZip ‡Average Token Budget=192, Compression Level=↓ 66.7%2026.05 | 61.6 | 98.4 | |
| MutualAverage Token Budget=192, Compression Level=↓ 66.7%2026.05 | 61.4 | 99.4 | |
| CLSAverage Token Budget=192, Compression Level=↓ 66.7%2026.05 | 61.4 | 99.3 | |
| CLSAverage Token Budget=128, Compression Level=↓ 77.8%2026.05 | 60.8 | 98.6 | |
| MutualAverage Token Budget=128, Compression Level=↓ 77.8%2026.05 | 60.7 | 98.4 | |
| VisionZipAverage Token Budget=192, Compression Level=↓ 66.7%2026.05 | 60.3 | 98.2 | |
| VisionZip ‡Average Token Budget=128, Compression Level=↓ 77.8%2026.05 | 60 | 97 | |
| MutualAverage Token Budget=64, Compression Level=↓ 88.9%2026.05 | 59.8 | 96.8 | |
| CLSAverage Token Budget=64, Compression Level=↓ 88.9%2026.05 | 59.6 | 96.6 | |
| VisionZipAverage Token Budget=128, Compression Level=↓ 77.8%2026.05 | 58.7 | 96.1 | |
| VisionZip ‡Average Token Budget=64, Compression Level=↓ 88.9%2026.05 | 57.7 | 95.1 | |
| VisionZipAverage Token Budget=64, Compression Level=↓ 88.9%2026.05 | 55.8 | 91.8 | |
| LeVLJEPALanguage Model=Llama-1B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 44.6 | — | |
| LeVLJEPALanguage Model=Qwen-1.5B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 43.7 | — | |
| InfoNCELanguage Model=Llama-1B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 42.7 | — | |
| SigLIPLanguage Model=Llama-1B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 42.4 | — | |
| InfoNCELanguage Model=Qwen-1.5B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 42.2 | — | |
| SigLIPLanguage Model=Qwen-1.5B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 41.6 | — | |
| RandomLanguage Model=Qwen-1.5B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 37 | — | |
| RandomLanguage Model=Llama-1B, Vision Encoder=ViT-B/16, Pre-training Data=Datacomp-L, Bridge Architecture=MLP, Evaluation Protocol=Frozen backbone and LLM2026.07 | 36.4 | — |