Visual Question Answering on GQA (Accuracy, Relative Score)
64.2AccuracyVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBackbone=LLaVA-NeXT, Number of Visual Tokens=2880, Projector Fine-tuning=No2024.12 | 64.2 | 100 | |
| VisionZipBackbone=LLaVA-NeXT, Number of Visual Tokens=640, Projector Fine-tuning=Yes2024.12 | 62.4 | 97.2 | |
| VisionZipBackbone=LLaVA-NeXT, Number of Visual Tokens=640, Projector Fine-tuning=No2024.12 | 61.3 | 95.5 | |
| VisionZipBackbone=LLaVA-NeXT, Number of Visual Tokens=320, Projector Fine-tuning=Yes2024.12 | 61 | 95 | |
| SparseVLMBackbone=LLaVA-NeXT, Number of Visual Tokens=640, Projector Fine-tuning=No2024.12 | 60.3 | 93.9 | |
| VisionZipBackbone=LLaVA-NeXT, Number of Visual Tokens=320, Projector Fine-tuning=No2024.12 | 59.3 | 92.3 | |
| VisionZipBackbone=LLaVA-NeXT, Number of Visual Tokens=160, Projector Fine-tuning=Yes2024.12 | 58.2 | 90.7 | |
| SparseVLMBackbone=LLaVA-NeXT, Number of Visual Tokens=320, Projector Fine-tuning=No2024.12 | 57.7 | 89.9 | |
| VisionZipBackbone=LLaVA-NeXT, Number of Visual Tokens=160, Projector Fine-tuning=No2024.12 | 55.5 | 86.4 | |
| SparseVLMBackbone=LLaVA-NeXT, Number of Visual Tokens=160, Projector Fine-tuning=No2024.12 | 51.2 | 79.8 |