Visual Question Answering on GQA (Score, Relative Performance %)
61.9GQA ScoreVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaBase Model=LLaVA 1.5 7B, Number of Visual Tokens=576, Training Protocol=Standard training2024.12 | 61.9 | 100 | |
| VisionZipBase Model=LLaVA 1.5 7B, Number of Visual Tokens=192, Training Protocol=VisionZip training2024.12 | 61.5 | 99.4 | |
| VisionZipBase Model=LLaVA 1.5 7B, Number of Visual Tokens=128, Training Protocol=VisionZip training2024.12 | 60 | 96.9 | |
| VisionZipBase Model=LLaVA 1.5 7B, Number of Visual Tokens=64, Training Protocol=VisionZip training2024.12 | 58.9 | 95.2 |