General Image Understanding on LLaVA-Bench In-the-Wild
67.7ScoreVisionZip
Evaluation Results
| Method | Links | |
|---|---|---|
| VisionZipBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 67.7 | |
| VanillaBackbone=LLaVA-1.5-7B, Visual Token Budget=5762026.06 | 66.9 | |
| V2DropBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 66.5 | |
| EvoCutBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 66.4 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 66.1 | |
| ApETBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 66.1 | |
| PDropBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 65.8 | |
| EvoCutBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 65.1 | |
| VisionZipBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 64.8 | |
| ApETBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 64.2 | |
| ApETBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 63 | |
| EvoCutBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 63 | |
| V2DropBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 62.9 | |
| VisionZipBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 62.9 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 62.7 | |
| V2DropBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 62.4 | |
| PDropBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 61.9 | |
| PDropBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 59.2 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 57.5 | |
| FastVBackbone=LLaVA-1.5-7B, Visual Token Budget=1282026.06 | 52 | |
| FastVBackbone=LLaVA-1.5-7B, Visual Token Budget=1922026.06 | 49.4 | |
| FastVBackbone=LLaVA-1.5-7B, Visual Token Budget=642026.06 | 46.1 |