Visual Question Answering on VizWiz (Score, Relative Performance)
68.3ScoreVanilla
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| VanillaRetaining ratio=100%2025.11 | 68.3 | 100 | — | |
| HiPruneRetaining ratio=33.3%2025.11 | 67.5 | 98.8 | — | |
| OC-VTPRetaining ratio=33.3%, Individual training set adaptation=true2025.11 | 67.5 | 98.8 | — | |
| OC-VTPRetaining ratio=33.3%, Individual training set adaptation=false2025.11 | 67.4 | 98.7 | — | |
| VisionZipRetaining ratio=33.3%2025.11 | 67.1 | 98.2 | — | |
| OC-VTPRetaining ratio=22.2%, Individual training set adaptation=true2025.11 | 67.1 | 98.2 | — | |
| OC-VTPRetaining ratio=22.2%, Individual training set adaptation=false2025.11 | 66.8 | 97.8 | — | |
| HiPruneRetaining ratio=22.2%2025.11 | 66.5 | 97.4 | — | |
| VisionZipRetaining ratio=22.2%2025.11 | 66.3 | 97.1 | — | |
| OC-VTPRetaining ratio=11.1%, Individual training set adaptation=true2025.11 | 66.1 | 96.8 | — | |
| HiPruneRetaining ratio=11.1%2025.11 | 64.2 | 94 | — | |
| OC-VTPRetaining ratio=11.1%, Individual training set adaptation=false2025.11 | 64.2 | 94 | — | |
| VisionZipRetaining ratio=11.1%2025.11 | 62.8 | 91.9 | — | |
| VanillaModel=LLaVA-NeXT, TFLOPs=100%2026.06 | 60.75 | — | 100 | |
| APETModel=LLaVA-NeXT, TFLOPs=70%2026.06 | 60.72 | — | 99.4 | |
| VSkip+ (N=20)Model=LLaVA-NeXT, TFLOPs=74%2026.06 | 59.35 | — | 98.2 | |
| Ours (N=20)Model=LLaVA-NeXT, TFLOPs=67%2026.06 | 57.99 | — | 98.8 | |
| ShortV (N=20)Model=LLaVA-NeXT, TFLOPs=51%2026.06 | 57.09 | — | 96 | |
| V2DropModel=LLaVA-NeXT, TFLOPs=70%2026.06 | 56.83 | — | 98.4 | |
| VTW (K=16)Model=LLaVA-NeXT, TFLOPs=51%2026.06 | 54.86 | — | 86.5 | |
| PRISMSample Count=57K2025.02 | 42.3 | — | — | |
| Full DataSample Count=186K2025.02 | 41.7 | — | — | |
| RandomSample Count=57K2025.02 | 38.8 | — | — |