Visual Question Answering on GQA (Score, Relative Performance)
64.2ScoreVanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaTokens=2880, Retaining Ratio=100%, Backbone=LLaVA-NeXT2025.11 | 64.2 | 100 | |
| OC-VTPTokens=640, Retaining Ratio=22.2%, Individual Training=true, Backbone=LLaVA-NeXT2025.11 | 62.8 | 97.8 | |
| VisionZipTokens=640, Retaining Ratio=22.2%, Backbone=LLaVA-NeXT2025.11 | 61.3 | 95.5 | |
| OC-VTPTokens=640, Retaining Ratio=22.2%, Backbone=LLaVA-NeXT2025.11 | 61.2 | 95.3 | |
| HiPruneTokens=640, Retaining Ratio=22.2%, Backbone=LLaVA-NeXT2025.11 | 60.6 | 94.4 | |
| OC-VTPTokens=320, Retaining Ratio=11.1%, Individual Training=true, Backbone=LLaVA-NeXT2025.11 | 59.6 | 92.8 | |
| VisionZipTokens=320, Retaining Ratio=11.1%, Backbone=LLaVA-NeXT2025.11 | 59.3 | 92.4 | |
| OC-VTPTokens=320, Retaining Ratio=11.1%, Backbone=LLaVA-NeXT2025.11 | 58.1 | 90.5 | |
| OC-VTPTokens=160, Retaining Ratio=5.6%, Individual Training=true, Backbone=LLaVA-NeXT2025.11 | 57.6 | 89.7 | |
| HiPruneTokens=320, Retaining Ratio=11.1%, Backbone=LLaVA-NeXT2025.11 | 57.4 | 89.4 | |
| OC-VTPTokens=160, Retaining Ratio=5.6%, Backbone=LLaVA-NeXT2025.11 | 56.1 | 87.4 | |
| VisionZipTokens=160, Retaining Ratio=5.6%, Backbone=LLaVA-NeXT2025.11 | 55.1 | 85.8 | |
| HiPruneTokens=160, Retaining Ratio=5.6%, Backbone=LLaVA-NeXT2025.11 | 52.5 | 81.8 |