Visual Reasoning on GQA (test-dev)
62AccuracyLLaVA-1.5-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5-7BReduction Ratio=0%, Vision Tokens=5762026.02 | 62 | |
| Mask-LLaVAReduction Ratio=90%, Vision Tokens=572026.02 | 60.6 | |
| Mask-LLaVAReduction Ratio=97%, Vision Tokens=422026.02 | 60.5 | |
| Voco-LLaMaReduction Ratio=88%, Vision Tokens=642026.02 | 60.4 | |
| M3Reduction Ratio=75%, Vision Tokens=362026.02 | 60.3 | |
| Voco-LLaMaReduction Ratio=88%, Vision Tokens=322026.02 | 60.2 | |
| MQTReduction Ratio=88%, Vision Tokens=642026.02 | 60 | |
| Voco-LLaMaReduction Ratio=88%, Vision Tokens=162026.02 | 59.4 | |
| MQTReduction Ratio=88%, Vision Tokens=362026.02 | 58.8 | |
| Mask-LLaVAReduction Ratio=97%, Vision Tokens=152026.02 | 58.5 | |
| M3Reduction Ratio=75%, Vision Tokens=92026.02 | 58 | |
| MQTReduction Ratio=88%, Vision Tokens=162026.02 | 57.6 | |
| FasterVLMReduction Ratio=90%, Vision Tokens=582026.02 | 54.9 | |
| LLaVA-1.5-7B (Random Patch Dropping)Reduction Ratio=90%, Vision Tokens=582026.02 | 54.2 | |
| FasterVLMReduction Ratio=95%, Vision Tokens=292026.02 | 51.5 | |
| LLaVA-1.5-7B (Random Patch Dropping)Reduction Ratio=95%, Vision Tokens=292026.02 | 51 | |
| FitPruneReduction Ratio=90%, Vision Tokens=582026.02 | 49.9 | |
| SparseVLMReduction Ratio=90%, Vision Tokens=582026.02 | 48.8 | |
| FitPruneReduction Ratio=95%, Vision Tokens=292026.02 | 43.6 |