Accuracy on GQA (Visual Question Answering)
61.97AccuracyOriginal
Evaluation Results
| Method | Links | |
|---|---|---|
| OriginalBackbone=LLaVA-1.5-7B, Token Budget=Full2026.05 | 61.97 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 61.79 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 60.61 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 60.57 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 60.07 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 59.82 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 59.77 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 59.58 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 59.52 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 59.48 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 59.27 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 59.27 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 59.26 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 59.17 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 58.66 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 58.54 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 58.38 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 58.29 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 57.91 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 57.78 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 57.67 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 57.62 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 57.1 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 56.79 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 56.5 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 55.76 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 55.1 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 54.48 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 54.4 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 53.68 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 51.14 |