Comprehensive Multimodal Benchmarking on MMBench MMB-EN_en
65.89AccuracyGRIP+decoder+rl
Evaluation Results
| Method | Links | |
|---|---|---|
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 65.89 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 65.46 | |
| OriginalBackbone=LLaVA-1.5-7B, Token Budget=Full2026.05 | 64.09 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 64.09 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 63.75 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 63.75 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 63.66 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 63.32 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 63.14 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 62.97 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 62.88 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 62.8 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=192 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 62.71 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=192 tokens2026.05 | 62.46 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 62.46 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=128 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 62.37 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 62.29 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 62.2 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 61.94 | |
| GRIP+encoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=encoder2026.05 | 61.69 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 61.6 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=128 tokens2026.05 | 61.6 | |
| GRIP+encoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=encoder2026.05 | 61.6 | |
| VisionZipBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 60.22 | |
| VisprunerBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 60.05 | |
| SparseVLMBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 59.88 | |
| GRIP+decoder+rlBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=rl, Pruning Component=decoder2026.05 | 59.79 | |
| GRIP+decoder+slBackbone=LLaVA-1.5-7B, Token Budget=64 tokens, Optimization Strategy=sl, Pruning Component=decoder2026.05 | 59.62 | |
| PruneSIDBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 59.54 | |
| DivPruneBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 59.45 | |
| DARTBackbone=LLaVA-1.5-7B, Token Budget=64 tokens2026.05 | 54.81 |