Multi-modal Understanding on MMBench (Language Scores)
86.2MMB Score (EN)Vanilla
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VanillaToken Retention Ratio=100%2026.05 | 86.2 | 83.3 | |
| SPprunerToken Retention Ratio=70%2026.05 | 86.1 | 82.5 | |
| DARTToken Retention Ratio=70%2026.05 | 86 | 82.6 | |
| FastVToken Retention Ratio=70%2026.05 | 85.7 | 82.8 | |
| SPprunerToken Retention Ratio=50%2026.05 | 85.6 | 82 | |
| DARTToken Retention Ratio=50%2026.05 | 85.3 | 81.6 | |
| FastVToken Retention Ratio=50%2026.05 | 85.1 | 81.2 | |
| SPprunerToken Retention Ratio=30%2026.05 | 84.5 | 79.5 | |
| DARTToken Retention Ratio=30%2026.05 | 82.5 | 79.5 | |
| FastVToken Retention Ratio=30%2026.05 | 80.8 | 76.2 | |
| LLaVA-NeXT-7BVisual Token Budget=2880, Token Reduction Ratio=100%, Base Model=LLaVA-NeXT-7B2026.07 | 67.2 | 56.5 | |
| AnchorPruneVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 67.1 | 56.5 | |
| CDPrunerVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 65.9 | 56.6 | |
| AnchorPruneVisual Token Budget=160, Token Reduction Ratio=↓ 94.4%, Base Model=LLaVA-NeXT-7B2026.07 | 65.5 | 56.9 | |
| PyramidDropVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 65.3 | 57.3 | |
| AnchorPruneVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 65.3 | 56.9 | |
| SparseVLMVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 64.9 | 56.9 | |
| VisionZipVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 64.6 | 56.3 | |
| CDPrunerVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 64.6 | 55.2 | |
| PyramidDropVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 64.2 | 54.3 | |
| CDPrunerVisual Token Budget=160, Token Reduction Ratio=↓ 94.4%, Base Model=LLaVA-NeXT-7B2026.07 | 64.2 | 54 | |
| SparseVLMVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 63.2 | 54 | |
| VisionZipVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 63.1 | 55 | |
| PruMerge+Visual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 62.8 | 55.2 | |
| DivPruneVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 62.8 | 53.8 | |
| FastVVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 62.5 | 54 | |
| PruMerge+Visual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 61.6 | 52.9 | |
| DivPruneVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 60.4 | 50.4 | |
| FastVVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 60.2 | 50.8 | |
| VisionZipVisual Token Budget=160, Token Reduction Ratio=↓ 94.4%, Base Model=LLaVA-NeXT-7B2026.07 | 58.8 | 51.8 | |
| PruMerge+Visual Token Budget=160, Token Reduction Ratio=↓ 94.4%, Base Model=LLaVA-NeXT-7B2026.07 | 58 | 47.3 | |
| DivPruneVisual Token Budget=160, Token Reduction Ratio=↓ 94.4%, Base Model=LLaVA-NeXT-7B2026.07 | 57.4 | 47.1 |