Multimodal Understanding on MMBench (MMB, Avg. Normalized Average Retention)
86.08MMB ScoreBF16
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BF16Precision=BF162026.06 | 86.08 | — | |
| MODEQuantization=W32026.06 | 82.56 | — | |
| MC-MoEQuantization=W32026.06 | 81.42 | — | |
| GPTQQuantization=W32026.06 | 81.19 | — | |
| VEQ-MAQuantization=W32026.06 | 81.12 | — | |
| MODEQuantization=W22026.06 | 78.69 | — | |
| GPTQQuantization=W22026.06 | 77.32 | — | |
| MC-MoEQuantization=W22026.06 | 76.43 | — | |
| VEQ-MAQuantization=W22026.06 | 75.76 | — | |
| VanillaBase Model=LLaVA-NEXT-7B, Token Budget=2880, Pruning Rate=0%, Loc. (Pruning Location)=-2026.05 | 67.4 | 100 | |
| MS-ResamplerVision Token=1442026.06 | 65.6 | 100.43 | |
| DARTBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=L22026.05 | 65.3 | 95.6 | |
| HoloVBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=Pre2026.05 | 65.3 | 95.7 | |
| DiffPruneBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=Pre2026.05 | 64.7 | 96.1 | |
| LLaVA-1.5-7BVision Token=5762026.06 | 64.3 | 100 | |
| HiREDBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=Pre2026.05 | 64.2 | 93.4 | |
| DARTVision Token=1922026.06 | 63.6 | 97.98 | |
| PDropBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=L8–L242026.05 | 63.4 | 90.7 | |
| FitPruneVision Token=1922026.06 | 63.3 | — | |
| PDropVision Token=1922026.06 | 63.2 | 96.19 | |
| HiREDVision Token=1922026.06 | 62.8 | 89.06 | |
| SparseVLMVision Token=1922026.06 | 62.5 | 95.79 | |
| MustDropVision Token=1922026.06 | 62.3 | 96.26 | |
| FastVBase Model=LLaVA-NEXT-7B, Token Budget=320, Pruning Rate=88.9%, Loc. (Pruning Location)=L2–L322026.05 | 61.6 | 87.6 | |
| FastVVision Token=1922026.06 | 61.2 | 89.58 | |
| LLaVA-PruMergeVision Token=1922026.06 | 59.6 | 88.92 |