Multimodal Understanding on MMBench MMB EN
79.04ScoreLaVer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LaVerVisual Encoder Model=Qwen-ViT2025.12 | 79.04 | — | — | |
| BaselineVisual Encoder Model=Qwen-ViT2025.12 | 77.66 | — | — | |
| LaVerVisual Encoder Model=SigLIP22025.12 | 75.6 | — | — | |
| LaVerVisual Encoder Model=AIMv22025.12 | 75.43 | — | — | |
| BaselineVisual Encoder Model=AIMv22025.12 | 74.14 | — | — | |
| BaselineVisual Encoder Model=SigLIP22025.12 | 73.97 | — | — | |
| LaVerVisual Encoder Model=CLIP2025.12 | 69.93 | — | — | |
| BaselineVisual Encoder Model=CLIP2025.12 | 68.64 | — | — | |
| LLaVA-Next (Full)Remain Tokens=28802026.05 | 67.9 | 76.8 | 100 | |
| VisionZipRemain Tokens=6402026.05 | 66.3 | 75.1 | 97.8 | |
| ASAP (Ours)Remain Tokens=6402026.05 | 65.8 | 75.9 | 98.8 | |
| ASAP (Ours)Remain Tokens=3202026.05 | 64.5 | 74 | 96.3 | |
| PruneSIDRemain Tokens=6402026.05 | 64.2 | 74.8 | 97.4 | |
| VisionZipRemain Tokens=3202026.05 | 63.1 | 72.2 | 94 | |
| PruneSIDRemain Tokens=3202026.05 | 63 | 73 | 95.1 | |
| ASAP (Ours)Remain Tokens=1602026.05 | 61.8 | 71.6 | 93.2 | |
| LaVerVisual Encoder Model=DINOv22025.12 | 61.68 | — | — | |
| PruneSIDRemain Tokens=1602026.05 | 60.8 | 70.5 | 91.7 | |
| VisionZipRemain Tokens=1602026.05 | 60.1 | 68.6 | 89.3 | |
| BaselineVisual Encoder Model=DINOv22025.12 | 59.19 | — | — | |
| LaVerVisual Encoder Model=MLP + Qwen 2.52025.12 | 29.04 | — | — | |
| BaselineVisual Encoder Model=MLP + Qwen 2.52025.12 | 26.8 | — | — |