Multimodal Large Language Model Evaluation on MME
2,315MME ScoreFull Model
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Full ModelRatio=1.02026.04 | 2,315 | 100 | |
| HAWKRatio=0.62026.04 | 2,313 | 99.1 | |
| HAWKRatio=0.82026.04 | 2,311 | 95.8 | |
| VisionZipRatio=0.62026.04 | 2,308 | 96.1 | |
| DARTRatio=0.62026.04 | 2,260 | 89.5 | |
| VisionZipRatio=0.82026.04 | 2,182 | 89.2 | |
| DARTRatio=0.82026.04 | 2,135 | 80.4 | |
| HAWKRatio=0.92026.04 | 2,101 | 88.5 | |
| DARTRatio=0.92026.04 | 1,992 | 72.2 | |
| VisionZipRatio=0.92026.04 | 1,923 | 77.5 | |
| CLASPToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 1,848 | — | |
| NuwaToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 1,834 | — | |
| HolovToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 1,820 | — | |
| BTPToken retention budget (R)=192, Base Model=LLaVA-v1.5-7B2026.04 | 1,816 | — | |
| LLaVA-1.5-13BImg/s=2.22, Speedup=-2025.10 | 1,530.6 | — | |
| APTBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 1,511.2 | — | |
| LLaVA-1.5-7BImg/s=3.70, Speedup=-2025.10 | 1,510.1 | — | |
| ResizingBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 1,496.9 | — | |
| RandomBase Model=LLaVA-1.5-13B, Img/s=2.79, Speedup=+26%2025.10 | 1,484 | — | |
| APTBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 1,474 | — | |
| ResizingBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 1,473.8 | — | |
| RandomBase Model=LLaVA-1.5-7B, Img/s=4.58, Speedup=+24%2025.10 | 1,460.5 | — |