Multimodal Evaluation on MME (Perception Score)
1,864Perception ScoreTwigVLM
Evaluation Results
| Method | Links | |
|---|---|---|
| TwigVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 1,864 | |
| TwigVLM++Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 1,858 | |
| LLaVA-NeXT-7BRetained Tokens=2880, Base Model=LLaVA-NeXT-7B2025.03 | 1,851 | |
| FastVRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 1,807 | |
| VisionZipRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 1,787 | |
| VisionZip‡Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 1,778 | |
| TwigVLM++Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,773 | |
| SparseVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 1,772 | |
| VisionZip‡Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,770 | |
| TwigVLMRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,758 | |
| VisionZipRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,702 | |
| SparseVLMRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,694 | |
| MustDropRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,641 | |
| FastVRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 1,539 |