Multi-modal Benchmark on MMBench
83.3AccuracySkiLa
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SkiLa2025.12 | 83.3 | — | |
| LLaVA-OneVision 7BModel Size=7B2025.12 | 83.2 | — | |
| Qwen2.5-VL 7BModel Size=7B2025.12 | 82.5 | — | |
| SkiLa-V2025.12 | 82.4 | — | |
| Gemma3 27BModel Size=27B2025.12 | 82.3 | — | |
| GPT-4o2025.12 | 82.1 | — | |
| Direct SFT2025.12 | 82.1 | — | |
| Claude3.7-Sonnet2025.12 | 81.4 | — | |
| GPT-4v2025.12 | 81 | — | |
| ROSS 7BModel Size=7B2025.12 | 80.5 | — | |
| Vision-R1 7B*Model Size=7B, Tested by authors=true2025.12 | 79.8 | — | |
| GPT-4o-mini2025.12 | 77.6 | — | |
| LVR 7B*Model Size=7B, Tested by authors=true2025.12 | 74.6 | — | |
| VILA-13BModel Scale=13B, Precision=FP162023.06 | 73.8 | — | |
| VILA-13B-AWQModel Scale=13B, Quantization=INT4-g1282023.06 | 73.6 | — | |
| Cambrian 13BModel Size=13B2025.12 | 73.4 | — | |
| VILA-7BModel Scale=7B, Precision=FP162023.06 | 69.8 | — | |
| VILA-7B-AWQModel Scale=7B, Quantization=INT4-g1282023.06 | 68.8 | — | |
| SwiftVLMToken Retention Ratio=33.3%, Backbone=LLaVA-NeXT-7B2026.02 | 68 | 98 | |
| VanillaToken Retention Ratio=100%, Backbone=LLaVA-NeXT-7B2026.02 | 67.9 | 100 | |
| SwiftVLMToken Retention Ratio=22.2%, Backbone=LLaVA-NeXT-7B2026.02 | 67.7 | 97.1 | |
| FEATHERToken Retention Ratio=33.3%, Backbone=LLaVA-NeXT-7B2026.02 | 67.5 | 92.8 | |
| VanillaBackbone=LLaVA-NeXT-7B, Token Retention=2880, Reduction Ratio=100%2026.02 | 67.4 | — | |
| FEATHERToken Retention Ratio=22.2%, Backbone=LLaVA-NeXT-7B2026.02 | 66.5 | 87.5 | |
| VisionZipBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 66.2 | — | |
| SparseVLMBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 65.8 | — | |
| PDropBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 65.5 | — | |
| ApETBackbone=LLaVA-NeXT-7B, Token Retention=640, Reduction Ratio=77.8%2026.02 | 65.3 | — | |
| VanillaVisual Token Budget=5762026.02 | 64.6 | 100 | |
| SwiftVLMVisual Token Budget=1922026.02 | 64.5 | 99.8 | |
| SparseVLMBackbone=LLaVA-NeXT-7B, Token Retention=320, Reduction Ratio=88.9%2026.02 | 64.2 | — | |
| SwiftVLMVisual Token Budget=1282026.02 | 63.9 | 98.9 | |
| ApETBackbone=LLaVA-NeXT-7B, Token Retention=320, Reduction Ratio=88.9%2026.02 | 63.5 | — | |
| PDropBackbone=LLaVA-NeXT-7B, Token Retention=320, Reduction Ratio=88.9%2026.02 | 63.4 | — | |
| VisionZipBackbone=LLaVA-NeXT-7B, Token Retention=320, Reduction Ratio=88.9%2026.02 | 63.1 | — | |
| Janus-Pro 7BModel Size=7B2025.12 | 62.6 | — | |
| PDropBackbone=LLaVA-NeXT-7B, Token Retention=160, Reduction Ratio=94.4%2026.02 | 61.8 | — | |
| ApETBackbone=LLaVA-NeXT-7B, Token Retention=160, Reduction Ratio=94.4%2026.02 | 60.8 | — | |
| VisionZipBackbone=LLaVA-NeXT-7B, Token Retention=160, Reduction Ratio=94.4%2026.02 | 60.1 | — | |
| SuperCLIPPretrain=B-512M, Multi-modal LLM Setting=true2025.12 | 55.9 | — | |
| SparseVLMBackbone=LLaVA-NeXT-7B, Token Retention=160, Reduction Ratio=94.4%2026.02 | 52.1 | — | |
| CLIPPretrain=B-512M, Multi-modal LLM Setting=true2025.12 | 49.1 | — | |
| FastVToken Retention Ratio=33.3%, Backbone=LLaVA-NeXT-7B2026.02 | 48.3 | 75.1 | |
| FastVToken Retention Ratio=22.2%, Backbone=LLaVA-NeXT-7B2026.02 | 46 | 66.9 |