Multi-modal Understanding on SEED-IMG
78.46AccuracyQwen3-VL-4B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-VL-4BModel=Qwen3-VL, Parameter Count=4B2026.04 | 78.46 | — | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision, Parameter Count=7B2026.04 | 76.64 | — | |
| SpB2.0-VL-5BModel=SpB2.0-VL, Parameter Count=5B2026.04 | 76.08 | — | |
| Qwen2.5-VL-3BModel=Qwen2.5-VL, Parameter Count=3B2026.04 | 73.88 | — | |
| InternVL2-4BModel=InternVL2, Parameter Count=4B, Result Source=OpenVLM Leaderboard (OpenCompass, 2025)2026.04 | 73.2 | — | |
| InfiniteVL-4BModel=InfiniteVL, Parameter Count=4B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 72.9 | — | |
| SmolVLM2-2.2BModel=SmolVLM2, Parameter Count=2.2B2026.04 | 70.69 | — | |
| Vanilla 7BBase Model=mini-Gemini 7B, Number of Tokens=576, Protocol=Upper Bound2024.12 | 69.7 | 100 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=1922024.12 | 67.5 | 96.8 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=192, Fine-tuning Protocol=Fine-tuned multimodal projector2024.12 | 67 | 96.1 | |
| LLaVA-1.5 Vanilla 13BTokens Retained=576, Compression Ratio=100%2025.08 | 66.9 | 100 | |
| VisionZip 🔥Tokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 66.1 | 98.8 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=128, Fine-tuning Protocol=Fine-tuned multimodal projector2024.12 | 65.9 | 94.5 | |
| DivPruneTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 65.72 | 98.2 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=1282024.12 | 65.6 | 94.1 | |
| MaTVLM-3BModel=MaTVLM, Parameter Count=3B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 65.6 | — | |
| MMTokTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 65.49 | 97.9 | |
| VisionZipTokens Retained=192, Compression Ratio=↓ 66.7%2025.08 | 65.2 | 97.5 | |
| VisionZip 🔥Tokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 64.9 | 97 | |
| MMTokTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 64.26 | 96.1 | |
| DivPruneTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 64.22 | 96 | |
| VisionZipTokens Retained=128, Compression Ratio=↓ 77.8%2025.08 | 63.8 | 95.4 | |
| MMTokTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 63.39 | 94.8 | |
| Cobra-3BModel=Cobra, Parameter Count=3B, Result Source=InfiniteVL (Tao et al., 2025) paper2026.04 | 63.3 | — | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=64, Fine-tuning Protocol=Fine-tuned multimodal projector2024.12 | 62.6 | 89.8 | |
| DivPruneTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 62.44 | 93.3 | |
| VisionZipBase Model=mini-Gemini 7B, Number of Tokens=642024.12 | 61.7 | 88.5 | |
| VisionZip 🔥Tokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 61.4 | 91.8 | |
| VisionZipTokens Retained=64, Compression Ratio=↓ 88.9%2025.08 | 60.4 | 90.3 |