Multimodal Understanding on SEED Bench Img
77SEEDB ScoreQwen2.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL2026.01 | 77 | |
| LLaVA-OneVision2026.01 | 76.7 | |
| Molmo2026.01 | 74.6 | |
| PaliGemma2026.01 | 71.5 | |
| SmolVLM22026.01 | 71.3 | |
| LLaVA-NeXT2026.01 | 69.6 | |
| Gemma3-4b-it2026.01 | 65.5 | |
| LLaVA-1.52026.01 | 60.1 | |
| LLaVA-AIMv2Encoder=AIMv22026.01 | 59.5 | |
| LLaVA-AIMv2-2D-RoPEEncoder=AIMv2, 2D-RoPE=true2026.01 | 58.6 | |
| LLaVA-2D-RoPE2D-RoPE=true2026.01 | 58.5 | |
| LLaVA-SigLIPEncoder=SigLIP2026.01 | 56.7 | |
| LLaVA-SigLIP2Encoder=SigLIP22026.01 | 54.8 | |
| LLaVA-SigLIP-2D-RoPEEncoder=SigLIP, 2D-RoPE=true2026.01 | 54.5 | |
| LLaVA-SigLIP2-2D-RoPEEncoder=SigLIP2, 2D-RoPE=true2026.01 | 52.7 | |
| TokenFlow-XLBackbone=Qwen-2.5-14B, Resolution=384, Visual Input Type=Discrete2024.12 | 0.726 | |
| ShareGPT4VBackbone=Vicuna-7B, Resolution=336, Visual Input Type=Continuous2024.12 | 0.697 | |
| ChameleonBackbone=34B from scratch, Resolution=256, Visual Input Type=Discrete2024.12 | 0.696 | |
| TokenFlow-XLBackbone=Vicuna-13B, Resolution=384, Visual Input Type=Discrete2024.12 | 0.687 | |
| EMU3Backbone=8B from scratch, Resolution=512, Visual Input Type=Discrete2024.12 | 0.682 | |
| LLaVA-1.5Backbone=Vicuna-13B, Resolution=336, Visual Input Type=Continuous2024.12 | 0.681 | |
| JanusBackbone=DeepSeek-LLM-1.3B, Resolution=384, Visual Input Type=Continuous2024.12 | 0.637 | |
| TokenFlow-LBackbone=Vicuna-13B, Resolution=256, Visual Input Type=Discrete2024.12 | 0.626 | |
| TokenFlow-BBackbone=Vicuna-13B, Resolution=224, Visual Input Type=Discrete2024.12 | 0.604 | |
| VILA-UBackbone=LLaMA-2-7B, Resolution=384, Visual Input Type=Discrete2024.12 | 0.59 | |
| InstructBLIPBackbone=Vicuna-13B, Resolution=224, Visual Input Type=Continuous2024.12 | 0.588 | |
| Qwen-VL-ChatBackbone=Qwen-7B, Resolution=448, Visual Input Type=Continuous2024.12 | 0.577 | |
| NEXT-GPTBackbone=Vicuna-7B, Resolution=224, Visual Input Type=Continuous2024.12 | 0.575 | |
| VILA-UBackbone=LLaMA-2-7B, Resolution=256, Visual Input Type=Discrete2024.12 | 0.563 | |
| SEED-LLAMABackbone=LLaMA-2-13B, Resolution=224, Visual Input Type=Discrete2024.12 | 0.537 | |
| BLIP-2Backbone=Vicuna-13B, Resolution=224, Visual Input Type=Continuous2024.12 | 0.464 | |
| LWMBackbone=LLaMA-2-7B, Resolution=256, Visual Input Type=Discrete2024.12 | 0.096 |