Visual Question Answering on SEED-Bench Image
76.9AccuracyInternVL2.5-MPO
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL2.5-MPOModel Size=8B2025.01 | 76.9 | |
| DeepSeekVL-2Model Size=8B2025.01 | 76.8 | |
| WeMMModel Size=8B, Access Type=Open-source2024.07 | 75.9 | |
| SAIL-VLModel Size=8B2025.01 | 75.5 | |
| IXC-2.5-7BModel Size=7B2024.07 | 75.4 | |
| Qwen2-VLModel Size=8B2025.01 | 75.3 | |
| SAIL-VLModel Size=2B2025.01 | 74.7 | |
| InternVL2.5-MPOModel Size=2B2025.01 | 73.2 | |
| OpenCLIP + Qwen2.5-3BVision Encoder=OpenCLIP, LLM=Qwen2.5-3B2026.05 | 72.9 | |
| DeepSeekVL-2Model Size=2B2025.01 | 72.5 | |
| Bunny-v1.1-4BBackbone=Phi-3-3.8B, Param.=4B, Train Data=2.7M2026.02 | 72.5 | |
| VEN-VLLLM=Qwen3-1.7B, Retain Ratio (%)=∼ 7.5%2026.05 | 72.5 | |
| MM1.5 3BModel Parameters=3B, Decoding Strategy=Greedy2024.09 | 72.4 | |
| C-GSPN + Qwen2.5-3BVision Encoder=C-GSPN, LLM=Qwen2.5-3B2026.05 | 72.1 | |
| Qwen2-VLModel Size=2B2025.01 | 72 | |
| Phi-3-Vision 4BModel Parameters=4B, Decoding Strategy=Greedy2024.09 | 71.8 | |
| LLaVA-NeXTLLM=Vicuna-13B, Resolution setting=High resolution, CAL=false2024.05 | 71.8 | |
| LLaVA-NeXT+CALLLM=Vicuna-13B, Resolution setting=High resolution, CAL=true2024.05 | 71.6 | |
| InternVL2-2BLLM=InternLM2-1.8B, Retain Ratio (%)=100%2026.05 | 71.6 | |
| Qwen2-VL-2BLLM=Qwen2-1.5B, Retain Ratio (%)=100%2026.05 | 71.5 | |
| MM1.5 1B (MoE)Model Parameters=1B, Architecture=MoE, Decoding Strategy=Greedy2024.09 | 71.4 | |
| InternVL2 2BModel Parameters=2B, Decoding Strategy=Beam Search2024.09 | 70.9 | |
| Gemini-ProAccess Type=Closed-source API2024.07 | 70.7 | |
| LLaVA-NeXT+CALLLM=Vicuna-7B, Resolution setting=High resolution, CAL=true2024.05 | 70.7 | |
| MGM-HD+CALLLM=Vicuna-13B, Resolution setting=High resolution, CAL=true2024.05 | 70.5 | |
| HIVEBackbone=Huginn, Param.=4B, Train Data=6.5M, Recurrence Level (r)=322026.02 | 70.5 | |
| VEN-VLLLM=Qwen2.5-1.5B, Retain Ratio (%)=∼ 10%2026.05 | 70.3 | |
| MM1.5 1BModel Parameters=1B, Decoding Strategy=Greedy2024.09 | 70.2 | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 70.1 | |
| MGM-HDLLM=Vicuna-13B, Resolution setting=High resolution, CAL=false2024.05 | 70.1 | |
| LLaVA-NeXTLLM=Vicuna-7B, Resolution setting=High resolution, CAL=false2024.05 | 69.6 | |
| MGMLLM=Vicuna-13B, Resolution setting=Low resolution, CAL=false2024.05 | 69.5 | |
| MGM+CALLLM=Vicuna-13B, Resolution setting=Low resolution, CAL=true2024.05 | 69.4 | |
| LLaVA-1.5+CALLLM=Vicuna-13B, Resolution setting=Low resolution, CAL=true2024.05 | 69.3 | |
| GPT-4VAccess Type=Closed-source API2024.07 | 69.1 | |
| MGM+CALLLM=Vicuna-7B, Resolution setting=Low resolution, CAL=true2024.05 | 69 | |
| VEN-VLLLM=Qwen3-0.6B, Retain Ratio (%)=∼ 7.5%2026.05 | 69 | |
| DyCo-RLBackbone=Qwen2.5-VL-3B, Zero-shot=true2026.06 | 69 | |
| LaVerVisual Encoder Model=SigLIP22025.12 | 68.62 | |
| LLaVA-1.5LLM=Vicuna-13B, Resolution setting=Low resolution, CAL=false2024.05 | 68.6 | |
| MGM-HD+CALLLM=Vicuna-7B, Resolution setting=High resolution, CAL=true2024.05 | 68.6 | |
| LLaVA-1.5-13BLLM=Vicuna-13B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 68.2 | |
| MGMLLM=Vicuna-7B, Resolution setting=Low resolution, CAL=false2024.05 | 68.2 | |
| Emu3Param.=8B2026.02 | 68.2 | |
| GRPO BaselineBackbone=Qwen2.5-VL-3B, Zero-shot=true2026.06 | 68.2 | |
| BaselineVisual Encoder Model=SigLIP22025.12 | 67.57 | |
| MiniCPM-V2 3BModel Parameters=3B, Decoding Strategy=Beam Search2024.09 | 67.1 | |
| LaVerVisual Encoder Model=AIMv22025.12 | 67.04 | |
| BaselineVisual Encoder Model=AIMv22025.12 | 66.96 | |
| LLaVA-1.5LLM=Vicuna-7B, Resolution setting=Low resolution, CAL=false2024.05 | 66.6 | |
| LLaVA-1.5+CALLLM=Vicuna-7B, Resolution setting=Low resolution, CAL=true2024.05 | 66.5 | |
| LLaVA-1.5-7BLLM=Vicuna-7B, Image Size=336x336, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 66.1 | |
| LLaVA-v1.5Parameters=7B2024.03 | 66.1 | |
| LLaVA-1.5LLM=Vicuna-7B, Retain Ratio (%)=100%2026.05 | 66.1 | |
| LumenParameters=7B2024.03 | 65.8 | |
| MGM-HDLLM=Vicuna-7B, Resolution setting=High resolution, CAL=false2024.05 | 65.7 | |
| Qwen-VL-ChatLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B*, Fine-tune Sample Size=50M+2023.10 | 65.4 | |
| Qwen-VL-ChatLLM=Qwen-7B, Retain Ratio (%)=100%2026.05 | 65.4 | |
| LaVerVisual Encoder Model=CLIP2025.12 | 65.2 | |
| MGM+CALLLM=Gemma-2B, Resolution setting=Low resolution, CAL=true2024.05 | 65 | |
| MGMLLM=Gemma-2B, Resolution setting=Low resolution, CAL=false2024.05 | 64.6 | |
| BaselineVisual Encoder Model=CLIP2025.12 | 64.36 | |
| PyramidDropLLM=Vicuna-7B, Retain Ratio (%)=∼ 10%2026.05 | 64.3 | |
| LaVerVisual Encoder Model=DINOv22025.12 | 62.98 | |
| BaselineVisual Encoder Model=Qwen-ViT2025.12 | 62.93 | |
| Qwen-VLLLM=Qwen-7B, Image Size=448x448, Pre-train Sample Size=1.4B+, Fine-tune Sample Size=50M+2023.10 | 62.3 | |
| BaselineVisual Encoder Model=DINOv22025.12 | 62.24 | |
| LaVerVisual Encoder Model=Qwen-ViT2025.12 | 61.95 | |
| LLaVA-MiniLLM=Vicuna-7B, Retain Ratio (%)=∼ 10%2026.05 | 60.2 | |
| InstructBLIP-8BLLM=Vicuna-7B, Image Size=224x224, Pre-train Sample Size=129M, Fine-tune Sample Size=1.2M2023.10 | 58.8 | |
| InstructBLIPParameters=7B2024.03 | 58.8 | |
| Qwen-VL-ChatParameters=7B2024.03 | 58.2 | |
| VisionZipLLM=Vicuna-7B, Retain Ratio (%)=∼ 10%2026.05 | 53.4 | |
| FastVLLM=Vicuna-7B, Retain Ratio (%)=∼ 10%2026.05 | 51.9 | |
| SparseVLMLLM=Vicuna-7B, Retain Ratio (%)=∼ 10%2026.05 | 51.1 | |
| BLIP2-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M2023.10 | 49.7 | |
| MiniGPT-4Parameters=7B2024.03 | 47.4 | |
| LaVerVisual Encoder Model=MLP + Qwen 2.52025.12 | 43.7 | |
| BaselineVisual Encoder Model=MLP + Qwen 2.52025.12 | 40.62 | |
| LLaVA-7BLLM=Vicuna-7B2023.10 | 37 |