Multimodal Capability Evaluation on MM-Vet
85.6ScoreMasters
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| MastersBase Model=InternVL3.5-8B2025.12 | 85.6 | — | — | — | — | — | — | — | — | — | |
| MastersBase Model=InternVL3-8B2025.12 | 83.8 | — | — | — | — | — | — | — | — | — | |
| Gemini-2.5-Pro2025.12 | 83.3 | — | — | — | — | — | — | — | — | — | |
| Gemini-2.5-ProModel Category=Close-source Models2025.09 | 83.3 | — | — | — | — | — | — | — | — | — | |
| InternVL3.5-38B2025.12 | 82.2 | — | — | — | — | — | — | — | — | — | |
| MastersBase Model=Qwen2.5-VL-7B2025.12 | 81.7 | — | — | — | — | — | — | — | — | — | |
| InternVL3-78B2025.12 | 81.3 | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-32B2025.12 | 79.4 | — | — | — | — | — | — | — | — | — | |
| MastersBase Model=Qwen3-VL-8B2025.12 | 79.4 | — | — | — | — | — | — | — | — | — | |
| GPT-4.12025.12 | 78.8 | — | — | — | — | — | — | — | — | — | |
| GPT-52025.12 | 77.6 | — | — | — | — | — | — | — | — | — | |
| GPT-5-ThinkingModel Category=Close-source Models2025.09 | 77.6 | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-72B2025.12 | 76.9 | — | — | — | — | — | — | — | — | — | |
| GLM-4.5V2025.12 | 75.2 | — | — | — | — | — | — | — | — | — | |
| GPT-4o-202408062024.10 | 75.1 | — | — | — | — | — | — | — | — | — | |
| Gemini-2.0-Flash2025.12 | 73.6 | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-Max-0809Params (B)=722024.10 | 72.3 | — | — | — | — | — | — | — | — | — | |
| VAPO-Thinker-7BModel Category=Our Models2025.09 | 71.9 | — | — | — | — | — | — | — | — | — | |
| InternVL3.5Number of Parameters=2.3B2025.12 | 71.7 | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-4B (Base)Base Model=Qwen3-VL-4B, Alignment Strategy=Base2026.06 | 71.22 | — | — | — | — | — | — | — | — | — | |
| Vision-R1-7BModel Category=Open-source Models2025.09 | 71.1 | — | — | — | — | — | — | — | — | — | |
| Claude-3.5-Sonnet2025.12 | 70.1 | — | — | — | — | — | — | — | — | — | |
| COPSD (Standard)Base Model=Qwen3-VL-4B, Alignment Strategy=COPSD (Standard)2026.06 | 70.09 | — | — | — | — | — | — | — | — | — | |
| Claude-3.7-Sonnet2025.12 | 70 | — | — | — | — | — | — | — | — | — | |
| VLAA-Thinker-7BModel Category=Open-source Models2025.09 | 70 | — | — | — | — | — | — | — | — | — | |
| OPDBase Model=Qwen3-VL-4B, Alignment Strategy=OPD2026.06 | 69.77 | — | — | — | — | — | — | — | — | — | |
| COPSD (Hybrid)Base Model=Qwen3-VL-4B, Alignment Strategy=COPSD (Hybrid)2026.06 | 69.54 | — | — | — | — | — | — | — | — | — | |
| SFTBase Model=Qwen3-VL-4B, Alignment Strategy=SFT2026.06 | 69.17 | — | — | — | — | — | — | — | — | — | |
| GPT-4o2025.12 | 69.1 | — | — | — | — | — | — | — | — | — | |
| SAIL-VL2Number of Parameters=2.7B2025.12 | 68.7 | — | — | — | — | — | — | — | — | — | |
| COPSD (Standard)Base Model=Qwen2.5-VL-7B, Alignment Strategy=COPSD (Standard)2026.06 | 68.26 | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B (Base)Base Model=Qwen2.5-VL-7B, Alignment Strategy=Base2026.06 | 68.23 | — | — | — | — | — | — | — | — | — | |
| COPSD (Hybrid)Base Model=Qwen2.5-VL-7B, Alignment Strategy=COPSD (Hybrid)2026.06 | 68.21 | — | — | — | — | — | — | — | — | — | |
| GRPOBase Model=Qwen2.5-VL-7B, Alignment Strategy=GRPO2026.06 | 66.7 | — | — | — | — | — | — | — | — | — | |
| Claude3.5-Sonnet2024.10 | 66 | — | — | — | — | — | — | — | — | — | |
| Safe-RLHF-VBase Model=Qwen3-VL-4B, Alignment Strategy=Safe-RLHF-V2026.06 | 65.96 | — | — | — | — | — | — | — | — | — | |
| RecursiveVLMTraining Dataset=Data2, Train Steps=2, Eval Step=22026.02 | 65.64 | — | — | — | — | — | — | — | — | — | |
| R1-OneVision-7BModel Category=Open-source Models2025.09 | 65.2 | — | — | — | — | — | — | — | — | — | |
| VACoDeBackbone=Qwen3-VL-8B2025.10 | 65.08 | — | — | — | — | — | — | — | — | — | |
| OPDBase Model=Qwen2.5-VL-7B, Alignment Strategy=OPD2026.06 | 64.82 | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BModel Category=Open-source Models2025.09 | 64.8 | — | — | — | — | — | — | — | — | — | |
| VAPO-Thinker-3BModel Category=Our Models2025.09 | 64.6 | — | — | — | — | — | — | — | — | — | |
| Self-AugBackbone=Qwen3-VL-8B2025.10 | 64.5 | — | — | — | — | — | — | — | — | — | |
| InternVL2-Llama3-76BParams (B)=762024.10 | 64.4 | — | — | — | — | — | — | — | — | — | |
| SFTBase Model=Qwen2.5-VL-7B, Alignment Strategy=SFT2026.06 | 64.13 | — | — | — | — | — | — | — | — | — | |
| RecursiveVLMTraining Dataset=Data2, Train Steps=2, Eval Step=12026.02 | 64.04 | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-Pro2024.10 | 64 | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-Pro2025.12 | 64 | — | — | — | — | — | — | — | — | — | |
| GRPOBase Model=Qwen3-VL-4B, Alignment Strategy=GRPO2026.06 | 63.82 | — | — | — | — | — | — | — | — | — | |
| VCDBackbone=Qwen3-VL-8B2025.10 | 63.48 | — | — | — | — | — | — | — | — | — | |
| Standard TransformerTraining Dataset=Data2, Train Steps=1, Eval Step=12026.02 | 63.26 | — | — | — | — | — | — | — | — | — | |
| MultinomialBackbone=Qwen3-VL-8B2025.10 | 62.82 | — | — | — | — | — | — | — | — | — | |
| InternVL2.5-8BModel Category=Open-source Models2025.09 | 62.8 | — | — | — | — | — | — | — | — | — | |
| InternVL3Number of Parameters=2.1B2025.12 | 62.2 | — | — | — | — | — | — | — | — | — | |
| Qwen2-VLLLM Param=7B, Type=Und. Only2024.11 | 62 | — | — | — | — | — | — | — | — | — | |
| SAIL-VL1.5Number of Parameters=2.5B2025.12 | 61.4 | — | — | — | — | — | — | — | — | — | |
| Molmo-72B2025.12 | 61.1 | — | — | — | — | — | — | — | — | — | |
| Safe-RLHF-VBase Model=Qwen2.5-VL-7B, Alignment Strategy=Safe-RLHF-V2026.06 | 60.7 | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-72B2025.12 | 60.6 | — | — | — | — | — | — | — | — | — | |
| RecursiveVLMTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | 59.95 | — | — | — | — | — | — | — | — | — | |
| RecursiveVLMTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | 59.82 | — | — | — | — | — | — | — | — | — | |
| HyperVL ViTLNumber of Parameters=2.0B2025.12 | 59 | — | — | — | — | — | — | — | — | — | |
| NVLM-72B2025.12 | 58.9 | — | — | — | — | — | — | — | — | — | |
| Gemini-1.0-Pro2024.10 | 58.6 | — | — | — | — | — | — | — | — | — | |
| Meteor2024.05 | 57.3 | — | — | — | — | — | — | — | — | — | |
| HyperVLNumber of Parameters=1.8B2025.12 | 56.3 | — | — | — | — | — | — | — | — | — | |
| Qwen-VL-Plus2024.10 | 55.7 | — | — | — | — | — | — | — | — | — | |
| Standard TransformerTraining Dataset=Data1, Train Steps=1, Eval Step=12026.02 | 55.28 | — | — | — | — | — | — | — | — | — | |
| LLAVA-NeXTLLM Param=7B, Type=Und. Only2024.11 | 54.8 | — | — | — | — | — | — | — | — | — | |
| TroL-7BParameters=7B2024.06 | 54.7 | — | — | — | — | — | — | — | — | — | |
| InternVL2-8B + RPRP fine-tuning=Object Replacement Data2024.08 | 52.6 | — | — | — | — | — | — | — | — | — | |
| AndesVLNumber of Parameters=2.4B2025.12 | 52 | — | — | — | — | — | — | — | — | — | |
| Claude3-Sonnet2024.10 | 51.7 | — | — | — | — | — | — | — | — | — | |
| LongVILA-7B (S3)LLM=Qwen2-7B, Resolution=dynamic2024.08 | 51.7 | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-2BParams (B)=2.12024.10 | 51.5 | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-2BModel Scale=2B, Model Access Type=Open-source2025.03 | 51.5 | — | — | — | — | — | — | — | — | — | |
| Vanilla recursionTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | 51.24 | — | — | — | — | — | — | — | — | — | |
| Vanilla recursion w/ RMSNormTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | 51.01 | — | — | — | — | — | — | — | — | — | |
| MiniGemini-HD-13BParameters=13B, Resolution=HD2024.06 | 50.5 | — | — | — | — | — | — | — | — | — | |
| Vanilla recursionTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | 49.82 | — | — | — | — | — | — | — | — | — | |
| M3IDModel=LLaVA-NEXT2026.02 | 49.72 | 46.56 | 41.55 | 44.88 | 46 | 34.62 | 50.73 | — | — | — | |
| Qwen2-VLNumber of Parameters=2.2B2025.12 | 49.5 | — | — | — | — | — | — | — | — | — | |
| InternVL2-8B-FTRP fine-tuning=None2024.08 | 49.2 | — | — | — | — | — | — | — | — | — | |
| GPT-4v (1106, detail-high)2024.10 | 49 | — | — | — | — | — | — | — | — | — | |
| SPHINX-Plus-13BParameters=13B2024.06 | 47.9 | — | — | — | — | — | — | — | — | — | |
| Vanilla recursion w/ RMSNormTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | 47.8 | — | — | — | — | — | — | — | — | — | |
| REVISModel=LLaVA-NEXT2026.02 | 47.48 | 43.85 | 40.71 | 43 | 39.47 | 34.62 | 48.6 | — | — | — | |
| Qwen-VL-Chat-7BParameters=7B, Variant=Chat2024.06 | 47.3 | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-13BParameters=13B2024.06 | 47.3 | — | — | — | — | — | — | — | — | — | |
| VCDModel=LLaVA-NEXT2026.02 | 47.16 | 40.31 | 41.94 | 53.8 | 38.8 | 19.23 | 50.47 | — | — | — | |
| RegularModel=LLaVA-NEXT, Decoding=Standard greedy decoding2026.02 | 46.97 | 42.29 | 41.79 | 44.12 | 40.53 | 25 | 49 | — | — | — | |
| OnlyModel=LLaVA-NEXT2026.02 | 46.97 | 39.58 | 42.74 | 45.13 | 37.2 | 25 | 49.93 | — | — | — | |
| AGLAModel=LLaVA-NEXT2026.02 | 46.88 | 41.25 | 40.48 | 44 | 39.47 | 25 | 49.53 | — | — | — | |
| MM1-MoE-7Bx32Architecture=MoE, Parameters=7Bx322024.06 | 45.2 | — | — | — | — | — | — | — | — | — | |
| SETOKIMSize=7B, Visual Features=semantic-equivalent (SE), Visual Tokens=continuous (C), Observed during training=false2024.06 | 45.2 | — | — | — | — | — | — | — | — | — | |
| LLaVA-v1.6 (7B) w/ STICBase Model=LLaVA-v1.6 (7B), Strategy=STIC2024.05 | 45 | — | — | — | — | — | — | — | — | — | |
| H2OVL-Mississippi-2BParams (B)=2.12024.10 | 44.7 | — | — | — | — | — | — | — | — | — | |
| Ovis2Number of Parameters=2.5B2025.12 | 44.4 | — | — | — | — | — | — | — | — | — | |
| Phi-3-VisionParams (B)=4.22024.10 | 44.1 | — | — | — | — | — | — | — | — | — | |
| MGM-7B + RPRP fine-tuning=Object Replacement Data2024.08 | 44.1 | — | — | — | — | — | — | — | — | — |