Multimodal Visual Perception on MMVP
86.33AccuracyGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-53-run average=true2026.06 | 86.33 | |
| GPT-5Model Type=Understanding-only MLLM2025.12 | 85.33 | |
| GPT-4o3-run average=true2026.06 | 84.67 | |
| GPT-4oModel Type=Understanding-only MLLM2025.12 | 84.66 | |
| InternVL2.5-78BParameter Scale=78B2025.12 | 83 | |
| Qwen3VL-32BModel Type=Understanding-only MLLM2025.12 | 82.66 | |
| Qwen2.5-VL-72BParameter Scale=72B2025.12 | 81.7 | |
| InternVL3.5-38BModel Type=Understanding-only MLLM2025.12 | 80.66 | |
| InternVL3.5-38B3-run average=true2026.06 | 80.33 | |
| Qwen3-VL-4B-ThinkingParameter Scale=4B, Thinking Mode=true2025.12 | 80 | |
| Qwen3-VL-32B3-run average=true2026.06 | 80 | |
| Qwen3-VL-4B-Thinking + DiGParameter Scale=4B, Thinking Mode=true, Grounding Strategy=DiG2025.12 | 79 | |
| Qwen3-VL-8B-Thinking + DiGParameter Scale=8B, Thinking Mode=true, Grounding Strategy=DiG2025.12 | 78.7 | |
| COOPERModel Type=Unified MLLM2025.12 | 78.66 | |
| ThinkMorph3-run average=true, Latency (s)=142.82026.06 | 78.33 | |
| Qwen3-VL-8B3-run average=true2026.06 | 77.66 | |
| Qwen3VL-8BModel Type=Understanding-only MLLM2025.12 | 77.33 | |
| Visual-OPSD3-run average=true, Latency (s)=10.02026.06 | 77.33 | |
| Qwen3-VL-8B-ThinkingParameter Scale=8B, Thinking Mode=true2025.12 | 77.3 | |
| InternVL3.5-8BModel Type=Understanding-only MLLM2025.12 | 76.33 | |
| InternVL3.5-8B3-run average=true2026.06 | 76.33 | |
| Text-only SFT3-run average=true, Latency (s)=28.52026.06 | 76.33 | |
| BAGEL-REModel Type=Unified MLLM, Variant=Reasoning Enhancement2025.12 | 75.33 | |
| Visual-OPSD-Noise3-run average=true, Latency (s)=14.92026.06 | 75.33 | |
| BAGELModel Type=Unified MLLM2025.12 | 74.33 | |
| Florence-VL 8B# Vis tok.=5762024.12 | 73.3 | |
| BAGEL-PEModel Type=Unified MLLM, Variant=Perception Enhancement2025.12 | 72.66 | |
| BAGEL-7B3-run average=true2026.06 | 70.33 | |
| BAGELParams=7B+7B, Types=AR+Diff, Architecture Category=Uni. MoE/MoT Arch2025.11 | 69.3 | |
| Phi 3.5 Vision2024.12 | 67.7 | |
| Florence-VL 3B# Vis tok.=5762024.12 | 64.7 | |
| AutoVModel=Qwen2.5-VL 7B2025.06 | 64.3 | |
| AutoVModel=LLaVA-OneVision 7B2025.06 | 64.2 | |
| Janus-Pro-7B3-run average=true2026.06 | 63.33 | |
| Janus-Pro-7BModel Type=Unified MLLM2025.12 | 62.33 | |
| APIModel=Qwen2.5-VL 7B2025.06 | 61.7 | |
| APIModel=LLaVA-OneVision 7B2025.06 | 61.5 | |
| BaseModel=Qwen2.5-VL 7B2025.06 | 61.3 | |
| BaseModel=LLaVA-OneVision 7B2025.06 | 60.7 | |
| Liquid-7BModel Type=Unified MLLM2025.12 | 58.33 | |
| Qwen2.5-VL-7BParameter Scale=7B2025.12 | 54.7 | |
| Cambrian 8B# Vis tok.=5762024.12 | 51.3 | |
| Janus-Pro + AIA (Ours)Params=7B, Types=AR, Architecture Category=Uni. Double Image Encoders / Training Objectives2025.11 | 48 | |
| Chameleon-7B3-run average=true2026.06 | 47.67 | |
| Janus-ProParams=7B, Types=AR, Architecture Category=Uni. Double Image Encoders / Training Objectives2025.11 | 47.3 | |
| LLaVA next 8B# Vis tok.=28802024.12 | 38.7 | |
| CoVFTBackbone=LLaVA-1.5-13B2026.03 | 38.67 | |
| JARVISLLM=Qwen2-7B2025.12 | 38 | |
| BitFitBackbone=LLaVA-1.5-13B2026.03 | 38 | |
| FedAvg-TIEsFederated Learning Setting=M_T-T2026.03 | 37.3 | |
| Fed-CMPFederated Learning Setting=M_T-T2026.03 | 36.9 | |
| LLaVALLM=Qwen2-7B2025.12 | 36.7 | |
| CoVFTBackbone=LLaVA-1.5-7B2026.03 | 36.67 | |
| Emu3-ChatParams=8B, Types=AR, Architecture Category=Und. Only2025.11 | 36.6 | |
| FedAvg-TAFederated Learning Setting=M_T-T2026.03 | 36.6 | |
| MOONFederated Learning Setting=M_T-T2026.03 | 36.4 | |
| VIRALLLM=Qwen2-7B2025.12 | 36 | |
| FedAvg-DAREFederated Learning Setting=M_T-T2026.03 | 36 | |
| Ours w/o MaskingLLM=Qwen2-7B2025.12 | 35.3 | |
| SENTINELModel=LLaVA-1.5-13B2026.06 | 35.3 | |
| ViPSyModel=LLaVA-1.5-13B2026.06 | 35.3 | |
| FedAvgFederated Learning Setting=M_T-T2026.03 | 35.2 | |
| FreezeBackbone=LLaVA-1.5-13B2026.03 | 34 | |
| Full fine-tuningBackbone=LLaVA-1.5-13B2026.03 | 34 | |
| FedAdamFederated Learning Setting=M_T-T2026.03 | 33.9 | |
| HSA-DPOModel=LLaVA-1.5-13B2026.06 | 33.3 | |
| HALVAModel=LLaVA-1.5-13B2026.06 | 32.6 | |
| VanillaModel=LLaVA-1.5-13B2026.06 | 32 | |
| BitFitBackbone=LLaVA-1.5-7B2026.03 | 31.33 | |
| LLaVALLM=Vicuna-7B2025.12 | 31.3 | |
| OPA-DPOModel=LLaVA-1.5-13B2026.06 | 31.3 | |
| JARVISLLM=Vicuna-7B2025.12 | 30.7 | |
| LLaVA-1.5Backbone=LLaVA-1.5-13B2026.03 | 30.67 | |
| ViPSyModel=LLaVA-1.5-7B2026.06 | 30.6 | |
| Local TrainingFederated Learning Setting=M_T-T2026.03 | 30.5 | |
| VIRALLLM=Vicuna-7B2025.12 | 30 | |
| SVPTBackbone=LLaVA-1.5-7B2026.03 | 29.33 | |
| LLaVA-1.5-7BImage Token=576, TFLOPS=10.12024.12 | 29.3 | |
| TPRModel=LLaVA-1.5-7B2026.06 | 29.3 | |
| LoRABackbone=LLaVA-1.5-7B2026.03 | 28.66 | |
| FedProxFederated Learning Setting=M_T-T2026.03 | 28.2 | |
| Ours w/o MaskingLLM=Vicuna-7B2025.12 | 28 | |
| FreezeBackbone=LLaVA-1.5-7B2026.03 | 28 | |
| OPA-DPOModel=LLaVA-1.5-7B2026.06 | 28 | |
| LLaVA-1.5Backbone=LLaVA-1.5-7B2026.03 | 27.33 | |
| Full fine-tuningBackbone=LLaVA-1.5-7B2026.03 | 27.33 | |
| Dynamic-LLaVA-7B†Training-Free=false, Image Token=115 (-80%)2024.12 | 26.3 | |
| VCDModel=LLaVA-1.5-7B2026.06 | 25.3 | |
| POVIDModel=LLaVA-1.5-7B2026.06 | 25.3 | |
| VPTBackbone=LLaVA-1.5-7B2026.03 | 24.67 | |
| EFUFModel=LLaVA-1.5-7B2026.06 | 24.6 | |
| SENTINELModel=LLaVA-1.5-7B2026.06 | 24.6 | |
| LLaVA-FastVTraining-Free=true, Image Token=144 (-75%)2024.12 | 24 | |
| RLAIF-VModel=LLaVA-1.5-7B2026.06 | 24 | |
| VanillaModel=LLaVA-1.5-7B2026.06 | 23.3 | |
| HALVAModel=LLaVA-1.5-7B2026.06 | 23.3 | |
| DOLAModel=LLaVA-1.5-7B2026.06 | 22.6 | |
| OPERAModel=LLaVA-1.5-7B2026.06 | 22.6 | |
| HA-DPOModel=LLaVA-1.5-7B2026.06 | 22.6 | |
| VILA-UParams=7B, Types=AR, Architecture Category=Uni. Purely2025.11 | 22 |