Visual Perception on MMVP
76.67AccuracySCF-VR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SCF-VRParadigm=Latent Reasoning, Data Size=30K, Backbone=Qwen2.5-VL-7B2026.04 | 76.67 | — | |
| MUSE-3B# LLM Params=2B2026.05 | 74.8 | — | |
| LLaVA-OneVisionParadigm=Zero-Shot VLMs, Data Size=9M2026.04 | 74 | — | |
| LaReBase VLM=Qwen3-VL-8B-Instruct2025.11 | 74 | — | |
| UniLIP-3B# LLM Params=2B2026.05 | 73 | — | |
| InternVL3# LLM Params=1.8B2026.05 | 72.7 | — | |
| LVRBase VLM=Qwen3-VL-8B-Instruct2025.11 | 72.7 | — | |
| Vision-R1Paradigm=Tool-use & RL Enhanced Reasoning, Data Size=200K2026.04 | 72.67 | — | |
| VL-RethinkerParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 72.67 | — | |
| CapImagineBase VLM=Qwen3-VL-8B-Instruct2025.11 | 72.4 | — | |
| LaserParadigm=Latent Reasoning, Data Size=267K2026.04 | 72 | — | |
| MUSE-1B# LLM Params=1B2026.05 | 70.5 | — | |
| DMLRParadigm=Latent Reasoning, Data Size=-2026.04 | 70.1 | — | |
| DeepEyesParadigm=Tool-use & RL Enhanced Reasoning, Data Size=47K2026.04 | 70 | — | |
| VLM-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 69.67 | — | |
| Jigsaw-R1Prompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 69.66 | — | |
| ICoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 69.3 | — | |
| MixPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 69 | — | |
| CCoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 69 | — | |
| Bagel-7B-MoTModel Category=Open-source General Models2025.11 | 68.7 | — | |
| GPT-4oParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 68.7 | — | |
| UniLIP-1B# LLM Params=1B2026.05 | 68.7 | — | |
| JigsawPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 68.67 | — | |
| PAPOParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 68.67 | — | |
| Multimodal CoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 68.1 | — | |
| MonetParadigm=Latent Reasoning, Data Size=125K2026.04 | 68 | — | |
| InternVL3# LLM Params=1B2026.05 | 67.3 | — | |
| ThymeBase VLM=Qwen3-VL-8B-Instruct2025.11 | 66.7 | — | |
| SPHINX-13B2026.01 | 66.6 | — | |
| Qwen2.5-VL-7BParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 65.67 | — | |
| SenseNova-SIBase Architecture=Bagel-7B-MoT, Model Category=Ours2025.11 | 65.3 | — | |
| CARPE-MoE2026.01 | 65 | — | |
| CARPE2026.01 | 64 | — | |
| LVRParadigm=Latent Reasoning, Data Size=470K2026.04 | 64 | — | |
| ResDecBase Model=Qwen2.5-VL2026.02 | 63.33 | — | |
| Qwen 2.5 VLPrompting=CoT prompting, Backbone=Qwen-VL-2.5 3B2025.12 | 63.33 | — | |
| LLaVA1.5-7B2026.01 | 63 | — | |
| INTERNVL3-8B + PGTBackbone=INTERNVL3-8B, Data=PGT-augmented2026.05 | 62.7 | — | |
| OPERABase Model=Qwen2.5-VL2026.02 | 61.67 | — | |
| LEVI2026.01 | 61.3 | — | |
| INTERNVL3-8BBackbone=INTERNVL3-8B2026.05 | 60.7 | — | |
| VISTABase Model=Qwen2.5-VL2026.02 | 60.33 | — | |
| VCDBase Model=Qwen2.5-VL2026.02 | 59.67 | — | |
| DoLaBase Model=Qwen2.5-VL2026.02 | 59.33 | — | |
| InternVL3-8BModel Category=Open-source General Models2025.11 | 59.3 | — | |
| WiSE-FT2026.01 | 59 | — | |
| Qwen3-VL-8BModel Category=Open-source General Models2025.11 | 58.7 | — | |
| RegularBase Model=Qwen2.5-VL2026.02 | 58 | — | |
| IMAGE JIGSAWMethod=IMAGE JIGSAW2026.05 | 58 | — | |
| InternVL3.5-8BParadigm=Zero-Shot VLMs, Data Size=70K2026.04 | 57.67 | — | |
| SenseNova-SIBase Architecture=Qwen3-VL-8B, Model Category=Ours2025.11 | 57.3 | — | |
| InternVL3-2BModel Category=Open-source General Models2025.11 | 56.7 | — | |
| LLaVA1.5-7BFine-tuned=ImageNet2026.01 | 56.6 | — | |
| SenseNova-SIBase Architecture=InternVL3-8B, Model Category=Ours2025.11 | 56 | — | |
| ICDBase Model=Qwen2.5-VL2026.02 | 55.33 | — | |
| VST-7B-SFTModel Category=Open-source SI Models2025.11 | 54.7 | — | |
| BAGEL# LLM Params=3B2026.05 | 54.7 | — | |
| Cambrian-S-7BModel Category=Open-source SI Models2025.11 | 54 | — | |
| QWEN2.5-VL-7B + PGTBackbone=QWEN2.5-VL-7B, Data=PGT-augmented2026.05 | 54 | — | |
| QWEN2.5-VL-7BBackbone=QWEN2.5-VL-7B2026.05 | 53.3 | — | |
| QWEN2.5-VL-7B + SPECIALIZED MIXBackbone=QWEN2.5-VL-7B, Data=Specialized Mix2026.05 | 52 | — | |
| InternVL3.5-8B2025.11 | 50.6 | — | |
| MetaMorph# LLM Params=8B2026.05 | 48.3 | — | |
| SPATIAL-LADDER-3BMethod=SPATIAL-LADDER-3B2026.05 | 48.1 | — | |
| Vision-R1Base VLM=Qwen3-VL-8B-Instruct2025.11 | 47.8 | — | |
| SenseNova-SIBase Architecture=InternVL3-2B, Model Category=Ours2025.11 | 47.3 | — | |
| Gemini2.5-Pro2025.11 | 45.5 | — | |
| QWEN2.5-VL-3B + PGTBackbone=QWEN2.5-VL-3B, Data=PGT-augmented2026.05 | 45.3 | — | |
| VIGORL-3BMethod=VIGORL-3B2026.05 | 44.7 | — | |
| LLAVA-NEXT-LLAMA3-8B + PGTBackbone=LLAVA-NEXT-LLAMA3-8B, Data=PGT-augmented2026.05 | 42 | — | |
| QWEN2.5-VL-3B + SPECIALIZED MIXBackbone=QWEN2.5-VL-3B, Data=Specialized Mix2026.05 | 42 | — | |
| LLAVA-NEXT-7B + PGTBackbone=LLAVA-NEXT-7B, Data=PGT-augmented2026.05 | 38.7 | — | |
| LLAVA-NEXT-LLAMA3-8BBackbone=LLAVA-NEXT-LLAMA3-8B2026.05 | 38.7 | — | |
| QWEN2.5-VL-3BBackbone=QWEN2.5-VL-3B2026.05 | 37.3 | — | |
| LLaVA-VTLLM=V-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 36.7 | — | |
| Emu3-Chat# LLM Params=8B2026.05 | 36.6 | — | |
| FedAvg-TASetting=M_Joint2026.03 | 35.2 | — | |
| FedAvg-TIEsSetting=M_Joint2026.03 | 34.3 | — | |
| Fed-CMPSetting=M_Joint2026.03 | 34.3 | — | |
| FedAvgSetting=M_Joint2026.03 | 34.2 | — | |
| MOONSetting=M_Joint2026.03 | 33.8 | — | |
| LLaVA-1.5LLM=V-13B, #PT=558K, #IT=665K, Representation=Visual Embeddings (E)2024.03 | 33.3 | — | |
| FedAdamSetting=M_Joint2026.03 | 33.1 | — | |
| LLAVA-NEXT-7BBackbone=LLAVA-NEXT-7B2026.05 | 32.7 | — | |
| LLaVA-CapLLM=V-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 32 | — | |
| THINKLITE-VLMethod=THINKLITE-VL2026.05 | 32 | — | |
| Local TrainingSetting=M_Joint2026.03 | 31.6 | — | |
| InternVL2.5# LLM Params=1B2026.05 | 31.3 | — | |
| FedAvg-DARESetting=M_Joint2026.03 | 31.2 | — | |
| LLaVA-DCapLLM=V-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 30.7 | — | |
| Janus-pro-7B2025.11 | 30.7 | — | |
| LLaVA-SGLLM=V-13B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 30 | — | |
| FedProxSetting=M_Joint2026.03 | 29.4 | — | |
| Vicuna-VTLLM=V-13B, #IT=665K, Representation=Text-based (T)2024.03 | 26.7 | — | |
| LLaVA-VTLLM=V-7B, #PT=558K, #IT=665K, Representation=E + T2024.03 | 24 | — | |
| ResDecBase Model=LLaVA-1.52026.02 | 24 | — | |
| MemVRBase Model=LLaVA-1.52026.02 | 23.67 | — | |
| VILA-U# LLM Params=7B2026.05 | 22 | — | |
| ONLYBase Model=LLaVA-1.52026.02 | 21.33 | — | |
| OPERABase Model=LLaVA-1.52026.02 | 21 | — |