Visual Question Answering on MM-Vet
75.8MM-Vet ASR AccuracyMiMo-VL-7B +PC
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MiMo-VL-7B +PCBackbone Model=MiMo-VL-7B, Training Paradigm (+PC)=Yes2026.03 | 75.8 | — | |
| Qwen2.5-VL-7B +PCBackbone Model=Qwen2.5-VL-7B, Training Paradigm (+PC)=Yes2026.03 | 74.2 | — | |
| LocoREBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=LocoRE2026.01 | 73.1 | — | |
| Qwen2.5-VL-32BBackbone=Qwen2.5-VL, Model Size=32B, Inference Strategy=Base2026.01 | 72.2 | — | |
| MiMo-VL-7BBackbone Model=MiMo-VL-7B, Training Paradigm (+PC)=No2026.03 | 72.2 | — | |
| Qwen2.5-VL-7BBackbone Model=Qwen2.5-VL-7B, Training Paradigm (+PC)=No2026.03 | 69.7 | — | |
| SGRS + LocoREBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 67.7 | — | |
| SGRS + LocoREBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 66.2 | — | |
| LocoREBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 64.8 | — | |
| LocoREBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 64.8 | — | |
| Qwen2-VL-7BBackbone=Qwen2-VL, Model Size=7B, Inference Strategy=Base2026.01 | 63.2 | — | |
| Qwen2.5-VL-3B +PCBackbone Model=Qwen2.5-VL-3B, Training Paradigm (+PC)=Yes2026.03 | 63.2 | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL, Model Size=7B, Inference Strategy=Base2026.01 | 62.2 | — | |
| Qwen2.5-VL-3BBackbone Model=Qwen2.5-VL-3B, Training Paradigm (+PC)=No2026.03 | 60 | — | |
| SGRS + LocoREBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=SGRS + LocoRE2026.01 | 42 | — | |
| LocoREBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=LocoRE2026.01 | 38.4 | — | |
| SGRS + LocoREBackbone=Intern-VL, Model Size=13B, Inference Strategy=SGRS + LocoRE2026.01 | 37.3 | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5, Model Size=13B, Inference Strategy=Base2026.01 | 36.1 | — | |
| SGRS + LocoREBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 36 | — | |
| LocoREBackbone=Intern-VL, Model Size=13B, Inference Strategy=LocoRE2026.01 | 35.4 | — | |
| SGRS + LocoREBackbone=Intern-VL, Model Size=7B, Inference Strategy=SGRS + LocoRE2026.01 | 35 | — | |
| LocoREBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=LocoRE2026.01 | 33.8 | — | |
| LocoREBackbone=Intern-VL, Model Size=7B, Inference Strategy=LocoRE2026.01 | 33.7 | — | |
| Intern-VL-13BBackbone=Intern-VL, Model Size=13B, Inference Strategy=Base2026.01 | 33.7 | — | |
| LLaVA-1.5-7B + VissinkBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=Vissink2026.01 | 33.5 | — | |
| LLaVA-1.5-7B + FarSightBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=FarSight2026.01 | 32.5 | — | |
| LLaVA-1.5-7B + OPERABackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=OPERA2026.01 | 31.4 | — | |
| LLaVA-1.5-7B + SIDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=SID2026.01 | 31.2 | — | |
| Intern-VL-7BBackbone=Intern-VL, Model Size=7B, Inference Strategy=Base2026.01 | 31.2 | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=Base2026.01 | 30.5 | — | |
| LLaVA-1.5-7B + TAMEBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=TAME2026.01 | 30.5 | — | |
| LLaVA-1.5-7B + ICDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=ICD2026.01 | 30.4 | — | |
| LLaVA-1.5-7B + VCDBackbone=LLaVA-1.5, Model Size=7B, Inference Strategy=VCD2026.01 | 29.5 | — | |
| CPGC-UAPTarget Model=Mantis-CLIP2026.01 | — | 50.32 | |
| CPGC-UAPTarget Model=VILA - 1.52026.01 | — | 48.27 | |
| CPGC-UAPTarget Model=MiniGPT42026.01 | — | 44.75 | |
| Doubly-UAPTarget Model=Mantis-CLIP2026.01 | — | 50.21 | |
| Doubly-UAPTarget Model=VILA - 1.52026.01 | — | 49.13 | |
| Doubly-UAPTarget Model=MiniGPT42026.01 | — | 47.67 | |
| Jailbreak-MLLMTarget Model=Mantis-CLIP2026.01 | — | 48.21 | |
| Jailbreak-MLLMTarget Model=VILA - 1.52026.01 | — | 17.24 | |
| Jailbreak-MLLMTarget Model=MiniGPT42026.01 | — | 12.24 | |
| LAMPTarget Model=Mantis-CLIP2026.01 | — | 73.45 | |
| LAMPTarget Model=VILA - 1.52026.01 | — | 72.54 | |
| LAMPTarget Model=MiniGPT42026.01 | — | 68.54 |