Multimodal Understanding on Real-world LVLM Benchmarks Aggregate 80% (test)
81.42MCQ AccuracyQwen2-VL-VCD
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2-VL-VCDBase Model=Qwen2-VL, Inference Strategy=VCD2026.03 | 81.42 | 78.58 | 80.86 | |
| Qwen2-VL-SCI5Base Model=Qwen2-VL, Inference Strategy=SCI52026.03 | 81.39 | 79.31 | 80.98 | |
| Qwen2-VL-TIEBase Model=Qwen2-VL, Inference Strategy=TIE2026.03 | 81.3 | 78.43 | 80.73 | |
| Qwen2-VL-M3IDBase Model=Qwen2-VL, Inference Strategy=M3ID2026.03 | 81.25 | 78.31 | 80.67 | |
| Qwen2-VLBase Model=Qwen2-VL2026.03 | 80.91 | 79.27 | 80.58 | |
| LLaVA-NeXT-VCDBase Model=LLaVA-NeXT, Inference Strategy=VCD2026.03 | 70.44 | 71.55 | 70.66 | |
| LLaVA-NeXT-TIEBase Model=LLaVA-NeXT, Inference Strategy=TIE2026.03 | 70.36 | 70.68 | 70.42 | |
| LLaVA-NeXT-M3IDBase Model=LLaVA-NeXT, Inference Strategy=M3ID2026.03 | 70.36 | 71.86 | 70.66 | |
| LLaVA-NeXT-SCI5Base Model=LLaVA-NeXT, Inference Strategy=SCI52026.03 | 70.32 | 72.7 | 70.79 | |
| LLaVA-NeXTBase Model=LLaVA-NeXT2026.03 | 70.12 | 71.86 | 70.46 |