Multimodal Understanding on AI2D
85.56ScoreInnovator-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Innovator-VLvariant=8B-Instruct, parameters=8B2026.01 | 85.56 | |
| Innovator-VLvariant=8B-Thinking, parameters=8B2026.01 | 85.07 | |
| LLaVA-OVversion=1.5, parameters=8B2026.01 | 84.49 | |
| Qwen3-VLparameters=8B2026.01 | 83.78 | |
| MiniCPM-Vversion=4.5, parameters=8B2026.01 | 83.42 | |
| Qwen-2.5-VL-InstructType=Und. Only, # Params.=7B2026.05 | 82.3 | |
| Qwen2-VLModel Size=7B, Training Strategy=Original2026.02 | 82.2 | |
| InternVL3.5parameters=8B2026.01 | 82.19 | |
| CREM_GModel Size=7B, Training Strategy=Fine-tuned on ShareGPT-4V2026.02 | 81.9 | |
| CREMModel Size=7B, Training Strategy=Unified framework2026.02 | 81.9 | |
| MiMo-VLtraining=7B-SFT, parameters=7B2026.01 | 81.54 | |
| MiMo-VLtraining=7B-RL, parameters=7B2026.01 | 81.51 | |
| CREM_RModel Size=7B, Training Strategy=Trained on MMEB2026.02 | 80.9 | |
| Intern-S1variant=mini, parameters=9B2026.01 | 80.86 | |
| TUNAType=Native Unified, # Params.=7B2026.05 | 79.3 | |
| Show-o2Type=Native Unified, # Params.=7B2026.05 | 78.6 | |
| Qwen2-VLModel Size=2B, Training Strategy=Original2026.02 | 73.8 | |
| CREM_GModel Size=2B, Training Strategy=Fine-tuned on ShareGPT-4V2026.02 | 72.9 | |
| CREMModel Size=2B, Training Strategy=Unified framework2026.02 | 72.8 | |
| ILLUMEType=Composite Unified, # Params.=7B2026.05 | 71.4 | |
| TUNAType=Native Unified, # Params.=1.5B2026.05 | 71.4 | |
| Emu3Type=Native Unified, # Params.=8B2026.05 | 70 | |
| MRoPE-IBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE-I2025.10 | 69.29 | |
| MHRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MHRoPE2025.10 | 68.32 | |
| STARFlow2Type=Native Unified, # Params.=10.6B2026.05 | 67.7 | |
| MRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=MRoPE2025.10 | 67.29 | |
| Vanilla RoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=Vanilla RoPE2025.10 | 66.71 | |
| CREM_RModel Size=2B, Training Strategy=Trained on MMEB2026.02 | 66.7 | |
| CircleRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=CircleRoPE2025.10 | 66.06 | |
| HoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=HoPE2025.10 | 63.46 | |
| VideoRoPEBackbone Model=Qwen3-VL-4B-Instruct, Positional Encoding Variant=VideoRoPE2025.10 | 63.21 | |
| Qwen-VL-ChatType=Und. Only, # Params.=7B2026.05 | 57.7 |