Instruction Following on MM-IFEval
83.1ScoreGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Inference mode=Thinking mode2026.04 | 83.1 | — | |
| Vero Mi-7BRL=MiMoVL, Initial Model=7B-SFT2026.04 | 80.2 | — | |
| Vero Q3T-8BRL=Qwen3VL, Initial Model=8B Think2026.04 | 79.6 | — | |
| GPT-5 NanoRL=N/A, Initial Model=N/A2026.04 | 78 | — | |
| Vero Q3I-8BRL=Qwen3VL, Initial Model=8B Inst2026.04 | 77.7 | — | |
| Gemini 2.5 FlashSize=-, mode=instruct2026.04 | 75.8 | — | |
| Gemini 2.5 FlashInference mode=Thinking mode2026.04 | 75.7 | — | |
| Q3VL 8B-ThkRL=N/A, Initial Model=N/A2026.04 | 75 | — | |
| Qwen3-VLInference mode=Thinking mode, Size=8B2026.04 | 73.5 | — | |
| Qwen3-OmniInference mode=Thinking mode, Size=30B-A3B2026.04 | 69.9 | — | |
| Q3VL 8B-InsRL=N/A, Initial Model=N/A2026.04 | 69.2 | — | |
| MiniCPM-o 4.5Inference mode=Thinking mode, Size=9B2026.04 | 68.2 | — | |
| Vero Q25-7BRL=Qwen25VL, Initial Model=7B Inst2026.04 | 66.5 | — | |
| MiniCPM-o 4.5Size=9B, mode=instruct2026.04 | 66.3 | — | |
| MiMoVL 7B-RLRL=MiMoVL, Initial Model=7B-SFT2026.04 | 66.1 | — | |
| Qwen3-OmniSize=30B-A3B, mode=instruct2026.04 | 65.7 | — | |
| LoMoModel=LLaVA-OV1.5-8B, Evaluation Protocol=Standard Evaluation2026.05 | 61.61 | — | |
| Qwen3-VLSize=8B, mode=instruct2026.04 | 59.4 | — | |
| Standard SFTModel=LLaVA-OV1.5-8B, Evaluation Protocol=Standard Evaluation2026.05 | 58.4 | — | |
| LoMoModel=Qwen3.5-9B, Evaluation Protocol=Standard Evaluation2026.05 | 57.23 | — | |
| ACPOModel Scale=14B, Base Model=InternVL32026.03 | 57 | — | |
| InternVL3.5Size=8B, mode=instruct2026.04 | 56.3 | — | |
| Mo2-O 7BRL=SFT Only, Initial Model=N/A2026.04 | 54.4 | — | |
| LoMoModel=Qwen3.5-9B, Evaluation Protocol=Rendered Evaluation2026.05 | 54.32 | — | |
| Q25VL 7B-InsRL=N/A, Initial Model=N/A2026.04 | 53.6 | — | |
| ACPOModel Scale=8B, Base Model=InternVL32026.03 | 53.3 | — | |
| β-DPOModel Scale=14B, Base Model=InternVL32026.03 | 53 | — | |
| SimPOModel Scale=14B, Base Model=InternVL32026.03 | 52 | — | |
| Standard SFTModel=Qwen3.5-9B, Evaluation Protocol=Standard Evaluation2026.05 | 51.74 | — | |
| DPOModel Scale=14B, Base Model=InternVL32026.03 | 50 | — | |
| DPO-ShiftModel Scale=14B, Base Model=InternVL32026.03 | 50 | — | |
| InstructModel Scale=8B, Base Model=InternVL32026.03 | 49.3 | — | |
| DPO-ShiftModel Scale=8B, Base Model=InternVL32026.03 | 49.2 | — | |
| LoMoModel=LLaVA-OV1.5-8B, Evaluation Protocol=Rendered Evaluation2026.05 | 48.83 | — | |
| IPOModel Scale=14B, Base Model=InternVL32026.03 | 48.8 | — | |
| DPOModel Scale=8B, Base Model=InternVL32026.03 | 48.7 | — | |
| InstructModel Scale=14B, Base Model=InternVL32026.03 | 48 | — | |
| IPOModel Scale=8B, Base Model=InternVL32026.03 | 46.8 | — | |
| β-DPOModel Scale=8B, Base Model=InternVL32026.03 | 46.7 | — | |
| LFM2-VL-1.6B# Total Params=1.6B2025.11 | 46.35 | — | |
| Standard SFTModel=Qwen3.5-9B, Evaluation Protocol=Rendered Evaluation2026.05 | 41.25 | — | |
| SimPOModel Scale=8B, Base Model=InternVL32026.03 | 39.6 | — | |
| InternVL3.5-1B# Total Params=1.1B2025.11 | 36.17 | — | |
| LFM2-VL-450M# Total Params=0.45B2025.11 | 33.09 | — | |
| Standard SFTModel=LLaVA-OV1.5-8B, Evaluation Protocol=Rendered Evaluation2026.05 | 28.83 | — | |
| SmolVLM2-500M# Total Params=0.5B2025.11 | 11.56 | — | |
| InternVL3.5-2B# Total Params=2.3B, Evaluation Toolkit=VLMEvalKit2025.11 | — | 47.31 | |
| LFM2-VL-3B# Total Params=3.0B, Evaluation Toolkit=VLMEvalKit2025.11 | — | 51.83 | |
| Qwen2.5-VL-3B# Total Params=3.75B, Evaluation Toolkit=VLMEvalKit2025.11 | — | 38.62 | |
| Qwen3-VL-2B# Total Params=2.1B, Evaluation Toolkit=VLMEvalKit2025.11 | — | 51.35 | |
| SmolVLM2-2.2B# Total Params=2.2B, Evaluation Toolkit=VLMEvalKit2025.11 | — | 19.42 |