Visual Reasoning on MMVP
86.3AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oVisual Sketchpad=Enabled2024.06 | 86.3 | |
| GPT-4oVisual Sketchpad=Disabled2024.06 | 85.3 | |
| One-step Latent Pred.Reasoning Paradigm=Latent-Space Reasoning, Reasoning Space=Latent2026.07 | 79.33 | |
| ProLaViT (Full)Reasoning Paradigm=Progressive Latent Visual Thought, Reasoning Space=Latent, Training Strategy=Distance-Weighted Diversity Loss2026.07 | 79 | |
| CoVTReasoning Paradigm=Latent-Space Reasoning, Reasoning Space=Latent2026.07 | 78.33 | |
| ProLaViT + L_div^marginReasoning Paradigm=Progressive Latent Visual Thought, Reasoning Space=Latent2026.07 | 78.33 | |
| ProLaViT (Base)Reasoning Paradigm=Progressive Latent Visual Thought, Reasoning Space=Latent2026.07 | 78 | |
| CoT SFTReasoning Paradigm=Text-Space Reasoning, Reasoning Space=Text2026.07 | 77.66 | |
| Qwen2.5-VL-InstructReasoning Paradigm=Base Model, Reasoning Space=N/A2026.07 | 77.33 | |
| LVRReasoning Paradigm=Latent-Space Reasoning, Reasoning Space=Latent2026.07 | 77.3 | |
| SFTReasoning Paradigm=Text-Space Reasoning, Reasoning Space=Text2026.07 | 77 | |
| LLaVA-OneVisionReasoning Paradigm=Zero-Shot VLMs2026.01 | 74 | |
| RIS+VLPOBackbone=Qwen2.5-VL-7B, Latent Tokens=5, Optimization=Visual-latent Policy Optimization (VLPO)2026.05 | 73.76 | |
| RISBackbone=Qwen2.5-VL-7B, Latent Tokens=52026.05 | 73.55 | |
| GPT-4 TurboVisual Sketchpad=Enabled2024.06 | 73.3 | |
| Unsilencing Latent ReasoningBackbone=Qwen2.5VL-7B2026.05 | 73 | |
| Vision-R1Reasoning Paradigm=Tool-use & RL Enhanced Reasoning2026.01 | 72.67 | |
| VL-RethinkerReasoning Paradigm=Tool-use & RL Enhanced Reasoning2026.01 | 72.67 | |
| CoVTBackbone=Qwen2.5VL-7B2026.05 | 72.67 | |
| LaserReasoning Paradigm=Latent Reasoning2026.01 | 72 | |
| GPT-4oModel Type=Proprietary2026.05 | 72 | |
| LVRBackbone=Qwen2.5-VL-7B, Latent Tokens=52026.05 | 71.03 | |
| GPT-4 TurboVisual Sketchpad=Disabled2024.06 | 71 | |
| DeepEyesReasoning Paradigm=Tool-use & RL Enhanced Reasoning2026.01 | 70 | |
| DMLRBackbone=Qwen2.5VL-7B2026.05 | 70 | |
| MonetBackbone=Qwen2.5-VL-7B, Latent Tokens=52026.05 | 70 | |
| LVRRFBackbone=Qwen2.5VL-7B2026.05 | 69.67 | |
| ICoTBackbone=Qwen2.5VL-7B2026.05 | 69.33 | |
| CCoTBackbone=Qwen2.5VL-7B2026.05 | 69 | |
| LVRBackbone=Qwen2.5VL-7B2026.05 | 69 | |
| GPT-4oReasoning Paradigm=Zero-Shot VLMs2026.01 | 68.7 | |
| PAPOReasoning Paradigm=Tool-use & RL Enhanced Reasoning2026.01 | 68.67 | |
| VanillaBackbone=Qwen2.5VL-7B2026.05 | 68.67 | |
| MonetReasoning Paradigm=Latent Reasoning2026.01 | 68 | |
| MCoTBackbone=Qwen2.5VL-7B2026.05 | 68 | |
| Qwen2.5-VL-7B+GLSDBackbone=Qwen2.5-VL-7B, Training=Grounded Latent Supervision Dataset (GLSD)2026.05 | 66.8 | |
| Qwen2.5-VL-7BReasoning Paradigm=Zero-Shot VLMs2026.01 | 65.67 | |
| MonetBackbone=Qwen2.5VL-7B2026.05 | 65.67 | |
| LVRReasoning Paradigm=Latent Reasoning2026.01 | 64 | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B2026.05 | 63.49 | |
| Unsilencing Latent ReasoningBackbone=Qwen2.5VL-3B2026.05 | 59.33 | |
| CoVTBackbone=Qwen2.5-VL-7B, Latent Tokens=52026.05 | 58.7 | |
| LVRBackbone=Qwen2.5VL-3B2026.05 | 58.67 | |
| LVRRFBackbone=Qwen2.5VL-3B2026.05 | 58.33 | |
| InternVL3.5-8BReasoning Paradigm=Zero-Shot VLMs2026.01 | 57.67 | |
| DMLRBackbone=Qwen2.5VL-3B2026.05 | 56.67 | |
| ICoTBackbone=Qwen2.5VL-3B2026.05 | 56 | |
| VanillaBackbone=Qwen2.5VL-3B2026.05 | 55.67 | |
| CCoTBackbone=Qwen2.5VL-3B2026.05 | 55.33 | |
| MCoTBackbone=Qwen2.5VL-3B2026.05 | 54.33 | |
| SOTA [10]2024.06 | 49.3 | |
| LEADBase Model=OpenVLThinker-7B, Decoding Strategy=LEAD2026.03 | 47.2 | |
| LEADBase Model=VL-Rethinker-7B, Decoding Strategy=LEAD2026.03 | 46.6 | |
| OpenVLThinker-7BDecoding Strategy=Standard2026.03 | 46.5 | |
| LEADBase Model=Vision-R1-7B, Decoding Strategy=LEAD2026.03 | 46.3 | |
| LEADBase Model=R1-Onevision-7B, Decoding Strategy=LEAD2026.03 | 45 | |
| MemVRBase Model=R1-Onevision-7B, Decoding Strategy=MemVR2026.03 | 44.5 | |
| Vision-R1-7BDecoding Strategy=Standard2026.03 | 44 | |
| SIDBase Model=R1-Onevision-7B, Decoding Strategy=SID2026.03 | 43.2 | |
| R1-Onevision-7BDecoding Strategy=Standard2026.03 | 43 | |
| VCDBase Model=R1-Onevision-7B, Decoding Strategy=VCD2026.03 | 42.9 | |
| VL-Rethinker-7BDecoding Strategy=Standard2026.03 | 42 | |
| LEADBase Model=VL-Cogito-7B, Decoding Strategy=LEAD2026.03 | 42 | |
| Gemini-Pro2024.06 | 40.7 | |
| VL-Cogito-7BDecoding Strategy=Standard2026.03 | 40 | |
| GPT-4V-preview2024.06 | 38.7 | |
| LLaVA-1.5-13B2024.06 | 24.7 |