Compositional Reasoning on MMStar
64.7AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 64.7 | |
| VL-RethinkerParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 63.2 | |
| Vision-R1Paradigm=Tool-use & RL Enhanced Reasoning, Data Size=200K2026.04 | 62.67 | |
| SCF-VRParadigm=Latent Reasoning, Data Size=30K, Backbone=Qwen2.5-VL-7B2026.04 | 60.82 | |
| ICoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 60.4 | |
| MonetParadigm=Latent Reasoning, Data Size=125K2026.04 | 60.33 | |
| DMLRParadigm=Latent Reasoning, Data Size=-2026.04 | 60.27 | |
| LaserParadigm=Latent Reasoning, Data Size=267K2026.04 | 60.1 | |
| Qwen2.5-VL-7BParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 59.7 | |
| LLaVA-OneVisionParadigm=Zero-Shot VLMs, Data Size=9M2026.04 | 59.13 | |
| DeepEyesParadigm=Tool-use & RL Enhanced Reasoning, Data Size=47K2026.04 | 58.73 | |
| CCoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 58.7 | |
| LVRParadigm=Latent Reasoning, Data Size=470K2026.04 | 57.93 | |
| Multimodal CoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 57.9 | |
| InternVL3.5-8BParadigm=Zero-Shot VLMs, Data Size=70K2026.04 | 53.33 | |
| PAPOParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 45.8 |