Visual Perception on SeedBench-2-Plus
72AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 72 | |
| ICoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 70.27 | |
| VL-RethinkerParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 70.27 | |
| LaserParadigm=Latent Reasoning, Data Size=267K2026.04 | 70.05 | |
| InternVL3.5-8BParadigm=Zero-Shot VLMs, Data Size=70K2026.04 | 69.78 | |
| DeepEyesParadigm=Tool-use & RL Enhanced Reasoning, Data Size=47K2026.04 | 69.08 | |
| CCoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 68.95 | |
| Vision-R1Paradigm=Tool-use & RL Enhanced Reasoning, Data Size=200K2026.04 | 68.95 | |
| SCF-VRParadigm=Latent Reasoning, Data Size=30K, Backbone=Qwen2.5-VL-7B2026.04 | 66.86 | |
| MonetParadigm=Latent Reasoning, Data Size=125K2026.04 | 65.88 | |
| Qwen2.5-VL-7BParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 65.31 | |
| LLaVA-OneVisionParadigm=Zero-Shot VLMs, Data Size=9M2026.04 | 61.22 | |
| Multimodal CoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 54.11 | |
| PAPOParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 54.11 | |
| LVRParadigm=Latent Reasoning, Data Size=470K2026.04 | 47.39 |