Visual Search on V*
92.67AccuracyDynamo + RL
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Dynamo + RLBackbone=Qwen2.5-VL-7B2026.06 | 92.67 | — | — | — | — | — | — | — | — | |
| DeepEyesCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Visually-grounded2025.09 | 90.1 | — | — | 53.72 | — | — | — | — | — | |
| Chain-of-FocusCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 88 | — | — | 50.94 | — | — | — | — | — | |
| ViGoRL-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 86.4 | — | — | 50.53 | — | — | — | — | — | |
| DynamoBackbone=Qwen2.5-VL-7B2026.06 | 85.86 | — | — | — | — | — | — | — | — | |
| Visual Para-Thinker++Size=7B2026.06 | 85.7 | — | — | — | — | — | — | — | — | |
| Dynamo + RLBackbone=Qwen2.5-VL-3B2026.06 | 85.34 | — | — | — | — | — | — | — | — | |
| RLBackbone=Qwen2.5-VL-7B2026.06 | 84.82 | — | — | — | — | — | — | — | — | |
| DynamoBackbone=Qwen2.5-VL-3B2026.06 | 84.29 | — | — | — | — | — | — | — | — | |
| InterSketch2026.05 | 83.8 | — | — | — | — | — | — | — | — | |
| AdaVaR-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Adaptive2025.09 | 83.4 | — | — | 55.82 | — | — | — | — | — | |
| MiMo-EmbodiedParams=7B2025.11 | 82.72 | — | — | — | — | — | — | — | — | |
| Thyme-7B2026.05 | 82.2 | — | — | — | — | — | — | — | — | |
| Visual Para-ThinkerSize=7B2026.06 | 82.2 | — | — | — | — | — | — | — | — | |
| DeepEyeV2-7B2026.05 | 81.8 | — | — | — | — | — | — | — | — | |
| MiMo-VLParams=7B2025.11 | 81.68 | — | — | — | — | — | — | — | — | |
| Visual Para-Thinker++Size=3B2026.06 | 80 | — | — | — | — | — | — | — | — | |
| DirectBackbone=Qwen2.5-VL-7B2026.06 | 79.06 | — | — | — | — | — | — | — | — | |
| GPT5-miniSize=-2026.06 | 78.6 | — | — | — | — | — | — | — | — | |
| VLAA-Thinker-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Text-based2025.09 | 78.5 | — | — | 54.2 | — | — | — | — | — | |
| GRPOSize=7B2026.06 | 78.4 | — | — | — | — | — | — | — | — | |
| ViGoRL-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 78.1 | — | — | 45.7 | — | — | — | — | — | |
| RLBackbone=Qwen2.5-VL-3B2026.06 | 78.01 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 78 | — | — | 50.9 | — | — | — | — | — | |
| Orsta-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 78 | — | — | 52.04 | — | — | — | — | — | |
| AdaVaR-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B, Reasoning Mode=Adaptive2025.09 | 77 | — | — | 50.84 | — | — | — | — | — | |
| Qwen2.5-VLSize=72B2026.06 | 76.9 | — | — | — | — | — | — | — | — | |
| Gemini2.5-ProSize=-2026.06 | 76.7 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B2026.05 | 76.4 | — | — | — | — | — | — | — | — | |
| Sequential (SFT)Size=7B2026.06 | 76.1 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLSize=7B2026.06 | 75.9 | — | — | — | — | — | — | — | — | |
| Visual Para-ThinkerSize=3B2026.06 | 75.9 | — | — | — | — | — | — | — | — | |
| Majority voting@4Size=7B2026.06 | 75.6 | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7BCategory=SFT & Close-source Models, Parameter Size=7B2025.09 | 75.4 | — | — | — | — | — | — | — | — | |
| LMM-R1Category=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 74.9 | — | — | 48.8 | — | — | — | — | — | |
| GPT-4oParams=–2025.11 | 73.9 | — | — | — | — | — | — | — | — | |
| GPT-4oSize=-2026.06 | 73.9 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLParams=7B2025.11 | 73.8 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 73.5 | — | — | 45.74 | — | — | — | — | — | |
| Qwen3-VL-8B2026.05 | 73 | — | — | — | — | — | — | — | — | |
| InternVL3Params=8B2025.11 | 72.8 | — | — | — | — | — | — | — | — | |
| GRIT-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 72.3 | — | — | 45.8 | — | — | — | — | — | |
| DirectBackbone=Qwen2.5-VL-3B2026.06 | 71.2 | — | — | — | — | — | — | — | — | |
| GRPOSize=3B2026.06 | 70.4 | — | — | — | — | — | — | — | — | |
| ThinkMorph-7B2026.05 | 67 | — | — | — | — | — | — | — | — | |
| GPT-4oCategory=SFT & Close-source Models2025.09 | 66 | — | — | 53.2 | — | — | — | — | — | |
| Sequential (SFT)Size=3B2026.06 | 65 | — | — | — | — | — | — | — | — | |
| Majority voting@4Size=3B2026.06 | 64.7 | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLSize=3B2026.06 | 63.3 | — | — | — | — | — | — | — | — | |
| OVR-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Text-based2025.09 | 62.5 | — | — | 55.76 | — | — | — | — | — | |
| MM-EurekaCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 59.7 | — | — | 52.52 | — | — | — | — | — | |
| VLAA-Thinker-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B, Reasoning Mode=Text-based2025.09 | 56 | — | — | 46.7 | — | — | — | — | — | |
| Claude-4-SonnetSize=-2026.06 | 45 | — | — | — | — | — | — | — | — | |
| Chain-of-FocusE2E=false, Param=7B2025.12 | — | — | — | 88 | — | — | — | — | — | |
| DeepeyesE2E=true, Param=7B2025.12 | — | 90.43 | 84.21 | 87.96 | — | — | — | — | — | |
| DeepEyes#Param=7B, Tool Capability=true2026.04 | — | — | — | — | 87.43 | — | — | 91.3 | 81.58 | |
| DyfoE2E=false, Param=7B2025.12 | — | — | — | 81.2 | — | — | — | — | — | |
| GPT-4o2025.12 | — | — | — | 66 | — | — | — | — | — | |
| IMAgentE2E=true, Param=7B2025.12 | — | 88.7 | 88.16 | 88.48 | — | — | — | — | — | |
| Jigsaw-R1#Param=3B2026.04 | — | — | — | — | 69.63 | — | — | 72.17 | 65.79 | |
| LLaVA-OneVisionParam=7B2025.12 | — | 75.7 | 75 | 75.4 | — | — | — | — | — | |
| LMM-R1#Param=3B2026.04 | — | — | — | — | 49.21 | — | — | 46.09 | 53.95 | |
| LVRModel Architecture=Qwen2.5-VL-3B-Instruct, Training Regime=4 steps2026.04 | — | — | — | — | 64.9 | 69.6 | 60.5 | — | — | |
| MM-Eureka#Param=7B2026.04 | — | — | — | — | 48.17 | — | — | 42.61 | 56.58 | |
| No fine-tuningModel Architecture=Qwen2.5-VL-3B-Instruct, Training Regime=Zero-shot2026.04 | — | — | — | — | 56 | 53 | 60.5 | — | — | |
| No fine-tuningModel Architecture=Qwen3-VL-4B-Instruct, Training Regime=Zero-shot2026.04 | — | — | — | — | 81.2 | 86.1 | 73.7 | — | — | |
| OpenVLThinker#Param=7B2026.04 | — | — | — | — | 78.01 | — | — | 76.52 | 80.26 | |
| PEARLModel Architecture=Qwen2.5-VL-3B-Instruct, Training Regime=LVR data2026.04 | — | — | — | — | 73.8 | 82.6 | 60.5 | — | — | |
| PEARLModel Architecture=Qwen2.5-VL-3B-Instruct, Training Regime=PixelReasoner data2026.04 | — | — | — | — | 69.6 | 78.3 | 56.6 | — | — | |
| PEARLModel Architecture=Qwen2.5-VL-3B-Instruct, Training Regime=ThinkMorph data2026.04 | — | — | — | — | 62.8 | 69.6 | 52.6 | — | — | |
| PEARLModel Architecture=Qwen3-VL-4B-Instruct, Training Regime=LVR data2026.04 | — | — | — | — | 81.7 | 85.2 | 76.3 | — | — | |
| PEARLModel Architecture=Qwen3-VL-4B-Instruct, Training Regime=PixelReasoner data2026.04 | — | — | — | — | 79.6 | 82.6 | 75 | — | — | |
| PEARLModel Architecture=Qwen3-VL-4B-Instruct, Training Regime=ThinkMorph data2026.04 | — | — | — | — | 75.4 | 81.7 | 65.8 | — | — | |
| Perception-R1#Param=3B2026.04 | — | — | — | — | 53.92 | — | — | 57.39 | 48.68 | |
| Perceval#Param=3B, Base Model=Qwen2.5-VL2026.04 | — | — | — | — | 83.25 | — | — | 90.43 | 72.37 | |
| Perceval#Param=7B, Base Model=Qwen2.5-VL2026.04 | — | — | — | — | 86.39 | — | — | 86.09 | 86.84 | |
| Pixel ReasonerE2E=false, Param=7B2025.12 | — | 91.3 | 77.63 | 85.86 | — | — | — | — | — | |
| Pixel-Reasoner#Param=7B, Tool Capability=true2026.04 | — | — | — | — | 84.3 | — | — | — | — | |
| Qwen2.5-VLParam=7B2025.12 | — | 79.13 | 73.68 | 76.96 | — | — | — | — | — | |
| Qwen2.5-VL#Param=3B2026.04 | — | — | — | — | 60.73 | — | — | 57.39 | 65.79 | |
| Qwen2.5-VL#Param=7B2026.04 | — | — | — | — | 62.3 | — | — | 60.87 | 64.47 | |
| Qwen2.5-VL + GRPO#Param=3B2026.04 | — | — | — | — | 80.1 | — | — | 86.95 | 69.73 | |
| Qwen2.5-VL + GRPO#Param=7B2026.04 | — | — | — | — | 84.29 | — | — | 85.22 | 82.89 | |
| Qwen2.5-VL-CoTParam=7B2025.12 | — | 73.91 | 76.32 | 74.86 | — | — | — | — | — | |
| R1-VL#Param=2B2026.04 | — | — | — | — | 58.64 | — | — | 59.13 | 57.89 | |
| R1-VL#Param=7B2026.04 | — | — | — | — | 55.5 | — | — | 47.83 | 67.11 | |
| SEALE2E=false, Param=7B2025.12 | — | — | — | 75.4 | — | — | — | — | — | |
| VL-Rethinker#Param=7B2026.04 | — | — | — | — | 56.54 | — | — | 54.78 | 59.21 | |
| VLAA-Thinker#Param=7B2026.04 | — | — | — | — | 47.12 | — | — | 43.47 | 52.63 | |
| VLM-R1#Param=3B2026.04 | — | — | — | — | 72.25 | — | — | 75.65 | 67.11 | |
| ZoomeyeE2E=false, Param=7B2025.12 | — | 93.9 | 85.5 | 90.6 | — | — | — | — | — |