Visual Reasoning on BLINK (Granular Metrics)
99Jigsaw AccuracyHuman
Evaluation Results
| Method | Links | ||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Human2026.04 | 99 | — | — | 96.07 | 99.42 | — | — | 92.48 | — | 98 | — | — | — | — | |
| P2Backbone=Gemini 2.5 Pro, Shots=Zero-Shot, Learning Mode=Training-free2026.04 | 96.67 | — | — | 74.1 | 96.51 | — | — | 63.91 | 77.68 | 77.05 | — | — | — | — | |
| SEVEXinf. cost (Average)=13752026.03 | 95.8 | 85.1 | 86.7 | 63.3 | 89.4 | 84.1 | 78.9 | — | — | — | — | — | — | — | |
| P2Backbone=GPT-5 Mini, Shots=Zero-Shot, Learning Mode=Training-free2026.04 | 91.33 | — | — | 64.03 | 94.19 | — | — | 86.47 | 81.45 | 93.44 | — | — | — | — | |
| P2Backbone=InternVL3.5-4B, Shots=One-Shot, Learning Mode=Training-free2026.04 | 90.67 | — | — | 62.59 | 86.04 | — | — | 94.73 | 69.89 | 90.16 | — | — | — | — | |
| Gemini 2.5 ProSetting=Raw Tool, Shots=Zero-Shot, Learning Mode=Training-free2026.04 | 88 | — | — | 66.19 | 91.86 | — | — | 33.83 | 61.83 | 57.38 | — | — | — | — | |
| P2Backbone=Qwen3VL-4B, Shots=One-Shot, Learning Mode=Training-free2026.04 | 86.67 | — | — | 64.03 | 88.37 | — | — | 93.98 | 61.02 | 85.25 | — | — | — | — | |
| Gemini-2.5-ProModel Type=Closed-source2026.05 | 85.3 | — | 90.2 | — | — | 74.6 | — | 50.4 | — | — | 85.5 | 78.3 | 89.4 | 43.3 | |
| P2Backbone=InternVL3.5-2B, Shots=One-Shot, Learning Mode=Training-free2026.04 | 83.33 | — | — | 46.04 | 39.53 | — | — | 69.17 | 32.25 | 55.74 | — | — | — | — | |
| InternVL3.5-4BSetting=Standard, Shots=One-Shot2026.04 | 80 | — | — | 45.32 | 65.69 | — | — | 45.86 | 40.59 | 56.56 | — | — | — | — | |
| Visual SketchpadLearning Mode=Training-free, Backbone=GPT-5 Mini, Codebase=Official2026.04 | 79.33 | — | — | 60.43 | 91.86 | — | — | 47.37 | 63.71 | 67.21 | — | — | — | — | |
| Qwen3VL-4BSetting=Instruct, Shots=One-Shot2026.04 | 79.33 | — | — | 59.71 | 80.23 | — | — | 39.84 | 41.66 | 54.1 | — | — | — | — | |
| Gemini 2.5 ProSetting=Standard, Shots=Zero-Shot, Learning Mode=Training-free2026.04 | 78 | — | — | 64.03 | 91.86 | — | — | 48.12 | 57.79 | 70.49 | — | — | — | — | |
| GPT-5 MiniSetting=Standard, Shots=Zero-Shot, Learning Mode=Training-free2026.04 | 76 | — | — | 53.24 | 76.74 | — | — | 41.35 | 52.42 | 58.2 | — | — | — | — | |
| Naiveinf. cost (Average)=12402026.03 | 75.8 | 83 | 81.4 | 55 | 87.3 | 76.5 | 71.6 | — | — | — | — | — | — | — | |
| LATTELearning Mode=Fine-tuned2026.04 | 75.33 | — | — | 33.09 | 29.65 | — | — | 48.87 | — | 47.54 | — | — | — | — | |
| MMFactoryLearning Mode=Training-free, Backbone=GPT-4o2026.04 | 75.3 | — | — | 58.3 | 85.5 | — | — | 60.2 | — | 59 | — | — | — | — | |
| SketchPadinf. cost (Average)=156212026.03 | 70.8 | 85.1 | 85.8 | 58.7 | 90.9 | 78.3 | 64.6 | — | — | — | — | — | — | — | |
| Visual SketchpadLearning Mode=Training-free, Backbone=GPT-4o2026.04 | 70.7 | — | — | 58.3 | 80.8 | — | — | 45.6 | — | 65.4 | — | — | — | — | |
| InternVL3.5-4BSetting=Raw Tool, Shots=One-Shot2026.04 | 66.67 | — | — | 44.6 | 64.53 | — | — | 75.18 | 37.9 | 54.92 | — | — | — | — | |
| GPT-5 MiniSetting=Raw Tool, Shots=Zero-Shot, Learning Mode=Training-free2026.04 | 66 | — | — | 53.24 | 75.58 | — | — | 45.11 | 65.05 | 59.02 | — | — | — | — | |
| CapImaginebackbone=Qwen2.5-VL-7B2026.02 | 64.7 | — | — | — | — | — | — | 49.6 | — | — | — | — | — | — | |
| Qwen3VL-4BSetting=Standard, Shots=One-Shot2026.04 | 64.67 | — | — | 61.87 | 86.62 | — | — | 45.9 | 47.04 | 54.92 | — | — | — | — | |
| Qwen2.5VL-7Bbackbone=Qwen2.5VL-7B2026.02 | 62.7 | — | — | — | — | — | — | 42.9 | — | — | — | — | — | — | |
| InternVL3.5-2BSetting=Raw Tool, Shots=One-Shot2026.04 | 62 | — | — | 34.53 | 41.86 | — | — | 56.39 | 25 | 50 | — | — | — | — | |
| InternVL3.5-2BSetting=Standard, Shots=One-Shot2026.04 | 61.33 | — | — | 33.81 | 34.88 | — | — | 49.62 | 29.57 | 47.54 | — | — | — | — | |
| Qwen3VL-4BSetting=Raw Tool, Shots=One-Shot2026.04 | 60.66 | — | — | 62.58 | 76.16 | — | — | 67.66 | 42.4 | 45.9 | — | — | — | — | |
| CapImaginebackbone=Qwen2.5-VL-7B, rewriting=false2026.02 | 59.3 | — | — | — | — | — | — | 42.9 | — | — | — | — | — | — | |
| ThymeLearning Mode=Fine-tuned2026.04 | 58 | — | — | 39.57 | 63.95 | — | — | 51.88 | 35.21 | 48.36 | — | — | — | — | |
| ATLASGRPOTraining=GRPO2026.05 | 57.7 | — | 70.6 | — | — | 50.5 | — | 43.6 | — | — | 57.3 | 61.7 | 34.1 | 26 | |
| BagelModel Type=Unified2026.05 | 57.3 | — | 69.2 | — | — | 51.1 | — | 39.8 | — | — | 63.2 | 60.8 | 37.1 | 30 | |
| TULIPLearning Mode=Training-free, Backbone=Llama-3.2-11B2026.04 | 57.26 | — | — | 29.61 | 48.97 | — | — | 44.96 | — | 60.01 | — | — | — | — | |
| VTS-VModel Type=Agentic Visual2026.05 | 56.1 | — | 67.2 | — | — | 51.2 | — | 49.4 | — | — | 62.4 | 61.7 | 32.9 | 28.7 | |
| CapImaginebackbone=Qwen2.5-VL-7B, filtering=false2026.02 | 56 | — | — | — | — | — | — | 44.4 | — | — | — | — | — | — | |
| GPT-4oModel Type=Closed-source2026.05 | 55.3 | — | 69.2 | — | — | 61 | — | 59.4 | — | — | 82.9 | 49.2 | 79.5 | 31.3 | |
| GPT-4oreported_from_prior_work=true2026.02 | 55.3 | — | — | — | — | — | — | 59.4 | — | — | — | — | — | — | |
| ATLASSFTTraining=SFT2026.05 | 54.7 | — | 57.3 | — | — | 46 | — | 48.1 | — | — | 50.4 | 59.2 | 26.5 | 26 | |
| OVR-7BLearning Mode=Fine-tuned2026.04 | 53.33 | — | — | 24.5 | 32.56 | — | — | 46.62 | 25.27 | 51.64 | — | — | — | — | |
| Claude-4-SonnetModel Type=Closed-source2026.05 | 53.3 | — | 62.2 | — | — | 49.9 | — | 47.4 | — | — | 61.5 | 59.2 | 35.6 | 30 | |
| Visual CoTModel Type=Agentic Visual2026.05 | 52.7 | — | 63.6 | — | — | 44.4 | — | 44.4 | — | — | 47 | 57.5 | 25 | 20.7 | |
| LVRModel Type=Latent Visual2026.05 | 52.7 | — | 65 | — | — | 49.4 | — | 48.1 | — | — | 59 | 60 | 35.6 | 25.3 | |
| LVRbackbone=Qwen2.5-VL-7B2026.02 | 52 | — | — | — | — | — | — | 46.6 | — | — | — | — | — | — | |
| ATLASLA-GRPOTraining=LA-GRPO2026.05 | 51.3 | — | 62.9 | — | — | 51.3 | — | 53.4 | — | — | 65 | 62.5 | 37.9 | 26.3 | |
| MCOTModel Type=Latent Visual2026.05 | 50.7 | — | 62.2 | — | — | 47.4 | — | 45.9 | — | — | 55.6 | 57.5 | 33.3 | 26.7 | |
| InternVL3-8Bbackbone=InternVL3-8B2026.02 | 50 | — | — | — | — | — | — | 45.9 | — | — | — | — | — | — | |
| Monetbackbone=Qwen2.5-VL-7B2026.02 | 50 | — | — | — | — | — | — | 47.4 | — | — | — | — | — | — | |
| Gemini-2.0-FlashModel Type=Closed-source2026.05 | 48.7 | — | 58 | — | — | 45.3 | — | 43.6 | — | — | 56.4 | 55 | 30.3 | 25.3 | |
| MonetModel Type=Latent Visual2026.05 | 45.3 | — | 58.7 | — | — | 41.8 | — | 40.5 | — | — | 41 | 56.7 | 22.7 | 28 | |
| V-ThinkerModel Type=Agentic Visual2026.05 | 42 | — | 43.4 | — | — | 35 | — | 51.1 | — | — | 26.9 | 43.3 | 19.7 | 18.7 | |
| CoVTModel Type=Latent Visual2026.05 | 41.3 | — | 65 | — | — | 47.9 | — | 49.6 | — | — | 59 | 60 | 36.4 | 24 | |
| PerceptionLM-8BLearning Mode=Fine-tuned2026.04 | 40 | — | — | 38.13 | 43.6 | — | — | 55.64 | 51.08 | 63.11 | — | — | — | — | |
| Zebra-CoTLearning Mode=Fine-tuned, Backbone=Anole 7B2026.04 | 39.33 | — | — | 17.99 | 26.16 | — | — | 21.02 | — | 45.9 | — | — | — | — | |
| LLaVA-OneVision-7BModel Type=Standard2026.05 | 38.7 | — | 47.6 | — | — | 36.6 | — | 33.8 | — | — | 47 | 43.3 | 25 | 20.7 | |
| MiniGPT-v2Model Type=Standard2026.05 | 34.7 | — | 44.8 | — | — | 32.8 | — | 48.9 | — | — | 43.6 | 13.3 | 24.2 | 20.3 | |
| Gemma-3-27BModel Type=Standard2026.05 | 33.3 | — | 42.7 | — | — | 32.1 | — | 31.6 | — | — | 42.7 | 37.5 | 21.2 | 16 | |
| Qwen2.5-VLModel Type=Standard2026.05 | 31.3 | — | 20.3 | — | — | 22.8 | — | 0 | — | — | 29.9 | 58.3 | 0.8 | 18.7 | |
| AnoleModel Type=Unified2026.05 | 2 | — | 27.3 | — | — | 16.4 | — | 3 | — | — | 31.6 | 25 | 11.7 | 14.3 |