Fine-grained Visual Perception on HRBench-8K
72.6AccuracyDeepEyes
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepEyesPrefilling=Multiple, Cropping=Yes, Tool-using=true2026.06 | 72.6 | |
| Thyme-VLPrefilling=Multiple, Cropping=Yes, Tool-using=true2026.06 | 72 | |
| Qwen2.5-VL-7B + SSL-R1Model Scale=7B, Training Strategy=+ SSL-R12026.04 | 71.75 | |
| Qwen2.5-VL-7B + Visual JigsawModel Scale=7B, Training Strategy=+ Visual Jigsaw2026.04 | 70.88 | |
| VisReflectPrefilling=Single, Tool-using=false2026.06 | 70.1 | |
| VL-Cogito-7BModel Scale=7B, Training Strategy=Representative Reasoning Model2026.04 | 69.62 | |
| PAPOPrefilling=Single, Tool-using=true2026.06 | 69.1 | |
| VIFVariation=with CoVT2026.04 | 68.8 | |
| Qwen2.5-VL-3B + SSL-R1Model Scale=3B, Training Strategy=+ SSL-R12026.04 | 68.75 | |
| CoVT2026.04 | 68.6 | |
| DeepEyesPrefilling=Single, Cropping=No, Tool-using=true2026.06 | 68.3 | |
| ThinkLite-VL-7BModel Scale=7B, Training Strategy=Representative Reasoning Model2026.04 | 68.12 | |
| Thyme-VLPrefilling=Single, Cropping=No, Tool-using=true2026.06 | 67.8 | |
| LLaVA-Critic-R1-7BModel Scale=7B, Training Strategy=Representative Reasoning Model2026.04 | 67.5 | |
| Qwen2.5-VL-7BModel Scale=7B, Training Strategy=Baseline2026.04 | 67.38 | |
| LVRPrefilling=Single, Tool-using=true2026.06 | 67.2 | |
| Qwen2.5-VLPrefilling=Single, Tool-using=false2026.06 | 66.9 | |
| Qwen2.5-VL-3B + Visual JigsawModel Scale=3B, Training Strategy=+ Visual Jigsaw2026.04 | 66.5 | |
| Qwen2.5-VL-7B2026.04 | 64.9 | |
| PixelReasonerPrefilling=Single, Tool-using=true2026.06 | 64.2 | |
| Qwen2.5-VL-3BModel Scale=3B, Training Strategy=Baseline2026.04 | 64.12 | |
| VIF2026.04 | 36.8 | |
| SiTebackbone=LLaVA-flickr, variant=rand2025.12 | 34.53 | |
| SiTebackbone=Qwen2-flickr, variant=ratio2025.12 | 34.33 | |
| SiTebackbone=LLaVA-flickr, variant=ratio2025.12 | 33.94 | |
| mPLUG-Owl22026.04 | 33.8 | |
| SiTebackbone=LLaVA, variant=ratio2025.12 | 33.72 | |
| LLaVAvariant=flickr2025.12 | 33.52 | |
| SiTebackbone=Qwen2-flickr, variant=rand2025.12 | 33.34 | |
| SiTebackbone=Qwen2, variant=ratio2025.12 | 32.94 | |
| SiTebackbone=Qwen2, variant=rand2025.12 | 32.67 | |
| Qwen2variant=flickr2025.12 | 32.63 | |
| SiTebackbone=LLaVA, variant=rand2025.12 | 32.56 | |
| Qwen2variant=Baseline2025.12 | 32.25 | |
| LLaVA-v1.52026.04 | 32.1 | |
| LLaVAvariant=Baseline2025.12 | 30.9 | |
| IDEFICS-9B2026.04 | 28.8 | |
| Qwen-VL2026.04 | 28.4 | |
| MiniGPT-v22026.04 | 26.1 |