High-Resolution Visual Perception on HR-Bench 4K
89.63AccuracyGemini-3.1-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-3.1-ProParam Size=-, Inference Mode=Closed-Source2026.05 | 89.63 | |
| Qwen3.5Param Size=397B, Inference Mode=Single Forward Pass2026.05 | 89.38 | |
| Vision-OPD (Ours)Param Size=9B, Inference Mode=Single Forward Pass2026.05 | 88.13 | |
| Qwen3-VL-InstructParam Size=235B, Inference Mode=Single Forward Pass2026.05 | 86.13 | |
| Qwen3.5Param Size=9B, Inference Mode=Single Forward Pass2026.05 | 85.75 | |
| Vision-OPD (Ours)Param Size=4B, Inference Mode=Single Forward Pass2026.05 | 84.5 | |
| Qwen3.5Param Size=4B, Inference Mode=Single Forward Pass2026.05 | 84.38 | |
| GPT-5.4Param Size=-, Inference Mode=Closed-Source2026.05 | 84 | |
| ZwZParam Size=8B, Inference Mode=Single Forward Pass2026.05 | 83.63 | |
| Gemini-2.5-ProModel Type=Closed-Source2026.05 | 83.3 | |
| SenseNova-MARSParam Size=8B, Inference Mode=Agentic2026.05 | 83.13 | |
| GLM-4.6VParam Size=106B, Inference Mode=Single Forward Pass2026.05 | 82.13 | |
| GPT-5.2Param Size=-, Inference Mode=Closed-Source2026.05 | 81.12 | |
| Kimi-K2.5Param Size=1T, Inference Mode=Single Forward Pass2026.05 | 80 | |
| Qwen3-VL-InstructParam Size=8B, Inference Mode=Single Forward Pass2026.05 | 79.63 | |
| MAESTROModel Type=Ours2026.05 | 79.6 | |
| Gemini-2.5-FlashModel Type=Closed-Source2026.05 | 79.4 | |
| DeepEyes-v2Model Type=Think with Images Methods2026.05 | 77.9 | |
| DeepEyesV2Param Size=7B, Inference Mode=Agentic2026.05 | 77.88 | |
| ThymeParam Size=7B, Inference Mode=Agentic2026.05 | 77 | |
| ThymeModel Type=Think with Images Methods2026.05 | 77 | |
| GLM-4.6VModel Type=Open-Source & Baselines2026.05 | 76.6 | |
| GPT-5Model Type=Closed-Source2026.05 | 75.3 | |
| DeepEyesParam Size=7B, Inference Mode=Agentic2026.05 | 75.13 | |
| DeepEyesModel Type=Think with Images Methods2026.05 | 75.1 | |
| Qwen3-VL-32BModel Type=Open-Source & Baselines2026.05 | 75 | |
| MathCoder-VLModel Type=Think with Images Methods2026.05 | 73.8 | |
| MiMo-VL-RLParam Size=7B, Inference Mode=Single Forward Pass2026.05 | 73.5 | |
| AdaFocusModel=Qwen2.5VL-3B, Training-free=true2026.02 | 73.25 | |
| Direct AnsweringModel Type=Open-Source & Baselines2026.05 | 72.4 | |
| VIFVariation=with CoVT2026.04 | 71.5 | |
| CoVT2026.04 | 71 | |
| Chain-of-FocusModel Type=Think with Images Methods2026.05 | 71 | |
| Untrained ModelModel Type=Open-Source & Baselines2026.05 | 70.3 | |
| ZoomEyesModel=Qwen2.5VL-3B, Training-free=true2026.02 | 70.13 | |
| VTS-VModel Type=Think with Images Methods2026.05 | 69.8 | |
| MiniCPM-V-4.5Param Size=9B, Inference Mode=Single Forward Pass2026.05 | 69.63 | |
| Qwen2.5-VL-7B2026.04 | 68.6 | |
| PixelReasonerModel Type=Think with Images Methods2026.05 | 68.6 | |
| VTOOL-R1Model Type=Think with Images Methods2026.05 | 68.5 | |
| VisionReasonerModel Type=Think with Images Methods2026.05 | 68.5 | |
| Kimi-K2.5Model Type=Open-Source & Baselines2026.05 | 68.4 | |
| BaselineModel=Qwen2.5VL-3B, Training-free=true2026.02 | 67.5 | |
| MLLMs-KnowModel=Qwen2.5VL-3B, Training-free=true2026.02 | 66.36 | |
| GPT-4oModel Type=Closed-Source2026.05 | 59 | |
| Visual-ARFTModel Type=Think with Images Methods2026.05 | 58.9 | |
| ZoomEyesModel=LLaVA-v1.5-7B, Training-free=true2026.02 | 49.88 | |
| AdaFocusModel=LLaVA-v1.5-7B, Training-free=true2026.02 | 47.38 | |
| VisCropModel=LLaVA-v1.5-7B, Training-free=true2026.02 | 46.25 | |
| WSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=90%2026.04 | 46.13 | |
| FP16Backbone=LLaVA-Next 13B2026.04 | 45.63 | |
| QSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=80%2026.04 | 44.88 | |
| WSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=80%2026.04 | 44.88 | |
| WSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=60%2026.04 | 44.88 | |
| VIF2026.04 | 44.8 | |
| WSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=70%2026.04 | 44.5 | |
| WSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=50%2026.04 | 44.5 | |
| MLLMs-KnowModel=LLaVA-v1.5-7B, Training-free=true2026.02 | 44.38 | |
| SVD-LLMBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=80%2026.04 | 44.25 | |
| QSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=90%2026.04 | 44.25 | |
| ASVDBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=80%2026.04 | 44.13 | |
| ASVDBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=90%2026.04 | 44 | |
| ASVDBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=70%2026.04 | 43.88 | |
| QSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=70%2026.04 | 43.88 | |
| SVD-LLMBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=60%2026.04 | 43.75 | |
| QSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=60%2026.04 | 43.37 | |
| SVD-LLMBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=50%2026.04 | 43.25 | |
| ASVDBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=60%2026.04 | 43 | |
| SVD-LLMBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=90%2026.04 | 43 | |
| QSVD-noQBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=50%2026.04 | 42.88 | |
| SVD-LLMBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=70%2026.04 | 42.62 | |
| ASVDBackbone=LLaVA-Next 13B, Compression Ratio (rho1)=50%2026.04 | 42 | |
| IGVA2026.04 | 40 | |
| mPLUG-Owl22026.04 | 36.9 | |
| BaselineModel=LLaVA-v1.5-7B, Training-free=true2026.02 | 36.13 | |
| LLaVA-v1.52026.04 | 36.1 | |
| Qwen-VL2026.04 | 31.8 | |
| IDEFICS-9B2026.04 | 30.6 | |
| MiniGPT-v22026.04 | 25.5 |