Visual Question Answering on V*
74.35AccuracyCropVLM
Evaluation Results
| Method | Links | |
|---|---|---|
| CropVLMReward=LL, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 74.35 | |
| Qwen 2.5 VLInput Resolution=1792x17922025.11 | 73.3 | |
| CropVLMReward=Accuracy, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 72.25 | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 60.73 | |
| Qwen 2.5 VL + CropVLMBase Model=Qwen 2.5 VL, Cropping Strategy=CropVLM, Input Resolution=2048x20482025.11 | 59.69 | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 59.69 | |
| LLaVA-1.5-13B + QLIPModel=LLaVA-1.5-13B, Cropped Images=false2025.05 | 58.6 | |
| Qwen 2.5 VL + UV-CoTBase Model=Qwen 2.5 VL, Cropping Strategy=UV-CoT, Input Resolution=336x3362025.11 | 56.54 | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=512, Cropping Strategy=CropVLM2025.11 | 56.02 | |
| LLaVA-1.5-7b + QLIPModel=LLaVA-1.5-7b, Cropped Images=false2025.05 | 53.4 | |
| Qwen 2.5 VL + ViCrop (rel-att)Base Model=Qwen 2.5 VL, Cropping Strategy=ViCrop (rel-att), Input Resolution=448x4482025.11 | 53.4 | |
| Qwen 2.5 VL + ViCrop (grad-att)Base Model=Qwen 2.5 VL, Cropping Strategy=ViCrop (grad-att), Input Resolution=448x4482025.11 | 53.4 | |
| Qwen 2.5 VLBase Model=Qwen 2.5 VL, Cropping Strategy=None, Input Resolution=448x4482025.11 | 51.31 | |
| Qwen 2.5 VL 3BBase Model=Qwen 2.5 VL 3B, Resolution=-, Cropping Strategy=None2025.11 | 51.31 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=Base2026.03 | 50.79 | |
| LLaVA 1.5 + CropVLMBase Model=LLaVA 1.5, Cropping Strategy=CropVLM, Input Resolution=2048x20482025.11 | 50.79 | |
| CropVLMBase Model=LLaVA 1.5 7B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 50.79 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=+DIPE2026.03 | 50.26 | |
| CropVLMBase Model=LLaVA 1.5 7B, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 49.74 | |
| HAVCBackbone=LLaVA-1.5, Signal Type=grad+entropy2026.01 | 49.73 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=Base2026.03 | 49.21 | |
| LLaVA 1.5 + ViCrop (rel-att)Base Model=LLaVA 1.5, Cropping Strategy=ViCrop (rel-att), Input Resolution=336x3362025.11 | 49.21 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=pure-att2026.01 | 49 | |
| Vanilla RoPEPositional Encoding Method=Vanilla RoPE, DIPE Enhancement=+DIPE2026.03 | 48.17 | |
| LLaVA 1.5 + ViCrop (grad-att)Base Model=LLaVA 1.5, Cropping Strategy=ViCrop (grad-att), Input Resolution=336x3362025.11 | 48.17 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=rel-att2026.01 | 47.64 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=+DIPE2026.03 | 47.64 | |
| Vanilla RoPEPositional Encoding Method=Vanilla RoPE, DIPE Enhancement=Base2026.03 | 47.12 | |
| ViCropBackbone=LLaVA-1.5, Signal Type=grad-att2026.01 | 46.59 | |
| CropVLMBase Model=LLaVA 1.5 7B, Resolution=512, Cropping Strategy=CropVLM2025.11 | 46.07 | |
| LLaVA-1.5-13BModel=LLaVA-1.5-13B, Cropped Images=false2025.05 | 45 | |
| LLaVA 1.5 + UV-CoTBase Model=LLaVA 1.5, Cropping Strategy=UV-CoT, Input Resolution=336x3362025.11 | 43.98 | |
| VanillaBackbone=LLaVA-1.52026.01 | 42.93 | |
| LLaVA 1.5Base Model=LLaVA 1.5, Cropping Strategy=None, Input Resolution=336x3362025.11 | 42.41 | |
| LLaVA 1.5 7BBase Model=LLaVA 1.5 7B, Resolution=-, Cropping Strategy=None2025.11 | 42.41 | |
| CropVLMBase Model=GPT 4.1 nano, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 42.41 | |
| LLaVA-1.5-7bModel=LLaVA-1.5-7b, Cropped Images=false2025.05 | 42.4 | |
| CropVLMBase Model=GPT 4.1 nano, Resolution=512, Cropping Strategy=CropVLM2025.11 | 38.22 | |
| CropVLMBase Model=GPT 4.1 nano, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 37.7 | |
| VanillaBackbone=InstructBLIP2026.01 | 37.69 | |
| ViCropBackbone=InstructBLIP, Signal Type=rel-att2026.01 | 37.17 | |
| HAVCBackbone=InstructBLIP, Signal Type=grad+entropy2026.01 | 37.17 | |
| ViCropBackbone=InstructBLIP, Signal Type=pure-grad2026.01 | 35.07 | |
| ViCropBackbone=InstructBLIP, Signal Type=grad-att2026.01 | 34.55 | |
| GPT 4.1 nanoBase Model=GPT 4.1 nano, Resolution=-, Cropping Strategy=None2025.11 | 32.98 |