Visual Question Answering on InfoVQA
89.3AccuracyAutoMoT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AutoMoT2026.03 | 89.3 | — | — | |
| VISEModel Scale=32B2026.06 | 88.43 | — | — | |
| VisionZero-CLEVRModel Scale=32B2026.06 | 88.32 | — | — | |
| VisionZero-ChartModel Scale=32B2026.06 | 88.19 | — | — | |
| iReasonerModel Scale=32B2026.06 | 88.12 | — | — | |
| EvoLMMModel Scale=32B2026.06 | 88.05 | — | — | |
| VisionZero-RWModel Scale=32B2026.06 | 87.94 | — | — | |
| VisPlayModel Scale=32B2026.06 | 87.89 | — | — | |
| BaseModel Scale=32B2026.06 | 87.77 | — | — | |
| Qwen2.5-VL-32B + AT-RL (Ours)Zero-shot=true2026.02 | 87.1 | — | — | |
| Penguin-VLModel Size=8B2026.03 | 86.8 | — | — | |
| Qwen3-VL 8B-RModel Scale=8B, Strategy=Reasoning2026.04 | 86.7 | — | — | |
| Qwen3-VL 8B + 4B-RMain Model=8B, Source Model=4B-R, Strategy=Reasoning Transfer2026.04 | 84.1 | — | — | |
| Qwen3-VLModel Size=8B2026.03 | 83.1 | — | — | |
| Qwen3-VL 4B-RModel Scale=4B, Strategy=Reasoning2026.04 | 83.1 | — | — | |
| VISEModel Scale=8B2026.06 | 82.83 | — | — | |
| Qwen3-VL 8B-SModel Scale=8B, Strategy=Simple2026.04 | 82.8 | — | — | |
| Qwen3-VL 8B + 2B-RMain Model=8B, Source Model=2B-R, Strategy=Reasoning Transfer2026.04 | 82.8 | — | — | |
| VisionZero-CLEVRModel Scale=8B2026.06 | 82.44 | — | — | |
| VisionZero-ChartModel Scale=8B2026.06 | 82.31 | — | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Token Retention Ratio=100%2025.12 | 82.3 | — | — | |
| iReasonerModel Scale=8B2026.06 | 82.15 | — | — | |
| EvoLMMModel Scale=8B2026.06 | 82.02 | — | — | |
| Direct Fine-tuning (r=1)Optimization steps=+700 steps2026.02 | 81.61 | — | — | |
| Direct Fine-tuning (r=1)Optimization steps=+0 steps2026.02 | 81.56 | — | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Standard2026.02 | 81.45 | — | — | |
| In-Squeeze (128 ... -> 1)Optimization mode=Min steps2026.02 | 81.45 | — | — | |
| VISEModel Scale=4B2026.06 | 81.45 | — | — | |
| VisionZero-RWModel Scale=8B2026.06 | 81.44 | — | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+200 steps2026.02 | 81.36 | — | — | |
| VisPlayModel Scale=8B2026.06 | 81.36 | — | — | |
| BaseModel Scale=8B2026.06 | 81.23 | — | — | |
| Direct Fine-tuning (r=1)Optimization steps=+200 steps2026.02 | 81.07 | — | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+700 steps2026.02 | 80.92 | — | — | |
| BaselineBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=1.00×, Channel multiplier=1.00×, KV Cache budget multiplier=1.00×2026.05 | 80.12 | — | — | |
| Qwen3-VL 4B-SModel Scale=4B, Strategy=Simple2026.04 | 80 | — | — | |
| Qwen3-VL 4B + 2B-RMain Model=4B, Source Model=2B-R, Strategy=Reasoning Transfer2026.04 | 79.7 | — | — | |
| InternVL-3.5Model Size=8B2026.03 | 79.1 | — | — | |
| iReasonerModel Scale=4B2026.06 | 78.76 | — | — | |
| VisionZero-ChartModel Scale=4B2026.06 | 78.74 | — | — | |
| EvoLMMModel Scale=4B2026.06 | 78.58 | — | — | |
| VisionZero-CLEVRModel Scale=4B2026.06 | 78.28 | — | — | |
| VisPlayModel Scale=4B2026.06 | 77.96 | — | — | |
| VisionZero-RWModel Scale=4B2026.06 | 77.94 | — | — | |
| Penguin-VLParameters=2B2026.03 | 77.8 | — | — | |
| BaseModel Scale=4B2026.06 | 77.73 | — | — | |
| OpenAI GPT-4oZero-shot=true2026.02 | 77 | — | — | |
| Qwen2.5-VL-72B InstructZero-shot=true2026.02 | 76.9 | — | — | |
| BaseRatio=100%, Backbone=Qwen2.5-VL-3B2026.05 | 75.95 | — | — | |
| ReCogDrive2026.03 | 75.8 | — | — | |
| Gemini 2.0 FlashZero-shot=true2026.02 | 75.6 | — | — | |
| CropVLMReward=Accuracy, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 75.6 | — | — | |
| CropVLMReward=LL, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 75.6 | — | — | |
| Qwen 2.5 VLInput Resolution=1792x17922025.11 | 75.55 | — | — | |
| DivPrune + RandomBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 74.9 | — | — | |
| IVC-PruneRatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 74.75 | — | — | |
| QwenVL2.5-3BModel size=3B2026.05 | 74.22 | — | — | |
| BalCapRL-3BBackbone=QwenVL2.5-3B2026.05 | 74.17 | — | — | |
| DivPruneBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 73.9 | — | — | |
| ERASERatio=-62.1%, Backbone=Qwen2.5-VL-3B2026.05 | 73.34 | — | — | |
| CapRL-3BBackbone=QwenVL2.5-3B2026.05 | 73.17 | — | — | |
| DivPrune+VTWBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 73 | — | — | |
| Claude 3.5 SonnetZero-shot=true2026.02 | 72.8 | — | — | |
| IVC-PruneRatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 72.58 | — | — | |
| Qwen3-VLParameters=2B2026.03 | 72.4 | — | — | |
| ERASERatio=-75.0%, Backbone=Qwen2.5-VL-3B2026.05 | 71.74 | — | — | |
| VISEModel Scale=2B2026.06 | 71.43 | — | — | |
| OpenEMMA2026.03 | 71.4 | — | — | |
| Qwen3-VL 2B-RModel Scale=2B, Strategy=Reasoning2026.04 | 71.4 | — | — | |
| RubiCap-3BBackbone=QwenVL2.5-3B2026.05 | 71.26 | — | — | |
| VisionZero-CLEVRModel Scale=2B2026.06 | 70.93 | — | — | |
| iReasonerModel Scale=2B2026.06 | 70.82 | — | — | |
| InternVL3.5Parameters=2B2026.03 | 70.8 | — | — | |
| EvoLMMModel Scale=2B2026.06 | 70.69 | — | — | |
| VisionZip + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 70.51 | — | — | |
| VisPlayModel Scale=2B2026.06 | 69.96 | — | — | |
| ShareGPT5V-mini-SFTTraining=SFT2026.05 | 69.94 | — | — | |
| VisionZero-ChartModel Scale=2B2026.06 | 69.61 | — | — | |
| VisionZero-RWModel Scale=2B2026.06 | 69.58 | — | — | |
| ERASERatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 69.25 | — | — | |
| BaseModel Scale=2B2026.06 | 69.02 | — | — | |
| VisionZip + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.45×, Channel multiplier=0.25×, KV Cache budget multiplier=0.28×2026.05 | 67.13 | — | — | |
| Cont-Squeeze (128 -> 1)Optimization steps=+0 steps2026.02 | 67.01 | — | — | |
| DART + RandomBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 65.9 | — | — | |
| DART+VTWBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 65.8 | — | — | |
| Eagle2number of parameters=1.5B2025.07 | 65.8 | — | — | |
| FastV + RotateKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 65.79 | — | — | |
| Qwen2-VL-2B#Params=2.2B2024.12 | 65.5 | — | — | |
| DARTBackbone=Qwen2.5-VL-7B, Token Retention Ratio=50%2025.12 | 64.4 | — | — | |
| IVC-PruneRatio=-85.0%, Backbone=Qwen2.5-VL-3B2026.05 | 63.72 | — | — | |
| InstructVLA-Generalistnumber of parameters=1.5B2025.07 | 63.7 | — | — | |
| InstructVLA-Generalistnumber of parameters=1.5B, robot state=true2025.07 | 63.7 | — | — | |
| FastV + ThinKBackbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.40×, Channel multiplier=0.25×, KV Cache budget multiplier=0.25×2026.05 | 63.01 | — | — | |
| Qwen2-VLnumber of parameters=1.5B2025.07 | 61.4 | — | — | |
| Llama 4 ScoutZero-shot=true2026.02 | 60.1 | — | — | |
| VisionZip (token only)Backbone=QWEN2.5-VL-7B-INSTRUCT, Token multiplier=0.28×, Channel multiplier=1.00×, KV Cache budget multiplier=0.28×2026.05 | 58.46 | — | — | |
| InternVL2#Params=2.2B2024.12 | 57.7 | — | — | |
| Gemma 3 4B ITZero-shot=true2026.02 | 56.2 | — | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 55.95 | — | — | |
| HoVLE#Params=2.6B, Resolution=HD2024.12 | 55.7 | — | — |