Visual Question Answering on VQA v2 (Performance Score)
83.93AccuracyVisionZero-CLEVR
Evaluation Results
| Method | Links | |
|---|---|---|
| VisionZero-CLEVRModel Scale=32B2026.06 | 83.93 | |
| VisionZero-ChartModel Scale=32B2026.06 | 83.9 | |
| VISEModel Scale=32B2026.06 | 83.85 | |
| iReasonerModel Scale=32B2026.06 | 83.84 | |
| EvoLMMModel Scale=32B2026.06 | 83.8 | |
| VisionZero-RWModel Scale=32B2026.06 | 83.61 | |
| BaseModel Scale=32B2026.06 | 83.56 | |
| VisPlayModel Scale=32B2026.06 | 83.52 | |
| BLIP-3oUnified=✓, #Params=8B, Visual Representation Type=Continuous2026.06 | 83.1 | |
| Qwen2.5-VL-7B (Base)Base Model=Qwen2.5-VL-7B, Alignment Strategy=Base2026.06 | 82.92 | |
| LLaVA-NeXT-13B + MIRRORModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 82.9 | |
| LLaVA-NeXT-13BModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 82.8 | |
| VisionZero-CLEVRModel Scale=8B2026.06 | 82.72 | |
| VisionZero-ChartModel Scale=8B2026.06 | 82.69 | |
| VISEModel Scale=8B2026.06 | 82.65 | |
| iReasonerModel Scale=8B2026.06 | 82.46 | |
| EvoLMMModel Scale=8B2026.06 | 82.38 | |
| Hyper-ICLBackbone=LLaVA-OneVision (Qwen2-7B)2026.06 | 82.24 | |
| LLaVA-NeXT-7BModel Scale=7B-class, LLM=Mistral-7B2026.06 | 82.2 | |
| LLaVA-NeXT-7B + MIRRORModel Scale=7B-class, LLM=Mistral-7B2026.06 | 82.1 | |
| VisionZero-RWModel Scale=8B2026.06 | 81.92 | |
| BaseModel Scale=8B2026.06 | 81.81 | |
| VisPlayModel Scale=8B2026.06 | 81.78 | |
| LLaVA-1.5-13B + MIRRORModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 81.7 | |
| GRPOBase Model=Qwen2.5-VL-7B, Alignment Strategy=GRPO2026.06 | 81.65 | |
| LLaVA-1.5-13BModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 81.3 | |
| MimICBackbone=LLaVA-OneVision (Qwen2-7B)2026.06 | 81.22 | |
| Qwen3-VL-4B (Base)Base Model=Qwen3-VL-4B, Alignment Strategy=Base2026.06 | 81.19 | |
| VISEModel Scale=4B2026.06 | 81.16 | |
| iReasonerModel Scale=4B2026.06 | 81.1 | |
| LLaVA-1.5-7B + MIRRORModel Scale=7B-class, LLM=Vicuna-7B2026.06 | 81.1 | |
| VisionZero-ChartModel Scale=4B2026.06 | 81.09 | |
| VisionZero-CLEVRModel Scale=4B2026.06 | 81.07 | |
| EvoLMMModel Scale=4B2026.06 | 80.97 | |
| OPDBase Model=Qwen3-VL-4B, Alignment Strategy=OPD2026.06 | 80.79 | |
| COPSD (Hybrid)Base Model=Qwen3-VL-4B, Alignment Strategy=COPSD (Hybrid)2026.06 | 80.67 | |
| COPSD (Standard)Base Model=Qwen3-VL-4B, Alignment Strategy=COPSD (Standard)2026.06 | 80.57 | |
| VisionZero-RWModel Scale=4B2026.06 | 80.24 | |
| LLaVA-NeXT-7BVisual Token Budget=2880, Token Reduction Ratio=100%, Base Model=LLaVA-NeXT-7B2026.07 | 80.2 | |
| AnchorPruneVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 80.2 | |
| BaseModel Scale=4B2026.06 | 80.07 | |
| VanillaBackbone=LLaVA-1.5-13B, Token Budget=Full Tokens2026.06 | 80 | |
| COPSD (Hybrid)Base Model=Qwen2.5-VL-7B, Alignment Strategy=COPSD (Hybrid)2026.06 | 79.99 | |
| VisPlayModel Scale=4B2026.06 | 79.89 | |
| Safe-RLHF-VBase Model=Qwen2.5-VL-7B, Alignment Strategy=Safe-RLHF-V2026.06 | 79.73 | |
| Safe-RLHF-VBase Model=Qwen3-VL-4B, Alignment Strategy=Safe-RLHF-V2026.06 | 79.65 | |
| GRPOBase Model=Qwen3-VL-4B, Alignment Strategy=GRPO2026.06 | 79.51 | |
| VILA-UUnified=✓, #Params=7B, Visual Representation Type=Discrete2026.06 | 79.4 | |
| AnchorPruneVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 79.4 | |
| SFTBase Model=Qwen3-VL-4B, Alignment Strategy=SFT2026.06 | 79.35 | |
| LLaVA-1.5-7BModel Scale=7B-class, LLM=Vicuna-7B2026.06 | 79.3 | |
| VisionZero-CLEVRModel Scale=2B2026.06 | 79.04 | |
| DivPruneVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 78.9 | |
| VisionZero-RWModel Scale=2B2026.06 | 78.89 | |
| VisionZero-ChartModel Scale=2B2026.06 | 78.85 | |
| Qwen-VLLLM=Qwen-7B2026.06 | 78.8 | |
| COPSD (Standard)Base Model=Qwen2.5-VL-7B, Alignment Strategy=COPSD (Standard)2026.06 | 78.75 | |
| 8-shot ICLBackbone=LLaVA-OneVision (Qwen2-7B)2026.06 | 78.7 | |
| PyramidDropVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 78.7 | |
| AnchorPruneVisual Token Budget=160, Token Reduction Ratio=↓ 94.4%, Base Model=LLaVA-NeXT-7B2026.07 | 78.6 | |
| VisPlayModel Scale=2B2026.06 | 78.59 | |
| VISEModel Scale=2B2026.06 | 78.54 | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 78.5 | |
| VanillaBackbone=LLaVA-1.5-7B, Retained Tokens=576 (Upper Bound)2026.06 | 78.5 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Retained Tokens=5762026.06 | 78.5 | |
| LLaVA-1.5LLM=Vicuna-7B2026.06 | 78.5 | |
| LLaVA-1.5-7BRetain Tokens=576, Pruning Ratio=0%2026.07 | 78.5 | |
| BaseModel Scale=2B2026.06 | 78.37 | |
| LLaVA-1.5 + PADL+ (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=true2026.06 | 78.2 | |
| Qwen-VL-ChatModel Scale=7B-class, LLM=Qwen-7B2026.06 | 78.2 | |
| CDPrunerVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 78.2 | |
| iReasonerModel Scale=2B2026.06 | 77.94 | |
| EvoLMMModel Scale=2B2026.06 | 77.86 | |
| Zoo-PruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 77.8 | |
| OPDBase Model=Qwen2.5-VL-7B, Alignment Strategy=OPD2026.06 | 77.62 | |
| LLaVA-1.5 + FreePrunerLLM=Vicuna-7B, Compression Method=FreePruner2026.06 | 77.6 | |
| AgilePruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 77.5 | |
| ShikraLLM=Vicuna-13B2026.06 | 77.4 | |
| STSBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 77.3 | |
| VisionZipVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 77.3 | |
| STSBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 77.2 | |
| FastVVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 77.2 | |
| DivPruneBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 77.1 | |
| SparseVLMVisual Token Budget=640, Token Reduction Ratio=↓ 77.8%, Base Model=LLaVA-NeXT-7B2026.07 | 77.1 | |
| LLaVA-1.5 + PADL (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=false2026.06 | 76.9 | |
| VanillaVision Token=576, Backbone=Qwen2.5-3B, Vision Encoder=clip-vit-large-patch14-3362026.06 | 76.9 | |
| VisionZipBackbone=LLaVA-1.5-13B, Token Budget=128 Tokens2026.06 | 76.8 | |
| LiquidUnified=✓, #Params=7B, Visual Representation Type=Discrete2026.06 | 76.8 | |
| UniTokUnified=✓, #Params=7B, Visual Representation Type=Discrete2026.06 | 76.8 | |
| CDPrunerVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 76.8 | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 76.7 | |
| EADPRetain Tokens=128, Pruning Ratio=77.8%2026.07 | 76.7 | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B, Visual Token Budget=5762026.07 | 76.7 | |
| Zoo-PruneBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 76.6 | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 76.6 | |
| LLaVA-1.5 + PruMergeLLM=Vicuna-7B, Compression Method=PruMerge2026.06 | 76.6 | |
| DivPruneVisual Token Budget=320, Token Reduction Ratio=↓ 88.9%, Base Model=LLaVA-NeXT-7B2026.07 | 76.6 | |
| Hyper-ICLBackbone=LLaVA-Interleave-7B2026.06 | 76.51 | |
| Zoo-PruneBackbone=LLaVA-1.5-13B, Token Budget=64 Tokens2026.06 | 76.4 | |
| AgilePruneBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 76.4 |