Visual Question Answering on VQA v2 (Accuracy and Rel.)
88.5AccuracyCoGR-MoE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoGR-MoEBackbone=LLaVA-1.5-7B2026.04 | 88.5 | — | |
| AeroRAG2026.04 | 86.9 | — | |
| mPLUG2026.04 | 85.7 | — | |
| Qwen2.5-VL-7B-InstructMitigation=None (baseline)2025.07 | 84 | — | |
| SENTINELBase Model=Qwen2.5-VL-7B-Instruct2025.07 | 84 | — | |
| SENTINELBase Model=Qwen2-VL-7B-Instruct2025.07 | 83.8 | — | |
| Qwen2-VL-7B-InstructMitigation=None (baseline)2025.07 | 83.7 | — | |
| MH-MoEBackbone=LLaVA-1.5-7B2026.04 | 83.6 | — | |
| Latent DenoisingArchitecture=Qwen-2.5-VL2026.04 | 83.4 | — | |
| I2MoEBackbone=LLaVA-1.5-7B2026.04 | 83.3 | — | |
| LLaVA-NextParams # trainable=13B, Text Backbone=AR, Image Backbone=-2026.05 | 82.8 | — | |
| Metis-HOMEBackbone=LLaVA-1.5-7B2026.04 | 82.7 | — | |
| ONE-PEACE2026.04 | 82.5 | — | |
| BaselineArchitecture=Qwen-2.5-VL2026.04 | 82.2 | — | |
| LLaVA-v1.6-vicuna-13BMitigation=None (baseline)2025.07 | 82.2 | — | |
| SENTINELBase Model=LLaVA-v1.6-vicuna-13B2025.07 | 82.2 | — | |
| BLIP2026.04 | 82.1 | — | |
| LLaVA-NeXT-7BRetained Tokens=2880, Base Model=LLaVA-NeXT-7B2025.03 | 81.8 | — | |
| LLaVA-NeXT-7BRetained Tokens=2880, Base Model=LLaVA-NeXT-7B2025.03 | 81.8 | — | |
| LLaVA-v1.6-vicuna-7BMitigation=None (baseline)2025.07 | 81.5 | — | |
| SENTINELBase Model=LLaVA-v1.6-vicuna-7B2025.07 | 81.5 | — | |
| Qwen2-VL-2B-InstructMitigation=None (baseline)2025.07 | 81.5 | — | |
| SENTINELBase Model=Qwen2-VL-2B-Instruct2025.07 | 81.5 | — | |
| LLaVA-NeXT-7BVisual tokens retained=Full, Pruning ratio=0%, Base Model=LLaVA-NeXT-7B2026.03 | 81.3 | 100 | |
| TwigVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 81.2 | — | |
| TwigVLM++Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 81.2 | — | |
| TwigVLMRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 81.2 | — | |
| TwigVLM++Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 81.2 | — | |
| LLaVA-HRLLM=Vicuna-7B, Resolution=384 × 3842026.04 | 80.5 | — | |
| TwigVLM++Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 80.4 | — | |
| TwigVLM++Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 80.4 | — | |
| VanillaBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 80 | — | |
| VanillaRetained Tokens=576, Compression Ratio=100%2026.04 | 80 | — | |
| LLaVA-1.5-13BImg/s=2.22, Speedup=-2025.10 | 80 | — | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Visual Token Retention=576 tokens2026.06 | 80 | 100 | |
| VisionZip‡Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 79.9 | — | |
| VisionZip‡Retained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 79.9 | — | |
| TwigVLMRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 79.7 | — | |
| TwigVLMRetained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 79.7 | — | |
| VIFLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 79.7 | — | |
| ResPruneVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 79.5 | 99.6 | |
| FastVRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 79.5 | — | |
| FastVRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 79.5 | — | |
| QMoPBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 79.4 | — | |
| APTBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 79.4 | — | |
| DivPruneVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 79.3 | 97.2 | |
| SparseVLMVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 79.2 | 96.9 | |
| CL-MOEBackbone=LLaVA-1.5-7B2026.04 | 79.2 | — | |
| PDropVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 79.1 | 95.7 | |
| VisionZIPVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 79.1 | 98.1 | |
| VisionZipRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 79.1 | — | |
| VisionZipRetained Tokens=640, Base Model=LLaVA-NeXT-7B2025.03 | 79.1 | — | |
| FullTraining Data Percentage=100%, Data Selection Constraint=None (Oracle)2026.04 | 79.1 | — | |
| ResizingBase Model=LLaVA-1.5-13B, Img/s=2.72, Speedup=+23%2025.10 | 78.9 | — | |
| TokenPackerBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 78.8 | — | |
| Qwen-VLLLM=Qwen-7B, Resolution=448 × 4482026.04 | 78.8 | — | |
| LLaVA-1.5 7BRetain Tokens=All 576 Tokens2026.03 | 78.6 | 100 | |
| Latent DenoisingArchitecture=LLaVA+SigLIP2026.04 | 78.6 | — | |
| VanillaBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 78.5 | — | |
| LLaVA-1.5-7BRetained Tokens=576, Pruning Ratio=0%, Base Model=LLaVA-1.5-7B2025.03 | 78.5 | 100 | |
| LLaVA-v1.5LLM=Vicuna-7B, Resolution=336 × 3362026.04 | 78.5 | — | |
| VanillaBackbone=LLaVA-1.5-7B, Retained Tokens=576, Compression Ratio=100%2026.04 | 78.5 | — | |
| LLaVA-1.5-7BImg/s=3.70, Speedup=-2025.10 | 78.5 | — | |
| VanillaToken Budget (Retained Tokens)=576, Reduction Ratio (↓ %)=0%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 78.5 | 100 | |
| VanillaRetained Tokens=576, Pruning Ratio=100%, Training Protocol=Zero-shot2025.11 | 78.5 | 100 | |
| LLaVA-1.5-7BVTR Type=N/A, Tokens Retained=576, Reduction Ratio=100%2026.06 | 78.5 | — | |
| LDP-v2Backbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 78.4 | — | |
| VisionZip‡Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 78.4 | — | |
| VisionZip‡Retained Tokens=320, Base Model=LLaVA-NeXT-7B2025.03 | 78.4 | — | |
| Upper BoundRetained Tokens=5762026.04 | 78.4 | — | |
| RBDVLM=LLaVA-1.52026.04 | 78.4 | — | |
| DARTVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 78.3 | 97.5 | |
| PruMergeVisual tokens retained=640, Pruning ratio=66.7%, Base Model=LLaVA-NeXT-7B2026.03 | 78.2 | 96.6 | |
| TwigVLM++Retained Tokens=192, Pruning Ratio=66.7%, Base Model=LLaVA-1.5-7B2025.03 | 78.2 | 99.6 | |
| Qwen-VL-ChatLLM=Qwen-7B, Resolution=448 × 4482026.04 | 78.2 | — | |
| QWEN-VLParams # trainable=7B, Text Backbone=AR, Image Backbone=-2026.05 | 78.2 | — | |
| QMoPBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 78.1 | — | |
| RandomBase Model=LLaVA-1.5-13B, Img/s=2.79, Speedup=+26%2025.10 | 78 | — | |
| SPAREBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 78 | 98 | |
| ResPruneVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 77.9 | 98.1 | |
| TokenPackerBackbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 77.9 | — | |
| TwigVLM++Retained Tokens=128, Pruning Ratio=77.8%, Base Model=LLaVA-1.5-7B2025.03 | 77.9 | 99.2 | |
| APTBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 77.9 | — | |
| SPprunerToken Budget (Retained Tokens)=192, Reduction Ratio (↓ %)=66.7%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 77.8 | 99.4 | |
| SPprunerToken Budget (Retained Tokens)=128, Reduction Ratio (↓ %)=77.8%, Base Model (LLaVA-1.5-7B)=LLaVA-1.5-7B2026.05 | 77.8 | 98.5 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 77.7 | 97.9 | |
| VisPruner + RESTOREVTR Type=Text-agnostic, Tokens Retained=192, Reduction Ratio=33.3%2026.06 | 77.6 | — | |
| HoloV + RESTOREVTR Type=Text-agnostic, Tokens Retained=192, Reduction Ratio=33.3%2026.06 | 77.6 | — | |
| DARTBackbone=LLaVA-1.5-13B, Visual Token Retention=128 tokens2026.06 | 77.6 | 97.1 | |
| ResizingBase Model=LLaVA-1.5-7B, Img/s=4.51, Speedup=+22%2025.10 | 77.5 | — | |
| EvoCompBackbone=LLaVA-1.5-7B, Retained Tokens=192, Compression Ratio=66.7%, Number of compressor layers (l)=22026.04 | 77.4 | — | |
| OC-VTPRetained Tokens=192, Pruning Ratio=33.3%, Training Protocol=Benchmark-specific training2025.11 | 77.4 | 98.6 | |
| DivPrune + RESTOREVTR Type=Text-agnostic, Tokens Retained=192, Reduction Ratio=33.3%2026.06 | 77.4 | — | |
| LDP-v2Backbone=LLaVA-1.5-7B, Vision token count=1442026.03 | 77.3 | — | |
| DOSETraining Data Percentage=20%, Data Selection Constraint=Partial Data Used before Selection2026.04 | 77.3 | — | |
| Latent DenoisingArchitecture=LLaVA+CLIP2026.04 | 77.3 | — | |
| DivPruneVisual tokens retained=320, Pruning ratio=88.9%, Base Model=LLaVA-NeXT-7B2026.03 | 77.2 | 96.6 | |
| TokenPackerBackbone=LLaVA-1.5-7B, Vision token count=642026.03 | 77.2 | — | |
| VisionZipVTR Type=Text-agnostic, Tokens Retained=192, Reduction Ratio=33.3%2026.06 | 77.2 | — | |
| FasterVLMBackbone=LLaVA-1.5-13B, Vision token count=1442026.03 | 77.1 | — |