Visual Question Answering on GQA (Mean accuracy)
65.8Mean AccuracyCambrian-1-34B
Evaluation Results
| Method | Links | |
|---|---|---|
| Cambrian-1-34BLanguage Model Scale=34B, Training Data Scale=Large2025.01 | 65.8 | |
| LLaVA-NeXT Vanilla 13BToken Budget=2880, Avg. Images=4.90, Avg. Tokens=2822.42025.08 | 65.4 | |
| LLaVA-NextParams (B)=13, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 65.4 | |
| LeoLanguage Model Scale=7B, Training Data Scale=Standard2025.01 | 64.8 | |
| FSRBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 64.4 | |
| LLaVA-NeXT-13BBackbone=LLaVA-NeXT-13B, Tokens Retained=2880, Pruning Ratio=0%2026.02 | 64.3 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 64.3 | |
| FMVR-LLaVA#Vision Tokens=576, Backbone=LLaVA-1.5-13B2026.03 | 64.2 | |
| LLaVA-NeXTLLM=Mistral-7B, Resolution=672 × 6722026.04 | 64.2 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 63.9 | |
| FSRBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 63.8 | |
| DenseConnectorLLM=Vicuna-7B2026.04 | 63.8 | |
| MMTokToken Budget=640, Avg. Tokens=6272025.08 | 63.71 | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 63.7 | |
| VisionZip ✨Token Budget=640, Avg. Tokens=6272025.08 | 63.7 | |
| FMVR-LLaVA#Vision Tokens=144, Backbone=LLaVA-1.5-13B2026.03 | 63.6 | |
| DivPruneBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 63.5 | |
| TG-LLaVALLM=Vicuna-7B, Resolution=336 × 3362026.04 | 63.4 | |
| LLaVA-1.5-13B#Vision Tokens=576, Backbone=LLaVA-1.5-13B2026.03 | 63.3 | |
| HoloVBackbone=LLaVA-NeXT-13B, Tokens Retained=960, Pruning Ratio=66.7%2026.02 | 63.1 | |
| IGVALLM=Vicuna-7B, Resolution=336 × 3362026.04 | 63.1 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 63 | |
| Full-Data(665K)Sampling Ratio=100% (665K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 63 | |
| VisionZipToken Budget=640, Avg. Tokens=6272025.08 | 63 | |
| FMVR-LLaVA#Vision Tokens=5762026.03 | 63 | |
| MMTokToken Budget=320, Avg. Tokens=3142025.08 | 62.95 | |
| VisionZipBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 62.9 | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 62.9 | |
| InternVLLanguage Model Scale=7B, Training Data Scale=Standard2025.01 | 62.9 | |
| DivPruneToken Budget=640, Avg. Tokens=6272025.08 | 62.82 | |
| HoloVBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 62.8 | |
| MMFuserLLM=Vicuna-7B2026.04 | 62.8 | |
| VIFLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 62.8 | |
| FSRBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 62.7 | |
| CDPrunerRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 62.7 | |
| FSRRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 62.6 | |
| CDPrunerRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 62.6 | |
| SPHINX#Vision Tokens=2892026.03 | 62.6 | |
| LLaVA-NeXT-7BRetained Tokens=2880, Reduction Ratio=100%2026.02 | 62.5 | |
| VisionZip ✨Token Budget=320, Avg. Tokens=3142025.08 | 62.5 | |
| VILALanguage Model Scale=7B, Training Data Scale=Standard2025.01 | 62.5 | |
| VISORBackbone=LLaVA-OV 1.5B, Avg. FLOPs Savings=6.6×2026.03 | 62.5 | |
| FSRRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 62.3 | |
| FMVR-LLaVA#Vision Tokens=1442026.03 | 62.3 | |
| GroundingGPTLLM Size=7B2024.01 | 62.1 | |
| VisPrunerRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 62.1 | |
| LLaVA-1.5LLM Size=7B2024.01 | 62 | |
| LLaVA.1.5Language Model Scale=7B, Training Data Scale=Standard2025.01 | 62 | |
| LLaVA-v1.5#Vision Tokens=5762026.03 | 62 | |
| MMTokToken Budget=160, Avg. Tokens=1572025.08 | 61.94 | |
| DivPruneRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 61.9 | |
| LLaVA-1.5-7BRetained Tokens=5762026.03 | 61.9 | |
| LLaVA-v1.5LLM=Vicuna-7B, Resolution=336 × 3362026.04 | 61.9 | |
| DivPruneBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 61.8 | |
| CDPrunerRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 61.4 | |
| MQT-LLaVA#Vision Tokens=1442026.03 | 61.4 | |
| HoloVRetained Tokens=960, Reduction Ratio=↓ 66.7%2026.02 | 61.3 | |
| M3#Vision Tokens=1442026.03 | 61.3 | |
| HoloVRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 61.2 | |
| XMASSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 61.2 | |
| FMVR-LLaVA#Vision Tokens=36, Backbone=LLaVA-1.5-13B2026.03 | 61.2 | |
| VisPrunerRetained Tokens=640, Reduction Ratio=↓ 77.8%2026.02 | 61.1 | |
| DivPruneRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 61.1 | |
| DivPruneToken Budget=320, Avg. Tokens=3142025.08 | 61.03 | |
| CoIDOSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 61 | |
| PyramidDrop#Vision Tokens=128, Backbone=LLaVA-1.5-13B2026.03 | 61 | |
| InternVL-2.0Params (B)=8, Text Gen Arch=AR, Image Gen Arch=-2025.05 | 61 | |
| FastVBackbone=LLaVA-NeXT-13B, Tokens Retained=640, Pruning Ratio=77.8%2026.02 | 60.9 | |
| HoloVBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 60.9 | |
| FSRRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 60.9 | |
| FMVR-LLaVA#Vision Tokens=362026.03 | 60.9 | |
| VisNecSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 60.8 | |
| VisionZipBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 60.7 | |
| ICONSSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 60.7 | |
| VisionZipToken Budget=320, Avg. Tokens=3142025.08 | 60.7 | |
| MonkeyLanguage Model Scale=7B, Training Data Scale=Standard2025.01 | 60.7 | |
| M3#Vision Tokens=144, Backbone=LLaVA-1.5-13B2026.03 | 60.6 | |
| LLaVA with ViCropLLM=Vicuna-7B, Resolution=336 × 3362026.04 | 60.5 | |
| Qwen-2.5-VL-7BResolution Strategy=Dynamic, Token Retention Ratio=100%, Average Tokens (T)=358.52025.08 | 60.48 | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Tokens Retained=320, Pruning Ratio=88.9%2026.02 | 60.4 | |
| COINCIDESampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 60.2 | |
| FMVR-LLaVA#Vision Tokens=9, Backbone=LLaVA-1.5-13B2026.03 | 60.2 | |
| MiniGPT-v2LLM=LLaMA 2-7B, Resolution=448 × 4482026.04 | 60.1 | |
| CDPruner#Vision Tokens=1282026.03 | 59.9 | |
| HoloVRetained Tokens=320, Reduction Ratio=↓ 88.9%2026.02 | 59.8 | |
| TypiClustSampling Ratio=15% (98K samples), Base Model=LLaVA-v1.5-7B, Training Dataset=LLaVA-665K2026.03 | 59.8 | |
| VisionZip ✨Token Budget=160, Avg. Tokens=1572025.08 | 59.7 | |
| CDPruner#Vision Tokens=128, Backbone=LLaVA-1.5-13B2026.03 | 59.7 | |
| SparseVLM#Vision Tokens=128, Backbone=LLaVA-1.5-13B2026.03 | 59.6 | |
| DivPruneRetained Tokens=1282026.03 | 59.4 | |
| AgilePrunerRetained Tokens=1282026.03 | 59.4 | |
| DivPrune#Vision Tokens=1282026.03 | 59.4 | |
| TRIM#Vision Tokens=128, Backbone=LLaVA-1.5-13B2026.03 | 59.4 | |
| MQT-LLaVA#Vision Tokens=144, Backbone=LLaVA-1.5-13B2026.03 | 59.4 | |
| DivPruneToken Budget=160, Avg. Tokens=1572025.08 | 59.34 | |
| Qwen-VL#Vision Tokens=2562026.03 | 59.3 | |
| Prumerge+#Vision Tokens=1442026.03 | 59.3 | |
| VisionZip#Vision Tokens=1922026.03 | 59.3 | |
| Qwen-VLLLM=Qwen-7B, Resolution=448 × 4482026.04 | 59.3 | |
| DivPrune#Vision Tokens=128, Backbone=LLaVA-1.5-13B2026.03 | 59.2 |