Visual Question Answering on GQA (Score)
71.3ScoreLiquid
Evaluation Results
| Method | Links | |
|---|---|---|
| Liquid# Params=7B, Resolution=5122025.03 | 71.3 | |
| LLaVA-OneVisionVision Encoder=ViT-SO400M, LLM=Qwen2, Training Data (PT+IT)=4.5+3.2M, Input Resolution=1152, #Visual Tokens=7290, Vis. Enc. Size (M)=430, TTFT (ms)=141242024.12 | 67.2 | |
| UniFlow-XLVision Encoder=InternViT-300M, LLM Backbone=Qwen2.5-7B, Resolution=4482025.10 | 65.86 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Training Data (PT+IT)=15+1.1M, Input Resolution=1024, #Visual Tokens=256, Vis. Enc. Size (M)=125, TTFT (ms)=6412024.12 | 65.8 | |
| AuroraEdge-V-2BNumber of parameters=2B2026.01 | 65.75 | |
| FSRBackbone=LLaVA-NeXT-13B, Retained Tokens=960, Pruning Ratio=66.7%2026.02 | 64.4 | |
| LLaVA-NeXT-13BBackbone=LLaVA-NeXT-13B, Retained Tokens=2880, Pruning Ratio=0%2026.02 | 64.3 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=960, Pruning Ratio=66.7%2026.02 | 64.3 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 63.9 | |
| FSRBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 63.8 | |
| AD-Loop#Params=7B, Capabilities=Und. and Gen.2026.02 | 63.8 | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=960, Pruning Ratio=66.7%2026.02 | 63.7 | |
| DivPruneBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 63.5 | |
| UniFlow-LVVision Encoder=InternViT-300M, LLM Backbone=Vicuna-7B, Resolution=448, Training Setting=LLaVA-v1.5 setting2025.10 | 63.35 | |
| LLaVA-1.5-13BBackbone=LLaVA-1.5-13B, Retained Tokens=576, Pruning Ratio=0%2026.02 | 63.3 | |
| ShareGPT4V# Params=7B, Resolution=3362025.03 | 63.3 | |
| UniFlow-LVVision Encoder=SigLIP2-SO400M, LLM Backbone=Vicuna-7B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 63.29 | |
| VanillaBackbone=LLaVA-1.5-13B2025.10 | 63.2 | |
| ECSOBackbone=LLaVA-1.5-13B2025.10 | 63.2 | |
| ETABackbone=LLaVA-1.5-13B2025.10 | 63.2 | |
| MoRASBackbone=LLaVA-1.5-13B2025.10 | 63.2 | |
| HoloVBackbone=LLaVA-NeXT-13B, Retained Tokens=960, Pruning Ratio=66.7%2026.02 | 63.1 | |
| Show-o2Vision Encoder=Wan2.1-VAE+ViT-SO400M, LLM Backbone=Qwen2.5-7B, Resolution=4322025.10 | 63.1 | |
| CDPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | 63 | |
| VisionZipBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 62.9 | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 62.9 | |
| HoloVBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 62.8 | |
| VanillaModel=LLaVA-OneVision-7B2025.10 | 62.8 | |
| ECSOModel=LLaVA-OneVision-7B2025.10 | 62.8 | |
| ETAModel=LLaVA-OneVision-7B2025.10 | 62.8 | |
| MoRASModel=LLaVA-OneVision-7B2025.10 | 62.8 | |
| FSRBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | 62.7 | |
| TokenFlow-XLVision Encoder=SigLIP-SO400M, LLM Backbone=Qwen2.5-14B, Resolution=3842025.10 | 62.5 | |
| FigStepBackbone=LLaVA-1.5-13B2025.10 | 62.4 | |
| CoCABackbone=LLaVA-1.5-13B2025.10 | 62.3 | |
| ASTRAModel=LLaVA-OneVision-7B2025.10 | 62.3 | |
| LLaVA-v1.5# Params=7B, Resolution=3362025.03 | 62 | |
| LLaVA-1.5Vision Encoder=CLIP-L, LLM Backbone=Vicuna-7B, Resolution=3362025.10 | 62 | |
| Janus-ProVision Encoder=SigLIP-L, LLM Backbone=DeepSeek-LLM-7B, Resolution=3842025.10 | 62 | |
| LLaVA-v1.5#Params=7B, Capabilities=Und. Only2026.02 | 62 | |
| Janus-Pro#Params=7B, Capabilities=Und. and Gen.2026.02 | 62 | |
| VanillaLoc.=-, Retained Tokens=576, Pruning Ratio=0%2026.03 | 61.9 | |
| VanillaModel=LLaVA-1.5-7B2025.10 | 61.9 | |
| ECSOModel=LLaVA-1.5-7B2025.10 | 61.9 | |
| ETAModel=LLaVA-1.5-7B2025.10 | 61.9 | |
| MoRASModel=LLaVA-1.5-7B2025.10 | 61.9 | |
| AutoSteerModel=LLaVA-OneVision-7B2025.10 | 61.9 | |
| DivPruneBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | 61.8 | |
| QLIPVision Encoder=CLIP-L, LLM Backbone=Vicuna-7B, Resolution=392, Training Setting=LLaVA-v1.5 setting2025.10 | 61.8 | |
| SemHiTok# Params=7B, Resolution=3842025.03 | 61.7 | |
| FigStepModel=LLaVA-OneVision-7B2025.10 | 61.7 | |
| FastVLMVision Encoder=FastViTHD, LLM=Qwen2, Training Data (PT+IT)=15+1.1M, Input Resolution=1024, #Visual Tokens=256, Vis. Enc. Size (M)=125, TTFT (ms)=1662024.12 | 61.6 | |
| CoCAModel=LLaVA-OneVision-7B2025.10 | 61.4 | |
| UniFlow-LVVision Encoder=DFN-CLIP-L, LLM Backbone=Vicuna-7B, Resolution=224, Training Setting=LLaVA-v1.5 setting2025.10 | 61.38 | |
| MMaDA#Params=8B, Capabilities=Und. and Gen.2026.02 | 61.3 | |
| FigStepModel=LLaVA-1.5-7B2025.10 | 61.3 | |
| Qwen2.5-VL-3BNumber of parameters=3B2026.01 | 61.25 | |
| UniTokVision Encoder=Vitamin-L, LLM Backbone=LLaMa-2-7B, Resolution=2562025.10 | 61.1 | |
| Liquid#Params=8B, Capabilities=Und. and Gen.2026.02 | 61.1 | |
| AutoSteerBackbone=LLaVA-1.5-13B2025.10 | 61.1 | |
| SemHiTokVision Encoder=SigLIP-L, LLM Backbone=Vicuna-7B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 61 | |
| FastVBackbone=LLaVA-NeXT-13B, Retained Tokens=640, Pruning Ratio=77.8%2026.02 | 60.9 | |
| HoloVBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | 60.9 | |
| ASTRABackbone=LLaVA-1.5-13B2025.10 | 60.9 | |
| VILA-U# Params=7B, Resolution=3842025.03 | 60.8 | |
| VILA-UVision Encoder=SigLIP-SO400M, LLM Backbone=LLaMA-2-7B, Resolution=3842025.10 | 60.8 | |
| VisionZipBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | 60.7 | |
| Qwen2-VL-2BNumber of parameters=2B2026.01 | 60.4 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=192, Pruning Ratio=66.7%2026.02 | 60.4 | |
| VisPrunerBackbone=LLaVA-NeXT-13B, Retained Tokens=320, Pruning Ratio=88.9%2026.02 | 60.4 | |
| ASTRAModel=LLaVA-1.5-7B2025.10 | 60.4 | |
| EMU3# Params=8B, Resolution=5122025.03 | 60.3 | |
| TokenFlow-L# Params=13B, Resolution=2562025.03 | 60.3 | |
| SemHiTok# Params=7B, Resolution=2562025.03 | 60.3 | |
| TokenFlow-LVision Encoder=ViTamin-XL, LLM Backbone=Vicuna-13B, Resolution=256, Training Setting=LLaVA-v1.5 setting2025.10 | 60.3 | |
| Emu3#Params=8B, Capabilities=Und. and Gen.2026.02 | 60.3 | |
| CoCAModel=LLaVA-1.5-7B2025.10 | 60.3 | |
| FSRBackbone=LLaVA-1.5-13B, Retained Tokens=192, Pruning Ratio=66.7%2026.02 | 60.2 | |
| PRUNESIDLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 60.1 | |
| DARTLoc.=L2, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 60 | |
| DivPruneLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 60 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=128, Pruning Ratio=77.8%2026.02 | 59.7 | |
| SynerGen-VL# Params=2.4B, Resolution=5122025.03 | 59.7 | |
| SynerGen-VLVision Encoder=SBER-MoVQ-GAN, LLM Backbone=InternLM2-MoE-2.4B, Resolution=5122025.10 | 59.7 | |
| FSRBackbone=LLaVA-1.5-13B, Retained Tokens=128, Pruning Ratio=77.8%2026.02 | 59.6 | |
| VisPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=192, Pruning Ratio=66.7%2026.02 | 59.5 | |
| TokLIP# Params=7B, Resolution=3842025.03 | 59.5 | |
| TokLIPVision Encoder=VQ-GAN+ViT-SO400M, LLM Backbone=Qwen2.5-7B, Resolution=3842025.10 | 59.5 | |
| CDPrunerBackbone=LLaVA-1.5-13B, Retained Tokens=64, Pruning Ratio=88.9%2026.02 | 59.4 | |
| AutoSteerModel=LLaVA-1.5-7B2025.10 | 59.4 | |
| UniFlow-LVVision Encoder=DINOv2-L, LLM Backbone=Vicuna-7B, Resolution=378, Training Setting=LLaVA-v1.5 setting2025.10 | 59.37 | |
| MobileVLMv2Vision Encoder=ViT-L/14, LLM=MobileLLaMA, Training Data (PT+IT)=1.2+3.6M, Input Resolution=336, #Visual Tokens=144, Vis. Enc. Size (M)=304, TTFT (ms)=4582024.12 | 59.3 | |
| InternVL-2.5-2BNumber of parameters=2B2026.01 | 59.3 | |
| TokenFlow-B# Params=13B, Resolution=2242025.03 | 59.3 | |
| TokenFlow-BVision Encoder=CLIP-B, LLM Backbone=Vicuna-13B, Resolution=224, Training Setting=LLaVA-v1.5 setting2025.10 | 59.3 | |
| VisionZipLoc.=Pre, Retained Tokens=192, Pruning Ratio=66.7%2026.03 | 59.3 | |
| DivPruneBackbone=LLaVA-1.5-13B, Retained Tokens=128, Pruning Ratio=77.8%2026.02 | 59.2 | |
| DivPruneLoc.=Pre, Retained Tokens=128, Pruning Ratio=77.8%2026.03 | 59.2 | |
| Janus# Params=1.5B, Resolution=3842025.03 | 59.1 | |
| Unified-IO 2Vision Encoder=VQ-GAN, LLM Backbone=6.8B from scratch, Resolution=3842025.10 | 59.1 |