Object Hallucination Evaluation on POPE (test)
90.6AccuracyVanilla
Evaluation Results
| Method | Links | |||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| VanillaBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=100%2025.12 | 90.6 | — | — | — | — | — | — | — | — | — | — | — | 100 | — | — | — | — | — | — | — | 100 | — | — | |
| InternVL2.5-8B2026.04 | 90.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ToFuBackbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 90.1 | — | — | — | — | — | — | — | — | — | — | — | 83.4 | — | — | — | — | — | — | — | 61.9 | — | — | |
| ToMeBackbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | 82.7 | — | — | — | — | — | — | — | 61.7 | — | — | |
| LLaVA-OV-0.5B w/ CLIModel=LLaVA-OV-0.5B w/ CLI2026.01 | 89.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-0.5B w/ SLIModel=LLaVA-OV-0.5B w/ SLI2026.01 | 89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7B w/ SLIModel=LLaVA-OV-7B w/ SLI2026.01 | 89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7B w/ CLIModel=LLaVA-OV-7B w/ CLI2026.01 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2-26BModel=InternVL-2-26B2026.01 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-0.5BModel=LLaVA-OV-0.5B2026.01 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DART (ViT)Backbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 88.7 | — | — | — | — | — | — | — | — | — | — | — | 88.1 | — | — | — | — | — | — | — | 63.9 | — | — | |
| LLaVA-OV-7B w/ DeepStackModel=LLaVA-OV-7B w/ DeepStack2026.01 | 88.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OV-7BModel=LLaVA-OV-7B2026.01 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Zamba2-VL-7BLanguage-backbone scale=7–8B2026.05 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IXC-2.5-7BModel=IXC-2.5-7B2026.01 | 88.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-OneVision-7B2026.04 | 88.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cobra-3.5BLanguage-backbone scale=2–4B2026.05 | 88.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IPCV+FastVBackbone=InternVL3-38B, ViT token retention rate=40%, LLM token retention rate=40%2025.12 | 88.3 | — | — | — | — | — | — | — | — | — | — | — | 89.9 | — | — | — | — | — | — | — | 64.4 | — | — | |
| LLaVA-OV-0.5B w/ DeepStackModel=LLaVA-OV-0.5B w/ DeepStack2026.01 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Gemini-1.5-Pro2026.04 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + Saliency-R1Training Stage=Saliency-R12026.04 | 88.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IXC-2.52026.04 | 87.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-2-8BModel=InternVL-2-8B2026.01 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7B + SFTTraining Stage=SFT2026.04 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cobra-8BLanguage-backbone scale=7–8B2026.05 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3BTraining Stage=Base2026.04 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B + Saliency-R1Training Stage=Saliency-R12026.04 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ICONSTraining Data Fraction=20%2026.05 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mamba-VL-2.8BLanguage-backbone scale=2–4B2026.05 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IVM-Enhanced LLaVA-7BNumber of Parameters=14B2024.05 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Zamba2-VL-2.7BLanguage-backbone scale=2–4B2026.05 | 87.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-3B + SFTTraining Stage=SFT2026.04 | 87.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAGICTraining Data Fraction=20%2026.05 | 87.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoE-LLaVALLM=Qwen, Parameters=2.2B2026.04 | 87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pythia-VL-2.8BLanguage-backbone scale=2–4B2026.05 | 86.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLASPBase Model=LLaVA-NeXT-13B, Token Retention Budget=640 Tokens2026.04 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pythia-VL-1BLanguage-backbone scale=~1B2026.05 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mamba-VL-0.8BLanguage-backbone scale=~1B2026.05 | 86.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-Llama-V-2.5-8B2026.04 | 86.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-7BTraining Stage=Base2026.04 | 86.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| mmMamba2.7BLanguage-backbone scale=2–4B2026.05 | 86.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cambrain-1-8B2026.04 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FullTraining Data Fraction=100%2026.05 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Pythia-VL-1.4BLanguage-backbone scale=~1B2026.05 | 86.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-7B#Tokens=2880, Total Inference Time=2284 s, Prefill Time=1062 s, FLOPs=12.6 T2026.01 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RDSTraining Data Fraction=20%2026.05 | 86.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7B + VisionTrim#Tokens=64, Total Inference Time=685 s, Prefill Time=235 s, FLOPs=0.8 T2026.01 | 86.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Upper BoundBase Model=LLaVA-NeXT-13B2026.04 | 86.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| COINCIDETraining Data Fraction=20%2026.05 | 86.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseVLMBase Model=LLaVA-NeXT-13B, Token Retention Budget=640 Tokens2026.04 | 86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ALVTSTokens Retained=128, Reduction Ratio=78%2026.06 | 85.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-7BNumber of Parameters=7B2024.05 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-13BNumber of Parameters=13B2024.05 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VanillaBase Model=LLaVA1.5-7B, Pruning Family=Baseline2026.02 | 85.9 | — | — | — | — | — | — | — | — | — | — | 100 | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7B#Tokens=576, Total Inference Time=1303 s, Prefill Time=494 s, FLOPs=3.8 T2026.01 | 85.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7BTokens Retained=576, Retention Ratio=100%2026.06 | 85.84 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ALVTSTokens Retained=192, Reduction Ratio=67%2026.06 | 85.72 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| D2-PruningTraining Data Fraction=20%2026.05 | 85.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GPT-4o2026.04 | 85.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| COIDOTraining Data Fraction=20%2026.05 | 85.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLIP-ScoreTraining Data Fraction=20%2026.05 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DataTailorTraining Data Fraction=20%2026.05 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mamba-VL-1.4BLanguage-backbone scale=~1B2026.05 | 85.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLASPBase Model=LLaVA-NeXT-13B, Token Retention Budget=320 Tokens2026.04 | 85.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-PhiLLM=Phi 2, Parameters=2.7B2026.04 | 85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-7B + VisionTrim#Tokens=320, Total Inference Time=921 s, Prefill Time=360 s, FLOPs=1.2 T2026.01 | 84.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RandomTraining Data Fraction=20%2026.05 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SemDeDupTraining Data Fraction=20%2026.05 | 84.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDropTokens Retained=192, Reduction Ratio=67%2026.06 | 84.67 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MobileVLMLLM=Mobile-LLaMA, Parameters=1.7B2026.04 | 84.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VL-Mamba2.8BLanguage-backbone scale=2–4B2026.05 | 84.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MobileVLM V2LLM=Mobile-LLaMA, Parameters=1.7B2026.04 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| EL2NTraining Data Fraction=20%2026.05 | 84.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2-8B2026.04 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Zamba2-VL-1.2BLanguage-backbone scale=~1B2026.05 | 84.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ALVTSTokens Retained=64, Reduction Ratio=89%2026.06 | 83.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Self-FilterTraining Data Fraction=20%2026.05 | 83.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CLASPBase Model=LLaVA-NeXT-13B, Token Retention Budget=160 Tokens2026.04 | 83.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseVLMBase Model=LLaVA-NeXT-13B, Token Retention Budget=320 Tokens2026.04 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Self-SepTraining Data Fraction=20%2026.05 | 83.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiniCPM-V-2.6-8B2026.04 | 83.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 82.7 | — | — | — | — | — | — | — | — | — | — | — | 78.6 | — | — | — | — | — | — | — | 70.7 | — | — | |
| PerplexityTraining Data Fraction=20%2026.05 | 82.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARTTokens Retained=192, Reduction Ratio=67%2026.06 | 82.45 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SEAL-7BNumber of Parameters=7B2024.05 | 82.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IDEFICSLLM=LLaMA, Parameters=9.0B2026.04 | 81.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PDropTokens Retained=128, Reduction Ratio=78%2026.06 | 81.82 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseVLMBase Model=LLaVA-NeXT-13B, Token Retention Budget=160 Tokens2026.04 | 81.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARTTokens Retained=128, Reduction Ratio=78%2026.06 | 80.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LISA-Enhanced LLaVA-7BNumber of Parameters=20B2024.05 | 80 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SparseVLMBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 79.3 | — | — | — | — | — | — | — | — | — | — | — | 75.1 | — | — | — | — | — | — | — | 73.4 | — | — | |
| InstructBLIPNumber of Parameters=13B2024.05 | 78.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-7B + SparseVLM#Tokens=320, Total Inference Time=1872 s, Prefill Time=644 s, FLOPs=2.5 T2026.01 | 78.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FastVTokens Retained=192, Reduction Ratio=67%2026.06 | 77.79 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DARTBackbone=InternVL3-38B, ViT token retention rate=100%, LLM token retention rate=5%2025.12 | 77.6 | — | — | — | — | — | — | — | — | — | — | — | 73.6 | — | — | — | — | — | — | — | 71.5 | — | — | |
| SparseVLMBase Model=LLaVA1.5-7B, Pruning Family=LLM Multi-Layer Pruning2026.02 | 77.5 | — | — | — | — | — | — | — | — | — | — | 90.2 | — | — | — | — | — | — | — | — | — | — | — | |
| VisionZipBase Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 77 | — | — | — | — | — | — | — | — | — | — | 89.6 | — | — | — | — | — | — | — | — | — | — | — | |
| PruMerge+Base Model=LLaVA1.5-7B, Pruning Family=Vision Encoder-Side Pruning2026.02 | 75.7 | — | — | — | — | — | — | — | — | — | — | 88.1 | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7B + SparseVLM#Tokens=64, Total Inference Time=1068 s, Prefill Time=377 s, FLOPs=1.3 T2026.01 | 75.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VTWTokens Retained=192, Reduction Ratio=67%2026.06 | 74.86 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |