Object Hallucination Evaluation on POPE (Rand, Pop, Adv, Avg)
100.43Average AccuracyMS-Resampler
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| MS-ResamplerVision Token=1442026.06 | 100.43 | — | — | — | 87 | — | |
| LLaVA-1.5-7BVision Token=5762026.06 | 100 | — | — | — | 85.9 | — | |
| VanillaModel=LLaVA-NeXT, TFLOPs=100%2026.06 | 100 | — | — | — | — | 87.61 | |
| APETModel=LLaVA-NeXT, TFLOPs=70%2026.06 | 99.4 | — | — | — | — | 87.79 | |
| Ours (N=20)Model=LLaVA-NeXT, TFLOPs=67%2026.06 | 98.8 | — | — | — | — | 88.31 | |
| V2DropModel=LLaVA-NeXT, TFLOPs=70%2026.06 | 98.4 | — | — | — | — | 87.98 | |
| VSkip+ (N=20)Model=LLaVA-NeXT, TFLOPs=74%2026.06 | 98.2 | — | — | — | — | 87.35 | |
| DARTVision Token=1922026.06 | 97.98 | — | — | — | 82.8 | — | |
| MustDropVision Token=1922026.06 | 96.26 | — | — | — | 82.6 | — | |
| PDropVision Token=1922026.06 | 96.19 | — | — | — | 82.3 | — | |
| ShortV (N=20)Model=LLaVA-NeXT, TFLOPs=51%2026.06 | 96 | — | — | — | — | 87.38 | |
| SparseVLMVision Token=1922026.06 | 95.79 | — | — | — | 83.6 | — | |
| VCDModel=InternVL3-8B2026.06 | 91.1 | 93.8 | 91.3 | 88.1 | — | — | |
| PAIModel=InternVL3-8B2026.06 | 91 | 93.7 | 90.9 | 88.2 | — | — | |
| GreedyModel=InternVL3-8B2026.06 | 90.9 | 93.4 | 90.9 | 88.5 | — | — | |
| FADEModel=InternVL3-8B2026.06 | 90.9 | 93.7 | 90.9 | 88.2 | — | — | |
| DCLAModel=InternVL3-8B2026.06 | 90.8 | 93.2 | 90.7 | 88.4 | — | — | |
| DAMOModel=InternVL3-8B2026.06 | 90.6 | 92.4 | 90.6 | 88.9 | — | — | |
| InternVL3-8BBackbone=InternVL3-8B, Retained Tokens=1280, Reduction Ratio=0%2026.06 | 90.3 | — | — | — | — | — | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 90.1 | — | — | — | — | — | |
| ERABackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 89.8 | — | — | — | — | — | |
| FastVVision Token=1922026.06 | 89.58 | — | — | — | 64.8 | — | |
| Op-SkipBackbone=Qwen3-VL-8B, TFLOPs=66%, N=202026.06 | 89.43 | — | — | — | — | — | |
| VSkipBackbone=Qwen3-VL-8B, TFLOPs=76%, N=202026.06 | 89.16 | — | — | — | — | — | |
| VanillaBackbone=Qwen3-VL-8B, TFLOPs=100%2026.06 | 89.13 | — | — | — | — | — | |
| HiREDVision Token=1922026.06 | 89.06 | — | — | — | 82.8 | — | |
| ShortVBackbone=Qwen3-VL-8B, TFLOPs=58%, N=202026.06 | 88.97 | — | — | — | — | — | |
| LLaVA-PruMergeVision Token=1922026.06 | 88.92 | — | — | — | 71.3 | — | |
| ERABackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 88.7 | — | — | — | — | — | |
| VisionZipBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 88.6 | — | — | — | — | — | |
| APETBackbone=Qwen3-VL-8B, TFLOPs=66%2026.06 | 88.54 | — | — | — | — | — | |
| V2DropBackbone=Qwen3-VL-8B, TFLOPs=66%2026.06 | 88.34 | — | — | — | — | — | |
| DARTBackbone=InternVL3-8B, Retained Tokens=256, Reduction Ratio=80.0%2026.06 | 88 | — | — | — | — | — | |
| VanillaBackbone=Qwen2.5-VL-7B, TFLOPs=100%2026.06 | 87.62 | — | — | — | — | — | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 87.6 | — | — | — | — | — | |
| V2DropBackbone=Qwen2.5-VL-7B, TFLOPs=55%2026.06 | 87.34 | — | — | — | — | — | |
| VSkipBackbone=LLaVA-1.5-7B, TFLOPs=76%, N=202026.06 | 87.33 | — | — | — | — | — | |
| Op-SkipBackbone=Qwen2.5-VL-7B, TFLOPs=55%, N=202026.06 | 87.32 | — | — | — | — | — | |
| VSkip+Backbone=LLaVA-1.5-7B, TFLOPs=76%, N=202026.06 | 87.26 | — | — | — | — | — | |
| Op-SkipBackbone=LLaVA-1.5-7B, TFLOPs=66%, N=202026.06 | 87.26 | — | — | — | — | — | |
| VTWBackbone=LLaVA-1.5-7B, TFLOPs=55%, K=162026.06 | 86.89 | — | — | — | — | — | |
| V2DropBackbone=LLaVA-1.5-7B, TFLOPs=66%2026.06 | 86.82 | — | — | — | — | — | |
| APETBackbone=LLaVA-1.5-7B, TFLOPs=66%2026.06 | 86.82 | — | — | — | — | — | |
| APETBackbone=Qwen2.5-VL-7B, TFLOPs=55%2026.06 | 86.7 | — | — | — | — | — | |
| VTW (K=16)Model=LLaVA-NeXT, TFLOPs=51%2026.06 | 86.5 | — | — | — | — | 87.41 | |
| ShortVBackbone=LLaVA-1.5-7B, TFLOPs=55%, N=202026.06 | 86.19 | — | — | — | — | — | |
| VanillaBackbone=LLaVA-1.5-7B, TFLOPs=100%2026.06 | 85.94 | — | — | — | — | — | |
| VisionZipBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 85.2 | — | — | — | — | — | |
| DARTBackbone=InternVL3-8B, Retained Tokens=128, Reduction Ratio=90.0%2026.06 | 85.1 | — | — | — | — | — | |
| VSkipBackbone=Qwen2.5-VL-7B, TFLOPs=67%, N=162026.06 | 84.38 | — | — | — | — | — | |
| VTWBackbone=Qwen3-VL-8B, TFLOPs=58%, K=162026.06 | 73.88 | — | — | — | — | — | |
| VTWBackbone=Qwen2.5-VL-7B, TFLOPs=50%, K=162026.06 | 70.6 | — | — | — | — | — | |
| ShortVBackbone=Qwen2.5-VL-7B, TFLOPs=50%, N=202026.06 | 58.91 | — | — | — | — | — | |
| Both-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | — | 86.2 | 80.3 | 79.8 | — | — | |
| Both-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | — | 58.9 | 55.8 | 53.2 | — | — | |
| Both-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | — | 86.4 | 83.5 | 80.1 | — | — | |
| CleanModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | — | 88.1 | 87.5 | 85.6 | — | — | |
| CleanModel=LLaVA, Vision Encoder=CLIP-3362024.12 | — | 66.3 | 63.7 | 58.4 | — | — | |
| CleanModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | — | 88.1 | 85.5 | 82.8 | — | — | |
| CleanModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | — | 84.4 | 83.5 | 82.7 | — | — | |
| FitPruneVision Token=1922026.06 | — | — | — | — | 83.4 | — | |
| Img-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | — | 84.4 | 81.5 | 80.1 | — | — | |
| Img-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | — | 56.4 | 54 | 52.9 | — | — | |
| Img-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | — | 86.2 | 83.5 | 79.7 | — | — | |
| Img-EmbModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | — | 58.9 | 59.3 | 58.8 | — | — | |
| Text-EmbModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | — | 86.2 | 84.9 | 80.6 | — | — | |
| Text-EmbModel=LLaVA, Vision Encoder=CLIP-3362024.12 | — | 56.2 | 53 | 51.8 | — | — | |
| Text-EmbModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | — | 82.3 | 78.4 | 72 | — | — | |
| VEV-UAPModel=LLaVA-1.5, Vision Encoder=CLIP-3362024.12 | — | 51.6 | 50.1 | 50.1 | — | — | |
| VEV-UAPModel=LLaVA, Vision Encoder=CLIP-3362024.12 | — | 52 | 50.5 | 50.3 | — | — | |
| VEV-UAPModel=InstructBlip, Vision Encoder=EVA-CLIP2024.12 | — | 69.5 | 66.9 | 61.5 | — | — | |
| VEV-UAPModel=Qwen2.5-VL, Vision Encoder=Qwen-ViT2024.12 | — | 55.6 | 55.6 | 53.5 | — | — |