Object Hallucination Evaluation on POPE (Accuracy Only)
92AccuracySPOT-E
Evaluation Results
| Method | Links | |
|---|---|---|
| SPOT-EBase Model=InternVL3-8B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 92 | |
| SPOT-EBase Model=InternVL2.5-26B2026.06 | 91.6 | |
| InternVL3-8BBase Model=InternVL3-8B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 91.1 | |
| InternVL2.5-26BBase Model=InternVL2.5-26B2026.06 | 90.8 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%, FFT Type=Local2026.06 | 90.7 | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%, FFT Type=Global2026.06 | 90.6 | |
| VanillaBackbone=InternVL-2.5-8B, Token Reduction Ratio=0%2026.06 | 90.5 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%, FFT Type=Local2026.06 | 90.5 | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%, FFT Type=Global2026.06 | 90.5 | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=66.7%2026.06 | 90.4 | |
| SPOT-EBase Model=InternVL2.5-8B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 90 | |
| BF16Model=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=BF162026.06 | 89.92 | |
| CLSE localBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%, FFT Type=Local2026.06 | 89.7 | |
| CLSE globalBackbone=InternVL-2.5-8B, Token Reduction Ratio=88.9%, FFT Type=Global2026.06 | 89.6 | |
| SPOT-EBase Model=Qwen3-VL-32B2026.06 | 89.5 | |
| MODEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 89.44 | |
| FastVBackbone=InternVL-2.5-8B, Token Reduction Ratio=77.8%2026.06 | 89.4 | |
| MC-MoEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 89.21 | |
| FP16Backbone=Qwen3-VL-8B2026.06 | 89.14 | |
| SPOT-EBase Model=Qwen2.5-VL-32B2026.06 | 89 | |
| InternVL2.5-8BBase Model=InternVL2.5-8B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 89 | |
| VEQ-MEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 88.96 | |
| VanillaAverage Token Reduction=0.0%, Backbone=Qwen3-VL-8B2026.06 | 88.9 | |
| Qwen3-VL-32BBase Model=Qwen3-VL-32B2026.06 | 88.9 | |
| MBQModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 88.85 | |
| Speed-QModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 88.82 | |
| VanillaBackbone=Qwen2-VL-7B, Token Retention Ratio=100.0%2026.06 | 88.8 | |
| GPTQModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 88.79 | |
| MoEQuantModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W32026.06 | 88.69 | |
| LLaVA-1.5 + PADL+ (8×)LLM=Vicuna-7B, Compression Method=PADL, Compression Ratio=8x, Adapter fine-tuning=true2026.06 | 88.5 | |
| GeMoENA=1.32B, Avgk=5.432026.06 | 88.38 | |
| Qwen2.5-VL-32BBase Model=Qwen2.5-VL-32B2026.06 | 88.3 | |
| AdaMoENA=1.39B, Avgk=6.132026.06 | 88.27 | |
| SPOT-EBase Model=LLaVA-OV-72B2026.06 | 88.2 | |
| SharQBackbone=Qwen3-VL-8B2026.06 | 88.2 | |
| SPOT-EBase Model=Qwen3-VL-8B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 88.1 | |
| Qwen3-VLToken Ratio=Full Tokens2026.06 | 88 | |
| SPOT-EBase Model=GPT-4o, Source Type=Closed-Source, Test-time Adaptation=SPOT-E2026.06 | 87.9 | |
| DYNMoENA=1.40B, Avgk=6.192026.06 | 87.84 | |
| NVFP4Backbone=Qwen3-VL-8B2026.06 | 87.73 | |
| LLaVA-1.5 + FreePrunerLLM=Vicuna-7B, Compression Method=FreePruner2026.06 | 87.7 | |
| PDropAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 87.6 | |
| Top-pNA=2.05B, Avgk=12.652026.06 | 87.54 | |
| LLaVA-OV-72BBase Model=LLaVA-OV-72B2026.06 | 87.5 | |
| VTWBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=K=202026.06 | 87.4 | |
| Janus-ProUnified=✓, #Params=7B, Visual Representation Type=Continuous2026.06 | 87.4 | |
| SPOT-EBase Model=Qwen2.5-VL-7B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 87.4 | |
| ARMUnified=✓, #Params=7B, Visual Representation Type=Discrete2026.06 | 87.3 | |
| Qwen2-VL-2B#Params=2B, TFLOPs=0.42025.06 | 87.3 | |
| LaTtE-Flow#Params=2B, TFLOPs=0.42025.06 | 87.3 | |
| MODEModel=Qwen3-VL-30B-A3B-Instruct, Avg-Bit=W22026.06 | 87.28 | |
| Qwen3-VL-8BBase Model=Qwen3-VL-8B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 87.2 | |
| BF16Model=Kimi-VL-A3B-Instruct, Avg-Bit=BF162026.06 | 87.17 | |
| VTWBase Model=LLaVA-1.5-13B, Hyperparameter (K/N)=K=202026.06 | 87.1 | |
| PDrop+RerouteAverage Token Reduction=66.7%, Backbone=Qwen3-VL-8B2026.06 | 87.1 | |
| MODEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 87.1 | |
| LLaVA-NeXT-7B + MIRRORModel Scale=7B-class, LLM=Mistral-7B2026.06 | 87.1 | |
| ALVTSNumber of Tokens=320, Token Reduction Ratio=89%2026.06 | 87.09 | |
| Janus#Params=1.5B, TFLOPs=0.82025.06 | 87 | |
| VanillaToken Reduction Ratio=100% (Upper Bound)2026.06 | 86.91 | |
| GPT-4oBase Model=GPT-4o, Source Type=Closed-Source, Test-time Adaptation=None2026.06 | 86.9 | |
| SPOT-EBase Model=Gemini-2.5-Flash, Source Type=Closed-Source, Test-time Adaptation=SPOT-E2026.06 | 86.9 | |
| SPOT-EBase Model=LLaVA-OV-7B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 86.9 | |
| MoEQuantModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 86.84 | |
| MBQModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 86.73 | |
| VEQ-MEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 86.72 | |
| VisPrunerToken Ratio=33.3%2026.06 | 86.7 | |
| LLaVA-NeXT-7BModel Scale=7B-class, LLM=Mistral-7B2026.06 | 86.7 | |
| ALVTSToken Reduction Ratio=89%2026.06 | 86.58 | |
| MC-MoEModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 86.53 | |
| V-SkipBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 86.5 | |
| DCP-PruneBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 86.5 | |
| SPOT-EBase Model=LLaVA-NeXT-7B, Source Type=Open-Source, Test-time Adaptation=SPOT-E2026.06 | 86.5 | |
| LLaVA-1.5 + PruMergeLLM=Vicuna-7B, Compression Method=PruMerge2026.06 | 86.5 | |
| VanillaVisual Token Budget=2880, Token Retention Ratio=100%2026.06 | 86.5 | |
| LLaVA-NeXT-13B + MIRRORModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 86.5 | |
| LLaVA-NeXT-7BNumber of Tokens=2880, Token Reduction Ratio=0%2026.06 | 86.41 | |
| LLaVA-NeXT-7BBase Model=LLaVA-NeXT-7B2026.06 | 86.4 | |
| VTWBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=K=162026.06 | 86.4 | |
| LLaVA-NeXT-13BBase Model=LLaVA-NeXT-13B2026.06 | 86.4 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2026.06 | 86.4 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B, Source Type=Open-Source, Test-time Adaptation=None2026.06 | 86.4 | |
| Speed-QModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 86.32 | |
| V-SkipBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=N=192026.06 | 86.3 | |
| Qwen2.5-VL-7BToken Retention=100%2026.06 | 86.3 | |
| LLaVA-1.5-7B + MIRRORModel Scale=7B-class, LLM=Vicuna-7B2026.06 | 86.3 | |
| ShortVBase Model=LLaVA-NeXT-7B, Hyperparameter (K/N)=N=192026.06 | 86.2 | |
| ShortVBase Model=LLaVA-NeXT-13B, Hyperparameter (K/N)=N=242026.06 | 86.2 | |
| VTWBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=K=72026.06 | 86.2 | |
| V-SkipBase Model=Qwen2.5-VL-7B, Hyperparameter (K/N)=N=72026.06 | 86.2 | |
| Janus Pro#Params=1.5B, TFLOPs=0.82025.06 | 86.2 | |
| LLaVA-NeXT-13BModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 86.2 | |
| VanillaBackbone=Qwen2.5-VL-7B, Token Pruning Rate=0%2026.06 | 86.1 | |
| GPTQModel=Kimi-VL-A3B-Instruct, Avg-Bit=W32026.06 | 86.06 | |
| Gemini-2.5-FlashBase Model=Gemini-2.5-Flash, Source Type=Closed-Source, Test-time Adaptation=None2026.06 | 86 | |
| PriorTRToken Ratio=33.3%2026.06 | 86 | |
| LLaVA-1.5-13B + MIRRORModel Scale=13B-class, LLM=Vicuna-13B2026.06 | 86 | |
| VanillaBackbone=LLaVA-1.5-7B, Retained Tokens=5762026.06 | 85.9 | |
| LLaVA-1.5LLM=Vicuna-7B2026.06 | 85.9 | |
| VanillaBackbone=LLaVA-1.5-13B, Retained Tokens=5762026.06 | 85.9 |