Object Hallucination on POPE (Random)
93.02F1 Scorevanilla
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| vanillaModel=LLaVA-1.52024.02 | 93.02 | 93 | — | — | — | |
| LogicCheckGPTModel=LLaVA-1.52024.02 | 93 | 93.33 | — | — | — | |
| DeCoBackbone=Qwen3-VL 8B2026.05 | 91.98 | 91.96 | 92.36 | — | — | |
| MGAPBackbone=Qwen3-VL 8B2026.05 | 91.94 | 91.83 | 93.67 | — | — | |
| HalTrapperBackbone=Qwen3-VL 8B2026.05 | 91.93 | 91.6 | 92.51 | — | — | |
| MoDBackbone=Qwen3-VL 8B2026.05 | 91.86 | 91.87 | 91.94 | — | — | |
| VanillaBackbone=Qwen3-VL 8B2026.05 | 91.79 | 91.53 | 89.08 | — | — | |
| ICDBackbone=Qwen3-VL 8B2026.05 | 91.75 | 91.74 | 91.21 | — | — | |
| SelfCheckModel=QWEN-VL-Chat2024.02 | 91.45 | 91.13 | — | — | — | |
| REVIS2026.02 | 91.43 | 91.9 | — | 86.4 | — | |
| LogicCheckGPTModel=mPLUG-Owl2024.02 | 90.84 | 91 | — | — | — | |
| VCDBackbone=Qwen3-VL 8B2026.05 | 90.83 | 90.67 | 88.8 | — | — | |
| LogicCheckGPTModel=QWEN-VL-Chat2024.02 | 90.71 | 91.33 | — | — | — | |
| VGAModel=Qwen2.5-VL2025.11 | 90.57 | 91.08 | — | — | — | |
| UNIFIED-IO 2Model Size=XXL2023.12 | 90.54 | 90.9 | 94.3 | 87.07 | 46.17 | |
| CASTBackbone=LLaVA-NeXT2026.05 | 90.42 | 90.68 | — | — | — | |
| PAIModel=Qwen2.5-VL2025.11 | 90.31 | 90.85 | — | — | — | |
| MGAPBackbone=LLaVA v1.5 7B2026.05 | 90.29 | 90.63 | 93.69 | — | — | |
| vanillaModel=QWEN-VL-Chat2024.02 | 90.28 | 90.67 | — | — | — | |
| REVISModel=LLaVA-NeXT, max_new_token=5122026.02 | 90.04 | 90.7 | — | 84.07 | — | |
| VAFModel=Qwen2.5-VL2025.11 | 89.87 | 90.57 | — | — | — | |
| Ferret-7BModel Size=7B2023.12 | 89.76 | 90.24 | 97.72 | 83 | 43.78 | |
| Ferret2023.12 | 89.76 | 90.24 | 97.72 | 83 | 43.78 | |
| VanillaBackbone=LLaVA v1.5 7B2026.05 | 89.76 | 88.88 | 89.7 | — | — | |
| OPERABackbone=LLaVA-NeXT2026.05 | 89.71 | 90.27 | — | — | — | |
| LUREModel=LLaVA-1.52024.02 | 89.7 | 89.67 | — | — | — | |
| BLIP2-14BLLM=Vicuna-13B, Image Size=224x224, Pre-train Sample Size=129M2023.10 | 89.6 | — | — | — | — | |
| DeCoBackbone=LLaVA v1.5 7B2026.05 | 89.58 | 89.86 | 92.41 | — | — | |
| VCDBackbone=LLaVA-NeXT2026.05 | 89.57 | 88.76 | — | — | — | |
| SelfCheckModel=LLaVA-1.52024.02 | 89.53 | 90.33 | — | — | — | |
| CMPCDecoding Strategy=Greedy, Backbone=LLaVA-OV2025.01 | 89.5 | 90.45 | — | — | — | |
| VCDDecoding Strategy=Greedy, Backbone=LLaVA-OV2025.01 | 89.44 | 90.28 | — | — | — | |
| CASTBackbone=LLaVA-1.5-7b2026.05 | 89.43 | 89.87 | — | — | — | |
| VCD + CNSModel Backbone=Qwen-VL2026.01 | 89.42 | 89.27 | — | — | — | |
| VGAModel=LLaVA-7B2025.11 | 89.41 | 89.28 | — | — | — | |
| BLIP-22024.04 | 89.3 | 88.6 | 84.1 | 95.1 | 56.6 | |
| InstructBLIPLLM=V-13B, zero-shot=true2023.11 | 89.3 | 88.7 | — | — | 55.2 | |
| BaselineDecoding Strategy=Greedy, Backbone=LLaVA-OV2025.01 | 89.3 | 90.1 | — | — | — | |
| InstructBLIP2023.12 | 89.27 | 88.57 | 84.09 | 95.13 | 56.57 | |
| InstructBLIP2023.06 | 89.27 | 88.57 | 84.09 | 95.13 | 56.57 | |
| InstructBLIP2023.11 | 89.27 | 88.57 | 84.09 | 95.13 | — | |
| InstructBLIPzero-shot=true2023.12 | 89.27 | 88.57 | 84.09 | 95.13 | 56.57 | |
| InstructBLIP2024.03 | 89.27 | 88.57 | 84.09 | 95.13 | 56.57 | |
| InstructBLIP2023.09 | 89.27 | 88.57 | 84.09 | 95.13 | 56.57 | |
| VGAModel=LLaVA-Next2025.11 | 89.21 | 89.91 | — | — | — | |
| NulluModel=LLaVA-1.52024.12 | 89.2 | 89.45 | 91.41 | 87.1 | — | |
| MoDBackbone=LLaVA v1.5 7B2026.05 | 89.17 | 89.24 | 91.37 | — | — | |
| VanillaModel=Qwen2.5-VL2025.11 | 89.1 | 89.88 | — | — | — | |
| ONLYModel=LLaVA-NeXT, max_new_token=5122026.02 | 89.09 | 89.97 | — | 81.93 | — | |
| VGAModel=LLaVA-13B2025.11 | 89.07 | 88.58 | — | — | — | |
| ICDBackbone=LLaVA v1.5 7B2026.05 | 89.04 | 89.47 | 92.84 | — | — | |
| Original samplingModel=LLaVA-1.52024.12 | 89.03 | 88.98 | 88.65 | 89.43 | — | |
| TARACModel=Qwen2.5-VL2025.11 | 89.01 | 89.79 | — | — | — | |
| VCDModel=LLaVA-NeXT, max_new_token=5122026.02 | 88.99 | 89.83 | — | 82.13 | — | |
| Osprey-7B*Model Size=7B2023.12 | 88.97 | 89.47 | 93.4 | 84.93 | 45.47 | |
| AGLAModel=LLaVA-NeXT, max_new_token=5122026.02 | 88.97 | 89.93 | — | 81.2 | — | |
| RegularModel=LLaVA-NeXT, Decoding=Standard greedy, max_new_token=5122026.02 | 88.94 | 89.9 | — | 81.2 | — | |
| M3IDModel=LLaVA-NeXT, max_new_token=5122026.02 | 88.94 | 89.9 | — | 81.2 | — | |
| VTIBackbone=LLaVA-1.5-7b2026.05 | 88.89 | 89.5 | — | — | — | |
| VTIModel=LLaVA-NeXT, max_new_token=5122026.02 | 88.86 | 89.77 | — | 81.6 | — | |
| CMPCDecoding Strategy=Sampling, Backbone=LLaVA-OV2025.01 | 88.83 | 89.52 | — | — | — | |
| OPERABackbone=LLaVA-1.5-7b2026.05 | 88.81 | 89.2 | — | — | — | |
| LLaVA-1.52023.12 | 88.71 | 88.73 | 88.89 | 88.53 | 49.8 | |
| LLaVA1.5 w/ HACLzero-shot=true, HACL=true2023.12 | 88.7 | 88.59 | 98.62 | 80.6 | 44.43 | |
| REVISModel=LLaVA-1.5, max_new_token=5122026.02 | 88.68 | 89.37 | — | 83.33 | — | |
| VTIBackbone=LLaVA-NeXT2026.05 | 88.68 | 89.23 | — | — | — | |
| HalTrapperBackbone=LLaVA v1.5 7B2026.05 | 88.65 | 88.67 | 88.77 | — | — | |
| VCD2026.02 | 88.61 | 89.6 | — | 80.93 | — | |
| LocVLM-B2024.04 | 88.5 | 87.9 | 83.6 | 93.9 | 56.2 | |
| VAFModel=LLaVA-Next2025.11 | 88.45 | 89.31 | — | — | — | |
| VTI2026.02 | 88.35 | 89.4 | — | 80.4 | — | |
| LION2023.11 | 88.33 | 88.97 | 97.12 | 81 | — | |
| Uncertainty-guided self-correction frameworkBase Model=Qwen2.5-VL-7B, Maximum Iterations=3, Crops per iteration=22025.12 | 88.3 | 89.1 | — | — | — | |
| LUREModel=QWEN-VL-Chat2024.02 | 88.28 | 88.67 | — | — | — | |
| Only2026.02 | 88.26 | 89.33 | — | 80.2 | — | |
| MPDModel=LLaVA-1.5-7B2026.04 | 88.2 | 89.31 | 92.41 | 84.1 | — | |
| VCD + CNSModel Backbone=LLaVA-Next2026.01 | 88.18 | 86.96 | — | — | — | |
| Regulardecoding=standard greedy2026.02 | 88.14 | 89.27 | — | 79.73 | — | |
| M3ID2026.02 | 88.14 | 89.27 | — | 79.73 | — | |
| VCD + CNSModel Backbone=LLaVA-1.52026.01 | 88.13 | 87.96 | — | — | — | |
| Ours-7B (Finetuned mPLUG-Owl-7B)Zero-shot=true, Training Data=LRV-Instruction2023.06 | 88 | 86 | — | — | — | |
| V-STARDecoding=Sampling2026.04 | 88 | 87.9 | — | — | — | |
| DePBase Model=LLaVA-1.52026.04 | 88 | 87.2 | 84.1 | 92.2 | — | |
| PAI_CDModel=LLaVA-7B2025.11 | 87.98 | 87.27 | — | — | — | |
| VCD + CNSModel Backbone=InstructBLIP2026.01 | 87.97 | 87.82 | — | — | — | |
| VanillaModel=LLaVA-7B2025.11 | 87.94 | 87.12 | — | — | — | |
| AGLA2026.02 | 87.92 | 89.1 | — | 79.87 | — | |
| Vanilla + CNSModel Backbone=LLaVA-1.52026.01 | 87.89 | 87.76 | — | — | — | |
| mPLUG-Owl22023.12 | 87.85 | 88.28 | 94.34 | 82.2 | 44.91 | |
| VCD + CNSModel Backbone=LLaVA-1.5-13B2026.01 | 87.83 | 86.62 | — | — | — | |
| TARACModel=LLaVA-7B2025.11 | 87.8 | 86.99 | — | — | — | |
| TARACModel=LLaVA-13B2025.11 | 87.8 | 87.02 | — | — | — | |
| VCDBackbone=LLaVA v1.5 7B2026.05 | 87.79 | 87.57 | 86.23 | — | — | |
| VCDDecoding Strategy=Sampling, Backbone=LLaVA-OV2025.01 | 87.78 | 88.69 | — | — | — | |
| LTS-FS(Nullu)Backbone=LLaVA-v1.5-7B2026.03 | 87.64 | — | — | — | — | |
| LLaVA-1.5-13B-HDLLM=Vicuna-13B, Image Size=448x448, Pre-train Sample Size=558K, Fine-tune Sample Size=665K2023.10 | 87.5 | — | — | — | — | |
| LTS-FS(VTI)Backbone=LLaVA-v1.5-13B2026.03 | 87.48 | — | — | — | — | |
| NulluModel=LLaVA-1.5-7B2026.04 | 87.43 | 88.23 | 91.31 | 81.86 | — | |
| PADELVLM Model=LLaVA-1.52026.02 | 87.42 | 86.96 | — | — | — | |
| Vanilla + CNSModel Backbone=LLaVA-1.5-13B2026.01 | 87.36 | 86.28 | — | — | — |