Object Hallucination Evaluation on MS-COCO POPE (Popular)
90.76AccuracyAVISC
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AVISCModel=Qwen2.5-VL-7B2024.05 | 90.76 | 90.16 | — | — | |
| AVISCModel=LLaVA-OneVision (Qwen2-7B)2024.05 | 89.86 | 89.45 | — | — | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=true2025.06 | 89.7 | 89.2 | — | 85.1 | |
| SIRABackbone=Qwen2.5-VL2026.05 | 89.7 | 89.12 | — | — | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=true2025.06 | 89.3 | 88.8 | — | 84.8 | |
| MaskCDBackbone=Qwen2.5-VL2026.05 | 88.65 | 88.45 | — | — | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=false2025.06 | 88.6 | 87.5 | — | 80.1 | |
| M3IDModel=Qwen2.5-VL-7B2024.05 | 88.5 | 85.36 | — | — | |
| baselineModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=false2025.06 | 88.4 | 87.4 | — | 80 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=false2025.06 | 88.3 | 87.3 | — | 80.2 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=true2025.06 | 88.2 | 87.3 | — | 81.1 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=false2025.06 | 88.1 | 86.9 | — | 79.5 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=true2025.06 | 87.9 | 86.9 | — | 79.7 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=false2025.06 | 87.7 | 86.5 | — | 78.8 | |
| CoFi-DecModel=LLaVA-1.52025.12 | 87.67 | 88.43 | 85.25 | — | |
| MESAModel=LLaVA-v1.52026.04 | 87.63 | 87.32 | 89.56 | 85.2 | |
| M3IDModel=LLaVA-OneVision (Qwen2-7B)2024.05 | 87.6 | 85.65 | — | — | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=false2025.06 | 87.6 | 86.3 | — | 78.1 | |
| OPERABackbone=Qwen2.5-VL2026.05 | 87.44 | 86.68 | — | — | |
| BRACSBackbone=Qwen-VL-Chat, Decoding Strategy=BRACS2026.05 | 87.43 | 86.18 | — | — | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=true2025.06 | 87.4 | 86.6 | — | 80.8 | |
| VCDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=true2025.06 | 87.4 | 86.4 | — | 79.7 | |
| VDD-NoneBackbone=Qwen-VL-Chat, Decoding Strategy=VDD-None2026.05 | 87.33 | 86.16 | — | — | |
| VEGASBase Model=LLaVA-1.5, Decoding Strategy=Greedy2025.12 | 87.3 | 87.37 | — | — | |
| VCDModel=LLaVA-OneVision (Qwen2-7B)2024.05 | 87.2 | 86.5 | — | — | |
| MESAModel=Qwen-VL2026.04 | 87.2 | 86.51 | 94.41 | 79.87 | |
| RVEBase Model=LLaVA-1.5-7B2026.05 | 87.17 | 86.59 | — | — | |
| VCDModel=Qwen-VL2026.04 | 87.12 | 86.4 | 91.49 | 81.85 | |
| VCDBackbone=Qwen2.5-VL2026.05 | 87.12 | 86.4 | — | — | |
| VCDModel=Qwen2.5-VL-7B2024.05 | 87.1 | 86.21 | — | — | |
| SchroMindModel=LLaVA-1.5-7B2026.02 | 87.1 | 87.48 | — | — | |
| BRACSBackbone=LLaVA-1.5-7B, Decoding Strategy=BRACS2026.05 | 87.1 | 86.91 | — | — | |
| ICTModel=Qwen-VL2026.04 | 87.03 | 86.15 | 94.08 | 79.46 | |
| SIDBackbone=Qwen2.5-VL2026.05 | 86.9 | 86 | — | — | |
| CMPCBase Model=LLaVA 1.52025.01 | 86.9 | 86.01 | 92.28 | 80.53 | |
| SIRABackbone=LLaVA-v1.52026.05 | 86.83 | 86.51 | — | — | |
| PAIBackbone=Qwen-VL-Chat, Decoding Strategy=PAI2026.05 | 86.8 | 85.72 | — | — | |
| VAFBase Model=LLaVA-1.5-7B2026.05 | 86.77 | 86.11 | — | — | |
| ICTModel=LLaVA-1.5-7B2026.02 | 86.76 | 86.4 | — | — | |
| ICTBackbone=Qwen2.5-VL2026.05 | 86.76 | 84.94 | — | — | |
| VISTABase Model=LLaVA-1.5, Decoding Strategy=Greedy2025.12 | 86.73 | 87.15 | — | — | |
| OPERAModel=LLaVA-1.5-7B2026.02 | 86.64 | 86.62 | — | — | |
| OPERABackbone=LLaVA-v1.52026.05 | 86.64 | 84.89 | — | — | |
| DeGFModel=Qwen-VL2025.12 | 86.5 | 85.71 | 86.87 | — | |
| VAFModel=LLaVA-v1.52026.04 | 86.46 | 85.09 | 94.68 | 77.26 | |
| VTIModel=LLaVA-v1.52026.04 | 86.37 | 85.2 | 93.19 | 78.47 | |
| VTIModel=Qwen-VL2026.04 | 86.37 | 85.29 | 92.58 | 79.07 | |
| CoFi-DecModel=Qwen-VL2025.12 | 86.34 | 86.38 | 91.24 | — | |
| M3IDModel=Qwen-VL2025.12 | 86.27 | 85.73 | 89.19 | — | |
| MaskCDBackbone=LLaVA-v1.52026.05 | 86.25 | 86 | — | — | |
| VCDBase Model=LLaVA-1.5-7B2026.05 | 86.2 | 85.98 | — | — | |
| DeGFModel=LLaVA-1.52025.12 | 86.1 | 86.37 | 84.73 | — | |
| PNDModel=LLaVA1.5-7B2026.04 | 86.1 | 88.79 | 98.41 | 80.87 | |
| ICTBackbone=LLaVA-v1.52026.05 | 86.07 | 86.4 | — | — | |
| PAIBase Model=LLaVA-1.5, Decoding Strategy=Greedy2025.12 | 86.06 | 86.42 | — | — | |
| NulluModel=LLaVA-v1.52026.04 | 86.06 | 85.88 | 87 | 84.8 | |
| DoLaBackbone=Qwen2.5-VL2026.05 | 85.93 | 84.41 | — | — | |
| VCDBackbone=Qwen-VL-Chat, Decoding Strategy=VCD2026.05 | 85.93 | 84.3 | — | — | |
| VanillaBase Model=LLaVA-1.5, Decoding Strategy=Greedy2025.12 | 85.9 | 86.32 | — | — | |
| VCDBase Model=LLaVA-1.5, Decoding Strategy=Greedy2025.12 | 85.88 | 86.03 | — | — | |
| ICTModel=LLaVA-v1.52026.04 | 85.86 | 84.36 | 94.38 | 76.26 | |
| RITUALModel=LLaVA-1.52025.12 | 85.83 | 86.17 | 84.17 | — | |
| VanillaBase Model=LLaVA-1.5-7B2026.05 | 85.83 | 84.33 | — | — | |
| SIDBackbone=LLaVA-v1.52026.05 | 85.83 | 85.44 | — | — | |
| SPINBackbone=LLaVA-1.5-7B, Decoding Strategy=SPIN2026.05 | 85.83 | 84.33 | — | — | |
| VCDModel=Qwen-VL, Decoding=VCD2026.01 | 85.8 | 84.15 | 94.37 | 75.93 | |
| AVISCModel=LLaVA-1.5 (13B)2024.05 | 85.73 | 86.53 | 81.94 | 91.67 | |
| MoDModel=LLaVA-v1.52025.05 | 85.7 | 86.1 | 84.1 | 88.1 | |
| VAFModel=Qwen-VL2026.04 | 85.63 | 83.87 | 95.56 | 74.73 | |
| MoDModel=Qwen-VL2025.05 | 85.6 | 83.7 | 96.3 | 74 | |
| SPINBackbone=Qwen-VL-Chat, Decoding Strategy=SPIN2026.05 | 85.53 | 83.71 | — | — | |
| MoDModel=LLaVA-NEXT2025.05 | 85.5 | 83.8 | 95.1 | 74.9 | |
| GreedyBackbone=LLaVA-1.5-7B, Decoding Strategy=Greedy2026.05 | 85.5 | 83.84 | — | — | |
| GreedyBackbone=Qwen-VL-Chat, Decoding Strategy=Greedy2026.05 | 85.47 | 83.62 | — | — | |
| NulluModel=Qwen-VL2026.04 | 85.43 | 85.21 | 86.52 | 83.93 | |
| VCDModel=LLaVA-1.5-7B2026.02 | 85.38 | 85.06 | — | — | |
| VCDModel=LLaVA-v1.52026.04 | 85.38 | 85.06 | 86.92 | 83.28 | |
| VCDBackbone=LLaVA-v1.52026.05 | 85.38 | 85.06 | — | — | |
| VCDBase Model=LLaVA 1.52025.01 | 85.38 | 85.06 | 86.92 | 83.28 | |
| VDD-NoneBackbone=LLaVA-1.5-7B, Decoding Strategy=VDD-None2026.05 | 85.27 | 85.94 | — | — | |
| AGLAModel=LLaVA1.5-7B2026.04 | 85.21 | 87.34 | 94.92 | 80.87 | |
| VCDModel=Qwen-VL2025.12 | 85.13 | 84.69 | 87.27 | — | |
| VanillaModel=Qwen-VL2026.04 | 85.1 | 84.78 | 86.63 | 83 | |
| baseModel=Qwen2.5-VL-7B2024.05 | 85.05 | 83.72 | — | — | |
| SDCDModel=Qwen-VL, Decoding=SDCD2026.01 | 84.93 | 83.07 | 94.79 | 73.93 | |
| VCDModel=Qwen-VL2025.05 | 84.9 | 83.6 | 94.5 | 74.9 | |
| VCDModel=LLaVA1.5-7B2026.04 | 84.89 | 85.16 | 93.86 | 77.92 | |
| VEGASBase Model=Shikra, Decoding Strategy=Greedy2025.12 | 84.87 | 84.93 | — | — | |
| PNDModel=InstructBLIP-7B2026.04 | 84.83 | 84.2 | 87.83 | 80.86 | |
| PAIBackbone=LLaVA-1.5-7B, Decoding Strategy=PAI2026.05 | 84.73 | 85.63 | — | — | |
| RegularModel=Qwen-VL2025.12 | 84.7 | 83.96 | 88.24 | — | |
| VCDBackbone=LLaVA-1.5-7B, Decoding Strategy=VCD2026.05 | 84.67 | 83.48 | — | — | |
| baseModel=LLaVA-OneVision (Qwen2-7B)2024.05 | 84.6 | 83.79 | — | — | |
| RITUALModel=Qwen-VL2025.12 | 84.57 | 84.67 | 84.09 | — | |
| BaseBackbone=Qwen2.5-VL2026.05 | 84.53 | 82.58 | — | — | |
| VCDModel=LLaVA-NEXT2025.05 | 84.5 | 82.9 | 92.9 | 74.8 | |
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=true2025.06 | 84.5 | 84.3 | — | 83.4 | |
| VAFModel=LLaVA1.5-7B2026.04 | 84.5 | 86.49 | 95.76 | 78.85 | |
| AVISCModel=LLaVA-1.52024.05 | 84.33 | 84.96 | 81.71 | 88.47 | |
| AVISCModel=LLaVA-1.5-7B2026.02 | 84.33 | 84.96 | — | — |