Object Hallucination Evaluation on A-OKVQA POPE (Popular)
90.3AccuracySECOND
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=true2025.06 | 90.3 | — | 90.5 | 90.4 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=false2025.06 | 89.9 | — | 87.6 | 89.6 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=true2025.06 | 89.9 | — | 92.5 | 90.7 | |
| SIRABackbone=Qwen2.5-VL2026.05 | 89.67 | — | — | 89.7 | |
| VCDBackbone=Qwen-VL2026.06 | 89.53 | — | — | 89.34 | |
| CAIBackbone=Qwen-VL2026.06 | 89.53 | — | — | 89.43 | |
| baselineModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=false2025.06 | 89.3 | — | 85.6 | 88.9 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=true2025.06 | 89.3 | — | 85.4 | 89.1 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=false2025.06 | 89.1 | — | 86.7 | 88.8 | |
| MaskCDBackbone=Qwen2.5-VL2026.05 | 89.05 | — | — | 89.15 | |
| VCDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=true2025.06 | 89 | — | 86.7 | 88.7 | |
| ONLYBackbone=Qwen-VL2026.06 | 88.83 | — | — | 88.46 | |
| baselineModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=false2025.06 | 88.7 | — | 88.2 | 88.7 | |
| SECONDModel=LLaVA-OneVision (SigLIP-384), LLM=Qwen2-0.5B, CD=false2025.06 | 88.7 | — | 83.8 | 88.1 | |
| SECONDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=false2025.06 | 88.4 | — | 86.8 | 88.2 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Mistral-7B, CD=true2025.06 | 88.2 | — | 88 | 88.3 | |
| VCDModel=LLaVA-Next (CLIP-336), LLM=Vicuna-7B, CD=true2025.06 | 88 | — | 88.3 | 88.1 | |
| OPERABackbone=Qwen2.5-VL2026.05 | 87.91 | — | — | 87.13 | |
| VCDBackbone=Qwen2.5-VL2026.05 | 87.85 | — | — | 87.81 | |
| CoFi-DecModel=Qwen-VL2025.12 | 87.71 | 90.96 | — | 87.26 | |
| SIDBackbone=Qwen2.5-VL2026.05 | 87.62 | — | — | 87.41 | |
| DoLaBackbone=Qwen2.5-VL2026.05 | 87.53 | — | — | 86.06 | |
| ICTBackbone=Qwen2.5-VL2026.05 | 87.43 | — | — | 86.39 | |
| PAIBackbone=Qwen-VL2026.06 | 87.37 | — | — | 86.17 | |
| HDDModel=LLaVA-NeXT2025.12 | 86.8 | — | — | 87.2 | |
| M3IDModel=Qwen-VL2025.12 | 86.5 | 89.59 | — | 85.95 | |
| DeGFModel=Qwen-VL2025.12 | 86.47 | 90.74 | — | 86.52 | |
| RITUALModel=Qwen-VL2025.12 | 86.36 | 88.73 | — | 86.2 | |
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=true2025.06 | 86.3 | — | 87.7 | 86.5 | |
| VCDModel=Qwen-VL2025.12 | 86.23 | 87.3 | — | 86.03 | |
| RegularBackbone=Qwen-VL2026.06 | 86 | — | — | 84.78 | |
| HALCModel=LLaVA-NeXT2025.12 | 85.9 | — | — | 84.7 | |
| BaseBackbone=Qwen2.5-VL2026.05 | 85.77 | — | — | 84.49 | |
| CMPCBase Model=LLaVA 1.52025.01 | 85.73 | 86.66 | 84.47 | 85.55 | |
| SECONDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=false2025.06 | 85.6 | — | 80.1 | 84.8 | |
| HDDModel=LLaVA-1.52025.12 | 85 | — | — | 85.1 | |
| CAIBackbone=InstructBLIP2026.06 | 84.87 | — | — | 85.4 | |
| VCDModel=LLaVA-NeXT2025.12 | 84.8 | — | — | 86.7 | |
| HALCModel=LLaVA-1.52025.12 | 84.7 | — | — | 84.3 | |
| RegularModel=Qwen-VL2025.12 | 84.6 | 87.99 | — | 83.88 | |
| CAIBackbone=LLaVA-1.52026.06 | 84.6 | — | — | 85.23 | |
| BeamModel=LLaVA-NeXT2025.12 | 84.5 | — | — | 83.3 | |
| OPERAModel=LLaVA-NeXT2025.12 | 84.3 | — | — | 85 | |
| baselineModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=false2025.06 | 84 | — | 77 | 82.8 | |
| SIRABackbone=LLaVA-v1.52026.05 | 83.77 | — | — | 84.73 | |
| ICTBackbone=LLaVA-v1.52026.05 | 83.4 | — | — | 84.45 | |
| OPERABackbone=LLaVA-v1.52026.05 | 83.22 | — | — | 84.15 | |
| MaskCDBackbone=LLaVA-v1.52026.05 | 83.05 | — | — | 83.75 | |
| ICDBase Model=LLaVA 1.52025.01 | 82.63 | 84.25 | 80.27 | 82.21 | |
| CMPCBase Model=InstructBLIP2025.01 | 82.6 | 80.64 | 85.8 | 83.14 | |
| SIDBackbone=LLaVA-v1.52026.05 | 82.48 | — | — | 83.2 | |
| VCDModel=Yi-VL (CLIP-448), LLM=Yi-6B, CD=true2025.06 | 82.1 | — | 79.1 | 81.6 | |
| VCDBackbone=LLaVA-v1.52026.05 | 81.85 | — | — | 82.82 | |
| VCDBase Model=LLaVA 1.52025.01 | 81.85 | 78.6 | 87.53 | 82.82 | |
| ICDBase Model=InstructBLIP2025.01 | 81.64 | 78.5 | 88.77 | 83.32 | |
| HDDModel=InstructBLIP2025.12 | 81.6 | — | — | 82.9 | |
| HALCModel=InstructBLIP2025.12 | 81.4 | — | — | 80.8 | |
| BeamModel=InstructBLIP2025.12 | 81 | — | — | 82.2 | |
| VCDModel=InstructBLIP2025.12 | 80.8 | — | — | 81.9 | |
| CoFi-DecModel=InstructBLIP2025.12 | 80.79 | 76.29 | — | 83.76 | |
| DeGFModel=InstructBLIP2025.12 | 80.47 | 75.61 | — | 82.35 | |
| CoFi-DecModel=LLaVA-1.52025.12 | 80.11 | 72.64 | — | 82.36 | |
| OPERAModel=LLaVA-1.52025.12 | 79.9 | — | — | 82.5 | |
| BaseBackbone=LLaVA-v1.52026.05 | 79.9 | — | — | 79.59 | |
| BaselineBase Model=LLaVA 1.52025.01 | 79.9 | 80.85 | 78.36 | 79.59 | |
| VCDBase Model=InstructBLIP2025.01 | 79.78 | 76 | 87.05 | 81.15 | |
| VCDModel=LLaVA-1.52025.12 | 79.5 | — | — | 82.6 | |
| OPERAModel=InstructBLIP2025.12 | 79.5 | — | — | 81.8 | |
| ONLYBackbone=LLaVA-1.52026.06 | 79.4 | — | — | 81.86 | |
| DeGFModel=LLaVA-1.52025.12 | 79.07 | 72.11 | — | 81.09 | |
| VCDBackbone=InstructBLIP2026.06 | 78.97 | — | — | 80.76 | |
| RITUALModel=LLaVA-1.52025.12 | 78.83 | 71.99 | — | 81.68 | |
| M3IDModel=InstructBLIP2025.12 | 78.8 | 73.38 | — | 81 | |
| RITUALModel=InstructBLIP2025.12 | 78.73 | 72.83 | — | 81.17 | |
| BeamModel=LLaVA-1.52025.12 | 78.7 | — | — | 81.7 | |
| VCDModel=InstructBLIP2025.12 | 78.63 | 73.53 | — | 80.72 | |
| M3IDModel=LLaVA-1.52025.12 | 77.8 | 70.98 | — | 80.91 | |
| VCDBackbone=LLaVA-1.52026.06 | 77.2 | — | — | 80.54 | |
| ONLYBackbone=InstructBLIP2026.06 | 76.73 | — | — | 80.07 | |
| VCDModel=LLaVA-1.52025.12 | 76.63 | 69.59 | — | 80.19 | |
| DoLaBackbone=LLaVA-v1.52026.05 | 76.47 | — | — | 79.86 | |
| PAIBackbone=InstructBLIP2026.06 | 76.47 | — | — | 79.61 | |
| PAIBackbone=LLaVA-1.52026.06 | 76.37 | — | — | 79.79 | |
| BaselineBase Model=InstructBLIP2025.01 | 76.19 | 72.16 | 85.28 | 78.17 | |
| RegularBackbone=LLaVA-1.52026.06 | 75.3 | — | — | 78.99 | |
| RegularModel=InstructBLIP2025.12 | 75.17 | 70.15 | — | 77.91 | |
| RegularModel=LLaVA-1.52025.12 | 75.07 | 68.58 | — | 78.77 | |
| RegularBackbone=InstructBLIP2026.06 | 74.8 | — | — | 77.98 | |
| VCDModel=Qwen-VL, Decoding=VCD2026.01 | 61.1 | 61.9 | 56.93 | 59.22 | |
| Regular DecodingModel=Qwen-VL, Decoding=Regular2026.01 | 60.4 | 62.06 | 53.53 | 57.48 | |
| SDCDModel=Qwen-VL, Decoding=SDCD2026.01 | 60.13 | 60.86 | 56.8 | 58.76 |