Object Hallucination on MSCOCO 500 images 2014 (val)
60.6Consistency Score (CS)BeamSearch
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BeamSearchBase Model=LLaVA-v1.5-7B2026.01 | 60.6 | 19.5 | |
| VanillaBase Model=LLaVA-v1.5-7B2026.01 | 59.3 | 18.2 | |
| GreedyBackbone=InstructBLIP, Max New Tokens=5122023.11 | 58.8 | 23.7 | |
| GreedyBackbone=Shikra, Max New Tokens=5122023.11 | 55.8 | 15.4 | |
| DoLaBackbone=Shikra, Max New Tokens=5122023.11 | 55.8 | 15.1 | |
| Beam SearchBackbone=InstructBLIP, Max New Tokens=5122023.11 | 55.6 | 15.8 | |
| Nucleus SamplingBackbone=Shikra, Max New Tokens=5122023.11 | 55.6 | 15.4 | |
| Nucleus SamplingBackbone=InstructBLIP, Max New Tokens=5122023.11 | 54.6 | 24.8 | |
| VCDBase Model=LLaVA-v1.5-7B2026.01 | 52.2 | 15.8 | |
| Beam SearchBackbone=Shikra, Max New Tokens=5122023.11 | 50.4 | 13.3 | |
| Nucleus SamplingBackbone=LLaVA-1.5, Max New Tokens=5122023.11 | 48.8 | 14.2 | |
| Beam SearchBackbone=LLaVA-1.5, Max New Tokens=5122023.11 | 48.8 | 13.9 | |
| DoLaBackbone=InstructBLIP, Max New Tokens=5122023.11 | 48.4 | 15.9 | |
| DoLaBackbone=LLaVA-1.5, Max New Tokens=5122023.11 | 47.8 | 13.8 | |
| PAIBase Model=LLaVA-v1.5-7B2026.01 | 46.7 | 14.4 | |
| OPERABackbone=InstructBLIP, Max New Tokens=5122023.11 | 46.4 | 14.2 | |
| GreedyBackbone=LLaVA-1.5, Max New Tokens=5122023.11 | 45 | 14.7 | |
| VIB-ProbeBase Model=LLaVA-v1.5-7B2026.01 | 44.9 | 14.1 | |
| OPERABackbone=LLaVA-1.5, Max New Tokens=5122023.11 | 44.6 | 12.8 | |
| VanillaBase Model=LLaVA-v1.6-7B2026.01 | 40.7 | 11.8 | |
| BeamSearchBase Model=LLaVA-v1.6-7B2026.01 | 39.2 | 10.9 | |
| VCDBase Model=LLaVA-v1.6-7B2026.01 | 36.4 | 9 | |
| OPERABackbone=Shikra, Max New Tokens=5122023.11 | 36.2 | 12.1 | |
| PAIBase Model=LLaVA-v1.6-7B2026.01 | 35.3 | 9.2 | |
| Nucleus SamplingBackbone=MiniGPT-4, Max New Tokens=5122023.11 | 32.6 | 10.7 | |
| DoLaBackbone=MiniGPT-4, Max New Tokens=5122023.11 | 32.2 | 10 | |
| VIB-ProbeBase Model=LLaVA-v1.6-7B2026.01 | 32.1 | 8.7 | |
| GreedyBackbone=MiniGPT-4, Max New Tokens=5122023.11 | 31.8 | 9.9 | |
| Beam SearchBackbone=MiniGPT-4, Max New Tokens=5122023.11 | 30.6 | 9.5 | |
| NucleusModel=InstructBLIP, Max new tokens=642023.11 | 30.4 | 15.7 | |
| GreedyModel=InstructBLIP, Max new tokens=642023.11 | 30 | 14.5 | |
| OPERABackbone=MiniGPT-4, Max New Tokens=5122023.11 | 26.2 | 9.5 | |
| NucleusModel=LLaVA-1.5, Max new tokens=642023.11 | 26.2 | 8.5 | |
| GreedyModel=MiniGPT-4, Max new tokens=642023.11 | 24.2 | 8.2 | |
| DoLaModel=MiniGPT-4, Max new tokens=642023.11 | 24.2 | 8.2 | |
| NucleusModel=MiniGPT-4, Max new tokens=642023.11 | 23.6 | 8.3 | |
| Beam SearchModel=MiniGPT-4, Max new tokens=642023.11 | 23.6 | 7.8 | |
| OPERAModel=MiniGPT-4, Max new tokens=642023.11 | 22.6 | 8.2 | |
| NucleusModel=Shikra, Max new tokens=642023.11 | 22.6 | 7.6 | |
| DoLaModel=InstructBLIP, Max new tokens=642023.11 | 22.2 | 7.1 | |
| GreedyModel=Shikra, Max new tokens=642023.11 | 22 | 7 | |
| Beam SearchModel=InstructBLIP, Max new tokens=642023.11 | 21.4 | 7.2 | |
| GreedyModel=LLaVA-1.5, Max new tokens=642023.11 | 20.6 | 6.2 | |
| DoLaModel=LLaVA-1.5, Max new tokens=642023.11 | 20.4 | 6.3 | |
| Beam SearchModel=Shikra, Max new tokens=642023.11 | 20.2 | 6.4 | |
| DoLaModel=Shikra, Max new tokens=642023.11 | 20.2 | 6.3 | |
| Beam SearchModel=LLaVA-1.5, Max new tokens=642023.11 | 18.8 | 5.9 | |
| OPERAModel=InstructBLIP, Max new tokens=642023.11 | 16.6 | 6.8 | |
| OPERAModel=LLaVA-1.5, Max new tokens=642023.11 | 14.2 | 5.2 | |
| OPERAModel=Shikra, Max new tokens=642023.11 | 14.2 | 5.9 |