Object Hallucination Assessment on MSCOCO (500 random samples)
53CsBaseline
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaselineDecoding=Nucleus, Backbone=LLaVA-1.52026.04 | 53 | 15.2 | 74.2 | |
| BaselineDecoding=Beam, Backbone=LLaVA-1.52026.04 | 52 | 15.6 | 74.6 | |
| BaselineDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 51.6 | 15.2 | 75.1 | |
| BaselineBase Model=LLaVA-1.5, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 51.3 | 16.8 | — | |
| CCABase Model=LLaVA-1.5, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 48.6 | 13.4 | — | |
| VCDBase Model=LLaVA-1.5, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 48 | 14.3 | — | |
| OPERABase Model=LLaVA-1.5, Sampling Strategy=beam search, Max Sequence Length=512 tokens2025.02 | 45.2 | 12.7 | — | |
| SIDBase Model=LLaVA-1.5, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 45 | 11.7 | — | |
| OPERADecoding=Beam, Backbone=LLaVA-1.52026.04 | 44.6 | 12.8 | — | |
| BaselineBase Model=LLaVA-NeXT, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 42.6 | 14.1 | — | |
| PAIDecoding=Nucleus, Backbone=LLaVA-1.52026.04 | 42 | 13.1 | 72 | |
| VCDBase Model=LLaVA-NeXT, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 41.3 | 12.9 | — | |
| OPERABase Model=LLaVA-NeXT, Sampling Strategy=beam search, Max Sequence Length=512 tokens2025.02 | 39.4 | 11.8 | — | |
| EAZYDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 38.8 | 11.4 | — | |
| SIDBase Model=LLaVA-NeXT, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 38.4 | 11.4 | — | |
| PAIDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 34.5 | 9.1 | 76 | |
| PAIDecoding=Beam, Backbone=LLaVA-1.52026.04 | 33.5 | 9.4 | 75.8 | |
| DACBase Model=LLaVA-1.5, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 30.6 | 12.3 | — | |
| AD-HHDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 29.6 | 8 | — | |
| AllPathDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 26.6 | 7.2 | — | |
| HaloProbe + BeamDecoding=Beam, Backbone=LLaVA-1.52026.04 | 25.2 | 7.2 | 76.1 | |
| DIMLDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 25 | 6.7 | 76.1 | |
| DACBase Model=LLaVA-NeXT, Sampling Strategy=nucleus sampling (p = 1), Max Sequence Length=512 tokens2025.02 | 21.4 | 10.2 | — | |
| HaloProbe + Post-processDecoding=Greedy, Backbone=LLaVA-1.52026.04 | 17.6 | 5.2 | 75.2 | |
| HaloProbe + Post-processDecoding=Nucleus, Backbone=LLaVA-1.52026.04 | 15.6 | 4.2 | 75.4 |