Hallucination Evaluation on CHAIR
72.8CHAIR_sM3ID
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| M3IDBase Model=InstructBLIP2026.01 | 72.8 | 21.1 | — | — | — | |
| AvisCBase Model=InstructBLIP2026.01 | 71 | 20.1 | — | — | — | |
| LLaVA-1.5Backbone=LLaVA-1.5-7B2025.06 | 66.8 | 12.7 | — | — | — | |
| M3IDModel=InstructBLIP, Max Token=1282026.01 | 62.3 | 18.2 | — | — | — | |
| WoodpeckerModel=InstructBLIP, Max Token=1282026.01 | 60.8 | 17.6 | — | — | — | |
| VCDBase Model=InstructBLIP2026.01 | 60.8 | 17.9 | — | — | — | |
| AvisCBase Model=LLaVA-1.52026.01 | 60.4 | 17.2 | — | — | — | |
| DoLaBackbone=InstructBLIP, Max New Tokens=1282026.02 | 60 | 20.1 | — | — | — | |
| ICDBackbone=InstructBLIP, Max New Tokens=1282026.02 | 59.3 | 17.5 | — | — | — | |
| VCDBase Model=LLaVA-1.52026.01 | 57.8 | 16.3 | — | — | — | |
| WoodpeckerModel=LLaVA-1.5, Max Token=1282026.01 | 57.6 | 16.7 | — | — | — | |
| VCDDecoding=Nucleus Sampling, Backbone=LLaVA-1.5, Max generation length=512 tokens2025.11 | 57.5 | 17.2 | — | — | — | |
| VanillaModel=InstructBLIP, Max Token=1282026.01 | 57.4 | 17.6 | — | — | — | |
| DoLaBackbone=LLaVA-1.5, Max New Tokens=1282026.02 | 57 | 15.9 | — | — | — | |
| VCDBackbone=InstructBLIP, Max New Tokens=1282026.02 | 57 | 17 | — | — | — | |
| M3IDBackbone=LLaVA-1.5-7B2025.06 | 57 | 16.57 | — | — | 82.06 | |
| VanillaMax Tokens=128, Model=Shikra2026.03 | 56.8 | 15.6 | — | — | — | |
| M3IDModel=LLaVA-1.5, Max Token=1282026.01 | 56.6 | 15.8 | — | — | — | |
| LLaVA-1.5 + VLfeedbackBackbone=LLaVA-1.5-7B, Learning Objective=VLfeedback2025.06 | 56.3 | 11.4 | — | — | — | |
| M3ID + CNSModel=InstructBLIP, Max Token=1282026.01 | 56.3 | 15.4 | — | — | — | |
| ICDBackbone=LLaVA-1.5, Max New Tokens=1282026.02 | 56.2 | 16.3 | — | — | — | |
| M3IDBase Model=LLaVA-1.52026.01 | 56.2 | 16.4 | — | — | — | |
| InstructBLIPBase Model=InstructBLIP2026.01 | 55.6 | 16.6 | — | — | — | |
| InstructBLIPDecoding Strategy=Greedy2026.03 | 55.6 | 24.2 | — | — | — | |
| VanillaDecoding=Nucleus Sampling, Backbone=LLaVA-1.5, Max generation length=512 tokens2025.11 | 55.6 | 16 | — | — | — | |
| ICDModel=InstructBLIP, Max Token=1282026.01 | 55.2 | 16.2 | — | — | — | |
| LLaVA-1.5Base Model=LLaVA-1.52026.01 | 55.2 | 17.6 | — | — | — | |
| VanillaModel=LLaVA-1.5, Max Token=1282026.01 | 55.1 | 16.4 | — | — | — | |
| VCDModel=InstructBLIP, Max Token=1282026.01 | 55.1 | 15.7 | — | — | — | |
| RegularBackbone=LLaVA-1.5, Max New Tokens=1282026.02 | 55 | 16.3 | — | — | — | |
| AGLAModel=InstructBLIP, Max Token=1282026.01 | 54.8 | 16.2 | — | — | — | |
| ICDModel=LLaVA-1.5, Max Token=1282026.01 | 54.6 | 15.4 | — | — | — | |
| VCDBackbone=LLaVA-1.5, Max New Tokens=1282026.02 | 54.4 | 16.6 | — | — | — | |
| PAIModel=InstructBLIP, Max Token=1282026.01 | 54.2 | 15.6 | — | — | — | |
| OPERAModel=InstructBLIP, Max Token=1282026.01 | 54.2 | 14.8 | — | — | — | |
| LLaVA-1.5 + Human-PreferenceBackbone=LLaVA-1.5-7B, Learning Objective=Human-Preference2025.06 | 54 | 9.3 | — | — | — | |
| RegularBackbone=InstructBLIP, Max New Tokens=1282026.02 | 54 | 18.1 | — | — | — | |
| RegularModel=LLaVA-1.5, Decoding=Standard greedy, max_new_token=5122026.02 | 54 | 15.78 | — | — | — | |
| HALCModel=InstructBLIP, Max Token=1282026.01 | 53.8 | 15.7 | — | — | — | |
| GreedyBackbone=LLaVA-1.5-7B2025.06 | 53.8 | 14.66 | — | — | 82.33 | |
| VanillaDecoding=Nucleus Sampling, Backbone=Idefics2, Max generation length=512 tokens2025.11 | 53.8 | 16.7 | — | — | — | |
| OPERABackbone=InstructBLIP, Max New Tokens=1282026.02 | 53.7 | 12.8 | — | — | — | |
| DoLaBackbone=LLaVA-1.5-7B2025.06 | 53.6 | 14.45 | — | — | 82.27 | |
| VCDModel=LLaVA-1.5, Max Token=1282026.01 | 53.4 | 15.8 | — | — | — | |
| VAFModel=InstructBLIP, Max Token=1282026.01 | 53.4 | 15.1 | — | — | — | |
| VCDDecoding=Nucleus Sampling, Backbone=InstructBLIP, Max generation length=512 tokens2025.11 | 53.3 | 19.8 | — | — | — | |
| PAIModel=LLaVA-1.5, Max Token=1282026.01 | 53.1 | 15.1 | — | — | — | |
| Original2026.03 | 53 | — | — | — | — | |
| LLaVA-1.5 7B2026.02 | 52.93 | 14.99 | — | — | — | |
| LLaVA-1.5-7B2026.05 | 52.8 | 15.9 | — | — | — | |
| VCDBackbone=LLaVA-1.5-7B2025.06 | 52.8 | 15.61 | — | — | 81.84 | |
| VanillaDecoding=Beam Search, Backbone=LLaVA-1.5, Max generation length=512 tokens2025.11 | 52.8 | 15.6 | — | — | — | |
| M3ID + CNSModel=LLaVA-1.5, Max Token=1282026.01 | 52.4 | 14.2 | — | — | — | |
| AGLAModel=LLaVA-1.5, Max Token=1282026.01 | 52.4 | 14.6 | — | — | — | |
| VCDDecoding=Beam Search, Backbone=LLaVA-1.5, Max generation length=512 tokens2025.11 | 52.4 | 15.5 | — | — | — | |
| VARModel=InstructBLIP, Max Token=1282026.01 | 52.3 | 14.7 | — | — | — | |
| Chat-UniViDecoding Strategy=Greedy2026.03 | 52.3 | 16.7 | — | — | — | |
| Vanilla + CNSModel=InstructBLIP, Max Token=1282026.01 | 52.2 | 15.2 | — | — | — | |
| VCD + CNSModel=InstructBLIP, Max Token=1282026.01 | 52.2 | 14.2 | — | — | — | |
| ONLYModel=InstructBLIP, Max Token=1282026.01 | 52.2 | 15.5 | — | — | — | |
| VanillaModel=Qwen-VL, Max Token=1282026.01 | 52.1 | 16.7 | — | — | — | |
| VCDModel=LLaVA-1.5, max_new_token=5122026.02 | 52 | 16.13 | — | — | — | |
| AGLA + CNSModel=InstructBLIP, Max Token=1282026.01 | 51.8 | 15.3 | — | — | — | |
| WoodpeckerModel=Qwen-VL, Max Token=1282026.01 | 51.8 | 16.3 | — | — | — | |
| FarSightBase Model=InstructBLIP2026.03 | 51.8 | 23 | — | — | — | |
| GreedyModel=LLaVA-1.5-7B, Max New Tokens=2562026.03 | 51.8 | 13.7 | — | — | — | |
| OPERAModel=LLaVA-1.5, Max Token=1282026.01 | 51.6 | 14.2 | — | — | — | |
| VCDDecoding=Nucleus Sampling, LVLM=LLAVA-1.5, Maximum new tokens=5122026.04 | 51.6 | 15.3 | — | — | — | |
| ONLY + CNSModel=InstructBLIP, Max Token=1282026.01 | 51.4 | 14.1 | — | — | — | |
| Vanilla + CNSModel=LLaVA-1.5, Max Token=1282026.01 | 51.2 | 14.8 | — | — | — | |
| HALC + CNSModel=InstructBLIP, Max Token=1282026.01 | 51.2 | 14.6 | — | — | — | |
| CAMDBase Model=InstructBLIP2026.03 | 51.2 | 22.5 | — | — | — | |
| HALCModel=LLaVA-1.5, Max Token=1282026.01 | 51 | 14.8 | — | — | — | |
| AGLAModel=LLaVA-1.5, max_new_token=5122026.02 | 51 | 13.64 | — | — | — | |
| VAR + CNSModel=InstructBLIP, Max Token=1282026.01 | 50.9 | 13.5 | — | — | — | |
| LLaVA-1.5-7BBase Model=None2024.05 | 50.8 | 11.7 | — | — | — | |
| SIDBackbone=LLaVA-1.5-7B2025.06 | 50.6 | 13.58 | — | — | 83.34 | |
| ReVisiTBackbone=LLaVA-1.5-7B2025.06 | 50.6 | 13.43 | — | — | 83.17 | |
| AGLA + CNSModel=LLaVA-1.5, Max Token=1282026.01 | 50.4 | 13.6 | — | — | — | |
| VanillaModel=LLaVA-1.5-13B, Max Token=1282026.01 | 50.4 | 14.7 | — | — | — | |
| Video-LLaVADecoding Strategy=Greedy2026.03 | 50.2 | 15.6 | — | — | — | |
| nullu2026.03 | 50.2 | — | — | — | — | |
| VanillaDecoding=Nucleus Sampling, LVLM=LLAVA-1.5, Maximum new tokens=5122026.04 | 50.2 | 16.2 | — | — | — | |
| VCD + CNSModel=LLaVA-1.5, Max Token=1282026.01 | 50.1 | 13.7 | — | — | — | |
| VAFModel=LLaVA-1.5, Max Token=1282026.01 | 50.1 | 14.2 | — | — | — | |
| VARBase Model=LLaVA-1.5 7B2026.02 | 50.09 | 14.77 | — | — | — | |
| ONLYModel=LLaVA-1.5, max_new_token=5122026.02 | 50 | 14.03 | — | — | — | |
| VCDBase Model=LLaVA-1.5 7B2026.02 | 49.81 | 13.69 | — | — | — | |
| ONLYBackbone=LLaVA-1.5, Max New Tokens=1282026.02 | 49.8 | 14.3 | — | — | — | |
| ONLYModel=LLaVA-1.5, Max Token=1282026.01 | 49.8 | 14.3 | — | — | — | |
| ICDModel=Qwen-VL, Max Token=1282026.01 | 49.8 | 16.2 | — | — | — | |
| M3IDModel=Qwen-VL, Max Token=1282026.01 | 49.8 | 17.4 | — | — | — | |
| AGLAModel=Qwen-VL, Max Token=1282026.01 | 49.8 | 15.6 | — | — | — | |
| VCDDecoding=Greedy, Backbone=LLaVA-1.5, Max generation length=512 tokens2025.11 | 49.8 | 14.5 | — | — | — | |
| HALC + CNSModel=LLaVA-1.5, Max Token=1282026.01 | 49.6 | 14.1 | — | — | — | |
| VARModel=LLaVA-1.5, Max Token=1282026.01 | 49.6 | 14.1 | — | — | — | |
| HALCModel=Qwen-VL, Max Token=1282026.01 | 49.6 | 15.4 | — | — | — | |
| PAIModel=Qwen-VL, Max Token=1282026.01 | 49.4 | 15.6 | — | — | — | |
| VCDMax Tokens=128, Model=Shikra2026.03 | 49.4 | 13.4 | — | — | — | |
| DoLaDecoding=Nucleus Sampling, Backbone=LLaVA-1.5, Max generation length=512 tokens2025.11 | 49.3 | 14.8 | — | — | — |