Hallucination Evaluation on Object HalBench
54.7CHAIR Score (s)LLaVA-1.5-7B
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| LLaVA-1.5-7BModel Version=1.5, Parameters=7B2026.05 | 54.7 | 27.6 | — | — | — | — | — | |
| LLaVA-RLHFData Size=122k, Feedback=Self-Reward, Model Scale=7B2026.04 | 53.6 | 14.8 | — | — | — | — | — | |
| LLaVA-v1.5-7BBase Model=LLaVA-v1.5-7B2026.05 | 53.6 | 25.2 | — | — | — | — | — | |
| VCDModel Scale=7B2026.04 | 53.3 | 15.7 | — | — | — | — | — | |
| baselineModel=LLaVA-v1.5-7B2026.02 | 52.7 | 28 | — | — | — | — | — | |
| LBR2026.05 | 52.2 | 26.7 | — | — | — | — | — | |
| LLaVA-1.5-7BModel Scale=7B2026.04 | 51.4 | 14.8 | — | — | — | — | — | |
| LLaVA-1.5-13BModel Scale=13B2026.04 | 50.4 | 14.3 | — | — | — | — | — | |
| BaselineModel=LLaVA-1.52026.02 | 48.1 | 24.7 | 45.3 | 283 | — | — | — | |
| VCDModel Scale=13B2026.04 | 47.7 | 13.2 | — | — | — | — | — | |
| LLaVA-RLHFData Size=122k, Feedback=Self-Reward, Model Scale=13B2026.04 | 47 | 12.4 | — | — | — | — | — | |
| CCA-LLaVABase Model=LLaVA-v1.5-7B2026.05 | 46.7 | 23.8 | — | — | — | — | — | |
| LLaVA-v1.5-13BBase Model=LLaVA-v1.5-13B2026.05 | 46.3 | 22.6 | — | — | — | — | — | |
| baselineModel=LLaVA-v1.5-13B2026.02 | 46 | 23 | — | — | — | — | — | |
| POVIDData Size=17k, Feedback=GPT-4V, Model Scale=7B2026.04 | 45.8 | 13.9 | — | — | — | — | — | |
| HALVAData Size=21.5k, Feedback=GPT-4V, Model Scale=13B2026.04 | 45.4 | 12.8 | — | — | — | — | — | |
| HALVAData Size=21.5k, Feedback=GPT-4V, Model Scale=7B2026.04 | 41.4 | 11.7 | — | — | — | — | — | |
| BaselineModel=InstructBLIP2026.02 | 39.6 | 21.1 | 37.7 | 287 | — | — | — | |
| Re-AlignModel=LLaVA-v1.5-13B2026.02 | 38.4 | 19.3 | — | — | — | — | — | |
| HA-DPOModel=LLaVA-v1.5-7B2026.02 | 37 | 20.9 | — | — | — | — | — | |
| Re-AlignModel=LLaVA-v1.5-7B2026.02 | 36.2 | 16.3 | — | — | — | — | — | |
| mDPOData Size=10k, Feedback=GPT-4V, Model Scale=7B2026.04 | 35.7 | 9.8 | — | — | — | — | — | |
| mDPOBase Model=LLaVA-v1.5-7B2026.05 | 35.7 | 9.8 | — | — | — | — | — | |
| oDPOData Size=19k, Feedback=GPT-4V, Model Scale=13B2026.04 | 34.7 | 9.8 | — | — | — | — | — | |
| oDPOData Size=19k, Feedback=GPT-4V, Model Scale=7B2026.04 | 34.3 | 9.5 | — | — | — | — | — | |
| POVIDModel=LLaVA-v1.5-7B2026.02 | 33.4 | 16.6 | — | — | — | — | — | |
| mDPOModel=LLaVA-v1.5-13B2026.02 | 33.3 | 16.6 | — | — | — | — | — | |
| AMP-MEGBase Model=LLaVA-v1.5-13B2026.05 | 31.7 | 20.6 | — | — | — | — | — | |
| mDPOModel=LLaVA-v1.5-7B2026.02 | 30.7 | 16 | — | — | — | — | — | |
| BaselineModel=MiniGPT-42026.02 | 27.5 | 14.5 | 26.3 | 287 | — | — | — | |
| GRIT-3BBackbone=GRIT-3B2026.03 | 23.8 | 10.5 | — | — | — | — | — | |
| KVSmooth (Ours)Model=InstructBLIP2026.02 | 23.7 | 13.3 | 22 | 278 | — | — | — | |
| R1-Onevision-7BBackbone=R1-Onevision-7B2026.03 | 23.2 | 9.4 | — | — | — | — | — | |
| PixelReasoner-7BBackbone=PixelReasoner-7B2026.03 | 22 | 7.8 | — | — | — | — | — | |
| DoLaBackbone=GRIT-3B2026.03 | 21.6 | 8 | — | — | — | — | — | |
| DoLaBackbone=R1-Onevision-7B2026.03 | 21.4 | 9.8 | — | — | — | — | — | |
| VCDBackbone=R1-Onevision-7B2026.03 | 21 | 8 | — | — | — | — | — | |
| DoLaBackbone=PixelReasoner-7B2026.03 | 20.6 | 7.1 | — | — | — | — | — | |
| VCDBackbone=GRIT-3B2026.03 | 20.4 | 7.9 | — | — | — | — | — | |
| VCDBackbone=PixelReasoner-7B2026.03 | 19.8 | 7.2 | — | — | — | — | — | |
| MemVRBackbone=GRIT-3B2026.03 | 19.4 | 8.1 | — | — | — | — | — | |
| MemVRBackbone=PixelReasoner-7B2026.03 | 19.4 | 6.3 | — | — | — | — | — | |
| FlexACBackbone=GRIT-3B2026.03 | 19.2 | 7.4 | — | — | — | — | — | |
| MemVRBackbone=R1-Onevision-7B2026.03 | 19.2 | 7.5 | — | — | — | — | — | |
| FlexACBackbone=PixelReasoner-7B2026.03 | 18.8 | 6.5 | — | — | — | — | — | |
| FlexACBackbone=R1-Onevision-7B2026.03 | 18.4 | 6.8 | — | — | — | — | — | |
| KVSmooth (Ours)Model=LLaVA-1.52026.02 | 17.5 | 9 | 16.7 | 286 | — | — | — | |
| OursBackbone=GRIT-3B2026.03 | 16 | 5.5 | — | — | — | — | — | |
| KVSmooth (Ours)Model=MiniGPT-42026.02 | 15.8 | 8.6 | 15.7 | 279 | — | — | — | |
| OursBackbone=R1-Onevision-7B2026.03 | 15.8 | 5.7 | — | — | — | — | — | |
| OursBackbone=PixelReasoner-7B2026.03 | 15.4 | 5.3 | — | — | — | — | — | |
| Qwen2-VL-2B-InstructMethod=baseline2026.02 | 15.3 | 8.6 | — | — | — | — | — | |
| Qwen2.5-VL-7B-InstructMethod=baseline2026.02 | 15 | 9.2 | — | — | — | — | — | |
| Qwen2-VL-7B-InstructMethod=baseline2026.02 | 14.3 | 8.5 | — | — | — | — | — | |
| GPT-4VBase Model=Proprietary2026.05 | 13.6 | 7.3 | — | — | — | — | — | |
| MFPOBase Model=LLaVA-v1.5-7B2026.05 | 13.4 | 6.6 | — | — | — | — | — | |
| OPA-DPOBase Model=LLaVA-v1.5-7B2026.05 | 13 | 4.3 | — | — | — | — | — | |
| SENTINELData Size=8.6k, Feedback=Self, Model Scale=7B2026.04 | 12.6 | 4 | — | — | — | — | — | |
| LBPBase Model=LLaVA-v1.5-7B2026.05 | 12.3 | 6.3 | — | — | — | — | — | |
| AVES-DPOData Size=5.2k, Feedback=Self, Model Scale=7B2026.04 | 12.2 | 3.9 | — | — | — | — | — | |
| RLHF-VBase Model=LLaVA-v1.5-13B2026.05 | 12.2 | 7.5 | — | — | — | — | — | |
| SENTINELData Size=7k, Feedback=Self, Model Scale=13B2026.04 | 11.8 | 3.3 | — | — | — | — | — | |
| MFPOBase Model=LLaVA-v1.5-13B2026.05 | 11.4 | 4.6 | — | — | — | — | — | |
| AVES-DPOData Size=4.6k, Feedback=Self, Model Scale=13B2026.04 | 11.3 | 3 | — | — | — | — | — | |
| LBPBase Model=LLaVA-v1.5-13B2026.05 | 10.7 | 4.2 | — | — | — | — | — | |
| RLAIF-VBase Model=LLaVA-v1.5-7B2026.05 | 10.5 | 5.2 | — | — | — | — | — | |
| RLAIF-VModel=LLaVA-v1.5-7B2026.02 | 7.8 | 4.2 | — | — | — | — | — | |
| vanilla-DPOModel=LLaVA-v1.5-13B2026.02 | 6.7 | 3.6 | — | — | — | — | — | |
| TPOModel=LLaVA-v1.5-7B2026.02 | 5.6 | 3.2 | — | — | — | — | — | |
| SENTINELModel=LLaVA-v1.5-7B2026.02 | 5.5 | 3 | — | — | — | — | — | |
| HSA-DPOBase Model=LLaVA-v1.5-13B2026.05 | 5.3 | 3.2 | — | — | — | — | — | |
| HSA-DPOModel=LLaVA-v1.5-13B2026.02 | 5 | 3.1 | — | — | — | — | — | |
| SENTINELModel=LLaVA-v1.5-13B2026.02 | 4.5 | 2.4 | — | — | — | — | — | |
| HII-DPOModel=Qwen2-VL-7B-Instruct2026.02 | 4.2 | 2.5 | — | — | — | — | — | |
| HII-DPOModel=LLaVA-v1.5-7B2026.02 | 4 | 2.5 | — | — | — | — | — | |
| HII-DPOModel=LLaVA-v1.5-13B2026.02 | 2.9 | 1.7 | — | — | — | — | — | |
| HII-DPOModel=Qwen2-VL-2B-Instruct2026.02 | 2.9 | 1.7 | — | — | — | — | — | |
| HII-DPOModel=Qwen2.5-VL-7B-Instruct2026.02 | 2.8 | 1.6 | — | — | — | — | — | |
| baselineModel=LLaVA-v1.5-7B2025.07 | — | — | — | — | 52.7 | 28 | — | |
| baselineModel=LLaVA-v1.5-13B2025.07 | — | — | — | — | 46 | 23 | — | |
| Bunny-2BLLM=Qwen-1.5-1.8, #Param=2.2B2026.01 | — | — | — | — | 50.2 | 23.4 | — | |
| DoLaModel=LLaVA-v1.5-7B2025.07 | — | — | — | — | 44 | 25.1 | — | |
| DOLAModel=LLaVA-1.5-7B2026.06 | — | — | — | — | 44.3 | 24.9 | — | |
| EFUFModel=LLaVA-v1.5-7B2025.07 | — | — | — | — | 39.3 | 22.6 | — | |
| EFUFModel=LLaVA-1.5-7B2026.06 | — | — | — | — | 41.6 | 22.6 | — | |
| HA-DPOLLM=Vicuna-1.5-7B, #Param=7B2026.01 | — | — | — | — | 39.9 | 19.9 | — | |
| HA-DPOModel=LLaVA-v1.5-7B2025.07 | — | — | — | — | 37 | 20.9 | — | |
| HA-DPOModel=LLaVA-1.5-7B2026.06 | — | — | — | — | 39 | 19.6 | — | |
| HALVAModel=LLaVA-1.5-7B2026.06 | — | — | — | — | 41.3 | 20.5 | — | |
| HALVAModel=LLaVA-1.5-13B2026.06 | — | — | — | — | 47.3 | 12.8 | — | |
| HSA-DPOModel=LLaVA-v1.5-13B2025.07 | — | — | — | — | 5.3 | 3.2 | — | |
| HSA-DPOModel=LLaVA-1.5-13B2026.06 | — | — | — | — | 5 | 3 | — | |
| LBPApproach=training-time bias mitigation2026.05 | — | — | — | — | — | — | 43 | |
| LLaVA-1.5-7BLLM=Vicuna-7B, #Param=7B2026.01 | — | — | — | — | 53.6 | 25.2 | — | |
| LLaVA-FA-2BLLM=Qwen-2.5-7B, #Param=2.2B2026.01 | — | — | — | — | 11.2 | 7.7 | — | |
| LLaVA-RLHFLLM=Vicuna-1.5-13B, #Param=13B2026.01 | — | — | — | — | 38.1 | 18.9 | — | |
| LLaVA-RLHFModel=LLaVA-1.5-7B2026.06 | — | — | — | — | 52.6 | 26.9 | — | |
| LLaVA-RLHFModel=LLaVA-1.5-13B2026.06 | — | — | — | — | 36.3 | 11.8 | — | |
| LLaVA-v1.6-vicuna-13BMitigation=None (baseline)2025.07 | — | — | — | — | 13.7 | 7.7 | — | |
| LLaVA-v1.6-vicuna-7BMitigation=None (baseline)2025.07 | — | — | — | — | 15.3 | 10.1 | — |