Multimodal Hallucination Evaluation on MMHal-Bench
46Average ScoreSFT + VIGIL
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SFT + VIGILBase Model=Qwen2.5-VL-72B2026.06 | 46 | — | — | — | |
| SFT + DA-DPOBase Model=Qwen2.5-VL-72B2026.06 | 44.2 | — | — | — | |
| SFT + HA-DPOBase Model=Qwen2.5-VL-72B2026.06 | 42.8 | — | — | — | |
| SFT + SimPOBase Model=Qwen2.5-VL-72B2026.06 | 41.1 | — | — | — | |
| SFT + DPOBase Model=Qwen2.5-VL-72B2026.06 | 40.5 | — | — | — | |
| SFT + VIGILBase Model=Qwen2.5-VL-7B2026.06 | 40.2 | — | — | — | |
| SFT + DA-DPOBase Model=Qwen2.5-VL-7B2026.06 | 38.5 | — | — | — | |
| SFT onlyBase Model=Qwen2.5-VL-72B2026.06 | 38.2 | — | — | — | |
| SFT + SimPOBase Model=Qwen2.5-VL-7B2026.06 | 37 | — | — | — | |
| SFT + DPOBase Model=Qwen2.5-VL-7B2026.06 | 36.8 | — | — | — | |
| SFT onlyBase Model=Qwen2.5-VL-7B2026.06 | 34.5 | — | — | — | |
| GIFTModel=Qwen3-VL 8B2025.10 | 4.84 | — | — | 26.4 | |
| GreedyModel=Qwen3-VL 8B2025.10 | 4.8 | — | — | 28.3 | |
| Self-AugBackbone=Qwen3-VL-8B2025.10 | 4.67 | 29 | — | — | |
| VACoDeBackbone=Qwen3-VL-8B2025.10 | 4.63 | 29 | — | — | |
| MultinomialBackbone=Qwen3-VL-8B2025.10 | 4.56 | 31 | — | — | |
| VCDBackbone=Qwen3-VL-8B2025.10 | 4.52 | 32 | — | — | |
| RC-DPOBackbone Model=MM-Eureka2026.05 | 4.01 | 40.62 | — | — | |
| RC-DPOBackbone Model=ThinkLite-VL2026.05 | 3.75 | 43.75 | — | — | |
| BRACSBackbone=Qwen-VL-Chat2026.05 | 3.72 | — | — | — | |
| GreedyBackbone=Qwen-VL-Chat2026.05 | 3.64 | — | — | — | |
| GIFTModel=Qwen2-VL 7B2025.10 | 3.58 | — | — | 27.5 | |
| GreedyModel=Qwen2-VL 7B2025.10 | 3.53 | — | — | 32.7 | |
| VCDBackbone=Qwen-VL-Chat2026.05 | 3.49 | — | — | — | |
| VDD-NoneBackbone=Qwen-VL-Chat2026.05 | 3.49 | — | — | — | |
| PAIBackbone=Qwen-VL-Chat2026.05 | 3.48 | — | — | — | |
| SPINBackbone=Qwen-VL-Chat2026.05 | 3.47 | — | — | — | |
| OPA-DPOBackbone Model=ThinkLite-VL2026.05 | 3.35 | 55.21 | — | — | |
| RC-DPOBackbone Model=OpenVLThinker2026.05 | 3.34 | 52.08 | — | — | |
| VanillaBackbone Model=MM-Eureka2026.05 | 3.33 | 54.17 | — | — | |
| RC-DPOBackbone Model=R1-Onevision2026.05 | 3.29 | 55.21 | — | — | |
| VCDBackbone Model=ThinkLite-VL2026.05 | 3.29 | 55.21 | — | — | |
| OPA-DPOBackbone Model=MM-Eureka2026.05 | 3.27 | 54.17 | — | — | |
| SIDBackbone Model=ThinkLite-VL2026.05 | 3.27 | 55.21 | — | — | |
| CASTBase Model=Qwen2.5-VL-7B2026.05 | 3.24 | 40.2 | 29.9 | — | |
| VCDBackbone Model=MM-Eureka2026.05 | 3.24 | 54.17 | — | — | |
| CASTBase Model=LLaVA-NeXT2026.05 | 3.12 | 61 | 48.9 | — | |
| RLAIF-VBackbone Model=MM-Eureka2026.05 | 3.1 | 57.29 | — | — | |
| CASTBase Model=Qwen2-VL-7B2026.05 | 3.09 | 48.4 | 40.8 | — | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B2026.05 | 3.05 | 43.6 | 34.7 | — | |
| UE-DPOBackbone=Qwen2.5-VL-3B, Datasize=5.7k2026.05 | 3.05 | 41 | — | — | |
| RLAIF-VBackbone Model=ThinkLite-VL2026.05 | 3.01 | 60.42 | — | — | |
| RLAIF-VBackbone=LLaVA-v1.5-7B, Datasize=16k2026.05 | 3 | 38 | — | — | |
| SIDBackbone Model=MM-Eureka2026.05 | 2.99 | 61.46 | — | — | |
| VCDBackbone Model=OpenVLThinker2026.05 | 2.98 | 61.46 | — | — | |
| RLAIF-VBackbone Model=R1-Onevision2026.05 | 2.97 | 59.38 | — | — | |
| UE-DPOBackbone=LLaVA-v1.5-7B, Datasize=16k, Training Data Source=RLAIF-V Data2026.05 | 2.95 | 37 | — | — | |
| CASTBase Model=InternVL2-8B2026.05 | 2.91 | 49.7 | 44.4 | — | |
| LBPApproach=training-time bias mitigation2026.05 | 2.91 | — | — | — | |
| VanillaBackbone Model=OpenVLThinker2026.05 | 2.91 | 63.54 | — | — | |
| SIDBackbone Model=OpenVLThinker2026.05 | 2.91 | 63.54 | — | — | |
| Qwen2-VL-7BModel=Qwen2-VL-7B2026.05 | 2.87 | 55.4 | 49.8 | — | |
| OPA-DPOBackbone Model=R1-Onevision2026.05 | 2.86 | 62.5 | — | — | |
| RLAIF-VBackbone Model=OpenVLThinker2026.05 | 2.83 | 61.46 | — | — | |
| UE-DPOBackbone=LLaVA-v1.5-7B, Datasize=5.7k, Training Data Source=RLHF-V Data2026.05 | 2.82 | 48 | — | — | |
| RLHF-V(HD)Backbone=LLaVA-v1.5-13B, Datasize=1.4k2026.05 | 2.81 | 49 | — | — | |
| OPA-DPOBackbone Model=OpenVLThinker2026.05 | 2.79 | 66.67 | — | — | |
| UE-DPOBackbone=LLaVA-v1.5-13B, Datasize=5.7k2026.05 | 2.76 | 45 | — | — | |
| oDPOData Size=19k, Feedback=GPT-4V, Model Scale=13B2026.04 | 2.74 | 45 | — | — | |
| TPOBackbone=LLaVA-v1.5-13B, Datasize=5.7k2026.05 | 2.72 | 46 | — | — | |
| BRACSBackbone=LLaVA-1.5-7B2026.05 | 2.72 | — | — | — | |
| GIFTModel=LLaVA-1.5 13B2025.10 | 2.72 | — | — | 55.8 | |
| InternVL2-8BModel=InternVL2-8B2026.05 | 2.71 | 56.7 | 52.3 | — | |
| SIDBackbone Model=R1-Onevision2026.05 | 2.68 | 66.67 | — | — | |
| VanillaBackbone Model=R1-Onevision2026.05 | 2.66 | 65.62 | — | — | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 2.62 | 49 | — | — | |
| VCDBackbone=LLaVA-1.5-7B2026.05 | 2.62 | — | — | — | |
| GreedyModel=LLaVA-1.5 13B2025.10 | 2.61 | — | — | 56.2 | |
| HALVAData Size=21.5k, Feedback=GPT-4V, Model Scale=13B2026.04 | 2.58 | 45 | — | — | |
| HALVABackbone=LLaVA-v1.5-13B, Datasize=22.5k2026.05 | 2.58 | 45 | — | — | |
| LLaVA-NeXTModel=LLaVA-NeXT2026.05 | 2.57 | 65.4 | 55.8 | — | |
| VCDBackbone Model=R1-Onevision2026.05 | 2.57 | 68.75 | — | — | |
| GreedyBackbone=LLaVA-1.5-7B2026.05 | 2.57 | — | — | — | |
| SPINBackbone=LLaVA-1.5-7B2026.05 | 2.57 | — | — | — | |
| VanillaBackbone Model=ThinkLite-VL2026.05 | 2.56 | 68.75 | — | — | |
| Self-AugBackbone=LLaVA-1.5-7B2025.10 | 2.55 | 59 | — | — | |
| VISTAApproach=training-free2026.05 | 2.55 | — | — | — | |
| Self-AugBackbone=LLaVA-1.5-13B2025.10 | 2.53 | 60 | — | — | |
| DPOBackbone=Qwen2.5-VL-3B, Datasize=5.7k2026.05 | 2.53 | 52 | — | — | |
| VACoDeBackbone=LLaVA-1.5-13B2025.10 | 2.52 | 61 | — | — | |
| VARModel=LLaVA-1.5 13B2025.10 | 2.52 | — | — | 56.2 | |
| oDPOData Size=19k, Feedback=GPT-4V, Model Scale=7B2026.04 | 2.5 | 49 | — | — | |
| SENTINELData Size=7k, Feedback=Self, Model Scale=13B2026.04 | 2.48 | 49 | — | — | |
| LLaVA-v1.5-13BBackbone=LLaVA-v1.5-13B2026.05 | 2.48 | 52 | — | — | |
| GIFTModel=LLaVA-1.5 7B2025.10 | 2.48 | — | — | 57.3 | |
| TPOBackbone=LLaVA-v1.5-7B, Datasize=5.7k2026.05 | 2.47 | 51 | — | — | |
| VAFModel=LLaVA-1.5 13B2025.10 | 2.46 | — | — | 59.2 | |
| VCDModel Scale=13B2026.04 | 2.4 | 51 | — | — | |
| VARModel=LLaVA-1.5 7B2025.10 | 2.4 | — | — | 60.8 | |
| mDPOData Size=10k, Feedback=GPT-4V, Model Scale=7B2026.04 | 2.39 | 54 | — | — | |
| mDPOBackbone=LLaVA-v1.5-7B, Datasize=10k2026.05 | 2.39 | 54 | — | — | |
| VCDBackbone=LLaVA-1.5-13B2025.10 | 2.37 | 64 | — | — | |
| VCDModel=LLaVA-1.5 7B2025.10 | 2.37 | — | — | 60.5 | |
| AVES-DPOData Size=4.6k, Feedback=Self, Model Scale=13B2026.04 | 2.36 | 58 | — | — | |
| MultinomialBackbone=LLaVA-1.5-13B2025.10 | 2.35 | 65 | — | — | |
| AVES-DPOData Size=5.2k, Feedback=Self, Model Scale=7B2026.04 | 2.35 | 53 | — | — | |
| VDD-NoneBackbone=LLaVA-1.5-7B2026.05 | 2.35 | — | — | — | |
| VCDBackbone=LLaVA-1.5-7B2025.10 | 2.32 | 65 | — | — | |
| VACoDeBackbone=LLaVA-1.5-7B2025.10 | 2.32 | 64 | — | — | |
| VCDModel=LLaVA-1.5 13B2025.10 | 2.31 | — | — | 61.5 |