Hallucination Evaluation on MMHal-Bench
84.2MMHal ScoreBoN w/ REAR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BoN w/ REARBase Model=Qwen3-VL-8B-Instruct, Search Strategy=Best-of-N2026.06 | 84.2 | 21.87 | |
| BoN w/ GenRMBase Model=Qwen3-VL-8B-Instruct, Search Strategy=Best-of-N2026.06 | 80.21 | 23.96 | |
| GreedyBase Model=Qwen3-VL-8B-Instruct, Search Strategy=Greedy Decoding2026.06 | 78.99 | 28.12 | |
| Qwen2.5-VL + FINER-TuningSize=7B2026.03 | 4.7 | 15 | |
| InternVL-3.5Size=14B2026.03 | 4.7 | 11 | |
| InternVL-3.5 + FINER-TuningSize=14B2026.03 | 4.7 | 10 | |
| Qwen2.5-VLSize=7B2026.03 | 4.6 | 18 | |
| InternVL-3.5 + FINER-TuningSize=8B2026.03 | 4.6 | 14 | |
| InternVL-3.5Size=8B2026.03 | 4.5 | 19 | |
| VLIModel=Qwen3-VL2026.01 | 4.32 | 34.38 | |
| ILVADBase Model=Qwen3-VL-8B2026.05 | 4.32 | 32.6 | |
| GreedyBase Model=Qwen3-VL-8B2026.05 | 4.28 | 35.4 | |
| OursBackbone=PixelReasoner-7B2026.03 | 4.12 | 26 | |
| MiniCPM-V-2LLM=MiniCPM-2.4B, #Param=2.8B2026.01 | 4.09 | 18.2 | |
| OmniLMM + RLAIF-VSize=12B2026.03 | 4 | 29 | |
| MemVRBackbone=PixelReasoner-7B2026.03 | 3.95 | 29 | |
| VCDBackbone=PixelReasoner-7B2026.03 | 3.87 | 33 | |
| FlexACBackbone=PixelReasoner-7B2026.03 | 3.83 | 31 | |
| VCDModel=Qwen3-VL2026.01 | 3.8 | 37.5 | |
| ILVADBase Model=Qwen2-VL-7B2026.05 | 3.77 | 25.3 | |
| CICDModel=Qwen3-VL2026.01 | 3.76 | 36.46 | |
| GreedyBase Model=Qwen2-VL-7B2026.05 | 3.75 | 29.7 | |
| DoLaBackbone=PixelReasoner-7B2026.03 | 3.74 | 35 | |
| OPERAModel=Qwen3-VL2026.01 | 3.72 | 39.1 | |
| MiniCPM-VLLM=MiniCPM-2.4B, #Param=2.8B2026.01 | 3.7 | 24.9 | |
| SAVEBackbone Model=Qwen2-VL-7B2025.12 | 3.7 | 23 | |
| PixelReasoner-7BBackbone=PixelReasoner-7B2026.03 | 3.7 | 37 | |
| VTIModel=Qwen3-VL2026.01 | 3.68 | 36.46 | |
| OriginModel=Qwen3-VL2026.01 | 3.56 | 40.63 | |
| ClearSightModel=Qwen3-VL2026.01 | 3.55 | 39.58 | |
| NulluModel=Qwen3-VL2026.01 | 3.53 | 39.58 | |
| OmniLMMSize=12B2026.03 | 3.5 | 34 | |
| LLaVA-1.6 + FINER-TuningSize=7B2026.03 | 3.5 | 40 | |
| GPT-4VSize=Unknown, Feedback=Unknown2024.05 | 3.49 | 28.1 | |
| GPT-4V (Base)Backbone=GPT-4V2025.03 | 3.49 | 28 | |
| GPT-4VBase Model=Proprietary2026.05 | 3.49 | 28 | |
| OmniLMM + RLAIF-V BoNSize=12B, Feedback=self2024.05 | 3.44 | 26 | |
| LLaVA-NeXTSize=34B, Feedback=X2024.05 | 3.31 | 34.4 | |
| BaseBackbone Model=Qwen2-VL-7B2025.12 | 3.31 | 32 | |
| LLaVA-1.6Size=7B2026.03 | 3.3 | 43 | |
| SAVEBackbone Model=LLaVA-NeXT-8B2025.12 | 3.21 | 29 | |
| SilkieSize=10B, Feedback=GPT-4V2024.05 | 3.19 | 32.3 | |
| OmniLMM + RLAIF-VSize=12B, Feedback=self2024.05 | 3.15 | 32.3 | |
| SAVEBackbone Model=LLaVA-1.6-7B2025.12 | 3.12 | 36 | |
| VLIModel=LLaVA-1.52026.01 | 3.11 | 45.63 | |
| Static CEIBackbone=LLaVA-NeXT2026.01 | 3.1 | 49 | |
| MiniGeminiSize=34B, Feedback=X2024.05 | 3.08 | 38.5 | |
| AMP-MEGSize=13B, Feedback=Rule2024.05 | 3.08 | 36.5 | |
| baseBackbone=LLaVA-NeXT2026.01 | 3.08 | 47 | |
| AMP-MEGBase Model=LLaVA-v1.5-13B2026.05 | 3.08 | 37 | |
| LLaVA 1.5 + RLAIF-V BoNSize=7B, Feedback=LLaVA-NeXT2024.05 | 3.07 | 28.1 | |
| AvisCBackbone=LLaVA-NeXT2026.01 | 3.07 | 48 | |
| Dynamic CEIBackbone=LLaVA-NeXT2026.01 | 3.07 | 47 | |
| OmniLMMSize=12B, Feedback=X2024.05 | 3.06 | 36.5 | |
| RLAIF-VLLM=Vicuna-1.5-7B, #Param=7B2026.01 | 3.06 | 29.2 | |
| CASTModel=Qwen-VL-Chat2026.05 | 3.04 | 38 | |
| SilkieBase Model=Qwen-VL-Chat2023.12 | 3.02 | — | |
| VISTABackbone Model=LLaVA-NeXT-8B2025.12 | 3.02 | 42 | |
| LBPBase Model=LLaVA-v1.5-13B2026.05 | 3.01 | 42 | |
| VTIModel=Qwen-VL-Chat2026.05 | 2.99 | 38.4 | |
| LLaVA 1.5 + RLAIF-VSize=7B, Feedback=LLaVA-NeXT2024.05 | 2.95 | 32.3 | |
| RLAIF-VBase Model=LLaVA-v1.5-7B2026.05 | 2.95 | 32 | |
| OPERAModel=Qwen-VL-Chat2026.05 | 2.94 | 38.4 | |
| MFPOBase Model=LLaVA-v1.5-13B2026.05 | 2.94 | 42 | |
| VISTABackbone Model=LLaVA-1.6-7B2025.12 | 2.93 | 41 | |
| RegularModel=Qwen-VL-Chat2026.05 | 2.93 | 41.1 | |
| CAACBackbone=LLaVA-NeXT2026.01 | 2.92 | 53 | |
| LBPBase Model=LLaVA-v1.5-7B2026.05 | 2.91 | 43 | |
| VCDBackbone Model=LLaVA-NeXT-8B2025.12 | 2.9 | 45 | |
| Qwen-VL-Chat2023.12 | 2.89 | — | |
| LPOIBase VLM Model=Idefics2-8B, Preference Learning Method=LPOI2025.05 | 2.88 | 36 | |
| BaseBackbone Model=LLaVA-1.6-7B2025.12 | 2.88 | 41 | |
| PAIModel=Qwen-VL-Chat2026.05 | 2.87 | 39.5 | |
| HALVABase Model=LLaVA-v1.5-13B2026.05 | 2.84 | 42 | |
| Mini-Gemini-2BLLM=Gemma-2B, #Param=2B2026.01 | 2.83 | 18.8 | |
| M3IDBackbone=LLaVA-NeXT2026.01 | 2.83 | 57 | |
| BaseBackbone Model=LLaVA-NeXT-8B2025.12 | 2.83 | 45 | |
| DePModel=LLaVA-1.52026.04 | 2.83 | 49 | |
| OPA-DPOBase Model=LLaVA-v1.5-7B2026.05 | 2.83 | 45 | |
| VCDBackbone=LLaVA-NeXT2026.01 | 2.82 | 57 | |
| Qwen-VL-Chat + DPO (GPT-4V as Best)Alignment Method=DPO (GPT-4V as Best)2023.12 | 2.81 | — | |
| mDPOBase VLM Model=Idefics2-8B, Preference Learning Method=mDPO2025.05 | 2.8 | 40 | |
| CRGBackbone=Qwen-VL-Chat2026.05 | 2.8 | 48.8 | |
| LLaVA-FA-2BLLM=Qwen-2.5-7B, #Param=2.2B2026.01 | 2.79 | 17.5 | |
| VCDModel=Qwen-VL-Chat2026.05 | 2.77 | 39.2 | |
| Qwen-VL-ChatSize=10B, Feedback=X2024.05 | 2.76 | 38.5 | |
| Qwen-VL-ChatLLM=Qwen-7B, #Param=9.6B2026.01 | 2.76 | 38.5 | |
| ILVADBase Model=InternVL3-8B2026.05 | 2.76 | 47.6 | |
| DeCOBackbone Model=LLaVA-NeXT-8B2025.12 | 2.75 | 46 | |
| GreedyBase Model=InternVL3-8B2026.05 | 2.74 | 48.8 | |
| LLaVA-1.5 + TL-DPOBackbone=LLaVA-1.5-7B, Learning Objective=TL-DPO2025.06 | 2.72 | — | |
| Bunny-2BLLM=Qwen-1.5-1.8, #Param=2.2B2026.01 | 2.72 | 19.3 | |
| VTIModel=LLaVA-1.52026.04 | 2.72 | 51 | |
| VIG training + LACINGBase Model=LLaVA-1.5 7B2026.02 | 2.71 | 56.1 | |
| NullModel=LLaVA-1.52026.04 | 2.7 | 54.2 | |
| CRGBackbone=LLaVA-1.5-7B2026.05 | 2.69 | 50.9 | |
| MFPOBase Model=LLaVA-v1.5-7B2026.05 | 2.69 | 49 | |
| SIMABase Model=VILA-7B2024.05 | 2.66 | — | |
| CICDModel=LLaVA-1.52026.04 | 2.66 | 58.3 | |
| VCDBackbone Model=LLaVA-1.6-7B2025.12 | 2.65 | 48 |