VQA Hallucination on MMHal
3.87ScoreGPT-4o
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4o2025.07 | 3.87 | 24 | |
| Intern-VL2.5-7BModel Scale=7B2025.07 | 3.54 | 26 | |
| Qwen-VL2.5-8BModel Scale=8B2025.07 | 3.29 | 27 | |
| OPA-DPOBase Model=LLaVA-v1.5-13B, RL Technique=OPA-DPO2025.07 | 3.02 | 40 | |
| RLAIFBase Model=LLaVA-v1.5-7B, RL Technique=RLAIF2025.07 | 2.89 | 42 | |
| TARS (Mask)Base Model=LLaVA-v1.5-13B, Perturbation Strategy=Mask2025.07 | 2.89 | 45 | |
| DeepSeek-VL2-27BModel Scale=27B2025.07 | 2.84 | 27 | |
| OPA-DPOBase Model=LLaVA-v1.5-7B, RL Technique=OPA-DPO2025.07 | 2.78 | 46 | |
| CHiP-DPOBase Model=LLaVA-v1.5-13B, RL Technique=CHiP-DPO2025.07 | 2.7 | 46 | |
| TARS (Replace)Base Model=LLaVA-v1.5-13B, Perturbation Strategy=Replace2025.07 | 2.63 | 47 | |
| TARS (Replace)Base Model=LLaVA-v1.5-7B, Perturbation Strategy=Replace2025.07 | 2.54 | 46 | |
| TARS (Mask)Base Model=LLaVA-v1.5-7B, Perturbation Strategy=Mask2025.07 | 2.48 | 45 | |
| DPOBase Model=LLaVA-v1.5-13B, RL Technique=DPO2025.07 | 2.48 | 50 | |
| LLaVA-v1.5-13BModel Scale=13B2025.07 | 2.39 | 53 | |
| CHiP-DPOBase Model=LLaVA-v1.5-7B, RL Technique=CHiP-DPO2025.07 | 2.32 | 57 | |
| HALVABase Model=LLaVA-v1.5-13B, RL Technique=HALVA2025.07 | 2.28 | 56 | |
| DPOBase Model=LLaVA-v1.5-7B, RL Technique=DPO2025.07 | 2.19 | 61 | |
| HALVABase Model=LLaVA-v1.5-7B, RL Technique=HALVA2025.07 | 2.12 | 59 | |
| RLHFBase Model=LLaVA-v1.5-13B, RL Technique=RLHF2025.07 | 2.1 | 67 | |
| LLaVA-v1.5-7BModel Scale=7B2025.07 | 2.02 | 61 | |
| RLHFBase Model=LLaVA-v1.5-7B, RL Technique=RLHF2025.07 | 1.93 | 67 |