Hallucination Assessment on MHumanEval
72.6Response RateLLaVA-RLHF
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-RLHFSize=13B, Feedback=Human2024.05 | 72.6 | |
| CCA-LLaVASize=7B, Feedback=X2024.05 | 68.5 | |
| POVIDSize=7B, Feedback=Rule2024.05 | 67.8 | |
| VCDSize=7B, Feedback=X2024.05 | 67.1 | |
| LLaVA 1.5Size=7B, Feedback=X2024.05 | 67.1 | |
| Less-is-moreSize=7B, Feedback=X2024.05 | 63.7 | |
| OPERASize=7B, Feedback=X2024.05 | 63 | |
| Qwen-VL-ChatSize=10B, Feedback=X2024.05 | 61 | |
| MiniGeminiSize=34B, Feedback=X2024.05 | 59.6 | |
| RLHF-VSize=13B, Feedback=Human2024.05 | 55.5 | |
| AMP-MEGSize=13B, Feedback=Rule2024.05 | 54.8 | |
| SilkieSize=10B, Feedback=GPT-4V2024.05 | 54.1 | |
| LLaVA-NeXTSize=34B, Feedback=X2024.05 | 53.4 | |
| HA-DPOSize=7B, Feedback=Rule2024.05 | 53.4 | |
| OmniLMMSize=12B, Feedback=X2024.05 | 52.7 | |
| GPT-4VSize=Unknown, Feedback=Unknown2024.05 | 45.9 | |
| LLaVA 1.5 + RLAIF-VSize=7B, Feedback=LLaVA-NeXT2024.05 | 44.5 | |
| LLaVA 1.5 + RLAIF-V BoNSize=7B, Feedback=LLaVA-NeXT2024.05 | 39.7 | |
| OmniLMM + RLAIF-VSize=12B, Feedback=self2024.05 | 35.6 | |
| OmniLMM + RLAIF-V BoNSize=12B, Feedback=self2024.05 | 29.5 |