Free-format Multimodal Hallucination Assessment on RefoMB (dev)
62.9TrustOmniLMM + RLAIF-V BoN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OmniLMM + RLAIF-V BoNSize=12B, Feedback=self2024.05 | 62.9 | 30.3 | |
| OmniLMM + RLAIF-VSize=12B, Feedback=self2024.05 | 58.1 | 28.3 | |
| LLaVA 1.5 + RLAIF-V BoNSize=7B, Feedback=LLaVA-NeXT2024.05 | 55.7 | 24.4 | |
| Less-is-moreSize=7B, Feedback=X2024.05 | 51.1 | 16.2 | |
| MiniGeminiSize=34B, Feedback=X2024.05 | 50 | 36.9 | |
| GPT-4VSize=Unknown, Feedback=Unknown2024.05 | 50 | 50 | |
| LLaVA 1.5 + RLAIF-VSize=7B, Feedback=LLaVA-NeXT2024.05 | 47.2 | 22.5 | |
| OmniLMMSize=12B, Feedback=X2024.05 | 44.7 | 18.5 | |
| LLaVA-NeXTSize=34B, Feedback=X2024.05 | 44.4 | 35.4 | |
| POVIDSize=7B, Feedback=Rule2024.05 | 44.4 | 13.6 | |
| CCA-LLaVASize=7B, Feedback=X2024.05 | 41.9 | 21.7 | |
| RLHF-VSize=13B, Feedback=Human2024.05 | 41.4 | 17.7 | |
| Qwen-VL-ChatSize=10B, Feedback=X2024.05 | 40.9 | 17.7 | |
| VCDSize=7B, Feedback=X2024.05 | 39.9 | 16.7 | |
| HA-DPOSize=7B, Feedback=Rule2024.05 | 39.9 | 17.2 | |
| SilkieSize=10B, Feedback=GPT-4V2024.05 | 38.9 | 21.2 | |
| LLaVA 1.5Size=7B, Feedback=X2024.05 | 36.9 | 16.2 | |
| OPERASize=7B, Feedback=X2024.05 | 33.8 | 13.1 | |
| AMP-MEGSize=13B, Feedback=Rule2024.05 | 30.3 | 14.6 | |
| LLaVA-RLHFSize=13B, Feedback=Human2024.05 | 26.3 | 17.2 |