Object Hallucination Evaluation on MME Existence (test)
96.67AccuracyLogicCheckGPT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LogicCheckGPTModel=mPLUG-Owl2024.02 | 96.67 | 93.33 | |
| vanillaModel=LLaVA-1.52024.02 | 96.67 | 93.33 | |
| SelfCheckModel=LLaVA-1.52024.02 | 96.67 | 93.33 | |
| LogicCheckGPTModel=LLaVA-1.52024.02 | 96.67 | 93.33 | |
| LogicCheckGPTModel=QWEN-VL-Chat2024.02 | 95 | 90 | |
| LUREModel=LLaVA-1.52024.02 | 93.33 | 86.67 | |
| SelfCheckModel=QWEN-VL-Chat2024.02 | 93.33 | 86.67 | |
| LUREModel=QWEN-VL-Chat2024.02 | 90 | 80 | |
| vanillaModel=QWEN-VL-Chat2024.02 | 88.33 | 80 | |
| LogicCheckGPTModel=MiniGPT-42024.02 | 86.67 | 73.33 | |
| SelfCheckModel=mPLUG-Owl2024.02 | 85 | 73.33 | |
| LUREModel=MiniGPT-42024.02 | 85 | 70 | |
| LRV-InstructionModel=mPLUG-Owl2024.02 | 83.33 | 66.67 | |
| LRV-InstructionModel=MiniGPT-42024.02 | 83.33 | 66.67 | |
| LUREModel=mPLUG-Owl2024.02 | 80 | 60 | |
| SelfCheckModel=MiniGPT-42024.02 | 80 | 60 | |
| vanillaModel=MiniGPT-42024.02 | 78.33 | 56.67 | |
| vanillaModel=mPLUG-Owl2024.02 | 65 | 35 |