Hallucination Evaluation on POPE Overall
91.1AccuracyInternVL3-8B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| InternVL3-8BCategory=SFT & Close-source Models, Parameter Size=8B2025.09 | 91.1 | — | |
| AdaVaR-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Adaptive2025.09 | 89 | 55.82 | |
| LLaVA-OV-7BCategory=SFT & Close-source Models, Parameter Size=7B2025.09 | 88.4 | — | |
| Chain-of-FocusCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 88.4 | 50.94 | |
| ViGoRL-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 88.3 | 50.53 | |
| AdaVaR-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B, Reasoning Mode=Adaptive2025.09 | 88.2 | 50.84 | |
| ViGoRL-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 88 | 45.7 | |
| DeepEyesCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Visually-grounded2025.09 | 87.9 | 53.72 | |
| VLAA-Thinker-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B, Reasoning Mode=Text-based2025.09 | 87.8 | 46.7 | |
| Qwen2.5-VL-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 87.8 | 50.9 | |
| Qwen2.5-VL-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 87.2 | 45.74 | |
| GPT-4oCategory=SFT & Close-source Models2025.09 | 86.9 | 53.2 | |
| Orsta-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 86.9 | 52.04 | |
| LMM-R1Category=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 86.7 | 48.8 | |
| GAP (LH+PCA+DA)Latent Head=true, PCA=true, Data Augmentation=true2026.05 | 86.3 | — | |
| MM-EurekaCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B2025.09 | 86.3 | 52.52 | |
| Qwen2.5-VL-7BModel size=7B2026.05 | 86.25 | — | |
| VLAA-Thinker-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Text-based2025.09 | 86.2 | 54.2 | |
| LH+DA (no PCA)Latent Head=true, Data Augmentation=true, PCA=false2026.05 | 86.02 | — | |
| OVR-7BCategory=Reasoning Models, Base Model=Qwen2.5-VL-7B, Parameter Size=7B, Reasoning Mode=Text-based2025.09 | 83.2 | 55.76 | |
| GRIT-3BCategory=Reasoning Models, Base Model=Qwen2.5-VL-3B, Parameter Size=3B2025.09 | 83 | 45.8 |