Hallucination Evaluation on POPE
94.42AccuracyMIRROR(ours)
Evaluation Results
| Method | Links | |||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MIRROR(ours)Param Size=7B2026.02 | 94.42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPHINX-1kResolution=1k2023.11 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| (IA)3Backbone=Qwen2.5-VL-3B, Trainable Parameters=524.K2026.06 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ScAle (attn)Backbone=Qwen2.5-VL-3B, Trainable Parameters=5762026.06 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3Param Size=8B2026.02 | 90.37 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-3.5 + FINER-TuningSize=14B2026.03 | 90.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5-MPOModel Size=2B2025.01 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| (IA)3Backbone=LLaVA-7B, Trainable Parameters=664.K2026.06 | 89.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Phantom-1.8BParameters=1.8B2024.12 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL3Param Size=2B2026.02 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LIVR2026.02 | 89.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-3.5Size=14B2026.03 | 89.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeekVL-2Model Size=8B2025.01 | 89.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-3.5 + FINER-TuningSize=8B2026.03 | 89.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MPDSetting=random, Base Model=LLaVA-1.5-7B2026.04 | 89.31 | — | 88.2 | — | — | — | — | 92.41 | — | — | — | — | — | — | — | — | — | 84.1 | — | |
| Qwen3-VL-4BModel Scale=4B2026.02 | 89.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-UHDVision Encoder=CLIP-L, Resolution=1008, LLM=Vicuna-13B, Data=89.12025.01 | 89.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL2.5-MPOModel Size=8B2025.01 | 89.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Visual PromptLLM=Vicuna-7B, Res.=3362024.08 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-7BParameters=7B2024.12 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-3.5-4BModel Scale=4B2026.02 | 88.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeekVL-2Model Size=2B2025.01 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.6 + FINER-TuningSize=7B2026.03 | 88.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-VIFParams=7B, Base model=Qwen-2.5-VL2026.05 | 88.71 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CrystaLBase Model=Qwen2.5-VL-7B2026.02 | 88.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TroL-1.8BParameters=1.8B2024.12 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLsI-7BParameters=7B2024.12 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InternVL-3.5Size=8B2026.03 | 88.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SEA-PRIMELLM=Vicuna-7B, Res.=3842024.08 | 88.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VCDBackbone=Qwen2-VL-7B2026.04 | 88.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-VIFParams=13B, Base model=LLaVA-1.52026.05 | 88.33 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VOLCANOModel Size=13B2023.11 | 88.3 | — | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NulluSetting=random, Base Model=LLaVA-1.5-7B2026.04 | 88.23 | — | 87.43 | — | — | — | — | 91.31 | — | — | — | — | — | — | — | — | — | 81.86 | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=1.2M2025.01 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VOLCANOModel Size=7B2023.11 | 88.2 | — | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.6Size=7B2026.03 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VGR-7BDownSample=2×2 | 4×4, #Vtoken=864, LLM=Vicuna-7B2025.06 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL-8BMode=base2026.05 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| mPLUG-Owl3Params=8B2026.05 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RossParams=7B2026.05 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VL + LOCUSSize=4B2026.06 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ScAle (attn)Backbone=LLaVA-7B, Trainable Parameters=1.02K2026.06 | 88.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen3-VLSize=4B2026.06 | 88.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AntidoteBackbone=LLaVA-1.5-7B, Hyperparameter Configuration=HP-search2026.04 | 88.06 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VLParams=7B, Base model=Qwen-2.5-VL2026.05 | 88.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-HR-XParam.=14B, Res.=1024, Data=1.2M, Inference Speed=12.9 t/s2024.03 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmniLMMSize=12B2026.03 | 88 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OriginalSetting=random, Base Model=LLaVA-1.5-7B2026.04 | 87.98 | — | 86.03 | — | — | — | — | 88.55 | — | — | — | — | — | — | — | — | — | 80.43 | — | |
| MIRROR(w/o tool)Param Size=7B2026.02 | 87.95 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-B, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=1.2M2025.01 | 87.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-B, CLIP-L, Resolution=1024/336, LLM=Vicuna-13B, Data=1.2M2025.01 | 87.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VLSI-2BParameters=2B2024.12 | 87.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TGIFBackbone=LLaVA-1.5-7B2026.02 | 87.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-VIFParams=7B, Base model=LLaVA-1.52026.05 | 87.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLAVA-HRVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/448, LLM=Vicuna-13B, Data=1.2M2025.01 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SEA-PRIMELLM=Gemma-2B, Res.=3842024.08 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VL-2BParameters=2B2024.12 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1-MoE-7B×32Parameters=7B×322024.12 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TroL-7BParameters=7B2024.12 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-HRParam.=13.4B, Res.=1024, Data=1.2M, Inference Speed=15.0 t/s2024.03 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-NeXT-7B†DownSample=2×2 | 4×4, #Vtoken=864, LLM=Vicuna-7B2025.06 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VGR-7BDownSample=2×2 | 2×2, #Vtoken=3024, LLM=Vicuna-7B2025.06 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 87.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Phantom-7BParameters=7B2024.12 | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmniLMM + RLAIF-VSize=12B2026.03 | 87.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL-SFTParams=7B, Base model=Qwen-2.5-VL2026.05 | 87.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoD-Multi RoundBackbone=LLaVA-v1.6-13b, Protocol=multi-turn dialectical reasoning2026.06 | 87.65 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-HRVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/448, LLM=Vicuna-7B, Data=1.2M2025.01 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-13B, Data=1.2M2025.01 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5*LLM=Vicuna-13B, Res.=3362024.08 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1-MoE-3B×64Architecture=MoE, Parameters=3B2024.12 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepSeek-VL-1.3BParameters=1.3B2024.12 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-HRParam.=7.4B, Res.=1024, Data=1.2M, Inference Speed=19.7 t/s2024.03 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2-VLModel Size=2B2025.01 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Qwen2.5-VL + LOCUSSize=7B2026.06 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 87.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5-7BBackbone=LLaVA-1.5-7B2026.04 | 87.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoD-Single RoundBackbone=LLaVA-v1.6-13b, Protocol=single-round inference2026.06 | 87.51 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PIIP-LLaVAVision Encoder=ConvNeXt-L, CLIP-L, Resolution=1024/336, LLM=Vicuna-7B, Data=2.7M2025.01 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Mistral Instruct v0.1 7BLLM backbone=Mistral, Model Size=7B, Variant=Instruct v0.12025.12 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIG training + VARBase Model=LLaVA-1.5 7B2026.02 | 87.5 | — | 86.99 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=1282026.06 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CDPrunerBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=322026.06 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ShareGPT4V-13B2026.06 | 87.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIG training + PAIBase Model=LLaVA-1.5 7B2026.02 | 87.49 | — | 86.12 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIG trainingBase Model=LLaVA-1.5 7B2026.02 | 87.47 | — | 85.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoE-LoRABackbone=LLaVA-v1.6-13b2026.06 | 87.42 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AVG-LLaVAResolution=High, LLM=Vicuna-7B2024.09 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| S2-Wrapper*LLM=Vicuna-7B, Res.=10082024.08 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SEA-PRIMELLM=Llama3-8B, Res.=3842024.08 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MM1-3BParameters=3B2024.12 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TARS (Mask)Backbone=Muffin-13B2025.07 | 87.4 | — | — | — | — | — | — | 84.9 | — | — | — | — | — | — | — | — | — | — | — | |
| AntidoteBackbone=LLaVA-1.5-7B, Hyperparameter Configuration=HP-orig2026.04 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cambrian-1Params=8B2026.05 | 87.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VIG training + LACINGBase Model=LLaVA-1.5 7B2026.02 | 87.39 | — | 86.19 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LLaVA-1.5Resolution=Standard, LLM=Vicuna-7B2024.09 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Moxin-7BLLM backbone=Moxin-7B, Model Size=7B2025.12 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SKILA2026.02 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SPAREBackbone=LLaVA-1.5-7B, Retained Tokens=642026.06 | 87.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |