Visual Hallucination Evaluation on HallusionBench
76.6AccuracyQwen2-VL-72B-Thinking
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Qwen2-VL-72B-ThinkingMax Output Tokens=40K2026.03 | 76.6 | — | — | — | — | |
| Qwen2-VL-72B-ThinkingMax Output Tokens=4K2026.03 | 76.4 | — | — | — | — | |
| Vision-SR1Backbone=Mimo-VL-7B2025.08 | 75.6 | — | — | 49.5 | — | |
| InternVL3.5-38BAttack=Benign2026.07 | 75.07 | — | — | — | — | |
| Qwen3-VL + DISCO (10K)Backbone=Qwen3-VL, Alignment Strategy=DISCO (10K)2026.02 | 74.97 | — | — | — | — | |
| Vision-R1Backbone=Mimo-VL-7B, Training Data=47K data2025.08 | 74.3 | — | — | 46 | — | |
| Visual Para-Thinker++Size=7B2026.06 | 73.8 | — | — | — | — | |
| Qwen3-VLBackbone=Qwen3-VL2026.02 | 73.5 | — | — | — | — | |
| Qwen2-VL-7B-ThinkingMax Output Tokens=40K2026.03 | 73 | — | — | — | — | |
| Qwen2.5-VL-7B + ECRDParameters=7B, Enhancement=ECRD2026.02 | 72.5 | — | — | — | — | |
| Qwen3-VL + Textual (10K)Backbone=Qwen3-VL, Alignment Strategy=Textual (10K)2026.02 | 72.24 | — | — | — | — | |
| Zero-shot InferenceBackbone=Mimo-VL-7B, Inference Protocol=Zero-shot (before RL)2025.08 | 71.9 | — | — | 44.4 | — | |
| Qwen2-VL-7B-ThinkingMax Output Tokens=4K2026.03 | 71.6 | — | — | — | — | |
| InternVL3.5-8BAttack=Benign2026.07 | 71.39 | — | — | — | — | |
| Visual Para-ThinkerSize=7B2026.06 | 71 | — | — | — | — | |
| Kimi-VL-A3B-Thinking2026.03 | 70.6 | — | — | — | — | |
| Qwen2.5-VLSize=72B2026.06 | 70 | — | — | — | — | |
| Qwen2.5-VL-72B-InstructAttack=Benign2026.07 | 69.61 | — | — | — | — | |
| Optimization-based Token SelectionTarget Model=InternVL3.5-8B2026.07 | 69.6 | — | — | — | — | |
| InternVL3.5-4BAttack=Benign2026.07 | 69.08 | — | — | — | — | |
| Vision-SR1Backbone=Qwen2.5-VL-7B2025.08 | 68.9 | — | — | 52.2 | — | |
| GRPOSize=7B2026.06 | 68.8 | — | — | — | — | |
| Vision-SR1Backbone=Qwen2.5-VL-3B2025.08 | 68.3 | — | — | 48.8 | — | |
| Qwen2.5-VL-7B + supervisorParameters=7B, Enhancement=supervisor2026.02 | 67.5 | — | — | — | — | |
| Vision-R1Backbone=Qwen2.5-VL-3B, Training Data=47K data2025.08 | 67.4 | — | — | 47.1 | — | |
| Majority voting@4Size=7B2026.06 | 66.8 | — | — | — | — | |
| Sequential (SFT)Size=7B2026.06 | 66.7 | — | — | — | — | |
| Vision-R1Backbone=Qwen2.5-VL-7B, Training Data=47K data2025.08 | 66.6 | — | — | 50.7 | — | |
| Qwen2.5-VLSize=7B2026.06 | 66 | — | — | — | — | |
| Percention-R1 (7B)Backbone=7B2025.08 | 65.4 | — | — | 45.2 | — | |
| gemma-2-9b-it2026.03 | 65.3 | — | — | — | — | |
| Qwen2.5-VL-7B-InstructAttack=Benign2026.07 | 65.19 | — | — | — | — | |
| Visual Para-Thinker++Backbone=Qwen2.5-VL-7B, Training Stage (MAC/RDMAO)=MAC+RDMAO2026.06 | 64.7 | — | — | — | 2,540 | |
| Phi-4-reasoning-vision-15BThinking Mode=default2026.03 | 64.4 | — | — | — | — | |
| Visual Para-Thinker++Size=3B2026.06 | 64 | — | — | — | — | |
| Phi-4-reasoning-vision-15BThinking Mode=force thinking2026.03 | 63.9 | — | — | — | — | |
| MiniCPM-v2.6Backbone=MiniCPM-v2.62026.02 | 63.83 | — | — | — | — | |
| LLaVA-OneVision-7B + ECRDParameters=7B, Enhancement=ECRD2026.02 | 63.7 | — | — | — | — | |
| Gemini2.5-ProSize=-2026.06 | 63.7 | — | — | — | — | |
| Qwen2.5-VL-3B-InstructParams=3.75B2025.12 | 63.62 | — | — | — | — | |
| MiniCPM-v2.6 + HIPPOBackbone=MiniCPM-v2.6, Alignment Strategy=HIPPO2026.02 | 63.41 | — | — | — | — | |
| GPT5-miniSize=-2026.06 | 63.2 | — | — | — | — | |
| POW3R dynamicBase policy=Qwen3-VL-8B2026.05 | 62.9 | — | — | — | — | |
| Category-balancedBase policy=Qwen3-VL-8B2026.05 | 62.6 | — | — | — | — | |
| Category-balancedBase policy=Qwen3-VL-4B2026.05 | 62.5 | — | — | — | — | |
| BinaryBase policy=Qwen3-VL-8B2026.05 | 62.5 | — | — | — | — | |
| POW3R dynamicBase policy=Qwen3-VL-4B2026.05 | 62.4 | — | — | — | — | |
| BaseBase policy=Qwen3-VL-8B2026.05 | 62.4 | — | — | — | — | |
| Static scalarBase policy=Qwen3-VL-4B2026.05 | 62.2 | — | — | — | — | |
| Static scalarBase policy=Qwen3-VL-8B2026.05 | 62.2 | — | — | — | — | |
| Visual Para-ThinkerSize=3B2026.06 | 62.2 | — | — | — | — | |
| BaseBase policy=Qwen3-VL-4B2026.05 | 62.1 | — | — | — | — | |
| Qwen2-VL-2BParams=2.2B2025.12 | 62.04 | — | — | — | — | |
| BinaryBase policy=Qwen3-VL-4B2026.05 | 62 | — | — | — | — | |
| EVE-iter3Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=32026.04 | 61.89 | — | — | — | — | |
| GPT-4oSize=-2026.06 | 61.4 | — | — | — | — | |
| Qwen2.5-VL-7BParameters=7B2026.02 | 61.3 | — | — | — | — | |
| EVE-iter1Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=12026.04 | 61.28 | — | — | — | — | |
| EVE-iter2Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=22026.04 | 61.09 | — | — | — | — | |
| MiMo-VL-7B-SFT-2508Backbone=MiMo-VL-7B-SFT-2508, Training Iteration=02026.04 | 60.93 | — | — | — | — | |
| GRPOSize=3B2026.06 | 60.4 | — | — | — | — | |
| Qwen2.5-VL-3B-InstructAttack=Benign2026.07 | 60.04 | — | — | — | — | |
| Qwen3-VL-8BTraining Strategy=Staged2026.05 | 59.54 | — | — | — | — | |
| Claude-4-SonnetSize=-2026.06 | 59.2 | — | — | — | — | |
| InternVL3.5-38BRatio=100%, Backbone=InternVL3.5-38B2026.05 | 59.08 | — | — | — | — | |
| F3ARatio=60%, Backbone=InternVL3.5-38B2026.05 | 58.9 | — | — | — | — | |
| VisionZipRatio=40%, Backbone=InternVL3.5-38B2026.05 | 58.77 | — | — | — | — | |
| DivPruneRatio=60%, Backbone=InternVL3.5-38B2026.05 | 58.71 | — | — | — | — | |
| FastVRatio=60%, Backbone=InternVL3.5-38B2026.05 | 58.38 | — | — | — | — | |
| InternVL2-2BParams=2.2B2025.12 | 58.36 | — | — | — | — | |
| VisionZipRatio=60%, Backbone=InternVL3.5-38B2026.05 | 58.35 | — | — | — | — | |
| Sequential (SFT)Size=3B2026.06 | 58.3 | — | — | — | — | |
| Majority voting@4Size=3B2026.06 | 58.1 | — | — | — | — | |
| Visual Para-Thinker++Backbone=Qwen2.5-VL-7B, Training Stage (MAC/RDMAO)=MAC only2026.06 | 58 | — | — | — | 2,503 | |
| F3ARatio=40%, Backbone=InternVL3.5-38B2026.05 | 57.96 | — | — | — | — | |
| MobileNet-QwenParams=1.84B2025.12 | 57.94 | — | — | — | — | |
| DivPruneRatio=40%, Backbone=InternVL3.5-38B2026.05 | 57.78 | — | — | — | — | |
| FastVRatio=40%, Backbone=InternVL3.5-38B2026.05 | 57.31 | — | — | — | — | |
| Honeybee-Remake-SEED-200KModel=Qwen3-VL (4B), Selection Ratio=20%2026.05 | 56.8 | — | — | — | — | |
| BASEModel=Qwen3-VL (4B), Selection Ratio=0%2026.05 | 56.7 | — | — | — | — | |
| CDPrunerRatio=60%, Backbone=InternVL3.5-38B2026.05 | 56.66 | — | — | — | — | |
| Qwen2.5-VLSize=3B2026.06 | 56.1 | — | — | — | — | |
| AutoNeuralParams=1.47B2025.12 | 56.05 | — | — | — | — | |
| CDPrunerRatio=40%, Backbone=InternVL3.5-38B2026.05 | 55.95 | — | — | — | — | |
| FULLModel=Qwen3-VL (4B), Selection Ratio=100%2026.05 | 55.9 | — | — | — | — | |
| Base MLLM + Multi-Agent DebateBackbone=Qwen2.5-VL-7B2026.06 | 55.4 | — | — | — | 2,854 | |
| InternViT-QwenParams=1.86B2025.12 | 55.31 | — | — | — | — | |
| LLaVA-OneVision-7BParameters=7B2026.02 | 55.1 | — | — | — | — | |
| VisionZipRatio=20%, Backbone=InternVL3.5-38B2026.05 | 55.04 | — | — | — | — | |
| F3ARatio=60%, Backbone=Qwen2.5-VL-7B2026.05 | 54.62 | — | — | — | — | |
| PReD2026.03 | 54.5 | — | — | — | — | |
| POW3R dynamicBase policy=Gemma3-4B2026.05 | 54.4 | — | — | — | — | |
| InternVL2-1BParams=0.94B2025.12 | 54.26 | — | — | — | — | |
| InternViT-LiquidParams=1.49B2025.12 | 54.26 | — | — | — | — | |
| Category-balancedBase policy=Gemma3-4B2026.05 | 54.1 | — | — | — | — | |
| FastVRatio=20%, Backbone=InternVL3.5-38B2026.05 | 54.06 | — | — | — | — | |
| BinaryBase policy=Gemma3-4B2026.05 | 54 | — | — | — | — | |
| DivPruneRatio=20%, Backbone=InternVL3.5-38B2026.05 | 53.94 | — | — | — | — | |
| BaseBase policy=Gemma3-4B2026.05 | 53.9 | — | — | — | — | |
| Base MLLM + Para-ThinkerBackbone=Qwen2.5-VL-7B, K (Number of Paths/Agents)=42026.06 | 53.9 | — | — | — | 2,456 |