Hallucination and Visual Reasoning Evaluation on HallusionBench
81.8Accuracy (aACC)PStar
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| PStarBackbone=Qwen2-VL-7B2026.05 | 81.8 | 33.6 | 42.8 | — | — | — | — | 52.7 | — | |
| PStarBackbone=Qwen2.5-VL-7B2026.05 | 81.4 | 36.1 | 41.1 | — | — | — | — | 52.9 | — | |
| PStarBackbone=Qwen2-VL-2B2026.05 | 75.7 | 23 | 31.7 | — | — | — | — | 43.4 | — | |
| Debate with imagesModel=Gemini-2.5-Pro2025.11 | 75.3 | 58.26 | 53.79 | — | — | — | — | — | — | |
| Majority voteModel=Gemini-2.5-Pro2025.11 | 73.6 | 56.96 | 49.46 | — | — | — | — | — | — | |
| Debate about imagesModel=Gemini-2.5-Pro2025.11 | 73.1 | 56.09 | 49.82 | — | — | — | — | — | — | |
| Debate with imagesModel=Qwen2.5-VL-72B2025.11 | 70.9 | 50.43 | 42.24 | — | — | — | — | — | — | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B*2026.05 | 69.9 | 41.3 | 44.4 | — | — | — | — | 51.9 | — | |
| Debate about imagesModel=Qwen2.5-VL-72B2025.11 | 69.37 | 48.26 | 41.52 | — | — | — | — | — | — | |
| Debate with imagesModel=GPT-4o2025.11 | 69.2 | 47.39 | 42.24 | — | — | — | — | — | — | |
| Qwen2-VL-7BModel=Qwen2-VL-7B*2026.05 | 68.5 | 39 | 43.7 | — | — | — | — | 50.4 | — | |
| Debate about imagesModel=GPT-4o2025.11 | 68.35 | 46.96 | 40.43 | — | — | — | — | — | — | |
| Majority voteModel=Qwen2.5-VL-72B2025.11 | 68.19 | 44.35 | 41.16 | — | — | — | — | — | — | |
| Debate with imagesModel=Claude-Sonnet-42025.11 | 67.68 | 44.78 | 42.24 | — | — | — | — | — | — | |
| CoT promptModel=GPT-4o2025.11 | 67.17 | 51.3 | 40.07 | — | — | — | — | — | — | |
| Majority voteModel=Claude-Sonnet-42025.11 | 67.17 | 47.83 | 39.71 | — | — | — | — | — | — | |
| Debate about imagesModel=Claude-Sonnet-42025.11 | 67.17 | 43.91 | 39.35 | — | — | — | — | — | — | |
| Direct promptModel=Qwen2.5-VL-72B2025.11 | 67.01 | 39.57 | 37.91 | — | — | — | — | — | — | |
| Direct promptModel=Claude-Sonnet-42025.11 | 66.5 | 47.39 | 38.99 | — | — | — | — | — | — | |
| CoT promptModel=Qwen2.5-VL-72B2025.11 | 66.5 | 47.39 | 41.52 | — | — | — | — | — | — | |
| Direct promptModel=Gemini-2.5-Pro2025.11 | 66.16 | 49.57 | 40.07 | — | — | — | — | — | — | |
| CoT promptModel=Claude-Sonnet-42025.11 | 65.48 | 47.83 | 38.27 | — | — | — | — | — | — | |
| InternVL2-8BModel=InternVL2-8B*2026.05 | 63.9 | 35 | 36 | — | — | — | — | 45 | — | |
| GPT-4V (0409)Model=GPT-4V (0409)*2026.05 | 62.1 | 36.7 | 32.7 | — | — | — | — | 43.9 | — | |
| CoT promptModel=Gemini-2.5-Pro2025.11 | 61.76 | 43.91 | 35.38 | — | — | — | — | — | — | |
| Qwen2-VL-2BModel=Qwen2-VL-2B*2026.05 | 61.5 | 32.4 | 33 | — | — | — | — | 42.4 | — | |
| Direct promptModel=GPT-4o2025.11 | 60.07 | 41.74 | 34.3 | — | — | — | — | — | — | |
| InternVL2-2BModel=InternVL2-2B*2026.05 | 58.7 | 26 | 29.2 | — | — | — | — | 38 | — | |
| LLaMA-3.2-11B-VisionModel=LLaMA-3.2-11B-Vision*2026.05 | 58 | 31.8 | 31.2 | — | — | — | — | 40.3 | — | |
| Majority voteModel=GPT-4o2025.11 | 57.36 | 21.3 | 35.38 | — | — | — | — | — | — | |
| LLaVA-v1.5-7BModel=LLaVA-v1.5-7B*2026.05 | 48.8 | 20.5 | 13.6 | — | — | — | — | 27.6 | — | |
| HALVAModel=LLaVA-1.5-7B2026.06 | 48.8 | — | — | — | — | — | — | — | — | |
| SELF-FILTER (Scores)Samples=25k2024.02 | 48.15 | 11.54 | 11.11 | — | — | — | — | — | — | |
| HA-DPOModel=LLaVA-1.5-7B2026.06 | 48.1 | — | — | — | — | — | — | — | — | |
| ViPSyModel=LLaVA-1.5-7B2026.06 | 48.1 | — | — | — | — | — | — | — | — | |
| ViPSyModel=LLaVA-1.5-13B2026.06 | 48 | — | — | — | — | — | — | — | — | |
| OPA-DPOModel=LLaVA-1.5-7B2026.06 | 47.9 | — | — | — | — | — | — | — | — | |
| SENTINELModel=LLaVA-1.5-7B2026.06 | 47.6 | — | — | — | — | — | — | — | — | |
| HALVAModel=LLaVA-1.5-13B2026.06 | 47.6 | — | — | — | — | — | — | — | — | |
| SENTINELModel=LLaVA-1.5-13B2026.06 | 47.4 | — | — | — | — | — | — | — | — | |
| VCDModel=LLaVA-1.5-7B2026.06 | 47.2 | — | — | — | — | — | — | — | — | |
| EFUFModel=LLaVA-1.5-7B2026.06 | 47 | — | — | — | — | — | — | — | — | |
| VanillaModel=LLaVA-1.5-7B2026.06 | 46.8 | — | — | — | — | — | — | — | — | |
| DOLAModel=LLaVA-1.5-7B2026.06 | 46.7 | — | — | — | — | — | — | — | — | |
| POVIDModel=LLaVA-1.5-7B2026.06 | 46.5 | — | — | — | — | — | — | — | — | |
| VanillaModel=LLaVA-1.5-13B2026.06 | 46.5 | — | — | — | — | — | — | — | — | |
| OPA-DPOModel=LLaVA-1.5-13B2026.06 | 46.4 | — | — | — | — | — | — | — | — | |
| HSA-DPOModel=LLaVA-1.5-13B2026.06 | 46.1 | — | — | — | — | — | — | — | — | |
| LLaVA-RLHFModel=LLaVA-1.5-13B2026.06 | 45.9 | — | — | — | — | — | — | — | — | |
| SELF-FILTER (CLIP)Samples=25k2024.02 | 45.85 | 14.45 | 10.33 | — | — | — | — | — | — | |
| OPERAModel=LLaVA-1.5-7B2026.06 | 45.7 | — | — | — | — | — | — | — | — | |
| SELF-FILTER (w/o Diversity)Samples=25k2024.02 | 45.53 | 10.98 | 10.99 | — | — | — | — | — | — | |
| Full dataSamples=158k2024.02 | 45.32 | 14.74 | 10.33 | — | — | — | — | — | — | |
| PrototypicalitySamples=25k2024.02 | 45.32 | 13.29 | 10.77 | — | — | — | — | — | — | |
| RandomSamples=25k2024.02 | 43.85 | 14.16 | 9.01 | — | — | — | — | — | — | |
| AlpagasusSamples=25k2024.02 | 42.69 | 10.12 | 6.81 | — | — | — | — | — | — | |
| GraNdSamples=25k2024.02 | 42.27 | 9.83 | 8.57 | — | — | — | — | — | — | |
| LLaVA-RLHFModel=LLaVA-1.5-7B2026.06 | 41.8 | — | — | — | — | — | — | — | — | |
| EL2NSamples=25k2024.02 | 41.22 | 9.25 | 7.25 | — | — | — | — | — | — | |
| TPRModel=LLaVA-1.5-7B2026.06 | 39.8 | — | — | — | — | — | — | — | — | |
| RLAIF-VModel=LLaVA-1.5-7B2026.06 | 35.1 | — | — | — | — | — | — | — | — | |
| ADORA-7BModel Size=7B2026.03 | — | — | — | — | 53.1 | — | — | — | — | |
| Argos2025.12 | — | — | — | — | 46.6 | — | — | — | — | |
| BaselineBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=All 1296 Tokens, Reduction Percentage=100%2026.06 | — | — | — | — | 73.1 | — | — | 55.9 | 100 | |
| BaselineBackbone=InternVL3-8B, Retained Tokens=All 1280 Tokens, Reduction Percentage=100%2026.06 | — | — | — | — | 74.9 | — | — | 49.4 | 100 | |
| Baseline: all KVVLM Backbone=Qwen2-VL-7B-Instruct2026.05 | — | — | — | — | — | — | — | 60.12 | — | |
| Baseline: all KVVLM Backbone=Qwen2.5-VL-7B-Instruct2026.05 | — | — | — | — | — | — | — | 65.6 | — | |
| Baseline: all KVVLM Backbone=Qwen3-VL-8B-Instruct2026.05 | — | — | — | — | — | — | — | 53.9 | — | |
| Baseline: all KVVLM Backbone=llava-v1.6-mistral-7b-hf2026.05 | — | — | — | — | — | — | — | 40.8 | — | |
| Baseline: all KVVLM Backbone=llama3-llava-next-8b-hf2026.05 | — | — | — | — | — | — | — | 37.9 | — | |
| CDPrunerBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=256 Tokens, Reduction Percentage=↓ 80.2%2026.06 | — | — | — | — | 68.9 | — | — | 45.3 | 94.3 | |
| CDPrunerBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=128 Tokens, Reduction Percentage=↓ 90.1%2026.06 | — | — | — | — | 65.5 | — | — | 41.3 | 89.6 | |
| CDPrunerBackbone=InternVL3-8B, Retained Tokens=256 Tokens, Reduction Percentage=↓ 80.0%2026.06 | — | — | — | — | 67.4 | — | — | 41.5 | 90 | |
| CDPrunerBackbone=InternVL3-8B, Retained Tokens=128 Tokens, Reduction Percentage=↓ 90.0%2026.06 | — | — | — | — | 62.8 | — | — | 37.4 | 83.8 | |
| Chameleon-7bType=Unified (Understanding & Generation), LLM Params=7B2025.03 | — | — | — | 17.1 | — | — | — | — | — | |
| Claude3-Sonnet2024.10 | — | — | — | 41.3 | — | — | — | — | — | |
| Claude3.5-Sonnet2024.10 | — | — | — | 49.9 | — | — | — | — | — | |
| DeepSeek-VL-1.3BParams (B)=2.02024.10 | — | — | — | 27.6 | — | — | — | — | — | |
| DivPruneBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=256 Tokens, Reduction Percentage=↓ 80.2%2026.06 | — | — | — | — | 68.8 | — | — | 46.6 | 94.1 | |
| DivPruneBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=128 Tokens, Reduction Percentage=↓ 90.1%2026.06 | — | — | — | — | 65.5 | — | — | 44.5 | 89.6 | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=256 Tokens, Reduction Percentage=↓ 80.0%2026.06 | — | — | — | — | 69.3 | — | — | 43 | 92.5 | |
| DivPruneBackbone=InternVL3-8B, Retained Tokens=128 Tokens, Reduction Percentage=↓ 90.0%2026.06 | — | — | — | — | 64.6 | — | — | 37.6 | 86.2 | |
| Emu2-ChatType=Understanding-only, LLM Params=33B2025.03 | — | — | — | 29.5 | — | — | — | — | — | |
| FastVVLM Backbone=Qwen2-VL-7B-Instruct2026.05 | — | — | — | — | — | — | — | 58.68 | — | |
| FastVVLM Backbone=Qwen2.5-VL-7B-Instruct2026.05 | — | — | — | — | — | — | — | 25.6 | — | |
| FastVVLM Backbone=Qwen3-VL-8B-Instruct2026.05 | — | — | — | — | — | — | — | 47.83 | — | |
| FastVVLM Backbone=llava-v1.6-mistral-7b-hf2026.05 | — | — | — | — | — | — | — | 40.8 | — | |
| FastVVLM Backbone=llama3-llava-next-8b-hf2026.05 | — | — | — | — | — | — | — | 43.6 | — | |
| FastVBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=256 Tokens, Reduction Percentage=↓ 80.2%2026.06 | — | — | — | — | 67.8 | — | — | 49.1 | 92.7 | |
| FastVBackbone=Qwen2.5-VL-7B-Instruct, Retained Tokens=128 Tokens, Reduction Percentage=↓ 90.1%2026.06 | — | — | — | — | 57 | — | — | 41 | 78 | |
| FastVBackbone=InternVL3-8B, Retained Tokens=256 Tokens, Reduction Percentage=↓ 80.0%2026.06 | — | — | — | — | 71.2 | — | — | 44 | 95.1 | |
| FastVBackbone=InternVL3-8B, Retained Tokens=128 Tokens, Reduction Percentage=↓ 90.0%2026.06 | — | — | — | — | 60.4 | — | — | 38.9 | 80.6 | |
| Gemini-1.0-Pro2024.10 | — | — | — | 45.7 | — | — | — | — | — | |
| Gemini-1.5-Pro2024.10 | — | — | — | 45.6 | — | — | — | — | — | |
| gemma-3-12b-it2026.03 | — | — | — | — | 65.3 | — | — | — | — | |
| GPT-4o-202408062024.10 | — | — | — | 54.2 | — | — | — | — | — | |
| GPT-4v (1106, detail-high)2024.10 | — | — | — | 39.3 | — | — | — | — | — | |
| H2OVL-Mississippi-0.8BParams (B)=0.82024.10 | — | — | — | 29.6 | — | — | — | — | — | |
| H2OVL-Mississippi-2BParams (B)=2.12024.10 | — | — | — | 36.4 | — | — | — | — | — | |
| IdeficsType=Understanding-only, LLM Params=9B2025.03 | — | — | — | 27.3 | — | — | — | — | — |