General VQA on HallusionBench
73.48AccuracyGemini 3-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3-Pro2026.02 | 73.48 | |
| Qwen2.5-VL-7B-Instruct + VPPOBackbone model=Qwen2.5-VL-7B-Instruct, Training Data=19.2K2026.05 | 70.8 | |
| Perception-R1-7BTraining Data=1.4K2026.05 | 70 | |
| Qwen2.5-VL-7B-Instruct + Faithful-MR1Backbone model=Qwen2.5-VL-7B-Instruct, Training Data=19.2K2026.05 | 69.8 | |
| Qwen2.5-VL-7B-Instruct + GRPOBackbone model=Qwen2.5-VL-7B-Instruct, Training Data=19.2K2026.05 | 69.3 | |
| Vision-R1-7BTraining Data=210K2026.05 | 68.1 | |
| Vision-SR1-7BTraining Data=56K2026.05 | 68.1 | |
| Qwen2.5-VL-3B-Instruct + Faithful-MR1Backbone model=Qwen2.5-VL-3B-Instruct, Training Data=19.2K2026.05 | 68 | |
| Qwen2.5-VL-3B-Instruct + VPPOBackbone model=Qwen2.5-VL-3B-Instruct, Training Data=19.2K2026.05 | 67.7 | |
| Qwen2.5-VL-3B-Instruct + GRPOBackbone model=Qwen2.5-VL-3B-Instruct, Training Data=19.2K2026.05 | 67.2 | |
| GPT-5tier=High2026.02 | 66.58 | |
| Qwen2.5-VL-7B-InstructBackbone model=Qwen2.5-VL-7B-Instruct2026.05 | 65 | |
| Qwen2.5-VL-3B-InstructBackbone model=Qwen2.5-VL-3B-Instruct2026.05 | 64.8 | |
| Qwen3-VLmode=Thinking2026.02 | 64.01 | |
| ERNIE 5.02026.02 | 63.87 | |
| Gemini 2.5-Pro2026.02 | 63.7 | |
| Qwen3-VLLanguage Backbone=Qwen3 1.7B LLM, Evaluation Framework=VLMEvalKit [69]2026.03 | 51.89 | |
| Intern3.5-VLLanguage Backbone=Qwen3 1.7B LLM, Evaluation Framework=VLMEvalKit [69]2026.03 | 48.18 | |
| FineViT-VLLanguage Backbone=Qwen3 1.7B LLM, Evaluation Framework=VLMEvalKit [69]2026.03 | 46.54 | |
| Aquila-VLLanguage Backbone=Qwen2.5 1.5B LLM, Evaluation Framework=VLMEvalKit [69]2026.03 | 42.07 |