Visual Perception on HallusionBench
71.08AccuracyVL-Rethinker
Evaluation Results
| Method | Links | |
|---|---|---|
| VL-RethinkerParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 71.08 | |
| SCF-VRParadigm=Latent Reasoning, Data Size=30K, Backbone=Qwen2.5-VL-7B2026.04 | 68.63 | |
| LaserParadigm=Latent Reasoning, Data Size=267K2026.04 | 67.72 | |
| DMLRParadigm=Latent Reasoning, Data Size=-2026.04 | 65.8 | |
| ICoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 65.5 | |
| LVRParadigm=Latent Reasoning, Data Size=470K2026.04 | 65.19 | |
| CCoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 64.9 | |
| NoisyRollout-3BBase Model Size=3B2026.06 | 63.85 | |
| Vision-R1Paradigm=Tool-use & RL Enhanced Reasoning, Data Size=200K2026.04 | 63.83 | |
| Multimodal CoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 63.6 | |
| DeepEyesParadigm=Tool-use & RL Enhanced Reasoning, Data Size=47K2026.04 | 62.57 | |
| PAPO-DAPO-3BBase Model Size=3B2026.06 | 62.36 | |
| R1-ShareVLBase Model Size=3B2026.06 | 61.41 | |
| Qwen2.5-VL-3B-InstructBase Model Size=3B2026.06 | 60.88 | |
| Qwen2.5-VL-3B-Instruct + VEPOBase Model Size=3B, Fine-tuning=VEPO2026.06 | 60.46 | |
| Qwen2.5-VL-3B-Instruct + GRPO (Top 40% high entropy)Base Model Size=3B, Fine-tuning=GRPO, Constraint=Top 40% high entropy2026.06 | 59.73 | |
| Qwen2.5-VL-3B-Instruct + GRPOBase Model Size=3B, Fine-tuning=GRPO2026.06 | 59.52 | |
| Qwen2.5-VL-3B-Instruct + GRPO (Top 20% high entropy)Base Model Size=3B, Fine-tuning=GRPO, Constraint=Top 20% high entropy2026.06 | 59.2 | |
| VPPO-3BBase Model Size=3B2026.06 | 58.46 | |
| PAPOParadigm=Tool-use & RL Enhanced Reasoning, Data Size=39K2026.04 | 57.52 | |
| Qwen2.5-VL-7BParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 56.57 | |
| MonetParadigm=Latent Reasoning, Data Size=125K2026.04 | 56.36 | |
| InternVL3.5-8BParadigm=Zero-Shot VLMs, Data Size=70K2026.04 | 56.15 | |
| LLaVA-OneVisionParadigm=Zero-Shot VLMs, Data Size=9M2026.04 | 51.1 |