Multimodal Hallucination Evaluation on HallusionBench
70.7Hallucination ScoreThinkLite-VL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ThinkLite-VLParameters=7B2025.12 | 70.7 | — | — | |
| Revisual-R1Parameters=7B2025.12 | 69.2 | — | — | |
| PG-CoTParameters=7B2025.12 | 68.7 | — | — | |
| Qwen2.5-VLParameters=7B2025.12 | 65 | — | — | |
| VAPOModel Scale=7B2025.09 | 57.4 | — | — | |
| VLAAModel Scale=7B2025.09 | 54.7 | — | — | |
| R1-OVModel Scale=7B2025.09 | 52.5 | — | — | |
| Qwen-VLModel Scale=7B2025.09 | 50 | — | — | |
| V-R1Model Scale=7B2025.09 | 49.5 | — | — | |
| Xuanwu VL-2BModel Size=2B2026.03 | 47.32 | — | — | |
| RecursiveVLMTraining Dataset=Data2, Train Steps=2, Eval Step=22026.02 | 47.22 | — | — | |
| InternVL 3.5 2BModel Size=2B2026.03 | 46.78 | — | — | |
| Standard TransformerTraining Dataset=Data2, Train Steps=1, Eval Step=12026.02 | 46.65 | — | — | |
| RecursiveVLMTraining Dataset=Data2, Train Steps=2, Eval Step=12026.02 | 44.9 | — | — | |
| InternVL 3.0 2BModel Size=2B2026.03 | 43.32 | — | — | |
| RecursiveVLMTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | 38.69 | — | — | |
| Standard TransformerTraining Dataset=Data1, Train Steps=1, Eval Step=12026.02 | 37.56 | — | — | |
| Vanilla recursion w/ RMSNormTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | 36.54 | — | — | |
| RecursiveVLMTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | 36.41 | — | — | |
| Vanilla recursion w/ RMSNormTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | 35.15 | — | — | |
| Vanilla recursionTraining Dataset=Data1, Train Steps=2, Eval Step=22026.02 | 34.61 | — | — | |
| Vanilla recursionTraining Dataset=Data1, Train Steps=2, Eval Step=12026.02 | 33.55 | — | — | |
| DAMOModel=Qwen2.5-VL-7B, Decoding=DAMO2025.05 | — | 71.29 | 46.82 | |
| DAMOModel=Qwen3-VL-8B, Decoding=DAMO2025.05 | — | 73.08 | 50 | |
| DAMOModel=InternVL3-8B, Decoding=DAMO2025.05 | — | 51.94 | 43.64 | |
| DCLAModel=Qwen2.5-VL-7B, Decoding=DCLA2025.05 | — | 72.13 | 48.55 | |
| DCLAModel=Qwen3-VL-8B, Decoding=DCLA2025.05 | — | 72.34 | 49.42 | |
| DCLAModel=InternVL3-8B, Decoding=DCLA2025.05 | — | 52.03 | 43.35 | |
| GreedyModel=Qwen2.5-VL-7B, Decoding=Greedy2025.05 | — | 71.82 | 47.69 | |
| GreedyModel=Qwen3-VL-8B, Decoding=Greedy2025.05 | — | 71.5 | 48.84 | |
| GreedyModel=InternVL3-8B, Decoding=Greedy2025.05 | — | 50.32 | 41.91 | |
| VCDModel=Qwen2.5-VL-7B, Decoding=VCD2025.05 | — | 71.61 | 48.55 | |
| VCDModel=Qwen3-VL-8B, Decoding=VCD2025.05 | — | 69.93 | 48.55 | |
| VCDModel=InternVL3-8B, Decoding=VCD2025.05 | — | 47.5 | 38.73 |