Multimodal Reasoning on HallusionBench
0.7293AccuracyTGRL-DAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TGRL-DAPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.7293 | — | |
| NoisyRolloutData=6.4K2026.03 | 0.722 | — | |
| TGRL-GRPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.7202 | — | |
| TGRL-DAPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.7129 | — | |
| TGRL-GRPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.7108 | — | |
| ThinkLiteData=11K2026.03 | 0.71 | — | |
| ThinkLite-VL-7BTraining Protocol=Zero RL2025.12 | 0.709 | — | |
| DAPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.7087 | — | |
| OpenVLThinkerData=50K2026.03 | 0.708 | — | |
| GRPOData=39K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.7066 | — | |
| MSSRModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 0.706 | — | |
| VLAA-Thinker-7BTraining Protocol=SFT + RL2025.12 | 0.7 | — | |
| GRPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.698 | — | |
| GRPOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 0.697 | — | |
| REINFORCE++Model=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 0.692 | — | |
| VLAA-ThinkerData=25K2026.03 | 0.686 | — | |
| RLOOModel=Qwen2.5-VL-7B, Training Protocol=Zero RL2025.12 | 0.685 | — | |
| Qwen2.5-VL-7BTraining Protocol=Zero RL2025.12 | 0.684 | — | |
| DAPOData=2.1K, Base Model=Qwen-2.5-VL-7B2026.03 | 0.679 | — | |
| R1-Onevision-7BTraining Protocol=SFT + RL2025.12 | 0.672 | — | |
| MSSRModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 0.666 | — | |
| MM-Eureka-Qwen-7BTraining Protocol=Zero RL2025.12 | 0.664 | — | |
| R1-OnevisionData=165K2026.03 | 0.656 | — | |
| Qwen-2.5-VL-7BData=-2026.03 | 0.646 | — | |
| ThinkLite-VL (+ Ours)Model=ThinkLite-VL, Method=Self-Reflection2025.12 | 0.643 | 0.079 | |
| REINFORCE++Model=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 0.632 | — | |
| GRPOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 0.623 | — | |
| RLOOModel=Qwen2.5-VL-3B, Training Protocol=Zero RL2025.12 | 0.616 | — | |
| OpenVLThinker-7BTraining Protocol=SFT + RL2025.12 | 0.6 | — | |
| Qwen2.5-VL-3BTraining Protocol=Zero RL2025.12 | 0.599 | — | |
| ThinkLite-VL (Vanilla)Model=ThinkLite-VL, Method=Vanilla2025.12 | 0.553 | 0.22 | |
| Eagle2number of parameters=1.5B2025.07 | 0.458 | — | |
| InstructVLA-Generalistnumber of parameters=1.5B2025.07 | 0.456 | — | |
| InstructVLA-Generalistnumber of parameters=1.5B, robot state=true2025.07 | 0.428 | — | |
| Qwen2-VLnumber of parameters=1.5B2025.07 | 0.417 | — | |
| ChatVLAnumber of parameters=1.5B2025.07 | 0.399 | — | |
| Magmanumber of parameters=8B2025.07 | 0.38 | — | |
| Bunnynumber of parameters=8B2025.07 | 0.377 | — | |
| PaliGemmanumber of parameters=2B2025.07 | 0.322 | — | |
| OpenVLAnumber of parameters=7B, fine-tuned=true2025.07 | 0.084 | — | |
| ECoTnumber of parameters=7B2025.07 | 0.031 | — | |
| OpenVLAnumber of parameters=7B2025.07 | 0 | — |