General-domain Reasoning on HalluBench
71AccuracyPAPO-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| PAPO-7BBase Model=PAPO-7B2025.10 | 71 | |
| Qwen2.5-VL-7B + DUPLBase Model=Qwen2.5-VL-7B, RL Algorithm=DUPL2025.10 | 71 | |
| Qwen2.5-VL-7B + NoisyRolloutBase Model=Qwen2.5-VL-7B, RL Algorithm=NoisyRollout2025.10 | 70.1 | |
| VLAA-Thinker-7BBase Model=VLAA-Thinker-7B2025.10 | 70 | |
| Qwen2.5-VL-7B + GRPOBase Model=Qwen2.5-VL-7B, RL Algorithm=GRPO2025.10 | 68.6 | |
| R1-Onevision-7BBase Model=R1-Onevision-7B2025.10 | 67.2 | |
| Qwen2.5-VL-3B + DUPLBase Model=Qwen2.5-VL-3B, RL Algorithm=DUPL2025.10 | 67 | |
| MM-Eureka-Qwen-7BBase Model=MM-Eureka-Qwen-7B2025.10 | 66.4 | |
| Qwen2.5-VL-3B + NoisyRolloutBase Model=Qwen2.5-VL-3B, RL Algorithm=NoisyRollout2025.10 | 66.1 | |
| Qwen2.5-VL-3B + GRPOBase Model=Qwen2.5-VL-3B, RL Algorithm=GRPO2025.10 | 65.5 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2025.10 | 65.2 | |
| OpenVLThinker-7BBase Model=OpenVLThinker-7B2025.10 | 60 | |
| Qwen2.5-VL-3BBase Model=Qwen2.5-VL-3B2025.10 | 59.9 |