Comprehensive Reasoning on Aggregate Benchmarks
66.9Average AccuracyQwen2.5-VL-7B + DUPL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL-7B + DUPLBase Model=Qwen2.5-VL-7B, RL Algorithm=DUPL2025.10 | 66.9 | |
| Qwen2.5-VL-7B + NoisyRolloutBase Model=Qwen2.5-VL-7B, RL Algorithm=NoisyRollout2025.10 | 65.4 | |
| PAPO-7BBase Model=PAPO-7B2025.10 | 65.2 | |
| Qwen2.5-VL-7B + GRPOBase Model=Qwen2.5-VL-7B, RL Algorithm=GRPO2025.10 | 63.9 | |
| VLAA-Thinker-7BBase Model=VLAA-Thinker-7B2025.10 | 63.6 | |
| MM-Eureka-Qwen-7BBase Model=MM-Eureka-Qwen-7B2025.10 | 63.5 | |
| OpenVLThinker-7BBase Model=OpenVLThinker-7B2025.10 | 61.9 | |
| Qwen2.5-VL-3B + DUPLBase Model=Qwen2.5-VL-3B, RL Algorithm=DUPL2025.10 | 61.2 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2025.10 | 61.1 | |
| R1-Onevision-7BBase Model=R1-Onevision-7B2025.10 | 60.5 | |
| Qwen2.5-VL-3B + NoisyRolloutBase Model=Qwen2.5-VL-3B, RL Algorithm=NoisyRollout2025.10 | 59.6 | |
| Qwen2.5-VL-3B + GRPOBase Model=Qwen2.5-VL-3B, RL Algorithm=GRPO2025.10 | 58.4 | |
| Qwen2.5-VL-3BBase Model=Qwen2.5-VL-3B2025.10 | 52.5 |