Multimodal Reasoning on Multimodal Reasoning Benchmarks Combined
71.86Overall ScorePTD-PO
Evaluation Results
| Method | Links | |
|---|---|---|
| PTD-POModel Scale=Qwen3-VL-8B-Thinking2026.06 | 71.86 | |
| PTD-POModel Scale=Qwen3-VL-4B-Thinking2026.06 | 71.23 | |
| HDPOModel Scale=Qwen3-VL-8B-Thinking2026.06 | 69.92 | |
| PAPOModel Scale=Qwen3-VL-4B-Thinking2026.06 | 69.2 | |
| PAPOModel Scale=Qwen3-VL-8B-Thinking2026.06 | 69.05 | |
| GRPOModel Scale=Qwen3-VL-8B-Thinking2026.06 | 68.78 | |
| HDPOModel Scale=Qwen3-VL-4B-Thinking2026.06 | 68.29 | |
| GRPOModel Scale=Qwen3-VL-4B-Thinking2026.06 | 68.06 | |
| PTD-POModel Scale=Qwen3-VL-2B-Thinking2026.06 | 61.21 | |
| OPSDModel Scale=Qwen3-VL-8B-Thinking2026.06 | 60.76 | |
| SFTModel Scale=Qwen3-VL-8B-Thinking2026.06 | 59.34 | |
| SFTModel Scale=Qwen3-VL-4B-Thinking2026.06 | 59.03 | |
| HDPOModel Scale=Qwen3-VL-2B-Thinking2026.06 | 57.68 | |
| OPSDModel Scale=Qwen3-VL-4B-Thinking2026.06 | 57.24 | |
| PAPOModel Scale=Qwen3-VL-2B-Thinking2026.06 | 54.11 | |
| GRPOModel Scale=Qwen3-VL-2B-Thinking2026.06 | 50.63 | |
| SFTModel Scale=Qwen3-VL-2B-Thinking2026.06 | 45.19 | |
| OPSDModel Scale=Qwen3-VL-2B-Thinking2026.06 | 44.08 |