Multimodal Reasoning on V* (accuracy, Avg)
0.832AccuracyMVH-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MVH-RLSetting=Our Model2026.05 | 0.832 | 0.697 | |
| Monet-RLSetting=Open-Source Baseline2026.05 | 0.822 | 0.676 | |
| MVH-SFTSetting=Our Model2026.05 | 0.822 | 0.678 | |
| Qwen2.5-VL-7B + vanilla SFTSetting=Open-Source Baseline2026.05 | 0.817 | 0.658 | |
| ILVR-Stage1Setting=Open-Source Baseline2026.05 | 0.806 | 0.666 | |
| ILVR-Stage2Setting=Open-Source Baseline2026.05 | 0.806 | 0.67 | |
| Monet-SFTSetting=Open-Source Baseline2026.05 | 0.796 | 0.665 | |
| Qwen2.5-VL-7B + SFT + GRPOSetting=Open-Source Baseline2026.05 | 0.785 | 0.669 | |
| Qwen2.5-VL-7BSetting=Open-Source Baseline2026.05 | 0.764 | 0.635 | |
| GPT-4oSetting=Proprietary Model2026.05 | 0.675 | 0.585 |