Multimodal Reasoning on HR-8K (accuracy, Avg)
69.5AccuracyMVH-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MVH-RLSetting=Our Model2026.05 | 69.5 | 69.7 | |
| MVH-SFTSetting=Our Model2026.05 | 67.1 | 67.8 | |
| Qwen2.5-VL-7B + SFT + GRPOSetting=Open-Source Baseline2026.05 | 66.8 | 66.9 | |
| ILVR-Stage2Setting=Open-Source Baseline2026.05 | 66.6 | 67 | |
| ILVR-Stage1Setting=Open-Source Baseline2026.05 | 66.5 | 66.6 | |
| Monet-RLSetting=Open-Source Baseline2026.05 | 66 | 67.6 | |
| Qwen2.5-VL-7BSetting=Open-Source Baseline2026.05 | 63.8 | 63.5 | |
| Monet-SFTSetting=Open-Source Baseline2026.05 | 63 | 66.5 | |
| Qwen2.5-VL-7B + vanilla SFTSetting=Open-Source Baseline2026.05 | 61.6 | 65.8 | |
| GPT-4oSetting=Proprietary Model2026.05 | 55.5 | 58.5 |