Multimodal Reasoning on MME-RW
53.8AccuracyMVH-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MVH-RLSetting=Our Model2026.05 | 53.8 | 69.7 | |
| Monet-SFTSetting=Open-Source Baseline2026.05 | 52.9 | 66.5 | |
| Qwen2.5-VL-7B + SFT + GRPOSetting=Open-Source Baseline2026.05 | 52.4 | 66.9 | |
| GPT-4oSetting=Proprietary Model2026.05 | 52 | 58.5 | |
| Qwen2.5-VL-7B + vanilla SFTSetting=Open-Source Baseline2026.05 | 51.3 | 65.8 | |
| Monet-RLSetting=Open-Source Baseline2026.05 | 51.2 | 67.6 | |
| ILVR-Stage2Setting=Open-Source Baseline2026.05 | 50.4 | 67 | |
| MVH-SFTSetting=Our Model2026.05 | 50.4 | 67.8 | |
| ILVR-Stage1Setting=Open-Source Baseline2026.05 | 49.2 | 66.6 | |
| Qwen2.5-VL-7BSetting=Open-Source Baseline2026.05 | 45.8 | 63.5 | |
| TASMExample Number=20, Average Context Length=14372026.06 | 43.5 | — | |
| EMLoC (Qwen2-VL)Example Number=20, Average Context Length=15102026.06 | 42.2 | — | |
| MLoC (Qwen2-VL)Example Number=20, Average Context Length=73932026.06 | 41.1 | — | |
| MLoC (Qwen2-VL)Example Number=5, Average Context Length=19242026.06 | 39.4 | — | |
| MiniCPM-V2.6 (8B)Example Number=02026.06 | 37.2 | — | |
| Qwen2-VL (7B)Example Number=02026.06 | 36.6 | — | |
| InternVL2 (8B)Example Number=02026.06 | 33.9 | — | |
| Llava1.5 (7B)Example Number=02026.06 | 28.2 | — | |
| Llama3.2-V (11B)Example Number=02026.06 | 14.6 | — |