Multimodal Reasoning on VisualProcessBench Overall
54.6FEI AverageVRPRM-MiMo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRPRM-MiMo# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 54.6 | 72.91 | |
| VRPRM-MiMo w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 53.03 | 71.62 | |
| VRPRM-Qwen3# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 51.82 | 70.01 | |
| VRPRM-MiMo w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 51.61 | 46.77 | |
| MiMo-VL-7B# Samples=unk2025.08 | 51.09 | 63.38 | |
| VRPRM-MiMo w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 50.77 | 60.61 | |
| VRPRM# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 49.72 | 66 | |
| VRPRM-Qwen3 w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 49.24 | 57.07 | |
| Qwen3-VL-4B-Thinking# Samples=unk2025.08 | 49.18 | 61.4 | |
| Qwen2.5-VL-7B# Samples=unk2025.08 | 48.37 | 45.36 | |
| VRPRM-Qwen3 w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 48.3 | 53.39 | |
| VRPRM-Qwen3 w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 47.14 | 68.63 | |
| Qwen2.5-VL-72B# Samples=unk2025.08 | 46.54 | 47.82 | |
| VRPRM w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 45.77 | 62.11 | |
| VRPRM w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 44.58 | 52.2 | |
| InternVL2.5-8B# Samples=unk2025.08 | 43.89 | 46.08 | |
| Gemini-2.0-Flash# Samples=unk2025.08 | 43.68 | 42.17 | |
| VRPRM w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 38.14 | 53.66 | |
| GPT-4o-mini# Samples=unk2025.08 | 36.45 | 35.91 | |
| VisualPRM-8B# Samples=400K2025.08 | 25.61 | 61.03 |