Multimodal Reasoning on MathVision (Metrics: FEI, AEI)
46.07FEIVRPRM-MiMo
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRPRM-MiMo# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 46.07 | 72.87 | |
| VRPRM-MiMo w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 43.4 | 69.99 | |
| VRPRM# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 42.98 | 67.34 | |
| VRPRM-Qwen3# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 42.13 | 70.48 | |
| VRPRM-Qwen3 w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 39.89 | 70.15 | |
| VRPRM-MiMo w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 39.36 | 60.51 | |
| MiMo-VL-7B# Samples=unk2025.08 | 38.27 | 61.6 | |
| VRPRM-Qwen3 w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 37.78 | 57.69 | |
| Qwen3-VL-4B-Thinking# Samples=unk2025.08 | 37.08 | 61.64 | |
| Qwen2.5-VL-7B# Samples=unk2025.08 | 36.94 | 39.54 | |
| VRPRM-MiMo w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 35.81 | 44.24 | |
| VRPRM-Qwen3 w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 34.97 | 53.49 | |
| Qwen2.5-VL-72B# Samples=unk2025.08 | 34.27 | 41.88 | |
| VRPRM w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 33.99 | 61.82 | |
| VRPRM w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 33.15 | 54.57 | |
| InternVL2.5-8B# Samples=unk2025.08 | 30.67 | 42.61 | |
| Gemini-2.0-Flash# Samples=unk2025.08 | 30.48 | 40.68 | |
| GPT-4o-mini# Samples=unk2025.08 | 27.39 | 35.1 | |
| VRPRM w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 26.83 | 51.95 | |
| VisualPRM-8B# Samples=400K2025.08 | 24.58 | 62.91 |