Multimodal Reasoning on MMMU (FEI, AEI)
55.06FEI ScoreVRPRM-MiMo w/o RL & w/o CoT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| VRPRM-MiMo w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 55.06 | 45.35 | |
| VRPRM-MiMo w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 54.31 | 65.52 | |
| VRPRM-MiMo# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 53.18 | 66.95 | |
| VRPRM-Qwen3# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 52.81 | 65.78 | |
| VRPRM# Samples=53.6K, Explicit Reasoning (CoT)=true, RL Training=true2025.08 | 52.06 | 63.16 | |
| MiMo-VL-7B# Samples=unk2025.08 | 50.94 | 58.45 | |
| VRPRM-Qwen3 w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 50.56 | 49.15 | |
| VRPRM-MiMo w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 50.26 | 57.63 | |
| Qwen3-VL-4B-Thinking# Samples=unk2025.08 | 49.81 | 58.07 | |
| VRPRM w/o RL & w/o CoT# Samples=3.6K, Explicit Reasoning (CoT)=false, RL Training=false2025.08 | 49.06 | 50.69 | |
| VRPRM w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 47.57 | 55.94 | |
| Qwen2.5-VL-72B# Samples=unk2025.08 | 46.44 | 51.31 | |
| VRPRM w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 46.44 | 52.66 | |
| VRPRM-Qwen3 w/o CoT# Samples=53.6K, Explicit Reasoning (CoT)=false, RL Training=true2025.08 | 46.44 | 62.34 | |
| VRPRM-Qwen3 w/o RL# Samples=3.6K, Explicit Reasoning (CoT)=true, RL Training=false2025.08 | 46.44 | 54.37 | |
| Qwen2.5-VL-7B# Samples=unk2025.08 | 44.57 | 46.88 | |
| Gemini-2.0-Flash# Samples=unk2025.08 | 43.07 | 43.04 | |
| InternVL2.5-8B# Samples=unk2025.08 | 41.63 | 49.59 | |
| GPT-4o-mini# Samples=unk2025.08 | 40.45 | 35.27 | |
| VisualPRM-8B# Samples=400K2025.08 | 30.71 | 59.01 |